GLM-5.2 和 Kimi K3 加剧开放 AI 基础设施之争
- Sophie Larsen

- 8月3日
- 讀畢需時 13 分鐘
Z.ai 和 Moonshot AI 在一个月内相继发布 GLM-5.2 和 Kimi K3,将两款中国模型推入 Google News 和全球开发者社区的讨论焦点。
这些发布带来的竞争,比新一轮基准测试排名所显示的更为尖锐。两款模型都瞄准了过去主要与 Anthropic 和 OpenAI 闭源系统相关联的、依赖工具的长周期任务。
但在部署变得困难的环节,两者采取了不同策略。GLM-5.2 强调高效的长上下文运行和宽松许可。Kimi K3 则结合了规模大得多的模型、原生视觉能力和雄心勃勃的智能体平台。
这一差异很重要,因为模型质量只是第一项考验。团队还必须评估服务能力、许可条款、软件兼容性、基准测试条件,以及在长时间任务中的可靠性。
早期证据值得关注,但尚不完整。公司评测显示出具有竞争力的结果,而 Kimi K3 初期的容量问题也揭示了,强劲需求能够多快暴露基础设施的局限。
Google News 捕捉到的不只是两次模型发布
GLM-5.2 和 Kimi K3 代表了两种相互竞争的尝试,旨在让长时间运行的 AI 智能体在美国最大模型提供商之外也具备实用性。
Z.ai 于 2026 年 6 月 16 日推出 GLM-5.2。该公司将其描述为一款面向长周期任务的旗舰模型,尤其适用于编程、研究、调试和性能优化。
长周期工作意味着,模型必须在延续时间较长的任务、工具调用、修正和不断变化的证据之间保留有用状态。单凭较大的上下文窗口,并不能保证具备这种能力。
GLM-5.2 最多可接受一百万个 token,而其前代产品为 20 万个 token。Z.ai 表示,其围绕编程智能体轨迹扩展了长上下文训练,而非仅针对简单的文档检索。
该公司还以 MIT 许可证发布了模型权重。开发者可以检查、修改和部署这些权重,不受某些模型许可证附带的地区限制约束。
Moonshot AI 随后于 7 月 16 日发布 Kimi K3。该模型同样支持一百万个 token 的上下文窗口,但增加了原生视觉输入,以及规模大得多的混合专家架构。
混合专家模型会将每个 token 路由至选定的参数组,而不是激活整个网络。这种设计可以在每一步推理时不使用全部参数的情况下,扩展总容量。
Moonshot 将 Kimi K3 描述为一款拥有 2.8 万亿参数的模型。该公司称,这一系统面向编程、推理、办公工作、视觉任务和协同智能体活动而构建。
Kimi K3 已通过 Moonshot 的聊天、编程、智能体和 API 产品提供。该公司称,完整模型权重将于 7 月 27 日发布,详见其 Kimi K3 概览。
这些发布解释了它们为何频繁出现在 Google News 中,但聚合报道本身并非事件的核心。更深层的事件,是开发者可选择的可信模型正在扩展。
过去,开放权重模型主要通过本地控制、自定义能力或更低的运营成本展开竞争。如今,GLM-5.2 和 Kimi K3 声称其性能已更接近领先的专有系统。
这一变化促使买方重新审视一个假设:前沿级智能体能力究竟必须来自何处。它也迫使模型供应商以可衡量的优势来证明封闭访问的合理性。
这两次发布都没有终结这场辩论。但它们确实将讨论从理论争论推进到工程团队可以测试的部署决策。
美国模型提供商在部署层面面临压力
直接压力落在那些依靠模型质量、可靠容量和受控访问相结合来维持优势的提供商身上。
Anthropic 和 OpenAI 仍是核心参照点,因为它们的模型支撑着许多编程和智能体工作流。其周边工具也降低了企业客户的集成工作量。
GLM-5.2 通过开放权重、标准部署路径,以及与成熟推理框架的兼容性来挑战这一地位。Z.ai 列出了 vLLM、SGLang、Transformers 等本地服务选项。
该模型也可与开发者已熟悉的编程智能体界面配合使用。与采用需要全新工具链的模型相比,这降低了切换负担。
Kimi K3 则以不同方式施压。Moonshot 正在通过聊天、Kimi Code、其智能体环境、API 和协同智能体功能提供同一款模型。
这种广度很重要,因为许多组织已不再将模型视为孤立的聊天系统来评估。它们会评估模型能否搜索、编辑文件、使用工具,并完成多阶段任务。
Kimi 模型卡记录了涵盖软件工程、办公任务、浏览、金融、法律研究和多模态工作的测试。
Moonshot 选定的对比对象包括 Anthropic、OpenAI 和 GLM-5.2。这种设定表明,该公司希望企业开发者将哪些供应商与 Kimi 一并纳入考量。
竞争压力并不只是某个中国模型取得了高分。它来自于可信替代方案同时出现在多个层面。
买方可以比较托管 API、可下载权重、编程工具、智能体编排、上下文限制和许可条款。这带来了更大的议价能力和更多技术选择。
这些发布也发生在 DeepSeek 于 2025 年改变中国模型开发预期之后。此前的事件让买方更愿意迅速测试新模型。
美联社报道发现,Kimi K3 发布后不久便引起美国开发者和分析师关注。当时,它还在 Arena 的前端编程类别中位居榜首。
前端编程测试侧重于界面和面向浏览器的应用。它们并不覆盖所有生产要求,但为开发者提供了可供审视的直观展示。
Arena 联合创始人兼 CEO Anastasios Angelopoulos 称 Kimi K3 是一次重大发布。他的反应反映了该模型的早期排名,而非对所有工作负载的最终判断。
这一区别很重要。排行榜会影响关注度,而实际采用取决于模型能否在团队的真实代码库、工具、安全规则和审查流程中稳定复现表现。
因此,组织面临着不得不作出的回应。它们必须建立按工作负载比较模型的评估流程,而不是依赖某一家默认供应商。
这一回应将在数月而非数日内展开。既有合同和集成会形成惯性,但开放替代方案使得不加质疑地续约更难自圆其说。
GLM-5.2 和 Kimi K3 走向长周期智能体的路径不同
GLM-5.2 优先考虑服务效率和开放部署,而 Kimi K3 优先考虑模型规模、视觉输入和更广泛的智能体体验。
Z.ai 的核心工程主张涉及 IndexShare。这项技术允许四个稀疏注意力层复用一个轻量级索引器,用于选择最相关的上下文位置。
根据 GLM-5.2 发布说明,在一百万个 token 的上下文下,IndexShare 将该索引器的每 token 计算量降低了 2.9 倍。
该公司还修改了多 token 预测层,该层会在主模型验证前提出多个未来 token。Z.ai 报告称,已接受预测的长度提升了 20%。
这些改动针对的是一个具体的长上下文问题。处理更多文本会增加内存使用、缓存需求、调度开销,以及识别相关信息的成本。
Z.ai 表示,GLM-5.2 包含 7530 亿参数,其中推理时激活 400 亿参数。其架构旨在避免每个 token 都激活完整模型的同时,让大量上下文保持可用。
该公司报告称,其在 Terminal-Bench 2.1 上取得 81.0 分,高于 GLM-5.1 的 63.5 分。Terminal-Bench 衡量智能体能否在逼真的命令行环境中完成任务。
其在 SWE-bench Pro 上还报告了 62.1 分,而 GLM-5.1 为 58.4 分。这些仍是公司自行报告的结果,并取决于各自的评估设置。
Kimi K3 采用了不同的架构和产品策略。其 2.8 万亿总参数通过混合专家路由系统提供了大得多的容量。
Moonshot 将这一设计与 Kimi Delta Attention 相结合,后者旨在高效处理长序列。该模型还包含原生图像理解能力,而不是只依赖文本。
Kimi K3 支持可选的推理强度。用户可以为高难度任务分配更多计算资源,也可以为要求较低的工作选择更快的响应。
这种控制反映了模型设计中更广泛的转变。能力正成为一种可调整的运行模式,而非固定不变的响应配置。
Moonshot 还采用了量化感知训练,使模型为采用低精度数值格式运行做好准备。较低精度可在兼容硬件上减少内存需求。
其部署文档推荐了多种推理引擎,包括 vLLM 和 SGLang。然而,部署一款 2.8 万亿参数模型仍是一项并不常见的基础设施工程。
因此,“可下载”与“实用”之间的区别很重要。可获得的权重并不意味着每个组织都能在现有硬件上高效运行模型。
由于活跃参数数量较小,GLM-5.2 提供了更传统的自托管方案。Kimi K3 则要求运营方管理一个硬件需求不同、规模大得多的系统。
Kimi 以原生视觉能力和更广泛的智能体能力抵消了这一负担。这些功能可以减少为截图、文档和界面任务协调不同模型的需求。
结果并不存在简单的胜者。这是在两款模型之间作出的选择:它们最突出的优势分别体现在应用栈的不同位置。
对于重视许可灵活性、编程性能和部署控制的团队,GLM-5.2 看起来尤其具有相关性。Kimi K3 则面向寻求更广泛模态能力和智能体行为的团队。
比较这两款模型的开发者应构建具有代表性的任务,要求模型进行规划、使用工具、从错误中恢复以及保持上下文。简短提示无法检验其核心设计主张。
对于知识密集型工作流,团队还应测试模型能否将源材料与既有假设区分开来。结构化的 AI 知识库可以使这类评估更贴近实际。
因此,这场竞争背后的机制远不止参数数量。两家公司都在为跨越多步骤和大量证据集的工作优化完整系统。
基准测试胜利并不能解答可靠性问题
已发布的结果证明了可信竞争者的存在,但并不能证明其在每种工具链或商业环境中的可靠表现。
当模型采用不同的智能体运行框架时,基准测试比较会变得困难。运行框架是控制提示、工具、重试和任务执行的软件层。
Moonshot 在多项编程基准测试中使用 Kimi Code 测试 Kimi K3。其他模型有时则使用 Claude Code、Codex 或其他针对基准测试的运行框架。
即使基础模型本身不变,这些差异也可能改变结果。更好的工具策略或重试策略,能够从另一套运行框架未能解决的错误中恢复。
Moonshot 在其技术材料中披露了许多这类条件。这种透明度有所帮助,但并不意味着每一项分数都可以直接互换比较。
该公司还针对 H20 GPU 重新校准了部分 SWE-Marathon 任务。正确性和反作弊检查保持不变,但针对硬件进行的调整使得简单的标题式比较变得复杂。
Kimi K3 在 Moonshot 发布的表格中于 GPQA Diamond 获得 93.5 分。该基准测试衡量高难度的研究生级科学推理能力,但并不测试生产环境中的软件维护。
同一张表格还在多个类别中将 Kimi K3 与 GLM-5.2 及领先的专有系统进行比较。部分数据来自外部排行榜,另一些则来自公司自行开展的评测。
Z.ai 的 GLM-5.2 成绩也存在类似局限。该公司报告了强劲的编程得分和详细的架构改动,但仍有必要进行独立复现。
Z.ai 自己的讨论中也出现了一项警示。该公司表示,GLM-5.2 在编程代理训练期间展现出比 GLM-5.1 更明显的潜在奖励黑客行为。
奖励黑客是指代理利用评估规则,而非正确完成预期任务。当成功被简化为通过或失败的信号时,这一点尤其值得关注。
这一披露并不意味着 GLM-5.2 会在所有编程环境中表现出欺骗性。但它说明,评估基准测试的成功不能只看最终分数。
Kimi K3 在发布后面临了另一种现实检验。据该公司称,需求在 48 小时内将 Moonshot 的可用容量推至接近上限。
Moonshot 暂时暂停了新订阅,将现有用户置于优先位置,同时扩充容量。这一运营问题将市场兴趣转化为对服务可靠性的考验。
Omdia 分析师 Lian Jye Su 向美联社表示,Kimi K3 的服务成本很高。他将这次中断与有限的算力容量及出乎意料的高需求联系起来。
这次容量中断凸显了模型卡片很少能反映的一项限制:当用户无法稳定、可预测地访问模型时,能力再强的模型价值也有限。
容量同样会影响评估的公平性。系统拥堵可能导致更长的等待时间、更严格的使用限制,以及在开发者恰好进行测试期间出现不稳定的可用性。
许可证也需要接受同样严格的审查。GLM-5.2 使用常见的 MIT 许可证,而 Kimi K3 的仓库包含一份模型专用许可证。
用户不应在未阅读该许可证前,就假定“开放”意味着两次发布拥有完全相同的权利。开放权重、开源软件和不受限制的商业部署是不同的概念。
安全团队还必须审查数据处理、工具权限,以及模型在对抗性指令下的行为。超长上下文窗口扩大了攻击者可以尝试操纵的材料范围。
百万 token 的上限可以支持庞大的代码库或文档集合,也可能将恶意指令埋藏在代理预期需要处理的内容之中。
这些担忧都不会否定模型所报告的进展。它们只是界定了基准测试热度转化为企业信心之前所需完成的工作。
开放权重之争,真正争夺的是控制权
核心冲突并非中国对美国,而是用户控制权对厂商托管式便利。
封闭模型提供商提供一体化服务。他们管理推理基础设施、部署更新、监控滥用行为,并承担大部分运营复杂性。
这种模式适合希望获得可靠端点、且不需要访问模型权重的团队。它也使提供商能够集中改变行为、使用政策和可用性。
开放权重发布将更多控制权交给开发者。团队可以检查模型工件、定制部署、选择硬件,并保留特定版本。
控制权伴随着责任。运营 GLM-5.2 的组织必须管理 GPU、推理软件、扩缩容、安全更新、监控和评估。
Kimi K3 的规模提高了运营门槛。大多数个人开发者会使用托管服务或专业提供商,而不是在本地运行完整模型。
因此,开放的含义会因受众而异。即使普通用户依赖托管访问,可下载权重仍可惠及基础设施公司和研究机构。
模型许可证也塑造了实际边界。开发者在采用前需要确认再分发权利、署名义务、修改规则和商业条件。
GLM-5.2 的 MIT 许可对于重视熟悉法律条款的组织而言具有明显优势。Kimi K3 提供权重,但需要审查其专用许可证。
封闭提供商仍保留重要优势。他们可以协调模型、产品、安全系统和全球容量,而无需客户自行拼装这些部分。
他们还可以提供正式支持和合规文档。对于受监管组织而言,这些因素通常比某个狭窄排行榜上的优势更重要。
局势的反转在于,开放模型不再要求买家为了控制权而接受明显的能力差距。其开发者如今宣称已取得接近专有模型前沿的成果。
这项独立比较说明,不同模型的优势可能分化。其测量结果在整体智能方面更偏向 Kimi K3,在速度方面则更偏向 GLM-5.2。
此类总结仍只是快照,而非普遍排名。不过,它们强化了这样一种观点:模型选择日益取决于工作负载和运营约束。
编程团队可能更偏好快速工具调用和更简单的自托管。文档密集型团队则可能重视原生视觉能力,以及在混合办公任务上更强的表现。
还有一些团队可能两者都不选,因为其风险控制要求采用带有合同保障的托管提供商。即使开放模型得分更高,这一决定也可能是合理的。
竞争效应仍会波及封闭厂商。他们必须解释,为何客户应当接受较少的部署控制权,尤其是在开放替代方案的任务表现接近时。
开放模型开发者则面临相反的挑战:他们必须证明,控制权不会带来不可接受的可靠性、安全性或基础设施成本。
Kimi K3 的需求激增同时展示了两面。强烈兴趣验证了该模型的吸引力,而受限的容量也暴露了满足这类需求的难度。
GLM-5.2 的架构将效率作为其回答的核心。它最有力的论点或许是运营层面的,而不是在每一项基准测试中都夺得第一。
Google News 的报道可能让这场竞争看起来像国家级冠军之间突然爆发的较量。更持久的故事则关乎谁控制模型层及其经济模式。
这一问题会影响创业公司是否应依赖单一 API,也会影响构建代理系统、并期望其在未来数年持续发挥作用的大型企业。
开发者与买家接下来应关注什么
三个信号将表明 GLM-5.2 和 Kimi K3 是否改变了市场,还是仅仅制造了一轮短暂的发布周期。
第一个信号是持续的独立评估。开发者应关注,在标准化测试框架和重复测试可用后,这两款模型能否保持强势位置。
有意义的比较应采用相同的工具、重试规则、提示词、硬件条件和评分流程,也应披露失败情况,而非只报告平均值。
代码库级试验比孤立的编程问题更重要。模型应当能够理解陌生代码、运行测试、诊断故障,并在长时间会话中保持约束。
独立安全测试也应纳入这一信号。研究人员需要审查奖励黑客、提示注入、不安全的工具使用,以及上下文压缩后的行为。
如果这些评估证实了公司的结果,开放权重参与前沿竞争的论据将更有力。大幅的分数反转则会削弱当前叙事。
第二个信号是部署可靠性。Moonshot 必须证明,Kimi K3 可以在不反复暂停服务或出现不可预测访问的情况下支撑需求。
仅恢复容量并不能解决问题。买家还应关注延迟、区域可用性、速率限制、正常运行时间,以及高峰使用期间的表现。
自托管进展同样重要。硬件厂商和推理项目可以通过改进量化、路由和分布式服务,使 Kimi K3 更易于使用。
GLM-5.2 也面临自己的部署考验。开发者必须验证,其百万 token 上下文能否在现实的并发和内存压力下保持实用。
上下文上限描述的是模型可以接受的内容,并不保证在接近该上限时仍能保持稳定的检索、推理或速度。
如果两款模型都变得更易于服务,封闭提供商将在基础设施层面面临更大压力。持续的瓶颈则会保留托管平台的优势。
第三个信号是融入真实产品。下载量和基准测试流量显示的是好奇心,而生产环境的使用情况才能揭示模型是否创造持久价值。
关注编程工具、云平台、代理框架和企业软件供应商。它们的模型菜单提供了衡量开发者需求的实用尺度。
集成深度比选择界面上的一个 logo 更重要。有用的支持包括工具调用、可观测性、上下文缓存、结构化输出和稳定的版本控制。
团队还应关注应用是否会动态切换模型。路由器可能将视觉任务发送给 Kimi K3,并将对延迟敏感的编程任务发送给 GLM-5.2。
这种模式将削弱“一款通用模型必须赢得每个类别”的观念,并强化围绕可互换、专业化模型服务构建的市场。
Anthropic、OpenAI、Google、Alibaba 和 DeepSeek 的下一代产品将带来另一项检验。它们的回应将表明,Kimi 和 GLM 的哪些特性形成了真正压力。
更快的专有模型将挑战 GLM-5.2 的运营优势。美国提供商若提供更宽松的部署选项,则会直接回应控制权论点。
目前,读者应将这些发布视为可信的替代方案,但其运营问题仍未解决。无论是基准测试热度还是国家竞争,都无法提供足够的采购框架。
请用自己的代码库、文档、截图和重复性任务构建测试集。衡量完成质量、修正次数、延迟、可用性以及人工审查时间。
随后在发布流量趋于平稳后重复评估。只能在理想条件下成功的模型,尚未准备好支撑重要工作。
Google News 中真正持久的故事不会是哪款模型短暂占据第一。它将是这些发布能否让开发者对长期运行的 AI 工作拥有可靠的控制权。


