Kimi K3 和 GLM-5.2 改写开源权重 AI 竞争格局
- Ethan Carter

- 8月3日
- 讀畢需時 13 分鐘
Moonshot AI 和 Z.ai 在数周内先后发布两款雄心罕见的开源权重模型,随即登上 google news。Moonshot 的 Kimi K3 拥有 2.8 万亿参数、原生视觉理解能力和 100 万 token 的上下文窗口。Z.ai 的 GLM-5.2 则以 7530 亿参数和相当的上下文容量,瞄准长程编程与智能体任务。
这些数字令人瞩目,但模型规模并非真正的冲突所在。两家公司都在挑战一种假设:先进 AI 必须留在由美国供应商控制的封闭界面之后。
开发者可以在遵守各版本许可证、并满足高昂硬件要求的前提下,检查和部署模型权重。这让工程团队对托管、定制、数据处理和推理基础设施拥有更多控制权。
这些发布也从一个出人意料的方向向 OpenAI 和 Anthropic 施压。Moonshot 和 Z.ai 并非只是提供更便宜的通用聊天替代品。它们瞄准的是编程智能体、长时间运行的工作流和大上下文分析——这些正是封闭模型建立起最强商业地位的领域。
结果尚未尘埃落定。厂商基准测试仍难以直接比较,实际部署成本可能抹去理论优势,而可下载的模型也不一定就能被实际高效地运行。但两款可信发布的出现,改变了企业采购方所面对的问题。
过去的问题是,开放模型能否接近前沿性能。如今的问题则是:当开源权重替代方案已经足以胜任重要的生产工作时,封闭供应商是否还能证明,给予客户更少控制权是合理的。
Kimi K3 和 GLM-5.2 实际改变了什么
这两次发布让开源权重 AI 从次要选项变成了一项严肃的基础设施决策。
Moonshot 于 2026 年 7 月发布 Kimi K3,作为其最新旗舰模型。随附的 Kimi K3 论文描述,这是一款混合专家模型,总参数量为 2.8 万亿,其中推理时活跃参数为 1040 亿。
混合专家模型会将每个 token 路由至选定的专家组件,而非使用每一个参数。这样的设计让模型能够扩大总体容量,同时不必在每次请求中激活整个网络。
据 Moonshot 的技术资料,Kimi K3 使用 896 个专家,并为每个 token 选择其中 16 个。它还支持视觉输入,并提供 100 万 token 的上下文窗口。
上下文窗口是指模型在一次交互中能够考虑的信息量。100 万 token 可以容纳一个大型代码仓库、广泛的技术文档,或一组篇幅很长的业务记录。
这些能力让 Kimi K3 不只是又一次聊天机器人发布。Moonshot 将其定位于软件开发、研究、视觉分析,以及涉及多种工具和延展任务历史的智能体工作。
因此,“Kimi K3 explained”这一说法需要加上一个重要限定。该模型的决定性特征并不只是参数规模,其价值主张结合了稀疏激活、长上下文、多模态输入和可下载权重。
Moonshot 最初通过其应用和 API 提供访问,随后发布模型权重和技术报告。这个顺序很重要,因为当独立开发者能够审查实际发布内容时,开源权重的主张才更具意义。
同样被称为 Zhipu AI 的 Z.ai,则沿着不同的技术路径发布了 GLM-5.2。其官方 GLM-5.2 模型卡列出该模型拥有 7530 亿参数,并提供 100 万 token 的上下文选项。
GLM-5.2 主要面向文本、编程和长程智能体任务。长程指的是要求模型在延长的会话中保持计划、从错误中恢复,并协调多个步骤的工作。
这一差异形成了有趣的分野。Kimi K3 强调规模、视觉理解和广泛的智能体能力;GLM-5.2 则将重点放在编程、持续推理和大文本上下文上。
两款发布都提供模型权重,但开源权重并不意味着开发过程的每一部分都是开放的。训练数据集、过滤决策和完整训练流水线可能仍不可得。采购方应区分可下载权重与完整可复现性。
即便存在这一限制,访问权限仍会改变团队的能力边界。企业可以在自身环境中评估模型,应用自定义安全措施,研究失败模式,并避免将每一次请求都发送至外部服务。
它还可以围绕可预测的工作负载构建专用服务系统。这对于处理源代码、法律文件、内部研究或其他敏感材料的组织尤其重要。
这正是为什么 GLM-5.2 vs Kimi K3 不只是一次基准测试竞赛。它比较的是两种让前沿规模能力更可由用户掌控的路径。
这些发布也带来了一项更广泛的市场测试。开发者如今可以评估:访问权、控制权和适应性,是否足以弥补封闭托管模型所提供的运营便利。
为什么封闭式 AI 供应商如今面临压力
OpenAI 和 Anthropic 面临压力,因为客户能够在同一次采购决策中比较模型质量与部署控制权。
封闭供应商仍保有重要优势。它们运营着成熟的服务,维护丰富的开发者工具,并承担部署超大模型的工作。其客户无需组建集群、优化推理或管理模型更新。
这些优势依然显著,但它们已无法终结这场争论。
Kimi K3 和 GLM-5.2 为企业提供了另一条路径。团队可以在实验阶段使用托管端点,随后在隐私、延迟、定制需求或工作负载规模足以证明投入合理时,考虑私有化部署。
即使客户最终从未自行托管,这一选择也会改变谈判格局。可信的替代方案降低了对单一供应商模型行为、访问规则、产品路线图和服务可用性的依赖。
压力在编程领域最为强烈。软件智能体需要消耗大量上下文,因为它们必须检查文件、理解依赖关系、阅读文档、运行工具,并保留此前尝试的历史记录。
一次简短的聊天机器人交流相对容易在供应商之间迁移。但围绕专有智能体行为构建的工程工作流则更难迁移。
这两款中国模型都瞄准了这种依赖。Z.ai 将 GLM-5.2 描述为在长程工作方面的改进,而 Moonshot 则将 Kimi K3 定位为面向编程和通用智能体任务的模型。
两家公司自行报告的评估结果显示,它们在选定的编程和智能体基准上具有竞争力。这些说法仍需谨慎看待,因为测试设置、工具访问、提示方式和评分程序都可能影响排名。
独立信号依然值得关注。一项 Associated Press 评估报道称,Kimi K3 在衡量前端编程能力的 Arena 排名中登顶。同一报道还指出,国际开发者对 GLM-5.2 的兴趣正在增长。
Arena 风格的评估依赖比较或偏好判断,而非固定答案标准。它能捕捉传统测试遗漏的特质,但也衡量了特定的界面和用户群体。
没有任何单一结果能够确立全面优势。编程模型可能在孤立任务上表现出色,却在代码仓库规范、模糊需求、工具故障或跨多个文件的变更中遇到困难。
尽管如此,封闭实验室必须回应这一更广泛的趋势。开源权重发布正达到这样一个阶段:团队可以用真实的内部工作负载测试它们,而不是基于旧有假设将其排除在外。
这对需要可审计性的采购方尤其重要。可下载权重并不会让模型完全透明,但本地测试能让团队在受控条件下更清楚地观察其行为。
团队可以围绕自己的代码、文档和政策构建回归测试套件。他们可以在批准迁移前,比较不同模型版本的输出。
这一过程有助于形成更严谨的 AI 工作流。模型成为文档化系统中一个可替换的组件,而非系统永久不变的核心。
OpenAI 和 Anthropic 可以通过更高可靠性、更强安全控制、更易部署和更优支持来回应。它们也可以继续以快于开放替代方案实现运营化的速度,改进专有模型。
关键变化在于,它们必须证明这些优势。当开发者能够下载可信的竞争对手并进行直接评估时,仅靠品牌认知已不再那么有说服力。
Google news 的报道放大了这种压力,因为它将讨论带出了专业模型社群。企业领导者如今会将 Kimi K3 和 GLM-5.2 视为战略选择,而非小众的研究发布。
这种被迫作出的回应将在数月而非数日内展开。值得关注的是更长的上下文限制、更灵活的企业部署、更好的模型可移植性,以及对托管服务在原始智能之外能提供何种价值的更有力说明。
GLM-5.2 vs Kimi K3 的本质是控制权与便利性之争
核心权衡不在于哪个模型赢得静态评分表,而在于谁掌控模型周边的基础设施。
Kimi K3 提供了更广泛的能力组合。其原生视觉处理能力使其能够同时处理图像和文本,而 100 万 token 的上下文则支持处理大量相关材料。
Moonshot 还围绕稀疏计算设计了该模型。每个 token 只会激活其庞大参数池中的一部分,与激活全部 2.8 万亿参数相比,所需计算量更低。
较低的激活量并不意味着模型很小。完整权重集仍然极其庞大,实际部署需要大量存储、内存、网络资源和工程专业能力。
量化可通过使用更少的位来表示权重,从而降低这些需求。然而,激进压缩可能会改变准确性、延迟或稳定性,具体取决于实现方式和工作负载。
GLM-5.2 的总参数量较小,但仍远超普通本地模型的规模。其更聚焦于文本和编程的设计,可能会吸引不需要原生视觉输入的组织。
模型卡强调了可用的 100 万 token 上下文,以及在延展智能体任务上的性能提升。这使其适用于代码库分析、多文件变更、研究综合和长期工具使用。
但宣传中的上下文容量并不等同于可靠的长上下文性能。模型可以接受极长的提示词,却无法提取关键事实、保持计划,或正确地优先处理近期指令。
团队应测试有效上下文,而不只是最大上下文。良好的评估会将相关事实置于不同位置、引入干扰信息,并衡量模型是否始终如一地使用证据。
同样的原则也适用于智能体基准。智能体的表现取决于其周边框架,包括工具定义、重试逻辑、权限、记忆和执行环境。
在一家厂商的测试框架中表现出色的模型,换到另一家的框架中可能会呈现不同表现。因此,比较 GLM-5.2 与 Kimi K3 需要共享的测试环境和一致的成功标准。
对于软件团队,这些标准可能包括通过的测试数量、误修改的文件、审查时间、工具出错后的恢复能力,以及无需人工干预即可完成的任务比例。
对于研究团队,标准可能包括引文准确性、证据覆盖度、矛盾处理能力,以及将结论追溯至原始材料的能力。
这正是控制权变得有价值的地方。开放权重让技术成熟的组织能够调整服务行为,并决定数据流向何处。它们也支持长期使用某一特定模型版本。
托管的专有模型可能会随更新发生变化。即使提供商提升了平均质量,新行为仍可能影响提示词、评估或自动化流程。
运行固定版本的开放权重模型,能让客户对这一变更周期拥有更多控制权。他们可以在部署到生产环境前验证更新,并保留一个后备版本。
便利性则推动着相反的方向。托管 API 可提供快速部署、弹性容量、监控和支持,而无需专门的推理团队。
大多数组织不应想当然地认为自托管必然更经济或更安全。维护不善的基础设施本身也可能带来可用性、隐私和访问控制风险。
更好的问题是,组织需要控制哪一层。有些团队只需要托管服务商在合同中提供的数据保护;另一些则需要私有网络、自定义日志、固定模型版本,或部署在特定司法管辖区内。
从这一视角来看,Kimi K3 是一种部署选择,而不是一场围绕数万亿参数的奇观。GLM-5.2 则通过更偏重编程的设计传递了相同含义。
两款模型都不会取代闭源 AI。相反,它们让闭源便利性所对应的溢价更加显眼。
基准测试无法终结这场竞赛
在独立测试于真实工作负载中复现这些结论之前,最强的主张仍只是厂商主张。
Moonshot 表示,Kimi K3 在编程、智能体和通用能力评估中具有竞争力。Z.ai 表示,GLM-5.2 相较 GLM-5.1 有所改进,尤其是在长任务和超长上下文方面。
这些结果提供了有用的起点,但并不保证生产环境中的结果。基准测试污染、提示词选择、工具配置和评分方法都可能影响报告中的性能。
新模型通常也会受到爱好者的集中测试。早期成功案例可能会过度代表契合模型优势的工作负载,而失败案例则较少得到系统性记录。
需求本身也带来了另一层不确定性。据另一份容量报告称,Moonshot 曾因需求超过可用容量而暂时暂停新的 Kimi 订阅。
这一回应支持了市场关注度异常高的说法,同时也揭示了围绕如此庞大模型的基础设施挑战。
一家提供商可以发布权重,却仍难以持续提供稳定的托管访问。独立运营方在尝试以实用延迟服务该模型时,也面临类似限制。
Kimi K3 的稀疏架构减少了活跃计算量,但服务性能不只取决于活跃参数数量。专家路由可能会在加速器之间产生通信需求,尤其是在将权重分布到多台机器的部署中。
长上下文则增加了另一项负担。系统在生成新 token 时,必须存储并管理与先前 token 相关的信息。
Moonshot 此前探索过解耦式服务,将推理的不同阶段分配到不同资源上。其 Mooncake research 描述了一种围绕管理长上下文推理中所用键值缓存的架构。
这项工作提供了相关技术背景,但并不意味着每一个独立的 Kimi K3 部署都能继承 Moonshot 的生产效率。运营方必须自行构建或采用自己的服务栈。
GLM-5.2 面临相关问题。其百万 token 能力可能需要特定模型配置,而不是在所有托管环境中都作为默认路径运行。
开发者在比较结果前,应确认上下文设置、输出限制、内存要求和服务商特定限制。模型名称本身并不能保证在不同平台上具有相同行为。
安全性也需要平衡评估。本地部署可以减少对外部 API 的暴露,但会将补丁管理、访问管理、日志记录和模型隔离的责任转移给客户。
开放权重可以帮助研究人员检查模型行为,但不会自动揭示每一个训练样本的来源,也不会消除产生不安全输出的可能性。
监管和地缘政治问题又为跨国企业增加了不确定性。企业可能需要审查软件许可证、数据治理、出口规则、采购政策以及行业特定要求。
这些审查应聚焦于有据可查的义务,而不是基于国籍的假设。相关问题在于数据如何流动、谁运营服务、许可证允许什么,以及如何审计部署。
另一项风险是追逐基准。如果团队因为模型在某一项公开测试中领先而选择它,可能会忽视它在自身重复且并不光鲜的工作中的失败率。
客服智能体必须始终如一地遵守政策。编程智能体必须避免损坏无关文件。研究模型必须将证据与看似合理的虚构内容区分开来。
这些品质往往比赢得一个醒目的分数更重要。它们还需要长期、跨多类任务,并采用明确人工审查标准的评估。
Kimi K3 和 GLM-5.2 的发布值得关注,因为它们使此类测试成为可能。但仅因其权重可用,并不值得获得无条件信任。
最负责任的结论应是有条件的:两款模型都具备足以进行评估的、已有文档支持的能力,但都还没有足够独立的生产证据来终结开源与闭源之争。
Google News 读者接下来应关注什么
三个信号将显示,这些发布究竟代表持久竞争,还是短暂的基准测试周期。
第一个信号是独立部署证据。开发者应关注覆盖编程智能体、长文档检索、多模态分析和工具使用的可复现测试。
有价值的报告会披露模型版本、推理设置、量化方法、提示词、工具和成功标准。缺少这些细节的排名,决策价值较低。
代码库级编程测试尤其具有揭示意义。可信的评估应衡量完成的任务、引入的回归问题、审查工作量,以及从失败命令中恢复的能力。
如果 Kimi K3 和 GLM-5.2 在这些环境中表现稳定,那么开放权重前沿替代方案的理由将更充分。如果结果因托管环境或配置而大幅变化,托管闭源系统仍将保有显著优势。
第二个信号是部署可及性。权重发布只是开始,因为很少有组织能够在没有专业基础设施的情况下运行如此规模的模型。
关注稳定的推理框架、受支持的量化版本、更广泛的加速器兼容性,以及来自多家提供商的可靠托管服务。这些进展决定开放访问能否成为实际可用的访问。
Kimi K3 是一项要求异常高的测试。其总计 2.8 万亿参数,即使每个 token 只激活其中一部分,仍会带来巨大的存储和分发需求。
GLM-5.2 同样需要严肃的基础设施,但其整体规模较小,可能带来不同的采用路径。如果它被证明更易于运行,组织可能会在文本和编程工作负载中偏向它。
多元化的托管市场将增强开放权重的论据。若依赖单一官方端点,则会削弱用户获得了实质性基础设施选择的说法。
第三个信号是闭源模型提供商的回应。OpenAI 和 Anthropic 不必发布权重,也能应对这一挑战。
它们可以通过更高的可靠性、更好的智能体工具、更强的企业控制、更优的上下文处理,以及更清晰的数据治理承诺来回应。它们也可以降低模型之间迁移所需的工作量。
重要指标将是闭源服务是否变得更灵活。固定版本访问、私有部署选项、更强的评估工具和可导出的工作流状态等功能,都将直接弥补控制权缺口。
又一波中国模型发布可能会加剧压力。Alibaba 和 DeepSeek 已帮助确立中国作为开放和开放权重模型开发重要来源的地位。
中国实验室之间的竞争同样重要。Moonshot 和 Z.ai 不仅要抵御 OpenAI 和 Anthropic,还必须应对国内竞争对手。
这种动态能够加快模型可用性,但也可能缩短产品周期。企业团队需要稳定版本和可靠支持,而不是持续围绕最新检查点重建的压力。
Google 新闻的关注必然会转向下一款模型。持久的问题在于,当发布热度消退后,开发者是否仍会继续使用 Kimi K3 和 GLM-5.2。
仅靠下载量无法回答这一问题。有意义的采用会体现在集成、可重复评估、持续维护的服务工具,以及明确说明限制条件的生产案例研究中。
买方应避免根据发布首周的结果做出广泛的平台承诺。相反,他们应建立一套具有代表性的评估集,并在真正重要的工作流中比较模型。
从一个范围明确的任务开始。记录所需上下文、工具调用、人工干预、延迟、失败模式和最终输出质量。然后将任务重复足够多次,以暴露不一致性。
团队也应测试可移植性。提示词、检索系统和智能体工具应避免不必要地依赖某一模型独有的行为。
无论下一项基准由哪家厂商领先,这种准备都很有用。模型竞争变化太快,无法建立永久性的假设。
Kimi K3 和 GLM-5.2 很重要,因为它们扩大了可信选择的范围。它们也揭示了将模型访问转化为运营价值所需的工作。
未来一到三个月将显示,独立运营方能否可靠地服务这些模型,开发者能否复现头条结果,以及闭源提供商是否会调整其企业条款。
对于关注 google news 的读者而言,这才是实际任务:忽略最响亮的分数,识别你真正需要的工作负载,并要求在模型将运行的环境中提供证据。你的下一次 AI 评估,衡量的是模型声望,还是组织能够验证的控制力、可靠性和可移植性?


