Z.AI 凭借 GLM-5.3 挑战 Anthropic、Google 的编程格局
- Olivia Johnson

- 5天前
- 讀畢需時 14 分鐘
Z.AI 于 8 月 14 日发布 GLM-5.3,并宣称其编程能力提升了 50%,直接挑战 Anthropic、Google 和 OpenAI 的模型格局。这家北京 AI 公司表示,改进完全来自后训练,而非更大的底层模型。这一说法让此次发布的意义超出了又一次常规更新。
据 Z.AI 介绍,GLM-5.3 与 GLM-5.2 使用相同的基础模型。该公司将额外训练集中在复杂软件工作、长时间运行的智能体任务和网络安全上。因此,其公布的提升检验了:更好的执行环境是否能比又一轮昂贵的预训练带来更大价值。
这正是核心分歧。Anthropic、Google 和 OpenAI 通过大型专有模型、集成式编程产品和可观的计算预算建立了各自的地位。Z.AI 则主张,中国模型可以通过有针对性的后训练缩小部分差距,同时保留开放权重路径。
这些数字颇为吸睛,但大多来自 Z.AI 自身的评估。GLM-5.3 的模型权重在发布时也尚不可用,该公司承诺将在两周的安全测试和加固后发布。在独立研究人员能够复现结果之前,这一公告仍是一项有力的技术主张,而非已尘埃落定的排名。
GLM-5.3 将竞争从规模转向训练质量
Z.AI 将 GLM-5.3 视为证据:无需再进行一次完整预训练周期,同一基础模型也能获得显著更强的能力。
预训练让模型从大量数据中学习广泛模式。后训练则进一步塑造其推理、遵循指令、使用工具和完成专业任务的方式。Z.AI 表示,GLM-5.3 的提升来自通过更多可执行环境和更长的编程任务来扩展这一第二阶段。
这一差异很重要,因为预训练新的前沿模型需要大量计算资源、数据准备和工程时间。能够从现有基础模型中提取重大改进的实验室,或许能更快迭代,并将投入集中在实际应用中的薄弱环节。
GLM-5.2 已为这一策略奠定了基础。更广泛的 GLM-5 系列,其总参数量从 GLM-4.7 的 3550 亿增长到 GLM-5 的约 7440 亿。Z.AI 还将其公布的预训练语料从 23 万亿 token 增加至 28.5 万亿 token。
该公司的 GLM-5 documentation 描述了一种混合专家架构,即每个 token 仅激活网络的一部分。Z.AI 报告称,在模型更大的总参数规模中,活跃参数为 400 亿。这种设计旨在提升整体容量,同时避免每次请求都使用全部参数。
GLM-5.3 并未替换这一基础模型。相反,Z.AI 表示,它在更长的编程轨迹和更多交互式环境中训练了该模型。轨迹记录了智能体如何规划、调用工具、读取结果、调整方向,以及如何在多个步骤中验证其工作。
这一重点反映出 AI 编程领域更广泛的转变。生成看似合理的函数已不再是主要考验。开发者日益期待智能体能够检查代码仓库、修改多个文件、运行测试、诊断故障,并保留既有行为。
这些任务会暴露短小编程提示很少揭示的弱点。模型可能写出有效语法,却误解某项依赖、忘记先前作出的决策,或在验证修复前就停止。针对延展性、可执行任务进行训练,可以直接瞄准这些失效模式。
Z.AI 表示,在其内部 Z.AI Code Bench 上,GLM-5.3 相比 GLM-5.2 提升了 50%。在高推理设置下,该公司报告称,模型以约 50,000 个输出 token 达到 31.4% 的完成率。在同一比较中,该公司列出的 Claude Opus 4.8 完成率为 29.5%,但使用了约 120,000 个输出 token。
在最大投入下,据称 GLM-5.3 达到 34.5%。根据该公司的图表,Anthropic 的 Fable 5 仍以 39.5% 领先。这一结果并不支持“Z.AI 已击败所有西方模型”这种简单说法。
但它支持一个更有限的论点。Z.AI 表示,其模型正在复杂编程工作上接近专有竞争对手,同时在某些评估设置中使用更少的生成 token。Token 效率很重要,因为长时间运行的智能体可能产生巨量的中间推理和工具输出。
这一结果也重新定义了 Anthropic 与 Google 的竞争。Google 的 Gemini 模型仍是拥有广泛产品分发能力的通用多模态系统。Anthropic 则围绕 Claude Code 和长周期软件工作建立了特别强的声誉。GLM-5.3 直接进攻的是第二个领域,而非试图一次赢得所有模型能力。
Anthropic、Google 和 OpenAI 为何如今面临压力
眼前的压力来自这样一种模型:它力图胜任高要求工作,同时为开发者提供更多部署选择。
编程已成为生成式 AI 最明确的商业用途之一。这项任务能产生可见输出,支持自动化测试,并消耗足够多的 token,使模型选择在财务上变得重要。它也促使开发者比较不同供应商,而不是始终忠于某一个通用聊天机器人。
对 Anthropic 的压力最为明显,因为 Claude Code 已为智能体编程建立了熟悉的界面。Z.AI 支持兼容 Anthropic 的端点,使部分围绕 Claude API 格式构建的工具能够改为向 GLM 模型发送请求。
兼容性并不意味着这些系统完全相同。Claude Code 包含自身的编排、上下文管理、权限控制和产品行为。不过,替代端点降低了在现有工作流中测试另一款模型所需的成本与工作量。
OpenAI 通过 Codex 及其开发者平台面临类似挑战。Google 则通过 Gemini 的编程集成和云端分发面临这一挑战。三家公司都可以通过更强模型、更低成本选项或更深度的产品集成来回应。
不过,替代方案无需在每一项基准测试上占据主导,便能形成定价压力。它只需在有意义的一部分生产任务上可靠运行即可。
这一模式在 Z.AI 之外已清晰可见。Chinese model market 已涌现 Moonshot AI、DeepSeek、Alibaba、MiniMax 和 Z.AI 等模型,争夺全球开发者的关注。它们的增长让企业能够选择跨多个供应商路由工作负载。
美联社报道称,在最近一个月 OpenRouter 上最受欢迎的五款模型均来自中国。报道还援引行业观察人士的话称,这些系统在编程和研究方面已接近领先的美国模型,尽管在更广泛能力上仍然落后。
这一限定很重要。编程表现并不会自动转化为更好的事实可靠性、视觉理解、商业分析或安全表现。替换主要模型的公司必须评估整个工作负载,而不是只看一个排行榜。
然而,企业并不总需要一款模型处理所有事情。它们可以将代码仓库搜索路由给一个系统,将代码生成交给另一个系统,再将高风险审查交给第三个系统。这种模块化方法让接近领先者的竞争对手成为实用的议价工具。
因此,最强压力可能落在常规智能体工作负载上。这些工作包括依赖项更新、测试创建、文档修改、重复性重构和初步缺陷调查。买方可以比较成功率、延迟、治理能力和总 token 使用量,而不必要求绝对前沿的性能。
开发者也越来越习惯切换模型。OpenCode、Cline、Roo Code 等编程界面以及供应商路由服务,将用户体验与底层模型分离开来。这使模型选择更像一项基础设施决策。
agent cost debate 增添了紧迫感。尝试自主工作流的企业发现,长任务消耗的 token 可能远超普通聊天。当智能体反复搜索文件、修订计划和运行工具时,微小的效率差异也会变得实质性。
Z.AI 的发布时机正利用了这一担忧。GLM-5.2 已因编程能力获得关注,而 GLM-5.3 则在买方积极重新评估自己究竟需要多少高溢价性能之际推出。
这正是略显别扭却重要的 Anthropic 与 Google 对比变得有用之处。Anthropic 具备以编程为中心的产品声誉,Google 则拥有分发能力和多模态广度。Z.AI 并未同时匹配两种策略。它将竞争收窄到软件任务的执行质量,在这一领域,专业化模型有更清晰的竞争机会。
Anthropic、Google 基准测试叙事仍需独立验证
GLM-5.3 的基准提升是值得进一步评估的重要线索,但并非其生产环境优势的独立证明。
Z.AI 报告了多项公开和内部测试中的改进。在 Terminal Bench 2.1 上,据称该模型得分为 88.2,GLM-5.2 为 81.0。Terminal Bench 评估智能体能否在命令行环境中完成任务。
该公司还报告称,在 Terminal Bench 3.0 上得分为 28.3,高于前代的 4.6。在 Z.AI 的比较中,Anthropic Fable 5 达到 33.7,OpenAI 的 GPT-5.6 Sol 达到 34.6。这些结果使 GLM-5.3 更接近专有模型领跑者,但并未使其位列第一。
在 DeepSWE v1.1 上,Z.AI 报告的得分为 66.9,而 GLM-5.2 为 46.2。其列出的 Moonshot 的 Kimi K3 得分为 67.5,GPT-5.6 Sol 为 72.7。在 SWE-Marathon v1.1 上,据称 GLM-5.3 从 19.4 升至 42.5。
这些基准考察软件工程的不同方面,其得分无法合并为一个通用排名。结果还取决于智能体框架、工具访问权限、推理投入、token 预算、重试策略和任务配置。
智能体框架是模型周围负责管理工具、文件、命令和反馈的软件。即使底层权重保持不变,模型置于另一套框架中时也可能表现不同。
这就是为什么基准测试方法与醒目的得分同样重要。开发者需要知道,竞争模型是否获得了等效的工具、上下文限制、提示词和错误恢复机会。
独立基准正在努力缩小这一差距。CursorBench methodology 使用源自真实编辑器会话的、具有歧义的多文件任务。它同时追踪正确性、token 消耗、平均成本和智能体步骤数量。
这种评估很有价值,因为生产环境中的编程很少像一道自成一体的编程谜题。真实请求通常缺少重要上下文,涉及陌生代码仓库,并要求判断应修改哪些文件。
即使这些测试也有局限。随着模型开发者针对其进行优化,基准可能变得不再具有代表性。当新的智能体封装层改进规划能力或提供更好的代码仓库工具时,得分也可能发生变化。
GLM-5.3 的内部基准测试结果需要更加谨慎地看待。Z.AI 控制了任务分布、评估环境、对比配置和报告方式。这项 50% 的提升可能真实存在,但仍可能高估其他团队实际能获得的收益。
该模型的 token 数据也需要结合背景理解。更少的输出 token 可能意味着推理效率更高,但也可能反映出不同的篇幅偏好、工具行为或停止标准。公平的比较需要在一致的资源限制下衡量成功结果。
可靠性仍是另一个悬而未决的问题。Z.AI 此前承认,在高并发、长上下文的 GLM-5 工作负载下,曾出现罕见的异常输出。该公司表示,在一次调查中复现了每 10,000 次请求约三到五次异常结果。
报告的症状包括重复内容、乱码和异常字符。Z.AI 将该问题归因于长上下文、并发以及其推理基础设施之间难以处理的交互。
低错误率在大规模运行时依然可能产生影响。一个处理数百万次 agent 请求的服务可能遇到数千次失败,而只运行少量任务的开发者可能一次也不会遇到。因此,生产测试必须包含重复试验,而非一次成功的演示。
模型采购方应基于自己的代码库建立评估。实用任务包括修复已知 bug、升级依赖项、为遗留模块添加测试,以及审查刻意植入问题的补丁。团队应记录成功情况、回归、耗时、工具调用和人工修正。
他们还应在可搜索的系统中保存任务上下文和最终产物。本地的工程知识库可以帮助团队比较不同模型的运行结果,而不会在终端、问题追踪器和技术文档之间丢失决策记录。
这些证据揭示的信息会多于排行榜。与一个会自信地产生难以察觉的回归问题的模型相比,成功率较低但失败方式透明的模型或许更容易监督。
网络安全能力带来价值,也带来风险
GLM-5.3 的网络安全结果强化了其在编程方面的竞争力,但也增加了对受控访问和可复现安全评估的需求。
Z.AI 表示,网络安全能力在后训练阶段的出现速度快于预期。该公司重点关注更长的利用链:agent 必须识别弱点、制定可行路径,并在可执行环境中验证结果。
在 CyberGym 上,Z.AI 报告称 GLM-5.3 得分为 84.5,高于 GLM-5.2 的 77.2。在同一比较中,DeepSeek V4 Pro 得分为 83.3,GPT-5.6 Sol 为 83.6。
CyberGym 测试在开源软件中发现漏洞的能力。仅仅找到可疑的代码模式还不够。强劲表现要求模型能够判断该问题是否会导致真实的安全失效。
在 ExploitBench 上,Z.AI 报告的得分从 24.4 升至 54.4。Anthropic Fable 5 仍以 78.0 大幅领先。这一差距表明,不应将此次发布描述为对 Anthropic 的彻底击败。
Z.AI 还表示,GLM-5.3 在两小时内完成了 ExploitGym 的 105 项任务。该公司将此作为证据,证明模型能够从漏洞识别进一步推进到漏洞利用。
这些能力拥有正当的防御用途。安全团队可以利用 agent 检查大型代码库、复现已知漏洞、确定补丁优先级,并验证拟议修复是否封堵了受影响路径。
它们也显然具有双重用途风险。能够发现并利用缺陷的模型既可帮助防御者,也可帮助攻击者。结果取决于访问控制、部署环境、工具权限以及操作者的意图。
这一风险部分解释了 Z.AI 为何没有立即发布权重。该公司表示,计划在发布前再进行两周的安全评估和加固。
这一延迟使该公司的开放权重信息出现了矛盾。GLM-5.3 被宣传为开放模型,但研究人员在发布时无法检查或运行其权重。只有当文件、许可证、模型卡和安全文档发布后,这一承诺才可被检验。
Z.AI 还表示,其安全工作涵盖协调漏洞披露流程。其发布材料中流传的报告数据包括:在 269 个项目中发现 2,436 个问题,其中 53 个已公开,其余仍处于保密期。
这些数字均由公司自行报告,须谨慎处理。一个发现的问题可能是真正可利用的漏洞,也可能是重复项、影响较低的问题或误报。通过受影响项目和分配的漏洞记录公开发布,将提供更有力的证据。
网络安全方面的主张还高度依赖于测试框架。专业 agent 可能获得调试器、模糊测试器、编译器、网络工具或结构化反馈,而普通编程用户未必具备这些条件。在通用编辑器中运行的模型可能无法复现相同结果。
独立测试人员应使用受控、合法的环境。合适的目标包括故意存在漏洞的应用程序、历史开源漏洞,以及预期结果已知的已修复代码库。
他们的衡量不应止于发现漏洞。严肃的评估应考察模型是否识别出正确的代码路径、生成可复现的测试、解释根本原因、提出安全补丁,并避免无关指控。
误报尤其值得关注。若一个 agent 向安全团队大量发送质量低下的发现,浪费的时间可能比节省的更多。最佳模型并非只是报告最多潜在缺陷的模型。
安全评估人员还应测试模型是否遵守边界。拥有终端访问权限的编程 agent 可能泄露机密、修改无关文件,或执行嵌入在代码库中的不可信指令。
关于agent 提示注入的研究表明,当恶意指令出现在外部内容中时,使用工具的模型依然容易受到攻击。该问题适用于所有供应商,包括 Anthropic、Google、OpenAI 和 Z.AI。
因此,GLM-5.3 同时增加了机会与责任。如果其网络安全能力提升经受住测试,防御者将获得另一个强大的系统。与此同时,发布权重会削弱提供商在分发后限制滥用的能力。
开放权重是 Z.AI 的战略优势,也是其最大的不确定性
Z.AI 最有力的竞争论点并非 GLM-5.3 赢得每一项测试,而是开发者最终可能能够检查、调整并托管其权重。
Anthropic 领先的 Claude 模型仍属专有模型。OpenAI 的旗舰模型同样以托管服务的形式提供。Google 通过其产品和云平台分发 Gemini,同时保留对其最强模型权重的控制。
开放权重改变了买方的选择。组织可以研究模型、针对特定领域调整模型、通过选定的基础设施提供商进行部署,或将敏感提示保留在受控环境内。
不过,“开放权重”的范围比“开源”更窄。已发布的权重不一定包含训练数据、完整训练代码、评估框架,或复现模型所需的全部组件。
硬件要求构成另一项限制。即使采用量化或稀疏激活,一个总参数量超过 7,000 亿的模型仍需要大量内存和基础设施。大多数个人开发者将通过托管服务访问它,而非在本地运行完整部署。
大型企业和云服务提供商拥有更大的灵活性。他们可以在专用基础设施上部署模型、使用托管服务,或微调较小的衍生模型。这使开放权重战略与拥有明确治理和基础设施目标的组织最为相关。
发布时缺少权重,使 GLM-5.3 的这一优势尚未得到确认。Z.AI 已承诺发布,但最终许可证和相关产物将决定用户实际上能做什么。
限制性许可证可能限制商业采用。不完整的文档可能使部署更加困难。延迟发布则会削弱“开放性使此次发布区别于 Anthropic、Google 和 OpenAI”的说法。
还存在地缘政治限制。一些美国组织可能因采购规则、数据驻留担忧、制裁风险,或对未来监管的不确定性而拒绝中国模型。
即使权重在本地运行,这些担忧也不会消失。组织仍需要调查供应链、许可证、模型行为、更新流程和支持代码的来源。
反过来,本地部署可以降低部分数据传输风险。控制推理环境的公司无需将专有源代码发送至外部 API。这一区别可能对受监管行业或敏感研究尤为重要。
采用程度将像原始能力一样取决于信任。Anthropic、Google 和 OpenAI 拥有成熟的企业关系、安全计划、支持渠道和集成能力。Z.AI 必须说服买家,其运营成熟度与模型性能相匹配。
其此前的服务调查说明了这一挑战。编程 agent 会产生长时间、不规则的工作负载,难以保持稳定服务。模型在受控评估中可能表现出色,却会在需求压力下受到容量限制或不稳定延迟的影响。
近期 GLM 发布后的社区报告中,既有赞誉,也有关于配额、冷却时间、可用性和工具行为不一致的投诉。轶事无法确立总体失败率,但能指出买家应测试的领域。
Z.AI 的战略即使不取代美国实验室也能成功。它可以成为可信的第二供应商、高吞吐量任务的路由选择,或供优先重视控制权的组织自托管的模型。
仅这一结果就会影响市场。一个可行的替代方案会改变合同谈判、架构决策,以及对哪些公司能够提供先进编程智能的假设。
三个信号将决定 GLM-5.3 是否重塑编程市场
未来一个月将比发布日的排行榜更重要,因为 Z.AI 必须将主张转化为可复现的软件、可靠的访问能力和持续的采用。
第一个信号是承诺的权重发布。研究人员应关注 Z.AI 是否按计划发布文件、随附何种许可证,以及模型卡是否说明预期用途和已知限制。
完整发布将强化 Z.AI 最主要的战略论点。它将使独立团队能够复现基准测试、检验安全主张,并评估部署要求。延期或限制性许可证将削弱其与专有竞争对手之间的对比。
第二个信号是独立编程性能。评估人员应在匹配的 token 预算和等效工具条件下,对代码库规模的任务运行 GLM-5.3。
最有参考价值的结果将比较完成率、回归、延迟和人工修正时间。如果私有工程评估显示出不稳定行为,那么在公开基准上的成功将不那么重要。
独立网络安全测试值得单独审查。研究人员应在隔离环境中测试已知存在漏洞的程序,并公布他人可以复现的方法。经确认的漏洞披露将比内部发现总数提供更有力的证据。
第三个信号是 Anthropic、Google 和 OpenAI 的回应。新的编程产品发布、修订后的使用政策、更好的路由选择或更强的开放模型投入,都将表明 Z.AI 已改变了竞争重点。
现有巨头依然保有重大优势。Anthropic 在编程产品上势头强劲,Google 拥有分发渠道和多模态基础设施,OpenAI 则拥有庞大的开发者平台。它们也具备快速应对的资源。
不过,Z.AI 的发布仍改变了举证责任。成熟实验室不能再假定,专有模型的规模优势本身就足以维持编程智能体领域的明显领先。它们必须证明,其高端模型能够带来更好的结果、更低的监督成本,或更强的治理能力。
开发者不应仅凭厂商图表来选定赢家。更合理的做法是选择一组具有代表性的任务,让每个模型走过同一套工作流。其中应包括日常维护、模糊缺陷、长周期重构、安全检查,以及专门用于暴露故障恢复能力的任务。
应记录模型在第一次出错后如何表现。编程智能体很少能毫无瑕疵地完成每一项困难任务。它们发现失败、修订计划并维护代码仓库完整性的能力,往往比首次生成的补丁更重要。
GLM-5.3 最重要的主张,归根结底关乎进步的来源。如果针对性的后训练能够在不改变基础模型的情况下带来显著、可重复的提升,其他实验室将会在可执行环境和长时程轨迹上投入更多资源。
这将压缩整个市场的开发周期。同时,相较于单纯的原始参数规模,智能体设计、评估质量和数据采集的重要性也会进一步上升。
对于知识工作者和软件团队而言,实际问题已不再是哪一家供应商拥有最聪明的聊天机器人,而是哪种模型组合能够在可接受的成本、控制和安全约束下,可靠地完成真实工作。
从最宏观的层面看,Anthropic、Google 和 OpenAI 的格局依然稳固,但已不再令人从容。GLM-5.3 围绕编程、网络安全和开放获取提出了一场聚焦测试。现在,Z.AI 必须发布承诺的权重,经受独立评估,并证明其基准测试优势能够在真实代码仓库中持续存在。


