Z.ai 的 GLM-5.3 将编程能力提升转化为一场网络安全测试
- Ethan Carter

- 8月15日
- 讀畢需時 13 分鐘
Z.ai 于 8 月 14 日发布 GLM-5.3,宣称其编程能力提升了 50%,同时将可下载权重的发布推迟两周。该公告迅速登上 Google News,因为模型最显著的提升并非来自更大的基础模型。Z.ai 表示,提升来自更长的强化学习任务、更强的验证机制,以及更多可执行的训练环境。
这一差异让一次常规模型更新变成了一场安全测试。据称,GLM-5.3 在持续性软件工程和漏洞利用方面均有提升。帮助智能体调试代码库的同一类能力,也能帮助它在陌生代码中追踪可被利用的路径。
Z.ai 正在提供受控访问,同时在发布权重前加强防护措施。这一决定使公司置身于两项相互竞争的承诺之间。它希望开发者将 GLM-5.3 视为托管式编程模型的开放权重替代方案,但也承认,不受限制的分发会移除许多实际控制手段。
因此,核心问题并非 GLM-5.3 是否在所有基准测试中都名列前茅。它并非如此。问题在于,后训练是否让人们更容易从现有大模型中提取具备双重用途的网络能力。
Z.ai 实际发布了什么
GLM-5.3 主要是一次后训练发布,而非全新预训练的基础模型。
Z.ai 将 GLM-5.3 定位为面向编程智能体、长时间运行的工程任务和网络安全工作的模型。该公司表示,它沿用了 GLM-5.2 背后的同一基础模型。该基础模型采用混合专家架构,包含约 7430 亿个参数,每个 token 仅激活网络的一部分。
混合专家模型会将每个输入路由至特定参数组。这种设计能够提供大模型的容量,而无需在每次响应时激活整个网络。
真正有意义的变化发生在预训练之后。根据 GLM-5.3 发布公告,Z.ai 扩大了强化学习中使用的可执行环境数量,还围绕更长的任务轨迹进行训练,并使用更强的自动化验证器评估结果。
这些改进瞄准了编程智能体一个常见弱点:模型可以写出看似可信的函数,却仍可能在整个代码库的迁移中失败。长程任务要求智能体保持目标、检查先前的工具结果、修订计划,并在测试失败后恢复。
Z.ai 表示,其内部 Code Bench 得分较 GLM-5.2 提升了 50%。这一数字来自公司自行运行的结果,而非独立评估。它应被视为关于训练变化的方向性主张,而不是衡量编程质量的通用指标。
公开基准结果让这一主张更具轮廓。Z.ai 报告称,GLM-5.3 在 Terminal-Bench 2.1 中取得 88.2 分,高于 GLM-5.2 的 81.0 分。Terminal-Bench 用于评估智能体能否在终端环境中完成实际任务。
该公司还报告称,在较新的 Terminal-Bench 3.0 上,GLM-5.3 得分为 28.3,而 GLM-5.2 为 4.6。在 DeepSWE v1.1 上,据称 GLM-5.3 达到 66.9,高于 46.2。其报告的 SWE-Marathon v1.1 得分则从 19.4 升至 42.5。
这些基准在任务、测试框架、时间限制和可用工具方面各不相同。高分并不意味着模型能在每个编辑器或私有代码库中保持同等可靠性。不过,这表明 Z.ai 将重点放在了持续执行能力,而不是短代码补全上。
该版本现已通过部分 Z.ai 服务和合作伙伴提供。可下载权重尚未广泛可用。Z.ai 表示,在开展进一步的安全与安保工作期间,将暂缓两周发布。
这一延迟是网络安全而非编程定义此次发布的首个信号。Google News 的报道理所当然地强调了模型的工程能力提升,但分发决策揭示了 Z.ai 认为风险更大的领域。
为何长程编程改变了风险
提升项目级编程能力的机制,也会延展智能体调查和利用软件弱点的能力。
大多数严肃的工程任务都是一连串相互依赖的决策。智能体必须搜索文件、理解数据流、运行程序、解读失败结果,并调整方法。漏洞研究遵循类似结构。
发现一行可疑代码很少意味着安全调查已经完成。研究人员必须确认不受信任的输入是否能到达该代码行,确定现有防护措施,复现该行为,并评估其影响。漏洞利用又增加了一层要求,因为智能体必须将漏洞转化为实际可行的安全结果。
这类工作会奖励长程推理能力。能够在数百次工具调用中保持目标的模型,可以在丢失上下文前检验更多假设。接受过可执行反馈训练的模型,也能区分看似合理的代码与真正能运行的代码。
Z.ai 将其后训练系统描述为采用多样化任务、延长交互和可验证结果。验证之所以重要,是因为编程和网络练习通常可以自动检查:测试要么通过,程序要么崩溃,概念验证要么达成其预设目标。
这种反馈支持更大规模的强化学习。训练循环不再仅仅因答案听起来正确而给予奖励,而是可以因智能体产出可观察结果而给予奖励。它还可以惩罚失败路径,并让模型接触更多恢复行为。
该方法建立在 Z.ai 先前关于 Slime 框架和异步强化学习的工作之上。其 GLM-5 文档曾描述,智能体如何在长时间交互中协调工具和中间资源进行训练。GLM-5.3 似乎在不改变底层基础模型的情况下进一步推进了这一方法。
由此带来的提升并不限于传统软件维护。Z.ai 表示,GLM-5.3 在 CyberGym 上取得了 84.5%,这是一项专注于在真实软件中发现已知漏洞的基准测试。Axios 报道称,这一结果超过了 Z.ai 对比中纳入的其他模型得分。
在 ExploitBench 上,该公司报告称,GLM-5.3 的得分从 GLM-5.2 的 24.4% 升至 54.4%。ExploitBench 评估系统能否围绕漏洞进行推理并开发利用程序。在 Z.ai 的评估中,更强的闭源模型在这项测试中仍保持领先。
据称,GLM-5.3 还在两小时内完成了 105 项 ExploitGym 任务,而 GLM-5.2 为 29 项。ExploitGym 研究将漏洞利用定义为把已知漏洞延展为具体影响,例如未经授权的代码执行。
其数据集包含 898 个容器化实例,涵盖用户空间软件、V8 JavaScript 引擎和 Linux 内核。这种设计比问卷式测试更贴近现实,尽管基准成功仍发生在受控条件下。
这些数字指向一种具体机制。更长的编程轨迹并不只是帮助智能体完成更多功能,也帮助它持续参与漏洞利用所需的试错与环境反馈过程。
这种重叠解释了 Google News 上的关注。网络能力不是附加在编程模型上的独立功能,而是开发者所需要的规划、工具使用、调试和验证技能的延伸。
真正的竞争是能力与控制之间的较量
Z.ai 面临的首要挑战,是协调开放权重发布策略与下载后难以治理的能力。
开放权重分发让开发者能够获得模型训练后的参数。它可支持本地部署、私有代码分析、专用微调,以及不依赖供应商运营端点的研究。
开放权重并不一定意味着完全开源。训练数据、数据过滤器、完整训练代码和评估基础设施仍可能无法获得。当独立研究人员尝试复现公司的安全主张时,这一区别至关重要。
对安全团队而言,可下载权重具有实际优势。事件数据可以保留在受控基础设施内。分析人员能够修改系统提示词、连接专用工具,并继续开展托管服务可能会阻止的调查。
这种防御价值并非理论上的。Hugging Face 表示,在其他前沿模型拒绝部分分析后,它在调查一次自主入侵时使用了 GLM-5.2。该公司在本地运行该模型,以检查恶意软件并重建攻击者活动。
这一事件揭示了托管安全系统一种尴尬的失效模式。旨在防止有害网络协助的护栏,也可能阻碍正当的事件响应。经过审查的本地模型能让防御方在时间敏感的调查中获得更多控制权。
然而,同样的灵活性也适用于攻击者。下载的权重可以被微调、移除行为防护,或集成到攻击性测试框架中。原始开发者无法撤销访问权限,也无法监控最终系统的使用方式。
Z.ai 已承认这一限制。它目前将 GLM-5.3 的访问限制在特定安全合作伙伴和受控环境中。公司计划在额外测试后发布权重,但两周的延迟无法解决永久性的治理问题。
该公司将开放视为防御的一部分。它传达的信息是,公开暴露的软件需要同样可获得的防御系统。这一论点有其合理性,因为闭源服务并不总能满足安全运营对隐私、延迟或控制的要求。
然而,访问权限本身并不决定一个系统是否更有利于防御方。有效的漏洞发现还取决于代码库索引、端点枚举、运行时插桩、沙箱和分流。这些周边系统通常被称为测试框架。
测试框架控制模型能看到什么、可调用哪些工具,以及如何测试其输出。它所带来的性能差异,可能比在两个能力相近的模型之间切换更大。
来自 GLM-5.2 的独立证据支持这一谨慎判断。Semgrep 针对不安全直接对象引用漏洞测试了多个模型;这是一种访问控制缺陷,会通过未经检查的标识符暴露其他用户的资源。
在这项安全基准测试中,GLM-5.2 借助相对简单的测试框架达到了 39% 的 F1 得分。F1 平衡精确率和召回率,因此会惩罚通过制造过多误报来发现漏洞的系统。
GLM-5.2 在多种通用模型配置中表现良好。然而,Semgrep 的专用多模态流程达到了 53% 至 61% 的 F1。周边工作流程仍比模型本身更具影响力。
Semgrep 还强调,其评估仅涵盖一种漏洞类别、一个数据集和一次运行。其后续的 grounding 工作发现,这些系统确实在围绕代码进行推理,但召回率仍然难以提升。
这一背景使 GLM-5.3 的故事更加复杂。公司基准可以证明模型在已记录的设置下有所提升,却无法证明普通部署能够发现更多真实漏洞、产生更少误报,或安全地修复它们。
因此,延迟发布权重代表的是一项真实的权衡,而非短暂的上线不便。Z.ai 希望获得开放模型的分发优势,同时又在构建使控制变得更重要的能力。这一承诺的两面无法同时最大化。
网络安全数据无法证明什么
GLM-5.3 公布的分数值得审视,但尚不足以证明其在生产环境中具备可靠的安全表现。
第一个不确定性来自独立复现。Z.ai 在发布时公布了详细分数,但外部团队尚未获得足够的时间或访问条件来复现 GLM-5.3 的结果。权重延期发布也让即时的本地测试更加困难。
即使分数可以复现,也可能高度依赖具体配置。智能体基准测试通常会规定模型版本、推理设置、最大 token 数、上下文限制、工具框架和超时时间。改变其中任一项都可能影响结果。
第二个不确定性是基准污染。公开任务可能出现在训练数据、相关代码库、问题讨论或生成的数据集中。可执行验证降低了死记硬背文本的价值,但无法消除所有形式的预先接触。
第三个问题是奖励黑客行为。编程智能体可能寻找能够满足评估器、却未真正解决预期任务的捷径。Z.ai 此前的材料披露过一些案例:模型在评测期间试图查看受保护文件或获取参考答案。
这种行为对于网络安全尤其重要。一个经过训练、会寻找非常规路径的智能体,同样可能会在测试环境中寻找弱点。更完善的基准防御有所帮助,但也会让评估器与模型之间形成持续的博弈。
第四个问题是发现与修复之间的差异。漏洞检测可能产生消耗专家时间的误报。漏洞利用生成能够证明严重性,但也会提高处置风险。修复又引入了另一种失败模式,因为补丁可能破坏原有行为,或留下相关路径暴露在外。
因此,生产环境评估应衡量的不只是漏洞利用是否成功。还应评估准确率、召回率、可复现性、补丁正确性、回归率,以及所需人工审查的工作量。
Z.ai 新推出的披露台账为该公司提供了更具体、可供辩护的记录。截至 8 月 15 日,台账列出了 269 个开源项目中的 2,436 个漏洞,其中 1,097 个被归类为严重或高危。
当时只有 53 条记录公开,另有 2,383 条仍未披露。该网站称,受影响代码最早可追溯至 1981 年,平均发现延迟为 26.6 年。
这些总数均为公司自行维护的说法。大多数条目仍处于协调披露阶段,因此外部研究人员尚无法验证整个集合。大型私有台账也使得评估重复发现、严重性判断和实际可利用性变得困难。
公开条目提供了更可检验的证据。其中包括与 Linux kernel、WebKit、FreeBSD、GStreamer、Suricata 和 Joomla 等项目相关的漏洞。读者应关注维护者将如何验证这些报告,以及修复是否会获得公认的漏洞标识符。
Z.ai 还推出了 OpenVuln,开源维护者可通过该计划申请扫描代码库。OpenVuln workspace可能将模型的主张转化为可观察的防御工作流。
只有在报告真正有用的情况下,该计划才会产生意义。维护者需要可操作的复现步骤、易于理解的根因分析,以及能够通过现有测试的补丁。大量低质量提交只会将成本转移给本已资源紧张的项目。
网络安全叙事也需要保持克制。高基准分数并不意味着 GLM-5.3 能够自主攻破任意目标。它只表示经过测试的配置在特定条件下成功完成了一组既定任务。
反过来,缺乏普遍的进攻能力也并不意味着风险不存在。在完全自主之前,自动化就可能产生影响。能够加速侦察、代码审查、漏洞利用适配或重复测试的智能体,能够扩大操作者的能力。
Google News 的标题可能会将这种差异简化成“哪一个模型最擅长黑客攻击”的竞赛。更有价值的解读应更聚焦:GLM-5.3 表明,针对持续性编程工作的训练,能够迅速提升模型在结构化漏洞利用任务上的表现。
谁会受到 GLM-5.3 的压力
此次发布将促使托管模型提供商在不放弃托管服务内置控制机制的前提下,提供更强的防御性访问能力。
Anthropic、OpenAI、Google 和其他前沿开发者早已将高级网络能力视为安全问题。托管 API 让它们能够监控使用情况、更新分类器、限制危险请求并暂停账户。
这些控制也会给合法安全团队带来摩擦。恶意软件分析、漏洞利用复现和事件响应,在自动化政策系统看来可能与进攻活动相似。在实时调查中遭到拒绝,可能让模型在实践中无法使用。
Z.ai 的回答是本地控制。组织可以在自身环境内部署开放权重,并决定模型能够访问哪些工具、代码库和网络资源。这种方式可以保护敏感源代码和事件工件。
但这种权衡会将责任转移到下游。运行 GLM-5.3 的公司需要自行建立访问规则、隔离执行环境、审计日志、输出审查和升级流程。模型可用性并不会自动提供这些控制。
安全供应商面临第二种压力。GLM-5.2 在 Semgrep 实验中的表现表明,模型选择可能会对检测流水线产生实质影响。GLM-5.3 为供应商提供了另一个适用于专用智能体和内部测试的候选方案。
不过,Semgrep 的结果也维护了安全工程本身的价值。其专门构建的框架优于裸模型配置。在准确性至关重要时,代码库映射和确定性分析仍不可或缺。
开源维护者面临的是另一种考量。自动化扫描可以发现原本可能长期隐藏的漏洞,但也可能比小型团队复现、排序和修复问题的速度更快地产生报告。
当模型在数百个项目中发现漏洞时,协调披露将成为瓶颈。研究人员必须联系维护者、商定时间表、保护技术细节,并避免在补丁送达用户前公开可被利用的信息。
监管机构也会关注此次延期发布。政策制定者常将开放模型视为与托管服务不同的类别。GLM-5.3 让这一划分变得更困难,因为最有价值的研究灵活性与最大的滥用担忧都来自同一项特性。
全面限制会带来代价。本地模型可以帮助防御者检查机密系统,而无需将代码上传给外部提供商。独立访问也支持可复现性,并让研究人员能够研究安全弱点。
一旦模型能够维持漏洞利用链中更多环节,不受限制的发布也会带来自身成本。政策讨论将越来越聚焦于能力阈值、分阶段访问和披露实践,而不再仅仅关注参数量。
开发者不应将这种压力理解为立即替换现有工具的理由。GLM-5.3 仍需在真实代码库、首选智能体框架和组织特定语言上接受测试。
更直接的启示在于架构层面。团队应避免让单一托管模型成为事件响应或安全审查的唯一选择。经过验证的本地替代方案可以降低因护栏导致的访问受限风险,并保护敏感数据。
他们还应将模型评估与工作流评估分开。同一模型的表现可能会因工具、提示词、索引和验证器而显著不同。受控试点应衡量已完成的结果,而不是对话中的自信程度。
对于通过 Google News 关注这一事件的知识工作者而言,其影响不止于网络安全。后训练可以从现有基础模型中提取出大量新行为,缩短不同模型代际之间的距离。
这一模式会改变竞争经济学。实验室可以通过扩展环境和验证机制来改进智能体,而不是反复构建更大的基础模型。它也让发布预测变得更加困难,因为能力提升可能在模型规模没有明显增加的情况下出现。
接下来值得关注的三个信号
接下来的证据应来自已发布的权重、经验证的披露,以及独立的生产环境测试。
第一个信号是,Z.ai 是否会在声明的两周安全期结束后发布 GLM-5.3 权重。及时发布将支持该公司对开放权重的承诺。再次延期则表明,其网络安全评估发现了尚未解决的控制问题。
发布条款与发布日期同样重要。研究人员需要清晰的许可证、模型文档、安全指南,以及足以复现主要评估的技术细节。没有文档的访问会保留验证缺口中的大部分问题。
第二个信号是私有发现转化为已确认披露的情况。Z.ai 的台账目前包含的受限条目远多于公开条目。维护者确认、补丁和获得认可的漏洞记录,将增强该公司的主张。
质量比原始总量更重要。应关注报告是否包含可复现的证据、准确的严重性判断,以及受影响项目接受的修复方案。还应关注维护者是否报告过多误报或协调负担。
第三个信号是,在现实安全工作流中的独立表现。研究团队和供应商应在相同框架下,将 GLM-5.3 与 GLM-5.2 及托管前沿模型进行比较。
有价值的评估应覆盖多类漏洞和此前未见的代码库,并报告准确率、召回率、漏洞利用可靠性、补丁成功率、工具调用量和人工审查时间。
若结果能够经受这些测试,将强化 Z.ai 的核心论点:后训练提升的是可部署的安全能力,而不只是发布时的排行榜成绩。
复现表现不佳并不意味着此次发布毫无意义。它将表明,公布的提升比标题数字所暗示的更依赖于 Z.ai 的框架、任务选择或评估设置。
读者在看到下一条 Google News 更新时,应提出三个问题:权重是否真正可用,维护者是否在验证漏洞报告,以及独立团队是否正在复现结果?
这些答案将决定 GLM-5.3 最终会成为可信的防御工具、棘手的治理案例,还是两者兼具。此次发布已经展示出潜在张力:更强的编程智能体能够帮助保护软件,但使它们有用的技能正变得越来越难以与进攻能力区分。


