GLM-5.3 后训练带来了意料之外的漏洞利用问题
- Martin Chen

- 1天前
- 讀畢需時 15 分鐘
Z.ai 凭借一项引人注目的说法,推动 GLM-5.3 登上 Google News:后训练意外地让其编程模型学会构建日益完整的漏洞利用链。
该公司称,一项相关安全行动在 269 个开源项目中发现了 2,436 个潜在漏洞。据报道,其中 1,097 项被归类为严重漏洞。这些数字仍由公司自行报告,大多数底层案例尚未公开。
比标题更具影响力的细节在于,Z.ai 称 GLM-5.3 与 GLM-5.2 使用相同的基础模型。其能力提升来自后训练,即通过针对性任务、反馈和可执行环境来塑造预训练模型。
这带来了核心冲突。让编程智能体更擅长调试的训练,同样可能提升其漏洞发现与利用能力。Z.ai 并未将完整漏洞利用构建描述为其最初目标。
因此,GLM-5.3 的意义不止于又一次基准测试发布。它提供了一个案例,说明实用的编程能力如何能在基础模型不变的情况下,发展为具有双重用途的网络能力。
该模型在高难度漏洞利用测试中仍落后于领先的闭源系统。不过,这一差距并不能消除担忧。开放权重分发会让能力控制在发布后更难执行。
GLM-5.3 为何登上 Google News
标题的重点并不只是 Z.ai 发布了一款更强的编程模型。真正重要的变化在于,其网络安全能力已远远超出漏洞检测。
Z.ai 于 2026 年 8 月 14 日发布 GLM-5.3,作为面向编程的 GLM-5.2 后继版本。该公司称其为最强的开源权重编程模型,不过权重在发布时并未立即提供。
据 Z.ai 称,权重原定在完成两周安全评估和加固后发布。这一延迟承认了一种在普通编程模型发布中鲜少显现的紧张关系。
该公司称,GLM-5.3 在其内部 Z.ai Code Bench 上的表现较 GLM-5.2 提升了 50%。由于该测试属于 Z.ai,独立比较应将这一数字视为厂商说法。
公开基准结果提供了更多背景。Z.ai 报告称,GLM-5.3 在 Terminal-Bench 3.0 上获得 28.3 分,而 GLM-5.2 为 4.6 分。Terminal-Bench 评估智能体在命令行环境中执行实际任务的能力。
据报道,该模型在 DeepSWE v1.1 上的成绩也从 46.2 提升至 66.9。其 SWE-Marathon v1.1 得分则从 19.4 升至 42.5。
这些编程结果解释了该模型为何受到关注,却无法解释 GLM-5.3 为何广泛出现在 Google News 和安全讨论中。
这种关注来自 Z.ai 对其涌现式网络能力的描述。在此语境下,“涌现”并不意味着这些能力在没有任何相关训练数据的情况下出现。Z.ai 有意加入了面向漏洞的数据和可执行环境。
令人意外的是提升的程度与方向。该公司原本预期模型会更擅长推理单个缺陷,但称该模型反而显著增强了将多个步骤组合成长漏洞利用工作流的能力。
漏洞发现系统识别行为不安全的代码。漏洞利用系统则更进一步,将这种弱点转化为可复现的路径,以获得非预期的控制权或数据访问权限。
这种区别至关重要。发现崩溃可以帮助维护者修复软件;而构建从内存损坏到未授权执行的链条,则更接近实际攻击能力。
Z.ai 报告称,GLM-5.3 在 CyberGym 上获得 84.5 分。在该公司的评估设置下,GLM-5.2 的结果据称为 77.2 分。
独立的 CyberGym framework 包含来自 188 个软件项目的 1,507 个历史漏洞。智能体会获得存在漏洞的代码,并必须生成能够复现目标缺陷的概念验证输入。
CyberGym 的维护者警告称,排行榜结果取决于智能体配置、试验次数和随机运行情况。较小的分数差异并不总是代表有意义的能力差距。
GLM-5.3 的报告分数仍显示,Z.ai 正在针对严肃的安全工作负载进行测试。这并非一组简单的编程谜题或选择题。
此次发布之所以成为新闻,是因为一项训练计划产生了两种结果:它带来了更强的编程助手,同时也为开发者制造了更棘手的安全问题。
后训练改变了模型网络能力的上限
GLM-5.3 表明,基础模型的规模可能掩盖某些能力,而针对性后训练能够让这些能力变得可获取、有组织且稳定。
预训练为语言模型提供从大型数据集中获得的广泛统计知识。后训练则通过示例、反馈、工具和重复任务执行,教会模型如何应用这些知识。
Z.ai 称 GLM-5.3 与 GLM-5.2 共享基础模型。如果这一说法准确,那么网络能力的提升并不需要进行又一次昂贵的预训练周期。
相反,该公司扩展了可执行训练环境,并让模型接触更长的编程任务。可执行环境让智能体能够运行命令、观察失败、修改代码,并根据结果继续工作。
这种反馈循环改变了编程任务的性质。模型不必在一次回复中生成正确答案;它可以调查代码仓库、形成假设、进行测试,并修正方法。
这些行为类似于普通的软件调试,也类似于漏洞研究。
追踪内存错误的开发者与构建漏洞利用的攻击者,可能从同一份证据开始。两者都会检查代码路径、观察崩溃,并推理内存状态。
差异会在之后出现。防御性工作流会在确认并修复缺陷后停止;进攻性工作流则会寻找能将缺陷转化为更大控制力的原语。
漏洞利用原语是可复用的技术能力,例如读取任意内存或控制指令指针。组合多个原语即可形成漏洞利用链。
Z.ai 称,GLM-5.3 在这条链的后期环节提升最为明显。其报告的 ExploitBench 得分从 GLM-5.2 的 24.4 上升至 54.4。
ExploitBench methodology 衡量多个漏洞利用阶段中的进展。其 V8 基准考察的能力范围从基本代码覆盖率到任意代码执行。
这种分级衡量很重要,因为简单的通过或失败分数会掩盖关键差异。触发崩溃的影响远小于绕过防护并控制程序执行。
Z.ai 还报告称,GLM-5.3 在两小时评估预算内成功完成 105 项 ExploitGym 任务。在可比设置下,GLM-5.2 据称完成了 29 项。
在六小时预算下,GLM-5.3 据称完成了 130 项任务,而 GLM-5.2 为 39 项。更长的预算用于测试智能体能否在困难的多阶段工作中持续进行有效推理。
更广泛的 ExploitGym benchmark 包含 869 项真实世界漏洞任务,涵盖用户空间软件、Google 的 V8 JavaScript 引擎和 Linux 内核。
每项任务都提供存在漏洞的代码、构建说明,以及一个已经能够触发相关缺陷的输入。智能体必须将这一起点转化为未授权代码执行。
该基准背后的研究人员将这种能力描述为天生具有双重用途。自动化漏洞利用可以帮助防御者验证严重程度,但也可能降低进攻性工作的专业门槛。
他们的结果也揭示了重要限制。包括地址空间随机化和浏览器沙箱在内的标准缓解措施,会显著降低成功率。
在一个有记录的 V8 案例中,智能体在 71 分钟内构建了一条多步骤链。该链包括内存泄露、伪对象构造和控制流重定向。
不过,这条特定链依赖于被禁用的保护措施。当研究人员恢复地址空间随机化和 V8 沙箱后,该漏洞利用便不再有效。
这些背景信息避免了夸大的结论。GLM-5.3 并非一个能够自动攻破具备完整防护的生产目标的系统。
其报告的轨迹仍然重要,因为能力在漏洞利用阶梯上取得了更高层级的提升。后训练做的不只是帮助模型识别可疑代码模式。
这一教训不仅适用于 Z.ai。开发者不能假定,熟悉的基础模型在接受特定任务后训练后仍会保持稳定的风险状况。
训练环境同样值得审视。奖励智能体的坚持性、工具使用和成功执行,可能强化可在防御与进攻场景之间迁移的行为。
这种迁移很难通过一条简单指令消除。能够诊断细微内存损坏的智能体,已经具备漏洞利用所需的若干组成部分。
因此,安全问题需要前移。模型开发者必须在分发最终权重之前,评估训练课程解锁了哪些能力。
对“1,097 个严重漏洞”说法需要谨慎解读
Z.ai 的漏洞总数表明其进行了大量工作,但这并不等同于 1,097 个经过独立确认、可立即利用的生产环境漏洞。
根据该公司的披露材料及发布前后的报道,其安全工作在 269 个开源项目中产生了 2,436 项发现。Z.ai 据称将其中 1,097 项评为严重级别。
这些数字推动了 Google News 报道的大部分内容,也最需要谨慎看待。
“发现”是测试期间产生的疑似安全问题。只有在复现、去重、根因分析,以及针对最新受影响版本审查后,它才会成为已确认漏洞。
严重程度带来了另一项复杂性。严重标签通常取决于可利用性、受影响配置、权限、用户交互和潜在影响。
自动化系统可能高估这些因素。多份生成的报告也可能最终追溯到同一个根因。
Z.ai 尚未公开足够证据,供外部研究人员验证每一个报告案例。据报道,大多数发现仍处于协调披露流程或禁运期内。
协调漏洞披露让维护者有时间在技术细节公开前调查并修复缺陷。这种做法可以减少伤害,但也会延后独立验证。
因此,未立即公开细节并不能证明这些发现无效。这意味着读者应将该行动报告的规模,与其已确认的安全影响区分开来。
随着时间推移,公开披露数量将更具参考价值。届时,研究人员可将 Z.ai 的原始分类与维护者决定、分配的标识符、补丁和最终严重性评级进行比较。
误报是另一项关键指标。一个报告数千个推测性问题的系统,可能制造的工作量超过其节省的工作量。
安全团队必须复现每一份可信报告,并确定问题是否会在真实部署中存在。他们还必须区分重复症状与不同漏洞。
最有价值的模型应在不压垮维护者的前提下增加已确认的发现数量。原始发现量无法证明这种平衡。
CyberGym 自身的研究说明了验证为何重要。其智能体曾针对已修复或当前版本的软件生成数百个崩溃输入。
人工检查将这些输出缩减为规模更小的不完整补丁和此前未知漏洞集合。去重和专家审查改变了对原始结果的解读。
该框架在其更广泛的研究中报告了 34 个零日漏洞和 18 个历史遗留的不完整补丁。这些结果是在验证之后得出的,并非由每一次生成的崩溃直接换算而来。
同样,Z.ai 的 1,097 这一数字应被视为公司自行报告的分类结果。它不应被表述为可武器化零日漏洞的既定数量。
即使是已确认的严重漏洞,也不能自动证明 GLM-5.3 在没有人工支持的情况下发现了它们。评测框架、提示词、工具、重试次数和审查流程都会影响结果。
腾讯玄武实验室使用较早的 GLM 模型展示了这种系统效应。其专用 Atuin agent 据称在 CyberGym 上优于更通用的 GLM-5.1 配置。
该实验室将很大一部分提升归因于围绕代码分析、目标建模、漏洞利用构造、验证和审查进行的编排。模型能力只是其中一个组成部分。
这一观察对 GLM-5.3 同样适用。一套经过精心设计的防御系统,或许能比标准编程界面挖掘出更有价值的发现。
攻击者也可以围绕相同权重构建能力更强的支架。开放分发让用户能够修改提示词、工具、记忆和执行策略,超出原始提供方的控制范围。
因此,企业安全团队应要求提供基准分数以外的证据。有价值的文档包括可复现的评估、误报率、缓解设置和人工审查要求。
他们还应保留调查上下文。一个可搜索的技术知识库可以将模型发现与补丁、过往事件和维护者决策关联起来。
实际标准很直接:统计已验证的根本原因、被接受的报告、已完成的修复和受到保护的用户。
在这些数字可得之前,1,097 这一数字是一个重要信号。它并非对现实世界危害或防御价值的最终衡量。
开放权重将能力转化为治理考验
核心竞争并非 Z.ai 与另一家模型提供商之间的较量,而是有用的防御访问与发布后失去控制之间的取舍。
封闭模型提供商可以通过账户审查、监控、速率限制和专门计划来限制对高级网络能力的访问。这些控制措施仍不完善,但提供商可以集中修订它们。
开放权重分发改变了这一方程。用户可以在私有基础设施上运行模型,移除界面限制,并将其连接到自定义工具。
他们还可以进一步对其进行微调。一旦权重开始流通,原始开发者就无法可靠地召回每一个副本,也无法实施一项全球统一的安全政策。
这种永久性提高了 Z.ai 计划发布的风险。一段两周的加固期可以改善拒答行为并记录风险,但无法解决所有下游用途。
拒答训练对于双重用途请求尤为脆弱。同一项技术任务既可以支持补丁、渗透测试、学术研究,也可以支持未经授权的漏洞利用。
上下文并不总能揭示意图。在合法和恶意工作流中,模型都可能收到完全相同的代码和调试指令。
过于严格的限制可能阻碍防御者。薄弱的限制可能让漏洞利用变得更容易。没有单一的输出过滤器能够清晰地区分这些情况。
Z.ai 决定延后发布权重,表明该公司认识到存在实质性的安全问题。这一延迟的价值取决于评估和加固过程实际改变了什么。
重要措施包括针对现代缓解机制进行测试、评估新型目标,以及衡量安全措施能否经受常见修改。该公司还应记录其发布条件。
基准透明度很重要,因为标题分数压缩了许多选择。时间预算、工具访问、agent 支架、token 限制和试验次数都会改变结果。
CyberGym 明确警告,提交的运行具有随机性。一次尝试成功即可视为某个实例被解决,因此增加试验次数可能提高报告的性能。
ExploitGym 同样显示,更多时间有助于最强系统。据报道,Claude Mythos Preview 在两小时内的成功次数从 127 次升至六小时内的 204 次。
因此,比较应使用等效的预算和环境。否则,模型的提升可能部分反映了更好的评测框架或更多重试机会。
当相关声明暗示现实中的漏洞利用时,防御措施也必须保持启用状态。在禁用缓解机制的情况下获得的结果回答了一个研究问题,却没有回答生产安全问题。
这一差异在 ExploitGym 记录的 V8 利用链中清晰可见。该 agent 展现了复杂的推理能力,但恢复后的防御措施阻止了那次特定攻击。
开放权重开发者还面临额外的披露问题。发布详细的模型轨迹可以帮助研究人员理解能力,但这些轨迹可能暴露可迁移的漏洞利用策略。
完全隐瞒细节会阻碍有意义的审查。公布一切则可能增加操作风险。
合理的中间路径包括向可信研究人员开放访问、发布汇总评估结果,以及延迟技术披露。维护者应在更广泛公众之前获得可操作的细节。
竞争环境让克制变得更加困难。编程基准会影响开发者的关注、分发合作关系和模型采用。
网络安全分数如今又创造了一个营销维度。提供商可以将其作为模型帮助防御者检查大型代码库的证据。
这种防御场景是真实存在的。开源维护者往往没有足够的专家来审计每一项变更,或调查每一次可疑崩溃。
进攻场景同样真实。持续运行的 agent 可以测试大量假设、持续运作,并在相关目标之间复用成功技术。
Microsoft 将类似能力描述为加速防御性安全的机会。其AI 安全研究强调扫描、验证和人工引导的修复。
决定性因素将是部署优势。当模型比攻击者更早触达维护者,并且生成补丁的速度快于漏洞利用的扩散速度时,防御者将受益。
当可用权重、支架和目标在易受攻击项目能够响应之前广泛可得时,攻击者将受益。
GLM-5.3 让这场竞赛呈现得异常清晰。编程能力的提升与网络风险来自同一项底层训练进展。
安全团队现在应做出哪些改变
组织应将高级编程 agent 视为防御工具和拥有特权的安全主体,而不是普通聊天助手。
第一项改变涉及隔离。安全评估应在受控环境中运行,不能不受限制地访问生产网络、凭据或敏感代码库。
沙箱限制 agent 在沿着不安全路径执行后能够触及的范围。它也能帮助调查人员复现操作,并将模型行为与外部干扰区分开来。
第二项改变涉及权限。编程 agent 应仅获得其分配任务所需的文件、工具和网络目标。
广泛的 shell 访问权限比只读代码库分析带来更大风险。自动部署权限比生成供人工审查的补丁带来更大风险。
第三项改变涉及日志记录。团队应记录提示词、工具调用、变更文件、生成的工件和验证结果。
仅凭最终答案无法解释 agent 如何得出安全结论。中间操作可能暴露不安全假设或绕过控制措施的尝试。
安全团队还应将发现与漏洞利用验证分开。一个 agent 可以识别可疑代码,而一个限制更多的环境则测试该问题是否可复现。
这种分离降低了一次常规代码库审计悄然变成完整漏洞开发演练的可能性。它也为敏感工作创建了清晰的审批节点。
发现需要独立确认。人工审查者应复现该漏洞、检查受影响版本,并评估现实部署条件。
严重性分类不应只依赖模型生成的叙述。严重程度必须反映实际可达性、权限、缓解措施和用户影响。
团队应在数量之外衡量准确率。有用指标包括被接受的发现、重复项、误报、修复时间以及生成补丁引入的回归问题。
发现问题更少但准确率更高的模型,可能带来更大的防御价值。维护者的注意力有限,而嘈杂的报告会消耗这一资源。
组织还应评估 agent 的持续性。更长的任务可以发现快速扫描遗漏的漏洞,但也会增加计算消耗和不安全操作的机会。
时间和工具预算应反映每个目标的敏感性。内部测试库不需要与浏览器引擎或身份系统相同的控制措施。
采购审查需要询问,提供商能否在部署后改变控制措施。托管 API 和可下载权重带来不同的治理选项。
托管服务可能支持监控和紧急限制。本地部署的模型提供隐私和控制,但客户需要承担更多安全责任。
使用可下载模型的团队应维护签名工件、版本清单和可复现配置。他们必须知道每次审计由哪个模型执行。
补丁管理应更贴近发现环节。如果修复仍要在漫长的组织队列中等待,更快发现漏洞的价值就会受限。
开发者、产品负责人和安全审查者需要一套统一的分诊工作流。该工作流应在不过度暴露敏感漏洞利用细节的前提下保留证据。
外部维护者需要得到尊重性的披露。自动化报告应包含可复现证据、受影响修订版本,以及足以支持修复的分析。
发送原始模型输出会造成不必要的工作。用未经验证的报告淹没项目可能损害信任,并埋没合法漏洞。
行业还需要针对误报和防御感知型漏洞利用开展更强的评估。当前基准揭示了问题的不同部分,但没有单一分数能够捕捉操作风险。
CyberGym 衡量漏洞复现。ExploitGym 衡量从已知崩溃转化为可运行代码执行的能力。
ExploitBench 对中间漏洞利用能力进行评分。它们共同提供了比单一标题数字更丰富的图景。
团队也应在内部采用同样的分层方法。询问模型是否发现了 bug、复现了它、绕过了缓解措施,以及是否造成了有意义的影响。
每个阶段都需要不同的控制措施。每个阶段也都创造了独立的人工审查机会。
GLM-5.3 报告的性能并不意味着每个组织都面临一波迫在眉睫的自主攻击。它意味着准备窗口正在缩小。
三个信号将决定 GLM-5.3 的走向
下一阶段取决于公开权重、经验证的披露,以及在真实防御条件下进行的独立测试。
第一个信号是 Z.ai 的权重发布。该公司表示,将在让 GLM-5.3 广泛开放下载之前完成安全评估和加固。
若能伴随一份详细的模型卡发布,将有助于增强外界对该公司流程的信心。这份文件应说明网络安全评估、访问决策、局限性以及缓解措施测试。
如果发布延期,则说明这项出乎意料的能力所需的额外工作超出了原定发布计划的容纳范围。若在缺乏实质性文档的情况下发布,治理层面的担忧将进一步加深。
第二个信号是漏洞披露台账。Z.ai 报告的 2,436 项发现和 1,097 项关键级别分类,需要有可供外部观察者评估的结果。
关注已受理的报告、已分配的漏洞标识符、维护者确认、已完成的补丁,以及更新后的严重性评级。这些结果将揭示这些数量背后的准确程度。
较高的确认率将支持 Z.ai 在防御性安全方面的论点。大量重复或被拒绝的报告,则会削弱这一核心说法。
时机同样重要。只有在技术细节广泛传播之前,维护者获得足够的信息和时间来保护用户,漏洞计划才能成功。
第三个信号是独立复现。研究人员需要在等效的测试框架、预算和防护设置下运行 GLM-5.3。
测试应包括当前软件、此前未见的漏洞、现代缓解措施,并清晰区分模型性能与智能体编排。
如果独立结果接近 Z.ai 的数据,就能证实后训练提升了模型底层的网络安全能力上限。若差距很大,则表明原始测试框架对结果的贡献更大。
研究人员还应考察,普通编程界面是否会暴露相同的行为。专用安全智能体可能会解锁标准助手无法提供的能力。
这种差异会影响实际风险。需要专家构建测试框架的模型,与能够通过常见编程工具生成漏洞利用链的模型,其采用曲线截然不同。
Google News 将继续突出戏剧性的数量,因为它们能将复杂的安全故事压缩为一个数字。真正持久的结论将来自经验证的漏洞与可复现的评估。
GLM-5.3 已经改变了讨论方向。它表明,有针对性的后训练能够显著改变现有基础模型的风险画像。
这一结果挑战了一项常见的发布假设。安全分析不能只关注模型规模、预训练算力或基础检查点的身份。
开发者必须评估训练环境、工具和长周期目标所创造出的能力。这些组成部分决定了模型学会完成什么任务。
防御者不应等待每一项存在争议的计数尘埃落定。他们现在就可以隔离智能体、限制权限、验证发现,并缩短修补周期。
最后一个问题关乎运营:维护者能否利用 GLM-5.3 这类系统,以快于攻击者利用漏洞的速度完成修复?
关注 Z.ai 的权重发布、已确认的披露结果,以及具备防御意识的独立测试。这些信号共同将表明,这究竟会成为一种防御优势,还是对失控能力迁移的警示。


