Z.ai 的 GLM-5.3 在网络安全基准测试中挑战美国模型
- Martin Chen

- 3天前
- 讀畢需時 15 分鐘
在这款中国模型于一项网络安全基准测试中取得 84.5% 的分数后,Z.ai 将 GLM-5.3 的开放权重发布推迟了两周。这一说法让 GLM-5.3 登上 Google News,因为它挑战了人们对美国在先进 AI 领域领先地位的一项安逸假设。
关键变化并不在于又一款模型登顶某项公开测试。Z.ai 表示,它训练 GLM-5.3 以发现软件漏洞,随后认为立即发布权重仍需增加额外防护措施。这一组合让该模型处于两个相互冲突的目标之间:广泛的防御性访问与对攻击能力的控制。
OpenAI 和 Anthropic 等美国开发者在更广泛的评测中仍保有显著优势。不过,据报道,GLM-5.3 在专注于复现已知软件漏洞的基准测试 CyberGym 上追平或超过了部分美国模型。这一结果缩小了能力差距中一个具有战略重要性的部分。
一旦模型权重可供下载,Z.ai 便无法可靠地控制后续修改或部署。这使得计划中的发布比普通 API 访问更具影响力,也将一项基准测试结果转化为对开放权重分发能否与前沿级网络能力共存的考验。
GLM-5.3 公告实际改变了什么
GLM-5.3 将抽象的开放模型争论转化为一项有明确发布时间、并附带可量化网络安全主张的发布决策。
Z.ai 于 2026 年 8 月 14 日公布 GLM-5.3,但将模型权重暂缓两周发布。该公司表示,需要更多时间测试控制措施并加强安全安排。
开放权重模型让用户能够访问决定其行为的已训练数值参数。这些参数可支持本地部署、进一步训练,以及绕过原始开发者安全措施的修改。
因此,这次延迟涉及的不只是常规的发布测试。Z.ai 计划分发一种可在发布后由独立运营方复制和改造的产物。之后再移除访问权限,也无法收回已经下载的副本。
根据 GLM-5.3 disclosure,Z.ai 专门通过受控环境中的网络安全任务实践来改进模型。由此产生的能力,并非一般编程表现带来的偶然副作用。
Z.ai 报告称,GLM-5.3 在 CyberGym 上取得了 84.5% 的成绩。该公司表示,按照其评估设置,这一分数超过了其列出的 Anthropic Fable 5 和 OpenAI GPT-5.6 Sol 的结果。
该公司还称,在 ExploitBench 上,GLM-5.3 仅落后于这两款模型。这项评估测试的是对真实漏洞的推理能力,以及开发可用漏洞利用代码的能力。
这些测试衡量的是相关但不同的技能。发现易受攻击的代码,并不自动证明模型具备攻破受保护生产网络的能力。编写概念验证,也不同于在完整入侵过程中可靠地执行操作。
这一差异很重要,因为“黑客攻击”一词将多种活动压缩进了一个戏剧化标签中。模型可能能够成功检查源代码,却难以完成侦察、凭证获取、持久化或规避防御等任务。
CyberGym 本身包含来自 188 个软件项目的 1,507 个真实世界漏洞。其主要任务要求 AI 智能体生成概念验证测试,以复现此前已有文档记录的缺陷。
概念验证是指在受控条件下触发漏洞的代码。它帮助研究人员确认弱点、理解其影响,并评估补丁是否有效。
CyberGym research 描述了一个要求很高的过程。智能体必须浏览代码库、定位相关逻辑,并生成能够触及漏洞行为的测试。
不过,该基准并未复现真实攻击中的所有条件。其分数应被视为漏洞研究能力的证据,而非衡量网络安全主导地位的通用指标。
Z.ai 的回应为这一结果增添了额外分量。开发者常常展示有利的基准测试结果,却不改变发布计划。而在这里,开发者将这一结果与具体的安全延期联系在一起。
在此期间,Z.ai 计划采用分层访问机制。部分安全合作伙伴可在权重广泛可用前,于受控环境中使用 GLM-5.3。
这种方式类似分阶段部署,即可信评估者先于公众获得访问权限。它可以揭示失效模式并完善文档,但无法消除后续分发带来的影响。
因此,关键变化很明确:一家中国开放权重开发者称,其最新模型已达到网络安全测试会影响模型何时发布、而不只是如何发布的水平。
为什么 Google News 的标题给美国实验室施压
Google News 的关注之所以重要,是因为 GLM-5.3 同时对领先美国实验室的能力主张和分发策略施加了压力。
OpenAI 和 Anthropic 通常通过受控服务提供其最强大的系统。它们可以监控请求、执行政策、暂停账户,并在无需重新分发模型权重的情况下更新服务端防护措施。
这种控制具有实际安全价值。服务提供商可以限制明显的恶意活动,并调查跨越众多用户的行为模式,也可以将敏感功能限制给获批客户。
然而,集中式护栏也给防御方带来了不同的问题。事件响应人员有时需要模型检查恶意软件、重建攻击过程或测试危险代码。托管模型可能会将这些授权工作误判为滥用。
攻击者与防御者之间的区别往往取决于自动过滤器无法获得的上下文。同一段代码可能支持犯罪入侵、渗透测试或紧急调查。
这一问题在涉及 Hugging Face 的一次入侵后变得明显。该公司表示,一个自主 AI 智能体系统在其部分环境中执行了数万项操作。
据称,这些智能体上传了恶意数据集、利用了处理弱点、提升了权限,并获取了敏感凭证。Hugging Face 表示,未发现公共模型或数据集遭篡改的证据。
据报道,在响应过程中,该公司在分析恶意软件和攻击行为时遭遇了前沿服务的护栏拒绝。随后,它在自有基础设施上运行了 Z.ai 的早期模型 GLM-5.2。
Hugging Face 表示,本地访问让其团队能够在不将事件数据发送到环境外部的情况下分析敏感材料。这项入侵调查成为支持由防御者控制模型的一个具体论据。
这一事件并不能证明开放权重始终更安全。它展示的是一个更狭义的观点:受控服务可能恰恰会在获授权调查人员最需要广泛技术自由时变得不可用。
GLM-5.3 加大了这一压力。如果其基准测试主张成立,防御者可能获得一款可本地部署、网络安全能力更接近领先闭源系统的模型。
届时,OpenAI 和 Anthropic 将面临一个尴尬选择。更严格的限制可减少部分滥用,但也可能将安全团队推向控制更少的模型。
更宽松的限制或许能更有效地服务于合法调查人员,但也会扩大可协助缺乏经验攻击者的功能访问范围。
因此,竞争压力并不局限于模型准确性。美国实验室必须提供可信的方法,让受信任的防御者在不放弃监控与问责的前提下使用敏感能力。
企业买家面临同样的冲突。安全团队可能出于维护和支持考虑而偏好托管模型,但同一团队也可能因入侵证据包含凭证、客户信息或受监管数据而需要本地推理。
开放权重模型可以满足这一部署要求,但也将更多责任转移给运营方,包括隔离、访问控制、日志记录、更新和评估。
对于通过 Google News 关注这一事件的开发者来说,启示并不是某一家提供商已经确定胜出。分发设计已成为网络能力竞争的一部分。
胜出的模型不会只是生成最好的概念验证代码。它必须能够融入可辩护的运营流程、在紧急情况下作出响应,并避免成为不受监控的攻击服务。
这一要求为美国实验室带来了若干可能的回应。它们可以建立可信研究计划、提供隔离部署,或制定围绕经验证安全工作设计的政策。
它们还可以改进审计机制,以区分合法测试与滥用。这些方法都无法彻底解决归因问题,但每一种都针对了护栏锁定所暴露出的运营弱点。
GLM-5.3 让这些选择更具紧迫性。如果高能力开放权重持续可用,闭源模型提供商便不能假定客户会在高风险安全事件期间接受广泛拒绝。
真正的竞争是受控访问与开放防护之间的较量
主要冲突并非中国对美国,而是受控访问对一款可被防御者和攻击者共同修改的模型。
Z.ai 将该模型描述为开放防御基础设施的一部分。其核心观点是,暴露在外的软件需要同样易于获取的工具来发现并修复弱点。
该公司还将这一论点与一项漏洞披露工作结合起来。审查时,其security ledger列出了 2,436 个已收集漏洞,其中 1,097 个被标记为严重或高危。
该账本覆盖 269 个开源项目,也区分了已公开披露的条目和仍未公开的条目——当漏洞正等待协调修复时,这一点尤为重要。
Z.ai 表示,GLM 系列模型为这些发现作出了贡献。这是公司的主张,独立审查者尚未验证每一项所列发现或归因。
尽管如此,该账本为防御叙事提供了可量化的形式。它指向广泛使用项目中的漏洞,而非只展示抽象的基准测试百分比。
Z.ai 还推出了 OpenVuln,这一计划允许开源维护者提交代码仓库进行扫描。OpenVuln service旨在将模型引导至防御性代码审查。
维护者可以使用这类服务定位内存安全缺陷、不安全的输入处理或被忽视的错误路径。及早发现可帮助项目在攻击者利用缺陷前完成修复。
同样的推理能力具有双重用途。攻击者可以检查公共代码仓库、识别尚未打补丁的安装实例,并将技术发现转化为可重复利用的漏洞利用方式。
模型权重让这种张力更难管理。API 提供商可以封禁可疑账户、限制工具使用或修补防护措施;被复制的模型则可在这种控制之外继续运行。
用户还可以对开放权重系统进行微调,即通过额外训练数据调整其行为。该过程可能使模型专门服务于防御性审计,或移除拒绝行为。
发布延期可以改进原始模型及其文档,但无法保证每个未来衍生版本都保留这些保护措施。
这正是“开放盾牌”这一说法只概括了一半结果的原因。任何人都能检查并改进的盾牌,能够强化防御者;但它也可能为进攻系统提供可复用的组件。
封闭访问并不能提供一个干净利落的解决方案。能力极强的托管模型仍可能遭到越狱、窃取,或被接入不安全的工具。其运营方也可能在测试和隔离中出现失误。
Hugging Face 的案例揭示了另一项限制。即使工作涉及正在发生的入侵事件,防御者也可能需要远程服务商拒绝提供的能力。
开放模型能够降低对服务商审批的依赖。它们支持离线分析、可复现实验和内部部署。对于处理敏感软件的研究人员而言,这些优势十分可观。
但它们也将治理责任本地化。每个组织都必须决定谁可以向模型提问、模型能够调用哪些工具,以及其输出是否需要人工审核。
没有网络访问权限的模型,与拥有 shell 访问权限和凭据的自主代理,面临的风险并不相同。仅凭模型权重并不能决定完整的威胁。
周边的运行框架同样重要。运行框架是为模型提供记忆、工具、目标和行动权限的软件。
隔离的模型可以提出概念验证建议,却不会执行它。接入脆弱系统的代理则可以测试、修改并扩大攻击,而无需等待人工批准。
因此,仅聚焦权重是否可下载的政策,将忽视关键的部署差异。管控还应考虑工具权限、自主性、日志记录和运行环境。
GLM-5.3 加剧了这一权衡,因为它将广泛访问与据称接近前沿的网络能力结合在一起。这些能力越趋近,争论双方就越难感到安心。
开放模型倡导者必须应对不可逆转的扩散问题。封闭模型倡导者则必须说明,在不依赖脆弱的自动化权限机制的情况下,防御者如何能在紧急情况下获得同等能力。
双方都不能依赖口号。实际问题在于:哪一种访问设计,能在专业能力并不均等的数千个组织中带来更好的安全结果。
84.5% CyberGym 得分并不能证明什么
GLM-5.3 据称取得的分数意义重大,但并不能证明它与最强的美国模型在整体能力上旗鼓相当。
基准测试结果取决于提示词、代理框架、token 预算、工具配置和评分规则。一个设置下的百分比,未必能与另一个设置下报告的百分比相提并论。
即便是同一个基础模型,搭配更好的代理脚手架后也可能表现不同。脚手架负责组织任务、选择工具、保存中间结果,并决定何时重试。
因此,Z.ai 的比较需要独立复现。评估者需要获得完整模型、测试设置,以及足够详细的信息,以判断每个系统是否获得了可比的资源。
两周的延迟暂时限制了这项工作。外部研究人员要等到 Z.ai 发布可下载权重或授予受控访问后,才能全面评估。
公开暴露基准测试也会带来另一项担忧。开发者可以让模型在与已知测试相似的任务上训练,从而提高得分,却未必在未知漏洞上获得同等提升。
这并不意味着结果无效。它意味着,全新、保留未公开的测试比熟悉的公开测试套件更具证据价值。
近期的政府评估说明了其中差异。2026 年 5 月,美国人工智能标准与创新中心评估了 DeepSeek V4 在公开和非公开任务上的表现。
CAISI 评估发现,DeepSeek 自行报告的比较结果看起来强于其在政府测试套件中的实际表现。CAISI 估计其综合能力落后约八个月。
在 CAISI 的 CTF-Archive-Diamond 网络安全基准上,DeepSeek V4 的报告得分为 32%。在所述配置下,OpenAI 的 GPT-5.5 得分为 71%。
这些数据并不能直接预测 GLM-5.3 的表现。它们说明,单一基准测试的结果不应被泛化为对国家能力的笼统结论。
CyberGym 也主要关注具有已知历史和可用源代码仓库的漏洞。现实中的攻击者往往从不完整的信息、不断变化的网络和不确定的目标开始。
一次端到端入侵可能需要社会工程、身份攻陷、横向移动、持久化和规避检测。成功生成概念验证代码,只覆盖了这条链路的一部分。
反过来,CyberGym 也可能低估防御价值。能够快速复现缺陷的模型,或许能帮助维护者确认报告、确定补丁优先级并生成回归测试。
该基准衡量的是一项具有技术意义的技能。错误在于,将这项技能视为无害的代码审查,或视为完整的自主黑客能力。
Z.ai 的漏洞清单也需要同样严格的审视。列出的总数很具体,但数量本身并不能证明新颖性、可利用性,或模型的独立贡献。
一些发现可能只是重复了已知的弱点模式。另一些则可能需要不寻常的配置,或不存在实际攻击路径。协调披露记录最终可以澄清其价值。
最有力的佐证应包括已被接受的补丁、已分配的标识符、维护者确认和独立复现。公开示例也应在披露可操作细节前保护相关项目。
GLM-5.3 在更多测试中的表现将很重要。ExploitBench 可以考察漏洞利用开发推理,而端到端靶场可以测试代理在更长攻击序列中的运行表现。
研究人员还应测试拒绝行为和安全防护被移除后的情况。若只需适度微调就能抹除限制,开放权重模型的默认行为就没那么重要。
资源需求带来了另一项不确定性。大型模型或许可以下载,但要以完整能力运行,仍可能成本高昂且技术难度很大。
这一门槛可以减缓随意滥用,尽管资金充足的犯罪团伙和政府仍可能获得足够的基础设施。更小的蒸馏版本日后可能降低这一门槛。
可靠性同样重要。一个在精选任务上成功、却在其他场景中编造细节的模型,可能浪费调查人员的时间,或导致不安全的代码修改。
安全团队需要误报率、可复现性数据,以及模型在干净代码仓库上的表现。报告过多不存在漏洞的扫描器,可能令维护者不堪重负。
Google News 的标题自然会压缩这些限定条件。读者应保留核心发现,同时抵制最宽泛的解读。
据报道,GLM-5.3 在一项相关的公开评估中取得了显著结果。它是否能在真实网络行动中与美国系统匹敌,仍是一个悬而未决的实证问题。
GLM-5.3 推出之际,美国正重新审视开放权重 AI
此次发布发生在一个关键时点:政策制定者必须区分模型来源、访问设计和已证明的能力,而不能将它们视为同一个问题。
开放权重 AI 曾避开部分针对受控前沿服务的限制。随着可下载系统接近敏感能力门槛,这种区分越来越难以维持。
特朗普政府一直在考虑加强对开放模型的审查。根据政策报道,官员们面临与国家安全 AI 规则和评估相关的 9 月及 10 月期限。
若政策只针对封闭服务,就会让一个不断扩大的类别游离于核心框架之外。GLM-5.3 及时说明了为何能力门槛可能跨越分发类别。
然而,将所有开放权重一概视为等同也同样粗糙。一个没有实质网络能力的小型研究模型,与一个接入自主工具的前沿系统并不具有相同风险。
原产国带来了另一场独立争论。一些美国官员和分析人士特别关注在中国开发的模型,理由包括供应链、数据安全和国家安全担忧。
另一些人则认为,广泛限制会削弱美国的开放发展。这类限制可能会将研究和应用推向监督机制更少的司法辖区。
大型科技公司支持继续保留对开放模型的访问。它们关心的利益包括研究、本地部署、竞争,以及对少数 API 服务商的替代选择。
防御层面的理由也确实存在。开源维护者往往预算有限、积压工作庞大。可访问的代码审计模型,能够将稀缺注意力导向严重缺陷。
然而,维护者不应在未审查数据处理做法的情况下,将敏感代码上传至未知服务。本地部署可减少这种暴露,但需要适当的基础设施和运行纪律。
政府采购也将面临类似问题。机构需要可重复的评估,才能允许模型编写代码、检查受保护系统,或通过安全工具采取行动。
最有用的规则应聚焦于可衡量的条件,包括能力、自主性、工具访问、部署环境,以及移除安全防护后的后果。
发布前评估有助于识别危险行为。它们必须使用保留未公开的任务和可比设置,否则开发者就会针对可见的合规测试进行优化。
披露流程也需要关注。如果模型发现数千个漏洞,而维护者收到的报告超过其验证能力,就可能形成修复瓶颈。
协调披露通常会给受影响的开发者留出时间,在技术细节公开前调查并修复缺陷。AI 可以提高报告量,其速度可能超过现有流程的承受能力。
Z.ai 的分级发布提供了一种临时应对方式。可信合作伙伴可以测试模型,同时公司完善安全防护并推进披露流程。
在权重开始流通后,该系统将迎来真正考验。研究人员会审视管控措施多容易被移除,运营者则会衡量本地部署是否改善防御结果。
监管机构不应将一个基准测试百分比视为完整的风险评估;也不应等到发生重大事件后才制定一致的评估标准。
更广泛的美中比较仍未尘埃落定。美国实验室在许多广泛和私有评估中仍处于领先地位,而中国开发者则扩大了开放权重替代方案的质量和可用性。
GLM-5.3 之所以重要,是因为网络能力并非普通的生产力功能。它可以通过更快修补漏洞创造社会价值,同时降低实施利用攻击所需的专业门槛。
这种双重用途使简单化的国家排名价值更低。紧迫的问题是,有能力的模型如何从实验室进入其行动会产生后果的环境。
模型权重发布后值得关注的事项
三个信号将决定 GLM-5.3 是带来持久转变,还是一则围绕单项有利基准测试构建的头条新闻。
第一个信号是计划中的权重发布后所开展的独立测试。研究人员应复现 CyberGym 的结果,并在保留未公开的漏洞评估和端到端代理评估中测试 GLM-5.3。
可比设置将至关重要。评估者应在公布得分的同时,发布代理脚手架、token 预算、工具权限和成功标准。
如果独立结果仍接近 Z.ai 的说法,美国与中国之间网络能力差距收窄的论据将更有说服力。若出现大幅下滑,这一结论则会被削弱。
第二个信号来自 Z.ai 的漏洞计划。经维护者确认的发现、被接受的补丁和公开标识符,能够显示基准测试能力是否转化为有价值的防御工作。
原始总数不应成为决定性衡量标准。已报告漏洞的质量、新颖性和修复情况,比进入台账的数量更重要。
读者还应关注项目如何处理报告量。有效的计划必须避免压垮维护者,或在修复措施可用前披露弱点。
持续的防御成果将强化 Z.ai 的“开放盾牌”论点。验证不足或不安全的披露,则会凸显扩大自动化漏洞发现规模所带来的运营风险。
第三个信号是华盛顿的政策回应。预计针对政府 AI 使用和安全评估的新标准,将澄清官员如何对待具备较强能力的开放权重模型。
以已证明能力为核心的框架,可能会将 GLM-5.3 这类系统纳入部署前测试,而不限制每一个可下载模型。
基于国家的限制则针对的是另一类问题。它将聚焦中国模型提供商及相关交易,而非开放权重分发本身。
无论哪种方式,都无法消除已在国际范围内分发的权重。政策仍可影响云托管、企业采购、政府使用以及对支持性基础设施的访问。
开发者和企业采购方不应等到监管出台后才制定内部规则。他们需要隔离测试、最小权限工具访问、日志记录,以及对重要行动实施人工审批。
团队应在可搜索的 AI knowledge base 中记录评估证据和政策决策。这些记录可以将模型变更与事件、控制措施和部署审批关联起来。
下一条 Google News 头条很可能聚焦于新的分数、发布或限制。更重要的问题是,独立证据是否支持安全、可重复的防御价值。
GLM-5.3 已经通过将这种权衡具体化而改变了讨论。不久之后,任何拥有足够基础设施的人,都可能掌控一个 Z.ai 认为敏感到需要延迟发布的模型。
安全负责人应按这一顺序追踪独立测试、经验证的漏洞结果和政府标准。这些信号将揭示 GLM-5.3 代表的是持久能力,还是暂时的基准优势。
权重只能解决访问问题。运营者如何将模型连接到工具、数据和真实系统,将决定它主要发挥盾牌作用,还是成为加速器。


