Z.ai 称 GLM-5.3 在 CyberGym 上略胜 Anthropic 的 Mythos 5
- Olivia Johnson

- 8月15日
- 讀畢需時 14 分鐘
Z.ai 表示,GLM-5.3 在 CyberGym 上取得了 84.5% 的得分,以 0.7 个百分点略高于 Anthropic 受限开放的 Mythos 5。这一结果让围绕谁掌控最强网络安全 AI 的 anthropic techmeme 叙事变得更为复杂。
这一比较的重要性不止于一场狭义的基准测试竞争。Z.ai 计划在两周的安全延迟后,将 GLM-5.3 作为开放权重模型发布。不过,其最敏感的网络安全功能仍将仅限经验证用户和指定安全合作伙伴使用。
这种结构使 Z.ai 处于两种相互竞争的分发模式之间。开放权重让组织能够检查、修改并在自己的基础设施上运行软件。经验证访问则让开发者能够对可能同时支持防御性研究和攻击性行动的高级功能保留一定控制权。
Anthropic 为 Mythos 5 选择了第二种方式更为集中化的版本。该模型通过受信任访问计划提供,而非公开发布权重。Z.ai 现在主张,开放模型也能接近类似的网络能力,同时在最高风险层面保留控制措施。
这项基准测试并未解决哪家公司模型更优的问题。但它为开发者、安全团队和政策制定者提出了一个更尖锐的问题:当接近前沿的网络能力以其创造者无法收回的软件形式出现时,会发生什么?
GLM-5.3 将基准提升变成一次访问测试
关键变化不只是 GLM-5.3 取得了更高分数。Z.ai 正将接近前沿的网络表现与通向开放权重的路径结合起来。
根据 Z.ai 的 GLM-5.3 发布公告,该模型在 CyberGym 上取得了 84.5%。Anthropic 报告 Mythos 5 的得分为 83.8%。0.7 分的差距很小,但二者的分发计划截然不同。
CyberGym 评估 AI 智能体能否在真实软件中复现漏洞。模型会获得漏洞描述及相关源代码仓库,必须定位受影响的代码,并生成能够触发缺陷的输入。
最初的 CyberGym 研究涵盖了来自 188 个软件项目的 1,507 个漏洞。这一设计比多项选择式安全测试更具参考价值。它要求智能体浏览源代码、操作工具并产生可观察的结果。
Z.ai 的结果仍属于公司自行报告的基准测试主张。公开数据并不能证明 GLM-5.3 能在不同智能体框架、算力预算、提示词或安全环境中复现同样的表现。
这些变量至关重要。当研究人员改变工具框架、重试次数、时间限制或对构建系统的访问权限时,模型的表现可能不同。即使很小的方法差异,也可能超过 GLM-5.3 与 Mythos 5 之间报告的分差。
这一得分仍代表了相较于 Z.ai 先前公开水平的重大提升。GLM-5.1 在公开 CyberGym 排行榜上的得分为 68.7%。若从这一水平提升至 84.5%,该公司将接近最强的受限系统。
Z.ai 表示,其通过在可执行环境中进行后训练来提升 GLM-5.3。这些是受控的软件系统,智能体可在其中编译代码、运行测试、检查失败情况,并从更长的任务序列中学习。
这种方法之所以重要,是因为它并不完全依赖于打造更大的基础模型。它表明,有针对性的训练、更好的环境以及延长智能体运行时间,能够从现有模型家族中释放出可观的专业能力。
该公司正在将公开权重发布推迟两周,以加强保障措施。在此期间,指定安全合作伙伴可在受控环境中访问高级功能。
然而,一旦权重公开,公司能直接施加影响的范围就会改变。Z.ai 可以控制其托管服务、合作伙伴计划和官方工具,却无法可靠地控制部署在其他地方的每一份修改副本。
这正是为何此次发布是一场访问测试,而不只是又一次模型更新。该公司正试图将用户的本地控制权,与其认为最敏感功能周围的身份验证结合起来。
为什么 Anthropic Techmeme 的比较很重要
anthropic techmeme 的比较对一种观念构成压力:卓越的网络能力能够持续集中在少数美国模型提供商内部。
这则报道将 GLM-5.3 与 Mythos 5 对比,是因为 Anthropic 为限制高级网络功能树立了最明确的先例。Mythos 5 并非传统意义上的公开 Claude 发布版本。
Anthropic 将 Mythos 5 描述为与 Fable 5 具有相同底层模型,但移除了部分选定网络安全保障措施的版本。它通过 Project Glasswing 及相关受信任访问计划,向获批组织提供这一配置。
Fable 5 面向更广泛市场,配备可重定向或拒绝敏感请求的分类器。Mythos 5 则让经过审查的防御者能够更直接地访问 Anthropic 认为需要额外控制的能力。
在其 Mythos 5 公告中,Anthropic 表示,该模型最初将服务于一小群网络防御者和基础设施提供商。公司还将访问与数据保留和安全监控要求挂钩。
Z.ai 正在采用相关思路,但并未采纳相同的分发边界。其敏感网络功能受到访问限制,但更广泛的模型仍将以开放权重形式发布。
这一区别从两方面对 Anthropic 施加压力。首先,当开放替代方案接近其基准表现时,客户可能会质疑受限模型是否仍有必要。其次,当相当的能力出现在其他地方时,政府必须考虑对一家提供商的限制是否仍然有效。
这一比较也对 Z.ai 构成压力。开放权重发布会带来对可复现性、文档、模型完整性和负责任披露的期待。一旦独立研究人员能够检查和修改模型,公司便不能仅依赖排行榜上的主张。
对于企业买家而言,决定不止关乎原始准确率。受限服务提供集中更新、监控、合同控制和明确的运营方。自托管模型则提供数据本地性、定制能力,以及对外部拒绝系统更少的依赖。
安全团队两种价值都需要。在事件处理中,他们可能需要模型分析恶意软件、重建入侵过程或检查可疑代码。对于通用安全分类器而言,这些请求可能看起来像有害活动。
此前的一起事件说明了这个问题。Hugging Face 表示,前沿系统的安全控制干扰了其对一起 AI 驱动入侵事件的调查。根据对这起智能体主导的泄露事件的报道,该公司随后在本地运行 GLM-5.2 来协助分析。
这一案例支持了 Z.ai 关于由防御者控制模型的论点。但它并不能证明不受限制的本地部署始终更安全。帮助事件响应团队的同一种独立性,也可能帮助攻击者规避监控。
因此,核心竞争问题并非中国与美国之争,而是安全性究竟依赖于控制模型、控制特定工具的访问,还是控制用户在敏感环境中能够做什么。
Anthropic 更重视由提供商管理的访问。Z.ai 则押注于一种混合结构:既保护高级功能,又不无限期地扣留底层模型。
开放权重遇上经验证的网络安全访问
Z.ai 的设计将模型可用性与操作许可分离,但在权重离开其服务器后,这种分离将难以执行。
开放权重软件让用户能够访问训练期间学习到的数值参数。这些权重通常可以被下载、托管、微调,并连接至独立工具。
这与最严格意义上的开源软件不同。权重发布可能不包含训练数据、完整训练代码,或复现模型所需的每一个组件。实际益处仍然可观,因为用户无需将每个请求发送给原始提供商,即可运行模型。
经验证访问则涉及不同层面。Z.ai 可以要求其托管网络功能进行身份验证、限制合作伙伴环境、记录活动,或限制对面向漏洞利用工具的访问。
当外部团体围绕公开权重构建替代系统时,挑战便随之而来。他们可以替换官方提示层、接入不同工具、移除托管限制,或使用额外漏洞利用数据训练模型。
Z.ai 承认,发布后将失去对修改版本的控制。这一承认是理解该政策的核心,而非无关紧要的免责声明。
因此,该公司的方法取决于公开模型与受限网络栈之间存在有意义的能力差距。若最敏感的表现需要私有工具、数据集或训练组件,经验证访问仍保有实际价值。
若公开权重已经包含大部分能力,外部开发者可能会重建缺失层。他们可以在没有 Z.ai 参与的情况下添加 shell 访问、调试器、漏洞数据库、模糊测试器和自动重试系统。
这并不意味着该发布在定义上就是不负责任的。许多防御组织需要能在受保护网络中运行的模型。他们无法将专有源代码、凭据或事件材料上传至外部 API。
本地部署也有助于团队在调查期间保全证据。它降低敏感数据离开组织,或受制于提供商数据保留政策的风险。
支持开放网络模型的最有力论据在于不对称性。攻击者本就会检查公开仓库、复用漏洞利用代码并自动化侦察。人员有限的维护者往往无法检查每一个依赖项,也无法复现每一次被报告的崩溃。
Z.ai 将 GLM-5.3 定位为向这些维护者提供可比自动化能力的一种方式。其关联的 OpenVuln 项目允许开源项目提交代码仓库,以进行模型辅助的安全分析。
该服务可能将能力导向缺少专业研究团队的防御者。其价值将取决于误报率、披露实践、可复现性,以及维护者是否能获得可操作的修复指导。
该公司还报告了更广泛的漏洞发现记录。其公开安全账本列出已收集的 2,436 个漏洞,其中包括 1,097 个被归类为严重或高严重性的问题。
这些数字来自 Z.ai 自身的披露系统。它们并未说明有多少发现被独立归功于 GLM 模型、有多少供应商予以确认,或模型将良性行为误判的频率。
尽管如此,该账本仍让外部观察者能够审查比泛泛的安全专业能力主张更具体的内容。公开漏洞标识符、受影响项目、披露日期和补丁,最终可以支持更有力的评估。
开放权重与经验证功能的混合模式,只有在这些证据改善时才会成功。否则,“经验证访问”可能会沦为只描述官方服务、却无法反映模型现实风险的标签。
CyberGym 分数无法衡量完整威胁
84.5% 的 CyberGym 成绩表明模型具备较强的漏洞复现能力,但并未衡量一次成功攻击所需的全部环节。
CyberGym 从为智能体提供大量方向性信息开始。该基准测试提供漏洞描述及对应的源代码仓库,智能体随后必须创建能够触发已知缺陷的概念验证输入。
现实中的攻击者往往需要从更早阶段开始。他们可能需要发现未知目标、获得初始访问权限、识别高价值系统、规避检测、维持持久化,并在陌生网络中横向移动。
在 CyberGym 上表现优异的模型,并不意味着它自动具备贯穿整条攻击链的能力。不过,当人类操作员提供缺失的上下文时,它仍能显著加快进攻性工作。
该基准测试还区分了导致崩溃与复现预期漏洞。这一区别很重要,因为崩溃只能证明某处发生了故障,不能证明智能体理解或利用了目标缺陷。
针对新型评估系统的研究进一步揭示了这一差距。ExploitGym 要求智能体将已知漏洞转化为未授权代码执行,而非仅仅触发一个 bug。
ExploitGym benchmark 包含 869 项任务,覆盖用户空间软件、Chrome 的 V8 引擎和 Linux 内核。每项任务均提供存在漏洞的代码,以及一个已能演示该缺陷的输入。
智能体必须将这一起点转化为可用的 exploit。研究人员报告称,现代防御措施显著降低了成功率,但并未在所有任务中完全消除成功案例。
该评估还发现,模型有时会通过不同于预期目标的缺陷实现代码执行。这一现象说明,简单的成功次数可能具有误导性。
智能体或许能获取基准测试标记,却没有展现研究人员意图衡量的能力。反过来,发现相邻漏洞即使会增加评分复杂度,也可能代表有价值的安全工作。
时间与算力预算又带来了一层不确定性。在困难任务中,更强的智能体可能持续改进数小时,而较弱的系统则会很早进入平台期。
只有当 GLM-5.3 和 Mythos 5 获得可比的工具、预算、指令与重试机会时,两者的比较才有意义。公开摘要并不总会披露足够细节,以确认这种等价性。
因此,独立复现不应只关注最终百分比。研究人员还需要了解模型版本、智能体框架、任务子集、执行环境、工具权限、推理设置及评分方法。
他们还应测试数据污染问题。CyberGym 使用历史漏洞和公开代码仓库,因此相关细节可能已出现在训练数据中。
模型即使记住了信息,仍可能需要大量推理才能将其转化为可用的概念验证。然而,数据污染可能让结果显得比实际更具普适性。
新近披露的漏洞和私有测试集将提供更有力的衡量方式。评估者还可以加入已修复和不存在漏洞的对照项,观察模型是否会在没有漏洞时虚构缺陷。
运营安全则需要另一套测试。研究人员应衡量模型是否遵守范围限制、在识别风险后停止、保护机密信息,并提供有用的修复步骤。
一个发现更多 bug、却泄露凭证或损害测试系统的模型,可能为防御者带来新的成本。仅凭基准准确率无法捕捉这种权衡。
因此,84.5% 这一说法应被视为警示信号。它表明开源模型正接近一个值得严肃测试的能力门槛,但并不能证明 GLM-5.3 是最佳或最危险的网络安全模型。
真正的竞争是能力与控制之间的较量
GLM-5.3 将网络安全 AI 变成了一个分发问题:防御能力覆盖面的扩大,也会增加能够重新利用这项技术的人数。
这是本文的核心权衡。一个有用的安全模型必须理解存在漏洞的代码、推理 exploit,并能操作工具。而这些相同能力也会加速进攻性工作。
集中式服务提供商通过身份核验、请求分类器、监控、留存政策和账户执法来管理这种风险。当用户违反政策,或新证据改变风险判断时,他们可以禁用访问权限。
这些控制也有局限。分类器可能阻止合法的恶意软件分析、事件响应或 exploit 验证。远程服务也可能在危机期间不可用,或不适合处理机密证据。
开放权重解决了其中一些问题。它们让防御者能在受保护网络内部运行模型,针对专有系统进行调优,并直接控制日志与敏感代码。
但它们也削弱了开发者干预的能力。经过修改的模型可以在没有身份核验、使用监控或集中维护的安全措施的情况下运行。
这一冲突解释了为何尽管总体分发策略不同,Z.ai 与 Anthropic 都在向可信访问计划靠拢。两家公司都认识到,某些网络安全功能需要比普通编程辅助更严格的审查。
Anthropic 的模式从集中控制出发,选择性地授予更深层访问权限。Z.ai 则从计划开放权重出发,并尝试围绕特定功能和环境保留控制措施。
两种方式都无法消除滥用。服务商管理的模型可能被越狱、通过遭入侵账户访问,或通过能力提取被复制。开放模型则可被微调、组合并匿名部署。
相关的政策问题并不是孤立地判断模型开放还是封闭。政策制定者需要审视围绕模型的完整系统。
该系统包括可用工具、自主运行环境、网络访问权限、漏洞数据、算力预算、日志记录、人工审查,以及执行生成代码的能力。
一个只能生成文本的模型,与接入扫描器、调试器、浏览器、云凭证和持久化智能体的同一模型相比,所带来的即时风险并不相同。
这一差异也为企业提供了更务实的安全目标。当相似信息广泛存在于公开代码仓库和安全研究中时,限制模型知识非常困难。
控制高风险执行环境或许更易衡量。服务商可以限制对 exploit 测试框架的访问、隔离目标、要求授权,并围绕敏感操作保留审计轨迹。
开放部署仍会令这种模式更加复杂。外部用户可以自行构建环境,特别是在有能力的工具同样开放时。
答案不会来自一条单一的全球规则。大型基础设施提供商、独立维护者、学术研究人员和政府安全团队面临的威胁与责任各不相同。
企业应首先将常规代码审查与具备 exploit 能力的自动化区分开来。前者可采用常规开发者控制;后者则需要更严格的身份、范围、日志和审批要求。
团队还应记录哪个模型检查了哪个代码仓库,以及它使用了哪些工具。AI 生成的发现必须能够复现,才能进入漏洞披露或修复流程。
对于追踪模型快速变化的知识工作者而言,一个可搜索的 AI knowledge base 有助于保存基准测试方法、系统卡和政策变更。当标题分数省略关键评估细节时,这些上下文至关重要。
anthropic techmeme 的叙事框架很有价值,因为它揭示了正在形成的竞争。更深层的较量并不只是 GLM-5.3 对阵 Mythos 5,而是分布式能力与可执行控制之间的较量。
GLM-5.3 发布后值得关注什么
三个信号将决定 Z.ai 是否建立了可持续的访问模式,还是只是在能力周围设置了一道很快会失去约束力的临时门槛。
第一个信号是独立基准复现。研究人员应使用与 Z.ai 报告相同的 CyberGym 任务、智能体框架、工具权限和算力预算来测试发布的 GLM-5.3 权重。
如果复现结果接近 84.5%,将增强该公司的说法:开放模型已达到 Mythos 级别的网络安全性能。如果出现大幅下降,则表明托管系统、私有测试框架或评估设置作出了实质性贡献。
复现应包括新任务和无漏洞对照项。这有助于区分真正的代码推理能力,与记忆、基准污染,或生成看似合理但实际错误的 exploit 输入的倾向。
第二个信号是公开权重与经验证访问之间的能力差距。Z.ai 需要说明哪些功能仍受限制,以及为什么公开模型无法轻易复现这些功能。
有价值的披露应说明受限工具、执行限制、监控方式、合作伙伴资质和升级处置流程,但不应披露会简化滥用的细节。
如果独立开发者很快重建敏感技术栈,经过验证的用户政策在实践中将几乎没有约束力。它只会管理 Z.ai 的官方服务,而无法控制外部的同类部署。
如果受控环境能产生明显更强的结果,混合模式就更具可信度。开放权重可以支持常规防御工作,而最高风险的操作仍留在受监控系统内。
第三个信号是可衡量的防御性采用。OpenVuln 计划和 Z.ai 的漏洞账本提供了一种早期追踪这一结果的方式。
观察者应关注有多少报告的发现获得公开标识符、供应商确认和补丁。他们还应考察漏洞披露质量、重复率、误报率,以及维护者验证模型生成报告所需的时间。
不断积累的已确认修复记录,将支持 Z.ai 关于开放网络安全能力能增强防御者的主张。若形成大量私有库存、却看不到明确修复成果,则更难以评估。
监管回应将影响这三个信号。各国政府越来越担忧能够自动化漏洞发现与利用的模型,尤其是在其权重可以立即跨境传播时。
广泛的限制可能会将开发推向更不透明的渠道。薄弱的控制则可能让关键基础设施暴露在低成本、可扩展的自动化威胁之下。
更可信的框架应聚焦已展现的能力和运营环境。它可以区分普通的本地代码分析,与那些能够自主利用目标、规避防御或跨网络运行的系统。
模型开发者应预期会被要求提供标准化评估、事件报告、访问记录,以及证明其安全主张能够经受独立测试的证据。
安全团队不应等待这些标准出台。他们可以在隔离环境中测试网络安全智能体,限制凭证,要求书面授权,并在人类发现与漏洞利用之间设置人工环节。
他们还应比较模型的修复质量。发现缺陷固然重要,但提供安全补丁、回归测试和易于理解的说明,往往能创造更大的防御价值。
GLM-5.3 的即时故事,是其在狭义基准测试中的领先。更大的 anthropic techmeme 故事,则关乎高级网络安全推理不再具有排他性。
Anthropic 能够限制 Mythos 5,因为它控制着该服务及其分发。Z.ai 正准备发布一个模型,其更广泛的复制版本可能比附加在原始端点上的任何政策都存续得更久。
这使得即将发布的版本比那 0.7 分的差距更为重要。独立评测结果、经验证的访问能力差距,以及已确认的漏洞修复情况,将表明 Z.ai 的折中方案是否奏效。
开发者和企业采购方在采用该模型前应先问一个问题:当模型本身不再稀缺时,他们的控制措施能否有效管理智能体的工具与行动?


