top of page

Z.ai 以 GLM-5.2 挑战 Anthropic Google 网络安全格局

Z.ai 发布 GLM-5.2 后,对 anthropic google 网络安全合作关系构成了压力。这是一款开放权重模型,安全测试表现出人意料地强劲。

这家中国公司称,其模型在部分网络防御测试中已接近 Anthropic 受限提供的 Mythos 5。独立发现支持一个更谨慎的结论:GLM-5.2 在特定漏洞任务上可与领先的闭源模型竞争,但在更广泛的评估中并未始终达到 Mythos 的水平。

这一差异比标题中的对比更重要。Google 参与了 Anthropic 的 Project Glasswing,该项目让经过筛选的防御方能够使用 Mythos 级能力。GLM-5.2 则走了一条不同路径:其可下载的权重允许组织在不由服务提供商控制每一次请求的情况下运行和修改模型。

因此,这场竞争不只是 Z.ai 与 Anthropic 的较量。它将受限访问和由提供商管理的安全措施,与可在私有基础设施中广泛部署的模型置于对立面。核心问题已不再是开放模型是否会获得先进的网络能力,而是随着差距缩小,防御方将如何应对。

GLM-5.2 将一次模型发布变成了安全测试

Z.ai 通过可下载模型权重提供可信的网络能力,改变了这场讨论。

Z.ai,也称智谱 AI,于 2026 年 6 月 13 日向编码计划用户推出 GLM-5.2。三天后,该公司发布了模型权重和技术材料。公司将该模型定位于编码、软件工程和长时间运行的智能体任务。

开放权重意味着组织可以下载训练参数,并在自己控制的基础设施上运行模型。这与托管服务不同:托管服务的提供商可以监控流量、调整安全措施、暂停用户服务或撤销访问权限。

该发布很快引起安全研究人员关注。Semgrep 在不安全的直接对象引用检测任务上测试了 GLM-5.2,这类漏洞通常被称为 IDOR 检测。这些漏洞允许用户访问属于他人的数据或操作。

在这项 IDOR 评估 中,GLM-5.2 的 F1 得分为 39%。F1 将精确率和召回率合并为一项指标。在相同的基础提示设置下,Claude Code 的得分为 32%。

Semgrep 的专用多模态流水线仍然领先,得分介于 53% 至 61% 之间。这一结果提供了重要限定:表现强劲的模型并不会自动胜过围绕针对性分析、代码仓库映射和结构化验证构建的安全系统。

该实验还比较了不同形式的辅助。GLM-5.2 获得了一个基础 harness,即为模型提供上下文并管理交互的软件。Semgrep 的内部流水线则获得了专门设计的引导,用于识别端点并聚焦搜索范围。

这意味着该结果并不能证明它在整体上优于 Claude。它表明,GLM-5.2 无需大量脚手架支持,也能在一项高度依赖推理的漏洞任务中表现良好。对于考虑私有化部署的安全团队而言,这仍是一个有意义的变化。

所提供的 Reuters 标题将该模型描述为在网络防御测试中接近 Mythos 5。现有证据仅在明确说明测试任务、模型配置和评估 harness 的前提下,才支持“接近”这一表述。

基准测试结果衡量的是模型在既定环境中的表现。它并不能自动预测模型处理陌生代码仓库、设有防御措施的网络,或不完整事件报告时的能力。

GLM-5.2 的重要性来自访问方式与能力的结合。当数千个团队可以下载、定制并运行模型而无需等待批准时,即便模型略弱,其运营层面的影响也可能更大。

这正是此次发布立即引发紧张关系的原因。Anthropic 将其最强的网络功能视为受控能力。Z.ai 则将具有竞争力的能力置入一个能够脱离原始开发者传播的模型之中。

Anthropic Google 安全模式为何面临压力

anthropic google 的路径依赖于受管理的访问,而 GLM-5.2 在分发后削弱了提供商的作用。

Anthropic 于 2026 年 4 月通过 Project Glasswing 推出 Mythos Preview。该计划将 Anthropic 与美国政府及主要科技、金融和安全组织聚集在一起。

Google 与 Amazon Web Services、Apple、Broadcom、Cisco、CrowdStrike、Microsoft、Nvidia、Palo Alto Networks、Linux Foundation 和 JPMorganChase 一同加入。它们宣称的目标是在攻击者利用漏洞之前,发现重要软件中的漏洞。

此后,Mythos 5 成为面向获批 Glasswing 参与者提供的更强后继模型。Anthropic 将其描述为与 Fable 5 采用相同底层模型,但移除了部分选定网络安全防护措施。

Mythos 发布说明解释了这种划分。Fable 5 通过分类器和回退机制服务普通用户。Mythos 5 则让经过审核的防御方更广泛地使用 Anthropic 认为异常敏感的网络能力。

这种结构假定提供商仍处于模型与大多数用户之间。Anthropic 可以决定谁能获得不受限制的功能,也可以监控可疑活动,并调整模型周围的系统。

Google 的参与并不意味着 Mythos 成为了 Google 模型。它意味着 Google 是使用 Anthropic 受限系统的防御联盟成员之一。在解读核心关键词 anthropic google 及其面临的竞争压力时,这一区别至关重要。

GLM-5.2 挑战了该联盟的运营前提。一旦模型权重被下载,Z.ai 就无法可靠地在每个部署中施加完全相同的监控规则。运营方可以修改周边软件、微调模型行为,或移除拒答机制。

这种差异并不意味着开放权重本身具有恶意。私有化运行可以帮助防御方保护源代码、受监管信息和机密事件数据,也让研究人员无需依赖供应商服务即可复现研究结果。

然而,同样的控制能力也会让具有攻击目标的用户受益。恶意运营方可以反复进行实验,而不会触发提供商一侧的速率限制、账户审查或集中式滥用检测。

这一权衡带来的压力不止针对 Anthropic。Google 和其他 Glasswing 合作伙伴必须证明,受控访问能够形成持久的防御优势。他们需要将特权能力转化为更快的发现速度、协调披露和经验证的补丁。

如果不受限制的竞争者始终足够接近,那么访问本身就会成为性能的一部分。一款略强但受限的模型,并不一定能比部署在众多内部安全团队中的较弱模型带来更多总体防御能力。

这种压力既是眼前的,也是长期的。短期内,组织必须判断 GLM-5.2 是否足够可靠,可用于安全工作流。长期来看,前沿开发者必须重新审视:当类似能力出现在可下载系统中时,哪些防护措施仍然有效。

这是这场故事中的第一次重大逆转。网络安全领导地位原本应部分建立在限制最强模型访问权限之上。GLM-5.2 表明,在政策框架稳定之前,可比工具就可能在这一访问模式之外出现。

开放权重改变网络安全方程式

决定性差异不在于某一项基准得分,而在于谁能够运行、适配和检视模型。

网络安全工作涵盖多种不同活动。模型可能审查代码、复现已知漏洞、开发利用程序、分析恶意软件,或在模拟网络中进行操作。在某一类别中成功,并不保证在其他类别中也能成功。

Anthropic 自己的测试说明了能力范围的高端。Mythos Preview 接受了针对已打补丁软件和数千个开源模糊测试目标的评估。

根据 Anthropic 的网络安全评估,在一项重复实验中,Mythos Preview 共 181 次生成了可用的 Firefox 利用程序。较早的 Claude 模型在数百次尝试中仅成功两次。

该模型还在 Anthropic 的 OSS-Fuzz 测试中生成了 595 个较低级别的崩溃。它在十个完全打补丁的目标上实现了完整的控制流劫持,即最严重的类别。

这些是由公司自行开展的评估,因此不应将其视为普遍测量结果。尽管如此,它们仍说明了 Anthropic 为何建立受限访问计划。相关能力并不止于识别可疑代码模式。

GLM-5.2 尚未在可直接比较的公开测试中匹配上述每一项结果。其当前依据是一系列更狭窄的发现,而不是对 Mythos 的一次全面复现。

英国 AI Security Institute 为最强的能力对等说法提供了有益的制衡。其研究人员在狭窄的网络任务和模拟多步骤攻击中测试了 GLM-5.2。

该机构发现,在其狭窄任务中,GLM-5.2 的表现与四个月前发布的闭源模型相似。在较长的网络靶场中,它则接近近七个月前发布的一款模型。

因此,其开放权重分析认为,GLM-5.2 落后于闭源网络能力前沿约四至七个月。这并不等同于与 Mythos 5 实现能力对等。

然而,对于依赖持久技术领先的防御方而言,这一发现绝非令人安心。该机构此前的内部评估认为,开放模型落后六至十个月。实测的延迟正在缩短。

长期任务结果尤其值得关注。GLM-5.2 最初的轨迹与一款较新的闭源模型相似,但随后在模拟攻击链中停滞。

这种模式表明存在两个不同的能力层级。该模型能够解决单个技术步骤,但在长时间操作中维持计划并持续适应方面更为困难。

这一限制在真实入侵中十分重要。攻击者必须应对凭据、网络变化、错误假设、防御警报和不完整访问权限。强劲的代码分析得分仅捕捉到这一过程的一部分。

防御方仍应避免自满。开放权重让外部团队能够改进 harness、增加记忆机制、提供专用工具,并使用领域特定示例对模型进行微调。

一项基准测试的是某个时刻的一个打包系统。开放部署则创造了一个开发平台。改进可以来自从未与原始模型制造商协调过的组织。

这正是 GLM-5.2 改变竞争机制之处。Anthropic 可以在受控接口背后改进 Mythos,而更广泛的 GLM 社区可以在众多独立环境中改进部署方法。

anthropic google 联盟仍拥有重要优势。其成员掌握大量安全数据、基础设施知识和漏洞披露关系。他们可以在真实系统上验证发现,并将修复措施应用到广泛使用的产品中。

GLM-5.2 提供的是另一种优势:分发能力。其用户可将模型部署在私有代码仓库旁,并在不将敏感代码发送给外部服务的情况下定制工作流。

这两种优势都不能保证更好的安全性。结果取决于组织能否验证发现、优先处理真正的风险,并且比对手利用漏洞更快地完成修复。

基准测试标题未透露的内容

GLM-5.2 在部分任务上接近 Mythos 5 的说法可信,但将其概括为整体网络安全能力则并不成立。

安全基准测试往往将多项选择压缩为一个分数。其中包括提示词、可用工具、令牌预算、尝试次数、模型设置和成功标准。

一个模型可能因为任务与其训练数据相似而得分较高。另一个模型则可能因安全系统阻止了部分评估而表现不佳。专门设计的测试框架也可能通过提供更好的上下文,优于更强的基础模型。

Semgrep 的结果清楚地说明了这一问题。在简单设置下,GLM-5.2 击败了 Claude Code。但它并未超过 Semgrep 的引导式流程,后者将模型推理与结构化应用分析结合起来。

英国研究机构发现了另一项局限性。GLM-5.2 在狭窄技能上接近较早一代的前沿模型,但在长序列任务中落后得更多。这一差距削弱了“单一漏洞检测分数可以代表完整进攻能力”的说法。

近期的一项学术测试提供了第三个视角。CryptanalysisBench 评估针对密码方案的攻击,包括已知弱点,以及尚无成熟实用破解方法的更复杂设计。

在这项密码分析基准测试中,GLM-5.2 完成了 65.3% 的一级任务。Mythos 5 完成了 85.7%。Opus 4.8、Sonnet 5 和 GPT-5.5 的表现也介于两者之间。

在更困难的任务上,差距进一步扩大。按研究人员统计的扩展变体中的成功次数,GLM-5.2 攻破了 24 个方案,Mythos 5 则攻破了 61 个。

Mythos 5 还帮助发现了此前未被报告的问题。研究人员称,它识别出一项已发表安全证明中的问题,并协助完成了一次完整的密钥恢复攻击。

这些结果削弱了任何“GLM-5.2 已经全面追平 Mythos 5”的宽泛说法。它们也说明,模型比较需要覆盖多个任务类别。

现有证据支持一种更准确的判断。GLM-5.2 已达到能够在一些实用安全测试中挑战领先系统的水平。Mythos 5 在高难度密码推理方面仍保有显著优势。

这并不意味着 Z.ai 的发布不重要。一个模型无需赢得每项基准测试,才会对攻击者或防御者产生实际价值。

许多现实中的安全问题,来自反复出现的普通错误,而非高级密码分析。访问控制漏洞、不安全的输入处理、泄露的密钥和薄弱配置,广泛存在于大型软件组合中。

一款可广泛获取、且能胜任这些任务的模型,可以扩大接受自动化审查的代码库数量。它也可能增加嘈杂或误导性报告的数量。

误报会带来真实成本。安全团队必须复现每项发现、判断可利用性、定位受影响版本,并协调修复工作。生成看似合理但实际错误报告的模型,可能消耗宝贵的工程时间。

漏报则带来另一种风险。团队可能信任一个看似有能力的扫描器,从而减少其他审查活动。基准测试获胜并不能证明可以取代人工测试、静态分析或成熟的模糊测试系统。

还存在数据污染问题。公开的基准任务可能直接出现在训练数据中,也可能通过说明文字和代码间接出现。高质量评估会使用新目标、受控环境和执行轨迹分析,以降低这种风险。

最佳应对方式不是从标题中选出一个赢家。采购方应在近期的内部代码上测试模型,保留一套隐藏答案集,并衡量经验证的发现,而不是生成报告的数量。

因此,Anthropic 与 Google 的故事,和能力一样也关乎验证。防御联盟必须证明,其受限模型能够带来实际的安全收益。开放模型社区则必须证明,广泛访问不会只是让未经验证的输出成倍增加。

真正的竞争是受限访问与分布式能力之争

当前竞争的核心在于:当有用的网络能力扩散时,安全护栏能否依然有效。

Anthropic 认为,先进的网络模型既可以协助防御者,也可以帮助攻击者。这种双重用途特性解释了 Fable 5 与 Mythos 5 的区分。

Fable 使用分类器,即用于检测敏感请求的独立系统。部分被标记的任务会被拦截,或转交给另一个模型。Mythos 则在指定领域内为获批研究人员提供更少的限制。

这种设计提供了多个执行控制点。Anthropic 可以评估申请者、监控流量、调查反复出现的可疑行为,并在出现新的滥用模式时更新分类器。

这种方法也会给合法用户带来阻力。安全研究人员往往需要讨论利用技术、恶意软件行为或规避方法,才能理解一个漏洞。审慎的分类器可能会中断这类工作。

开放权重消除了许多由提供商控制的阻力,但也移除了许多集中式控制措施。拒答训练有时可以被修改,是否保留日志则由独立运营者决定。

这一政策冲突并不只是美国与中国之间的矛盾。凡是模型开发者、监管者和安全团队需要在访问权限与滥用风险之间取得平衡的市场,都会存在这种冲突。

围绕安全的更广泛争论早已超出 Mythos 的范围。其他前沿开发者已推出或测试面向网络安全的系统,而研究人员对于危险能力何时出现仍存在分歧。

Google 的位置较为复杂。作为主要的软件和基础设施运营商,它支持 Project Glasswing。同时,它也开发自己的模型和安全系统,因此其动机并不止于 Anthropic 的访问政策。

Anthropic 与 Google 的关系之所以重要,是因为受限模型能通过其部署合作伙伴获得价值。Google 可以提供大型代码库、经验丰富的防御者,以及修复广泛部署软件的渠道。

Z.ai 的方法则创造了另一种规模效应。独立组织可以将 GLM-5.2 部署在私有开发网络中,并将其连接到工单系统、代码搜索、测试环境和本地安全工具。

对企业而言,决策涉及的远不止原始准确率。数据治理同样重要。一些组织无法将源代码、漏洞报告或事件证据发送给外部模型服务。

本地运营的模型可以解决这一限制。然而,组织也因此需要自行承担访问控制、模型更新、日志记录和滥用监控的责任。

部署因此是转移风险,而非消除风险。托管服务将信任集中在模型提供商身上。自托管系统则将责任分散到安全实践差异很大的运营者之间。

这种分布式模式使监管变得复杂。政府可以对国内提供商和大型云服务施加条件,但对运行在私有或海外基础设施上的模型副本影响力较小。

它也使事件响应更加复杂。托管提供商可以在其服务中修复系统级弱点。开放模型运营者则必须自行获取并应用更新。

防御者应预期这两条路径都会持续存在。高度敏感的组织会在受控的前沿访问能够提供可衡量优势时选择它。其他组织则会偏好可适应、并留在自身环境中的模型。

战略上的错误,是将任何一条路径视为充分条件。受限的前沿能力无法保护每一个软件项目。无限制分发也无法保证谨慎使用或可靠发现。

更强的防御体系应将有能力的模型与传统安全控制相结合。这些控制包括代码审查、模糊测试、依赖项管理、网络分段、身份控制、可复现测试和协调披露。

AI 改变的是单项任务的速度和规模。它并不能免除人们判断哪些系统重要、确认结果、部署修复,以及衡量风险暴露是否真正下降的需要。

三个信号将显示 Z.ai 是否真的缩小了差距

下一阶段的证据应来自独立测试、实际应用结果和可衡量的防御成果,而不是又一次模型发布。

第一个信号是 GLM-5.2 在广泛且抗数据污染的网络安全评估中的表现。研究人员需要测试漏洞发现、利用、逆向工程、密码分析和持续网络行动。

若其在这些类别中取得更强结果,将强化 Z.ai 对 Mythos 5 的比较。如果它在密码分析或长时程范围内持续表现疲弱,则说明当前的对等说法仍然仅限于特定任务。

评估者应公布足够的方法细节,以使比较具备意义。他们应说明用于验证成功的测试框架、工具、令牌限制、尝试次数、安全护栏和判定标准。

第二个信号是开放模型运营者改进周边系统的速度。GLM-5.2 的可下载权重允许安全公司和内部团队围绕它构建专用智能体。

应关注代码库映射、检索、工具使用、记忆或微调带来的、能够被独立复现的提升。如果这些系统缩小了长时程差距,开放权重将使该模型的能力超出其发布时的配置。

失败同样具有参考价值。如果优化后的部署仍然不可靠,那么基础模型的可访问性不会转化为 Mythos 级别的行动能力。

第三个信号是经验证的防御影响证据。Anthropic 及其 Glasswing 合作伙伴需要报告发现的漏洞、严重性等级、重复率、修复时间和后续补丁采用情况。

Z.ai 的用户也应遵循同一标准。当报告属于重复项、误报、低影响问题,或维护者无法复现的缺陷时,再大的数量也意义有限。

最理想的结果,是重要软件的暴露窗口缩短。这需要漏洞发现、负责任报告、工程修复、发布管理和用户采用等环节共同完成。模型只影响其中一部分链条。

广泛的进攻性适应证据,会使评估朝相反方向变化。安全团队应监控威胁行为者是否将开放模型纳入可重复的入侵工作流,而不只是观察他们是否在论坛中提及它们。

短期赢家不会由某家公司宣称在某项基准中领先来决定。决定因素将是谁能将模型能力转化为经过验证的行动,同时控制运营风险。

对开发者而言,实际的应对方式是:假定有能力的自动化漏洞分析正变得广泛可用。在扫描量上升之前,审查高风险代码路径、改善密钥处理,并使安全测试可复现。

企业采购方应要求在自身软件上进行评估,而不是接受通用排行榜。他们还应明确由谁验证发现,以及如何审计模型访问。

关注 Anthropic 与 Google 竞争的知识工作者,应保留源材料、基准版本和后续更正。能力声明变化很快,而截图和孤立分数往往会脱离其原有语境而长期流传。

未来几个月将揭示,GLM-5.2 代表的是狭窄基准测试带来的压力,还是网络能力的持久转变。关注独立测试、优化部署和经验证的补丁。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page