top of page

Anthropic 的 Claude Mythos HAWK 攻击暴露了 PQC 无法弥补的安全缺口

9月11日
讀畢需時 11 分鐘

Anthropic 的 Claude Mythos HAWK 攻击在大约 60 小时的 AI 辅助研究后,降低了这一候选签名方案的估计密钥强度。HAWK 此前已历经两年和两轮专家审查。重要事件正是这种反差,而非已部署加密遭到即时攻破。

Anthropic 于 2026 年 7 月 28 日披露了这一结果,同时还公布了针对简化版 AES 的另一项攻击。HAWK 团队随后从美国国家标准与技术研究院的后量子签名竞赛中撤回了其算法。没有任何已最终确定的 NIST 后量子标准受到影响。

这一事件带来的安全问题比标题所暗示的更棘手。后量子密码学,或 PQC,可保护系统免受未来量子攻击。它无法保护新算法免于此前未发现的数学弱点、更快速的自动化分析,或不足的人类审查能力。

这使密码学家、标准制定机构、软件供应商和企业采购方都面临一种错配。AI 现在可以更快地搜索某些技术攻击空间,而验证和修复仍依赖稀缺的人类专家。

Claude Mythos HAWK 攻击改变了一场标准竞赛

Claude Mythos 并未攻破已部署的安全标准,但它改变了哪一个候选方案能够可信地成为标准。

HAWK 是 NIST Additional Digital Signatures 流程中的一项数字签名提案。数字签名让系统能够验证消息由谁签署,以及消息是否遭人篡改。HAWK 旨在抵御来自传统计算机和未来量子计算机的攻击。

该方案依赖于一个被认为难解的格问题。格是一种由点组成的数学排列,其结构可用于构建密码学方案。HAWK 的紧凑签名和性能特征使其成为一个颇具吸引力、值得进一步评估的候选方案。

Anthropic 表示,一名研究人员在一个智能体研究框架中使用了 Claude Mythos Preview。该系统审阅文献、推理数学结构、运行实验,并与研究人员交流发现。

这一过程发现了一个非平凡自同构,即一种保持数学结构不变的对称性。早期研究已表明,找到这种对称性可能支持一项攻击。尚未解决的问题是,HAWK 的特定构造中是否存在可被利用的版本。

根据 Anthropic 的研究披露,模型辅助流程找到了此前缺失的关联。它实现了一种基于搜索更小有效空间的更快密钥恢复方法。

针对较小的 HAWK-256 挑战参数,Anthropic 报告称,预期攻击成本从 2^64 次操作降至 2^38 次。这一降幅极大,尽管这些挑战参数原本并非用于部署。

结果也影响了更大的 HAWK 参数集。Anthropic 得出结论,为维持预期安全水平,需要显著增大密钥。这一变化将抹去支撑 HAWK 候选资格的重要效率优势。

HAWK 的设计者随后从 NIST 流程中撤回了该提案。此次撤回避免了一个已被削弱的候选方案继续走向标准化或部署。

这一结果证明了审查机制在采用前发挥了作用。NIST 的公开竞赛有意让提案接受对抗性分析。研究人员发现弱点时,候选方案本就可能被淘汰。

然而,这一发现的速度和来源仍然重要。HAWK 在获得广泛专家关注后,AI 辅助工作流仍在约 60 小时内找到了决定性的攻击路径。

Anthropic 估计,开发和验证此次攻击大约花费了 10 万美元的模型使用成本。对个人研究人员而言,这很昂贵;但与攻破被广泛信任的密码技术的潜在价值相比,这一成本并不高。

因此,这一事件改变的不只是候选名单。它还改变了人们对于资金充足的实验室能在短时间内进行多少密码分析探索的预期。

为什么后量子密码学无法弥补这一安全缺口

PQC 应对的是攻击者计算机的能力,而 HAWK 事件涉及的是防御者数学设计中的弱点。

后量子算法围绕被认为可同时抵御传统和量子计算的难题构建。它们在特定角色中替代了 RSA 和椭圆曲线密码学等易受攻击的公钥系统。

这种保护有明确边界。抗量子假设无法弥补被忽略的捷径、结构性对称、实现错误、被盗密钥、受损端点或存在缺陷的协议集成。

Claude Mythos 攻击的是第一类问题。它没有使用量子计算机,也没有模拟实际可行的量子攻击。它是在 HAWK 的数学结构中找到了更高效的传统攻击路径。

这一区别解释了为何该结果不会削弱迁移至 PQC 的更广泛理由。在具有密码学意义的量子计算机到来之前,当前公钥系统仍需替代方案。

NIST 于 2024 年最终确定了首批三项主要 PQC 标准,包括用于建立共享密钥的 ML-KEM,以及用于数字签名的 ML-DSA 和 SLH-DSA。NIST 表示,HAWK 的发现不会影响这些已最终确定的标准。

组织可在 NIST 的PQC 标准页面确认这一边界。ML-KEM 和 ML-DSA 使用的构造不同于此次攻击所针对的特定 HAWK 机制。

教训并不是抗量子密码学已经失败,而是“抗量子”描述的是对某一类计算威胁的抵抗能力,并非对所有形式密码分析的免疫力。

同样的区别也适用于已部署系统。一个组织可能完成 PQC 迁移,却仍因薄弱的访问控制而暴露私钥;它可能保护了网络流量,却让 AI 智能体通过获授权工具泄露数据。

有效的签名算法也无法判断已签署指令是否恶意。它验证真实性和完整性,而非验证受信任系统是否作出了安全决策。

因此,PQC 只是安全的一层。它还需要密钥管理、安全实现、经验证的更新、访问控制、监控以及快速算法替换能力作为配套。

在这些条件下,密码敏捷性变得尤为重要。密码敏捷性是指将系统设计为让团队无需重建周边应用即可更换算法和密钥。

这种能力一直都很有用。AI 辅助密码分析使其在运营层面变得紧迫,因为从发现到广泛知晓之间的间隔可能缩短。

企业还需要准确的密码资产清单。团队必须知道算法出现在哪里、哪些供应商控制它、它保护哪些数据,以及它们能多快完成替换。

在所有地方部署同一种新算法的迁移方案,可能造成另一种集中风险。如果该算法后来出现弱点,每个依赖它的系统都会同时进入修复队列。

混合设计可以在过渡期间降低这种风险。它们将传统组件与后量子组件结合,因此若其中一层遇到意外问题,另一层仍可发挥作用。

混合密码学并非永久性保障。它会增加复杂性、扩大消息体积、提高互操作性要求,并带来更多集成错误的机会。但在较新的算法积累更多审查期间,它仍可提供有用的多样性。

Claude Mythos HAWK 攻击强化了这样一点:安全依赖于可替换的组件和分层控制。它并不支持在所有数学不确定性消除前冻结 PQC 部署。

等待将保留对已知量子风险的暴露;在没有替换计划的情况下推进,则会造成另一种脆弱性。安全团队必须同时管理这两种压力。

AI 正在压缩密码分析时间线

最具影响的变化并非 AI 找到了一项攻击,而是它能够以机器规模反复搜索弱点。

传统密码分析结合了深厚的专业知识、直觉、文献审查、实验和细致验证。进展可能需要数月或数年,其间会经历许多无成果的路径。

Anthropic 的工作流自动化了这一循环的部分环节。Claude Mythos 搜索论文、提出关联、编写实验代码、检查结果,并在有限的人类指导下修订方法。

HAWK 研究并非完全自主。一名研究人员提供指导,并帮助判断新出现的结果是否具有意义。在披露前,人类专家和受影响的设计者也参与其中。

不过,劳动分工仍然重要。在同一时间内,AI 可以生成比人工探索更多的候选论证和实验。随后,人类可以专注于验证及其影响。

Anthropic 报告的第二项结果说明了这种扩展潜力。一个独立框架让 Claude Mythos 自主开发了针对七轮 AES-128 的更快攻击。

AES-128 通常采用十轮变换。研究人员检查简化轮数的变体,以了解完整算法的安全余量。攻破七轮并不意味着攻击者能够攻破生产环境中的 AES-128。

Anthropic 报告称,相较此前针对该简化版本的攻击,其方法实现了 200 倍至 800 倍的改进。该公司还表示,这项攻击仍然成本高得不切实际,且不会威胁完整 AES。

这些限定至关重要。缺少它们,一项狭窄的研究结果就会变成 AI 攻破了保护现代系统的加密技术这一错误说法。

其价值在于研究过程。HAWK 和简化轮数 AES 涉及不同的密码学结构,但同一类 AI 系统为两种分析都作出了贡献。

Anthropic 和学术研究人员随后推出了 CryptanalysisBench,这是涵盖六个密码学类别的 191 项任务集合。智能体必须利用真实实现,并通过正式安全测试。

该基准的初步结果表明,前沿模型可以复现许多针对故意存在缺陷方案的已知攻击。研究人员还报告了涉及其他实验性密码设计的新发现。

基准并不能衡量开放式密码分析所需的每一项技能。其任务具有明确环境、可访问的实现以及可衡量的成功条件。

真实研究始于更大的不确定性。模型必须决定哪些假设重要、识别有用文献、避免无效证明,并区分真实弱点与实验噪声。

HAWK 案例值得注意,是因为它跨越了其中一部分鸿沟。该系统不只是重新发现隐藏在训练练习中的答案。Anthropic 表示,它开发出一项此前未知的攻击,并提供了可运行的演示代码。

独立审查仍然必要。Anthropic 开发了模型、运行了项目,并发布了主要性能声明。这会产生强调成功、淡化失败尝试的动机。

该公司承认,许多会话并未产生新的发现。它还报告称进行了大量人工验证,这使得“模型独立解决了整个问题”的简单说法变得更为复杂。

一项独立评估既强调了这一结果的重要性,也指出了 Anthropic 更广泛营销叙事中的不确定性。这种平衡是恰当的。

这项攻击在技术上可能意义重大,但并不能证明 AI 已成为自主的密码分析大师。一次成功结果并不能揭示该系统在未知研究问题上的失败率。

然而,攻击者并不需要每次尝试都具备可靠的天才表现。他们可以并行运行搜索,保留成功路径,并丢弃数千次失败。

这种不对称让防御者承受压力。标准制定机构必须认真审查每一项可信结果,而攻击者只需要一条行得通的路径。

真正的瓶颈是人工验证

只有当防御者能够足够快地验证、确定优先级并修复发现的问题时,更快的发现速度才会转化为安全收益。

AI 漏洞研究带来了一个熟悉的规模化难题。生成一份看似可信的报告,比确认其正确性、衡量其影响、协调披露以及交付安全修复方案更便宜。

密码学加剧了这一问题,因为微小的数学错误就可能使整个攻击失效。一段有说服力的模型解释无法替代证明、可复现代码或专家审查。

误报会消耗稀缺的注意力。如果实验室生成数千项推测性的弱点,维护者和标准团队就必须将真正的发现与自信的错误区分开来。

真阳性则带来另一种负担。每一项都可能需要独立分析、与设计者沟通、制定新参数、更新实现、进行互操作性测试以及修订合规指南。

对 HAWK 的响应发生在有利条件下。该算法仍处于开放的标准化流程中,且没有生产系统依赖它。

其设计者可以撤回该候选方案,而不必迫使组织轮换密钥或更换证书。当 AI 在广泛部署的软件或协议中发现弱点时,情况将不会如此。

生产环境中的密码学存在漫长的依赖链。操作系统、浏览器、云平台、硬件模块、嵌入式设备、身份服务和第三方库可能共享同一种原语。

即使数学上可靠的替代方案,也可能需要数年才能覆盖每一个终端。供应商发布修复后,不受支持的设备和硬编码依赖关系仍可能让易受攻击的组件继续服役。

AI 可能会更频繁地暴露这一修复缺口。如果攻击性用户在防御者建立足够的接收处理能力之前获得同样的能力,它也可能扩大这一缺口。

Anthropic 将 HAWK 项目描述为负责任的研究。该公司称,它在 6 月与 HAWK 的作者分享了攻击结果,并通过 NIST 渠道协调发布。

由于 HAWK 尚未部署,这一流程降低了即时风险。未来的结果可能涉及无法在短暂披露窗口内安全修补的系统。

因此,访问政策成为安全架构的一部分。实验室必须决定哪些人可以使用先进的网络能力,哪些活动需要监控,以及何时某项结果需要强制审查。

限制单一模型无法解决问题。能力会通过新模型、开放研究、蒸馏系统和专用智能体框架扩散。

更持久的防御是扩展验证能力。标准机构需要可复现的提交材料、自动化测试环境、独立审查者和明确的证据要求。

供应商需要能够接收机器生成报告、又不会淹没人类响应团队的系统。报告应包含代码、受影响的配置、攻击假设和可重复的影响测量。

AI 也可以协助处理这一防御端队列。独立系统可以复现实验、比较补丁、检查依赖关系,并归类重复发现。

不过,使用同一模型提出并批准某项结果,会造成明显的利益冲突。独立验证应涉及不同工具、独立提示词和合格的人类判断。

安全团队还应避免将每一项数学改进都视为紧急情况。HAWK 攻击改变了一个候选算法的安全性估计,但更大的参数仍然不切实际,难以攻击。

同样,针对缩减轮数 AES 的结果并不意味着应轮换生产环境中的 AES 密钥。反应过度会浪费资源,并削弱人们对未来披露的信任。

正确的响应取决于证据、部署状态、攻击成本和受影响的安全假设。这些因素必须在每一份 AI 生成的报告中保持明确。

安全负责人接下来应关注什么

三个信号将表明 Claude Mythos HAWK 攻击是一次孤立的成功,还是安全研究发生持久变化的开端。

第一个信号是独立复现。Anthropic 之外的研究人员必须验证 HAWK 技术、其复杂度估计,以及它在不同参数选择下的影响。

可运行的演示代码会提高可信度,因为研究人员可以观察到被恢复的挑战密钥。但这并不会自动验证对更大实例的每一项外推。

独立密码学家还应测试相关构造是否包含可比的对称性。更广泛的模式将加大其他基于格的设计所面临的压力;而仅限于 HAWK 的结果则会缩小影响范围。

NIST 对撤回的处理提供了第二个信号。其附加签名流程的部分目的,是选择具有不同性能和安全属性的算法。

相关问题在于,AI 辅助审查是否会成为候选算法评估的标准组成部分。NIST 已通过其签名项目让提案接受公众审查。

正式的 AI 评估要求将强化这样一种观点:标准流程正在适应变化。仅靠非正式实验,审查覆盖范围仍会依赖个别实验室,以及对昂贵模型的不均衡访问。

第三个信号是其在未知密码分析问题上的表现。当模型或开发者可以直接围绕已知任务进行优化时,公开基准的价值会降低。

研究人员需要受控测试:保留隐藏问题、记录未成功的尝试,并将模型输出与人工贡献区分开来。报告应同时包含成本和耗时,以及成功结果。

在互不相关的算法上反复取得新颖结果,将支持 Anthropic 更广泛的主张。若无法复现这些收益,则可能表明 HAWK 恰好匹配了一种有利的问题结构。

安全负责人不应等待这场争论尘埃落定后再采取行动。他们可以梳理密码依赖关系,在采购中要求具备替换路径,并测试关键服务能够多快轮换算法。

他们还应将量子准备与通用 AI 安全区分开来。PQC 用于保护数据和身份验证,抵御一种特定的未来计算能力;它并不约束获得授权的 AI 智能体如何使用已解密的信息。

安全的组织需要同时具备这两类项目。一类降低遭受量子解密的风险,另一类管理模型访问、工具权限、数据流、监控和人工授权。

因此,近期的决策并不是选择 PQC 还是 AI 防御,而是现有安全运营是否能够吸收更快的发现速度,同时完成艰难的密码迁移。

请在下一次架构审查时提出一个实际问题:如果 AI 系统明天使某个受信任算法失效,你的团队能否定位每一项依赖关系并安全地完成替换?

Claude Mythos HAWK 攻击表明,发现周期正在缩短。组织现在需要能够跟上节奏的替换、验证和治理周期。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page