top of page

Anthropic Simon Willison 引述揭示 AI 密码分析的真正考验

Anthropic Simon Willison 的报道如今带来了更尖锐的警示:Claude 找到了两项密码学进展,但两种攻击都不会危及当今运行中的系统。真正的矛盾在于别处:政府和工程师正在选择未来数十年保护数字系统所需的数学基础,而 AI 密码分析能力也在不断提升。

2026 年 7 月 28 日,Anthropic 表示,Claude Mythos Preview 改进了针对 HAWK 和缩减轮数版 AES-128 的攻击。HAWK 是一种拟议的后量子签名方案。AES 则是支撑无数安全应用的成熟对称密码算法,不过 Anthropic 测试的仅是一个刻意削弱的变体。

Simon Willison 在 7 月 29 日引用约翰斯·霍普金斯大学密码学家 Matthew Green 的观点前重点介绍了这项工作。Green 认为,AI 密码分析正出现在一个异常有利的时刻。行业正从 RSA 和椭圆曲线签名迁移至旨在抵御量子计算机的新问题体系。

这一时机形成了核心张力。Claude 的成果可在标准投入生产前加强公开审查。然而,更快的自动化密码分析也可能压垮负责验证发现、协调披露及替换受损设计的人类机构。

Anthropic Simon 研究改变了密码分析的基准线

重要的变化并非 Claude 破解了已部署的加密系统,因为它并没有。Claude 针对两个经过严格限定的目标,实现了研究层面的改进。

Anthropic 的第一项成果涉及 HAWK——一种基于格的数字签名方案,正在接受 NIST 额外后量子签名遴选流程的评估。数字签名让软件能够验证身份并检测未经授权的改动,同时不会泄露私有签名密钥。

HAWK 此前已历经大约两年的两轮公开评估。根据 Anthropic 的密码学研究,Mythos 在约 60 小时的工作后改进了已知最优攻击。

该模型发现了一个非平凡自同构,即 HAWK 底层格结构中的一种数学对称性。先前研究已证明,找到这种对称性即可实现攻击;但尚未证明 HAWK 中相关的对称性可以被获取。

Anthropic 表示,由此产生的枚举攻击降低了最小 HAWK-256 挑战参数的有效安全性。预计密钥恢复成本从约 2^64 次操作降至 2^38 次操作。

这种差异非常显著。按照所述模型,两项估算之间相差 2^26 倍,约等于少了 6700 万倍的工作量。不过,HAWK-256 是一个较小的挑战参数,而非生产配置。

该攻击仍属于指数复杂度,因此其成本会随密钥变大而快速上升。Anthropic 表示,攻击更大的 HAWK 参数仍不具备可行性。这一弱点也仅针对 HAWK,并非针对整个格密码学领域。

第二项成果针对的是七轮 AES-128。生产环境中的 AES-128 会执行十轮重复变换,而研究人员会有意减少轮数,以研究其安全余量的变化。

Mythos 开发了一种名为 Möbius Bridge 的指纹识别方法。Anthropic 表示,该方法从现有的中间相遇攻击中移除了一个 256 路猜测步骤;这类攻击以增加存储空间为代价减少计算量。

其他优化使其相较以往攻击的估算速度提升达到 200 倍至 800 倍。然而,该实验仍假定能够获取 2^105 个选择明文,这对于任何实际操作而言都是不可能的规模。

因此,该模型并未破解实际部署的 AES。它推进的是一条涉及弱化实验室版本的专门研究路线。这一区分,将具有意义的科学成果与迫在眉睫的网络安全紧急事件区分开来。

两条研究路线的成本都很高。Anthropic 估计,每项主要成果的 API 使用成本约为 10 万美元。AES 调查在得出已发表的方法前,生成了约 10 亿个输出 token。

Anthropic Simon 讨论之所以重要,是因为 Willison 聚焦于:这项工作似乎几乎不需要专家级提示。人类操作员多次要求模型继续追求更具挑战性的结果,而不是接受其最初“任务不可行”的结论。

这些干预很重要,但并未包含最终的数学洞见。模型提出候选变换,否决失败的思路,测试替代方案,并通过一个智能体式研究过程形成核心指纹方法。

这使讨论超越了“AI 是否能复述已知密码学文献”的问题。更难的问题是,持续的模型推理、计算工具和基础研究方向是否能够产出有用的新攻击。

为什么 Matthew Green 称这一时机近乎理想

AI 密码分析正随着安全界替换其最重要的公钥基础而出现,使防御性审查具有异常高的价值。

Green 的论点始于后量子转型。当前的公钥系统通常依赖 RSA 或椭圆曲线密码学,其安全性建立在足够强大的量子计算机能够高效求解的数学问题之上。

这一威胁并不意味着今天已经存在具有密码学实用价值的量子计算机。它意味着,长生命周期系统必须在这种机器可用之前采用替代算法。

迁移需要多年,因为密码学深植于操作系统、浏览器、身份服务、嵌入式设备、证书、支付基础设施和企业软件之中。已存储的加密信息还可能遭受“现在收集、日后解密”攻击。

NIST 于 2016 年启动了正式的后量子标准化工作。该机构于 2024 年 8 月最终确定了前三项主要后量子标准,涵盖通用加密和数字签名。

该机构还在继续评估其他签名方案。多样性至关重要,因为不同组织面临不同的性能约束,而依赖单一数学家族可能集中系统性风险。

HAWK 作为基于格同构的紧凑型签名设计进入了这项更广泛的筛选。它具有一些特性,可能使其在签名大小、密钥大小或实现权衡重要的场景中颇具吸引力。

Claude 的成果对这种平衡提出了挑战。Anthropic 认为,要恢复预期的安全余量,需要更大的 HAWK 密钥,这将削弱该方案原本具有吸引力的若干特性。

这一结果并不说明公开标准化失败了。开放竞赛本就旨在让候选算法在软件供应商和政府依赖它们之前接受对抗性分析。

历史记录说明了原因。另一项后量子候选方案 SIKE 在经历多年研究后,研究人员于 2022 年发现了一种毁灭性的经典攻击。据报道,该攻击可在一台普通笔记本电脑上运行。

Green 将 AI 视为在防御回报最高的时期扩展这种对抗能力的途径。Simon Willison 的Matthew Green 引述将这一时刻形容为公开 AI 密码分析的“完美时机”。

其益处不止于淘汰弱候选方案。持续、可信的攻击可以帮助研究人员识别哪些假设值得信任,以及哪些设计模式会造成隐藏风险。

密码学并不会因为尚未发现攻击而获得信任。信任源于多年公开尝试、已发表的失败、改进的攻击、修正后的证明以及独立复现。

AI 可以增加这一过程中被探索的假设数量。它可以检索晦涩论文,将数学条件转化为实验,编写验证代码,并保持多条研究分支同时活跃。

这种能力很重要,因为专家注意力稀缺。许多算法受到的分析远少于 AES;自 NIST 于 2001 年选定 AES 以来,其设计便一直受到持续审查。

最佳的防御情形类似于面向数学的持续自动化测试。模型提出攻击,计算工具淘汰薄弱思路,专家验证存留下来的方案,设计者再修订其方案。

关注这项工作的开发者不应将每一项缩减轮数的结果解读为放弃获批原语的理由。相反,他们应区分生产影响与未来研究能力的证据。

知识管理在此变得相关,因为验证需要保存提示词、源论文、失败假设、代码、审阅者意见和披露决定。可检索的工程知识库能够在漫长审查期间让这些证据保持关联。

后量子转型为 AI 密码分析提供了清晰的防御目标。候选系统是公开的,部署仍然有限,机构也已有接收关键分析的流程。

这种有利的契合不会永远持续。一旦脆弱原语被广泛部署,发现其弱点将带来紧急的替换成本,以及潜在危险的披露问题。

真正的竞赛是 AI 发现速度与人类验证能力之争

主要的对手不是 Claude 与人类密码学家,而是自动化发现速度与确立事实所需的有限人类能力之间的较量。

Anthropic 将 Mythos 描述为在两项调查中均大致自主运行。不过,发现与接受仍是两个不同阶段,且第二阶段的进展要慢得多。

HAWK 攻击相对容易验证,因为研究人员可以端到端实现密钥恢复流程。验证者可以生成密钥、执行攻击,并确认其是否恢复了秘密信息。

AES 结果则带来了不同的挑战。其要求仍远超实际执行能力,因此审阅者无法简单地以所声称的规模运行完整攻击。

相反,他们必须检查数学推导、测试更小的实例、分析复杂度,并确认每一步降维都如描述般运行。Anthropic 表示,两名研究人员为此投入了数百小时。

模型在大约一周内形成了 AES 思路。尽管研究人员高度专注于这一主张,但仍花了近一个月才建立信心。

Anthropic 还承认,其研究人员并非密码学专家。他们必须学习足够多的领域知识,才能验证该方法并准备论文。

这一披露支持两种解读。它表明模型可以帮助非专业人士取得高级成果;它也说明了为什么在该领域接受这些成果之前,独立专家审查仍不可或缺。

模型能够生成看似有说服力的数学论述,同时夹带细微错误。一段长推导可能依赖一个未经证明的假设、一篇被遗漏的既有论文,或是在现实内存成本下失效的复杂度估计。

新颖性也带来另一个问题。当文献检索不完整时,重新发现一项晦涩成果可能显得像是新发现。这一风险在密码学中尤为突出,因为相关工作可能跨越数十年、不同语言、研讨会、预印本和专业符号体系。

独立的 CryptanalysisBench 研究提供了更广泛的背景。其作者汇集了涵盖六类密码学体系、三个难度层级的 191 项任务。

据报道,五个前沿模型攻破了 65% 至 86% 的已知存在实用攻击方法的方案。它们还解决了更高难度第二层级中的 6 至 12 项完整强度任务。

这些数字并不能证明模型具备不受限制的专家能力。基准测试简化了环境,所选问题可能不同于开放研究,且性能取决于脚手架、推理预算和评估规则。

不过,这些结果支持了 Anthropic 更谨慎的主张:现代模型能够开展真正的密码分析工作。相关问题不再是这种能力是否完全存在。

瓶颈如今转向如何审查不断增长的大量看似合理的输出。Anthropic 预测,学术密码学可能会面临与软件漏洞研究中已开始出现的相同分诊压力。

这不仅是行政管理层面的担忧。错误主张可能浪费专家数周时间,损害人们对健全标准的信心,或对仍然安全的系统引发公众恐慌。

有效主张的管理难度可能更大。审查人员必须复现结果、定位受影响系统、联系设计者、与标准机构协调,并决定技术细节何时应当公开。

庞大的推理预算进一步加剧了这种失衡。AES 工作消耗了 10 亿个输出 token,而人类无法直接阅读或审计如此大的体量。

研究人员需要结构化证据,而不是原始模型转录文本。有效系统必须记录哪些主张经受住了测试、哪些代码支持这些主张,以及人类判断在哪些环节改变了调查方向。

AI 实验室也需要激励机制,以奖励审慎的否定性发现。即便目标尚未部署或被刻意弱化,发布“AI 攻破加密”的轰动标题仍可能吸引关注。

Simon Willison 通过强调 Anthropic 明确说明的限制避免了这一陷阱:两项结果均不影响当前生产系统。他的表述使焦点保持在研究方法及其未来影响上。

因此,竞争将由验证基础设施决定。如果审查队列增长速度快于可信专家的处理速度,仅靠更快的模型无法让密码学更安全。

Anthropic Simon 叙事不应作出的过度主张

Claude 的攻击值得关注,但它们并不表明互联网加密正在崩溃,也不表明 AI 已击败现代密码学。

HAWK 的结果影响的是一种拟议中的签名方案。它并未削弱 NIST 已选定的标准化后量子算法、其他签名候选方案,或所有基于格的构造。

HAWK 也没有已知的生产环境部署规模。在评估期间将其移除或修订,代表的是标准流程在广泛部署前正常发挥作用。

AES 的结果则更容易被误述。完整 AES-128 使用十轮,而 Mythos 攻击的是七轮。减少三轮改变了被分析对象。

研究人员研究减轮密码,是因为改进可能揭示结构性洞见。然而,针对七轮的攻击并不会自动延伸至八轮、九轮或十轮。

其数据需求同样重要。此前的攻击假设拥有 2^105 个选择明文,而 Anthropic 的改进并未使这一要求在实际操作上变得可行。

从规模来看,2^105 大约相当于 40 万万亿亿个输入。没有攻击者能够针对真实服务收集、传输、存储或处理如此多的选择加密结果。

Anthropic 自己的脚注称,实现这项减轮攻击仍将花费数亿美元。即便这一估计也是针对被弱化的密码,而非已部署的 AES-128。

该公司应因突出说明这些边界而获得肯定。二次报道和社交媒体帖子仍可能抹去这些限制,把“改进的学术攻击”变成“AI 破解 AES”。

关于归因也仍有未解问题。Anthropic 发布了展示模型活动的材料,但任何复杂的智能体工作流都混合了模型输出、脚手架设计、工具访问、目标选择与人类反馈。

人类提示很简短,有时主要只是鼓励。但人类选择了研究目标、构建了环境、审查了输出,并决定哪些分支值得继续投入计算资源。

因此,将这项工作称为完全自主会夸大证据。更准确的描述是:在有限实质性指导和广泛人类验证下开展的持续智能体研究。

成本也限制了其可推广性。每项结果约 10 万美元,对前沿实验室或政府项目而言尚可承受;但对大多数大学团队或标准组织来说,并非日常支出。

未来模型或许能够降低这一成本。目前,这项结果证明的是集中投入的大规模推理预算能实现什么,而不是每位开发者都能通过一次简短聊天复现什么。

基准测试证据也应保持同样克制。对已知破解的成功证明了搜索与推理能力,但不能证明模型会可靠地识别生产密码学中未知的缺陷。

研究选择可能造成可见性偏差。成功调查会成为论文,而失败运行、重复结果和无法验证的主张获得的公众关注较少。

Anthropic 指出,许多会话没有产生任何发现。在评估这种方法的效率和可靠性时,这一细节应始终处于核心位置。

独立确认将提供最有力的检验。HAWK 作者、NIST 参与者和外部密码学家需要审查该攻击的安全性估计及其影响。

CyberScoop 的技术报道称,Anthropic 在发表前与学者协调,并披露了 HAWK 发现。这一过程提高了可信度,但发表只是公共审查的开始,而非结束。

最大的未知数在于目标变化后会发生什么。拟议方案和减轮密码比保护当前通信的已部署算法更适合成为研究对象。

若 AI 生成了常用协议中的缺陷,将带来相互冲突的责任。研究人员需要足够开放以实现独立验证,但过早发表可能会向攻击者提供可操作的方法。

在外部机构获得可比访问能力之前,模型提供商也可能已掌握实质性能力。这种不对称将引发有关监督、披露时间表以及由谁决定发布哪些研究的问题。

这些治理问题并不否定防御性论据。它们表明,研究能力与制度能力必须同步增长。

三项信号将表明 AI 是否让密码学更安全

下一阶段取决于可复现性、标准采纳情况,以及验证系统能否与模型生成的发现同步扩展。

第一项信号是对 HAWK 攻击的独立复现。外部研究人员应确认该非平凡自同构、HAWK-256 的 2^38 估计,以及对更大参数的影响。

复现将强化这样一种主张:智能体模型发现了在长期公开审查中被遗漏的有意义弱点。若出现重大修正,则会削弱关于 Claude 研究可靠性的主张。

第二项信号是 NIST 对 HAWK 及类似候选方案的处理。审查人员可能拒绝 HAWK、修订其参数、要求进一步分析,或认定其他优点足以支持继续考虑。

确切结果不如过程重要。标准机构需要一种可重复的方式来接受 AI 辅助提交,同时不降低证据要求。

AI 生成的密码分析应接受与人类工作相同的数学审查。它还可能需要额外记录,涵盖推理设置、脚手架、工具访问、失败路径和人类干预。

第三项信号是 Anthropic 承诺扩展公开评估。该公司表示,计划举办学术研讨会,并进一步发布针对其他减轮密码攻击的材料。

Anthropic 报告了一项针对 13 轮 LEA 的初步攻击,在现代桌面电脑上运行不到一小时。完整 LEA 使用 24 轮,因此该结果同样不会立即影响生产环境。

它还描述了一项针对六轮 Serpent-128 的攻击,其完整设计使用 32 轮。据报道,其他有限改进涉及 Salsa20、Poseidon 和 SHA-1。

这些后续主张需要论文、代码、外部审查和精确的威胁模型。持续涌现的独立确认结果将支持 Green 的乐观解读。

相反,若出现大量不清晰或重复的主张,则表明验证瓶颈正在显现。届时,该领域在扩大原始发现量之前将需要更好的筛选机制。

从长期来看,研究人员应关注模型是否会从攻击简化变体,进展到评估完整候选设计。完整轮数的生产级原语设定了高得多的门槛。

他们还应衡量 AI 在人类审查人员之前发现缺陷的频率。个别成功案例具有参考价值,但系统性比较才能揭示模型是在扩大覆盖范围,还是主要重复专家工作。

HAWK 规范及相关公开材料提供了进行该测试的合适环境。开放规范让独立团队能够质疑设计本身,也能质疑 Anthropic 的分析。

组织无需因为这项研究改变已部署的 AES。他们应继续遵循获批的密码学指南,盘点遗留公钥依赖,并准备后量子迁移计划。

安全负责人还应建立接收 AI 辅助发现的流程。这些流程需要技术分诊、可复现性要求、披露渠道,以及对修复决策的明确责任归属。

研究人员应保留否定性结果。失败的方法可以避免重复工作、揭示模型局限,并显示某项成功主张究竟源于系统性搜索还是罕见运气。

Anthropic 与 Simon 的讨论最终呈现了能力与需求之间难得的一致。世界正需要更广泛审查陌生安全假设之际,AI 恰好在对抗性数学方面不断进步。

Green 的乐观态度仍是有条件的。只有当人类能够验证其输出、修订脆弱设计,并在攻击者获得优势前协调披露时,AI 密码分析才能增强安全性。

在目标仍未部署时,标准组织能否建立这种能力?开发者、研究人员和安全团队应密切关注三项信号:独立复现、NIST 的回应,以及 Anthropic 下一轮披露的质量。

这些信号将揭示 Claude 的工作是开启更安全的持续密码审查时代,还是仅仅制造一条更快增长、等待人类判断的主张队列。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page