Astra 破解 Enigma 刚刚为 Claude Opus 提供了第二个目标
OpenAI 的 GPT-6 Astra 经过两天工作,成功还原了一则 82 字母的 Enigma 消息;尽管研究人员自 2005 年以来一直未能破解它。Astra 破解 Enigma 的成果六天后,Anthropic 的 Claude Opus 5 又完成了另一次成功破解。两个项目共同将历史密码分析转化为对前沿 AI agents 异常具体的测试。
这并非一个聊天机器人猜出可读德语的故事。两个项目都结合了档案证据、可执行软件、密码学搜索,以及模型自身结论之外的验证。它们的重要性在于,AI 能够完成这条研究闭环中的多少环节。
两个系统抵达答案的路径也不同。Astra 在研究人员主导的调查中选定目标,并开发了大部分工具。Claude 则获得了预先准备好的工作台、历史资料以及更强的人类指引。这使 Astra 与 Claude Opus 的对比更像是两种研究工作流的案例,而非一场基准测试竞赛。
Astra 破解 Enigma,还原了一则自 2005 年以来始终未解的消息
关键变化并不是 Enigma 再次被破解,而是一次 AI 辅助调查解决了一则现代研究人员此前无法还原的具体消息。
这则消息编号为 MVUEH,发送于 1941 年 7 月 10 日。一个战术呼号为 2ny 的德国陆军无线电台,将其发送给党卫队骷髅师的军需无线电台。接收台将其记录为第 172 号消息,时间为下午 5 点 30 分。
历史密码分析人员早已了解 Enigma 的机械结构及其普遍弱点。然而,要解密一则保存至今的具体消息,仍需要正确的机器配置、准确的密文,以及有关缺失明文的有用线索。
MVUEH 在这三方面都存在问题。它仅包含 82 个加密字母,可供统计分析的文本有限。其存留副本中也存在不确定或转录错误的字符。
该机器配置与同日使用的其他已知密钥不同。它的转子顺序为 253,而两个相关密钥使用的是 512 顺序。左侧转子在第 72 个字母处罕见地发生一次进位,又增添了复杂性。
开发者 Carter Leffen 通过让 GPT-6 Astra 检查 Crypto Cellar Research 发布的未破解消息,启动了这项调查。Astra 将 MVUEH 选为最有希望的目标。随后,它将该消息与另一份已还原明文的电报 SIPVX 联系起来。
那则相关消息中包含重复出现的地名 ROSENOWROSENOW。调查将这 14 个字母作为 crib,即用于测试可能 Enigma 设置的一段疑似明文。
crib 并不会直接揭示答案。它通过排除无法生成该疑似短语的配置来限制搜索范围。其余字母仍必须在同一把机器密钥下组成连贯文本。
根据已发布的 MVUEH 案例研究,该调查在还原密钥前记录了 12 个不确定的密文位置。这些备选项产生了 13,824 种允许的读法。
这个顺序很重要。在看到答案之前记录不确定性,可以减少人们为了迎合预期结果而重新解释模糊笔迹的诱惑。
Astra 和专业 agents 审阅了资料、构建搜索程序、运行实验,并质疑中间结论。调查以 Python 和 C++ 开发了 Enigma 模拟及 Bombe 风格搜索软件。
最终得到的密钥解密了全部 82 个重建后的正文字符。它也与独立记录的消息头相符,后者并未用于选择最终明文。
还原出的德语文本大意是请求一条行军路线,报告发件人在 Rosenow 的位置,并要求立即通过无线电回复。推测的署名为 Waschbusch,但这一读法仍属暂定。
该结果于 2026 年 9 月 15 日报告给历史密码学研究人员 Frode Weierud。Weierud 审查了密钥和明文,并认定该解法正确。
详细的密码分析审查指出,这项工作还揭示了早期转录中的错误。它确认该消息使用的密钥与 7 月 10 日其他已知通信完全不同。
因此,该项目的成果不只是生成了看似合理的德语文本。它找到了一个能够解释密文、独立消息头、相关通信以及 Enigma 模拟器行为的配置。
这正是该结果值得关注的原因。语言模型可以在未还原历史消息的情况下生成令人信服的文本。而在这里,可执行证据和文献证据为这种倾向划定了边界。
真正的成果是研究闭环,而非一次幸运的明文猜中
Astra 最突出的贡献,是协调了研究人员通常需要借助不同工具、并通过反复人工交接完成的多种工作。
调查从目标选择开始,而不是从一个狭义、明确的解码请求开始。Astra 审阅了一批未解消息,并因相关材料提供了多种独立验证结果的方式而选择 MVUEH。
它对比了一份已发布的接收端转录文本和一份模糊的发出端副本。它调查了临近通信和已知的每日密钥,也协助构建了能够在明确约束条件下测试机器设置的软件。
这一序列更接近专家研究,而非普通问答。模型必须在不完整文档、历史假设、代码、失败搜索和验证之间切换。
多种早期方法均告失败。已知的同日密钥无法解密该消息。插线板设置假设没有产生可接受结果,而早期的爬山搜索即使在受控条件下表现也不佳。
这些失败迫使调查重新审视其假设。重复的 Rosenow 短语最终提供了更有力的路径,因为它将 MVUEH 与一则已解的相关消息联系起来。
最终分析并不只依赖这段 14 字母的 crib。周围仍有 68 个字母未受约束,必须生成连贯输出。记录在案的消息头随后为恢复出的设置提供了独立测试。
研究人员针对该消息头独立检查了 14,829,646 种物理密钥组合。仅有 923 种仍然兼容,需要进行完整的读法审查。
不同的实现复现了消息和消息头结果。一个独立的可满足性模型——它将机器约束表示为形式逻辑问题——在 42 个抽样状态上得出了相同结论。
重新加密提供了另一项必要验证。恢复出的设置将拟议明文重新转换回重建后的密文。
该测试确认了内部一致性,但本身并不能确立历史解释。错误转录或选择不当的 crib,仍可能误导一个内部一致的计算。
调查通过将重新加密与消息头、相关消息、预先声明的来源备选项和外部审查结合起来,强化了其主张。这些证据无法消除所有编辑层面的不确定性,尤其是围绕署名的问题。
首次独立审查也存在局限。SWARM 使用另一套模拟器复现了预期的正文和消息头结果,但没有重复完整搜索。因此,它确认了恢复出的配置,却没有独立地重新发现该配置。
这一区别是理解 Astra 如何破解 Enigma 的核心。多个 AI agents 彼此达成一致,并不能算作独立确认。它们可能继承同样错误的来源、假设或软件缺陷。
有意义的检验来自其对话之外的证据,包括消息表单、独立记录的消息头数据、不同实现、历史通信记录,以及经验丰富的密码分析人员的审查。
这一工作流为密码学之外的 AI 辅助研究提供了有用范式。agent 可以搜索文档、编写分析代码并提出解释;但只有当外部证据能够否定一个看似完美的错误时,它的结论才具有可信度。
这也是良好的知识管理成为技术严谨性一部分的地方。研究人员需要在来源文档、假设、实验和修订之间建立可追溯的联系。
结构化的 AI knowledge base 可以保存这些关联。它无法验证密码,但可以让人类审查人员清晰看到证据链。
Claude Opus 随后以另一种方式攻击 Enigma
Claude Opus 5 得出了另一个有效结果,但更强的人类指引塑造了其目标和搜索策略。
9 月 20 日,网络安全研究人员 Jack Willis 还原了另一则消息 FMNGI 的密钥。他在次日通知 Weierud,距离 MVUEH 解法提交验证仅过去六天。
FMNGI 是一则日期为 1941 年 7 月 31 日的入站消息。它由党卫队骷髅师军需无线电台接收,并记录为第 285 号消息。
Willis 向 Claude Opus 5 提供了一个用 Go 编写的密码分析工作台和相关历史资料。相较于 Astra 所获得的环境,这套配置为模型提供了更狭窄且准备更充分的工作环境。
决定性线索来自相关通信。与 Friedrich Hartjenstein 相关的结尾署名产生了 14 字母 crib:XHARTJENSTEINX。
历史密码分析人员此前已记录了 Hartjenstein 署名的多种形式。这使他的姓名成为预期明文的可信来源,而非在看到输出后才编造出的短语。
Claude 使用工作台和提供的材料调查该消息。根据 FMNGI 技术说明,最终密钥搜索在一台 Apple M2 电脑上耗时 13 分 28 秒。
还原出的明文中,德语“纵队”一词出现了错误。Weierud 解释称,该错误可能发生在加密、转录或 Morse 传输过程中。
这一瑕疵强化了一个重要观点:历史消息并非干净的基准测试输入。操作员、无线电条件、笔迹以及后续转录都可能引入噪声。
该消息的第二份档案副本尤其有用。Weierud 于 2026 年 7 月在德国 Bundesarchiv 发现了一批补给部门通信档案。
与第 205 NF 号消息相关的副本,保留了比此前发布的第 285 号版本更准确的密文。它也支持了与 Hartjenstein 的关联。
现有明文汇编或许能够提供更直接的解法。不过,Willis 发起攻击时并未获得那份完整明文。
Claude 辅助搜索转而依靠这名军官的署名作为 crib。这让更广泛的消息内容承担起验证恢复密钥的作用。
这种方法让更多人类专业知识在流程早期介入。Willis 选择资源、提供工作台,并将调查引向一条有历史依据的线索。
Astra 的项目则将更多目标选择和工具开发工作交给模型。其研究人员仍设定目标、评估进展并推动工作向前,但模型探索的是更广阔的问题空间。
这些差异比简单比较 Astra 与 Claude Opus 的得分更重要。一种工作流测试了更广泛的研究自主性,另一种则测试了专家、强大模型与预先准备的技术基础设施之间的聚焦协作。
两者都产出了有价值的结果。但两者都不能证明模型能够独立取代密码分析师、档案研究员、软件工程师和历史审查者。
它们反而表明:当人类研究者掌控目标并要求可核验的证据时,前沿模型能够有效地跨越这些角色开展工作。
图灵的另一项测试是证据,而非模仿
这种历史上的对称性引人入胜,但这些项目并不能证明前沿模型重现了战时破解 Enigma 的成就。
Alan Turing 与模仿游戏密切相关,后者后来被称为图灵测试。它询问的是:通过文字互动,一台机器是否能让人无法将其与真人区分开来。
他在战时的工作则关乎另一个问题。Turing、Gordon Welchman、波兰密码分析师、操作员、工程师以及数千名 Bletchley Park 员工,围绕不断变化的德国密码构建了一套情报系统。
现代叙述常将这项集体努力压缩为一个天才人物和一台机器。真实的行动结合了截获通信、流程失误、缴获材料、统计推理、机电式 Bombes,以及持续的人类判断。
英国 Bombe 利用从已知明文片段中推导出的逻辑矛盾,帮助搜索可能的 Enigma 设置。它并不是简单接收密文,再输出可读答案。
近期项目与那种更早的模式更为接近,而非人们熟悉的聊天机器人的叙事。人类提供了历史语料与研究目标;模型整理线索、编写工具并搜索可能性;外部证据决定其答案是否站得住脚。
不过,将这些结果称作等同于 Turing 的战时工作,会扭曲两段历史。原始密码分析师面对的是一个活跃对手,其流程和密钥持续变化。
Astra 和 Claude 处理的是 Enigma 设计已被理解数十年后的保存信息。它们可以利用公开密钥、已知通信记录、现代计算机、档案发现以及成熟的密码分析技术。
更负责任的说法应当更为克制:前沿 AI 协助恢复了两份此前屡次尝试仍未破解的单独信息。
Leffen 本人的项目明确表示,它并不声称首次破解了 Enigma。每一次转述都应保留这一限定。
这个标题隐喻仍抓住了一些真实之处。这些模型面对的任务中,仅靠有说服力的语言并不足够。它们必须产出可供他人运行和检查的成果物。
这比普通基准测试更严苛。基准测试通常在模型开始前就固定问题、评分规则和预期答案。
档案密码分析并没有如此清晰的边界。源材料可能存在错误;最佳线索可能位于另一份馆藏中;一个看似合理的答案可能因多种互不相关的原因而错误。
因此,成功取决于能否在不悄然改写不确定性的前提下驾驭它。模型必须知道何时搜索、编程、比对记录、质疑转录内容,以及请求外部核验。
这才是图灵另一项测试更有价值的含义。它衡量的是 AI 系统能否参与一条严谨的探究链,而不是它是否听起来像一位专家。
战时记录也提醒人们,不应将破译密码视作孤独天才的成果。有效的密码分析始终结合了人类洞察、机器、流程和机构知识。
2026 年的结果更新了这一协作关系中的工具,但并未取消这种协作关系本身。
Astra 和 Opus 的结果无法证明什么
两个成功案例无法证明普遍可靠性、完全自主性,或具备广泛破解现代加密的能力。
Enigma 在历史上意义重大,但并不代表当今的密码安全。现代加密依赖不同的数学构造、实现方式和威胁模型。
因此,这些信息恢复案例几乎无法说明前沿模型是否能够破解部署得当的现代加密。它们不应被描述为当代加密通信突然暴露的证据。
这些案例也受益于大量先前的人类工作。Crypto Cellar Research 维护了信息语料库,记录未解案例,保存密钥,并连接相关通信记录。
研究人员此前已恢复附近的信息,并研究了反复出现的特征。AI 辅助攻击前不久,新的 Bundesarchiv 发现补充了重复密文和背景证据。
Astra 获得了 SIPVX 中重复出现的 Rosenow 短语这一有用线索。Claude 则获得了 Hartjenstein 的签名、准备好的历史材料和可用的密码分析环境。
这些优势并未让结果变得微不足道。它们界定了这些系统实际完成的任务。
最有力的解读关乎研究压缩。据报道,Astra 在两天内完成的工作,Weierud 认为一位人类研究者可能需要数周或数月。
这一比较来自一位经验丰富的参与者,而非受控的生产力研究。它应被视为知情判断,而不是普遍衡量标准。
Astra 调查中的自主部分也仍需进一步审查。其日志引用了 Crypto Cellar 网站上无法获取的正确 Bundesarchiv 文件标识符。
Weierud 表示不确定模型是如何找到这些引用的。它们可能曾出现在网络其他位置,来自可访问的目录记录,或通过其他途径进入模型。
没有必要编造神秘解释。恰当的回应是保留日志、确定检索路径,并将来源发现与缺乏支持的推断区分开来。
该案例还引发了数据污染问题。当相关材料已存在于模型训练数据或检索环境中时,模型可能看似在独立推理。
在调查开始时,MVUEH 仍被列为未解。然而,在将功劳归因于通用推理之前,研究人员仍必须记录每一项可访问的来源。
可复现性同样尚不完整。重新运行最终验证程序,比重现整个发现过程更容易。
完整复现应从同一份公开语料库开始,保留相同的来源不确定性,并在不复用已发现的已知明文片段位置的情况下独立恢复密钥。
FMNGI 也存在相关局限。一旦研究者提供了工作台和强有力的签名线索,Claude 的搜索便很快完成。13 分钟的运行时间并未衡量识别该线索所需的档案工作。
这些限制并未抹去这一成就。它们说明,为自主科学提出的主张需要比成功的历史调查更严苛的证据。
最站得住脚的结论是具体的:两个由研究者主导的项目利用前沿模型破解了两条不同的未解 Enigma 信息,一位经验丰富的外部专家接受了这两把密钥。
任何更广泛的结论仍是开放的研究问题。
三个信号将显示这是否会成为可重复的方法
下一项考验是,其他研究者能否复现这一工作流、破解更困难的信息,并保存每项决策的可验证记录。
第一个信号是对 MVUEH 进行独立的端到端复现。新团队应从破解前的语料库和已有记录的来源替代方案开始。
如果该团队能在不导入已发布解答的情况下恢复同一把密钥,那么可复用 AI 研究方法的论据将更有说服力。如果复现需要未披露的线索,自主性主张就会削弱。
第二个信号是剩余语料库的进展。Crypto Cellar Research 表示,其馆藏包含近 1,000 条 Enigma 和 Truppenschlüssel 信息。
在 9 月的两次破解之后,仍有七条 Enigma 信息未解。另一个谜题 WEUWY 编号 138 已通过一条平行信息得知明文,但仍缺少其原始密钥。
这些目标并不等同。有些尚未破解,可能是因为幸存密文包含过多错误、信息过短,或不存在有用的已知明文片段。
如果研究人员公开失败的方法、来源不确定性、代码和验证材料,进一步成功将最具意义。仅有一段明文所提供的证据会弱得多。
第三个信号是其在历史密码分析之外的采用情况。核心工作流可以迁移至软件考古、科学文献审查、文档取证,以及其他记录不完整的研究领域。
模型需要定位相关证据、编写工具、检验相互竞争的解释,并将其假设暴露出来供审查。它还应保留负面结果,而非呈现一段流畅的事后叙事。
最后这项要求对企业和知识工作者而言十分重要。许多 AI 系统如今能够令人信服地总结文档,但能维持从来源到结论的可追溯链条的系统较少。
Astra 的 Enigma 破译项目提供了更好的标准。模型应生成可检查的中间成果物,而独立证据仍保有推翻答案的权力。
开发者应关注模型提供商是否让这些工作流更易于审计。实用功能包括持久化研究日志、来源级引用、可复现的工具执行,以及对检索事实与模型推断的清晰区分。
研究人员还应询问由谁控制目标选择。Astra 的相对自由帮助揭示了其更广泛的能力,但自主性也扩大了隐藏假设和无关搜索的空间。
Claude 所处的受限环境减少了这种自由,同时让过程更容易解释。两种安排都不会天然更优。
合适的设计取决于错误的代价和外部核验的可用性。开放式发现受益于探索,而高风险结论则需要更严格的审查关卡。
这些案例留给读者一个实际问题:AI 系统只能给出答案,还是能够帮助建立一份可供持怀疑态度的专家检验的记录?
对 Astra 和 Claude Opus 而言,两条古老的 Enigma 信息提供了令人鼓舞的证据。接下来的项目必须证明,这一方法能够经受新研究者、新档案馆和没有已知解答的目标的考验。



