AstraによるEnigma解読がClaude Opusに第2の標的を与えた
OpenAIのGPT-6 Astraは、2005年以来研究者による解読を拒み続けていた82文字のEnigmaメッセージを、2日間の作業の末に復元した。このAstraによるEnigma解読の成果に続き、6日後にはAnthropicのClaude Opus 5を用いた別の解読も成功した。両プロジェクトは、歴史的暗号解読を最先端AIエージェントにとって異例なほど具体的な試験へと変えている。
これは、チャットボットが読めるドイツ語を推測したという話ではない。両プロジェクトは、アーカイブ資料、実行可能なソフトウェア、暗号学的探索、そしてモデル自身の結論を超えた検証を組み合わせた。重要なのは、AIがその研究ループのどこまで担えたかにある。
2つのシステムは、異なる方法で答えに到達した。Astraは研究者主導の調査の中で標的を選び、ツールの多くを開発した。Claudeには、用意済みの作業環境、歴史資料、より強い人間からの指示が与えられた。この違いにより、Astra対Claude Opusはベンチマーク競争というより、2つの研究ワークフローの比較研究に近いものとなっている。
AstraによるEnigma解読、2005年以来解けなかったメッセージを復元
重要な変化はEnigmaが再び解読されたことではなく、AI支援の調査が、現代の研究者でもこれまで復元できなかった特定のメッセージを解決したことにある。
MVUEHと識別されたこのメッセージは、1941年7月10日に送信された。戦術呼出符号2nyを持つドイツ陸軍の無線局が、SS-Totenkopf師団の補給担当無線局へ送ったものだ。受信局は午後5時30分、これを第172号電文として記録した。
歴史的な暗号解読者はすでに、Enigmaの機構と一般的な弱点を理解していた。しかし、現存する1通のメッセージを解読するには、正しい機械設定、正確な暗号文、そして欠落した平文に関する有用な手掛かりが依然として必要になる。
MVUEHには、その3点すべてで問題があった。暗号化された文字は82文字しかなく、統計分析に使えるテキストは限られていた。現存する写しにも、不確かな文字や誤転記された文字が含まれていた。
機械設定は、同日の他の既知鍵とは異なっていた。ローター順序は253であり、関連する2つの鍵では順序512が使われていた。72文字目で左側ローターがまれに回転したことも、別の複雑さを加えた。
開発者のCarter Leffenは、Crypto Cellar Researchが公開した未解読メッセージをGPT-6 Astraに調査させることでこの研究を始めた。AstraはMVUEHを最も有望な標的として選択した。その後、このメッセージを、平文がすでに復元されていた別の電文SIPVXと結び付けた。
その関連メッセージには、地名ROSENOWROSENOWが繰り返し含まれていた。調査では、この14文字をcrib、すなわちEnigmaの候補設定に対して検証する推定平文の断片として用いた。
cribが直接答えを明らかにするわけではない。推定された語句を生成できない設定を排除することで、探索を制約する。残りの文字も、ひとつの一貫した機械鍵のもとで意味の通るテキストを形成しなければならない。
公開されたMVUEH case studyによると、調査では鍵を復元する前に暗号文の不確かな位置を12か所記録していた。これらの代替候補から、許容される読み方は13,824通りとなった。
この順序は重要だ。答えを見る前に不確実性を記録することで、好ましい結果に合うまで不鮮明な筆跡を都合よく読み替えてしまう誘惑を抑えられる。
Astraと専門エージェントは資料を調べ、探索プログラムを構築し、実験を実行し、中間的な発見に異議を唱えた。調査では、PythonとC++でEnigmaシミュレーションおよびBombe型探索ソフトウェアを開発した。
得られた鍵は、復元された本文82文字すべてを復号した。また、最終平文の選定には使われていなかった独立記録済みの電文ヘッダーとも一致した。
復元されたドイツ語テキストはおおむね、行軍経路を尋ね、送信者がRosenowにいることを報告し、即時の無線返信を求めている。推定される署名はWaschbuschだが、この読みはなお暫定的である。
この結果は2026年9月15日、歴史的暗号研究者Frode Weierudに報告された。Weierudは鍵と平文を調べ、解読は正しいと結論づけた。
詳細なcryptanalytic reviewは、この作業が初期の転記における誤りも明らかにしたと指摘している。さらに、このメッセージが7月10日に知られている他の通信とは完全に異なる鍵を使っていたことも確認した。
したがって、このプロジェクトはもっともらしいドイツ語を生成しただけではない。暗号文、独立したヘッダー、関連通信、Enigmaシミュレーターの挙動を説明する設定を見つけた。
この組み合わせこそ、この結果が注目に値する理由である。言語モデルは、歴史的メッセージを復元せずとも説得力のある文章を生成できる。ここでは、実行可能な証拠と文書的な証拠が、その傾向に境界を設けた。
真の成果は幸運な平文ではなく、研究ループだった
Astraの最大の貢献は、通常なら研究者が別々のツールと繰り返しの手作業による受け渡しで行う複数の作業形態を調整したことにある。
調査は、狭く定義された解読要求ではなく、標的の選定から始まった。Astraは未解決メッセージのコレクションを検討し、関連資料が結果を検証する複数の独立した方法を提供していたためMVUEHを選んだ。
公開済みの受信転記と、かすかな送信控えを比較した。近接する通信と既知の日鍵も調べた。また、明示的な制約のもとで機械設定を検証できるソフトウェアの構築にも寄与した。
この流れは、通常の質問応答よりも専門家の研究に似ている。モデルは不完全な文書、歴史的仮説、コード、失敗した探索、検証の間を行き来する必要があった。
初期のアプローチのいくつかは失敗した。既知の同日鍵ではメッセージを復号できなかった。ケーブル設定の仮説からは受け入れられる結果が出ず、初期のヒルクライミング探索も、制御された条件下でさえ十分に機能しなかった。
これらの失敗により、調査は前提の見直しを迫られた。繰り返されるRosenowという語句は最終的に、MVUEHを関連する既解読メッセージへ結び付けたため、より強力な経路を提供した。
最終分析は14文字のcribだけに依存していない。周囲の68文字は制約を受けず、意味の通る出力を生み出す必要があった。記録済みのヘッダーは、その後、復元された設定に対する別個の検証を提供した。
研究者は、そのヘッダーに対して14,829,646通りの物理的な鍵組み合わせを独立して検証した。互換性を保ったのは923通りだけであり、全文の読解レビューが必要だった。
別々の実装が、メッセージとヘッダーの結果を再現した。機械の制約を形式論理問題として表す独立した充足可能性モデルも、抽出された42状態で一致した。
再暗号化も、もうひとつ必要な検証を提供した。復元された設定は、提案された平文を再び復元済みの暗号文へ変換した。
この検証は内部整合性を確認するが、それだけで歴史的解釈を確立するものではない。誤った転記や不適切に選ばれたcribでも、一貫した計算を誤った方向へ導く可能性がある。
調査は、再暗号化をヘッダー、関連メッセージ、事前に宣言された資料上の代替候補、外部レビューと組み合わせることで、その主張を強化した。証拠は、特に署名をめぐる編集上の不確実性をすべて排除するものではない。
最初の独立レビューにも限界があった。SWARMは別のシミュレーターを使って期待される本文とヘッダーの結果を再現したが、完全な探索は繰り返さなかった。そのため、復元された設定は確認したものの、それを独立に再発見したわけではない。
この区別は、AstraがEnigmaをどのように解いたかを理解するうえで中心的である。複数のAIエージェントが互いに同意したとしても、それは独立した確認にはならない。同じ誤った資料、前提、ソフトウェア上の欠陥を引き継ぐ可能性があるためだ。
意味のある検証は、彼らの会話の外にある証拠から得られた。そこには電文様式、独立記録されたヘッダーデータ、別実装、歴史的通信、経験豊富な暗号解読者によるレビューが含まれる。
このワークフローは、暗号学を超えたAI支援研究にも有用なモデルを示している。エージェントは文書を探索し、分析コードを書き、説明を提案できる。その結論が信頼に足るものとなるのは、外部証拠が洗練された誤りを退けられる場合だけだ。
ここはまた、優れたナレッジマネジメントが技術的厳密さの一部となる場所でもある。研究者には、資料文書、前提、実験、改訂の間に追跡可能なつながりが必要だ。
構造化されたAI knowledge baseは、それらのつながりを保持できる。暗号を検証することはできないが、証拠の連鎖を人間のレビュー担当者に見える状態で維持できる。
Claude Opusは異なる種類のEnigma攻撃で続いた
Claude Opus 5も別の有効な結果に到達したが、より強い人間の指導が、その標的と探索戦略の両方を形作った。
9月20日、サイバーセキュリティ研究者Jack Willisは別のメッセージFMNGIの鍵を復元した。MVUEHの解読が検証のため提出されてから6日後の翌日、彼はWeierudに知らせた。
FMNGIは1941年7月31日付の受信メッセージだった。SS-Totenkopf師団の補給担当無線局が受信し、第285号電文として記録していた。
Willisは、Goで書かれた暗号解読用ワークベンチと関連する歴史資料をClaude Opus 5に提供した。このセットアップにより、ClaudeにはAstraよりも狭く、あらかじめ整えられた環境が与えられた。
決定的な手掛かりは関連通信から得られた。Friedrich Hartjensteinに関連する末尾署名から、14文字のcrib XHARTJENSTEINXが得られた。
歴史的暗号解読者は以前から、Hartjensteinの署名の複数の形態を記録していた。そのため、この名前は出力を見た後に作り出された語句ではなく、想定される平文の信頼できる出所となった。
Claudeはワークベンチと提供資料を使ってメッセージを調査した。FMNGI technical accountによると、最終的な鍵探索はApple M2コンピューター上で13分28秒を要した。
復元された平文には、ドイツ語で「縦列」を意味する単語に誤りが含まれていた。Weierudは、その誤りが暗号化、転記、またはモールス送信の過程で発生した可能性があると説明した。
この不完全さは重要な点を強める。歴史的メッセージは、クリーンなベンチマーク入力ではない。通信員、無線状況、筆跡、後年の転記のいずれもがノイズを持ち込む可能性がある。
このメッセージの第2のアーカイブ写しは、特に有用だった。Weierudは2026年7月、ドイツのBundesarchivで補給業務に関する通信のコレクションを見つけていた。
第205号NF電文に関連する写しには、以前に公開されていた第285号版より正確な暗号文が残されていた。また、Hartjensteinとの関係も裏付けた。
利用可能な平文コレクションがあれば、より直接的な解決が可能だったかもしれない。しかしWillisは、攻撃を始めた時点ではその完全な平文を持っていなかった。
その代わり、Claude支援による探索は、将校の署名をcribとして利用した。これにより、より広範なメッセージが復元された鍵の検証役を果たすことになった。
この手法では、プロセスのより早い段階に人間の専門知識が置かれた。Willisはリソースを選び、ワークベンチを提供し、歴史的に裏付けられた手掛かりへ向けて調査を導いた。
Astraのプロジェクトでは、標的選定とツール開発のより多くが委任された。研究者はなお目標を設定し、進捗を評価し、作業を前進させたが、モデルはより広い問題空間を探索した。
こうした違いは、単純なAstra対Claude Opusのスコアよりも重要だ。一方のワークフローは、より広範な研究の自律性を試した。もう一方は、専門家、有能なモデル、そして整備済みの技術基盤による集中型の協働を試した。
どちらも有用な結果を生んだ。しかし、モデルが暗号解読者、アーキビスト、ソフトウェアエンジニア、歴史検証者を独力で置き換えられることを示したわけではない。
むしろ、人間の研究者が目的を管理し、検証可能な証拠を要求するなら、最先端モデルがそれらの役割をまたいで効果的に動けることを示している。
チューリングのもう一つのテストは、模倣ではなく証拠である
歴史的な対称性は魅力的だが、これらのプロジェクトは、最先端モデルがEnigma解読という戦時中の成果を再現したことを立証するものではない。
Alan Turingは、後にチューリングテストと呼ばれるようになった「模倣ゲーム」と密接に結び付けられている。これは、文章による対話で機械を人間と区別できなくできるかを問うものだ。
彼の戦時中の仕事は、別の問題を扱っていた。Turing、Gordon Welchman、ポーランドの暗号解読者、オペレーター、エンジニア、そして数千人のBletchley Parkスタッフは、変化し続けるドイツの暗号を対象とした情報システムを構築した。
現代の説明では、その集団的な取り組みが一人の天才と一台の機械に圧縮されがちだ。実際の作戦は、傍受通信、手続き上のミス、鹵獲資料、統計的推論、電気機械式Bombes、そして継続的な人間の判断を組み合わせたものだった。
英国のBombeは、cribから導かれる論理的矛盾を用いて、可能なEnigma設定を探索する助けとなった。暗号文を受け取って、ただちに読める答えを出力する装置ではなかった。
最近のプロジェクトは、よく知られたチャットボットの物語よりも、この古いパターンに近い。人間が歴史資料群と研究目標を提供し、モデルが手掛かりを整理し、ツールを書き、可能性を探索した。外部の証拠が、その答えが成立するかどうかを決めた。
ただし、その成果をTuringの戦時中の仕事と同等と呼ぶなら、両方の歴史を歪めることになる。元の暗号解読者たちは、手順と鍵が絶えず変わる能動的な敵に直面していた。
AstraとClaudeは、Enigmaの設計が数十年前から理解されている状況で、保存されたメッセージを扱った。公開済みの鍵、既知の通信、現代のコンピューター、アーカイブ上の発見、確立された暗号解読手法を利用できた。
責任ある主張は、より限定的なものだ。最先端AIは、正確な設定が過去の試みで解明されなかった二つの個別メッセージの復元を支援した。
Leffen自身のプロジェクトも、Enigmaを初めて解読したと主張しているわけではないと明示している。この留保は、あらゆる再話に付随させるべきだ。
それでも見出しの比喩は、現実の一面を捉えている。これらのモデルは、説得力のある言葉だけでは足りない課題に直面した。他者が実行・検査できる成果物を生み出さなければならなかった。
これは通常のベンチマークよりも厳しい評価だ。ベンチマークでは通常、モデルが始める前に問い、採点規則、期待される答えが固定される。
アーカイブ暗号解読には、そのような明確な境界はない。資料には誤りが含まれる可能性がある。最良の手掛かりが別のコレクションにあるかもしれない。もっともらしい答えでも、いくつもの無関係な理由で誤っている場合がある。
したがって成功は、不確実性をひそかに書き換えずに乗り越えられるかにかかっている。モデルは、いつ検索し、コードを書き、記録を比較し、転記を疑い、外部検証を求めるべきかを知る必要がある。
これが、チューリングのもう一つのテストとして、より有用な意味である。AIシステムが専門家らしく聞こえるかではなく、規律ある探究の連鎖に参加できるかを測る。
戦時中の記録も、暗号解読を孤独な天才の仕事として扱わないよう警告している。効果的な暗号解読は常に、人間の洞察、機械、手順、組織的知識を結び付けてきた。
2026年の成果は、その協働における機械を更新した。それ自体が協働を不要にしたわけではない。
AstraとOpusの成果が証明していないこと
二つの成功例だけでは、一般的な信頼性、完全な自律性、あるいは現代暗号を広く破る新たな能力を立証できない。
Enigmaは歴史的に重要だが、現在の暗号セキュリティを代表するものではない。現代暗号は、異なる数学的構造、実装、脅威モデルに依存している。
したがって、このメッセージ復元は、最先端モデルが適切に運用された現代暗号を破れるかについて、ほとんど何も語らない。現代の暗号化通信が突如として危険にさらされた証拠として提示すべきではない。
これらの事例は、広範な先行する人間の作業からも恩恵を受けた。Crypto Cellar Researchはメッセージのコーパスを維持し、未解決事例を記録し、鍵を保存し、関連通信を結び付けていた。
研究者たちはすでに近接するメッセージを復元し、繰り返される署名を研究していた。AI支援による攻撃の直前には、新たなBundesarchivの発見が重複する暗号文と文脈的証拠を追加した。
Astraには、SIPVXで繰り返されるRosenowのフレーズという有用な手掛かりがあった。Claudeには、Hartjensteinの署名、準備された歴史資料、動作する暗号解読環境が与えられた。
こうした利点が成果を些細なものにするわけではない。それらは、システムが実際に完了した課題を定義している。
最も強い解釈は、研究作業の圧縮に関するものだ。報道によればAstraは、Weierudが人間の研究者なら数週間から数か月かかると考えた作業を2日で完了した。
この比較は統制された生産性研究ではなく、経験豊富な参加者によるものだ。普遍的な測定ではなく、情報に基づく判断として扱うべきである。
Astraの調査における自律的な部分も、さらなる検証を要する。そのログには、Crypto Cellarのウェブサイトでは利用できなかった正しいBundesarchivのファイル識別子が記載されていた。
Weierudは、モデルがそれらの参照をどう見つけたのか不明だと報告した。それらはオンライン上の別の場所に存在した可能性も、アクセス可能なカタログ記録に由来する可能性も、別の経路でモデルに入った可能性もある。
謎めいた説明を作り出す必要はない。適切な対応は、ログを保存し、取得経路を特定し、資料の発見と裏付けのない推論を分けることだ。
この事例は汚染の問題も提起する。関連資料がすでに学習データや検索環境に存在する場合、モデルが独立して推論したように見えることがある。
MVUEHは調査開始時点で未解決として掲載されていた。しかし研究者は、一般的な推論に功績を帰する前に、アクセス可能だったすべての資料を記録する必要がある。
再現可能性も依然として不完全だ。最終的な検証器を再実行することは、発見プロセス全体を繰り返すことより容易である。
完全な再現は、同じ公開コーパスから始め、同一の資料上の不確実性を保存し、発見済みのcrib配置を再利用せずに独立して鍵を復元するものとなる。
FMNGIにも関連する限界がある。研究者がワークベンチと強力な署名の手掛かりを提供した後は、Claudeの探索は高速だった。13分という実行時間は、その手掛かりを特定するために必要なアーカイブ作業を測っていない。
こうした留保は成果を消し去るものではない。自律的な科学に関する主張には、成功した歴史調査に関する主張よりも厳しい証拠が必要である理由を示している。
最も擁護可能な結論は具体的だ。研究者主導の二つのプロジェクトが最先端モデルを使い、別々の未解決Enigmaメッセージを解読し、経験豊富な外部専門家が両方の鍵を受け入れた。
それ以上の主張は、依然として未解決の研究課題である。
これが再現可能な手法になるかを示す三つのシグナル
次の試験は、他の研究者がワークフローを再現し、より困難なメッセージを解き、すべての判断について検証可能な記録を残せるかどうかだ。
第一のシグナルは、MVUEHの独立したエンドツーエンド再現である。新しいチームは、解決前のコーパスと記録済みの資料候補から始めるべきだ。
そのチームが公開済みの解答を取り込まずに同じ鍵を復元できれば、再利用可能なAI研究手法であるという根拠は強まる。再現に非公開の手掛かりが必要なら、自律性の主張は弱まる。
第二のシグナルは、残るコーパスでの進展だ。Crypto Cellar Researchによれば、そのコレクションには約1,000件のEnigmaおよびTruppenschlüsselメッセージが含まれている。
9月の二つの解読後も、7件のEnigmaメッセージが未解決のままだ。別のパズルであるWEUWY番号138には並行メッセージから既知の平文があるが、元の鍵はまだ不明である。
これらの対象は同等ではない。一部は、残存する暗号文に誤りが多すぎる、メッセージが短すぎる、有用なcribが存在しないといった理由で未解決なのかもしれない。
追加の成功が最も重要になるのは、研究者が失敗したアプローチ、資料上の不確実性、コード、検証資料を公開する場合だ。平文だけでは、はるかに弱い証拠となる。
第三のシグナルは、歴史暗号解読以外での採用である。中核となるワークフローは、ソフトウェア考古学、科学文献レビュー、文書フォレンジック、不完全な記録を扱うその他の研究へ移せる。
モデルには、関連証拠を見つけ、ツールを書き、競合する説明を検証し、前提をレビューのために明示することが求められる。また、滑らかな回顧的ストーリーを提示する代わりに、否定的な結果も保存すべきだ。
この最後の要件は、企業やナレッジワーカーにとって重要である。現在、多くのAIシステムは文書を説得力ある形で要約できるが、資料から結論まで追跡可能な連鎖を維持できるものは少ない。
AstraのEnigma解読プロジェクトは、より優れた基準を提示している。モデルは検査可能な中間成果物を生成し、独立した証拠は答えを覆す権限を持ち続けるべきだ。
開発者は、モデル提供者がこうしたワークフローをより監査しやすくするかを注視すべきである。有用な機能には、永続的な研究ログ、資料単位の引用、再現可能なツール実行、取得された事実とモデル推論の明確な分離が含まれる。
研究者は、誰が対象選定を管理するのかも問うべきだ。Astraの相対的な自由は、より広い能力を明らかにする助けになったが、自律性は隠れた前提や無関係な探索の余地も広げる。
Claudeの制約された環境は、その自由を減らす一方で、プロセスを解釈しやすくした。どちらの構成も自動的に優れているわけではない。
適切な設計は、誤りのコストと外部検証の利用可能性に左右される。オープンエンドの発見には探索が有益である一方、高リスクの結論にはより厳格なレビューゲートが必要だ。
これらの事例は、読者に実践的な問いを残す。AIシステムは単に答えを出せるだけなのか、それとも懐疑的な専門家が検証できる記録の構築を支援できるのか。
AstraとClaude Opusにとって、二つの古いEnigmaメッセージは有望な証拠をもたらした。次のプロジェクトでは、この手法が新たな研究者、新たなアーカイブ、既知の解答のない対象にも耐えられることを示さなければならない。



