top of page

Anthropic Schneier Watch:LLM暗号解読が新たな攻撃を発見、ただし現代暗号は依然として堅牢

Anthropicの研究者らは、最先端AIモデルがこれまで報告されていなかった暗号攻撃を発見した一方、最も困難な実運用ターゲットには通用しなかったことを示す新たなベンチマークの検証に協力した。Bruce Schneierがこの結果を、単なる推論デモとして片付けるのではなく、セキュリティ専門家が注視すべきものだと取り上げた点で、anthropic schneierのシグナルは重要だ。

CryptanalysisBenchは、AIエージェントが数理的な分析を暗号方式に対する実行可能な攻撃へと転換できるかをテストする。191のタスクは、ブロック暗号、ハッシュ関数、認証付き暗号、公開鍵システムを含む6種類の暗号プリミティブを対象とする。

中心的な対立は、今や測定可能になった。AI支援の暗号解読は、導入前の防御的レビューを強化できる一方、同じ能力が最終的には人間の専門家では追いつけない規模でシステムを精査する攻撃者を助ける可能性もある。現行モデルはフル強度のAESや同程度に成熟した暗号を破るにはまだほど遠いが、このベンチマークは、すでに独自の貢献を果たせることを示している。

CryptanalysisBench、研究上の主張を実行可能な攻撃へ

このベンチマークは、説得力のある説明や別のモデルによる採点ではなく、動作する攻撃コードを要求することで、AI推論を巡る議論を変える。

研究者らは、2026年7月のプレプリントでCryptanalysisBenchを発表した。著者はETH Zurich、Anthropic、University of Haifa、Technische Universität Berlin、Tel Aviv Universityに所属している。

このベンチマークは主に、National Institute of Standards and Technologyによる4つのコンペティションを基にしている。これらのプログラムでは、AES、SHA-3、軽量暗号、耐量子暗号の候補が評価された。

コレクションには、6つのプリミティブ群にまたがる191のタスクが含まれる。プリミティブとは、暗号化、認証、衝突耐性、デジタル署名といった性質を提供するために使われる、基盤的な暗号アルゴリズムだ。

各タスクでは、AIエージェントにソースコード、ドキュメント、形式的なセキュリティゲームへのアクセスが与えられる。セキュリティゲームは、攻撃者が正確にどのような問い合わせを行えるか、何を成功とみなすかを定義する。

モデルは攻撃対象を選び、自己完結したスクリプトを生成しなければならない。別のコントローラーが秘密鍵を保持し、インターフェースを通じて許可されたリクエストにのみ応答する。

その後、検証では新たな乱数を用いてスクリプトを実行する。鍵復元、偽造、衝突の各攻撃は、人手の介入なしに、それぞれの成功条件を満たさなければならない。

一部の確率的ゲームでは、1回を超える成功が必要となる。こうしたタスクでは、ベンチマークは20件の独立したインスタンスを実行し、少なくとも17勝を要求する。論文は、ランダムな推測でこの閾値を通過する確率は約0.1%と見積もっている。

この構造は、AIベンチマークに根強く残る問題を軽減する。モデルは、もっともらしい数学を書いたり、よく知られた攻撃を引用したり、言語モデルの審査役を説得したりできても、有効な結果を生み出せない場合がある。

その代わりCryptanalysisBenchは、二値的な実務上の問いを投げかける。提出された攻撃は、定められたルールの下で方式を破るのか。

タスクは2つのティアとチャレンジセットに編成されている。Tier 1には、既知の実用的攻撃がある49のアルゴリズムが含まれ、モデルが確立済みの弱点を再現、または独力で再発見できるかを測定する。

Tier 2には、既知の実用的な破り方がない142のアルゴリズム、あるいは攻撃の実行コストが高すぎるアルゴリズムが含まれる。研究者らは、フル強度の設計と、ラウンド数の削減、鍵長の短縮、パラメータ変更を施した縮小版の両方をテストする。

チャレンジセットは、公表済みの暗号解読の限界に近い実運用品質の暗号を対象とする。AES、ChaCha、Katan-32、Present-80、Simon-32/64、Speck-32/64、Skinny-64/64が含まれる。

この区別は不可欠だ。古いコンペティション候補、ラウンド数を減らした暗号、欠陥のあるリファレンスコードを破っても、それは現在のWebトラフィックを保護する暗号をAIが破ったことを意味しない。

Schneierのセキュリティ評価は、適切な論調を示した。彼は結果を初期段階のものと呼びつつ、このベンチマークは注目に値すると強調した。

ニュースは、現代暗号が突然破られたことではない。自動化システムが、暗号解読について論じる段階から、検証可能で明らかに独創的な攻撃をいくつか生み出す段階へと移ったことだ。

Anthropic SchneierのシグナルはAES破りではなく、新規の成果

最も強い結果は独創的な暗号解読上の貢献を示す証拠であり、最も重要な留保は、フル強度の実運用暗号が依然として破られていないことだ。

評価された最先端モデルは5つで、Claude Opus 4.8、Claude Sonnet 5、Claude Mythos 5、GPT-5.5、オープンウェイトのGLM-5.2である。Anthropicは、研究者らとの協力を通じてMythos 5へのアクセスを提供した。

Tier 1の性能は、GLM-5.2の65.3%からMythos 5の85.7%までの範囲だった。Opus 4.8は73.5%に達し、Sonnet 5とGPT-5.5はいずれも75.5%に達した。

これらの結果は、文書化された弱点を持つ方式に対する広範な能力を示している。しかし、それだけでモデルがその弱点を独力で導き出したことの証明にはならない。

LLMは訓練データから攻撃を想起したり、よく知られたパターンから再構成したり、ソースコードから別の経路を発見したりする可能性がある。研究者らは実行トレースを監査したが、トレースだけでは想起と再発見を完全に区別できないことを認めている。

より重要な結果は、フル強度のTier 2方式から得られた。Mythos 5とSonnet 5は、NISTの軽量暗号プロセスにおける認証付き暗号候補であるSpoCに対し、完全な128ビット鍵復元攻撃を独立して生成した。

一般にAEADと呼ばれる追加認証データ付き認証暗号は、メッセージの機密性と完全性の両方を保護する。報告されたSpoC攻撃は、変更されていない方式における設計レベルの欠陥を悪用するために、2回のオラクル問い合わせを使用した。

Mythos 5はまた、KINDIに対する復号反応攻撃も生成した。この手法は、特別に構成した暗号文の復号を求められた際にシステムがどう反応するかから情報を引き出す。

論文によると、この攻撃はKINDIで公開されていた選択暗号文攻撃安全性の証明に誤りがあることを明らかにした。著者らは、KINDIの問題とSpoCの鍵復元攻撃のいずれも、以前は知られていなかったとしている。

この表現には慎重さが求められる。研究者らの文献調査に基づけば、攻撃は新規とみられるが、プレプリントだけで誰も非公開に発見していなかったことまで証明することはできない。

影響を受けた方式も、AES、ChaCha、あるいは現在標準化された耐量子暗号の勝者と同等ではない。SpoCはコンペティションで採用されなかった候補であり、KINDIも導入されたNIST標準にはならなかった。

それでも、失敗または落選した候補は有益な研究対象である。公開コンペティションの間に多くの人間の暗号研究者がそれらを調査しており、このベンチマークは意図的に脆弱なパズルより難しい試験を提供する。

ベンチマークは、フル強度のTier 2における成功率も4.4%から8.9%の範囲で記録した。Mythos 5が8.9%で先行し、GPT-5.5が7.4%、Sonnet 5が6.7%で続いた。

これらの割合には文脈が必要だ。成功した攻撃の一部は、実装上の欠陥、仕様が不十分な挙動、または意図された数学的設計を損なわない不備を標的にしていた。

論文は、設計レベルの暗号解読とこうした結果を区別している。また、パラメータ削減スクリプトが元のプリミティブとは無関係の弱点を誤って導入した、スケーリング上のアーティファクトも特定している。

したがって、最も擁護しやすい結論は限定的だ。最先端モデルは現実の欠陥を発見でき、ときに明らかに新しい攻撃を生み出し、分析を動作するコードへ転換できる。

ただし、フル強度のAESを破ったわけではない。広く導入された暗号標準が、一般に自動化攻撃に脆弱であることを示したわけでもない。

エージェント型暗号解読がセキュリティレビューに与える圧力

AIはより多くの調査を並行して実行し、見過ごされてきた候補を再調査し、実行可能な仮説を継続的にテストできるため、当面の圧力は暗号レビューのプロセスにかかる。

従来の暗号解読は、少数の専門家集団に依存している。彼らは設計を研究し、既知の構成と比較し、数学的仮説を立て、攻撃の実装に相当の時間を費やす。

このベンチマークは、エージェントにそのワークフローを圧縮した形で与える。エージェントはコードを調べ、仕様を読み、セキュリティゲームを選択し、オラクルの挙動をテストし、数理ソフトウェアを使い、攻撃スクリプトを改良できる。

これは、チャットボットに説明を求めるだけのことではない。モデルはツール、実行環境、状態、そして誤りを修正する反復機会を備えたハーネス内で動作する。

研究では、モデルは失敗する前に適切な弱点を認識することが多かった。多くの失敗は、不必要に難しい目標を選ぶ、実用的でない探索を汎用ソルバーに委ねるといった、実行のまずさによるものだった。

この発見は、将来の進歩を想像しやすくする。より良い計画、より長い実行時間、改善されたツール利用、より効率的な連携によって、まったく新しい暗号学的洞察を必要とせずに攻撃完了率を高められる可能性がある。

Mythos 5の優位性は、ベンチマークがより多くのテスト時演算を許可した場合に特に強く現れた。テスト時演算とは、トークン、ツール呼び出し、並列試行など、モデルが1つの問題に取り組む際に使用する処理予算を指す。

ここに能力とリスクの緊張関係が生まれる。防御側は同じシステムを使い、候補方式のレビュー、リファレンス実装の検査、導入前の攻撃生成を行える。

攻撃者は、あまり知られていないアルゴリズム、独自プロトコル、監査が不十分な製品を再調査するために利用できる。システムが弱い独自プリミティブや欠陥のある実装に依存していれば、AESを破る必要はない。

Anthropicは、高度なサイバーモデルを管理された防御的導入という枠組みで捉えている。同社の暗号研究では、より広範なベンチマークの取り組みとともに、Hawkおよびラウンド数を削減したAESの弱点に関する研究を説明している。

ラウンド数を削減したAESは、研究目的で暗号の反復変換ラウンドの一部を取り除いたものだ。この弱体化版への攻撃は進歩の測定に役立つが、すべての10ラウンドを備えた標準AES-128を破ることにはならない。

この境界は、公開の議論では見失われやすい。「AIがAESを攻撃」とする見出しは、意味のある学術的成果を指している場合でも、実際には起きていない実用的な破り方を示唆しかねない。

暗号研究者は長年、設計の安全余裕を把握するためにラウンド数を削減した派生版を研究してきた。7ラウンドへの進展は、フルラウンドAESを復号可能にしなくても、分析上の理解を改善できる。

したがって、圧力は壊滅的な事態になる前に、組織面で現れる。標準化団体、モデル開発者、ソフトウェアベンダーは、AI生成の攻撃を検証し、本物の弱点を開示するための手順を必要とする。

レビュー担当チームは、もっともらしい発見の量が増えることもトリアージしなければならない。数百件の攻撃を提案するモデルは、試行の大半が失敗に終わる場合でも、貴重な専門家の時間を消費しうる。

各タスクには形式的なゲームと管理された実装があるため、ベンチマーク内では自動検証が役立つ。実際のシステムで、こうしたきれいな条件が得られることはほとんどない。

実運用のプロトコルは、暗号プリミティブに加え、シリアライゼーション、鍵管理、認証フロー、ハードウェアの挙動、運用ポリシーを組み合わせている。攻撃は、コアアルゴリズムを無効化せずとも、こうした境界を通じて成功する可能性がある。

逆に、実験室環境では成功したように見える攻撃でも、実運用製品には存在しないインターフェースや実装上の選択に依存している可能性がある。実際の影響を判断するには、人によるレビューが依然として必要だ。

このベンチマークの公開リポジトリにより、独立した研究者はタスクを検証し、将来のモデルを比較できる。ベンダーがより強い能力を主張するようになる中で、再現性は決定的に重要となる。

最も大きな圧力を受ける組織は、AIラボだけではない。暗号標準化プロジェクトは、エージェントによるテストをいつ評価の定常的な一部にするかを決めなければならない。

独自暗号を採用するベンダーには、さらに明確な警告となる。モデルは、設計が掲げるセキュリティ特性とコードの実際の挙動との隔たりを探索できる。

このベンチマークが立証していないこと

CryptanalysisBenchは実在する能力を測定しているが、記憶、縮小パラメータ、実装バグ、大規模な計算予算により、広範な結論には限界がある。

第一の不確実性は学習データに関するものだ。Tier 1の攻撃はすでに公開されているため、モデルが学習時に遭遇した文章、数式、コードパターンを再現している可能性がある。

研究者らは、モデルが論文を引用したのか、既知の攻撃を想起したのか、別の経路を開拓したのかを特定するため、トレースレベルの監査を行った。しかし、一見新しい導出であっても、認識されない記憶を反映している可能性は残る。

AIMerは、一部のモデルで報告されている学習カットオフ後に効率的な2026年の攻撃が登場したため、部分的な統制条件を提供した。テスト対象のモデルはどれも、ベンチマークの条件下で公開済みの消去法を再現できなかった。

一部のモデルは、より緩い設定では秘密を復元したが、最近の攻撃で必要だった数より多くの初期化ベクトルを使用していた。これは有用な推論を示唆する一方、攻撃を見つけることと専門家並みの効率を達成することの隔たりも示している。

第二の制約は、縮小版に関するものだ。研究者らは、多くのTier 2アルゴリズムを弱め、計算上到達可能な範囲に攻撃を収めた。

これは標準的な暗号解析の実践だが、パラメータ変更によって人工的な脆弱性が生じる可能性がある。論文は、縮小スクリプトが処理を途中で打ち切ったり、依存するバッファのサイズが不整合なままになったりした事例を報告している。

そうした成功は、元の設計に対する進展ではなく、壊れたベンチマーク版を説明するものだ。著者らは、各モデルについて8件または9件のこうしたアーティファクトを、真の暗号解析結果から分離した。

第三の制約は、参照実装に関するものだ。すべてのモデルが解いた24件のTier 1タスクのうち4件は、基礎となるプリミティブの欠陥ではなくコードの不具合に関係していた。

実装攻撃は、実際のセキュリティ業務において依然として価値がある。しかし、それは暗号の数学的構成が健全かどうかとは別の問いに答えるものだ。

第四の制約は、リソース使用量だ。強力なエージェントは、単一の標的を探索する間に長時間の実行時間と膨大なトークン予算を消費しうる。

この結果は能力実証として依然重要だが、あらゆる攻撃者が専門的な暗号解析を安価に自動化できることを示すものではない。モデルへのアクセス、推論インフラ、検証、人間による監督は、引き続き制約となる。

第五の制約は、ベンチマークのカバレッジだ。このチャレンジセットは複数の実運用品質の暗号を代表しているが、実務で用いられるあらゆるプロトコル、実装、サイドチャネル、設定を捉えることはできない。

その形式的ゲームは、相互作用を定義された脅威モデルに意図的に制限している。これにより、エージェントが秘密ファイルへの偶発的なアクセスや無関係なコンテナの弱点を通じて勝利することを防いでいる。

この隔離は測定を改善する。一方で、現実の攻撃者がしばしば成功する雑多な条件も取り除く。

セーフガードは、別の複雑さをもたらす。研究者らは、GPT-5.6およびClaude Fable 5について、これらのモデルが暗号解析タスクをブロックしたため評価できなかったと報告している。

安全上の拒否は、基礎的な能力が低いことを示すものではない。ベンチマーク結果が、モデルの能力とその能力を取り巻くアクセス方針の双方に依存することを意味する。

これは比較上の問題を生む。より高性能なモデルでも、拒否すれば弱く見える可能性がある一方、制限の少ないモデルはより多くのタスクを完了できる。

同時に、ガバナンス上の問いも提起する。防御側の暗号研究者には高度な分析へのアクセスが必要だが、無制限のアクセスは攻撃能力を拡散させかねない。

このベンチマークは、その境界をどこに置くべきかを決めるものではない。これまで主に逸話に大きく依存してきた議論に、データを提供する。

もう一つの不確実性は転移可能性だ。過去の競技候補における性能は、成熟し厳格なレビューを受けた標準に対する性能を予測しない可能性がある。

AESは数十年にわたり継続的な注目を受けてきた。モデルがあまり研究されていない候補に欠陥を見つけたとしても、同じ手法を拡大すればAESを破れることを意味しない。

論文のチャレンジ層は、その境界を追跡するために設計されている。現在の結果はまだ飽和から遠く、これは安心材料であると同時に科学的にも有用だ。

したがって、anthropic schneierの解釈は両極端を避けるべきだ。この研究は玩具的な暗号の実証より強力だが、実運用の暗号化が差し迫った崩壊に直面していることの証拠よりは弱い。

最悪のリスクより先に訪れる防御上の機会

組織は、検証、開示、暗号アジリティを維持する限り、AIが生成した攻撃を人間によるレビューに加えることで今すぐ利益を得られる。

候補アルゴリズムは明白な出発点だ。標準化チームは、選定前に複数のモデルで設計を探査し、その後、再現可能な攻撃を独立した暗号研究者に送ることができる。

これにより、人間の注目が均等に集まらない提出物全体でカバレッジを広げられる。より強力な代替案が現れた後、初期ラウンドの候補は精査を受けにくくなることが多い。

SpoCとKINDIの発見は、その価値を示している。方式が実装段階に到達しない場合でも、新たに特定された失敗は将来の設計実務を改善できる。

参照実装も、もう一つの実践的な標的だ。エージェントは、形式的なセキュリティ特性と、認証をスキップする、空入力を誤って扱う、メッセージ要素を省略するといったコードパスを比較できる。

この作業は従来の脆弱性発見と重なるが、暗号コードには専門的な推論が必要となる。汎用スキャナーはメモリエラーを検出できても、プロトコルレベルの偽造を見逃す可能性がある。

AIは、弱点発見後の回帰テスト構築にも役立てられる。有効な攻撃スクリプトは、開発者が修正済みコードとともに保存できる具体的な成果物となる。

組織は、モデルに自らの発見を承認させるべきではない。特に結果が標準や広く使われているライブラリに影響する場合、独立した再現が引き続き必要となる。

妥当なレビュー連鎖は、自動実行可能な攻撃から始まる。次に人間の暗号研究者が、それが設計、実装、あるいは人工的なベンチマーク条件のどれを標的としているかを特定する。

その後、メンテナーは影響を受けるコードベースで結果を再現できる。そこで初めて、チームは実運用での影響を評価し、開示を調整すべきだ。

この構造は、モデル生成の研究を捨てることなく誤報を抑える。また、ベンチマークが最も明確な価値を示す役割、すなわち仮説の生成と実装にモデルを位置付ける。

自動化された分析が向上するにつれ、暗号アジリティの重要性は高まる。この用語は、製品全体を作り直すことなくアルゴリズムと鍵を置き換えられるようにシステムを設計することを意味する。

NISTの標準化プロセスは、移行計画がなぜ重要かをすでに示している。アルゴリズムの選定は始まりにすぎず、プロトコル、ハードウェア、長期運用システム全体への展開には何年もかかる。

AIは、この運用上の現実を変えない。設計の公開から弱点の発見までの時間を短縮できるため、移行が遅いことのコストはより高くなる。

チームは、暗号プリミティブがどこで使われているか、どのライブラリがそれらを実装しているか、プロトコルがより安全な代替手段をネゴシエートできるかを棚卸しすべきだ。独自アルゴリズムは、確立された標準のようなレビュー履歴を持たないため、直ちに注意を向けるべきである。

ただし、モデルが懸念すべき分析を出したというだけで、組織は成熟した暗号技術を置き換えるべきではない。時期尚早な変更は、新たな実装不具合や相互運用性の失敗を招きうる。

防御上の機会は、規律ある証拠に依存する。形式的ゲームに勝つ攻撃は調査に値する一方、裏付けのない文章は懐疑的に扱うべきだ。

このベンチマークの検証モデルは、暗号以外にも有用なテンプレートを提供する。AIセキュリティ評価では、タスクが許す限り再現可能な成果物を要求すべきだ。

これは、フロンティアモデルに関する主張がアクセス規則、購買判断、公共政策をますます形作っているため重要である。測定は、推論、記憶、実装スキル、総当たり的なリソース使用を区別しなければならない。

CryptanalysisBenchは、こうした測定上の問題を完全には解決しない。しかし、成功の定義が異例なほど明確な領域で、それらを可視化する。

AI暗号解析が加速しているかを示す三つのシグナル

次の段階は、より難しいベンチマークでの成功、新規攻撃の独立再現、標準化チームによる日常的な採用にかかっている。

第一のシグナルは、未解決のチャレンジセットに対する進展だ。研究者は、将来のモデルがよりラウンド数の多いAES、ChaCha、その他の実運用暗号に対して自明でない攻撃を生み出すかを追跡すべきである。

その結果がハーネスのバグに依存せず、公開された暗号解析の最前線を前進させるなら、より重要性を持つ。独立した専門家が、計算量、データ要件、実用上の意味を確認すべきだ。

単一の縮小ラウンドでの結果は、フル強度の暗号化が破られたことを意味しない。より強力な変種にわたる持続的なパターンが見られれば、モデル支援研究が専門的な暗号解析に近づいていることを示すだろう。

第二のシグナルは、SpoCとKINDIの発見の独立再現だ。他の暗号研究者は攻撃を検証し、先行研究を調査し、影響を受ける仮定が他の場所にも現れるかを評価する必要がある。

再現に成功すれば、フロンティアエージェントが独自の暗号解析に貢献できるという主張は強まる。先行する出版物やベンチマーク固有の依存関係が見つかれば、その結論は限定される。

将来のベンチマーク版には、モデルの学習後に登場した新しい非公開または新規公開の標的も含めるべきだ。これにより、記憶が説明となる可能性は低くなる。

第三のシグナルは、標準化団体とセキュリティ研究所による採用だ。エージェントテストがコードレビューや人間による暗号解析と並ぶ通常の事前展開ステップとなったとき、このベンチマークは運用上重要になる。

その変化には、開示ルールも含まれるべきだ。モデルは専門家が検証できる以上の速さで発見を生成できるため、トリアージのない大きなキューは防御作業を遅らせかねない。

モデル開発者が、トランスクリプト、リソース予算、失敗した試行、検証コードを共有するかにも注目すべきだ。外部の人々が新しい数学的攻撃とコーディング上の欠陥を区別できるとき、結果は信頼しやすくなる。

アクセス方針にも目を向けるべきだ。Anthropicは、攻撃的利用への懸念を反映し、最も高性能なサイバーモデルを選定されたパートナーに限定している。

アクセス制限は悪用を遅らせうるが、高度な防御能力を少数の研究所に集中させる可能性もある。より広い研究参加には、統制された環境と説明責任のある開示プロセスが必要となる。

Bruce Schneierの抑制的な反応は、適切な参照点だ。これは初期の結果だが、デジタルインフラに直接的な意味を持つ能力を示している。

有用な問いは、LLMが抽象的に「暗号を破れるか」ではない。検証可能なルールの下で、モデルの世代ごとに、より困難で、よりクリーンで、より新しい標的を打ち破れるかどうかだ。

セキュリティリーダーはこの進展を追い、自らのシステムをより迅速な暗号レビューに備えさせるべきだ。組織が依存するアルゴリズムを棚卸しし、独自設計を廃止し、重要なプロトコルが置き換えをサポートしているかをテストする必要がある。

研究者にとっても、取るべき行動は同じく具体的だ。新たな攻撃を再現し、ベンチマークの前提に異議を唱え、能力に関する主張が証拠を先行する前に、より強力なターゲットを提出すべきである。

anthropic schneier の件は、暗号技術の崩壊を宣言するものではなく、依然として警告シグナルにとどまる。その価値は、現在の限定的な成功と、業界全体に対応を迫るような攻撃との隔たりを測る点にある。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page