AnthropicのClaude MythosによるHAWK攻撃が露呈させた、PQCでは解消できないセキュリティギャップ
AnthropicのClaude MythosによるHAWK攻撃は、およそ60時間のAI支援研究を経て、候補となっていた署名方式の推定鍵強度を低下させた。HAWKはすでに2年間、2回にわたる専門家レビューを乗り越えていた。重要なのは、実運用中の暗号が直ちに破られたことではなく、この対照にある。
Anthropicは2026年7月28日、AESの縮小ラウンド版に対する別の攻撃とともに、この結果を公表した。その後、HAWKチームはNational Institute of Standards and Technologyの耐量子署名コンペティションからアルゴリズムを撤回した。最終化済みのNIST耐量子標準に影響はない。
この出来事が突き付けるセキュリティ上の問題は、見出しが示す以上に難しい。耐量子暗号、すなわちPQCは、将来の量子攻撃からシステムを守る。しかし、新しいアルゴリズムを、未発見の数学的脆弱性、より高速な自動分析、あるいは不十分な人手によるレビューから守るものではない。
このため、暗号研究者、標準化団体、ソフトウェアベンダー、企業の購入担当者は、不一致に直面する。AIは一部の技術的な攻撃空間をより速く探索できるようになった一方、検証と対処はいまだ希少な人間の専門家に依存している。
Claude MythosによるHAWK攻撃が標準化コンテストを変えた
Claude Mythosは実運用中のセキュリティ標準を破ったわけではないが、どの候補が信頼できる標準になり得るかを変えた。
HAWKは、NISTのAdditional Digital Signaturesプロセスにおけるデジタル署名の提案だった。デジタル署名により、システムは誰がメッセージへ署名したか、またメッセージが改ざんされたかどうかを検証できる。HAWKは、従来型コンピューターと将来の量子コンピューターの両方からの攻撃に耐えるよう設計されていた。
この方式は、格子問題の難しさが想定されることに依存していた。格子とは、暗号構成を支え得る構造を持つ点の数学的配置である。HAWKのコンパクトな署名と性能特性は、さらなる評価に適した魅力的な候補と見なされていた。
Anthropicによれば、ある研究者はエージェント型研究ハーネスでClaude Mythos Previewを使用した。このシステムは文献を精査し、数学的構造について推論し、実験を実行し、研究者と知見をやり取りした。
このプロセスは、数学的構造を保存する対称性である非自明な自己同型を発見した。先行研究では、このような対称性を見つけることが攻撃を支援し得ると示されていた。未解決だったのは、HAWK固有の構成の中に悪用可能な形が存在するかどうかだった。
Anthropicの研究開示によると、モデル支援プロセスはその欠けていたつながりを発見した。これにより、より小さな実効探索空間を基にした、より高速な鍵復元手法が可能になった。
小規模なHAWK-256のチャレンジパラメーターについて、Anthropicは想定攻撃コストが2^64回の演算から2^38回へ低下したと報告した。チャレンジパラメーターは実運用を意図したものではなかったが、この低下は非常に大きい。
この結果は、より大きなHAWKパラメーターセットにも影響した。Anthropicは、期待されるセキュリティ水準を維持するには大幅に大きな鍵が必要になると結論付けた。その変更により、HAWKの候補性を支えていた重要な効率面の利点は失われることになる。
HAWKの設計者はその後、NISTプロセスから提案を撤回した。この撤回により、弱体化した候補が標準化や実運用へ進むことは防がれた。
この結果は、採用前にレビューが機能した証拠である。NISTの公開コンペティションは、意図的に提案を敵対的分析にさらす。研究者が脆弱性を発見した場合、候補が脱落することは想定されている。
それでも、この発見の速度と出所は重要である。HAWKは、AI支援ワークフローが約60時間で決定的な経路を見つける前に、広範な専門家の注目を受けていた。
Anthropicは、攻撃の開発と検証に約10万ドルのモデル利用費が必要だったと見積もった。個人研究者にとっては高額である。しかし、広く信頼される暗号を破ることの潜在的価値と比べれば、控えめな額だ。
したがって、この出来事は単なる候補リスト以上のものを変える。資金力のある研究所が、短期間にどれほどの暗号解読探索を実施できるかという期待を変えるのである。
耐量子暗号がこのセキュリティギャップを埋められない理由
PQCが扱うのは攻撃者のコンピューター能力であり、HAWKの事例が示すのは防御側の数学的設計にある弱点である。
耐量子アルゴリズムは、従来型計算と量子計算の双方に耐えると考えられる問題に基づいて構築されている。特定の役割では、RSAや楕円曲線暗号など脆弱な公開鍵システムを置き換える。
その保護には明確な境界がある。量子耐性を持つという前提は、見落とされた近道、構造上の対称性、実装ミス、盗まれた鍵、侵害されたエンドポイント、あるいは欠陥のあるプロトコル統合を補うことはできない。
Claude Mythosが攻撃したのは最初のカテゴリーである。量子コンピューターを用いたわけでも、実用的な量子攻撃をシミュレートしたわけでもない。HAWKの数学的構造を通る、より効率的な古典的経路を発見した。
この違いは、なぜこの結果がPQC移行のより広い根拠を弱めないのかを説明する。現在の公開鍵システムは、暗号学的に重要な量子コンピューターが到来する前に置き換える必要がある。
NISTは2024年に、最初の主要なPQC標準3件を最終化した。これには共有秘密の確立に用いるML-KEMと、デジタル署名向けのML-DSAおよびSLH-DSAが含まれる。NISTは、HAWKに関する発見はこれらの最終化済み標準に影響しないとしている。
組織はNISTのPQC標準ページでその範囲を確認できる。ML-KEMとML-DSAは、攻撃が標的にしたHAWK固有の機構とは異なる構成を用いている。
教訓は、量子耐性暗号が失敗したということではない。「量子耐性」とは特定の計算上の脅威への耐性を表すのであり、あらゆる暗号解読に対する免疫を意味するものではない。
同じ区別は実運用中のシステムにも当てはまる。組織はPQC移行を完了しても、脆弱なアクセス制御によって秘密鍵を露出させたままにする可能性がある。ネットワーク通信を保護しても、AIエージェントが認可済みツールを通じてデータを漏えいさせることもあり得る。
有効な署名アルゴリズムであっても、署名された指示が悪意あるものかどうかは判断できない。検証するのは真正性と完全性であり、信頼されたシステムが安全な判断を下したかどうかではない。
したがってPQCは、セキュリティの一層にすぎない。その周囲には、鍵管理、安全な実装、認証済みアップデート、アクセス制御、監視、そして迅速なアルゴリズム置換が必要となる。
こうした条件下では、暗号アジリティが特に重要になる。暗号アジリティとは、周辺アプリケーションを再構築せずに、チームがアルゴリズムや鍵を置き換えられるようシステムを設計することを指す。
この能力は常に有用だった。AI支援暗号解読は、発見から広範な認知までの間隔を短縮し得るため、これを運用上の緊急課題にしている。
企業には正確な暗号資産台帳も必要である。チームは、アルゴリズムがどこで使われているか、どのベンダーがそれを管理しているか、どのデータを保護しているか、そしてどれほど速く置き換えられるかを把握しなければならない。
一つの新しいアルゴリズムを全体に導入する移行は、別の集中リスクを生み出しかねない。そのアルゴリズムに後から弱点が見つかれば、依存するすべてのシステムが同時に対処待ちの列へ入る。
移行期には、ハイブリッド設計がこの露出を抑えられる。古典的コンポーネントと耐量子コンポーネントを組み合わせることで、片方に予期せぬ問題が発生しても、もう一方の層を利用できるようにする。
ハイブリッド暗号は恒久的な保証ではない。複雑さ、メッセージの大型化、相互運用性への要求、そして統合エラーの機会を増やす。それでも、新しいアルゴリズムが十分な精査を積み重ねるまでの間、有用な多様性を提供できる。
Claude MythosによるHAWK攻撃は、セキュリティが交換可能なコンポーネントと多層的な制御に依存することを強調している。数学的な不確実性がすべて消えるまでPQC導入を凍結すべきだという主張を支持するものではない。
待機すれば、既知の量子リスクへの露出が残る。置換計画なしに進めば、別の形の脆弱性が生じる。セキュリティチームは、この両方の圧力を同時に管理しなければならない。
AIが暗号解読のタイムラインを圧縮している
最も重大な変化は、AIが一つの攻撃を見つけたことではなく、機械規模で脆弱性を繰り返し探索できることにある。
従来の暗号解読は、高度な専門性、直感、文献レビュー、実験、そして入念な検証を組み合わせる。進展には数カ月から数年を要することがあり、有用な着想に至るまでには多くの実りのない経路がある。
Anthropicのワークフローは、そのサイクルの一部を自動化した。Claude Mythosは論文を探索し、関連性を提案し、実験コードを書き、結果を検討し、限られた人間の指示のもとでアプローチを修正した。
HAWKに関する作業は完全自律ではなかった。研究者が指針を提供し、得られつつある結果に意味があるかどうかの判断を支援した。公表前には、人間の専門家と影響を受ける設計者も関与した。
それでも、分業の形は重要である。AIは同じ時間内に、人が手作業で探索できる以上の候補となる論拠や実験を生み出せる。その後、人間は検証と影響の評価に集中できる。
Anthropicが報告した2つ目の結果は、そのスケーリングの可能性を示している。別のスキャフォールドにより、Claude Mythosは7ラウンドAES-128に対するより高速な攻撃を自律的に開発した。
AES-128は通常、10ラウンドの変換を使用する。研究者は、完全なアルゴリズムの安全余裕を理解するため、縮小ラウンド版を調べる。7ラウンドを破れることは、攻撃者が実運用のAES-128を破れることを意味しない。
Anthropicは、この縮小版に対する従来の攻撃と比べて200倍から800倍の改善を報告した。同社はまた、この攻撃は依然として非現実的なほど高コストであり、完全なAESを脅かすものではないとしている。
こうした留保は不可欠である。これらがなければ、限定的な研究結果が、AIが現代のシステムを守る暗号を破ったという誤った主張へ変わってしまう。
価値は研究プロセスにある。HAWKと縮小ラウンドAESは異なる暗号構造を含むが、同じ種類のAIシステムが両方の分析に寄与した。
Anthropicと学術研究者はその後、6つの暗号ファミリーにまたがる191のタスク集であるCryptanalysisBenchを公開した。エージェントは実際の実装を悪用し、形式的なセキュリティテストを満たさなければならない。
ベンチマークの初期結果は、最先端モデルが意図的に脆弱化された方式に対する既知の攻撃の多くを再現できることを示している。研究者は、他の実験的な暗号設計に関する新たな発見も報告した。
ベンチマークは、オープンエンドな暗号解読に必要なあらゆる能力を測定するものではない。タスクには定義済みの環境、利用可能な実装、測定可能な成功条件がある。
現実の研究は、より大きな曖昧さから始まる。モデルは、どの前提が重要かを判断し、有用な文献を特定し、無効な証明を避け、本物の弱点と実験ノイズを区別しなければならない。
HAWKの事例が注目されるのは、その隔たりの一部を越えたからである。このシステムは、訓練課題の中に隠された答えを再発見しただけではない。Anthropicによれば、これまで未知だった攻撃を開発し、動作する実証コードを提供した。
独立した精査は引き続き必要である。Anthropicはモデルを開発し、プロジェクトを実行し、主要な性能主張を公表した。そのため、成功を強調し、失敗したセッションを控えめに扱うインセンティブが生じる。
同社は、多くのセッションで新たな発見が得られなかったことを認めている。また、大規模な人間による検証が行われたとも報告しており、モデルが問題全体を独力で解決したという単純な主張を難しくしている。
独立した評価は、この成果の重要性と、Anthropicのより広範なマーケティング上の主張をめぐる不確実性の両方を指摘した。このバランスが適切だ。
この攻撃は技術的に重要であり得る一方で、AIが自律的な暗号解読の達人になったことを証明するものではない。1件の成功だけでは、未知の研究課題全般におけるシステムの失敗率は分からない。
しかし攻撃者は、すべての試行で確実に天才的な成果を出す必要はない。並列で探索を走らせ、成功した経路を残し、数千件の失敗を捨てればよい。
この非対称性は防御側に圧力をかける。標準化団体は、信頼に足るすべての結果を慎重に検証しなければならない。攻撃者に必要なのは、機能する経路が1つだけだ。
真のボトルネックは人間による検証
より迅速な発見がセキュリティ上の利点となるのは、防御側が発見内容を十分な速さで検証し、優先順位を付け、修正できる場合に限られる。
AIによる脆弱性研究は、よく知られたスケーリング問題を生む。もっともらしい報告を生成するコストは、その正しさの確認、影響の測定、開示の調整、安全な修正の提供よりも低い。
暗号分野では、小さな数学的誤りが攻撃全体を無効にし得るため、この問題はいっそう深刻になる。もっともらしいモデルの説明は、証明、再現可能なコード、専門家レビューに代わるものではない。
偽陽性は貴重な注意力を消費する。研究所が数千件の推測的な弱点を生成すれば、保守担当者や標準化チームは、本物の発見と自信に満ちた誤りを見分けなければならない。
真陽性も別の負担を生む。各発見には、独立した分析、設計者との連絡、新しいパラメーター、実装の更新、相互運用性テスト、コンプライアンス指針の改訂が必要になる可能性がある。
HAWKへの対応は、好条件の下で行われた。このアルゴリズムはオープンな標準化プロセス内にとどまっており、本番システムはこれに依存していなかった。
設計者は、組織に鍵のローテーションや証明書の置き換えを強いることなく、この候補を撤回できた。AIが広く導入されたソフトウェアやプロトコルの弱点を見つけた場合は、そうはいかない。
本番環境の暗号技術には長い依存関係の連鎖がある。オペレーティングシステム、ブラウザー、クラウドプラットフォーム、ハードウェアモジュール、組み込みデバイス、IDサービス、サードパーティライブラリが、同じ暗号プリミティブを共有している場合がある。
数学的に妥当な置き換えであっても、すべてのエンドポイントに届くまで何年もかかることがある。サポート終了済みのデバイスやハードコードされた依存関係により、ベンダーが修正を公開した後も脆弱なコンポーネントが使われ続ける可能性がある。
AIは、この修正の隔たりをより頻繁に可視化する可能性がある。同時に、防御側が十分な受け入れ能力を整える前に攻撃側が同じ能力を手にすれば、その隔たりを広げる可能性もある。
AnthropicはHAWKプロジェクトを責任ある研究だと説明している。同社によれば、6月に攻撃手法をHAWKの著者と共有し、NISTのチャネルを通じて公開を調整した。
HAWKは導入されていなかったため、このプロセスは当面のリスクを低減した。将来の成果は、短い開示期間内に安全なパッチを適用できないシステムに関わるかもしれない。
その場合、アクセス方針はセキュリティアーキテクチャの一部となる。研究所は、高度なサイバー能力を誰が利用できるのか、どの活動に監視が必要か、どのような結果に義務的なレビューが必要かを決めなければならない。
1つのモデルを制限しても、この問題は解決しない。能力は、新しいモデル、オープンな研究、蒸留モデル、特化型エージェントフレームワークを通じて拡散する。
より持続的な防御は、検証能力の拡充である。標準化団体には、再現可能な提出物、自動テスト環境、独立した査読者、明確な証拠要件が必要だ。
ベンダーには、人間の対応チームを過負荷にすることなく、機械生成の報告を受け入れられる仕組みが必要である。報告には、コード、影響を受ける構成、攻撃の前提、再現可能な影響測定を含めるべきだ。
AIは、このキューの防御側でも役立つ。別のシステムが実験を再現し、パッチを比較し、依存関係を検査し、重複した発見をグループ化できる。
ただし、同じモデルに結果の提案と承認をさせることには明らかな利益相反がある。独立した検証には、異なるツール、別々のプロンプト、適格な人間の判断を用いるべきだ。
セキュリティチームは、数学的な改善すべてを緊急事態として扱うことにも抵抗すべきである。HAWK攻撃は候補のセキュリティ評価を変えたが、より大きなパラメーターに対する攻撃は依然として現実的ではなかった。
同様に、ラウンド数を削減したAESの結果は、本番環境のAES鍵をローテーションする理由にはならない。過剰反応はリソースを浪費し、将来の開示に対する信頼を損なう。
適切な対応は、証拠、導入状況、攻撃コスト、影響を受けるセキュリティ前提に依存する。これらの要因は、AI生成のあらゆる報告で明示されなければならない。
セキュリティリーダーが次に注視すべきこと
Claude Mythos HAWK攻撃が孤立した成功なのか、それともセキュリティ研究における持続的な変化の始まりなのかを示すシグナルは3つある。
第1のシグナルは独立した再現である。Anthropic以外の研究者が、HAWKの手法、その計算量見積もり、パラメーターの選択にわたる影響を検証しなければならない。
研究者が復元されたチャレンジ鍵を観測できるため、動作する実証コードは信頼性を高める。しかし、それだけで大規模なインスタンスへのあらゆる外挿が自動的に正当化されるわけではない。
独立した暗号研究者は、関連する構成に同等の対称性が含まれるかどうかも検証すべきだ。より広いパターンが見つかれば、ほかの格子ベース設計への圧力が高まる一方、HAWK固有の結果であれば影響は限定される。
NISTによる撤回の扱いが、第2のシグナルを示す。同機関の追加署名プロセスは、異なる性能・セキュリティ特性を持つアルゴリズムを選ぶためにも設けられている。
重要な問いは、AI支援レビューが候補評価の標準的な一部となるかどうかだ。NISTはすでに、署名プロジェクトを通じて提案を公的な精査にさらしている。
正式なAI評価要件は、標準化プロセスが適応しているという主張を強めるだろう。非公式な実験だけでは、対象範囲が個々の研究所や高価なモデルへの不均一なアクセスに左右され続ける。
第3のシグナルは、未知の暗号解析問題における性能である。モデルや開発者が既知の課題に直接最適化できるようになると、公開ベンチマークの有用性は低下する。
研究者には、非公開の問題を維持し、不成功の試行を記録し、モデル出力と人間の貢献を切り分ける管理されたテストが必要である。成功と並べて、コストと経過時間も報告すべきだ。
無関係なアルゴリズムにまたがる新規の結果が繰り返し得られれば、Anthropicのより広範な主張を支持することになる。そうした成果を再現できなければ、HAWKが好都合な問題構造に適合していたことを示唆する。
セキュリティリーダーは、その議論が決着するのを待ってから行動すべきではない。暗号依存関係をマッピングし、調達で置き換え経路を要求し、重要サービスがどれほど迅速にアルゴリズムを切り替えられるかをテストできる。
また、量子への備えと一般的なAIセキュリティを分けて考えるべきだ。PQCは、特定の将来の計算能力によるデータと認証への脅威から保護する。復号済み情報を認可されたAIエージェントがどう扱うかを統制するものではない。
安全な組織には、両方のプログラムが必要だ。一方は量子復号への露出を減らし、もう一方はモデルアクセス、ツール権限、データフロー、監視、人間による認可を管理する。
したがって短期的な判断は、PQCとAI防御のどちらを選ぶかではない。既存のセキュリティ運用が、困難な暗号移行を完了しながら、より高速な発見を吸収できるかどうかである。
次回のアーキテクチャレビューでは、実務的な問いを1つ投げかけるべきだ。明日、AIシステムが信頼されているアルゴリズムを無効化した場合、チームはすべての依存関係を特定し、安全に置き換えられるだろうか。
Claude Mythos HAWK攻撃は、発見のサイクルが短くなっていることを示している。組織には今、それに追随できる置き換え、検証、ガバナンスのサイクルが必要だ。



