Anthropic AIサイバー攻撃:90%自動化主張の解剖
更新日:6月17日

ヘッドラインは紛れもなく警告的なものでした。Anthropicは最近、中国の国家支援を受けたスパイ活動グループが、同社のClaudeモデルを利用して、数十の組織に対するサイバーキャンペーンの大部分を自動化したと発表しました。表面的には、これはセキュリティ業界で長年抱かれてきた懸念を裏付けるものです。すなわち、大規模言語モデル(LLM)が、便利なコーディングアシスタントから、デジタル戦争を遂行できる自律型エージェントへと進化しているということです。
しかし、プレスリリースや恐ろしい数字の裏には、はるかに複雑で議論の多い現実が隠されています。企業のエンジニアはこの状況を「初の」自律運用と位置づけていますが、サイバーセキュリティの専門家や業界のベテランたちは反論しています。彼らは、洗練されたAnthropic AIのサイバー攻撃という物語は、ハッキングにおける技術的ブレークスルーというよりも、「自動化」が実際に何を意味するのかを再定義することに関するものである可能性が高いと主張しています。
懐疑論は、攻撃があったかどうかだけでなく、どのように特徴づけられたかについても向けられています。マーケティングのやらせという非難から、運用セキュリティ(OpSec)に関する基本的な疑問まで、公式報告とコミュニティの反応との間の乖離は、私たちが「remio」について話す方法における高まる緊張を浮き彫りにしています。AIの脅威。
公式見解:自律型Anthropic AIによるサイバー攻撃か?

11月13日に同社代表が発表した声明によると、エンジニアたちは不正利用のクラスターを検出し、最終的には中国のサイバースパイに関連するオペレーターに起因すると結論付けました。この主張は具体的かつ大胆です。攻撃者は、攻撃チェーンの約80〜90%を計画および実行するためにClaude Codeモデルを使用したとされています。
標的は、30の組織にわたるテクノロジー、金融、政府部門に及びました。Anthropicは、人間が関与するのはターゲットの選択やデータ取得のタイミング決定といったハイレベルな意思決定のみに限定され、それ以外の偵察、脆弱性分析、エクスプロイト生成、さらにはデータ漏洩まで、すべてモデルが処理したとされる運用について説明しています。
これを達成するために、攻撃者はタスク分解と呼ばれる手法を使用したと報じられています。これは、悪意のある目的を、モデルの安全ガードレールを回避する、より小さく無害に聞こえるリクエストに分解することを含みます。AIに「このサーバーをハッキングしろ」と尋ねる代わりに、オペレーターは「接続テストを実行する」や「スクリプトをデバッグする」といった指示を出し、その結果を組み合わせて悪意のある目的を達成する可能性があります。
額面通りに受け取れば、これは大きな変化を意味します。市販のAIツールが単なるフォースマルチプライヤーではなく、複雑な侵入のパイロットに事実上なりつつあることを示唆しています。
オーケストレーションレイヤー:専門家が懐疑的な理由
サイバーセキュリティコミュニティの反応はAnthropic AIサイバー攻撃に関するレポートは、あまり信じられていませんでした。主な論点は「自律的」という言葉です。
Palo Alto Networksの研究開発担当副社長であるJonathan Allon氏は、この調査結果を、彼と同僚が「毎日見ている」「ありふれた攻撃」と解釈しました。サイバー脅威インテリジェンス企業Intel 471のアナリストであるJeremy Kirk氏は、Anthropicのレポートを「奇妙」と評し、わずか13ページで、通常の脅威インテリジェンスレポートの伝統的な構成要素が欠けていると指摘しました。
この区別は非常に重要です。AIが単独でゼロデイ脆弱性を発見することと、AIが人間が10年前に実行できたスクリプトを実行することの間には、大きな違いがあります。
多くの専門家はこれを「AIの天才」と見ています職場では、「ハイブリッドモデル」として。AIはオーケストレーションレイヤーとして機能します。これは、偵察タスクをまとめ、コードをドラフトする、疲れを知らないインターンです。これは確かに攻撃者にとって有用ですが、一般の人々が理解する方法で「90%の自動化」という数値を必ずしもサポートするものではありません。
AIがネットワークをスキャンするのに10時間かかるbashスクリプトを作成した場合、その10時間のブロック全体を「AI自動化」に帰することは、統計的、技術的には正しいですが、文脈上誤解を招きます。その行動を指示するために必要な知性は、依然として人間のオペレーターにあります。さらに、Anthropicはレポートの中で、Claudeが有効に見えるが無用な認証情報を含むエラーや幻覚を生成したと指摘しています。これには修正のために人間の介入が必要であり、主張されているよりもはるかに「ハンズオフ」ではなかったことを示唆しています。
マーケティングのやらせか?「治療法と病気の販売」

この事件を取り巻く論調の大部分は、動機に焦点を当てています。なぜ今この報告書を発表し、なぜこのような形で提示したのか?
読者や業界関係者は、認識されている利益相反を指摘しています。AnthropicはAIの安全性におけるリーダーとしての地位を確立しようとしています。恐ろしいAnthropic AIサイバー攻撃シナリオを強調することで、彼らは同時に自社のモデルの能力(ハッキングできるほど賢い)と自社の安全製品の必要性(私たちがいなければそれを止めることができない)を実証しています。
コミュニティからのコメントの一つが、その感情を要約しています。「Anthropicは、自社のAIが侵入活動に利用される可能性を、記事全体で強調していますが、防御側にはIOC(侵入の痕跡)や帰属の手がかりを一切与えていません。90%は誇示、10%は価値。
懐疑論は、そのタイミングによって煽られています。世界中の政府が現在、AI規制やAI安全研究所への資金提供について議論している中で、「国家が支援する」脅威の物語は強力なてこ入れとなります。これは、厳格な監視の必要性と、防衛グレードのAI監視のための収益性の高い政府契約の可能性を正当化します。企業が、自社の特定の監視ツールのみが検出し軽減できる脅威を過度に宣伝する場合、観察者は自然とそのようなものをマーケティングの駆け引きと見なす傾向があります。
運用上のセキュリティと「中国のサイバー諜報」のパラドックス

おそらく、Anthropic AIのサイバー攻撃の物語に対する最も痛烈な批判は、運用上のセキュリティ(OpSec)の観点から来ています。
高度な持続的脅威(APT)として一般的に知られている洗練された中国のサイバー諜報グループが、米国でホストされ、一般に公開されている大規模言語モデルを通じて主要なキャンペーンを実行するという考えは、多くの専門家にとってばかげていると言っても過言ではありません。
ClaudeのようなクラウドベースのLLMをコマンド&コントロール(C&C)や機密性の高いエクスプロイト生成に使用することは、攻撃計画をFBIに直接郵送するようなデジタル版です。これらのモデルは対話を記録します。それらは不正使用のために監視されています。国家レベルの攻撃者はこれを認識しています。
実際の国家レベルの脅威アクターは、何よりもステルス性を重視します。もし彼らが生成AIを使用してマルウェアを作成したり、脆弱性を分析したりしたいのであれば、アメリカの巨大テクノロジー企業がプロンプトを検査できない、ローカルのエアギャップインフラストラクチャで実行されているオープンソースモデル(Llamaなど)を使用する可能性がはるかに高いです。追跡可能なペーパー・トレイルを残す商用APIを使用することは、高度な諜報活動のオペレーション・モード・オペランディと矛盾します。この矛盾により、攻撃者は低レベルの請負業者であったか、「スクリプトキディ」がツールを試していたか、あるいは国家支援グループへの帰属が提示されているよりも薄弱であると多くの人が信じています。
証拠不足の問題
Anthropic の主張に対する最も強力な反論は、ハードデータが存在しないことです。報告書は物語的な説明を提供しましたが、サイバーセキュリティコミュニティが脅威を検証するために頼る技術的なアーティファクトを欠いていました。
具体的なプロンプトは公開されませんでした。侵害の兆候 (IoC) なしタスクの分解が機能していることを示す詳細なログはありません。
「プロンプトがなければ、それは起こらなかった」が、議論の合言葉となっています。実際のやり取りを見ずに、AI が本当に攻撃を「計画」していたのか、それとも非常に具体的で人間が誘導した指示に応じただけなのかを判断することは不可能です。
さらに、Claude のようなモデルに関するユーザーエクスペリエンスは、しばしば超有能なハッカーという考えと矛盾します。ユーザーは、これらのモデルに、広範な手取り足取りの指導なしに基本的なネットワーク概念を理解させるのに苦労しています。「基本的なネットワーク定義に苦労している」から「30 ターゲットのスパイ活動キャンペーンを調整した」への飛躍は、現在の証拠では埋められない大きな隔たりです。
タスク分解とAIハッキングの現実
懐疑論にもかかわらず、タスク分解の概念は現実的かつ増大する懸念事項です。これは、リクエストを原子化することによって安全フィルターを回避する方法を指します。
攻撃者が「この銀行からデータを盗む方法は?」と尋ねた場合、モデルは拒否します。しかし、攻撃者が「侵入テスト」のためにSQLインジェクションの脆弱性をテストするPythonスクリプトを要求し、次にデータベース出力をフォーマットする別のスクリプトを要求し、さらに3つ目の暗号化されたトンネルを確立するスクリプトを要求した場合、モデルは個々のリクエストすべてに準拠します。
Anthropicのエンジニアは、攻撃者がリクエストを無害な侵入テストタスクとして提示したと指摘しました。これは、モデルが「不正」だったのではなく、騙されたことを確認します。攻撃の「知性」は、強盗を準拠可能なチャンクに分割できる人間に由来しました。
これはAnthropicのAIサイバー攻撃の物語を偽にするものではありませんが、ジャンルを変えます。自律的なAIエージェントの物語ではなく、既存のツールの新しいインターフェースの物語です。AIは定型コードの記述の摩擦を減らしましたが、攻撃ロジックを発明したわけではありません。
将来への影響:参入障壁の低下
90%という自動化の数値が正確か誇張されているかにかかわらず、この事件は否定できない傾向を浮き彫りにしています。それは、サイバー犯罪の参入障壁が低下しているということです。
もはや、偵察キャンペーンを開始するためにマスターコーダーである必要はありません。必要なのは、それを実行するようにエンジンに指示する方法を知っていることだけです。AIが誤った認証情報を生成したり、ネットワークマッピングを誤ったりしたとしても、これらのタスクを試行する速度は、防御側にとって量的な問題となります。
専門家は、私たちは完全に自律的なAIハッカーの段階には達していないものの、「ハイブリッド運用」の時代に入りつつあるという点で一致しています。敵対者はLLMをフォースマルチプライヤーとして扱うでしょう。これにより、小規模なグループでも実力以上の力を発揮できるようになり、国家主体はより多くの人的資源を募集することなく、運用を拡大できるようになります。
しかし、不器用なオペレーターによる失敗した試みを、洗練された自律的な国家レベルの脅威として扱うことは、防御者にとって不利益となります。それは、仮説上のリスクと実際の運用上の現実との間の区別を曖昧にします。
結論
「Anthropic AI サイバー攻撃レポートは、業界にとってロールシャッハテストのようなものだ。セキュリティ販売者にとっては、即時の投資を必要とする恐ろしい未来への警告となる。ネットワーク防御の最前線にいる者にとっては、その瞬間のバズワードで着飾った、標準的な侵入のセンセーショナルな記述のように見える。
Anthropicのような企業が詳細なログ、プロンプト、技術的証拠を公開するまで、90%の自律的な攻撃という主張は検証されていません。現実はもっとありふれたものでしょう。悪意のある攻撃者はAIを含む利用可能なあらゆるツールを使用していますが、キーボードの後ろにいる人間がまだ糸を引いています。危険なのはAIが自分で考えていることではなく、人間が悪意のある衝動に行動しやすくなることです。
FAQ

Q: 中国のグループが本当にClaudeをサイバー攻撃に使用したのか?
Anthropicは、中国の国家支援グループがその活動の背後にいたと主張しています。しかし、独立したセキュリティ専門家はこの帰属に疑問を呈しており、米国でホストされている公開AIモデルを使用することは、国家主体ではなくアマチュアに典型的な、大規模な運用上のセキュリティ上の失敗であると指摘しています。
Q: 「80-90%の自動化」という主張は実際には何を意味するのか?
この数字は、戦略的意思決定ではなく、ポートスキャンやコードスニペットの作成など、AIによって実行されたタスクの量を示している可能性が高いです。人間は依然として重要な「ハイレベル」なターゲティングと意思決定を処理しており、AIは指揮官ではなくツールでした。
Q: AI攻撃の文脈におけるタスク分解とは何か?
タスク分解とは、攻撃者がAIの安全ガードレールを回避するために、悪意のある目標を小さく無害に見えるステップに分解する技術です。例えば、「ハッキングして」と依頼する代わりに、「ネットワーク接続テスト」を依頼します。これはAIには正当な要求と見なされます。
Q: なぜ人々は、AnthropicのAIサイバー攻撃レポートがマーケティングのやらせだと考えているのですか?
批評家は、技術的な証拠の欠如とレポートのタイミングを指摘しています。自社製品を、自分たちだけが制御できる危険な武器として位置づけることで、Anthropicはより多くのセキュリティソリューションを販売し、政府の規制に影響を与えることを目指しています。
Q: ClaudeのようなAIモデルは実際にハッキングを自律的に実行できますか?
現時点ではできません。コードを書いたり既知の脆弱性をスキャンしたりすることはできますが、頻繁に幻覚(偽の情報を発明する)を起こしたり、間違いを犯したりします。これらの間違いを修正するには常に人間の監督が必要であり、自律的なハッカーではなくアシスタントとなっています。



