AnthropicのUAE影響工作疑惑が露呈させるAIの説明責任の空白
Anthropicによると、UAEの影響工作はClaudeを用いて約300件の不正なソーシャルアカウントを連携させ、スーダンに関係する批判者を標的にした。同社はこのキャンペーンを高い確信度でUAE政府当局者に結び付けたが、個々の行為を誰が承認したのかまでは独自に確定していない。
この違いは重要だ。Anthropicは、ある1人の主体が数百回のセッションにわたりClaudeを使い、政治的メッセージング、個人調査、ソーシャル上での拡散、計画された証言を結び付けたとしている。この疑惑の工作は、説得力のある投稿を生成するだけにとどまらなかった。依頼を受けた言説を、独立した証拠であるかのように見せようとした。
AnthropicによるUAE影響工作の主張は、AI企業が私的な情報機関にますます似た存在になりつつある時期に出てきた。研究者、政府、ソーシャルプラットフォームには見えないプロンプトやアカウント行動を、AI企業は把握できる。一方で外部の人々は、基礎データを目にできないまま、その帰属判断を評価しなければならないことが多い。
AnthropicがUAE影響工作について説明した内容
Anthropicが描写したのは、孤立したチャットボット会話の集まりではなく、連携された影響工作システムだ。
同社は2026年9月のAI misuse reportでこの活動を公表した。同レポートは、Anthropicが2025年12月から2026年8月にかけて阻止したとしている有害な活動を扱っている。
Anthropicはこの事案に内部識別子GTG-84002を付与した。ある1人の主体が、民間プラットフォーム上で「Deadshot」と呼ばれるAIペルソナを維持していたという。恒常的なドクトリンファイルが、数百回に及ぶセッション全体でこのペルソナを導いた。
そのドクトリンは主として、ムスリム同胞団の国際的な影響力を解体することに焦点を当てていた。Claudeが関与する前に、主体は政治的目標を提示していた。この点は、モデルがキャンペーンの思想や標的を独自に選定したとの主張を限定する。
Anthropicによると、この主体は作戦を相互に結び付いた5つの作業領域に分けていた。それぞれが同じ政治的目標の異なる部分を担っていた。
第1の作業領域は、約300の不正なインフルエンサーアカウントを管理した。Anthropicは、このネットワークには中央集権的な資金提供と調整があったとする一方、アカウントは独立した声であるかのように見せられていた。
第2の領域では、実在するスイスの団体のアイデンティティをコピーしたフロント組織が作られた。疑惑のある運営者らは、この借用したアイデンティティを利用し、国家が作成した人権関連資料を独立した報道として公表した。
第3の作業領域では、国連人権理事会第62会期で発言する予定だった2人の証言が準備された。Anthropicによると、その内容はUAEへの言及を意図的に避けていた。
理事会の第62会期は、2026年6月15日から7月7日まで開催された。Anthropicは、準備された声明が最終的に提出されたかどうかを確認していない。
第4の作業領域では、欧州議会議員18人と著名なジャーナリストが調査された。Anthropicによれば、主体はこれらの人物に関する詳細なファイルを作成したが、公には特定していない。
第5の領域では、Anthropicが「counter-accountability dossiers」と呼ぶ、国連特別報告者に関する資料がまとめられた。これらの専門家は、スーダンにおけるUAEの疑惑の行為を批判していた。
同社は、関連アカウントを削除したとしている。また、ドクトリンには一部の成果物の想定受領者としてUAEの高官が記されていたともいう。
ただし、公開レポートには完全なプロンプト、アカウント記録、本人確認の証拠、資金の流れは示されていない。したがって読者が目にしているのはAnthropicの結論と選定された事例であり、完全な調査記録ではない。
この制約は、調査結果の重要性を損なうものではない。むしろ適切な枠組みを示している。これはサービス提供者による詳細な帰属判断であり、司法判断や独立したフォレンジック監査ではない。
Anthropicはこの作戦を、影響キャンペーンを観測可能な拡散と影響によって評価する枠組みであるBreakout Scaleのカテゴリー3に分類した。この評価は、複数のプラットフォームにまたがる活動を示す。
より高い評価には、広範な注目または測定可能な政策効果の証拠が必要だった。Anthropicは、いずれも確認できなかったとしている。
この不確実性は、作戦上の高度さと実証された成功を分けるものだ。キャンペーンは説得力のある基盤を構築し、意思決定者を分析し、政治的コンテンツを準備しても、世論や政策を変えずに終わる可能性がある。
最も妥当な結論はより限定的だ。Anthropicによれば、Claudeは、従来なら別々の調査員、執筆者、翻訳者、キャンペーン管理者を必要とした複数の欺瞞的活動を、ある1人の主体が組織する助けとなった。
スーダンがこのキャンペーンを単なるメッセージング以上のものにした理由
この作戦は戦争を調査するための仕組みを標的にしたとされ、AIの悪用を説明責任の問題へと転化させた。
スーダンでは2023年4月以降、スーダン国軍と準軍事組織である即応支援部隊の間で武力紛争が続いている。この戦闘は、大規模な避難、飢餓、民間人の死、広範な残虐行為の疑惑を生んできた。
UAEは、RSFへの軍事支援を繰り返し否定している。スーダン当局者、人権団体、調査関係者は、UAEとつながるネットワークがこの準軍事組織を支援していると非難してきた。
2026年9月の国連調査は、新たな文脈を加えた。Sudan findingsは、武器、物流、訓練、外国人要員をRSFに供給する国境をまたぐネットワークを記述した。
調査員は、UAE、コロンビア、チャドを含む複数国で活動する企業と仲介者を特定した。UAEは調査に協力した一方、いずれの側にも武器や支援を提供していないとの否定を続けた。
こうした相反する主張は、独立した証拠をとりわけ重要なものにする。国連専門家、ジャーナリスト、議員、人権団体は、どの疑惑が国際的な注目を受けるかを左右する。
Anthropicの説明は、この疑惑の作戦がその証拠形成の過程を狙ったことを示唆する。UAEの政策を好意的に見せるための主張にとどまらず、批判者に関する資料を作成し、人権関連の経路に偽装した政治的資料を送り込もうとしたとされる。
複製された組織は、この仕組みをよく示している。独立した市民社会の調査を装った文書は、政府が公式に出した声明より高い信頼性を持ち得る。
ゴーストライティングによる証言も同じ論理に従う。地域の、または独立した視点を代表しているように見える発言者は、当局者の紛争理解に影響を及ぼし得る。支援者への言及を削除すれば、メッセージの出所はさらに見えにくくなる。
これが、この事案が偽アカウント数を超えて重要である理由だ。ソーシャル投稿は可視化され、削除も可能だ。資料、ブリーフィング、証言は、研究者、当局者、組織の間を非公開で移動し得る。
特別報告者を標的にしたとされる点も、別の懸念を加える。これらの専門家は、相反する利害を持つ当事者からの情報源、文書、インタビュー、提出物に依存している。
AI支援のキャンペーンは、その過程を洗練された資料で圧倒し得る。また、資料を評価する人物を分析し、評判上の弱点や圧力点を探ることもできる。
Anthropicは、いずれかの報告者がこれらの資料に依拠したとは述べていない。文書が意図した受領者に届いたかどうかも確認していない。これらの欠けたつながりにより、この作戦が国連の手続きを損なったとは結論付けられない。
それでもキャンペーンの設計は、単にオンライン上の感情を動かすのではなく、説明責任のあり方を形作ろうとする意図を示している。独立機関を標的であると同時に配布経路として扱っていた。
これは防御側にとって、より難しい問題を意味する。プラットフォームは、アカウント作成のパターン、共有インフラ、協調した投稿を比較できる。国際機関は、AIを使った専門的な体裁の提出物をすべて自動的に拒否することはできない。
出所、裏付け、隠れた支援者を判断しなければならない。生成AIが調査、アドボカシー、証人証言の文体を素早く模倣できるようになるほど、こうした確認の必要性は高まる。
ナレッジワーカーにとって、出所とは情報がどこで生まれ、どのように変化したかを知ることを意味する。規律あるknowledge managementのプロセスは、原資料、相反する主張、検証メモを保持できる。
政治的な主張が真実かどうかを判定することはできない。しかし、出所が示されない文書が、反復されるだけで受け入れられてしまうことを難しくすることはできる。
Claudeによる影響工作は協調を基盤としていた
Claudeの疑惑の価値は、新しい政治戦略の発明ではなく、多数の業務にわたる運用上の一貫性にあった。
このキャンペーンは、既存のドクトリンファイルを使って出力の整合性を保っていたとされる。恒常的な指示により、主体は数百回のやり取りにわたって目標、望ましい枠組み、制約を繰り返し適用できた。
この構造が重要なのは、影響工作には多くの小さな制作業務が含まれるためだ。運営者には、調査要約、経歴、投稿、論点、レポート、翻訳、配信計画が必要になる。
汎用モデルは、1つの共有コンテキストを通じてこうした業務を結び付けられる。主体は、出力ごとに異なる専門家を必要としない。
Anthropicによると、このワークフローは、現実世界の対象と政治的ドクトリンを、公式の情報ブリーフのように見える形へと変換した。また、証言、アイデンティティを複製したレポート、資料、標的一覧も作成した。
「標的化」という言葉には慎重な扱いが必要だ。この事案では、特定の議員、ジャーナリスト、国連専門家を調査することが含まれる。Anthropicは、Claudeが彼らに対する物理的攻撃を行ったとは主張していない。
それでも、体系的な個人調査は、脅迫、操作、個別に最適化された説得を支援し得る。また、誰に接触し、どの論拠を使うかを運営者が決める助けにもなる。
「Deadshot」ペルソナは、持続的な運用インターフェースとして機能していたようだ。主体は毎回のセッションで任務を説明し直す代わりに、システムの設定内に組み込んだ。
これにより不整合は減る。また、チャットボットを再利用可能なキャンペーンのワークフローに近いものへ変える。
疑惑の作戦は、ナラティブの作成を技術的な秘匿と戦術的な選定と同期させた。この組み合わせは、個別のAI生成投稿よりも大きな意味を持つ。
モデルは、資料を自然な表現に書き換え、異なる場面向けに出力を整形し、共通のメッセージを保つことができた。ドクトリンとキャンペーン目標については、人間の運営者が責任を負っていた。
この役割分担は、Anthropicのより広範なレポート全体にも見られる。主体は標的と望む結論を選び、その後、調査、草稿作成、翻訳、ソフトウェア開発を加速させるためにAIを利用することが多かった。
Anthropicの脅威インテリジェンス責任者であるJacob Kleinは、より広い傾向を政府の情報業務における自動化と表現した。automated surveillanceに関する彼の発言は、まったく新しい標的カテゴリではなく、効率性を強調していた。
同じ解釈はこのキャンペーンにも当てはまる。政治的な主体は以前から、フロント団体を作り、同調的な証言者を育て、反対派に関する調査をまとめ、偽アカウントを連携させてきた。
生成AIは、これらの活動をより小さなチームに圧縮する。1人の運営者が複数の形式で資料を作成し、政治的状況が変化した際に素早く改訂できる。
人員配置のハードルを下げることになる。キャンペーンが国境、機関、オーディエンスをまたぐ場合には、言語の壁も下げられる。
しかし、自動化は検知可能なパターンも生み出す。使い回された方針文書、反復される書式、共通のインフラ、関連づけられたアカウントは、組織的な連携を露呈させうる。
ツール提供者は、とりわけ有用な位置を占める。Anthropicは、公開研究者には見えない利用履歴や技術的シグナルを調査できる。
ソーシャルプラットフォームが見ているのは別の層だ。同期した投稿、偽の身元、不自然な拡散パターンを検知できる一方、コンテンツがどのように作られたかを把握していない場合もある。
国連のような機関が受け取るのは、最終的な文書や証言だ。基盤となるモデルの利用状況も、拡散を後押ししたソーシャルネットワークも、見えない可能性がある。
したがって、この作戦は複数の可視性の境界をまたいでいた。AnthropicがClaude内の行動をキャンペーン全体の構造と結び付けるまで、単独の防御側が全体像を把握していたとは限らない。
この断片化された可視性こそが、中心的なセキュリティ上の課題である。モデル提供者はアカウントを閉鎖できるが、すでに他所へコピーされたコンテンツを自動的に削除することはできない。
ソーシャルプラットフォームは不正なネットワークを削除できるが、非公開で送付された資料を回収することはできない。公的機関は証言を精査できるが、商用AI提供者の内部ログを調べることはできない。
有効な防御には、これらの層の間での情報共有が必要となる。また、正当なプライバシーを守りながら、組織的な悪用を明らかにするための安全策も必要だ。
Anthropicの帰属判断は重大だが、独立して完全に検証できるものではない
報告書で最も強い主張は、外部の人々が検証する手段を最も持たない主張でもある。
Anthropicは、この作戦をUAE政府当局者に高い確信度で結び付けたとしている。根拠として、隠された帰属、方針文書で名指しされた想定受領者、そして実行者が拡散に資金を提供したことを示す証拠を挙げている。
「高い確信度」は、絶対的な証明ではなく、同社の評価を示す表現である。情報機関の用語では、入手可能な証拠が判断をどの程度強く裏付けるかを表す。
Anthropicは、独立した分析者がその判断を再現できるだけの一次証拠を公表していない。ユーザー、調査手法、将来の検知能力を守るため、詳細を伏せた可能性が高い。
こうした理由は理解できる。しかし同時に、検証上の空白も残る。
一般の人々は、アカウントの支払い履歴、ネットワークメタデータ、アクセス場所、完全な方針文書、あるいは主張される受領者との通信を確認できない。公表された事案概要には、UAE当局者の実名も出ていない。
また、実行者から公式な承認命令へ至る、確認済みの連鎖も存在しない。当局者への送付を意図していたことだけでは、各作業を誰が委託したのかを必ずしも立証しない。
そのアカウントは、職員、請負業者、仲介者、あるいは政治的に近い民間アクターのものであった可能性がある。Anthropicの評価には、こうした可能性を区別する証拠が含まれているかもしれないが、その証拠は公開されていない。
そのため、この疑惑を扱う報道は慎重な表現を用いている。AFP accountは、このキャンペーンをUAE関連と説明し、アブダビがRSFへの支援を否定していることも繰り返し伝えた。
この枠組みは、二つの異なる争点を分けて保っている。一つはAI支援を受けたキャンペーンの責任に関するものだ。もう一つは、スーダン内戦の一方の当事者に対するUAEの支援疑惑に関するものだ。
一方の争点に関する証拠が、もう一方を自動的に解決するわけではない。UAEを擁護するキャンペーンがあったとしても、同国に対する根本的な非難のすべてが事実だと証明することにはならない。
同様に、UAEによる軍事支援の否定は、Anthropicの技術的な帰属判断への答えにはならない。それぞれの主張には、それぞれの証拠が必要である。
Anthropicも、証言や標的向け資料が実際に受け手へ届いたかは確認できないと認めている。同社が確認したのは作戦上の準備であり、検証済みの政策的影響ではない。
同社は、不正なネットワークがキャンペーンのコンテンツを増幅したとしている。ただし、本物のユーザーによる反応、世論の変化、制度上の対応について、公的な測定結果は示していない。
これは重要だ。なぜなら影響工作は、結果ではなくインフラによって評価されることが多いからである。300のアカウントからなるネットワークは相当な規模に聞こえるが、アカウント数だけでは説得力を測れない。
偽アカウントは、実在する人々にほとんど届かないまま頻繁に投稿できる。高度に洗練された文書も、読まれないまま終わりうる。計画された介入は、配信前に阻止される可能性もある。
カテゴリー3の評価は、この区別を反映している。この活動は複数のプラットフォームにまたがった一方、広範な世間の注目や政策への影響は未確認のままだった。
これは、この事案を軽視する理由ではない。測定可能な影響が出る前に妨害することは、防御側にとって望ましい結果である。
一方で、このキャンペーンを実証済みの成功として描くことは避けるべきだ。証拠がより強く裏付けているのは、実証された影響よりも、準備、連携、欺瞞、そして主張された帰属である。
Anthropicの役割自体も精査に値する。同社は自社製品の悪用を調査し、何を開示するかを決め、証拠を選び、対応策を説明している。
そこには専門性と制度上のインセンティブの双方がある。AnthropicはClaudeの利用状況への最良のアクセスを持つ一方、自らが悪用を検知できることを示す利益も得る。
独立研究者は、提供者に単純に取って代わることはできない。しかし、同社の主張を、プラットフォームの記録、公開投稿、保存された文書、影響を受けた機関の声明と照合することはできる。
こうしたモデル提供者による透明性は、業界標準になりつつある。OpenAIも、ウェブサイトやソーシャルアカウントとともにAIを用いたcovert influence campaignsについての調査を公表している。
これらの開示は有用な手法を明らかにする。一方で、用語や証拠基準が企業ごとに異なるため、企業横断での比較は難しくなりうる。
成熟した報告制度には、一貫した確信度の水準、到達度の測定、保存されたサンプル、そして未解明の点に関する説明が含まれるべきだ。また、アカウントの帰属と政治的影響に関する結論を分ける必要もある。
こうした基準がなければ、一般の人々は各社の脅威報告を、主として提供者の示す枠組みで解釈するほかない。
本当のトレードオフは、検知と移転の間にある
Claudeアカウントを一つ削除すればキャンペーンを中断できるかもしれないが、その背後にあるワークフローや政治的需要をなくすことはできない。
Anthropicは、UAE関連の作戦に関与したアカウントを削除したとしている。この措置によりClaudeへのアクセスが制限され、同社は将来の検知に向けた行動上のシグネチャを得た。
アカウントの削除は必要だが、実行者の方針文書と政治的目標はモデルの外部に存在する。同じワークフローは、別の提供者、セルフホスト型モデル、あるいは人間の請負業者群へ移行できる。
OpenAIは、脅威活動が一つのAIプラットフォーム内にとどまることはめったにないと報告している。同社の研究はまた、実行者がモデルを従来型のツール、ウェブサイト、ソーシャルアカウントと組み合わせることを示している。
Anthropicの9月の包括的な報告書も、この点を補強している。同社によれば、他社のモデルが作戦で対話以外の役割を果たしていた場合、そのAI研究所とも調査結果を共有したという。
提供者をまたぐ移動は、個々のアカウントだけに基づく安全策を弱める。実行者は、調査、草稿作成、翻訳、コード、公開を複数のサービスに分散できる。
ここに、検知と移転の間の緊張が生まれる。より強力な執行は、一つのプラットフォームで観測された悪用を止められる一方、実行者をより見えにくいインフラへ押しやる可能性がある。
セルフホスト型モデルは、この問題をより難しくする。プロンプトを調査し、セッションを結び付け、アクセスを終了できる中央の提供者がいなくなるからだ。
ただし、中央集権的な監視には独自のリスクもある。モデル提供者は、公職者に関する政治的議論、擁護活動、研究を、それ自体として悪意あるものと扱うべきではない。
関連するシグナルは、組織的な欺瞞、なりすまし、隠された資金提供、同意のないプロファイリング、制度的手続きを操作しようとする試みである。コンテンツの視点だけでは、信頼できる執行基準にならない。
政治キャンペーンがAIを合法的に使い、演説原稿を作成したり公開報告書を要約したりすることはありうる。人権団体も、当局者を調査し、特定の政策立場を訴えることができる。
実行者が他組織の身元を模倣し、国家の指示を隠し、独立性を偽装し、あるいは偽のペルソナを組織的に運用する時点で、境界は変わる。
だからこそ、行動上の証拠が重要になる。複数アカウントで繰り返されるマスター方針文書、一元化された資金、複製された身元、共有インフラは、政治的な言葉遣いよりも強い指標となる。
ソーシャルプラットフォームは、生成AIが広く利用可能になる前から、類似の原則を発展させてきた。Metaは、コンテンツが不快かどうかではなく、誰が作戦を管理しているかについての欺瞞を軸に、組織的な不正行為を定義している。
生成AIは制作の層を拡張するが、根本的な欺瞞はなじみ深いままだ。実行者には依然として、配信チャネル、オーディエンス、信頼性、意思決定者へのアクセスが必要である。
ここには防御の機会がいくつもある。提供者は、繰り返し使われる方針文書、組織的なアカウントアクセス、大量のペルソナ作成、出所情報を取り除こうとする試みを検知できる。
プラットフォームは、同期した投稿や一致するインフラを特定できる。機関は、資金提供元の開示を求め、組織の身元を確認し、提出記録を保存できる。
ジャーナリストや研究者は、不審な資料を公開済みの言語パターンや保存された版と比較できる。これらの統制はいずれも、単独では機能しない。
AnthropicのAI悪用報告書は、拒否システムの限界も示している。モデルは操作を求める明示的な要求を拒否しても、同じ作業が通常のタスクに分割されれば応じる可能性がある。
経歴を書くこと、声明を翻訳すること、証言を整形することは、単独では無害に見える場合がある。リスクは、それらを組み合わせたワークフローと、その隠された目的から生じる。
持続的なコンテキストは、こうしたつながりを明らかにするため、検知を改善する。同時に、提供者が保有する情報の機微性も高める。
企業は、脅威に関する証拠をどれほど長く保持するか、誰がアクセスできるか、いつ共有できるかを定める規則を必要とする。政治的な調査は、プライバシーや市民的自由に関する難しい問題を提起する。
答えは、すべての会話を一律に監視することではない。高い確信度を伴う行動パターンと、厳格に統治された限定的な調査に焦点を当てる必要がある。
AnthropicのUAE影響工作主張を検証する三つのシグナル
次に得られる証拠は、Anthropicが孤立したアカウントを摘発したのか、それともより広範なキャンペーンの一構成要素を明らかにしたのかを示すはずだ。
第一のシグナルは、ソーシャルプラットフォームからの裏付けである。Anthropicは、複数のサービスで約300の不正アカウントが活動していたと説明している。
時期、コンテンツ、インフラ、資金提供が一致するプラットフォーム側の開示は、帰属判断を強めるだろう。また、本物のユーザーがその資料に接触したかも明らかになる。
一致する開示がないからといって、Anthropicの調査結果が自動的に否定されるわけではない。プラットフォームが同じ証拠を持たない場合もあれば、進行中の調査について語ることを避ける場合もある。
それでも、独立した確認は重要である。それにより、この事案は一社の内部評価を超えるものとなる。
第二のシグナルは、標的にされたとされる機関や人々からの反応である。国連人権理事会、特別報告者、欧州の議員、ジャーナリストは、関連する資料や働きかけを受けたかどうかを確認できる。
証言が提出または送付されたことが確認されれば、影響評価は変わる。それは、この作戦が準備段階を越え、説明責任を果たすための仕組みに到達したことを示す。
資料がそれらの機関に届かなかったという証拠は、Anthropicのより限定的な結論を裏付けるだろう。キャンペーンは依然として重大だが、観測可能な影響は限定的なものにとどまる。
第三の兆候は、より詳細な帰属根拠、またはUAE政府による公式な回答だ。Anthropicは、無害化したインフラ指標、文書サンプル、あるいは確信度評価についてより明確な説明を公表する可能性がある。
UAEは、スーダンに関する広範な否認とは切り離して、疑惑の影響工作に対応できる。具体的な回答があれば、二つの論争を区別しやすくなる。
これらの兆候は順番に評価すべきだ。プラットフォームによる裏付けはネットワークを、機関による検証は配布を、追加の証拠は帰属を検証する。
こうした疑問が残る間、読者は反復を検証と見なすべきではない。同じAnthropicの報告書を引用する複数の記事は、独立した確認にはならない。
実務上の教訓はスーダンにとどまらない。AIシステムは、一つの政治的ドクトリンを投稿、報告書、調査資料、証言へと展開しつつ、各チャネルで表現の一貫性を維持できる。
その能力は、ソース記録、本人性確認、透明性のある支援主体の価値を高める。同時に、モデル提供者に異例の調査権限を与えることにもなる。
AnthropicによるUAEの影響工作疑惑が重大なのは、機関が信頼性を確立する方法そのものへの攻撃未遂を描いているためだ。その重要性は、計画されたすべての成果物が成功したと証明できるかどうかには左右されない。
今後数カ月にわたり、対応するプラットフォーム上の削除、標的となった機関からの確認、そしてAnthropicの帰属判断を裏付ける証拠に注目すべきだ。こうした進展によって、これが阻止された実験だったのか、より広範なキャンペーンの目に見える断片だったのかが判断される。
それまでは、洗練された政治的コンテンツを、見栄えだけで証拠とみなすのではなく、出所をたどれる主張として扱うべきだ。原典を保存し、誰が利益を得るのかを特定し、独立した記録を比較し、技術的な帰属判断と政治的な結論を切り分ける。



