Meta AI広告検出、隠された虐待リンクを標的に しかし信頼の溝は残る
調査担当者が、一見ありふれたクリエイティブの背後に児童性的虐待コンテンツへのリンクを隠した有料広告を発見したことを受け、MetaはMeta AI広告検出を拡充した。
10月7日に導入された仕組みは、難しいモデレーション上の穴を狙うものだ。広告自体は無害に見えても、ユーザーを違法コンテンツ、有害なアプリ、あるいはオンライン上の虐待行為へ誘導する可能性がある。Metaによれば、新たなシステムは広告主が規模を拡大する前に、こうした隠れたシグナルを分析する。
この転換が重要なのは、Facebook、Instagram、Messenger、Threads、そしてMetaの広範な広告ネットワークで繰り返されたキャンペーンを、従来の安全対策が阻止できなかったからだ。Metaが検出機能の改善を導入したと述べた後も、研究者らは虐待的な広告を発見し続けた。中心的な対立は今や明白だ。Metaは自動化をさらに進める一方、攻撃者はそれを回避する方法を学び続けている。
Metaの新システムは広告の外側も見る
最も重要な変更は、Metaの審査プロセスが広告内に表示される内容だけでなく、広告の遷移先も調べるようになった点だ。
Metaは10月7日の発表で、5つの追加策を説明した。これらは言語、遷移先、過去のコンテンツ、防御的テスト、再犯者を対象とする。同社はこれを、敵対的な広告手法と呼ぶものに対する協調的な対応として位置づけている。
最初の追加策は、「signposting」を検出するための専用大規模言語モデルだ。Metaはこの言葉を、一見無害なコンテンツでありながら、児童の性的搾取コンテンツや関連する有害行為へユーザーをひそかに導くものとして用いている。
Signpostingは分類上の問題を生む。表示されている画像やテキストは、それだけを見ればポリシー違反ではない可能性がある。その意味は、遷移先、広告主の行動、その他の周辺シグナルを考慮して初めて明らかになる。
この文脈こそ、LLMが役立つ領域だ。大規模言語モデルは、単語、記号、指示、会話上の手掛かりの関係を分析する。より単純なキーワードフィルターでは見落としかねないパターンを識別できる。
Metaの2つ目の変更は、広告の遷移先に関する情報をシステムへさらに与えるものだ。同社によれば、これにより違反サイトをブロックし、ユーザーをそこへ誘導したアカウントに措置を講じられるようになる。
これは審査対象の範囲を大きく広げる。広告はもはや孤立したクリエイティブ資産として扱われない。ランディングページと、広告からそのページに至る経路が、安全性の判断の一部となる。
Metaは既存の広告コンテンツ全体を対象に、AI主導の追加スイープも導入した。これらの検索は、従来のシステムが見逃したコンテンツを発見することを目的とする。調査担当者が新たな回避パターンを見つけるにつれ、こうしたスイープで用いるシグナルも拡大する。
4つ目のツールは自動化された攻撃者として機能する。MetaはこれをレッドチーミングAIエージェントと呼び、犯罪者が大規模に悪用する前に防御の弱点を探るAIシステムを意味する。
このエージェントは敵対的な手法を模倣し、Metaの安全対策にある隙を明らかにすることが想定されている。これによりレッドチーミングは定期的な演習から、継続的なテストプロセスになり得る。
最後に、Metaは再犯検出を強化したと述べた。これらのシステムは、以前のアカウントが削除された後に新アカウントで戻ってくる広告主を認識しようとする。
この一連の対策は、虐待的なキャンペーンの異なる段階を狙う。検出は広告を調べ、遷移先分析は離脱経路を確認し、スイープは見逃しを探し、レッドチーミングは隙を探り、再犯対策は戻ってくる運営者を標的にする。
したがってMetaの新たな安全対策は、単なる別の画像分類器ではない。広告を取り巻くキャンペーン全体をモデル化しようとする試みだ。
この違いは本質的だ。従来のフィルターは、特定のアップロードがルールに違反するかを問う。Metaの新しいアプローチは、複数の無害に見える要素が全体として虐待的な経路を形成しているかを問う。
ただしMetaは、これらのツールについて再現率、誤検知率、独立したテスト結果を公表していない。同社は構成要素を説明したが、外部の人々はまだその有効性を測定できない。
Meta AI広告検出が遷移先を追う理由
Meta AI広告検出が下流へと対象を広げているのは、悪意ある行為者がMetaが当初審査するコンテンツの外側に意図を隠せるためだ。
一見普通の広告は、より長いコンバージョン経路の最初の段階として機能し得る。クリエイティブはMetaのオーディエンスへのアクセスを得る一方、有害なコンテンツは外部ページやアプリが提供する。
この分離により、広告主は単純なモデレーションルールを回避しやすくなる。Metaのシステムに表示される広告は、ユーザーが最終的に遭遇するものとは異なる可能性がある。リダイレクトも、所在地、端末、アカウント履歴、時間によって変化し得る。
この手法は、審査担当者と想定対象に異なるコンテンツを表示するクローキングに似ている。Metaはすでに、詐欺広告におけるクローキングの調査にAIを利用している。児童搾取キャンペーンは、同じ技術的問題のより緊急性の高い形を生み出す。
遷移先を認識するシステムは、リダイレクトを追跡し、ランディングページを分類し、それらを広告内の約束と比較できる。また、繰り返し使われるドメイン、アプリ識別子、支払い関係、アカウントクラスターを探すこともできる。
ただし、遷移先分析には限界がある。運営者はドメインを入れ替えたり、有害な行為を遅らせたり、最終的な遷移先の前に一見準拠しているページを置いたりできる。モバイルアプリも、ストア審査を通過した後に動作を変えられる。
Metaは、禁止コンテンツをホストまたは作成する外部ウェブサイトをブロックするとしている。リンクがブロックされると、同社はそのアドレスを含む広告、投稿、コメントを検索する。
同社はさらに、ブロック済みリンクを含む広告はアップロード時に却下されるべきだと述べる。これはドメインが特定された後に有用な封じ込めの仕組みとなる。
より難しい問題は、未知の遷移先に関わる。システムは、ユーザーが遭遇する前に、なじみのないリンクが危険かどうかを判断しなければならない。これには文脈的推論、行動分析、またはその両方が必要となる。
Metaの専用モデルは、この空白を埋めるために設計されたようだ。単独では禁止コンテンツに該当しないsignpostingのシグナルを検査できる。遷移先分析は、その後、それらのシグナルが有害な経路と対応しているかを検証できる。
Metaは2011年以降、アプリ全体でPhotoDNAおよび関連する照合技術を利用している。ハッシュ照合は、アップロードされたメディアを、既知の虐待コンテンツのデジタル指紋と比較する。
このアプローチは、既知のファイルやほぼ同一の複製に対しては依然として有用だ。一方、広告が視覚的に無害である場合、新たに生成された場合、虐待コンテンツを短時間だけ表示する場合、またはユーザーを別の場所へ誘導する場合には、直接的には機能しにくい。
したがって新たなツールは、ハッシュ照合を置き換えるのではなく補完する。既知のメディアだけを照合するのではなく、意図、経路、協調した行動に焦点を当てる。
Metaはまた、一定の違反シグナルをTech CoalitionのLanternプログラムを通じて共有している。参加企業は、これらのシグナルを利用してサービス横断で虐待的なアカウントや行動を検出できる。
加害者が1社だけに依存することはほとんどないため、プラットフォーム間の協力は重要だ。広告はMetaで始まり、アプリストアにつながり、個人運営のウェブサイトやメッセージングサービスで完結することがある。
Metaは、以前の児童安全に関する取り組みでこの幅広いアプローチを概説した。10月のツールは、この戦略により明示的な敵対的レイヤーを加える。
この転換はMeta以外にも圧力を生む。AppleとGoogleは、調査対象となった広告を通じて宣伝された一部製品をホストしていたアプリストアを運営している。ドメインプロバイダー、決済サービス、その他のプラットフォームも、流通の連鎖に加わる可能性がある。
単一のモデレーションシステムで、この連鎖全体を制御することはできない。Metaは広告主によるオーディエンスへのアクセスを拒めるが、基盤となるサービスの削除には他の仲介者による対応が必要だ。
このため、遷移先分析は必要であると同時に不完全でもある。Metaが顧客獲得チャネルとして果たす役割は減らせるが、より広いインターネットから有害な製品をなくすことはできない。
導入の背景にある数百件の報告済み失敗
Metaの発表は、問題が表面化する前に導入された予防策ではなく、文書化されたモデレーションの失敗への対応だ。
Tech Transparency Project(TTP)は、Metaのサービス全体に表示された広告を調査した。同団体の研究者らは、2025年後半以降、350件を超える虐待的な動画広告を発見したと報告している。
最初のグループが2026年8月に世間の注目を集めた後にも、250件を超える追加広告が配信されたとされる。一部では、Metaがすでに削除したコンテンツが繰り返されていた。
広告はFacebook、Instagram、Messenger、Threads、そしてMetaの広告ネットワークにまたがって表示された。研究者らによれば、多くは同意のない親密な画像を生成できるAI画像・動画アプリを宣伝していた。
一部の広告は、未成年者の普通の写真から始まっていたとされる。短い動画では、その画像が露骨な性的場面へと変換された。
研究者らは、4人の未成年者を含む画像の現実世界での出所を特定した。そこには公開されたソーシャルメディアの写真、ストック画像、欧州王室メンバーの公式写真が含まれていた。
この区別は重要だ。合成出力であることは、被害が実在の人物から切り離されていることを意味しない。生成システムは、実在する子どもの普通の写真を犯罪的な画像へと変換し得る。
9月の調査によると、広告は欧州連合で2万9,000超のアカウントに到達した。英国では約7,000アカウントに到達した。
利用可能な広告データでは、すべての市場について比較可能なインプレッション総数は示されていなかった。研究者らは、米国で250件超、オーストラリアで120件、インドで80件の広告を特定した。
Metaは、広告の大半が200インプレッション未満だったと述べた。また、研究者らが特定したグループから得た収益は5,000ドル未満だったとしている。
こうした数値は、根本にある安全性の問題を解決しない。問題は、有料配信が、公開前に広告を審査するシステムを通じて有害なコンテンツに経路を与えたかどうかだ。
Metaの広告基準は、児童の性的搾取、虐待、ヌードを禁止している。同社は、同意のない親密な画像を作成するために設計されたサービスも禁止している。
有料広告が審査を通過した場合、通常の投稿がモデレーションをすり抜ける場合よりも、説明責任の問題は深刻になる。広告は管理された商用製品であり、Metaはその配信に対して対価を受け取っている。
TTPの研究者らによれば、報告された広告の一部は最長で1週間表示された。その期間に、広告は追加の閲覧を獲得した。
Metaは、このコンテンツを容認しているとの示唆を否定した。同社の広報担当者は、Metaは児童搾取に積極的に対処しており、特定された広告の多くをすでに削除していたと述べた。
同社はまた、未成年者の画像が短時間しか表示されなかったり、ぼかされていたりするため、一部の動画は分類が難しかったとした。この説明は、攻撃者が意図的に悪用できる弱点を明らかにしている。
9月には、サンフランシスコ市の検事であるDavid ChiuがMetaに停止通告書を送付した。同事務所は、審査の失敗、再犯広告主、エスカレーション手順、児童安全当局への報告に関する情報を要求した。
市の異議申し立ては、Metaのポリシーと、禁止広告が繰り返し配信されたことの隔たりに焦点を当てた。Metaは、利用可能なデータがこれらの広告がサンフランシスコに到達したことを示していないとして、同事務所に管轄権があるのかを疑問視した。
他の当局もこの問題の調査を開始した。ミシガン州とフロリダ州の当局者は、報告された広告を調べていると示唆し、オーストラリアのeSafety規制当局はMetaに情報提供を求めた。
インドも重要な圧力点となった。同国の子どもの権利を扱う当局は、同社プラットフォーム上の児童搾取コンテンツをめぐる疑惑を受け、9月にMeta Indiaの幹部を召喚した。
Metaによると、2026年上半期にインドのFacebookとInstagramで530万件の児童性的搾取コンテンツに対処したという。同社は、その98%超を事前に特定したとしている。
この数字は、極めて大規模な執行量を示している。しかし、広告システムが秘匿されたリンク、再犯者、新たに生成されたメディアをどれほど効果的に検知できるかは明らかにしていない。
これが、この展開をめぐる信頼の隔たりである。Metaは数百万件の削除を記録できる一方、研究者は商業的な審査を経た掲載面に残る継続的な失敗を発見できる。
AIモデレーションは変化し続ける敵対者に直面する
主なトレードオフは速度と確実性の間にある。Metaには大規模な自動執行が必要だが、自動化されたあらゆる判断は新たな誤りと回避の機会を生む。
Metaは膨大な量のコンテンツと広告を審査している。人手による審査だけでは、すべてのクリエイティブ、リダイレクト、ランディングページ、アカウント間のつながり、行動シグナルをリアルタイムで確認することはできない。
したがって、自動化は避けられない。モデルはより多くの素材をスキャンし、離れたシグナルを結び付け、手作業の調査チームより迅速に対応できる。
しかし、規模は精度を保証しない。積極的な削除に最適化された検知器は正当なアカウントをブロックしかねない。誤検知の低減に調整された検知器は、有害な素材をより多く通してしまう可能性がある。
子どもの安全を守るための執行では、双方のコストが高くなる。見逃しはユーザーを違法な素材にさらし、被害者への加害を長引かせる可能性がある。誤検知は広告主やユーザーを不当に処罰するおそれがある。
Metaは、新モデルの判断しきい値を明らかにしていない。また、最もリスクの高い事案を人間の審査担当者がどの程度の頻度で確認するのかも説明していない。
Metaが審査システム、執行データ、広告ライブラリを管理しているため、独立した証拠は依然として特に重要である。研究者は目に見える失敗を観察できるが、すべてのブロック成功例を数えることはできない。
Metaのレッドチーミングエージェントは、この非対称性に対する興味深い回答だ。人間のチームが手作業で作成するよりも速く、バリエーションを生成・検証できる。
このエージェントは、表現を変えた文言、ぼかした画像、リダイレクトの連鎖、新しいアカウントのパターンを試す可能性がある。そのうえで、ある安全策は通過するが別の安全策では失敗する組み合わせを明らかにできる。
ただし、内部のレッドチームもMetaが選んだ前提の範囲で活動する。その設計者が予測しなかった手法や、テスト環境に存在しないデータパターンを見落とす可能性がある。
犯罪運営者もフィードバックを得る。広告が承認、却下、削除されれば、プラットフォームの統制について何かを学べる。その後、コンテンツを変更して再び試すことができる。
再犯検知は、新しいアカウントと過去に禁止された運営者を結び付けることで、この循環に対処する。シグナルには、インフラ、決済関係、管理上の行動、繰り返されるクリエイティブのパターンが含まれる可能性がある。
Metaは、どのシグナルを利用しているかを詳述していない。この非開示は、完全な情報公開が攻撃者を利する可能性があるため理解できる。一方で、独立した評価を難しくもする。
AI生成の搾取素材が広がっていることで、緊急性はさらに高まっている。NCMECによると、2023年1月から2025年12月に提出された画像と動画のうち、15万8,000件超をAI生成と分類した。
NCMECは、生成AIに関わる通報の劇的な増加も記録している。同団体の生成AIに関するガイダンスは、合成画像が識別可能な子どもを依然として搾取し、他の虐待的行為を支援しうると警告している。
通報量の増加は、プラットフォームだけでなく捜査担当者にも負担をかけうる。検知の改善は通報を増やすが、当局が行動するには、通報に十分な情報が含まれていなければならない。
量と並んで質も重要だ。不適切に分類された素材で捜査担当者を圧倒するシステムは、被害者の特定を改善することなく資源を消費しかねない。
Metaは、法律で求められる場合、明らかな児童搾取素材をNCMECに通報するとしている。また、インドの児童安全に関する事案を同国のNational Cyber Crime Reporting Portalへ直接通報することも発表した。
この通報の連携は重要だが、削除と通報は異なる目的に資する。広告の削除は拡散を抑える。詳細な通報は、捜査担当者が被害者、広告主、関連ネットワークを特定する助けとなりうる。
そのため、MetaのAI広告検知は複数の成果を支援しなければならない。有害な広告を拒否し、連携したアカウントを無効化し、有用な証拠を保存し、送付先をブロックし、信頼できる通報を当局へ送る必要がある。
あるタスクをうまく遂行するモデルでも、より広いシステムでは失敗しうる。同じ運営者が別のアカウントとドメインで直ちに戻ってくるなら、単一のクリエイティブをブロックしてもほとんど意味がない。
中心的な試験は持続性である。Metaは、研究者がすでに特定した個々の広告だけでなく、虐待的なネットワーク全体を自社システムが縮小していることを示さなければならない。
Metaの安全性に関する主張はいま測定可能な試験に直面している
新たな統制が意味を持つのは、外部の調査者が発見する前に、繰り返されるキャンペーンを減らせる場合に限られる。
Metaは多層的な防御を提示した。コンテンツ分析、送付先の検査、遡及的な一斉調査、敵対的テスト、リンクのブロック、再犯者の検知を組み合わせている。
この設計は脅威の構造に合致している。有害な広告は、単なる1枚の画像であることはめったにない。広告主、クリエイティブ素材、配信ルール、リンク、アプリ、ドメイン、代替アカウントが関わる。
同社は外部の研究者には利用できないシグナルにもアクセスできる。アカウント履歴、決済手段、管理上のつながり、デバイス情報、過去の執行事案を確認できる。
この優位性により、Metaは事後的な削除からネットワーク規模の妨害へ移行できるはずだ。同社は、元FBI捜査官がすでに略奪的なアカウントネットワークの手動調査を行っているとしている。
懸念は実行にある。研究者は、従来の安全策が発表された後にも広告を繰り返し特定した。一部のキャンペーンでは画像が再利用され、関連製品やアカウントを通じて継続していた。
この履歴により、10月の展開は検証可能な主張となる。Metaは、成功したアップロードの減少、露出期間の短縮、削除された広告主の再出現率の低下を示せるはずだ。
外部の人々がその主張を評価できるかどうかは、公開される透明性によって決まる。Metaは現在、執行統計を公表しているが、広範なコンテンツ総数は広告上の失敗に関する問いには答えない。
有用な報告書は、公開前にブロックされた広告と配信後に削除された広告を分けるだろう。また、露出時間の中央値や、復帰を試みた広告主の割合も示すべきだ。
送付先に対する執行も、独自の報告に値する。Metaは、ブロックしたドメインやアプリの数、リダイレクトが変更された頻度、関連アカウントが無効化された数を開示できる。
同社は、既知メディアの照合と文脈的な検知も区別すべきだ。この分離により、LLMと送付先ツールが本当に異なる脅威を捉えているかが分かる。
誤検知にも注意が必要だ。信頼できるシステムには、誤ってブロックされた広告主のための異議申し立てプロセスと、大きな影響を伴う判断に対する有意義な人間の審査が必要である。
Metaは、回避を可能にする技術的詳細を公開すべきではない。それでも、集計された性能データ、独立監査の結果、各執行カテゴリーの明確な定義は公表できる。
インドでの直接通報の取り決めは、測定可能なもう一つの領域を提供する。当局は、通報がより迅速に届くか、より良い証拠を含むか、より実行可能な捜査につながるかを評価できる。
Metaの開示にかかわらず、外部からの監視は続く。ジャーナリスト、市民社会の研究者、規制当局、アプリストアの調査担当者は、類似する広告が引き続き利用可能かを追跡できる。
元の10月の報道は、このツールを有害な送付先を隠す広告への対応として位置付けた。この枠組みは、モデルの説明ではなく結果に責任を置く。
Metaは、有害な広告が二度と審査を通過しないことを証明する必要はない。適応する敵対者に対して、完全な防止を確実に保証できるモデレーションシステムは存在しない。
ただし、既知の手法が確実に機能しなくなることは示す必要がある。よく知られたコンテンツ、関連アカウント、以前に特定された送付先を使う繰り返しの広告は、次第にまれになるべきだ。
そうした結果が現れるまで、この展開は、執行上の失敗という未解決の記録に付随した有望な防御アーキテクチャにとどまる。
ツールが機能しているかを示す3つのシグナル
次の証拠は、再犯者率、独立した調査結果、規制当局の対応の順に現れるはずだ。
最初のシグナルは、過去に削除された広告主や関連運営者が復帰するかどうかである。Metaが強化した再犯対策は、共通のインフラや行動に結び付く繰り返しのキャンペーンを減らすはずだ。
目に見える減少は、Metaが孤立した広告を削除するのではなくネットワークを妨害しているという主張を裏付ける。反復が続けば、新システムの有効性を示す根拠は弱まる。
2つ目のシグナルは、今後数か月に独立した研究者が何を見つけるかである。TTPなどの調査者は、10月の展開後も禁止広告が現れるかを検証できる。
最も示唆的な発見は、なじみのある手法に関わるものだ。無害に見えるクリエイティブ、短時間表示される虐待的なフレーム、リダイレクト、ローテーションするドメイン、新たなブランド名で再登場するアプリなどが含まれる。
発見率の低下は、完全な防止を証明するものではない。それでも、攻撃対象領域が狭まったことを示す有用な証拠となる。
研究者は、各広告が最初に表示された時点、報告された時点、Metaが削除した時点を記録すべきだ。この時系列により、事前の執行と事後的な後始末を区別できる。
3つ目のシグナルは、規制当局がどう対応するかだ。サンフランシスコはMetaのシステムに関する説明を求め、他の管轄区域の当局も独自の調査を開始した。
規制当局は、監査、詳細な報告、広告主記録の保存、人間による審査の変更を要求する可能性がある。アプリストアやその他の仲介者の役割も調べるかもしれない。
Metaが既知のパターンを繰り返し無視したとする規制上の認定は、同社の安全性に関する説明を損なう。より迅速な対応と改善された通報の証拠は、その説明を強めるだろう。
読者はMeta自身の透明性に関する開示にも注目すべきだ。広範な削除総数よりも、露出、再発行動、事前検知に結び付いた広告固有の指標の方が有益である。
MetaのAI広告検知には、明確な技術的目標がある。最初の段階が正常に見える場合でも、有害な経路を特定することだ。より難しい課題は、ユーザーや研究者が失敗に遭遇する前に、それが機能することを証明することである。
その証明には、企業発表の外にある証拠が必要となる。再犯する広告主が消えるか、独立調査で虐待的なキャンペーンが減少するか、規制当局が測定可能な改善を確認するかを注視してほしい。
AIモデレーションを評価する人々にとって、もはや問題はモデルが広告をスキャンできるかではない。適応するネットワークを止めるために、プラットフォームが弱いシグナルを十分迅速に結び付けられるかどうかである。次の独立監査と執行に関する開示を追い、それらをMetaの主張と比較してほしい。



