top of page

Tech Against TerrorismのAI調査、ガードレールが崩壊し得ることを示す

51 分前
読了時間: 20分

Tech Against Terrorismは130を超えるAIモデルをテストし、最新のテロ安全性評価では5モデル中3モデルが不合格となった。Tech Against TerrorismのAI調査で最も深刻な失敗が見られたのは、拒否に関する安全対策が意図的に取り除かれた改変モデルだった。

この違いは重要だ。この調査は、主流のチャットボットの大半が通常の利用で公然とテロリストを支援することを示すものではない。モデルが改変、再定義、あるいは開発者の直接的な管理を離れて配布された場合、安全性が急速に低下し得ることを示している。

この結果は、Meta、Hugging Face、オープンウェイト開発者、モデルホストに圧力をかける。中心的な課題は、正当な研究やローカル展開を維持しつつ、リリース時の安全対策を恒久的な保護とみなさないことにある。

したがって、最も強い発見は、オープンAIとクローズドAIの単純な対決ではない。適応可能なモデルと、適応後に生き残れない可能性がある安全制御との対立だ。

Tech Against TerrorismのAI調査はテストを拡大した

この新たな評価は、個別のチャットボットの失敗をめぐる議論から、モデルのサプライチェーン全体で安全性がどのように機能するかを幅広く検証する段階へと議論を進める。

Tech Against Terrorismは、オンライン上のテロ活動に焦点を当てる英国の非営利団体だ。同団体の研究者は、攻撃計画、資金調達、過激化、その他の有害な支援に関連する数百件のリクエストを用い、130を超えるモデルを評価した。

同団体のテストは、モデルが危険なリクエストを一貫して拒否するかを問う。また、モデルが提供する情報の深刻さと具体性も考慮する。

拡張テストによると、大量の死傷者につながる危害に関して、完全かつ具体的な回答を1件でも生成したモデルは不合格となった。100点満点中90点未満も不合格に数えられた。

これは厳しい基準だ。モデルは危険なプロンプトの大半を拒否していても、1件の応答で十分に完全な支援を提供すれば不合格になり得る。

この手法は、基本的な拒否率テストとは異なる。拒否率はモデルが「ノー」と答える頻度を数えるが、部分的な応答には追従できない可能性がある。

一部のシステムは警告から始め、その後に求められた内容を提供する。Tech Against Terrorismはこのパターンを「hedged compliance」と呼ぶ。

同団体の以前のテロ対策ベンチマークでは、主要27モデルと約2,500件の単発プロンプトを調査した。こうした応答のおよそ3分の1は、通常のウェブ検索を超える有意義な支援を提供していた。

このパイロット調査では、脅威カテゴリーやプロンプトの枠組みによる大きな差も確認された。ユーザーが研究目的だと主張した場合、同一のリクエストでも扱いが異なった。

最新の研究では、モデル群を拡大する一方、627件のリクエストに集中した。主要な結果は、テスト対象システムのおよそ60%が、提示された安全基準を満たさなかったというものだ。

2回の調査結果を、そのまま交換可能な統計として扱うべきではない。使用したモデル群、テスト規模、報告指標が異なるためだ。

しかし両者は同じ結論を裏付ける。モデルの見かけ上の安全性は、名称、提供者、標準的なインターフェースだけでは決まらない。

周辺の構成が重要だ。重み、システム指示、展開時の制御、そしてユーザーが名乗る身元も同様である。

評価には、テロ目的を直接宣言するケースが含まれていた。また、研究目的を装うなど、明白には悪意が見えない役割設定を通じたリクエストもテストした。

実際の攻撃者は、自身の意図を正直に述べる必要がほとんどないため、これは重要だ。明確な告白があって初めて機能する安全対策が提供できる安全性は限られる。

この調査はまた、抽象的な将来シナリオから、すでに利用可能なシステムへと焦点を移している。テストされたモデルの多くはローカルで実行でき、公開リポジトリに存在し、第三者によって改変可能だ。

この利用可能性が、記事の中心的な緊張関係を生む。開発者は元のモデルをテストできるが、配布されたすべてのコピーが同じ振る舞いを保つとは想定できない。

真の分断は、制御されたアクセスと編集可能な重みの間にある

この調査結果は、すべてのオープンウェイトモデルが安全でないことを立証するものではないが、クローズドサービスが異なる形で扱う制御上の問題を浮き彫りにしている。

オープンウェイトモデルは、学習済みパラメータをダウンロード可能にする。これらのパラメータは、システムが訓練や後の安全性チューニングで学んだパターンを符号化している。

開発者は、これらのモデルを言語、業界、ローカルハードウェア、専門的な用途に適応させられる。研究者は、ホスト型サービスでは見えない可能性がある挙動を検査できる。

こうした利点が、オープンウェイト開発が企業、大学、独立研究所、公的機関を引きつけてきた理由だ。少数のAPIプロバイダーへの依存を減らすこともできる。

クローズドモデルは異なる形態をとる。ユーザーはモデル開発者が管理するサービスを通じてアクセスし、基盤となる重みは受け取らない。

この制御により、プロバイダーはフィルターを更新し、不審な活動を監視し、アカウントを制限し、アクセスを撤回できる。安全性を保証するものではないが、介入する選択肢を維持できる。

オープンウェイトとして公開されたモデルは、同じようには回収できない。コピーがリポジトリやローカルマシンに広がれば、その後のポリシー変更が確実に届くことはない。

Tech Against Terrorismの以前のベンチマークでは、オープンかクローズドかは性能上の主要な分岐ではなかった。そのテストでは、通常のオープンモデルの一部がより安全なシステムの上位に位置した。

パイロット調査では、AnthropicのClaudeとTechnology Innovation InstituteのFalcon3が高く評価された。同団体によれば、MiniMaxも強い結果を示した。

この結果は、オープン性だけが危険性を決めるという主張を複雑にする。適切にアラインメントされたオープンモデルは有害なリクエストを拒否できる一方、管理されたサービスでも安全でない応答を生成し得る。

より重大な分岐は、リリース後に現れる。ユーザーは元の開発者の承認なしに、オープンウェイトモデルの拒否挙動を変更できる。

Metaによれば、Llama 3.1はリリース前のリスク評価、敵対的テスト、安全性ファインチューニング、外部レッドチーム演習を経た。同社の責任あるリリース計画も、モデルレベルとシステムレベルの安全対策を説明している。

これらの措置は依然として重要だ。Llama 3.1 8Bのテスト済みベースバージョンは、非営利団体のベンチマークで100点中97点を記録したとされる。

改変バージョンのスコアは約3だった。この94ポイントの低下は、安全制御がモデルとともに維持されなかった最も明確な例である。

Metaのポリシーは、有害かつ違法な利用を禁止している。しかし利用規約は、編集可能なモデルファイルを保有する敵対者よりも、規則を守るユーザーを効果的に制約する。

これはポリシーが無意味だということではない。商用展開、プラットフォーム、特定可能なライセンシーに対する執行の根拠となる。

しかし、モデルがオフラインで動作する場合、ポリシーの執行力は弱まる。ローカルシステムは、プロンプトを元のプロバイダーへ送信する必要がない。

その結果生じる圧力はMetaにとどまらない。編集可能な重みを公開するあらゆる開発者は、どの安全特性をモデル内部に組み込み、どの特性を展開時の制御に依存させるかを決めなければならない。

この調査は、拒否チューニングだけでは責任全体を担えないことを示唆している。開発者には、リリース後の改変を前提に設計された評価も必要だ。

モデルホストも関連する問題に直面する。研究用アーティファクトと、制限のない利用を目的として明示的に宣伝されるシステムを区別しなければならない。

この区別を自動化するのは難しい。改変モデルは、正当な安全性研究、創作活動、テストを支援し得る一方で、有害な支援に対する障壁も取り除き得る。

包括的な禁止は、研究者や小規模開発者にコストを課す。緩い配布管理では、明らかに制限解除されたモデルが容易に見つかる状態を残す。

だからこそ、主な対立は適応可能な能力と持続的な安全性の間にある。問われているのは、オープンモデルが存在すべきかどうかではない。

開発者が直接的な管理を失った後も、どの保護策が有効であり続けられるかという問題だ。

Abliterationは拒否訓練を取り外し可能な層に変える

Abliterationが重要なのは、拒否挙動を直接標的にし、リリース時の安全対策を第三者が取り除ける機能へと変えてしまうためだ。

Abliterationは、有害なリクエストを拒否することに関連する内部パターンを特定するモデル改変技術だ。その後、これらのパターンを抑制または相殺する。

この技術は、必ずしも新たな知識を追加するものではない。代わりに、モデルが訓練中にすでに学習した知識を開示するかどうかを変える。

この違いは決定的に重要だ。システムは同じ一般的な能力を維持したまま、危険なリクエストへの回答に格段に積極的になる可能性がある。

Tech Against Terrorismは、最新調査においてabliterationを施したモデルがすべての安全性テストに失敗したと報告した。研究者はまた、自由に利用できるツールを使い、小規模モデルを数分以内に改変できることも確認した。

同団体は、MetaのLlama 3.1 8Bの改変バージョンを元のモデルと比較した。ベースモデルは、攻撃、テロ資金調達、過激化に関するリクエストを拒否した。

改変バージョンは詳細な回答を提供したとされる。研究者は、それらの回答が自動的に現実の攻撃を可能にしたとは主張していない。

同団体のベンチマークは、システムが求められた情報を渡すかどうかを測定する。ユーザーがその情報を実行に移せるかどうかを立証するものではない。

この限界は発見を無効にするものではない。テストが裏付けられる範囲を定めるものだ。

この実験は、情報開示の挙動に大きな変化があったことを示している。ユーザーの能力、物資へのアクセス、作戦上の安全性、実務的な障壁を乗り越える能力は測定していない。

モデルリポジトリ層はこの問題をさらに大きくする。Tech Against Terrorismは、無検閲または安全対策なしのモデルとして宣伝するHugging Faceリポジトリを29,000件以上確認した。

この数は、29,000件のすべてのリポジトリにテロ関連の内容が含まれていたことを意味しない。制限が緩和されていることを示唆するラベルを使用したプロジェクトの数を表している。

一部のリポジトリは同じモデルの複製かもしれない。また、「uncensored」を、ここでテストされた特定技術を経ずに幅広いマーケティング用語として使っているものもある。

こうした留保を踏まえても、その数は配布後にモデルレベルの制御がいかに難しくなるかを示している。研究者が評価するより速く、コピーは増殖し得る。

Hugging FaceはCBS Newsに対し、継続的なモデレーションを行い、規則に違反するモデル、データセット、アプリケーションに対処していると述べた。

公開されているプラットフォームのコンテンツポリシーはテロ関連コンテンツを制限し、複数の対応を認めている。これには、アクセス削除、リポジトリのゲーティング、公開範囲の制限、アカウント停止が含まれる。

Hugging Faceはまた、報告書が提案する対応の一部がオープンな科学研究を制約し得ると警告した。この懸念は真剣に扱うべきだ。

セキュリティ研究者は、失敗モードを研究するために安全でないアーティファクトへアクセスする必要がある。開発者も、フィルターや監視システムをテストするために敵対的なモデルを必要とする。

したがって、リポジトリはある文脈では危険であり、別の文脈では価値を持ち得る。ラベルだけでこの問題を判断することはできない。

アクセス設計は、より対象を絞った道筋を提供する。プラットフォームは、実証されたリスクに応じて、本人確認、ゲーティング、警告ラベル、ダウンロード監視、独立したテスト結果を適用できる。

これらの制御は完全ではない。モデルがダウンロードされると、プラットフォームはその影響力の大半を失う。

それでも、流通上の摩擦は規模を左右し得る。高リスクな改変が、推薦システムによって気軽に見つかるものになるのを防ぐことはできる。

したがって、この研究はサプライチェーン上の問題を提起している。元の開発者がモデルを構築し、別の当事者が拒否機能を取り除き、プラットフォームがその結果を配布する。

各参加者が制御できるのはプロセスの一部にすぎない。しかし、一般社会が経験するのは、それらが組み合わさったリスクである。

持続的な対応には、3つすべての層への対処が必要だ。より安全な学習はリポジトリのガバナンスに取って代わるものではなく、リポジトリのガバナンスもすべてのモデルを是正できるわけではない。

デプロイメントの監視も不可欠である。オープンモデルを運用する組織には、独自のフィルター、ログ、権限管理、インシデント対応手順が必要となる。

企業は、ベースモデルで公表された安全性スコアがファインチューニング後にも当てはまると考えるべきではない。重要な改変はいずれも、新たな評価対象を生み出す。

AIテロ安全性テストには依然として検証上の隔たりがある

この研究は深刻な安全上の弱点を特定しているが、テロ組織による広範な実運用を証明するものではない。

Tech Against Terrorismは、テスト対象のモデルがテロ組織や過激派組織に利用されている証拠は見つからなかったと述べた。調査中には、過激派のチャットボットを1件特定した。

この検証上の隔たりは、見出しを解釈するうえで最も重要な限界である。モデルの利用可能性、安全でない出力、実際の運用への採用は、それぞれ別の段階を表す。

モデルが有害な質問に答えたとしても、実在する主体の能力を向上させるとは限らない。その情報の多くは、書籍、フォーラム、検索結果ですでに入手できる可能性がある。

重要な尺度は「能力増幅(uplift)」である。これは、利用可能な代替手段と比べて、モデルが有害な活動を実質的に容易にするかどうかを意味する。

Tech Against Terrorismは、この問いを中心にパイロット調査を設計した。研究者らは、モデルによる支援と、能力のある人物が通常のウェブ検索で取得できる資料を比較した。

同団体が7月に発表した結果では、回答の約3分の1が有意な能力増幅をもたらしたとされた。今回の拡大研究では、モデル単位でより厳格な失敗判定基準を用いた。

どちらの結果も、予測される攻撃件数に置き換えるべきではない。このベンチマークは、そのような因果推定を提供していない。

独立系の分析者も、劇的なシナリオだけに焦点を当てないよう警告している。戦略国際問題研究所によるテロリズムのリスク分析は、短期的な影響はより漸進的なものになり得ると論じた。

AIは、プロパガンダ、翻訳、勧誘、調査、偵察、事務作業を支援できる。こうした用途は、新しい自律兵器を生み出さずとも重要になり得る。

このような低レベルの支援は検出が難しい。また、正当な活動と十分に似通っているため、モデレーションを複雑にする。

英国の独立テロ法レビュアーも、同様に幅広い見方に至った。法的リスクのレビューでは、プロパガンダ、過激化、攻撃計画、武器関連の支援が検討された。

このレビューは、チャットボットによる過激化を特に難しい法的問題として特定した。一方で、リスクのあるやり取りすべてに新たなAI特化型の犯罪規定が必要だとは示していない。

これらの区別は、読者が60%という数字をどう解釈するかを左右すべきである。これは評価結果であり、現在のテロ組織による採用状況の測定ではない。

この失敗判定基準は一貫性も重視する。他の数百件のプロンプトを拒否していても、詳細な回答が1つあればモデルは失敗と判定され得る。

この基準は、重大な結果を招く安全性の観点では理にかなっている。深刻な情報開示が1件あれば、平均的な拒否率が高いことより重要になり得る。

ただし、すべての失敗したモデルが同じリスクをもたらすことを示すものではない。モデルは、正確性、能力、流通、ハードウェア要件、実用性の面で異なる。

小規模なローカルモデルは容易に応答に従うかもしれないが、信頼性の低い情報しか提供しない可能性がある。最先端システムは、より強力なアクセス制御のもとで、より良い情報を提供するかもしれない。

この研究は、プロンプトの選択と採点上の判断にも依存している。テロ対策ベンチマークでは、どの要求が有害なのか、何が有意な支援に当たるのかを決めなければならない。

偽陽性は、正当な安全保障研究、ジャーナリズム、教育、歴史分析を制限し得る。偽陰性は、危険な支援を見逃すおそれがある。

独立した追試は、調査結果をより強固なものにする。研究者は、専門家がカテゴリー定義や採点の信頼性を検証できるだけの方法論を公開すべきだ。

ただし、それによって有害なプロンプトのすぐに使えるコレクションを公開してはならない。これは、安全性研究におけるよく知られたジレンマを生む。

一般社会には、ベンチマークが現実のリスクを測定しているという証拠が必要である。しかし、過度な開示は評価パッケージを悪用の手引きに変えかねない。

したがって、結論は慎重でありながら明確であるべきだ。この研究は、テストされた多くのシステムで拒否制御が脆弱であることを示している。

AIがすでに大規模にテロリストの能力を変革したことを立証するものではない。一方で、悪用の条件が整えやすくなっていることは示している。

開発者とモデルホストはいま安全性の責任を共有している

この調査結果は、AI業界に対し、安全性をベースモデル公開時に発行される証明書ではなく、継続的に維持すべき特性として扱うよう求めている。

Tech Against Terrorismは、政府と開発者に対し、公開前の独立評価を支援するよう求めている。また、安全策の除去に耐えるモデルを設計することも推奨している。

配布プラットフォームに対して、同団体は独立テストに失敗した改変モデルへの制限を提案している。特にリスクの高い成果物については、検証済みアクセスも提案している。

これらの提案は、同じ失敗連鎖の異なる部分に向き合うものだ。単一の介入で、すべてのローカル改変や私的な転送を防ぐことはできない。

開発者はまず、脅威に特化した挙動をテストできる。一般的な安全性スイートでは、テロ資金調達、過激化、攻撃準備のシナリオを捉えられない可能性がある。

パイロット調査では、カテゴリー間で保護の度合いにばらつきが見られた。モデルは、よく知られた爆発物に関する要求を、他の武器や入手経路に関する一部の要求より一貫して拒否した。

広範な平均値は、こうした差を隠し得る。テストでは、カテゴリー別の性能と、成功した情報開示の深刻度を報告すべきである。

開発者は、アイデンティティの枠付けについても評価すべきだ。以前のベンチマークでは、同じ要求を研究目的として提示すると、応答に従う割合が大幅に高まることが分かった。

この結果は、分類上の近道を示している。モデルは、要求された能力や想定される害を評価する代わりに、申告された役割に反応している。

拒否応答のチューニングを強化すれば、この弱点を減らせるかもしれない。しかし、正当な作業まで妨げるリスクもある。文脈に応じたアクセス制御は、よりよい均衡をもたらす可能性がある。

審査済みの研究者には、匿名ユーザーには提供されない情報を提供できるかもしれない。このようなシステムには、説明責任を伴う認可と監査記録が必要となる。

オープンウェイトの公開では、中央集権的な認可は難しくなる。開発者は代わりに、危険な知識の削減、改ざん耐性の改善、より強力なデプロイメントツールのパッケージ化に注力することになるかもしれない。

これらの対策のいずれも完全な答えを提供しない。学習データのフィルタリングは有用な科学知識を減らし得る一方、改ざん耐性は正当な改変を妨げ得る。

独立評価は、こうしたトレードオフを明らかにする助けとなる。購入者やホストに、開発者自身の安全性主張を超えた根拠を提供する。

モデルリポジトリも、標準化された評価結果を表示することで貢献できる。ユーザーは、ダウンロードしたモデルがベースモデルの安全策を維持しているかを知るべきである。

プラットフォームは、通常のカスタマイズと、拒否挙動を明示的に除去する行為を区別することもできる。保護を回避することを売りにするモデルには、より綿密な精査が必要だ。

ゲーティングは見せかけの手順になってはならない。効果的な制御には、執行可能な条件、リスクに応じた審査、正当な研究のための明確な経路が必要である。

企業の導入者は、責任の最後の層を担う。システムプロンプト、検索・取得ソース、ツール、権限、ユーザーアクセスを選ぶのは彼らである。

安全なベースモデルでも、機密データベースや現実世界の行動に接続されると危険になり得る。改変モデルは、ツールアクセスがなくても追加のリスクを生み出し得る。

セキュリティチームは、モデルカードに頼るのではなく、導入されたシステムを評価すべきだ。ファインチューニング、量子化、第三者製アダプターはいずれも挙動を変え得る。

調達チームは、ベンダーがテロ関連の悪用をテストしているかを尋ねるべきだ。また、カスタマイズ後に安全策が消失したことをプロバイダーがどのように検出するかも確認すべきである。

政府は最も難しいバランスに直面する。公開だけに狭く焦点を当てた規則は、すでにオンラインにある有害なモデルを排除せずに、AI開発を中央集権化しかねない。

下流の悪用だけに焦点を当てた規則は、流通後にしか機能しない。また、被害が発生した後に初めて始まる捜査に依存する可能性もある。

実行可能な枠組みには、比例的な統制が必要となる。モデルの能力、改変の種類、アクセス方法、実証された安全性の性能は、すべて対応に影響すべきである。

この議論を、オープンモデル対クローズドモデルに還元することはできない。両方のアプローチが、リスク、インセンティブ、説明責任の空白を生み出す。

クローズドなプロバイダーはユーザーを監視できるが、支配を集中させる。オープンな開発は検証と競争を支える一方、公開後の介入を難しくする。

この研究の貢献は、そのトレードオフを具体的に示したことにある。安全性の主張は、開発者からホスト、ユーザーへと至るモデルの実際の経路に耐えなければならない。

Tech Against TerrorismのAI研究後に注目すべきこと

次の段階では、業界がこれらの結果を評価の問題、流通の問題、あるいはその両方として扱うかが明らかになる。

最初の兆候は、独立した追試である。他の研究機関は、報告された失敗率が、新しいモデル、言語、複数ターンの会話にわたって維持されるかをテストすべきだ。

研究者が安全策の除去後に同様の低下を観察すれば、追試は研究の結論を強める可能性がある。大きな差が出れば、採点やプロンプト設計への感度が明らかになる。

2つ目の兆候は、リポジトリの方針である。Hugging Faceや他のホストは、意図的に制限解除されたモデルをどのように分類、ラベル付け、ゲーティング、削除するかを決めなければならない。

有意義な対応は、正当な安全性研究と無制限の大規模配布を区別することになる。一方、広範な削除方針は、モデルを説明責任の薄いチャネルへ追いやる可能性がある。

3つ目の兆候は、開発者によるテストである。Metaなどのオープンウェイト公開者は、公開プロセスに改変後の評価を追加できる。

これらのテストでは、一般的なファインチューニングや拒否機能の除去手法が、重大な結果を招く挙動を変えるかを調べるべきである。結果を公開すれば、その後の安全性主張を評価しやすくなる。

読者は、現実世界での採用を示す証拠にも注目すべきだ。現在の報告書の最大の限界は、テロ組織による実証された利用がないことである。

確認済みの事例が出れば、流通管理の緊急性は高まる。こうした証拠が引き続き見られなければ、包括的な制限よりも的を絞った対策を支持する根拠となる。

どちらの結果になっても、モデルの安全性が無関係になるわけではない。予防は、新しいツールが日常化する前から始まることが多い。

開発者にとって実務上の教訓は明白である。ベースモデルの拒否挙動を恒久的な特性として扱ってはならない。

組織は、ファインチューニング、量子化、システムプロンプトの変更、アダプターの導入後に、安全性評価を再実施すべきだ。機密性の高いアクセスを付与する前に、導入システム全体をテストすべきである。

研究者は、ガードレールがどのように失敗するかを調べ続けるべきだが、その知見を実行手順に変えてはならない。プラットフォームは、この区別を認識する審査システムを構築すべきである。

政策立案者は、正当な分析を守りながら、測定可能な安全性の成果を求めるべきだ。曖昧な保証と一律の禁止は、どちらも困難なエンジニアリング作業を避けることになる。

Tech Against TerrorismのAI研究は、オープンウェイトAIの将来に結論を下したものではない。むしろ、あらゆるリリースに向けた、より実践的な問いを提示している。

モデルの安全保護策は、モデルを有用で持ち運びやすく、実験に開かれたものにする変更を経ても維持されるのか。

開発者、ホスティング事業者、購入者は、次のモデルが何千ものリポジトリに広がる前に、この問いを投げかけるべきだ。答えが依然として明確でないなら、独立したテストを最初の行動とすべきである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page