top of page

XBreaking LLM脱獄、説明可能AIを安全フィルターへの攻撃に転用

1 時間前
読了時間: 18分

XBreakingの研究者らは、説明可能AIを用いて、7つのオープンウェイト言語モデルにまたがる安全制御を特定し、弱体化させた。その知見は、防御のための有望な技術をセキュリティ上の対立へと変えるものだ。XBreaking LLM脱獄は、モデル内部のシグナルから拒否行動に関連する層を見つけ出す。そして、成功するプロンプトを手当たり次第に探すのではなく、その周辺のコンポーネントを標的にする。

査読済みのこの研究は、2026年10月10日にNeural Computing and Applicationsに掲載された。イタリアのパヴィーア大学とインドのCochin University of Science and Technologyの研究者らが手法を開発した。Llama、Qwen、Gemma、Mistralの各ファミリーに属するモデルを検証した。

これは言葉遊びでチャットボットをだます新たなプロンプトではない。XBreakingは、モデルの重み、隠れ状態、アテンションマップ、その他の内部情報への直接アクセスを前提とする。この制約により直近の脅威は限定されるが、カスタマイズ可能なオープンモデルを導入する組織への警告は、むしろ明確になる。

中心となる対立点はいまや明白だ。解釈可能性は、エンジニアが安全行動を理解し、強化する助けになり得る。同じ可視性は、その行動がどこに集中しているかを攻撃者に正確に示す可能性もある。

XBreaking LLM脱獄が実際に変えたこと

XBreakingは、プロンプトの試行錯誤を、アライン済みモデルと制約のないモデルを区別する内部コンポーネントの標的探索に置き換える。

広く知られる脱獄手法の多くは、チャットボットのインターフェースを介して機能する。攻撃者は、システムが拒否をやめるまで、リクエストの言い回し、構造、言語、文脈を変える。このプロセスには、多くの場合、繰り返しの生成とテストが伴う。

XBreakingは、代わりにモデル内部で機能する。研究者らは、安全性チューニング済みモデルと、同じアーキテクチャファミリーの制約のない対応モデルを比較する。論文ではこれらを「検閲済み」と「非検閲」と呼ぶが、安全性チューニング済みと制約なしという表現の方が中立的だ。

この比較には、モデル内部の判断に関連するシグナルを明らかにする技術、すなわち説明可能AIが用いられる。研究者らは、Transformerの層全体にわたる平均活性化値とアテンション値を測定する。活性化は内部計算を表し、アテンション値は処理中にトークン同士がどの程度強く影響し合うかを表す。

published studyでは、3段階のプロセスが報告されている。まずチームは、有害な入力と無害な入力を用いて両バージョンのプロファイルを作成する。次に統計的な特徴選択手法で、両バージョンを最もよく区別する層を順位付けする。最後に、選択された層の周辺にあるコンポーネントへ摂動を加える。

この順序は、解釈可能性を偵察へと変換する点で重要だ。この手法は、すべてのパラメータを等しく重要とは扱わない。安全性チューニングが最も明確に現れるとみられる小さな内部領域を探索する。

実験は7つのオープンウェイトモデルを対象とした。Llama 3.2 1B、Llama 3.1 8B、Qwen2.5 0.5B、Qwen2.5 3B、Gemma 2B、Gemma 7B、Mistral-7B-v0.3が含まれる。

各モデルには、概ね同一のアーキテクチャとパラメータ構成を持つ、対応する制約なしのバリアントがあった。この組み合わせにより、研究者らは内部動作を統制された形で比較できた。

評価には、10カテゴリーにわたる100件の有害行動が使われた。これらのカテゴリーには、詐欺、偽情報、マルウェア、プライバシー侵害、ハラスメント、身体的危害、危険な専門的助言が含まれていた。研究者らはこれらに、関連するテーマを扱う100件の無害行動を組み合わせた。

この設定は、敵対的プロンプトと防御を評価するためのオープンベンチマークであるJailbreakBench datasetに基づく。チームは当初、攻撃を加えなくてもすでに危険な回答を出す質問を除外した。この選択により、既存の失敗が報告される攻撃結果を水増しすることを防いだ。

したがってXBreakingは、脱獄の標的そのものを変える。プロンプトは依然として重要だが、最適化の主対象ではなくなる。モデル内部にある安全性のシグネチャが標的となる。

この違いが、本稿の中心的な緊張関係を生む。測定可能な内部シグネチャを残す安全機構は、研究しやすくなる。同時に、敵対者がモデルを制御できる場合には攻撃もしやすくなる。

XBreakingが安全性に重要な層を見つける方法

研究者らは、アライン済みモデルと制約のないモデルの差異を、拒否行動が集中する場所を明らかにする指紋として扱う。

この手法は、標準化された質問をモデルの両バージョンに送るところから始まる。すべての層について、平均活性化値とアテンションスコアを記録する。研究者らが数値範囲の異なるシグナルを比較できるよう、値は正規化される。

続いて特徴選択プロセスは、どの層レベルの測定値が、モデルが安全性チューニング済みか制約なしかを最もよく分類するかを問う。研究者らは分散分析検定を用いてこれらの特徴を順位付けする。有用な分類精度を提供する最小のグループを選択する。

ここが、XBreakingの仕組みにおける「説明可能」な部分だ。あらゆる隠れシグナルが直感的に人間が理解できる意味を持つと主張するのではなく、この手法はアラインメントに関連する測定可能な差異を特定する。それらの差異は、どこを調査または介入すべきかを研究者らに示す。

論文は、7つのモデル構成のうち5つで90%を超えるフィンガープリンティング精度を報告している。Gemma 7Bでは100%、Mistral-7B-v0.3では82.5%の精度だった。これらは著者らの実験設定内での分類結果であり、モデルの安全性を普遍的に測る指標ではない。

追加のテストでは、モデルの活性化をより具体的な内部特徴へ分解するスパースオートエンコーダが用いられた。Llama 3.1 8Bでは、このアプローチは100%の分類精度に達した。より単純な活性化・アテンション手法では97.5%だった。

スパースオートエンコーダにはより大きな計算コストが必要なため、著者らはより単純な手法を採用した。異なる層やアーキテクチャごとに別のモデルが必要になる場合がある。平均活性化値とアテンション統計は、通常の順伝播処理の間に収集できる。

多くの構成において、選択されたシグナルは中間または後半のTransformer層という限定されたグループに現れた。論文は、これらの領域をコンテンツ抑制に重要な寄与をする部分として解釈している。ただし、拒否行動との相関は、完全な因果説明を示すものではない。

こうした層を特定した後、XBreakingは近くにある正規化コンポーネントのスケーリング重みを変更する。Layer normalizationは、内部シグナルがTransformer内を移動する際のスケールと分布を調整する。研究者らはこれらの重みに制御されたノイズを加え、得られる応答を観察する。

攻撃では、複数の大きさで正および負の摂動をテストする。非常に小さな変更では、効果がほとんど見られないことが多かった。より大きな変更は、一般的なテキスト生成を損なう可能性がある。そのため研究者らは、モデルを完全に破損させずに拒否を弱められる範囲を探った。

このメカニズムは、攻撃が通常のファインチューニングと異なる理由を説明する。ファインチューニングでは、多数の例にわたって幅広い重みの集合を更新できる。XBreakingはアラインメントの指紋を使い、介入対象を絞り込む。

元のXBreaking preprintは2025年4月に公開された。2026年のジャーナル版では、より広範な評価、実用性の測定、転移実験、適用範囲に関するより明示的な議論が追加されている。

この手法は、逆向きに行われるセキュリティ監査にも似ている。防御側はモデルを比較し、脆弱な安全コンポーネントを特定できる。同じアクセス権を持つ攻撃者は、得られた地図を使ってそれらを抑制できる。

説明可能AIが攻撃マップになる

XBreakingの安全性への影響は、内部可視性が監査を改善する一方、安全制御を覆う不透明性を低下させるというトレードオフから生じる。

機械論的解釈可能性は、モデルの行動を生み出す計算を調べる。拒否、欺瞞、バイアス、その他の行動に結び付く特徴、回路、表現を特定する助けとなる。

この目的は通常、防御的なものだ。エンジニアはモデルの最終回答だけでは得られない、より多くの証拠を求めている。内部測定は、導入前に隠れた失敗モードを明らかにしたり、安全性トレーニングが一般化したかをチームが検証する助けになったりする可能性がある。

しかし、説明可能性は、それが明らかにする知識に道徳的な目的を与えるものではない。安全性に重要な層の地図は、強化、監視、修復を支え得る。同じ地図が、選択的な操作の指針にもなり得る。

より広範なinterpretability literatureでは、因果的介入はすでに重要なテストとして扱われている。研究者は内部特徴を変更し、その結果としての行動を調べる。XBreakingはこの論理を敵対的に適用する。

この研究は、標的を絞った摂動により、それまで拒否していたモデルが、複数の危害カテゴリーで危険なコンテンツを生成するようになったと報告している。より脆弱な領域には、政府の意思決定、マルウェア、成人向けコンテンツ、ハラスメント、専門的助言が含まれた。

研究者らは、初期の実験を複数のアノテーターによる手動レビューで評価した。アノテーター全員が分類に一致した応答のみを含めた。その後の実験では、より多くの応答を自動評価するためにLlama Guard 3を使用した。

この移行は規模を改善する一方で、別の不確実性の要因をもたらす。自動安全性分類器は、ニュアンスのあるコンテンツを誤分類する可能性がある。その判断は、導入組織のポリシーとは異なる可能性のあるカテゴリーや閾値にも左右される。

著者らはさらに、変更後のモデルが通常の能力を維持したかも測定した。HellaSwagとTruthfulQAで出力を比較し、MMLUで回答の一致度を測定した。報告された結果によれば、複数のモデルは元の行動のかなりの部分を維持した。

維持の度合いにはばらつきがあった。論文によると、生成評価では大半の構成が60%を超えるコサイン類似度を示した。一部は75%を上回った。報告された構成では、Mistral-7B-v0.3はMMLUで92%を超える一致度を維持した。

他の結果ははるかに弱かった。Gemma 7Bは、報告されたテストで45.3〜51.9%のコサイン類似度を示した。MMLUの一致度は29〜48%だった。Qwen2.5 3Bも、一部の設定では比較的低い一致度を記録した。

こうした差異は、安全性層をきれいに取り除けるという主張を複雑にする。XBreakingは有用な挙動を維持する場合もあったが、モデルファミリー全体で一貫していたわけではない。拒否の回避に成功しても、モデルが目に見えて劣化する可能性は残る。

より深い教訓は、解釈可能性が有害になったということではない。セキュリティ研究では、弱点を明らかにする技術が日常的に公表される。教訓は、説明可能性をアクセス制御、完全性チェック、多層的な安全対策とともに発展させなければならないということだ。

運用上の保護を伴わない透明性は、攻撃面を露出させかねない。解釈可能性を伴わない秘密主義は、防御側から失敗を隠しかねない。オープンモデルの開発者は現在、両方のリスクを管理する必要がある。

オープンウェイトモデルの導入者が最大の圧力に直面する

XBreakingが主に圧力をかけるのは、ホスト型の商用チャットボット利用者ではなく、オープンウェイトモデルをダウンロード、変更、ファインチューニング、再配布するチームだ。

この攻撃には、内部のモデルパラメータや計算を直接確認できるホワイトボックスアクセスが必要となる。通常のチャットボットインターフェースを操作する利用者は、そのアクセス権を持たない。公開された手法には、プロンプトへのアクセスだけでは不十分である。

著者らは、GPT-4、Claude、Geminiを自らの主張の対象から明確に除外している。これらの商用システムは、ダウンロード可能なモデル重みではなく、制御されたインターフェースを提供しているためだ。提供元はまた、コアモデルの周囲に個別の入力フィルター、出力分類器、不正利用監視を配置できる。

この制約により、XBreakingが主要なAIサービスすべての安全策を無効化できると直接結論づけることはできない。論文の脅威モデルでは、同じ手法をリモートのアプリケーション・プログラミング・インターフェースに適用することは技術的に不可能である。

オープンウェイトのデプロイメントには、異なるセキュリティ境界が存在する。モデル所有者、悪意ある内部関係者、侵害されたパイプライン、あるいは信頼できない配布者は、デプロイ前に重みを改変できる。その結果、組織は、見かけ上のアイデンティティが実際の安全挙動を反映しなくなったモデルを受け取る可能性がある。

このリスクは、医療、政府、金融、セキュリティ環境で稼働するプライベートAIシステムにとって重要だ。ローカルデプロイメントは、機密データに対する管理を改善しうる。一方で、モデル完全性に対する責任を中央の提供元から顧客へ移転することにもなる。

チームはしばしば、特化したワークフロー向けにオープンモデルをファインチューニングする。過去の研究では、開発者が安全策を除去する意図を持たない場合でも、カスタムファインチューニングが安全アラインメントを弱めうることが示されている。XBreakingは、より意図的かつ標的を絞った経路を加える。

したがって主要な対立軸は、オープンモデル対クローズドモデルではない。透明な安全エンジニアリングと、認可されたカスタマイズ後も信頼性を保つ安全性との対立である。組織には前者が必要だが、それが後者を保証すると考えてはならない。

モデルの来歴は特に重要になる。チームは、重みの出所、適用されたアダプター、承認後に内部パラメーターが変更されたかどうかを把握すべきだ。従来のソフトウェア資産台帳では、こうした変換を完全には捉えられない。

完全性検証も、最終的なモデル成果物を対象にする必要がある。ハッシュはファイルの変更を検出できるが、それはチームが信頼できる参照値を維持している場合に限られる。挙動テストは障害を検出できるが、狭いテストセットでは標的型の改変を見逃す可能性がある。

継続的な評価は、より強力なアプローチを提供する。チームは、ファインチューニング、量子化、マージ、形式変換の後に、ポリシー固有のテストを再実行できる。開発者が攻撃を試みていない場合でも、これらの操作はモデルの挙動を変化させうる。

エンジニアリング組織にとって、これは文書化の課題にもなる。テスト結果、モデルバージョン、アダプター、承認判断は、相互に結び付いた状態を維持しなければならない。検索可能なエンジニアリング・ナレッジベースは、チームがリリースをまたいでその証拠を保持する助けとなる。

モデルレベルのアラインメントは制御策の一つにすぎないため、多層的な安全策は依然として必要である。入力スクリーニング、出力モデレーション、制限されたツール権限、ログ記録、人間によるレビューは、侵害されたモデルがもたらす影響を抑制できる。

XBreaking LLM jailbreakは、これらの制御策を不要にするものではない。むしろ、組織がモデルの拒否挙動を、その重みに恒久的に備わる性質として扱うべきではない理由を示している。

証拠が立証していないこと

結果は実在するホワイトボックス上の弱点を明らかにしているが、本番AIシステムに対する万能のjailbreakを確立するものではない。

第一の制約は、モデルの対象範囲である。実験は4つのファミリーに属する7つのオープンウェイト構成を対象としている。これは有用なクロスモデルテストではあるが、2026年に利用可能なモデルのごく一部にとどまる。

テスト対象モデルの規模も、5億から80億パラメーターに及ぶ。論文はより大規模な近縁モデルへの転移を検討しているが、直接的な証拠は依然として小規模な構成に集中している。フロンティア規模のアーキテクチャでは、安全挙動が異なる形で分散している可能性がある。

第二の制約は、無制限の参照モデルに関するものだ。XBreakingは、攻撃者が比較対象として密接に対応するモデルを持つ場合に最も効果を発揮する。この組み合わせにより、アラインメントの差異を分離しやすくなる。

著者らは、より小さな同一ファミリーのモデルや、新たにファインチューニングされた無制限バージョンが代替の参照となりうると主張している。その転移実験では、対応するペアと比べて一貫性が低下したことが報告された。この低下は、実用上の信頼性を評価する際に重要である。

第三の制約は、モデルのアラインメントとデプロイメントフィルターの区別である。XBreakingは内部的な拒否挙動を改変する。本番システムでは、別個の分類器によってリクエストまたは応答が依然としてブロックされる可能性がある。

より広範な安全パイプラインを調査した2025年の研究では、入力・出力フィルターを含めるとjailbreakの有効性が低下しうることが示された。この研究は、多くのモデルレベル攻撃が、テストされた少なくとも1つのフィルターで検出可能だったと結論づけている。

これはXBreakingを無効にするものではない。評価対象となる単位を変えるだけである。コアモデルを突破することは、特に開発者がその拒否挙動に依存している場合、重大な問題だ。しかし、それだけで有害なコンテンツがエンドユーザーに届くことを自動的に意味するわけではない。

第四の制約は、実用性の維持に関するものだ。この攻撃は、通常の生成能力を維持しながら制限を除去することを目指す。論文自体のベンチマーク結果は、一部のモデルで意味のある性能低下を示している。

これは、防御側が利用できる観測可能なシグナルを生む。侵害されたモデルは、無害なテスト、推論評価、回帰テストスイートにおいて回答を変える可能性がある。最も強力な攻撃はこうした差異を最小化するだろうが、この研究は完全な隠蔽を示してはいない。

第五の制約は、因果的解釈に関するものだ。高い分類精度は、選択された内部特徴がモデルのバリアントを識別できることを示す。しかし、それだけではモデルが安全概念をどのように表現しているのか、あるいはなぜ各拒否が発生するのかを完全に説明できない。

層ごとの平均統計は、より具体的な回路、トークン効果、相互作用を隠してしまう可能性がある。スパースオートエンコーダーの結果は、より豊かな表現が分析を鋭くしうることを示唆する。同時に、それは未知の部分がいかに多く残されているかも浮き彫りにしている。

最後に、研究における有害性の判断は、人間と自動分類器に依存している。安全性評価は、純粋に機械的なグラウンドトゥルースではない。ポリシーの境界は、提供元、国、業界、デプロイメントの文脈によって異なる。

したがって、適切な結論は慎重なものとなる。XBreakingは、安全性チューニングが発見可能かつ操作可能な内部パターンを残しうることの証拠を提供する。ただし、すべての安全策が取り外し可能な一つのスイッチに集中していることを示すものではない。

防御策が追いついているかを示す3つのシグナル

次の段階は、独立した再現、完全性防御、完全なデプロイメントパイプラインに対するテストによって決まる。

第一のシグナルは、より大規模なオープンウェイトモデルにまたがる再現実験である。研究者は、同じ層選択手法が新しいアーキテクチャやはるかに大きなパラメーター規模でも機能するかを検証する必要がある。また、必要となる計算資源も測定しなければならない。

再現に成功すれば、アラインメントのフィンガープリントがアーキテクチャファミリーに従うという主張が強化される。失敗すれば、公表された効果が特定のモデル、ペアリング、評価上の選択により強く依存していることが示唆される。

最も有益な研究は、攻撃結果と実用性の結果の両方を公表するだろう。通常のモデル性能が崩壊するなら、高い攻撃成功率の意味は薄い。防御側には、改変されたモデルが日常的な回帰テストを回避できるかを明らかにする測定も必要となる。

第二のシグナルは、モデル内部を監視する、あるいは承認済みの重みを検証する防御策の登場である。開発者は、活性化パターンをテストし、モデル成果物を保護し、カスタマイズ後に安全性に敏感なコンポーネントを比較できる。

有用な防御策は、一般的なデプロイメント上の変更に耐えなければならない。量子化、アダプターマージ、プルーニング、形式変換は、数値を変化させうる。完全性システムは、想定される変換と悪意ある介入を区別する必要がある。

解釈可能性は、その防御の一部となる可能性がある。攻撃対象を選択するために使われた同じフィンガープリントが、異常な内部挙動を特定できるかもしれない。研究者は、活性化監視が許容できないレイテンシーを課すことなく摂動を検出できるかを検証すべきだ。

第三のシグナルは、完全なアプリケーションスタックに対する評価である。将来の研究では、改変されたモデルを入力フィルター、出力分類器、ツール制限、人間へのエスカレーションルールと組み合わせるべきだ。そうすれば、XBreakingがモデルレベルの弱点を生むのか、それともエンドツーエンドの障害を生むのかが明らかになる。

多層システムでも、すべてのコンポーネントが類似した前提に依存していれば失敗しうる。出力フィルターは、間接的な表現を使った有害コンテンツを見逃す可能性がある。ツール制限は実行を阻止しても、危険な指示の露出を防げないことがある。

したがって独立したレッドチームは、拒否だけでなく結果をテストすべきである。改変されたモデルがデータへアクセスできるか、ソフトウェアを呼び出せるか、重要な意思決定に影響を与えられるかを問うべきだ。こうした結果は、単一の安全でないテキスト分類よりも重要である。

開発者とエンタープライズの購入者は、モデル文書にも注目すべきだ。安全性レポートには、評価がファインチューニング、量子化、デプロイメントパッケージ化の前後どちらで行われたかを記載すべきである。未変更のベースモデルから得られた結果だけでは、カスタマイズされたすべての派生モデルを説明できない。

XBreaking LLM jailbreakは、モデル安全性を恒久的な機能というより、維持されるべきセキュリティ特性として捉え直させる。この変化は、調達、デプロイメント、継続的テストに影響を与えるべきだ。

オープンモデルを利用するチームは、現在の安全策を今すぐ棚卸しすべきである。どの制御策がモデル内部に存在し、どれがその外側で独立して機能しているのか。組織は、改変されたモデルが本番環境に到達する前に検出できるのか。

こうした問いは、実践的な出発点となる。説明可能性は、モデルがどのように意思決定するかを引き続き明らかにしていくだろう。最も恩恵を受けるのは、その説明によって明らかになるものも保護する組織である。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page