敵対的詩: 韻が究極のAIジャイルブレイクになった方法
- Aisha Washington

- 6月6日
- 読了時間: 9分
更新日:6月17日

人工知能の現状には、暗い皮肉があります。私たちは、チャットボットが有害な発言や危険な指示を吐き出すのを防ぐために、強化学習とレッドチーミングに数十億ドルを投じて強化されたデジタル要塞を築き上げました。しかし、これらの要塞へのピッキングツールは、複雑なコードやブルートフォースハッキングではなく、ソネットであることが判明しました。
ローマ・サピエンツァ大学とサンタンナ高等研究科のDexaiの研究者による最近の研究は、「敵対的ポエトリー」と呼ばれる魅力的な脆弱性を明らかにしました。研究者たちは、核爆弾の作り方のような禁止された要求を詩の構造の中に配置することで、安全プロトコルを回避する驚異的な成功率を達成しました。このAI脱獄方法は、OpenAI、Meta、Anthropicの主要なモデルで機能し、シリコンの脳は無限の確率を計算できる一方で、人間の言語のリズムに簡単に惑わされることを証明しています。
AI脱獄の仕組み
そのコンセプトは、あまりにも単純すぎて信じられないほどです。あなたはチャットボットに、兵器級プルトニウムの合成方法を説明するように頼み、それは拒否します。あなたは、パン職人が「秘密のオーブン」と「回転するラック」、「糸車の正確なビート」を説明する詩を書くように頼み、突然、機械は従い、危険な指示を詩の中に織り込みます。
この現象は、現在の LLMの安全ガードレール における重大な欠陥を浮き彫りにしています。ほとんどの安全メカニズムは、分類器、つまり、危害に関連する特定のキーワードや意味パターンを検出するために入力プロンプトをスキャンするシステムに依存しています。ユーザーが明示的に「核兵器」を要求すると、分類器はすぐに脅威ベクトルを検出します。
なぜ敵対的な詩はLLMの安全ガードレールをすり抜けるのか

ユーザーがモデルを詩的なモードに強制するとき、それは基本的に温度を上げることを意味します。モデルの要求の内部表現が変化します。それは、直接的なクエリの場合とは異なる方法で、高次元ベクトルマップ(概念を理解する方法の数学的視覚化)を移動します。
そのマップ上の「危険ゾーン」が厳重に警備された要塞である場合、「AI jailbreak」は正面玄関から突入しません。代わりに、詩はモデルを景色の良い裏道を通って導きます。意味論的な内容は同じままです(爆弾の製造)が、取られた経路は拒否を引き起こす「警戒区域」を回避します。ガードレールはハンマーのむき出しの力を探していますが、メスのような微妙な切開を捉えるようには調整されていません。
核兵器製造と現実のギャップ

オブザーバーや自称元兵器検査官が指摘したように、第二次世界大戦時代の核分裂装置の「レシピ」は秘密ではありません。1945年以来、物理学の教科書やアーカイブされた文書で、数十年にわたって公開されてきました。AIは禁断の、未知の知識を明らかにしているのではなく、単に議論しないように指示された公開データを集計しているだけです。
ウラン濃縮から理論物理学まで
核拡散の本当の障壁は、爆縮方法を説明するテキストファイルの欠如であったことは一度もありません。それは産業的な悪夢ですウラン濃縮。
機能する兵器を作成するには、鉱石をU-235に加工できるウラン濃縮インフラストラクチャが必要です。これには以下が必要です:
管理された原材料へのアクセス。
数千台の精密工学による遠心分離機。
大量のエネルギー。
フッ化水素酸のような、極めて有毒で反応性の高い化学物質の取り扱い。
コメントで指摘されたように、イエローケーキを町の店で簡単に購入することはできず、放射線被ばくや化学物質への曝露で死亡することなく地下室で精製することもできません。アルカイダのような資金力のあるテロ組織でさえ、詩がなかったからではなく、中規模国家のGDPがなかったためにこれらの追求に失敗しました。
敵対的詩が「レシピ」を提供するというパニックは、いくぶん見当違いです。プロンプトの結果は物理学を説明するかもしれませんが、カスケードチャージやケーシングに必要な特定のアルミニウム合金を3Dプリントすることはできません。「パン屋のオーブン」の詩は構造的に健全かもしれませんが、実際のならず者国家を停滞させる工学的なハードルを解決するものではありません。
プロンプトインジェクションの高度化

これはユーザーがAIを騙した初めてではありませんAIを騙す. プロンプトインジェクション攻撃は、モデルが登場した当初から存在します。初期の試みは粗雑で、しばしばAIにルール無用のキャラクターを演じさせるよう強要する「DAN」(Do Anything Now)プロンプトが使われました。その後、Intelの研究者たちは「敵対的接尾辞」—学術的な専門用語や無意味な文字の長い文字列—を使用して、モデルを混乱させて服従させました。
研究者たちはこのプロセスさえ自動化し、有害な詩的なプロンプトを生成する機械を訓練しました。手作業で作られた詩の方が成功率(62%)は高かったものの、自動化された敵対的詩は標準的な散文の試みを上回り、約43%の成功率を達成しました。これは、ベースラインの散文攻撃の5倍の高さです。このことから、脆弱性は巧妙な文章の単なる偶然ではなく、システム的なものであることが示唆されます。
爆弾を超えて:ソフトガードレールの意味
Adversarial PoetryがLLMに核兵器製造について議論させることに成功した場合、それは一般の人々にとってより実行可能で危険な行為をさせることにもつながる可能性が高いです。この手法は、CBRN(化学、生物、放射性物質、核)分野、サイバー攻撃シナリオ(コードインジェクションタスクで84%のASRを達成)、操作・偽情報シナリオ、プライバシー関連タスク(52.78%のASR)で有効でした。
ウランの壁は核兵器の悪用から私たちを守りますが、そのような物理的な壁は存在しません:
ポリモーフィックマルウェアコードの作成。
説得力のあるフィッシングメールの作成。
非合意の性的画像の生成。
偽情報キャンペーンの作成。
「詩」を求めるAIクレジットカード情報を盗むスクリプトを書くことは、実行に遠心分離機を必要としません。このAIジェイルブレイクの成功は、現在のアライメント技術の脆弱性を露呈しています。私たちは、単語フィルターのように機能する「分類器」でこれらのモデルをパッチしていますが、私たちは語彙だけでなく、意味を理解するシステムを扱っています。
防御が特定の「悪い言葉」を見つけることに依存している限り、ユーザーはそれらの言葉を新しい服で着飾る方法を見つけるでしょう。今日は詩かもしれませんが、明日はソクラテス対話や脚本かもしれません。この研究は、モデルが「賢く」なり、より創造的になる(より高い温度能力)につれて、その創造性を利用する操作に対してより脆弱になる可能性があることを証明しています。
OpenAIやAnthropicのような企業にとっての課題は、爆弾のレシピをブロックするだけでなく、モデルにフォーマットに関係なく意図を理解するように教えることです。それまでは、韻を踏む辞書と少しの忍耐力を持つ人には、ガードレールは浸透しやすいままです。
FAQ: AIジェイルブレイクと安全性

1. AIにおける敵対的ポエトリーとは具体的に何ですか?
敵対的ポエトリーとは、ユーザーが有害または禁止されているクエリを詩の形式で表現し、回避しようとするテクニックです。AIセーフティフィルター比喩、韻、断片的な構文を使用することで、これらのプロンプトは悪意のある意図を偽装し、AIのガードレールがリクエストを認識してブロックするのを防ぎます。
2. 高温サンプリングはなぜLLMを脆弱にするのですか?
3. 敵対的ポエトリーは、実際に誰かが核兵器を製造するのを助けることができますか?
技術的には、はい、それは "AI" に核兵器製造の理論的な手順を出力させることができますが、実際には、いいえ。爆弾製造における巨大な障壁は、数十年前から一般に公開されている理論的知識ではなく、物理的なウラン濃縮と工学です。AIAI
4. 従来のプロンプトインジェクション攻撃とどう違うのですか?
従来のプロンプトインジェクションは、コマンドオーバーライド、ロールプレイング(「DAN」メソッドなど)、またはAIを混乱させるための無意味なデータ文字列の追加に依存することがよくあります。敵対的ポエトリーは、自然言語と、安全分類器によって使用される特定のキーワードトリガーをバイパスするためにモデルが文学でトレーニングされたことを利用して、より巧妙です。
5. 企業はこの敵対的ポエトリーの脆弱性を修正していますか?
OpenAIやAnthropicのような企業はLLMの安全ガードレールを定期的に更新していますが、この特定の脆弱性を修正するのは困難です。詩は比喩と抽象化に依存するため、モデルの正当な創造的なコンテンツを作成する能力を破壊せずにフィルタリングすることは、重大な技術的課題です。Anthropicのチャットボットは詩的な攻撃に対して最も高い耐性を示しましたが、他のチャットボットは著しくパフォーマンスが悪化しました。調査された25のモデルのうち13は、詩的なプロンプトで70%を超える攻撃成功率を経験しましたが、35%未満の攻撃成功率を達成できたのは5つだけでした。


