多様性の崩壊: なぜポストトレーニングがAIの文章を検出可能にするのか
- Aisha Washington

- 6月6日
- 読了時間: 9分
更新日:6月17日

という一般的な考え方があります。AIライティングは本質的にありふれたものであり、大規模言語モデルは単なる「ウェブのぼやけたJPEG」に過ぎず、平均的で無味乾燥な文章しか生み出せない、というものです。この仮定が、現在のAI検出ツールの多くを支えています。検出ツールが段落をフラグ付けするとき、それは機械の魂を見つけているのではなく、多様性の崩壊として知られる統計的異常を検出しているのです。
現在、PangramのようなAI検出器が効果を発揮する、短く過渡的な期間にいます。これはAIが人間のような多様性を生み出せないからではなく、現在の安全性の業界標準である「post-training」が、Reinforcement Learning from Human Feedback (RLHF)」によってモデルの創造的な可能性を奪っているためです。
理解すること多様性の崩壊は、今日のAIモデルがそのように聞こえる理由、そして明日にはそのようには聞こえなくなる理由を理解するための鍵です。
メカニズム:ポストトレーニングがどのように多様性の崩壊を引き起こすか

ChatGPTの出力がなぜ無味乾燥に感じるのかを理解するには、パイプラインを見る必要があります。大規模言語モデル(LLM)は「ベースモデル」として始まります。ベースモデルは、次のトークンを予測するために大規模なデータセットでトレーニングされます。それらは生で、予測不可能で、その奇妙さにおいて驚くほど人間的です。それらは、混沌としたものや素晴らしいものを含む、人間の言語の完全な分布を表しています。
これは、Redditユーザーや開発者が「企業のボット」効果と呼んでいるものです。たとえば、次のようなプラットフォームでの議論では、r/singularity、医療AIやその他の機密性の高いアプリケーションに取り組んでいる業界関係者は、この現象を確認しています。ベースモデルは創造的でニュアンスのある診断やジョークを提供できますが、RLHFレイヤーは標準化された安全な応答を優先してそのバリエーションを抑制します。その結果、モデルは多様性の崩壊に苦しむことになります。創造的な表現のロングテールへのアクセスを失ったのです。
現代のLLMにおける多様性の崩壊の分析

「多様性の崩壊」について話すとき、それは「モードの崩壊」とは異なります。GAN(敵対的生成ネットワーク)の研究でよく使われる用語で、ジェネレーターが入力に関係なく同じ出力画像を生成することを指します。この場合、テキストは技術的にはユニークですが、スタイルは平坦です。
検出業界は、この平坦さに完全に依存しています。Pangramのようなツールは、"トレーニング後のアーティファクト"を見つけるように調整されているため、高い精度率を主張しています。これらは、RLHFの絞り込みプロセスから生じる特定の構文パターン、つまり、遷移語の過剰な使用、バランスの取れた文構造、そして困惑の欠如です。
現在のAIライティングが「駄作」なのは、技術が悪いからではありません。退屈するように最適化されたからです。
2年前、コメディライターのサイモン・リッチは、OpenAIのベースモデル(特にBase4のバージョン)を試しました。彼の経験は、その stark な違いを浮き彫りにしています。彼は、ベースモデルがロボット的だからではなく、才能のある人間のライターと区別がつかないほど似ていたため、不気味だと感じました。それはまだ、"post-training" のpost-training"conditioning" を受けておらず、それがdiversity collapseを引き起こしていました。その結果、これらのベースモデルからの出力は、人間の思考の高いエントロピーと統計的な不規則性を保持しているため、AI検出器からは見えないことがよくあります。
トレーニング後のアーティファクトが検出に果たす役割
AI検出器の現在の効率性は、現在の開発サイクルの的な特徴にすぎません。彼らは「知性」を検出しているのではなく、安全フィルターを検出しているのです。
RLHFによるトレーニングを受けたモデルは、回避的な学習をします。強い文体上の選択を避けるようになります。これが指紋を作成します。トレーニング後のアーティファクトは、エッセイが委員会によって書かれたように聞こえる理由です。人間の文章はギザギザしています。トーンの突然の変化、文の長さのばらつき、奇妙な語彙の選択があります。トレーニング後のモデルはこれらのギザギザを滑らかにします。
これにより、「より良く」「より安全」に一般公開用にモデルを作成すればするほど、検出されやすくなるというパラドックスが生じます。検出ツールは本質的にリスクの欠如を探しています。リスク(奇妙さの可能性)を取り除くと、人間性も取り除かれます。
しかし、最近の研究では、これは解決可能であることが示唆されています。
スタイルファインチューニングによる多様性の崩壊の解決

回避する最も効果的な方法多様性の崩壊 をターゲットを絞った スタイルファインチューニングによって、一般的なRLHFフィルターをバイパスすることです.
最近の研究では、GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Proなどの主要なモデルを50人の異なる作家のデータセットでファインチューニングしました。目的は、安全トレーニングによって抑制されていたベースモデルの潜在的な能力をモデルが回復できるかどうかを確認することでした。
結果は示唆に富むものでした。研究者は人間の専門家(MFA)に特定の作家の模倣文を書かせ、ファインチューニングされたモデルの出力と比較しました。専門家は一貫してAIによる模倣を好みました。さらに重要なことに、専門家はファインチューニングされていないデフォルトのAI出力を強く嫌いました。
専門家が反応していたのは、「AIライティング」対「人間ライティング」ではありませんでした。彼らが反応していたのはトレーニング後のアーティファクトでした。モデルが安全に適合した一般化よりも特定の文体パターンを優先するようにファインチューニングされると、多様性の崩壊は消滅しました。モデルはAIに関連付けられる「ゴミ」を生成するのをやめ、作者がいるように感じられるテキストを生成し始めました。
これはコンテンツ戦略に直接的な影響を与えます。もし多様性の崩壊は、アライメントトレーニングの単なる副作用にすぎない場合、AIライティングの「修正」には技術的なブレークスルーは必要ありません。異なるトレーニング目標が必要なだけです。
NeurIPSと敵対的トレーニングの台頭
学術界はすでにこれに対処するために動いています。カンファレンス・オンニューラル情報処理システム(NeurIPS)、AI研究界最大のイベントである、最近、特に「ダイバーシティ・コラプス」に対処する研究に最優秀論文賞を授与しました。
研究者たちは、敵対的学習 の学習後 のフェーズで、出力の分布が狭まりすぎるのを防ぎます。敵対的生成ネットワーク(GAN)のセットアップでは、1つのモデルがテキストを生成しようとし、もう1つのモデルがそれを人間のテキスト(または特定のターゲット分布)と区別しようとします。これにより、ジェネレーターは、ディスクリミネーターを騙すために高い多様性とエントロピーを維持することを余儀なくされます。
を統合することで 敵対的学習アライメントプロセスに組み込むことで、開発者は理論上、指示に従う(アライメントされた)モデルと、ベースモデルの統計的豊かさを保持するモデルの両方を手に入れることができます。
これは、「AIアクセント」――ChatGPTと関連付けられる、無味乾燥で検出可能なスタイル――は、本質的な特徴ではなく、解決可能なバグであることを示唆しています。
未来の様相:高品質なスラッグ

私たちは、現実に向かって突き進んでいます。そこでは、多様性の崩壊 はシステムから意図的に排除されます。企業がトレーニングされたモデルを展開し始めると、敵対的トレーニング または特殊なスタイルファインチューニング を使用すると、現在のAI検出ツールの有用性は失われます。
もし多様性の崩壊 を回避できれば、Pangramのようなツールは機能しなくなります。それらが探している統計的な透かしは単に存在しなくなるでしょう。
これはより複雑な問題につながります。AIが人間らしいテキストの無限のバリエーションを生成できる場合、「質の高いゴミ」の量は爆発的に増加します。私たちは、ボットのコメントがボットのコメントのように見えるため、一般的なボットのコメントを無視することに慣れています。将来のモデルは、私たちと機械を隔てているまさにその多様性を模倣するため、人間の出力と区別がつかない技術文書、創作フィクション、ソーシャルメディアのコメントを生成する可能性が高いです。
NeurIPSの著者たちは、フィードバックループの可能性についても警告しています。つまり、私たちは「AIテキスト」に溢れるようになり、人間が書く文章は、私たちを模倣するために訓練された機械を無意識に模倣することで、「多様性の崩壊」によって実際に悪化する可能性があります。最終的には、自分が人間であることを証明する唯一の方法は、最適化されたモデルが決して予測できないような、支離滅裂な何かを書くことだけになるような地点に到達するかもしれません。
FAQ
モード崩壊と多様性の崩壊の違いは何ですか?
モード崩壊とは、生成モデルが異なる入力に対して全く同じ結果を出力する失敗状態であり、本質的に行き詰まってしまうことです。多様性の崩壊は、モデルがユニークなテキストを生成するものの、文体の範囲が圧縮され、結果として平均的で一般的な響きの出力になる、より微妙な問題です。post-training制約。
なぜベースモデルはRLHFモデルよりも検出が難しいのですか?
ベースモデルは、人間の癖や不規則性を含む、トレーニングデータの生の、高エントロピーパターンを保持しています。それらは、低パープレキシティパターンを探す検出器に見えなくさせる、統計的なスパイクを平滑化する post-training アライメント(RLHF)を受けていません。
特定の著者のファインチューニングは、多様性の崩壊を修正できますか?
はい、style fine-tuning 特定のデータセットでのファインチューニングにより、モデルは一般的な安全アライメントよりも明確な声遣いを優先できます。特定の作家でファインチューニングされたモデルは、人間の模倣者を上回り、「AIアクセント」を欠いたテキストを生成できることが研究で示されています。これは、多様性の崩壊。
敵対的学習はAIの多様性にどのように役立ちますか?
敵対的学習 は、モデルが識別器を騙すように促される競争的要素を導入します。これにより、生成モデルは、トレーニング後 に、多様性の崩壊 を引き起こす安全で反復的なパターンに落ち着くのを防ぐために、より広範囲の出力とより高いエントロピーを維持することを余儀なくされます。
PangramのようなAI検出器は将来機能しますか?
可能性は低いです。現在の検出器は、post-training artifacts(トレーニング後の人工物)を特定することに依存しています。これはdiversity collapse(多様性の崩壊)に起因します。開発者がadversarial training(敵対的トレーニング)や特殊なファインチューニングのような、より優れたトレーニング方法を実装するにつれて、これらの人工物はなくなり、AIテキストは数学的に人間が書いたものと区別がつかなくなるでしょう。


