top of page

幻覚検出器の研究が示したのは普遍的なシグナルではなく下限

r/MachineLearningの研究者は、事前登録された検出器が最初のトークンが出現する前に、20件のモデルデプロイ中18件で目標を達成したと述べている。ただし、この報告結果は普遍的な幻覚検出器の存在を確立するものではない。むしろ、モデル内部の幾何学的構造に基づく共通の性能下限を示唆している。

この違いは重要だ。あらゆる誤答を特定できなくても、多数のモデル間で転移可能な検出器は有用なルーティングシグナルになり得る。ただし、現時点の証拠は、未公表または独立した査読をまだ受けていない実験を説明するソーシャル投稿に由来する。

投稿では、注目すべき逆転も報告されている。モデル自身の信頼度を加えても、幾何学のみの検出器を超えてデプロイ範囲は改善しなかった。失敗した2件のデプロイも同一であり、このテストでは信頼度と幾何学が重複する情報を捉えていたことが示唆される。

この知見は、よく知られた二つのアプローチに疑問を投げかける。一つは、トークン確率を便利な事実性スコアとして扱う考え方だ。もう一つは、単一の内部特徴がアーキテクチャ、データセット、幻覚の種類をまたいで一般化すると期待する考え方である。報告された実験は、いずれの期待も最も強い形では支持していない。

事前登録テストは20件中18件のデプロイで基準を満たした

中心的な結果は限定付きの成功である。幾何学ベースの検出器1種は、普遍的なものにはならなかったものの、事前登録されたカバレッジ基準を満たしたと報告されている。

元のMachineLearning投稿によると、研究者は10種類の言語モデルで二つのタスクを評価した。最初の実行では、これにより20件のモデル・タスク別デプロイが作られた。

このプロジェクトでは、四つの大分類にまたがる29種類のモデル内部シグナルを調べた。対象には、アテンションパターン、残差ストリームの動き、読み出しの幾何学、信頼度が含まれた。その後、評価データが存在する前に定めたルールに従い、セレクターが各モデルに一つのシグナルを選んだ。

フォワードパスとは、与えられた入力に対してモデルが行う一回分の完全な計算である。提案された検出器は、生成テキストが利用可能になる前にこの計算を調べる。この点で、完成した回答を文書と照合したり、複数のサンプリング結果を比較したりするシステムとは異なる。

生成前という制約は、報告された20件中18件という結果を興味深いものにしている。再現可能であれば、アプリケーションが長い回答の生成に時間を費やす前に、検出器はリスクを割り当てられる可能性がある。製品はその後、検索を要求したり、クエリを別のモデルに振り分けたり、人間のレビューを必須にしたりできる。

幾何学のみの検出器は、事前登録ルールの下で少なくとも17件のデプロイに合格する必要があった。投稿によれば、18件に合格した。これは、幾何学から導出したシグナルが、テスト条件全体で広範だが不完全なカバレッジを確立できるという限定的な主張を支持する。

この数字は、検出器が幻覚の90%を捕捉したことを意味しない。デプロイのカバレッジと検出精度は異なる測定値である。18件のデプロイで閾値を通過したというのは、それらの設定で手法が指定された基準を満たしたことを示すに過ぎない。

基礎となる閾値、クラスバランス、データセットの構築方法、キャリブレーション手順、デプロイごとの不確実性はすべて、読者がこの件数をどう解釈すべきかに影響する。完全な実験資料がなければ、この結果を本番環境でのエラー率に置き換えることはできない。

事前登録は、結果を見た後で仮説を修正する機会を制限することで、設計を強化する。ラベルの妥当性を検証するものでも、実装ミスを排除するものでも、選ばれたテストが実際のアプリケーションを代表することを保証するものでもない。

投稿によれば、手順は2回事前登録された。この詳細は、研究者が探索的な判断と検証的なテストを分けようとしたことを示唆する。両方の登録を独立して閲覧できれば、どの特徴、閾値、除外条件、統計テストが固定されていたかが明確になる。

したがって、最も責任ある読み方は限定的である。幾何学のみのアプローチは、テストされたデプロイの大半で計画した基準を超えたと報告されている。残る失敗は、主張の境界を定めるため重要である。

信頼度がカバレッジを広げなかった理由

最も鮮明な逆転は、信頼度の成績が悪かったことではなく、幾何学を超えるカバレッジを加えなかったと報告された点にある。

モデルの信頼度は、通常、可能な次トークンに割り当てられる確率を指す。値が高いほど、モデルが他の選択肢より一つの継続を強く支持していることを意味する。しかし、それは支持された継続が外部の現実と一致することを示すものではない。

この実験では、幾何学とモデルの信頼度を組み合わせたとされる。この複合検出器も20件中18件のデプロイで合格した。同じ2件を見逃し、どの失敗も救済できなかった。

より強い主張に対する事前登録の基準は、少なくとも19件のデプロイだった。複合手法はそこに到達しなかった。報告された決定ルールの下では、信頼度がカバレッジを広げたという命題は反証された。

この結果は、信頼度に有用な情報が一切含まれないことを示すものではない。その有用な変動が、これらのタスクとモデルでは選ばれた幾何学的シグナルと重なっていた可能性を示唆する。異なるデータセットやキャリブレーション手法なら、補完的な情報が明らかになるかもしれない。

ここでいう幾何学とは、内部表現間の測定可能な空間的関係を指す。内部表現は、モデルがプロンプトを処理する際に情報を符号化するベクトルである。そのノルム、角度、方向、層をまたぐ移動は、回答の正しさと相関し得る。

信頼度は同じ基礎ネットワークから生じる。そのため、モデル出力に近い幾何学的測定が、トークン確率に表れる情報の大部分をすでに捉えている可能性は十分にある。投稿で報告された救済ゼロの結果は、この説明と整合的だ。

近年の研究は、幾何学的指標が交換可能ではないことも警告している。幾何学的検出指標に関する2026年の研究では、正確性、関連性、一貫性、完全性、信頼度など、異なる統計量が異なる特性に反応することが示された。

同研究は、ドメインシフトに対する大きな感度も報告した。正しい歴史問題の回答と誤った回答を分けるシグナルが、数学では異なる振る舞いをする可能性がある。著者らは正規化を導入し、複数ドメイン評価での改善を報告しており、キャリブレーションが結果をどのように形作るかを浮き彫りにしている。

より広い教訓は、「幻覚」が複数の失敗メカニズムを含むということだ。モデルは一般的な誤解を一貫して述べたり、複数の回答から推測したり、提供された証拠を無視したり、推論ミスを犯したりする。これらの失敗が一つの内部シグネチャを共有するとは限らない。

信頼度は、特に既知のデプロイ分布に対してキャリブレーションされている場合、棄権ポリシーにとって依然として有用である。ただし、取得しやすいという理由だけで、アプリケーションは生の信頼度を独立した事実性の証人として扱うべきではない。

この違いは製品設計に影響する。信頼度の閾値は不確実性を特定できる一方、幾何学スコアは関連する不安定性を特定する。相関した二つのシグナルを組み合わせると、新たな証拠源を加えることなく冗長性があるように見える場合がある。

真に補完的な層は、異なるものを検査する。取得した記録と主張を比較したり、論理的一貫性をテストしたり、引用を検証したり、ツールの結果が回答を裏付けるかを調べたりするものだろう。こうしたチェックは、内部的なためらいではなく証拠を扱う。

MachineLearningの主張は普遍的検出に疑問を投げかける

共通の下限は運用上価値があるが、普遍的な検出器には、タスク、モデル、エラー定義をまたぐより強い証拠が必要だ。

報告された実験は、野心的な問いから始まった。生成前に幻覚を検出するため、内部シグナルの一群は十分に広く機能できるのか。その答えは、下限については「はい」、普遍性については「いいえ」のように見える。

これは意味論上の違いではない。普遍的検出器は、有利なタスク構造、アーキテクチャ固有のキャリブレーション、狭いエラー定義に依存せずに転移すべきである。20件中2件の失敗は、その絶対的な主張を退けるには十分だ。

それでも、この結果には実務的な価値がある。本番システムでは通常、一つのスコアがすべての事実問題を決着させる必要はない。より高コストの検証経路を正当化できるだけのリスク案件を、確実に十分な数だけ特定するゲートが必要になる。

社内ポリシーに関する質問へ答えるエンタープライズアシスタントを考えてみよう。生成前のスコアは、下書きを始める前にリスクの高いプロンプトを検索へ振り分けられる可能性がある。それでも最終回答には、取得したポリシー文書による裏付けが必要だ。

コーディングアシスタントは異なる状況を示す。問題となる失敗は、存在しないライブラリメソッド、互換性のないバージョン、複数ファイルにまたがる誤った推論に関わるかもしれない。短い事実回答でキャリブレーションされた検出器は、この環境には転移しない可能性がある。

長文のリサーチも別の境界を作る。一つの回答には数十の主張が含まれ、一部は裏付けられ、他は誤っている可能性がある。最初のトークンの前に取得された単一のスコアでは、後続のどの文が失敗するかを特定できない。

この制約は、デプロイのカバレッジを主張レベルの検証と混同すべきでない理由を説明している。検出器は、プロンプトから回答までの軌跡にリスクがあるかを推定できるかもしれない。しかし、その後に続くすべての命題の真偽を独立して確立することはできない。

関連研究は、早期シグナルの可能性を支持している。2026年の論文Before the First Tokenは、三つの事実データセットから得た552件のラベル付き例を用い、七つの自己回帰型トランスフォーマーを評価した。

著者らは、4億パラメータ未満のモデルではプローブ性能が偶然水準だったと報告した。およそ10億パラメータを超えると、一部のモデルでより強い生成前シグナルが観察された。このパターンは、指示チューニングにも依存していた。

この論文は、Pythia-1.4BとQwen2.5-7Bで有意な位置ゼロ効果を見出した。一方、より大規模であるにもかかわらず、Pythia-6.9Bは時間的プロファイルが平坦だった。この比較は、パラメータ数に基づく単純なルールに反する。

研究者らはさらに、検出された方向に沿った活性化ステアリングでは幻覚を修正できなかったと報告した。言い換えれば、このシグナルは因果的ではなく相関的だった。リスクの高い状態を検出しても、その状態を変更すれば真実の回答が生まれるという意味ではなかった。

この境界は、Reddit上の主張の解釈を導くべきだ。内部パターンは、専用の真実回路を表していなくても結果を予測できる。それはタスクの難しさ、プロンプトへの親しみやすさ、回答可能性、または正確性と相関する別の変数を符号化している可能性がある。

普遍的な検出器は、これらの代替説明を切り分ける必要がある。新たなドメイン、プロンプト形式、言語、モデルファミリー、事後学習の形態でも性能を維持すべきである。また、その前提を意図的に崩そうとする試みにも耐える必要がある。

したがって、結果を再現または検証するよう促す投稿の呼びかけは中心的である。次の段階は、より大きな見出しではない。二つの見逃しと、元のタスクがカバーしなかった設定を中心に設計された敵対的テストスイートである。

既存の検出器は問題の異なる部分を解決する

内部幾何学、意味的な不確実性、外部検証はそれぞれ異なる問いに答えるため、この分野は階層型の検出へと収束しつつある。

影響力のあるアプローチの一つは、意味的エントロピー、すなわち複数の生成回答の意味全体にわたる不確実性を測定する。繰り返し生成された回答が異なる主張を表す場合、モデルが作話している可能性は高くなる。

査読済みのセマンティック・エントロピー研究では、7Bから70BパラメータのLLaMA、Falcon、Mistralファミリーを検証した。評価対象となった各ファミリーとスケールで、AUROCは0.78から0.81の間で安定していたと報告している。

AUROCは、閾値全体にわたって正例を負例よりどの程度適切に上位へ順位付けできるかを測る指標だ。特定のアプリケーションで発生する偽陽性率を示すものではない。運用側は依然として、自らのコストに見合う閾値を設定する必要がある。

セマンティック・エントロピーは、生成前の検出器とは大きく異なる。Natureの手法では、主な文レベル実験に10回の生成を用いた。ばらつきを測定する前に、回答を意味ごとにグループ化している。

この手順は、サンプルごとに変化する任意の誤答を検出できる。一方で、同じ誤った主張を自信を持って繰り返すモデルは見逃す可能性がある。著者らは、自らの手法を、ハルシネーションと呼ばれるすべての振る舞いではなく、コンファビュレーションに限定すると明示している。

コストも異なる。複数の回答をサンプリングし、その意味を比較するには、単一の内部状態を読むより多くの計算が必要になる。特に大半のクエリが定型的である場合、単一パスの検出器は魅力的な初期フィルターとなる。

ブラックボックスのシステムには、別の制約がある。商用アプリケーションの開発者は、多くの場合、アテンションマップ、残差ストリーム、隠れベクトルを検査できない。APIを通じて受け取れるのはテキストと、場合によってはトークン確率だけだ。

したがって内部幾何学は、オープンウェイトモデル、セルフホスト型のデプロイ、あるいは適切なテレメトリーを公開する意思のあるプロバイダーに有利である。セマンティックな一貫性を使う手法はブラックボックスのテキスト出力でも機能しうるが、繰り返し生成を必要とする。

検索ベースの検証は第三の道筋を取る。回答が提供された文書に根拠づけられているかを確認する。正しい証拠が存在する場合には、自信に満ちた誤りを捕捉できるが、検索にはそれ自体の失敗モードもある。

リトリーバーが古いポリシーを返したり、関連する箇所を省いたり、誤解を招く文書を最上位に順位付けしたりする可能性がある。その結果、言語モデルが、その文を裏づけない情報源を引用することもある。グラウンディング・システムには、単に文書が存在するだけでなく、主張レベルの検証が必要だ。

ハイステークスなケースでは、人間によるレビューが依然として不可欠である。リスクスコアは注意を向ける優先順位付けに役立つが、レビュアーには原典の証拠と監査証跡へのアクセスが必要だ。検索可能なナレッジベースは、チームがその情報源の文脈を保持する助けになる。

これらの手法は、直接的な代替物ではなくレイヤーとして捉えるべきだ。内部検出器は、モデルの計算がリスクのあるケースに似ているかを問う。セマンティック・エントロピーは、サンプリングされた意味が安定しているかを問う。検索は、利用可能な証拠がその主張を裏づけるかを問う。

本番パイプラインでは、これら3つを独立していると見せかけることなく組み合わせられる。初期シグナルがクエリを振り分け、セマンティック検査が不確実な出力を調べ、証拠検査が重要な主張を検証する。人間のレビュアーは、その結果がコストを正当化するケースを扱う。

信頼度と内部幾何学の間に報告された冗長性は、このレイヤー型の見方を補強する。同じネットワークから測定値を追加しても、必ずしも知識が増えるわけではない。独立した証拠は、システム内のどこかで取り入れなければならない。

検証のギャップは依然として大きい

報告された事前登録は信頼性を高めるが、他者が実験を検査し再現できるようになるまで、公開された主張はなお不完全なままだ。

元の投稿が示しているのは結果の要約であり、査読済みの記録ではない。この知見を評価するには、登録内容、コード、データセット、モデルチェックポイント、プロンプト、ラベル、そしてデプロイメントレベルの完全な結果が必要となる。

「honest selector」という表現にも、正確な定義が必要だ。研究者が評価データを用いて指標、層、符号、閾値、変換を選ぶ場合、特徴選択は情報漏洩を引き起こしうる。クリーンな分割は、あらゆる適応的な意思決定をカバーしなければならない。

モデルごとに1つのシグナルを選ぶことは、第二の疑問を生む。特徴のファミリーは広く転移できても、選ばれる特徴はモデルによって異なる可能性がある。それは、どこでも変更なく動作する単一の固定検出器ほど普遍的ではない。

モデル固有の選択が、運用上は合理的である場合もある。チームは通常、デプロイメントごとに安全性の閾値を調整する。しかし主張では、普遍的な特徴ファミリーと、固定パラメータを持つ普遍的な検出器を区別すべきだ。

失敗した2つのデプロイメントは、集計件数以上の注意に値する。アーキテクチャ、タスク、スケール、チューニング手法、ラベル分布を共有しているかもしれない。共通の原因があれば、提案された下限がどこで崩れるかを特定できる。

正解ラベルをめぐる不確実性も重要である。ハルシネーションのラベルは、タスクが事実の正確性、文脈への忠実性、関連性、論理的一貫性のどれを測定するかによって左右されうる。対象の定義を知らなければ、検出器を解釈することはできない。

「before」という言葉にも、技術的な選択が隠れている場合がある。モデルは最初の出力トークンを選択する前に、すでにプロンプト全体を処理している。したがってその隠れ状態には、プロンプトの難しさ、既知性、予想される回答内容がエンコードされうる。

それでもこれは生成前検出ではあるが、モデルの計算を伴わない予測ではない。アプリケーションは少なくとも、プロンプト処理パスを完了する必要がある。長いコンテキストでは、この段階が推論コストのかなりの部分を占める可能性がある。

実験では、クラスの出現率と信頼区間も報告すべきだ。合格数だけでは、あるデプロイメントがかろうじて閾値を超えたのか、別のデプロイメントが余裕をもって上回ったのかが分からない。小規模なテストセットでは、順位付けが不安定になりうる。

適応的な攻撃も別の課題となる。ユーザーは質問を言い換えたり、無関係な文脈を注入したり、特定の回答スタイルを要求したり、長い推論を強制したりできる。通常のプロンプトで調整された検出器は、プロンプト構造が変わると失敗する可能性がある。

製品のブランド名が変わらなくても、モデル更新により内部幾何学は変化しうる。量子化、ファインチューニング、アダプター、システムプロンプト、推論設定は、測定されるシグナルを変える場合がある。変更のたびに、新たな検証が必要になる可能性がある。

研究用モデルとホスト型フロンティアシステムには、さらに違いがある。アーキテクチャ、ルーティング、ポストトレーニングが非公開のシステムに、内部状態を使う手法が転移すると想定することはできない。

モデルがハルシネーションを起こす理由に関する最近の研究は、さらに別の複雑さを加えている。2026年の評価インセンティブ研究は、次トークン学習と正確性重視の評価が、棄権よりも推測を報いると論じた。

検出器はリスクのある推測にフラグを立てられるが、それを生み出したインセンティブを変えることはない。デプロイメントチームには、検索、検証、リスク検出に加え、適切な回答拒否を報いるスコアリングルールが必要になるかもしれない。

こうした理由から、「20件中18件」は調査の終点ではなく、出発点とすべきだ。有用な再現研究では、公開された手順を固定し、未検証のモデルファミリーをテストし、元の閾値を差し替えることなく、すべての失敗を開示するだろう。

この下限が維持されるかは3つのテストで決まる

同じ下限が独立した再現、分布シフト、本番に近いルーティングテストを乗り越えられるなら、この主張は重要になる。

最初に注目すべきシグナルは、完全な公開だ。そこには、両方の事前登録記録、コード、特徴定義、モデル識別子、タスクデータ、ラベル、閾値、デプロイメントレベルのスコアを含めるべきである。

公開により、情報漏洩と選択に関する判断が監査可能となり、主張は強化される。登録内容が欠けていたり、モデルごとの結果が不完全だったりする場合、とりわけ成功した構成しか利用できない場合には、主張は弱まる。

第二のシグナルは、未検証のモデルとタスクを用いた独立再現である。最も有益なテストには、開発段階で除外されていたオープンウェイトのアーキテクチャ、多言語プロンプト、長文回答、ツール利用、文書に根拠づけられた生成を含めるべきだ。

再現研究では、研究者が何かを調整する前に、元の手順を維持すべきである。性能がドメインシフト後にのみ低下するなら、検出器は調整済みのローカルゲートとしてなお役立つ可能性がある。ただし、普遍的な下限を裏づけるものではない。

第三のシグナルは、運用上の成果に結びつけたルーティング試験である。研究者は、初期スコアが検索、回答拒否、再サンプリング、人間によるレビューをトリガーした際に、裏づけのない主張を減らせるかを測定すべきだ。

その試験に必要なのはAUROCだけではない。偽警報、見逃した誤り、レイテンシー、追加計算量、レビュー量、受理された回答の正確性を報告すべきである。これらの測定値によって、検出器がリソースを節約するのか、それとも単に誤りを移し替えるだけなのかが決まる。

最も有望な成果は、完璧な真実計ではない。生成前にリスクのあるプロンプトの安定した一部を捉え、それらを真に異なる検証メカニズムへ渡す、安価な最初のゲートである。

報告された信頼度の結果は、この設計をより緊急なものにしている。信頼度と内部幾何学が冗長なままであるなら、チームは両者の組み合わせを独立した2票として扱うのをやめるべきだ。内部スコアには、情報源の検索または主張検証を組み合わせるべきである。

この研究を評価する開発者は、すぐに3つの問いを立てられる。この検出器は自社データ上でも閾値を維持するか。見逃しは認識可能な失敗タイプに集中しているか。フラグ付きプロンプトをルーティングすることで、すべてのコストを考慮した後の最終的な正確性は向上するか。

より広い機械学習コミュニティは、孤立した逸話ではなく、統制されたテストで提案された下限を打ち破ろうとすべきだ。再現に失敗すれば、主張の範囲は狭まる。成功すれば、すべてのハルシネーションを検出するふりをせずに、有用な共有シグナルを確立できる。

そこに、報告された結果の真の価値がある。これは、万能検出器の探索を、測定可能な仮説へと置き換える。すなわち、モデルの内部幾何学は広範な早期警告を提供する可能性がある一方で、真実には依然として独立した証拠が必要だ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page