top of page

Tomáš BrucknerのLLM行動フィンガープリンティングは乱数でAPIモデルのすり替えを検出できる

7月21日
読了時間: 20分

Tomáš Brucknerは165のAIモデルをテストし、LLM行動フィンガープリンティングによって約120件の単一トークン応答から疑わしいAPIモデルのすり替えを特定できることを明らかにした。

この手法は、ほとんど子どもじみた要求から始まる。「1から100までのランダムな数字を1つ挙げてください」。しかし、モデルはランダムには答えない。GPT-4oは42、37、57を好み、Claude Sonnet 5は47に大きく集中した。Qwen3-Maxは30回の試行すべてで42を返した。

APIプロバイダーがあるモデルの提供を約束しながら、不透明な配信チェーンから応答を返している場合、こうした傾向が役立つ。Brucknerの実験は、低コストのプロンプトを繰り返すことで、重みやロジットへのアクセスも、プロバイダーの協力も必要とせず、行動上の不一致を明らかにできる可能性を示している。

だからといって、1つの数字が不正の決定的な証拠になるわけではない。重要なシグナルは、多数の回答、プロンプト、言語にまたがる分布である。モデル名が検証されていない単なるラベルにすぎない市場において、これは購入者に独立した確認手段を提供する。

単一トークンの回答がモデル固有のフィンガープリントを生み出した

この実験は、予測可能なモデルの偏りを実用的な識別シグナルへと変換する。

プラハ経済経営大学の研究者であるBrucknerは、2026年7月11日に自身のフィンガープリンティング研究の初版を公開した。彼は、顧客を多数のモデルや上流の推論プロバイダーと接続するアグリゲーター、OpenRouterを通じて提供されるモデルを調査した。

研究は、7月6日に取得された342件のカタログエントリーから始まった。明文化されたルールに基づき、特殊用途のシステム、不安定なエイリアス、重複するチェックポイント、非チャットモデル、非表示の推論が必須となるエンドポイントが除外された。その結果、明記された19のファミリーと53の配信プロバイダーにまたがる165モデルが残った。

各モデルには、英語、ロシア語、中国語、アラビア語で10件の簡単なタスクが与えられた。こうして得られた40通りのタスクと言語の組み合わせには、乱数、文字、色、動物、都市、単語、コイントスが含まれていた。

研究者は、主要なサンプリング設定の下で、各組み合わせにつき30件の応答を要求した。各プロンプトでは一語のみの回答を求め、エンドポイントが対応している場合は任意の推論を無効にした。

調査全体では、326,047件の応答が収集された。これは2,330万入力トークンと116万出力トークンに相当する。実験設計により、表示される各回答は極めて短く保たれた。

応答の97.6パーセントが有効だった。モデルの中央値では99.6パーセントの確率で有効な出力が生成されたが、一部のシステムは指定された形式をより頻繁に無視した。

乱数の結果が最も分かりやすい例となっている。GPT-4oは回答の多くを42、37、57に分散させた。Claude Sonnet 5は47に集中し、Llama 3.3は53を好んだ。Qwen3-Maxは、論文に示された英語での30回の試行すべてで42を選んだ。

こうした選択は、よく知られた言語モデルの挙動を反映している。ユーザーが「ランダム」という言葉を含めたからといって、モデルが安全な乱数生成器を呼び出すわけではない。モデルは、学習とアラインメントによって形成されたパターンから、もっともらしいテキストの続きを予測する。

人間の文化もこうした予測に影響を与える。42という数字には有名な文学的連想があり、7で終わる数字は主観的にランダムだと感じられやすい。以前の制御されたサンプリング研究では、言語モデルが目標分布を確実に再現することに苦戦することが示されている。

Brucknerの貢献は、モデルがサイコロの代わりとして不適切であることを改めて実証しただけではない。彼は、繰り返し現れるそれぞれの偏りを、その出力を生成したシステムに関する証拠として扱っている。

1件の回答だけでは、ほとんど意味がない。30回の試行で同一、または類似した分布の回答が得られれば、パターンが見え始める。複数の分布を組み合わせることで、信頼できる基準と比較可能な、より大きな行動プロファイルが生まれる。

この研究では、タスクと言語の各組み合わせをプローブセルと呼んでいる。フィンガープリントは、単一のお気に入りの回答ではなく、それらのセル全体における経験的な回答分布から構成される。

この違いは、見出しの主張を理解するうえで重要だ。乱数プロンプトは最も印象に残る例だが、1つの数字だけではモデルを確実に識別できない。実用的な手法には、反復サンプリングとより幅広いテスト群が必要となる。

LLM行動フィンガープリンティングがAPI再販業者に圧力をかける理由

モデルの購入者は多くの場合、モデル名と回答を受け取るだけで、その両者を結び付ける直接的な証拠を得られない。

ファーストパーティーの開発者は、自社のAPIを通じてモデルを公開できる。その後、アグリゲーターが、それぞれ異なるハードウェア、配信ソフトウェア、モデルのバリアントを使用する複数の上流プロバイダーを経由してリクエストをルーティングする場合がある。

さらに、アグリゲーターと最終的なアプリケーションの間に別の再販業者が入ることもある。各レイヤーによって購入は容易になるが、同時に顧客から見える配信スタックの範囲は狭くなる。

不誠実な事業者には、いくつかのすり替え方法がある。トラフィックをより小さなチェックポイントへ転送したり、古いバージョンを使用したり、大幅に量子化されたモデルを配信したりできる。量子化は数値精度を下げて必要なリソースを削減する手法であり、出力の挙動が変化する場合がある。

事業者は、応答メタデータ内の公称モデル識別子を維持できる。通常のAPIログを調べても、基盤となるモデルが変更されているにもかかわらず、顧客には異常が見つからない可能性がある。

これにより、プロバイダーの主張と実際に観測できるサービスとの間に深刻な商業上の対立が生じる。購入者は指定されたモデルに期待される挙動に対して料金を支払うが、通常、その重みやデプロイ設定を調査することはできない。

モデルのすり替えは、単なる理論上の脅威ではない。以前に査読を受けたモデル同一性監査では、Llamaモデルを掲げる31の商用エンドポイントのうち11件が、基準となるデプロイと統計的に異なることが判明した。

この結果は、すべての事例で悪意があったことを証明するものではない。設定の違い、量子化、バージョンのずれ、配信方法の変更はいずれも偏差を生じさせる可能性がある。しかし、公称ラベルが必ずしも基準と同等のサービスを表しているわけではないことを示した。

新しい手法は、こうした偏差を検出するための運用上の障壁を引き下げる。既存のテストでは、生成された文章全体、トークン確率へのアクセス、または特別に設計されたプロンプトが必要になる場合がある。

Brucknerのプローブが求めるのは、ありふれた、ごく短い回答だ。テキスト専用APIに対しても機能し、モデル所有者が事前にウォーターマークを埋め込む必要もない。

これは、多数のエンドポイントを管理する開発者にとって重要である。チームは、信頼できるファーストパーティーのデプロイからフィンガープリントを登録し、仲介業者からの応答をその基準と定期的に比較できる。

このテストは、本番環境の監視と並行して実行することもできる。ユーザーが曖昧な品質低下を報告するのを待つのではなく、事業者はルーティングの変更後すぐに統計的なドリフトを検出できる。

企業の購入者にとって、この問題はベンチマークスコアだけにとどまらない。すり替えられたモデルによって、ツールの選択、形式の一貫性、安全上の拒否、指示への追従が変化する可能性がある。日常的なチャット応答が問題なく見えても、こうした変化がワークフローを混乱させる場合がある。

内部評価の信頼性が損なわれる可能性もある。チームがあるチェックポイントを承認した後、デプロイ時に気付かないまま別のチェックポイントを実行するかもしれない。その場合、当初のセキュリティおよび信頼性テストは、もはや本番システムを表さない。

したがって、LLM行動フィンガープリンティングは、配信の詳細をさらに透明化するよう再販業者に圧力をかける。デプロイを切り替えるプロバイダーは、その違いを開示するか、独立した検証結果を公開する必要が生じる可能性がある。

モデル開発者にも圧力がかかる。外部監査システムがすり替えと正式な更新を区別するには、顧客が安定した基準エンドポイントと明確なバージョン識別子を得られる必要がある。

この手法は、信頼を不要にするものではない。信頼の一部を、プロバイダーのラベルから、顧客が管理できる再現可能な測定へと移すものだ。

フィンガープリントは魔法の数字ではなく、分布の中に存在する

中核となる仕組みは、各回答が現れる頻度を測定し、そのパターンを信頼できるモデルのパターンと比較する。

言語モデルは、次に来る可能性のあるトークンに確率を割り当てる。学習データ、トークン化、選好チューニング、デコード規則のすべてが、その確率に影響を与える。

ランダムな色を求めると、あるモデルでは「青」が、別のモデルでは「赤」が好まれる場合がある。ランダムな都市を求めるプロンプトでは、パリ、東京、ロンドンがそれぞれ異なる割合で繰り返し出力されるかもしれない。

こうした偏りは、開発者が意図的に埋め込んだ固有の秘密ではない。モデル構築プロセスから残された行動上の痕跡である。Brucknerの手法は、その痕跡を測定可能になるまで集約する。

論文では、回答分布の比較にJensen-Shannonダイバージェンスを使用している。この有界の統計尺度は、両側を対称に扱いながら、2つの確率分布がどれほど異なるかを表す。

ダイバージェンスが低いほど、応答パターンが類似していることを示す。高い場合は、2つの回答群が異なる行動分布から生じた可能性を示唆する。

同一モデルのサンプルを2つに分けた場合、セル単位のダイバージェンスの中央値は0.075だった。異なるモデルからのサンプルでは中央値が0.489となった。この差は、テスト群全体を通じて同一性を検証するのに十分な大きさだった。

分布は著しく非一様だった。使用可能な6,572セル全体で、エントロピーの中央値は1.00ビットとなり、最も一般的な回答が中央値で71パーセントを占めた。

100個の数字から真に一様に選択した場合、エントロピーは約6.64ビットになる。モデルの結果がはるかに低いことから、回答が少数の好まれる選択肢に大きく集中していたことが分かる。

この集中により、測定を低コストで実施できる。すべてのモデルが一様にサンプリングするなら、膨大な数のリクエストなしに回答からモデルの同一性を知ることは難しい。

モデル固有のピークがシグナルを生み出す。反復によって、それらのピークがどこにあり、どの程度支配的なのかを推定できる。

より幅広いテスト群を使うことで、この手法が42やその他の文化的な引用だけに依存することも防げる。4言語にまたがる10件のタスクによって、学習および事後学習の挙動を異なる角度から調べる。

言語の違いは、トークン化やコーパスの異なる影響を明らかにする可能性がある。同じ概念を求める場合でも、タスクの中国語版では英語版とは異なる分布が生じることがある。

したがって、フィンガープリントにはモデルに対する40の関連した観測結果が含まれる。完全なパターンを再現するには、代替モデルは1つの有名な回答だけでなく、それ以上のものを一致させなければならない。

この研究では、モデルファミリーの帰属判定もテストした。最近傍分類器は、未観測のモデルを明記されたファミリーに59.5パーセントの精度で分類した。これは、頻度で重み付けされた偶然の確率である18.4パーセントを上回った。

性能はファミリーによって異なった。GPTモデルの再現率は90パーセント、GLMモデルは83パーセントだった。Claudeの再現率は58パーセント、Geminiは55パーセントだった。

これらの数値は有用だが、限界もある。検証では、エンドポイントが登録済みの特定の基準と一致するかを問う。ファミリーの帰属判定では、未知のモデルがどこに属するかという、より難しい問題を扱う。

前者はAPI監査ですぐに役立つ。後者は調査上の手がかりを提供するが、あらゆる系統にわたって確実な識別を実現するものではない。

他の研究は異なる方法を採用している。LLMmapは、設計されたクエリを使用してモデルのバージョンを区別し、42モデルで高い成果を報告した。そのUSENIX論文は、慎重に選ばれたプロンプトによって、識別力の高い挙動を引き出せることを示している。

Brucknerは、単一クエリの識別性を目立たない反復と引き換えにしている。ランダムな色、数字、都市は、固定された一連の珍しい監査文字列よりも通常のトラフィックに近く見える。

このトレードオフこそが、この手法の魅力を決定づけている。完全な同一性オラクルほど正確ではないものの、従来型のチャットエンドポイントしか公開していないプロバイダーに対しても導入しやすい。

約120件のクエリで誤り率10.6パーセントを達成

この研究で最も実用的な成果は、クエリ量と検証誤差の関係を測定したことである。

評価では、検証を生体認証チェックのように扱った。一方のサンプル群で参照IDを登録し、もう一方のサンプル群で、申告されたエンドポイントがそれと一致するかをテストした。

真正試行では、同じモデルの応答を別々に二分したもの同士を比較した。なりすまし試行では、異なるモデルに属する二分サンプル同士を比較した。

しきい値によって、真正なエンドポイントを拒否したり、なりすましを受け入れたりする可能性がある。等価エラー率(EER)は、この2種類の誤り率が等しくなる点を示す。

ランダムに選択した1つのプローブセルを使用すると、EERは23.3パーセントだった。4セルでは13.2パーセントに低下し、8セルでは10.6パーセントに達した。

分割サンプル評価では、各セルにつき15回反復した。したがって、8セルには約120件の単一トークンクエリが必要だった。

16セルではEERが9.5パーセントに低下した。32セルでは8.4パーセントとなり、完全な40セルの一式では7.3パーセントに達した。

改善幅は、およそ16~24セルを超えると横ばいになった。このため運用者は、高頻度で軽量なチェックと、頻度は低いがより広範な監査のどちらかを実用的に選択できる。

EERが10.6パーセントでは、不正を自動的に断定するには不十分である。約10回に1回の誤りは、依然として無視できない。特に、アカウント停止や契約上の措置につながり得る場合はなおさらだ。

それでも、アラートとしては機能し得る。チームは、すべてのアラートを最終的な証拠として扱わないことを前提に、ノイズの多いシグナルを詳細な調査のきっかけとして日常的に利用している。

複数の独立した監査に繰り返し不合格となるエンドポイントは、より詳しく調査するに値する。顧客は一式のテストを再実行し、別の信頼できるデプロイメントと比較し、品質やレイテンシーの変化を検証できる。

この手法は、ほかの証拠と組み合わせることで、より強力になる可能性がある。トークン使用量、レイテンシー分布、ベンチマークタスク、プロバイダーのメタデータ、契約上のデプロイメント記録は、フィンガープリント結果を裏づけたり、疑問を投げかけたりできる。

Brucknerによるエコシステムの調査結果は、このような多層的アプローチが重要である理由を示している。異なるプロバイダーを通じて同じ名称のモデルを提供する34組のうち、10組が研究で規定されたなりすまし境界を超えて乖離していた。

最も極端な組み合わせは、CloudflareとParasailを通じて提供されたLlama 3.2 3B Instructだった。プロバイダー間距離は0.716に達し、この組み合わせはなりすまし領域の奥深くに位置した。

GPT-4でさえ、AzureとOpenAIのファーストパーティデプロイメントでは異なり、報告された距離は0.392だった。異なる配信スタックは、いずれかのプロバイダーが意図的にモデルをすり替えたことを証明しなくても、大きな差異を生み出し得る。

比較可能なすべての組み合わせにおいて、プロバイダー間距離の中央値は0.227だった。これは単一デプロイメントのノイズフロアを上回ったが、なりすまし距離の中央値である0.463を下回った。

言い換えれば、通常、プロバイダーの選択によるフィンガープリントの変化は、モデルを変更した場合よりも小さかった。しかし、例外は自動的な措置を複雑にするほど大きかった。

論文では、特に目を引く異常も特定された。WriterのPalmyra X5エンドポイントは、Qwen3 235B A22B 2507からわずか0.141しか離れていないフィンガープリントを生成した。

この距離は、同じモデルの真正サンプル間で確認された中央値と一致した。論文は、測定上、この2つの配信分布を統計的に区別できないと説明している。

これは、Writerが意図的にモデルを偽って表示した証拠ではない。類似した学習上の系譜、許諾された技術の使用、事後学習の選択、または文書化されていない配信構成が、関連する挙動を生み出した可能性がある。

著者は、このような調査結果を不正の告発ではなく、統計的な偏差として明確に位置づけている。影響を受ける組織が結果に異議を申し立てたり、説明したりできるよう、生データと配信メタデータも公開された。

あらゆる運用上の利用において、この慎重さが指針となるべきである。LLMの行動フィンガープリンティングは、調査すべき理由を特定できる。しかし、それ単独で意図、契約違反、またはサーバー上で実行されている正確な重みを確定することはできない。

モデル更新と適応的なプロバイダーは依然として大きな制約

行動フィンガープリントは変動する統計的基準であり、恒久的なシリアル番号ではない。

モデルは変化する。ベンダーは安全性レイヤー、システムプロンプト、トークナイザー、推論設定、ルーティングポリシーを更新する。正当な更新であっても、回答分布が古いベースラインから離れる可能性がある。

したがって、参照登録は更新しなければならない。論文は短期的な安定性を測定しているが、数か月にわたってフィンガープリントがどのように変化するかは明らかにしていない。

監査者には、申告されたモデルの信頼できるデプロイメントも必要である。その参照がなければ、エンドポイントを公開データベースと比較することはできても、構成が同等であるとは保証できない。

この制約は、クローズドモデルでは特に重要になる。顧客は重みを検査できず、ファミリー名はベンダーの文書に依存する。

必須の推論処理も、別の空白を生み出す。一部の現行モデルは、要求された単語を返す前に、非表示または表示された推論プロセスを実行する。

研究では、その推論を無効にできないエンドポイントを除外した。その最終回答は、この手法で定義される直接的な単一トークンサンプルとは異なる生成プロセスから得られるためである。

推論を無効にする要求を無視したエンドポイントもあった。この実験では、14のモデル・プロバイダーの組み合わせにわたる該当応答2,486件を除外した。これは全数調査の0.76パーセントに相当する。

ほかの主力エンドポイントでは、表示されるのが1単語だけであるにもかかわらず、完了トークンを40~60消費したと報告されている。非表示の計算が行われたため、表示された回答が直接サンプリングを表すことを確認できなかった。

プロバイダーが公開済みの監査プロンプトを認識する可能性もある。通常のトラフィックには別のシステムを代用しながら、それらのリクエストだけを真正なモデルにルーティングするかもしれない。

論文は、言い換え、複数言語、一般的な意味タスクによってこの問題に対処している。監査者は「ランダムな色を1つ挙げて」をさまざまに変化させ、プローブを実際のトラフィックに混ぜることができる。

ただし、この研究は、言い換えに対する不変性を検証する専用実験を今後の課題として残している。参照フィンガープリントとの比較可能性が失われるまで、プロンプトをどの程度変更できるかは、まだ示されていない。

高度なプロバイダーは、正確な文言ではなく、プローブでありそうなカテゴリーを学習する可能性がある。ランダムな数字、色、都市、コイントスを一群として特別扱いできるかもしれない。

テスト一式を拡張すれば、そのプロバイダーの負担は増える。しかし同時に、新しい参照データと、より慎重な調整も必要になる。

配信レイヤーの応答キャッシュによって、見かけ上の別のフィンガープリントが生じる可能性もある。同じ保存済み回答を再生すると、出力分布が人為的に収束してしまう。

研究では、応答レベルのキャッシュの証拠を探すため、レイテンシーと使用量のメタデータを確認した。一部のトラフィックではプロンプト接頭辞のキャッシュが見られたものの、全数調査を通じて説得力のある兆候は確認されなかった。

大規模な事後学習によって、ファミリーの手がかりが消える可能性もある。NvidiaのLlama 3.3 Nemotron派生モデルは、テスト対象のどのLlamaチェックポイントよりもQwenモデルに近かった。

この結果は、特定モデルの検証を無効にするものではない。ただし、大規模な追加学習後には、行動上の系譜と文書化された系譜が乖離し得ることを示している。

この研究が対象とするアグリゲーターも1つだけである。プロトコル自体はOpenRouterに依存しないが、そのエコシステムに関する調査結果が、ほかのマーケットプレイスや直接販売業者にも当てはまるとは限らない。

最後に、この論文は依然として2026年7月のarXivプレプリントである。公開された成果物によって再現は可能だが、独立したチームが、時間、ベンダー、変化するモデル世代をまたいでプロトコルを検証する必要がある。

これらの制約によって、この技術が役に立たなくなるわけではない。監視装置と暗号学的保証の違いを明確にしているのである。

ハードウェアに裏づけられたアテステーションは、デプロイされたコードと重みについて、より強力な証拠を提供できる。別の代替分析では、通常の出力チェックが非決定性や適応的な挙動に対して依然として脆弱であることから、このようなインフラストラクチャーの必要性を主張している。

行動チェックは別のレイヤーを担う。より強力なアテステーションにはプロバイダーやインフラ運用者の協力が必要だが、行動チェックは一般的なAPIに対して直ちに導入できる。

最も信頼性の高い将来のシステムは、両方を組み合わせる可能性が高い。アテステーションは承認済みのデプロイメントを検証し、行動監視は実際の応答におけるドリフト、ルーティングミス、説明のつかない変化を検出できる。

API顧客が次に注目すべきこと

この研究が有用な監査標準になるか、興味深い実験結果にとどまるかは、3つのシグナルによって決まる。

第1のシグナルは、独立した再現である。ほかの研究者が、信頼できるファーストパーティモデルを登録し、別のプロバイダーを監査して、報告された誤差曲線を再現する必要がある。

再現研究には、OpenRouter以外のエンドポイントも含めるべきである。また、ベンダーの更新や変化する推論インフラをまたいで、数か月にわたりフィンガープリントを測定すべきだ。

同じモデルが代替モデルよりも一貫して自身に近い状態を保てば、日常的な導入への信頼が高まる。頻繁に説明のつかないドリフトが発生すれば、この手法の運用上の価値は弱まるだろう。

第2のシグナルは、プロバイダーの対応である。アグリゲーターや再販業者は、デプロイメント識別子、量子化の詳細、上流ルーティング記録、バージョン変更通知を公開できる。

顧客が確認できるアテステーションや参照フィンガープリントを提供することもできる。このような情報開示は、承認済みの配信上の差異と、無断のすり替えを区別するのに役立つ。

透明性が欠如すれば、第三者による測定がより重要になる。反対に、明確なルーティング記録があれば、多くの異常を統計的推論なしに解決できる。

第3のシグナルは、適応的な回避への耐性である。将来のテストでは、比較可能な分布を維持しながら、タスクの文言、言語、タイミング、プローブカテゴリーをランダム化すべきである。

研究者は、登録時に一度も見ていない言い換えに対して、モデルが認識可能なフィンガープリントを維持するかを測定すべきだ。また、監査の検出を積極的に試みるプロバイダーもテストする必要がある。

成功すれば、論文の中心的な主張は強化される。失敗すれば、公開された行動チェックは、主に不用意なすり替えに対してのみ機能することが示される。

チームは、自社の監視を改善するために正式な標準を待つ必要はない。モデルのバージョンメタデータを保持し、代表的な出力を保存し、説明のつかない挙動変化が発生した後に評価を再実行できる。

知識集約型のワークフローでは、特にその履歴が必要になる。モデルドリフトは、明白な障害を引き起こすことなく、要約、プロジェクトの推奨、研究の統合、過去の意思決定の検索を変化させる可能性がある。

構造化されたAIナレッジベースは、モデル支援による重要な業務に関連するプロンプト、ソース文書、出力、レビューメモを保存できる。その記録は、エンドポイントの変更が実際の意思決定に影響したかどうかをチームが調査する際に役立つ。

中心的な教訓は単純だが、話題性の高い表現が示唆するほど広範ではない。ランダムな数字1つだけでは、AIモデルのIDは明らかにならない。小さな回答の分布を反復して調べれば、APIが申告された参照とは異なる挙動を示す際に、有用で低コストな警告を得られる。

開発者や企業の購入担当者が次に行うべきことは、42という数字を見てプロバイダーを非難することではない。信頼できるベースラインを確立し、定期的な監査を実施し、複数の証拠を用いて持続的な偏差を調査することである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page