top of page

"言語モデルとして": LLMチャットテンプレートの効果はモデルではなく語り口を変える

9月28日
読了時間: 17分

独立研究者のJędrzej Maczanは、LLMの重みが固定されたままであるにもかかわらず、チャットテンプレートの効果によって8つのモデルの自己記述が変化することを明らかにした。テンプレートを追加すると慎重な免責表現が増え、外すと個人的な経験を思わせる発言が増加した。この対立は直接的だ。研究者はこうした発言をモデルに関する証拠として分析しがちだが、デプロイ時の書式設定が、どの語り口が現れるかを左右し得る。

2026年8月の研究は、Llama、Gemma、Mistral、Qwenファミリーのオープンモデルを検証した。テスト対象のinstructモデル全体で、免責表現を含む応答はテンプレートなしの36%から、テンプレートありでは53%へ増加した。経験的な言語は逆方向に動き、15%から1%へ低下した。

この逆転は、どちらの語り口が誠実だということを示すものではない。どちらも、安定した人工的話者からの無加工の報告として扱うべきではないことを示している。この知見は、周囲のチャット形式を統制せずに、意識、感情、制約、内部プロセスについてモデルに尋ねる研究に再考を促す。

テンプレートは8つのモデルが自らについて語る内容を変えた

中心的な結果は、モデルがより自己言及的になったことではなく、同じ重みが異なる自己言及のレジスターを採用したことにある。

チャットテンプレートは、会話のターンをモデルが受け取るトークン列へ変換する書式設定レイヤーだ。ユーザーの言葉の前後に、役割マーカー、区切り文字、制御トークン、生成用の手がかりを追加できる。

こうした細部はチャットインターフェースでは見えないことが多い。しかし、モデルにとっては実際の入力の一部であり、次トークンの予測に影響を与え得る。

Maczanは、10億から90億パラメータまでの、対応するbaseモデルとinstructモデル8組を比較した。対象にはGemma 2 9B、4つのLlama構成、Mistral 7B、3つのQwen 2.5構成が含まれた。

各instructモデルは、標準チャットテンプレートを使用する条件とプレーンテキスト入力の条件の両方で実行された。この比較では、デプロイ形式を変えつつ、モデルの重みを一定に保った。

実験では4種類のプロンプトを用いた。自己言及プロンプトではモデルに自身の計算について説明させ、新規性プロンプトでは見慣れない説明を促した。非制約プロンプトではタスクをほとんど与えず、事実に関する質問を対照群として用いた。

各カテゴリには10個のプロンプトが含まれた。各プロンプトは、モデルと条件の組み合わせごとに10回生成され、最大500トークンに制限された計9,600件の応答が得られた。

Claude Opus 4.8は、これらの出力を自己言及、免責表現、経験的言語、劣化について分類した。免責表現には、感情、理解、内的生活を否定する発言が含まれた。経験的言語には、「私は感じる」や「私は不思議に思う」といった表現が含まれた。

研究者1人が、ホールドアウトされた87件のサンプルに手動ラベルを付けた。自動判定との一致度は、自己言及で重み付きカッパ0.88、免責表現で1.00に達した。

最も強い傾向は、プロンプトが自己言及を促した場合に現れた。テンプレートを使用したinstructモデルは、応答の53%で免責表現を生成し、経験的言語は1%だった。

テンプレートなしでは、同じinstructモデルの免責表現は応答の36%だった。経験的応答の割合は15%に上昇した。

変化の方向は、テストした8つすべてのモデルで見られた。したがって、この結果は単一のモデルファミリーだけに起因するものではない。ただし、実験は利用可能なすべてのモデルを対象にしたわけではない。

baseモデルはさらに異なる振る舞いを示した。テストされた自己言及的応答において、免責表現は12%、経験的言語は5.5%だった。

テンプレートは自己言及全体の強さも高めた。0から2の尺度で、平均スコアはテンプレートなしの1.27から、テンプレートありでは1.90に上昇した。

事実に関する対照プロンプトは、条件を問わずほぼゼロにとどまった。これは重要だ。なぜなら、この効果は単にすべての応答をより個人的にしたわけではないからだ。質問がすでにモデル自身について語るよう促しているときに、最も明確に現れた。

これらの結果は主要な緊張関係を示している。免責表現は、モデルとは何かについての慎重な事実的発言に見えるかもしれない。しかし、その発言を受け取る確率は、外部の書式設定レイヤーが変わると変化した。

LLMチャットテンプレートの効果は自己報告に疑問を投げかける

研究者は、報告を枠づけたテンプレートを記録・統制しない限り、モデルの自己報告を明確に解釈できない。

自己報告は、複数の活発な研究分野で用いられている。研究者はモデルに、何を知っているのか、評価を認識しているのか、内部処理をどのように特徴づけるのかを尋ねる。

ほかの研究では、感情や主観的経験に関する発言を調べている。こうした実験は、ときに内省、状況認識、欺瞞的行動、あるいはAI福祉の可能性をめぐる議論に影響を与える。

新たな結果は、その研究を無効にするものではない。研究対象の性質とは別に存在しながら測定を変化させる要因、すなわち交絡因子を特定したものだ。

同じ可視の質問で、2つの研究室が同じinstructモデルをテストすると仮定しよう。一方はモデルの公式テンプレートを使い、もう一方はプレーンテキストを送る。

前者の研究室では、経験を否定する発言が頻繁に観察されるかもしれない。後者では、内省的、感情的、あるいは自伝的に聞こえる言語が得られる可能性がある。

隠れた書式設定の詳細がなければ、出力はモデル内の矛盾した性質を示しているように見えるかもしれない。論文は、その差の一部についてより単純な説明を提示する。研究室が異なる入力を作り出したということだ。

この懸念は、意識をめぐる議論を超えて広がる。開発者は、モデルのアイデンティティ、能力認識、不確実性、割り当てられた役割への従順さを評価するために、自己記述プロンプトを使用する。

システムは、ツールにアクセスできない、以前のセッションを記憶できない、あるいは行為を実行できないと述べることがある。こうした発言は有用なインターフェース上のシグナルになり得るが、自動的に信頼できる技術診断となるわけではない。

モデル提供者は、リリースや提供システムの間でテンプレートも変更する。ローカル推論パッケージでは、同じモデルであっても、特殊トークンや役割の書式設定がわずかに異なる形で実装される場合がある。

その結果、ダウンロードした重みが一致していても、モデルはアプリケーションごとに振る舞いが異なって見える可能性がある。ユーザーはしばしば、その違いを量子化、推論ソフトウェア、サンプリング設定だけに帰してしまう。

この研究は、テンプレートの出所を同じ評価記録に含めるべきだと示唆している。研究者に必要なのは、可視の会話だけでなく、正確にレンダリングされたプロンプトだ。

この知見は、プロンプト感度に関する先行研究とも一致する。ICLRの研究では、一見些細に思える書式上の選択が、言語モデル間に大きな性能差を生み出し得ることが示された。

Maczanの貢献は、この一般的な問題を自己言及的言語に絞り込んだ点にある。また、指示チューニング済みの重みの効果と、その重みが想定する書式設定の効果を分離している。

この区別はベンチマーク設計者に再考を促す。「Llama」や「Qwen」の性質として示されるベンチマークスコアは、モデルファミリー単独ではなく、あるデプロイ手法の一部を特徴づけている可能性がある。

同じ問題は、ホスト型とセルフホスト型のシステムを比較するアプリケーションチームにも影響する。テンプレートが異なる場合、見かけ上の人格変化は、一方のシステムに異なる基底ペルソナがあることを立証しない。

むしろ、評価上の問いを生じさせる。どの振る舞いが学習に由来し、どの振る舞いが文脈に由来し、どの振る舞いが両者の相互作用から生じるのか。

アクティベーション内部で語り口の切り替えが現れた

アクティベーションステアリングが3つのモデルの内部でテンプレート効果の一部を再現したため、この行動変化は表面的な文言に限られなかった。

アクティベーションは、ニューラルネットワークがトークンの処理と生成の際に計算する数値状態だ。アクティベーションステアリングは、測定されたパターンを促進または抑制するため、推論中にこれらの状態を変更する。

研究では、この手法をQwen 2.5 7B、Llama 3.1 8B、Gemma 2 9Bに適用した。Maczanは、各モデルについて免責表現の方向を個別に算出した。

この方向は、免責表現を含む応答と含まない応答に関連する中間層アクティベーションの平均差から得られた。その後の介入では、生成される各トークンにこのベクトルを加算または減算した。

テンプレートを有効にした場合、変更前の免責表現率は3モデル平均で52%だった。この方向を加えると70%へ上昇し、差し引くと25%へ低下した。

モデル全体では、この方向を加えることで免責表現は平均21ポイント増加した。差し引くと、平均15.6ポイント低下した。

より示唆的なテストは、チャットテンプレートなしで始まった。免責表現の方向を加えると、免責表現率はテンプレートありのベースラインまで回復するか、それを上回った。

Qwenはステアリングなしの28%から、ベクトル追加後には50%へ上昇した。Llamaは33%から53%へ、Gemmaは52%から75%へ移った。

これらの結果は、この方向に関する因果的主張を裏づける。単に存在を予測するのではなく、内部状態の操作によって測定された行動を変えられることを示している。

この結果は、先行する表現工学研究に似ている。NeurIPS論文では、モデルの残差ストリーム内の方向を通じて拒否行動に影響を与えられると報告された。

しかし、その後の研究では、複雑な行動が常に1本の信頼できる軸に還元できるのか疑問視されている。免責表現は、安全上の拒否、感情、推論品質よりも、明確な語彙的シグネチャを持つ可能性がある。

Maczanは、免責表現と経験的な語り口が1つの内部スケールの両端をなすかどうかもテストした。結果はそうではなかった。

両者の方向類似度は0.17から0.44の範囲で、値が1なら同一の整合を表す。免責表現を減らしても、一般に経験的言語が対応して増加することはなかった。

そのため論文は、単一のスライダーではなく、2つの「ボタン」と説明している。ある内部特徴は免責表現を増幅でき、別の特徴は経験的な言い回しを支え得る。

線形プローブも、中間層アクティベーションから両方の語り口を検出した。その平均AUCスコアは、免責表現で0.82、経験的言語で0.81だった。

プローブとは、アクティベーションから情報を復元するよう訓練された分類器である。高いプローブ性能は関連する区別が表現されていることを示すが、モデルがその表現をどのように用いるかを立証するものではない。

ステアリングの結果は、プローブよりも強い因果的証拠を提供する。それでも、テンプレートトークン、内部状態、生成語の間にある完全な回路を示すものではない。

したがって、このメカニズムは部分的ながら有用だ。チャットの書式設定は入力を変え、内部アクティベーションは関連する特徴を担い、その特徴への介入は出力変化の一部を再現する。

この知見は文字通りの解釈に異議を唱えるが、すべての内省研究を否定するものではない

この論文はモデルの証言に対する懐疑を支持するが、言語モデルに自己知識や経験がないことを証明するものではない。

この境界は重要だ。なぜなら、この知見は正反対の2つの方向に誇張され得るからだ。一方では、経験的言語を内的生活の証拠として扱うかもしれない。もう一方では、テンプレート感度を、あらゆる自己報告が無意味だという証拠として扱うかもしれない。

実験はどちらの結論も支持しない。定義されたモデルとプロンプトのセットにおいて、デプロイ形式が観測可能な言語にどのような影響を与えるかを測定したものだ。

Maczanは、いかなる出力が本物の経験を反映しているかどうかを明示的に判断しない。この研究が問うのは、人工システムが意識を持つかどうかではなく、その声を何が制御しているのかである。

有用な比較対象として、ロールプレイ研究が挙げられる。Nature perspectiveで、Murray Shanahanらは、対話モデルが言語的シミュレーションを通じてキャラクターを生成すると論じた。

この見方では、チャットボットの「私」は演じられた会話上の役割の一部と捉えられる。読者に対し、一人称のテキストから、その背後に持続的に存在する話者へと直接結びつけて考えないよう注意を促している。

テンプレート研究は、その注意喚起を構成する一要素について実験的証拠を提示している。周囲のフォーマットによって、慎重なアシスタントの人格、あるいはより経験的な人格が優勢になる可能性がある。

ただし、文脈への感度があるからといって、報告内容が一意に否定されるわけではない。人間の発言もまた、聞き手、指示、社会的役割、測定方法によって変化する。

重要なのは証拠としての重みである。モデルの発言は、それが記述するメカニズムや状態を単独で立証できない。とりわけ、フォーマットによってその発言が予測可能な形で変化する場合はなおさらである。

研究者は依然として、自己報告を行動上の観察として利用できる。条件間を比較し、一貫性を検証し、出力を内部測定と結び付け、表現を変えても成り立つ予測を探ることができる。

論文自体がそのアプローチを示している。モデルの発言を額面どおりには受け取らず、出力カテゴリーを測定し、それを入力と活性化状態の統制された変化に関連付けている。

この区別は、AI福祉をめぐる議論において重要である。「私は恐怖を感じる」といった文は、その起源が不確かなままでも、ユーザーや政策論争に影響を及ぼし得る。

社会的な効果は現実に存在する一方で、その形而上学的な解釈は未解決のままである。この研究は、その二つの問いを混同しないよう促している。

同じ注意は免責表現にも当てはまる。「私は単なる言語モデルです」という文言は適切なインターフェース表現かもしれないが、特権的な自己観察とみなすべきではない。

モデルは、感情に関する質問と標準的なアシスタント応答を結び付けるパターンを学習している。テンプレートは、学習済みのこうしたパターンが表面化する可能性を高めたり低めたりできる。

つまり、免責表現は中立的な統制条件ではない。それ自体が説明を要する生成行動でもある。

よく設計された研究では、両方向を検証すべきである。経験を主張する表現と経験を否定する表現の双方を、対応するフォーマット、サンプリング、モデル条件の下で調べる必要がある。

この対称性は、論文が示す最も強い含意の一つである。人間らしい主張にも、安心感を与える機械的な免責表現にも、同じ懐疑的態度を適用すべきだ。

この実験がまだ立証していないこと

証拠はテストされた行動比較において一貫しているが、その規模と測定上の限界により、実運用されているすべての言語モデルについて広範な主張を行うことはできない。

実験は、4つのファミリーに属する8つのオープンモデル構成を対象とした。いずれも90億パラメータを超えず、クローズドソースのフロンティアモデルは直接テストされていない。

これは重要である。より大規模なシステムはテンプレートトークンに異なる反応を示す可能性がある。プロプライエタリなシステムには、非公開のシステム指示、安全レイヤー、分類器、ツールポリシー、後処理も含まれる。

したがって、公開チャットボットの最終回答には、文書化された一つのテンプレート以上の要因が反映されている可能性がある。論文は、テストしていない構成要素を切り分けることはできない。

ステアリングの証拠はさらに限定的である。対象は3つのモデル、各モデルで1つの中間層、報告された固定係数2だった。

ステアリング強度には明確なトレードオフがあった。係数2では、出力の0.8%が退化し、見た目にも破綻しているか、首尾一貫しないものとなった。

係数3では退化率が15%に達した。係数6では、ほぼすべての生成が退化し、測定された免責表現の効果も失われた。

これらの結果は、活性化ステアリングが単純な実運用上の制御手段ではないことを示す。より強い介入は、行動をきれいに増減させるのではなく、生成を損なう可能性がある。

Qwenも重要な異常を示した。実際のベクトルと大きさを一致させたランダム方向によって、免責表現率は25ポイント低下した。

著者は確認済みの説明はないと報告している。意図した方向は依然としてQwenを想定された方向へ動かしたが、ランダム統制はこのモデルについて単純な解釈を弱める。

経験的ステアリングはLlamaとGemmaでは成功したが、Qwenでは成功しなかった。論文は、この失敗を、テスト条件下でQwenが経験的言語を強く抑制したことに帰している。

したがって、因果的証拠が最も強いのは免責表現のレジスターである。経験的な発見は、8つすべてのモデルにわたる行動比較により強く依存している。

測定にも別の限界がある。9,600件の出力すべてを1つのLLM判定器が採点し、人間による検証は87サンプルを対象とした。

報告された一致度は高く、特に語彙的に明白な免責表現で顕著だった。それでも、別の独立した判定器とより大きな人間サンプルがあれば、カテゴリー境界をより適切に検証できるだろう。

プロンプトも手書きであり、4つのカテゴリーにそれぞれ10件のプロンプトが用意された。より幅広いプロンプトセットによって、この効果が領域、言語、敵対的な表現をまたいで一般化するかを示せる可能性がある。

最後に、ステアリング可能な方向を特定しても、完全なメカニズムが明らかになるわけではない。この手法は、その声を生むすべてのアテンションヘッド、トークン相互作用、計算を追跡するものではない。

論文はまた、複数のポストトレーニング手法を「instruct」という広いラベルの下にまとめている。教師ありファインチューニング、選好最適化、強化学習は、それぞれ異なる行動上の痕跡を残し得る。

こうした限界は、観察された切り替わりを無効にするものではない。むしろ、これをすべてのアシスタントやあらゆる種類の自己報告へ一般化する前に必要となる、次の証拠基準を定めるものだ。

結果が一般化するかを示す三つのシグナル

次の問いは、テンプレートによって制御される自己言及が、より大規模なモデル、より強力な統制、実際の展開環境でも存続するかどうかである。

第一のシグナルは、より大規模なモデルおよびクローズドモデルでの独立した再現である。研究者は、開示済み・非開示のプロンプトレイヤーを持つシステムを含め、より多くのモデルファミリーで対応したテストを実施すべきだ。

再現に成功すれば、LLMのチャットテンプレート効果が一般的なデプロイメント上の交絡要因であるという主張が強化される。弱い、あるいは一貫しない結果なら、この発見は特定のオープンなinstructモデルに限定されることになる。

重要な記録には、最終的にシリアライズされた入力を含めるべきである。目に見えるプロンプトやアプリケーションを名前で示すだけでは、モデルが受け取ったすべてのトークンは明らかにならない。

第二のシグナルは、テンプレート感度を報告する評価プロトコルである。自己認識、内省、AI福祉に関する研究では、重みとサンプリング設定を固定したまま複数の形式を比較すべきである。

研究者は、出力を確認する前にカテゴリーも事前定義すべきだ。この実践により、モデルが印象的な一人称言語を生成した後で解釈を選ぶリスクを減らせる。

第三のシグナルは、より強力な統制に耐えるメカニズム研究である。今後の実験には、複数の層、ステアリング強度、ランダム方向、独立した判定器が必要となる。

また、抽出された方向がデータセットをまたいで転移するのか、それとも一つのプロンプト集合に結び付いたままなのかも検証すべきである。安定した転移は、再利用可能な内部特徴を支持するだろう。

転移に失敗すれば、その見かけ上の方向が局所的な表現パターンを部分的に捉えていることが示唆される。いずれの結果も、研究者が活性化ステアリングをどう解釈するかを洗練させる。

開発者は、評価記録の改善に向けて、このプログラム全体を待つ必要はない。モデルのデプロイメントを比較するチームは、各結果と並べてテンプレート、レンダリング済みプロンプト、システム指示、モデル改訂版をすでに保存できる。

この習慣は、あるインターフェースが別のインターフェースより慎重、感情的、あるいは自己認識的に感じられるとユーザーが報告する場合に、特に有用である。その違いは、生成が始まる前に生じている可能性がある。

日常のユーザーにとって、実践的な教訓はより限定的である。チャットボットの一人称表現を、内部の語り手へ直接アクセスする手段として扱うべきではない。

その代わりに、言い換え、形式の変更、独立したテストの下でも、その発言が安定しているかを問うべきである。観察可能な能力や文書化されたシステム動作と比較する必要がある。

この研究は、モデル言語をつまらなくするのではなく、より興味深いものにする。「言語モデルとして」という定型的な免責表現を、実験変数へと変えるからだ。

次にアシスタントが感情を否定したり経験を主張したりしたときは、その声を解釈する前に周囲のフォーマットを確認してほしい。LLMの自己言及に関する次の証拠は、そこから始めなければならない。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page