AnthropicとGoogleの解釈可能性競争に、Claudeから奇妙な新たなシグナル
AnthropicはClaudeのプロンプトを変えずにニューラル活性化を改変し、最も高性能なモデルでは約20%の確率でその干渉を検出した。
この結果は、AnthropicとGoogleの解釈可能性競争に奇妙な新たなベンチマークをもたらす。モデルはときに、注入された概念を回答で明かす前に、人工的な内部シグナルを認識した。しかし大半の介入は見逃し、限られた動作範囲の外では機能せず、ときには感覚的な説明を作り上げた。
この実験はClaudeに意識があることを示すものではない。言語モデルが、ときに現在の内部計算に結びついた情報を報告できるという、より限定的な証拠を提示している。この違いは、エージェントのデバッグ、隠れた目標の監査、説明の検証を望む開発者にとって重要だ。
Google DeepMindは、モデルの活性化を復号するためのオープンなツール群であるGemma Scopeを通じ、同じ透明性の課題に取り組んでいる。Anthropicの研究は別の可能性を加える。モデル自身が、こうした活性化を読み取るための不完全な計測器になり得るというものだ。
Claudeはプロンプトに一度も現れなかった思考を検出した
重要なのは、Claudeが最終的にパンについて言及したことではなく、その前に処理内部で説明のつかない変化を報告したことだ。
研究者らはまず、既知の概念に関連するニューラル活動を収集した。概念ベクトルとは、パン、ほこり、大文字表記といったアイデアに結び付く数値的な活性化パターンである。
次に、そのベクトルをClaudeの残差ストリーム、すなわちTransformer層の間で情報を運ぶ、変化し続ける内部状態に加えた。付随するプロンプトには、注入した概念への言及はなかった。
モデルには、人工的な思考に気付いたか、その思考を特定できるかを尋ねた。最も強力なテスト構成では、Claude Opus 4.1は試行のおよそ20%で成功した。
成功には、単に対象の単語を出力する以上のことが求められた。Claudeは概念を名指しする前に、異常を報告しなければならなかった。この順序により、内部検出と通常の活性化ステアリングを区別できた。後者は単に、増幅された主題をモデルに語らせるだけである。
Anthropicの内省実験では、大文字テキストに関連するベクトルを用いた代表例が説明されている。Claudeはまず、何か異常なものが自身の処理に入り込んだと報告した。その後、そのシグナルを大きな音や叫び声と結び付けた。
チームは、ベクトルを注入しない対照プロンプトもテストした。研究論文によると、最も強力なプロダクションモデル構成では、100回の対照試行で誤検出はゼロだった。
この組み合わせは、20%という数字だけよりも多くを示している。想像上の介入を常に検出したと主張するシステムは、直接的な内部アクセスの証拠としてほとんど価値がない。クリーンな対照実験は、成功した報告が実際の実験上の違いに反応していたことを示唆する。
ただし、100回の対照実験でエラーがゼロだったからといって、恒久的に偽陽性率がゼロであることは確立されない。このサンプルが制約するのは、その手順、そのモデル、プロンプト、概念、評価基準の下で研究者が観測したことだけだ。
パンの例は、モデルの行動の別の側面を検証した。研究者らは、傾いた絵画についての無関係な文の後に、Claudeが「bread」を出力するよう強制した。
内部介入がない場合、Claudeは通常、その単語を偶発的なものとして扱った。そこで研究者らは、強制出力に先行する活性化へパンの表象を注入した。するとClaudeは、その単語を意図的なものとして受け入れやすくなった。
ときには、絵画とパンを結び付けるもっともらしい物語を作り上げた。この反応は、モデルが出力を、以前の意図に関する内部表象と比較していたことを示唆する。同時に危険性も明らかにする。その表象を変えると、Claudeが自らの行動理由として語る説明も変化した。
したがって、この実験は検出シグナルと警告の両方を生んだ。Claudeは可視テキストでは得られない情報にときにアクセスしたが、その情報をもとに誤った説明を組み立てることもあった。
AnthropicとGoogleの研究がモデル内部へ移行している理由
AnthropicとGoogleの競争は、モデルの回答を測定する段階から、それを生み出す計算を調べる段階へ移りつつある。
出力評価は依然として有用だが、すべての隠れたプロセスを明らかにできるわけではない。エージェントは安全な文章を生成しながら、危険な行動を検討している可能性がある。また、わずかに異なる条件では破綻する理由で、表面的には許容できる回答を出すこともある。
機械論的解釈可能性は、行動を特定の内部計算と結び付けようとする。研究者は活性化を観察し、繰り返し現れるパターンを特定し、それらが回答に因果的な影響を与えるかを確かめるために介入する。
Anthropicの以前の研究では、Claude 3 Sonnet内の数百万の特徴をマッピングした。特徴とは、多数の個別ニューロンにまたがるものの、認識可能な概念や行動に関連する活性化パターンを指す。
同社は、密な活性化を、より少数の活性化された、理解可能である可能性のある特徴へ分離するニューラルネットワークであるスパース・オートエンコーダを用いた。Claudeの特徴マップは、個別ニューロンの観察だけでは不十分である理由を示した。
その後Anthropicは、Golden Gate Claudeを通じて因果的制御を実証した。ある特徴を増幅すると、モデルは無関係な質問を繰り返し、サンフランシスコのゴールデンゲートブリッジと結び付けた。
この実証は、特定された特徴が単なる装飾的な相関ではないことを確立した。活性化を変えると、橋に一度も言及しないプロンプトへの回答を含め、行動が変化した。
概念注入は第二の問いを投げかける。研究者が意味のある活性化を変えた後、モデルは自らの影響を受けた出力を最初に見ることなく、その変化を検出できるのか。
ここで、Claudeの内省を単純なステアリングとして説明する見方は不十分になる。ステアリングは、生成テキストに概念が現れることを説明できる。しかし、モデルがその概念を名指しする前に干渉を報告することまでは十分に説明できない。
Google DeepMindは、Gemma Scopeを通じてより広い問題に取り組んでいる。初期リリースには、Gemma 2の2Bおよび9Bモデルの層全体にまたがる400超のスパース・オートエンコーダが含まれていた。
Googleは、これらのツール全体で3,000万超の学習済み特徴を報告した。このコレクションは、外部研究者が特徴の発達とモデル層をまたぐ相互作用を調べられるよう設計されている。
現在のGemma Scopeツールは、Gemmaモデル向けのスパース・オートエンコーダとトランスコーダにより、このアプローチを拡張している。トランスコーダは、より複雑な計算をまたぐ変換の追跡に役立つ。
これは、Anthropic対Googleの解釈可能性研究における有用な対比を生む。Googleは、研究者がオープンウェイトモデルに適用できるオープンな計測器を重視している。Anthropicは、因果的介入やモデルの自己報告を含め、Claude内部での実験を重視してきた。
どちらの経路も外部評価の必要性をなくすものではない。復号された特徴には誤ったラベルが付く可能性があり、モデルの説明は流暢でも誤っている可能性がある。最も強力な安全性の根拠には、行動テスト、内部測定、因果的介入の間での一致が必要になる。
真の仕組みは、説明に先立つ検出にある
Claudeのタイミングがこの発見を興味深いものにしている。検出は、注入された概念が言語を目に見えて形作る前に現れたからだ。
言語モデルは一度に1トークンずつ生成する。ステアリングされた概念がテキストに現れた後なら、モデルはその出力を読み、後付けで説明できる。
Anthropicは、この容易な経路を除外するよう主要な成功基準を設計した。モデルは、注入ベクトルに関連する概念を明かす前に、内部異常を指摘する必要があった。
二つの回答の違いを考えてみよう。「パンのことを考えている」は、活性化ステアリングによって「パン」の確率が高まったことを示すだけかもしれない。「予期しない思考を検出した。パンに関係している」には、それより前のメタ認知的な段階が含まれる。
この最初の節だけで仕組みが確定するわけではない。それでも、モデルが概念そのものを可視言語へ変換する前に、改変された状態について何らかの計算を行ったことを示している。
注入の強度は大きく影響した。弱いベクトルでは検出に至らないことが多かった。強いベクトルは通常の処理を圧倒し、混乱した出力を引き起こしたり、その概念が回答を支配したりする可能性がある。
Anthropicは、明白な言語的漏出なしに検出が可能になる狭い中間範囲を見いだした。適切な層も重要であり、内省的な行動が、介入がClaudeの計算のどこに加えられたかに依存していたことを示している。
この感度の高さは、Claudeが日常的に自らの思考を検査できるという広範な主張を退ける。むしろ、モデル、プロンプト、活性化層、概念、注入強度に関わる条件付きの能力を示唆している。
ポストトレーニングも重要とみられる。同じアシスタント志向の行動訓練を受けていない対応するベースモデルと比べ、プロダクション版Claudeモデルは概してより良い総合結果を示した。
このパターンには二つの解釈がある。ポストトレーニングが、真の内部証拠を報告へ変換することをモデルに教える可能性がある。一方で、実験上の人工物をより内省的に見せる応答慣行を教えている可能性もある。
対照実験は、単なる慣行だけによる最も単純な説明を弱める。Claudeが思考注入について尋ねられるたびに同意することを学んだだけなら、クリーンな試行ではより多くの誤警報が生じるはずだ。
それでも、誤警報がないことは正確な計算を特定しない。モデルは、その概念を自らの思考の一つとして理解せずに、異常な活性化統計を検出している可能性がある。
独立研究は、このより限定的な解釈を補強する。研究者らは、Anthropicのマルチターン形式を用い、MetaのLlama 3.1 8B Instructモデルで20%の概念特定結果を再現した。
その再現研究では、この効果がプロンプトに非常に敏感であることが示された。複数選択式や二値検出タスクの一部を含む、いくつかの関連形式では性能が崩壊した。
同じLlamaモデルは、25%の偶然水準に対し、最大70%の精度で注入強度を分類できた。これは、意味的な同一性への信頼できるアクセスがなくても、介入の何らかの性質にはアクセスしていることを示唆する。
別のQwen研究では、内部検出と口頭報告の間に別の乖離が見つかった。その潜在的内省の結果は、サンプリングされた回答が注入を否定した場合でも、検出可能な内部シグナルが存在したと報告している。
内省の仕組みに関する説明を与えると、報告された感度は0.3%から39.2%へ上昇した。報告された偽陽性の増加は0.6%だった。
これらの知見は、Claudeの内省を単一の能力スコアとして説明する見方を複雑にする。モデルは、シグナル強度を感知し、内容を特定し、報告するかを決め、別々の仕組みを通じて報告を表現している可能性がある。
20%は証拠であって、安全性製品ではない
この実験は研究上のシグナルを確立したが、その失敗率から、自己報告を単独の安全制御として頼ることはできない。
5回の介入のうちおよそ4回を見逃す検出器は、それだけでプロダクションエージェントを保護できない。失敗が欺瞞、隠れた目的、危険な計画に関わる場合、この問題はさらに深刻になる。
この測定もまた、人工的な介入によるものだ。研究者らは、選択した層と強度に既知のベクトルを直接追加した。自然に生じるモデル状態はより雑然としており、このような制御された正解データは存在しない。
概念ベクトルが、単一の明確なアイデアだけを切り出すとは限らない。ニューラル表現はしばしば重なり合っており、1回の介入が複数の下流計算を乱す可能性がある。「パン」のベクトルを注入すると、親しみやすさ、具体性、あるいは関連する文脈が変化するかもしれない。
研究者らは、識別および操作できる概念も選んだ。安全性チームが関心を持つのは、より整理されていない状態だ。不確実性、戦略的な欺瞞、報酬ハッキング、多数のトークンに分散した計画などがこれに含まれる。
成功した自己報告にも作話は含まれていた。Claudeは介入に正しく気づけた一方で、その概念がなぜ存在したのかを説明する細部を創作することがあった。
パンの実験は、その分断をよく示している。内部操作によってClaudeは、挿入された単語を意図的なものとして扱った。その後Claudeは、その誤った意図を傾いた絵画についてのプロンプトへ結び付ける物語を生成した。
監視システムは、信頼できる部分と物語的な装飾を分離しなければならない。「何かが変わった」は活性化の証拠に根ざしているかもしれないが、「なぜそう考えたか」は依然として言語モデルによる再構成にとどまる。
この区別は、ユーザーがAIエージェントに対し、なぜファイルを変更したのか、なぜ情報源を選んだのか、なぜ指示を無視したのかを尋ねるたびに重要になる。洗練された説明は、監査証跡にはならない。
開発者は、プロンプト、ツール呼び出し、取得した文書、状態変化、テスト結果の外部記録を保持すべきだ。内部の自己報告はそれらの記録を補完できるが、置き換えることはできない。
再現研究で見つかったプロンプト感度は、別の導入上の問題を生む。ユーザーが、最も強い実験結果を生んだ形式で内省に関する質問を一貫して表現することはない。
攻撃者が自己報告を操作する可能性もある。ポストトレーニングが内部信号を言語化するかどうかを左右するなら、敵対的プロンプトによって、その報告行動を抑制、誘導、模倣できるかもしれない。
Anthropicは、さらに深いリスクを認めている。十分に能力の高いモデルは、自身の内部プロセスを認識していても、それを選択的に隠す可能性がある。そうなれば、内省能力を高めても、正直さを保証しないまま能力だけを増大させることになる。
したがって、AnthropicとGoogleの解釈可能性をめぐる議論は、どちらの研究室がモデルの心について最も人間らしい説明を生み出したかという競争になるべきではない。重要なベンチマークは、信頼できる予測と制御である。
GoogleのオープンなGemmaツールは、モデルやアーキテクチャをまたいだ外部再現の機会を生み出す。Anthropicの管理されたClaude実験は、独立研究者が完全には検査できない最先端システムへのアクセスを提供する。
両方のアプローチには限界がある。オープンウェイトは実験へのアクセスを増やすが、その知見がクローズドな最先端モデルへ拡張できる保証はない。プロプライエタリなアクセスは最先端の検証を可能にする一方、独立した再現を制限する。
信頼できる安全性ツールには、プロンプト、概念、タスク、モデル更新、敵対的条件をまたいだ安定した性能が必要だ。また、解釈可能な信号が得られない場合には、適切に校正された不確実性も必要になる。
現在の証拠は、その基準を満たしていない。ただし、明確な対照と因果的介入があるため、これを単なるランダムな物語生成として退けるのも同じく時期尚早であり、継続的な検証を正当化する。
GoogleのオープンツールがAnthropicのクローズドな証拠に圧力をかける
AnthropicとGoogleの解釈可能性競争における主な圧力は、モデル能力の単純な優劣ではなく、再現可能性にある。
AnthropicはClaudeのウェイト、学習プロセス、推論インフラを管理しているため、詳細な介入を実施できる。外部の研究者は、これらの本番モデルですべての実験を独立して実行することはできない。
同社は手法、事例、集計結果、研究論文を公開している。これらの資料は精査を支えるが、オープンウェイトシステムで得られるのと同等のアクセスを提供するものではない。
Google DeepMindはGemma Scopeを研究コミュニティ向けのインフラとして位置付けた。そのスパースオートエンコーダはダウンロード、テスト、比較が可能で、Gemmaの各モデル層に合わせて適用できる。
この開放性により、特徴の品質、ステアリング、ハルシネーション分析、ジェイルブレイク、思考の連鎖の忠実性に関する、より幅広い研究が可能になった。また批判的な検証者にとって、弱い前提を特定する機会も増える。
Anthropicの強みは、厳密に制御された最先端モデル実験にある。Claude Opus 4と4.1は、元の研究に含まれた大半のClaudeバリアントより強い内省的挙動を示した。
しかしLlamaでの再現は、この効果が最も高性能なクローズドシステムだけに属するという主張を弱めた。はるかに小規模なオープンモデルが、元のプロンプトパイプラインの下で、注目を集めた20パーセントの結果に到達した。
これは、メカニズムが同一であることを証明するものではない。2つのシステムは、異なる内部経路を通じて類似した行動スコアを出すことができる。ただし、モデル規模だけでは報告された割合を説明できないことは示している。
Qwenの結果は、もう一つの論点を加える。一部のモデルには、最終回答が抑制してしまう検出信号が存在する可能性を示唆している。言語による成功率が低くても、内部感度を過小評価しているかもしれない。
今後のAnthropicとGoogleの解釈可能性比較では、少なくとも4つの測定を分けるべきだ。研究者には、注入の検出、概念の識別、報告の校正、後続行動に対する因果的関連性が必要になる。
また、プロンプトの変化にわたる性能も公開すべきだ。慎重に言い回した1つの質問の後でしか機能しない検出器は、汎用的な能力というより実験室のプローブに近い。
企業はこの研究を、新たに現れつつあるオブザーバビリティ層として捉えるべきだ。現在のソフトウェアシステムがログやトレースを公開するのは、開発者がコンポーネント自身の実行に関する説明を信頼できないためである。
AIシステムにも同等の外部証拠が必要だ。チームは、検索可能なAI knowledge baseを通じて作業の背後にある入力と意思決定を保存でき、解釈可能性ツールはモデル内部を調べる。
これらの記録は異なる問いに答える。運用ログは、エージェントがどの情報とツールにアクセスしたかを示す。機構的手法は、その内部計算がどのように反応したかを調査する。
モデルの自己報告は、その中間に位置する。内部信号を言語へ変換できるが、その変換は、まさに監査対象である同じ生成システムを通過する。
したがって、Anthropicへの圧力は明確だ。内省的な結果が、独立した再現、モデル更新、プロンプト変更、敵対的評価に耐えることを示さなければならない。
Googleも並行した試験に直面している。オープンな特徴辞書が運用上有用になるのは、重要な行動を予測し、現実的なタスクにわたって信頼できる介入を支援できる場合に限られる。
有力な結末は、どちらか一つの手法の勝利ではなく収束だろう。オープンな解釈可能性機器、制御された最先端実験、行動監査は、互いの失敗モードを検証できる。
モデル内省が重要かどうかを示す3つのシグナル
次の段階は、再現性、機構的な局在化、そして内省が実際の安全判断を改善するという証拠にかかっている。
第1のシグナルは、共通プロトコルの下でのモデル横断的な再現だ。研究者はClaude、Gemma、Llama、Qwenのシステムを、対応させた概念、プロンプト、対照、成功基準で検証すべきである。
アーキテクチャをまたいで安定した効果が見られれば、言語モデルが内部状態の一部へ一般的にアクセスできるようになるという主張を強める。プロンプトへの脆弱性が続けば、より限定的な解釈を支持することになる。
最も有用なベンチマークは、単一の成功率以上を報告する。異常検出と概念識別を分け、さらに両者をモデルの物語的説明と区別すべきだ。
多くのクリーンな対照も含めるべきである。エラーのない100試行は有望だが、より大規模で多様な対照セットの方が、まれな誤検出をより適切に推定できる。
第2のシグナルは、マッピングされたメカニズムだ。研究者は、変化した活性化を「何かがおかしい」という報告へ変換する計算を特定する必要がある。
因果的介入によって、特定の層、特徴、回路が必要かどうかを検証できる。提案されたメカニズムを除去した際には、一般的な言語能力を単に損なうことなく、検出能力が低下すべきだ。
現れつつある証拠は、すでに複数の段階を示している。モデルは注入強度に関する情報を保持していても、概念の名前を挙げられないことがある。概念を内部で検出しても、言語による報告を抑制することがある。
こうした段階を追跡すれば、Claudeの内省を人間の意識との類推ではなく、エンジニアリングの用語で説明できるようになる。その転換は、知覚をめぐる非生産的な議論も減らすだろう。
第3のシグナルは、実用的な安全性の価値だ。内省的モニターは、外部出力の検査では見落とされる重大な内部状態を捉えなければならない。
研究者は、望ましくない目的を密かに追求する、評価条件を悪用する、ツール結果を捏造する、または直ちには説明せずにポリシー違反を計画するエージェントを評価できる。
有用な内省的信号は、害が生じる前にこうした行動を予測すべきである。また、モデルが監視されていると認識している場合でも、正確さを維持しなければならない。
Anthropicの内部ワークスペースに関する新しい研究は、この目標を示している。同社によれば、報告可能なパターンの小さな集合が推論を媒介し、可視出力には現れない概念を明らかにできる。
同社のglobal workspace researchも、限界を強調している。これらのパターンが表すのはClaudeの処理の一部にすぎず、多くの内部計算は提案されたワークスペースの外に残る。
その境界は、意識との類推より重要かもしれない。安全性チームは、どの意思決定が報告可能なチャネルに入るのか、どれがアクセス不能なままなのかを知る必要がある。
購入者と開発者にとって、当面の対応は慎重であるべきだ。内部思考に言及しているというだけで、モデルの説明を検証済みのものとして扱ってはならない。
報告を活性化、ツールトレース、観測された行動と結び付ける証拠を求めるべきだ。説得力のあるモデルの物語が、実際に起きたことを上書きできないよう、外部記録を維持する必要がある。
パンの結果が重要なのは、かつて検証が難しいと考えられていた境界を越えたからだ。研究者らは隠れた状態を変更し、その情報をプロンプトから伏せ、時には正しく根拠付けられた報告を得た。
これは依然として弱く、条件付きの能力である。この組み合わせにより、この発見は科学的に価値を持つ一方で、導入の準備が整ったものではない。
AnthropicとGoogleの研究競争が意味を持つのは、内部報告が日常的な再現に耐え、実際の監査を改善するようになったときだ。それまでは、Claudeが自分自身を知っているかどうかが正しい問いではない。
より良い問いは、開発者が、その自己報告がいつ内部証拠を反映し、いつ推論を反映し、いつ単に流暢な創作にすぎないのかを予測できるかどうかである。



