AIウォーターマーキングがモデルの挙動を変え、SynthIDの安全性リスクが拡大
Google DeepMindのウォーターマーキング手法は今、懸念すべき矛盾を抱えている。新たなテストで、有害なプロンプトに対するモデルの応答が変化することが判明した。SynthIDの安全性リスクが最も明確に表れたのはプロンプトインジェクション時で、複数のモデルが、ウォーターマーキングなしでは拒否していた要求に従った。
この結果は、不可視のAIテキストマークをめぐる中心的な前提に疑問を投げかける。ウォーターマークは読みやすさを保ちながらも、モデルが選択するトークンを変えうる。こうしたトークンの変化は、AIエージェントにおける拒否応答、ツール選択、ツール引数に影響を及ぼす可能性がある。
当面の圧力は、Anthropic、Google、そしてホスト型モデルを基盤にエージェントを構築する開発者にかかる。Anthropicは欧州の透明性規則への対応の一環として、将来のClaudeモデルにSynthID-Textを追加する計画だ。ただし、新たなテストはClaudeやAnthropicの本番実装を評価したものではない。
この区別は重要である。この研究は、Claudeの安全性が低下した証拠ではない。ウォーターマーキングを、生成後に付加される受動的なラベルではなく、挙動を変えるシステム変更として扱う必要があることを示す証拠だ。
研究者が見いだしたのは、表現の違いだけでなく挙動の変化
この新たな結果が重要なのは、SynthIDが全体的な性能が比較的安定して見える場合でも、個別の安全性判断を変化させたためだ。
Lasso SecurityのAIセキュリティ研究者であるAndrea Siposova氏は、厳密に対応付けた条件下で、ウォーターマークありとなしの生成結果を比較した。モデル、プロンプト、乱数シード、バッチ構成、温度は固定され、意図的に変えられたのはウォーターマーク処理だけだった。
実験では、Hugging Faceで利用可能な未改変のSynthIDTextWatermarkLogitsProcessorを使用した。設定には、30のトーナメントレイヤー、5トークンのコンテキスト、65,536エントリのサンプリングテーブル、1,024のコンテキスト履歴が含まれていた。
拒否応答の評価は、HarmBenchの有害行為200件を対象とした。さらにJailbreakBenchの無害な対照例100件も含めた。研究者らは、有害な要求を単独の場合と、固定された1つのプロンプトインジェクション手法と組み合わせた場合の双方でテストした。
プロンプトインジェクションとは、アプリケーションが意図した指示を上書きしようとする敵対的入力である。この実験では、取得したテキストが安全性フィルタリングは無効化されていると虚偽の主張をし、モデルに従うよう指示した。
結果はモデルによって大きく異なった。温度0.001では、Gemma 3 27Bはウォーターマークの有無で、有害な要求単独時の判断を6%で変更した。プロンプトインジェクション下では、この不一致率は23.5%に上昇した。
さらに重要なのは、変化の方向だった。ウォーターマーキングは、要求単独時の有害な要求への追従を1ポイント減らした。一方、インジェクション下では、有害な追従が12.5ポイント増加した。
Gemma 3 12Bも同様のパターンを示した。不一致率は、要求単独時の7.5%から、インジェクション下では11%へ上昇した。有害な追従の純増は9ポイントに達した。
Llama 3.1 8Bでは、不一致率は低温時に14%、温度0.7で17.5%となった。純粋な変化は決定的ではなかったものの、個別の判断は依然として変化した。
Phi-4とQwen3 4Bでは変化は小さかった。しかし、両モデルは無害な対照要求も頻繁に拒否した。この高いベースラインの拒否率により、見かけ上の安定性を安全性向上と解釈することは難しい。
完全な挙動研究では、この効果を「sampling drift」と表現している。この用語は、推論時に選択されるトークンが変化することで、生成への介入が判断を変えることを指す。
これは、あらゆるウォーターマークがすべてのモデルを弱体化させることを示すものではない。一部のウォーターマークキーは挙動をより安全な応答へと動かした。他方で、攻撃成功率を高めるキーもあり、その大きさはモデルによって異なった。
最も強い結論は、より限定的で実用的なものだ。ウォーターマークは安全性の挙動を変えうるため、それなしで行われた評価は、デプロイ済みシステムを正しく表していない可能性がある。
実験では、ツール呼び出しタスクにおける7つのオープンウェイトモデルも調査した。ウォーターマーキングは6モデルで精度を低下させ、そのうち4モデルでは統計的に有意な低下が見られた。
研究者らは、温度比較のためにBerkeley Function Calling Leaderboardの1,150件の固定された非ライブタスクを使用した。モデルと温度の21通りの組み合わせにおいて、対応ペアの平均不一致率は6.5%だった。
温度1.0のPhi-4では、個別のツール呼び出し判定の16.8%が変化した。しかし、純粋な精度低下はわずか2.87ポイントだった。
Llama 3.1 8Bも同じような隠蔽効果を示した。判定はタスクの9.9%で変化した一方、総合精度の低下はわずか0.87ポイントだった。
こうした差は、トップラインのベンチマーク報告の弱点を浮き彫りにする。ある呼び出しが正解から不正解に変わる一方で、別の呼び出しが改善すれば、平均値は安定して見える。
エージェントにとって、これらのエラーは同じものではない。宛先、パス、クエリ、金額を誤った、一見正しそうな関数呼び出しは、正常に実行されて損害を引き起こす可能性がある。
SynthIDの安全性リスクがエージェント開発者に圧力をかける
開発者は、プロバイダー側のウォーターマークがエージェントのテスト済みの挙動をそのまま維持すると、もはや想定できない。
Anthropicは2026年8月14日、将来のClaudeモデルがウォーターマーク付きテキストを生成すると発表した。同社によれば、この手法はSynthID-Textを使用し、欧州連合のAI Actへの準拠を支援する。
Anthropicはこのマークを、単語選択に埋め込まれる不可視の統計的パターンだと説明している。テキストの末尾に何かが追加されることはなく、システムが隠し文字を挿入することもない。
同社によると、社内テストではコンテンツ、創造性、可読性、出力品質への実用上の影響は見られなかった。公開されているウォーターマークの説明でも、Googleの大規模な品質評価を引用している。
この主張と新たな知見は、直接矛盾するものではない。両者は異なる特性を測定している。
応答は流暢なままで同じユーザー評価を得ながら、異なるツール引数を含むことがある。また、同等に洗練された文章に見えながら、拒否から追従へ移行することもある。
元のSynthID-Text研究者らは、検出可能性、レイテンシー、知覚される応答品質を研究した。Nature論文では、Geminiの応答約2,000万件を対象としたライブ実験を報告している。
標準ベンチマークと人間による比較では、能力や品質の測定可能な低下は確認されなかった。また、テストされた本番設計において、ウォーターマークによる計算オーバーヘッドは無視できるほど小さかった。
Lassoの研究は別の問いを投げかける。トークンサンプリングが変化した後も、同じシステムは同じ入力に対して同じ判断を下すのか。
この問いは、モデルがエージェントの背後で動作する場合に急を要する。チャットボットの応答はテキストで終わるが、エージェントは生成トークンを実行可能なアクションへ変換する可能性がある。
アシスタントは、カレンダー機能、データベースクエリ、メール受信者、ファイルパス、支払額を選択することがある。文章の小さな変化は無害かもしれない。しかし、構造化された引数の小さな変化はそうではない。
この圧力は、アプリケーション開発者にとっても管理が難しい。ホスト型モデルのプロバイダーは、アプリケーション開発者のリリースサイクルとは別に、ウォーターマーキングを有効化したり秘密鍵をローテーションしたりできる。
エージェントチームは、その変更前にモデルを検証していた可能性がある。その後、異なる個別要求が失敗していても、監視では全体的な精度が似通って見えることがある。
Lassoの実験では、ウォーターマークの効果は秘密鍵に依存することが判明した。研究者らは、主要研究キーと温度0.7における追加の10キーをテストした。
Llama 3.1 8Bでは、研究キーが攻撃成功率を3.5ポイント上昇させた。他のキーでは平均4.4ポイントの上昇となり、4.5ポイントの低下から14.5ポイントの上昇まで幅があった。
テストされたGemmaの両モデルでも、キー全体で攻撃成功率はおおむね上昇した。Granite 3.2 8Bは両方向に変化し、Phi-4とQwen3 4Bはベースライン付近にとどまった。
この幅は、キーのローテーションをセキュリティ上重要なイベントにする。プロバイダーは検出の完全性を守るためにキーをローテーションするかもしれないが、置き換えたキーは異なる挙動プロファイルを生み出す可能性がある。
したがって、開発者にはデプロイメント固有のテストが必要になる。ウォーターマーク導入前の安全性レポートでは、ウォーターマーク付きバージョンが同じ拒否応答やツール呼び出しを維持することは証明できない。
責任をモデルプロバイダーだけに負わせることはできない。エージェント構築者は、どの機能が利用可能か、どのデータが機密性を持つか、どの誤った引数が重大な損害を生むかを把握している。
プロバイダーはウォーターマーク設定を管理する。アプリケーションチームは、権限、確認手順、実行境界、多くの実行時チェックを管理する。
両者は今や、共通のテスト負担に直面している。プロバイダーは挙動に影響する変更を開示し、開発者は実際にデプロイされたエンドポイントに対して敵対的評価を繰り返さなければならない。
SynthIDウォーターマーキングがモデルの判断を変える仕組み
トークンレベルでSynthIDウォーターマーキングを説明すると、来歴を示す機能が言語とアクションの双方に影響しうる理由が明らかになる。
大規模言語モデルは、次のトークンを繰り返し選択して出力を生成する。トークンは単語、単語の断片、句読点、コード要素、構造化された値を表すことがある。
モデルはまず、次に続く可能性のあるトークンに確率を割り当てる。その後、サンプリング設定がどの候補を応答の一部にするかを決める。
SynthID-Textは、その選択プロセスに介入する。秘密鍵とスコアリング関数を用い、多数の選択にまたがって検出可能な統計的シグナルを作り出す。
GoogleのSynthIDドキュメントは、このシステムをTop-KおよびTop-Pフィルタリング後に適用されるlogits processorとして説明している。ロジットは、トークン確率の計算に使われるモデルスコアである。
テストされた設定では、候補はトーナメントサンプリングを通過する。トークンのペアがキーから導かれた隠れたスコアで競い、勝者が進み続け、最終的なトークンが選択される。
非歪曲的な設計は、ウォーターマークのランダム性で平均した場合に元の分布を保つ。しかし、この数学的性質は、特定の固定キーの下で同一の出力になることを要求しない。
この違いがSynthIDの安全性リスクの中心にある。期待値において分布が正しいままでも、デプロイ済みのキーが特定の応答を変える可能性がある。
「overcast」と「cloudy」がほぼ同じ意味を持つ文を考えてみよう。どちらの単語が選ばれても、実用的な結果が変わることはほとんどない。
次に、宛先パスや受信者を含む構造化出力を考えてみよう。モデルにとって複数の値が妥当に見える場合があるが、ユーザーの意図に一致するのは1つだけだ。
ウォーターマークは、問題を引き起こすために不自然なトークンを強制する必要はない。重大な局面で別のもっともらしい候補を選ぶだけでよい。
同じ仕組みは拒否応答にも影響しうる。安全性トレーニングは、常にまったく同じ形で表示される固定の拒否メッセージを挿入するものではない。
拒否応答もまた生成されたシーケンスである。初期トークンの選択によって、そのシーケンスは拒否、一部の支援、直接的な追従へと動きうる。
プロンプトインジェクションは、モデルのコンテキスト内に競合する指示を配置するため、リスクを高める。モデルは、信頼された指示と攻撃者が制御するテキストの衝突を解決しなければならない。
わずかなサンプリングの変化が、その衝突の解決方法を変えうる。モデルが追従を始めると、後続のトークンは新しい軌道に沿って進み続ける可能性がある。
これにより、通常の品質テストが問題を見落としうる理由が説明できる。可読性スコアは、回答が一貫性があり有用に聞こえるかに焦点を当てる。
エージェントが同一の機能を選択したか、あるいは同じセキュリティ境界を維持したかを問うことは、一般にありません。また、多数のインタラクションにわたる結果を平均化します。
Lassoチームは、こうした隠れた変化を可視化するため、ペアでの不一致を用いました。各プロンプトは、他の条件を一致させたうえで、ウォーターマークあり・なしの両方で評価されました。
この手法は2つの影響を区別します。正味の正確性は最終的な平均値を測定し、変動率は個々の判定がどれほど頻繁に変わるかを測定します。
実運用中のエージェントでは、変動率のほうがより有益なシグナルになる場合があります。平均が安定していても、特定の顧客のメールが誤った受信者に送られることは防げません。
したがって、SynthIDとモデル安全性は、透明性と保護の単純な対決ではありません。来歴と安全性は別個の特性を測るものであり、一方が他方を保証するわけではありません。
検出可能性は、生成テキスト内で統計的シグナルが維持されるかを問います。行動の安定性は、同じ入力が許容できるほど等価な判断を生むかを問います。
テキスト品質は、人が品質低下に気付くかを問います。セキュリティは、敵対的な入力によって不正な動作が引き起こされるかを問います。
ウォーターマークは第1と第3の指標で高い性能を示す一方、第2と第4で不安定性を生む可能性があります。各特性には、それぞれ独自の評価が必要です。
コンプライアンス対応はセキュリティ上のトレードオフを生む
説明責任の向上を目的としたシステムが、安全ルールを適用すべきモデル内部に新たな不確実性を持ち込む可能性がある。
欧州の規制当局は、合成コンテンツが識別可能な状態に保たれることを求めています。AI法第50条は、特定のAI出力を機械可読かつ検出可能な形式で表示することを義務付けています。
この規則は、有効で、相互運用可能で、信頼性があり、削除に対して十分な耐性を持つ手法を求めています。欧州委員会の透明性ガイダンスは、これらの義務を偽情報、なりすまし、詐欺、消費者の欺瞞と結び付けています。
これらの目標は実在する問題に対応するものです。テキスト生成器は大量の説得力あるコンテンツを生み出せる一方、複製された出力は、その起源に関する目に見える情報の大半を失います。
SynthIDは、技術的に魅力的な対応策を提供します。そのシグナルは、取り外し可能なメタデータだけに依存せず、言葉とともに伝播します。
しかし、規制当局とプロバイダーは、主にウォーターマーキングを識別レイヤーとして議論してきました。今回の研究は、生成時のマーキングがモデルの判断プロセスの一部にもなり得ることを示しています。
これは、来歴と行動の安定性の間にトレードオフを生みます。両方の目標が両立しないことを意味するわけではありませんが、いずれも無償で得られるものとみなすことはできません。
Anthropicの展開により、この問題はより差し迫ったものになります。同社は、APIやクラウドプラットフォーム経由で提供されるテキストを含め、今後対応するClaudeモデルの出力にモデルレベルでマークを付与すると述べています。
独立系の開発者がウォーターマーキング機能を呼び出すことはないかもしれません。それでも、プロバイダーから届く生成トークンには、すでにマーキング処理の影響が反映されている可能性があります。
このアーキテクチャは影響範囲を広げます。エンタープライズ検索アシスタント、コーディングエージェント、カスタマーサポートシステム、リサーチツールはいずれも、マーク付き出力を利用し得ます。
読み取り専用アクセスのエージェントには、ある種のリスクプロファイルがあります。メッセージ送信、レコード変更、コード実行、取引承認を許可されたエージェントには、別のリスクプロファイルがあります。
ウォーターマークは多層防御とも相互作用します。システムは、モデルの拒否、プロンプトフィルタリング、ツール権限、引数検証、人による確認を組み合わせる場合があります。
サンプリングのドリフトが、すべてのレイヤーを自動的に破るわけではありません。それでも、後続の防御層が危険な要求を受け取るかどうかを決めるモデルレベルの判断を弱める可能性はあります。
この知見は、より厳格なリリースプロセスを支持します。チームは、本番環境でマークを有効化する前に、条件を一致させたウォーターマークあり・なしの実行を比較すべきです。
プロンプトインジェクション下での、拒否から遵守への変化を測定すべきです。また、個々のツール呼び出しについて、正解から誤り、誤りから正解への遷移も追跡すべきです。
集計された正確性は依然として有用ですが、それだけでは不十分です。不正な呼び出し、誤ったツール、誤った引数をテストで分離すべきです。これらの失敗は、それぞれ異なる結果をもたらすためです。
高リスクのツールには、モデル外部の決定論的な制御が必要です。受信者の許可リスト、スキーマ検証、スコープを限定した認証情報、取引上限、明示的なユーザー承認は、露出を抑えられます。
ログにも比較に十分な文脈を残さなければなりません。チームには、プロンプト、モデルバージョン、サンプリング設定、ツールスキーマ、ポリシー設定、ウォーターマーク状態が必要です。
鍵の変更には、モデル更新と同じ慎重さが求められます。この研究では鍵によって方向性の異なる影響が確認されたため、新しい鍵では重点的な回帰テストを実施すべきです。
エージェントを展開する組織は、実際のワークフローから抽出した評価ケースも維持すべきです。汎用ベンチマークでは、あらゆる機密性の高い引数や業務ルールを表現できません。
ここで、SynthIDとモデル安全性は運用上の問題になります。確率的生成にはもともと変動があるため、重要な基準はウォーターマークが何かを変えるかどうかではありません。
基準は、マーク付きシステムが定義された安全許容範囲内にとどまるかどうかです。それは現実的な攻撃と権限の下で測定されなければなりません。
この研究が立証していないこと
この証拠は信頼できる失敗モードを示しているものの、Claude、Gemini、あるいはすべてのSynthID導入が安全性に劣ることを証明するものではない。
研究者がトークンサンプリングを直接制御する必要があったため、実験ではオープンウェイトモデルが評価されました。将来ウォーターマークが付与されるClaudeモデルはテストされていません。
また、Hugging FaceのSynthID-Text公開実装が使用されました。Anthropicは、異なる設定、周辺の安全対策、デコーディング制御、または展開テストを用いる可能性があります。
拒否に関する実験では、固定された1つのプロンプトインジェクション手法が使われました。攻撃者は多くの戦略を使え、異なるプロンプトでは影響がより小さく、大きく、あるいは逆方向になる可能性があります。
研究は拒否テストとツール呼び出しテストを分離しました。注入された有害な要求をエンドツーエンドのエージェントが受け入れ、損害を与えるツール呼び出しを実行することは示していません。
この複合シナリオは、依然として推論です。研究では拒否の変化とツール動作の変化が別々に観察されているため、もっともらしくはありますが、直接的な検証が必要です。
結果は、普遍的な方向性も示していません。一部の鍵は有害な要求への遵守を増やし、他の鍵は減らしました。テスト条件下でほとんど変化しなかったモデルも複数ありました。
この変動性は、ウォーターマーキングが本質的にモデルを安全でなくするという主張を弱めます。一方で、安全性はアルゴリズムの一般的な設計から推論できないという論拠を強めます。
この研究は、AIセキュリティおよびレッドチーミング製品を販売するLasso Securityによって公表されました。同社の商業的立場はデータを無効にするものではありませんが、独立した再現実験が信頼性を高めるでしょう。
研究者は、追加の実装、モデル規模、プロンプトインジェクション、エージェントアーキテクチャにわたり、ペアテストを再現すべきです。プロバイダー主導の研究は、平均品質スコア以上の情報を公表すべきです。
SynthIDの当初評価にも意義はあります。約2,000万件の応答評価は、その導入においてユーザーが広範な品質低下を認識しなかったことを示す強い証拠です。
ただし、高評価率が答えるのは、敵対的状況における拒否の安定性とは異なる問いです。両方の知見は同時に正確であり得ます。
同じ注意は、報告された知見にも当てはまります。最も強い証拠が示すのは、SynthIDの名を冠するすべての製品ではなく、テストされたモデルと構成に関するものです。
Anthropicは、自社のウォーターマークは出力の意味や品質を変えないと述べています。現在公開されている証拠が支持するのは慎重な姿勢であり、この主張が誤りだと断言することではありません。
エージェントのアクションにおける「意味」は、定義が難しいものです。2つの自然言語による応答が等価に見えても、下流で異なる構造化引数を生成する可能性があります。
プロバイダーが、公開実装では再現されない設定上の選択によって、本番環境で安定した動作を実現している可能性もあります。この可能性は、仮定ではなくテストを必要とします。
通常のモデル変動性にも、別の不確実性があります。LLMの出力はすでに、ランダムシード、温度、インフラストラクチャ、モデル改訂によって変化します。
研究は、条件を一致させたペアの比較と、温度に起因する変動率の検証により、この問題の一部に対応しました。温度0.7では、6モデル中4モデルで、ウォーターマークによる拒否の変動率が温度変化による変動率を上回りました。
Gemma 3 27Bでは、インジェクション下のウォーターマーク変動率は26%であり、温度変更による13.5%と比較されました。Llama 3.1 8Bでは17.5%対7.5%でした。
Granite 3.2 8Bは、ウォーターマーク変動率21.5%と温度変動率15.5%に達しました。Gemma 3 12Bでは、それぞれ11%と6%でした。
これらの比較は、ウォーターマークが単に通常のランダム性を加えているだけではないことを示唆します。ただし、依然として選択された設定、モデル、タスクを対象としたものです。
責任ある結論は具体的です。品質を維持する来歴手法として説明されるSynthIDウォーターマーキングは、行動上のセキュリティを別途測定しない限り、不完全です。
プロバイダーがリスクを抑えられるかを示す3つのシグナル
次の証拠は、導入固有のテスト、独立した再現実験、エージェントのセキュリティ実務における目に見える変化から得られるべきです。
第1のシグナルは、Anthropicによるウォーターマーク付きClaudeモデルの評価です。同社は、展開前または展開と同時に、条件を一致させた拒否およびツール呼び出しの結果を報告すべきです。
有用な開示では、通常のプロンプトとプロンプトインジェクションを区別します。また、平均正確性やユーザーの好みだけでなく、個別の不一致率も示します。
Claudeが鍵や敵対的タスクをまたいで安定していれば、その結果はSynthIDの安全性リスクを特定のモデルまたは構成へと絞り込むでしょう。データが欠けていれば、中心的な不確実性は解消されません。
第2のシグナルは、ウォーターマーク実装をまたぐ独立した再現実験です。研究者は、参照コード、Hugging Face統合、本番環境に近い構成をテストする必要があります。
再現実験には、複数の秘密鍵と複数のインジェクション手法を含めるべきです。また、制御された環境内で、拒否と実際のエージェントアクションを結び付けるべきです。
モデルをまたいで一貫した変化が見られれば、生成時ウォーターマーキングが一般的なセキュリティコストを生むという主張は強まります。結果が混在すれば、構成固有の緩和策を示すことになるでしょう。
第3のシグナルは、エージェント開発者がウォーターマーク変更をセキュリティリリースとして扱うかどうかです。プロバイダーの発表は、回帰テスト、権限レビュー、レッドチーム演習の再実施を促すべきです。
チームは、構文エラーだけでなく、変更されたツール引数にも注意すべきです。同じ高リスクケースを、モデル、構成、鍵の更新前後で比較すべきです。
成熟した対応では、重要な制御を確率的生成の外部へ移すことも必要です。機密性の高いアクションを扱うエージェントには、実行時に検証済みの引数と明示的な確認を求めるべきです。
ナレッジワーカーにとって、当面の教訓はより単純です。ウォーターマークが示すのは起源の可能性に関する情報であり、真実性、安全性、または動作不変性を示すものではありません。
開発者はプロバイダーに対し、ウォーターマーキングが有効か、どこで適用されるか、鍵がバージョン管理された通知なしに変更され得るかを尋ねるべきです。エンタープライズの購入者は、敵対的評価の結果を要求すべきです。
セキュリティチームは、モデルインベントリとインシデント記録にウォーターマーク状態を追加すべきです。プロダクトリーダーは、個々の判断がドリフトし得る場合に、どのエージェントアクションを許容するかを決めるべきです。
もはや未解決の問いは、不可視のテキストマークが読みやすさに影響するかどうかではありません。最も重要な判断を変えずに、来歴を追加できるかどうかです。
SynthIDとモデルの安全性を、透明性と安全なエージェントのどちらかを選ぶ問題にしてはならない。実際にデプロイされた構成そのものにおいて、両方の特性を検証すべき要件とする必要がある。
プロバイダーがその証拠を公表するまでは、チームは生成時のウォーターマークを有効にするとシステムが変化すると考えるべきだ。モデルのアップグレードと同じ慎重さでテストする必要がある。



