top of page

AnthropicとGoogleのウォーターマーキング競争:Claudeはテキストに印を付けるが、証明は複雑化

Anthropicは、マークだけでは文書を実際に誰が書いたのか証明できないという限界があるにもかかわらず、新しいClaudeモデルに不可視のテキストウォーターマーキングを導入する方針だ。同社によれば、2026年8月2日以降に欧州連合で提供開始される対応モデルは、リリース時から出力に印を付ける。この方針により、AnthropicとGoogleのウォーターマーキング競争は、AIの来歴証明が管理されたデモの外でも機能するかを問う試験となる。

この変更は、欧州連合のAI Act第50条への対応である。同条は、技術的に実現可能な場合、生成されたテキストやメディアを機械可読かつ検出可能にすることを提供者に求める。Anthropicは対応するClaudeモデルが提供されるすべての地域でこのマーキングシステムを適用する予定で、欧州域内に限定しない。

最も明確な比較対象はGoogleだ。同社のSynthIDシステムはすでに、Geminiテキスト内に統計的シグナルを埋め込むためトークン選択を変更している。Anthropicは、自社のアルゴリズム、検出器、誤検出率について公表している情報がより少ない。そのため同社の方針は確固たるコンプライアンス上の約束を示す一方、結果を評価するには十分な公開証拠をまだ提供していない。

AnthropicがClaude内部で変更すること

AnthropicはAI識別を生成プロセスに組み込もうとしている。これによりウォーターマークは通常のコピーでは残るが、より大きな変更には依然として弱い。

対応するClaudeモデルがテキストを生成すると、Anthropicの説明によれば、応答には知覚できないウォーターマークが織り込まれる。この印は、目に見えるラベルや削除可能なファイルプロパティではなく、生成された言語のパターン内に存在する。

Anthropicは、正確な統計的手法を公開していない。ただし、この種の生成型ウォーターマークは通常、モデルが各トークンを選択する際の判断に影響を与える。トークンとは、言語モデルが一つの単位として処理する単語、単語の一部、または記号である。

システムは長い文章全体で、特定の有効な選択肢を優先できる。検出器は後に、その結果生じたパターンを探す。単一の単語から印が明らかになることはないが、十分なテキストがそのまま残っていれば、連続した並びが統計的シグナルを提供し得る。

この違いにより、応答をメールや文書にコピーしても、ウォーターマークが直ちに消えるわけではない。シグナルは言語そのものとともに移動する。隠しUnicode文字、文書ヘッダー、元のClaudeインターフェースには依存しない。

Anthropicはファイルについて別の手法も採っている。公開されたコンプライアンス説明によると、生成メディアファイルには署名済みの来歴情報が付与される。来歴メタデータは、アセットの出所と、署名後に変更されたかどうかを記録する。

この二つの手法は異なる失敗要因に対処する。誰かがテキストをコピーすると、通常のメタデータは失われる。統計的な印なら、その操作を経ても残る可能性がある。一方、画像やその他のファイルはより多くの構造を保持するため、暗号学的な証明書によって出所や編集履歴を記述できる。

展開には重要な境界がある。2026年8月2日以降にEUで開始される対応Claudeモデルには、直ちに適用される。旧モデルには移行期間が設けられ、レガシーシステムのコンプライアンス期限は12月2日とされている。

これは、過去のすべてのClaude応答に突然ウォーターマークが含まれることを意味しない。印は生成時に追加されなければならない。モデルがこのシステムに対応する前に作られたテキストへ、埋め込みパターンを遡及的に付加することはできない。

また、現在のClaude出力すべてから信頼できる検出結果が得られることも意味しない。短い回答ではトークン選択が少なく、統計的パターンを埋め込む余地も小さい。高度に制約されたテキストでも、モデルが選べるもっともらしい代替案が少ないため、同じ問題が生じ得る。

最も重要なのは、世界規模での適用範囲だ。Anthropicによれば、対応モデルからのマーキングはClaudeが利用可能な場所ならどこでも適用される。したがって、欧州の透明性義務は北米やその他の市場のユーザーが受け取る出力にも影響する。

この選択は、地域ごとに異なる挙動を維持する運用負担を減らす。また、ユーザーが非欧州のサービス拠点経由でリクエストを送ることで印を回避するのも防ぐ。しかし、検出と帰属に関する未解決の問題は、すべてのClaude顧客に関わるものとなる。

EUがこの時期を強いた理由

この方針は、より良いラベリングを目指す自主的な実験ではない。2026年8月2日に適用開始となった法的義務に対するAnthropicの対応である。

EUの第50条の規則は、合成テキスト、画像、音声、動画を生成するシステムの提供者に対し、出力を機械可読形式でマークすることを求めている。そのマークは、人工的に生成または改変された素材として検出可能にしなければならない。

法律はこの義務に条件を付している。技術的措置は、技術的に実現可能な範囲で、有効性、相互運用性、信頼性、堅牢性を備えなければならない。規制当局はコンテンツの特性、実装コスト、認められた最新技術水準を考慮する必要がある。

既知のウォーターマークには、あらゆる変換を生き残るものがないため、この文言はテキストにとって重要だ。ユーザーは応答を短縮、翻訳、言い換え、あるいは他の文章と組み合わせられる。こうした操作はいずれも、検出器が利用できる統計的証拠を弱め得る。

法律は一部の支援的用途も除外している。ユーザーの入力や意味を実質的に変更しない標準的な編集は、提供者の義務の対象外となる。しかしモデルレベルのシステムは、下流の文書がこの例外に該当するかを常に把握できるわけではない。

欧州の透明性コードは、企業に共通のコンプライアンス枠組みを提供する。参加は任意だが、根拠となる第50条の義務は引き続き法的義務である。署名企業は、EU加盟国全体でコンプライアンスを示すために、同コードの措置を利用できる。

この構造は、主要なモデル提供者が互換性のあるマーキングと検出の実務へ収束することを促す。ただし、同一のアルゴリズムを使うことまでは求めない。Anthropic、Google、OpenAIなどの企業は、依然として異なる技術的選択を取り得る。

コードは責任を提供者と導入者の間で分けている。提供者は出力に印を付け、検出を支援しなければならない。導入者は、人間によるレビューや編集上の責任に関する例外を条件として、特定のディープフェイクや公益性のあるテキストを開示しなければならない。

この分担は、出版や企業コミュニケーションで重要になる。モデル提供者はテキストにシグナルを埋め込めるが、そのテキストを公開する組織が、どうレビューしラベル付けするかを最終的に決める。ウォーターマークは編集プロセスの代わりにはならない。

たとえば、広報チームがClaudeに人間が書いた告知文の再構成を依頼する場合を考えてみよう。すべての事実上の主張を人間が提供していても、結果のテキストにはClaudeのシグナルが含まれる可能性がある。検出によって立証されるのはモデルの関与であり、根底にあるアイデアの著者ではない。

逆の問題もある。ある人がClaudeに声明文全体を書かせ、その後大幅に書き直したり翻訳したりすることもできる。最終版では、確信度の高い検出結果が出なくなる可能性がある。印がないことは、人間による執筆を立証しない。

このため、来歴は説明責任のあるAIワークフローの一要素にすぎない。組織には依然として、レビュー記録、ソース資料、承認、および公開される主張についての明確な責任所在が必要だ。

そのためAnthropicの世界規模での展開には二つの目的がある。対応モデルに一つの運用標準を設けること、そして企業顧客に地域をまたいで一貫したシグナルを提供することだ。その一貫性の代償として、欧州外のユーザーも同じ曖昧さを引き継ぐ。

AnthropicとGoogleの違いは証拠にある

AnthropicとGoogleの比較は、テキストにシグナルを持たせるべきかどうかではない。そのシグナルを評価するため、各社がどれだけの証拠を公開しているかに関するものだ。

Googleはすでに、SynthIDウォーターマーキングの基本的な動作を説明している。テキストでは、SynthIDがモデルによる次トークン選択時の確率スコアを調整する。この制御された調整により、Googleの検出器が後から探せるパターンが作られる。

モデルは依然として文脈に適した言語を選ぶ。ウォーターマークは、生成後に目に見える識別子を付けるのではなく、もっともらしい代替案の中での選択に影響を与える。読者が特定の単語を調べても、このパターンに気付くことはできないはずだ。

Googleは大規模展開を説明する研究も公開している。査読済みのウォーターマーキング研究では、個々の応答レベルで元のモデルの分布を維持するよう設計された、歪みのないSynthID-Textのバージョンを評価した。

研究者は約2,000万件のGeminiインタラクションを通じてシステムを試験した。ユーザーフィードバック、パープレキシティ測定、標準的な能力ベンチマークにおいて、有意な品質低下は報告されなかった。

論文は一つの実験設定で、実運用上のオーバーヘッドも定量化している。Gemma 7Bモデルでは、試験されたウォーターマーク設定なしで1トークン当たり15.527ミリ秒、設定ありで15.615ミリ秒を要した。これはレイテンシーの0.57パーセント増に相当した。

これらの数値は、Anthropicの手法の性能を示すものではない。Claudeは異なるサンプリング設計、検出器、鍵システム、または信頼度しきい値を用いている可能性がある。比較が示すのは、Googleのアプローチについて利用可能な証拠の水準である。

Anthropicは、自社のウォーターマークは知覚できず、テキスト品質を下げないとしている。技術文書または独立した評価を公開するまでは、これは同社の主張にとどまる。発表は公開の検出率、偽陽性しきい値、ベンチマーク結果を示していない。

この証拠の隔たりは中心的な問題だ。なぜならウォーターマーキングには常に方針上の選択が伴うからである。検出器は一致を返す前により強いシグナルを求めれば、誤った告発を減らせるが、本物のClaudeテキストをより多く見逃すことになる。しきい値を下げれば、印付きテキストをより多く検出できる一方、偽陽性も増える。

長さもこの方程式を変える。長いレポートには、シグナルを載せられるトークン選択が多数ある。見出し、コード断片、短い事実回答では観測数が少ない。責任ある検出器は、ときに結論を出さない必要がある。

Googleの公開研究は、選択的予測を通じてその抑制を示している。証拠が不十分な場合、検出器は判定を保留できる。ある評価では、研究者は予測を返したサンプルについて、真陽性率95パーセント、偽陽性率1パーセントとなるよう構成した。

これらの数値は、試験対象モデル、テキスト長、生成設定、評価データに依存する。普遍的な保証ではない。また、検出器が複雑なスコアを、根拠のない著者性の断定へ単純化すべきではない理由も示している。

したがって、AnthropicとGoogleの隔たりは必ずしも能力差ではなく、透明性の差である。Anthropicは導入条件を発表し、限界も認めている。Googleは、そのシステムの仕組み、評価設計、実運用上の証拠をより多く開示している。

この違いは、組織が重要な意思決定でClaudeの検出結果に依存する前に、Anthropicが文書を公開するよう圧力をかける。顧客は、どのモデルに印が付くのか、検出器にどれほどのテキストが必要なのか、そしてその出力がどの水準の信頼度を表すのかを理解する必要がある。

Googleも圧力に直面している。オープンな技術手法だけで、普遍的な来歴ネットワークが生まれるわけではない。SynthIDは、互換性のあるマークを適用した参加システムを識別できる。しかし、すべてのモデル提供事業者やローカル環境でのデプロイメントからのテキストにラベルを付けることはできない。

どちらのアプローチも、より広い意味での著者性という問題には答えない。ウォーターマークは、モデルが文章の生成に関与したことを示す場合がある。しかし、誰が論旨を組み立て、証拠を検証し、責任を引き受け、公開を承認したのかを判断することはできない。

検出されたマークは、Claudeが執筆した証拠ではない

中心となるトレードオフは単純だ。モデルレベルのマーキングは追跡可能性を高める一方、性質の大きく異なるAI支援を同じ検出可能なシグナルにまとめてしまう。

Anthropicは、Claudeが人間の文章を校正、翻訳、再整形しただけの場合でも、テキストにマークが付く可能性を認めている。検出器はClaudeの関与を正しく特定できるかもしれないが、それを見た人が著者性について誤った結論を導くおそれがある。

この制約は、日常的な専門業務にも影響する。弁護士は法的分析を変えずに、一文をわかりやすくするためClaudeを使うかもしれない。研究者は文法修正を依頼するかもしれない。英語を母語としない執筆者は、明瞭さを高めるためにモデルを使うかもしれない。

すべての出力に同じ種類のマークが付くなら、検出だけではモデルがどの程度の知的作業に貢献したのかは分からない。生成された論旨と、軽微な言語支援を受けた人間の論旨を区別することもできない。

だからこそ、「AI生成テキスト」という表現は誤解を招きうる。生成には連続性がある。人々はしばしば同じ文書の中で、モデルをブレインストーミング、構成作成、下書き、編集、翻訳、要約、整形に使う。

モデルレベルのウォーターマークが記録するのは処理であり、意図ではない。プロンプトに含まれていたアイデアの来歴を調べることはできない。また、人が応答を独自に検証したか、あるいは大幅に書き換えたかも判断できない。

学校や雇用主は、この区別を慎重に扱うべきだ。肯定的なシグナルが不正行為の自動的な証拠になってはならない。方針では、技術的な検出とは別に、許可される支援を定義する必要がある。

同じ注意はジャーナリズムにも当てはまる。報道機関が、人間の取材に基づくインタビューの翻訳や書式の標準化にClaudeを使うことはありうる。結果として得られた文章が検出器を反応させても、それはClaudeが取材を行った、あるいは事実を捏造したことを意味しない。

Anthropicが示す二つ目の制約は、逆方向を指している。大幅な書き換え、マークのないテキストとの混合、翻訳、または強い短縮により、シグナルは検出しにくくなる。意図的な回避者には、その強度を下げる手段がいくつもある。

通常の業務でも、そのような劣化は起こりうる。文書は複数の編集者、スタイルツール、コンテンツシステム、ローカライゼーションチームを経る場合がある。各段階で、マーク付きのトークン選択が別の表現に置き換わる可能性がある。

その結果、証拠には非対称性が生じる。検出されたマークはモデルの関与の可能性を示すが、その関与の規模は示さない。マークが見つからないことは、Claudeが関与していない証拠にはならない。

報道された展開の詳細によれば、Anthropicは両方向について明確に警告している。人間が作成しAIの支援を受けたテキストはマーク付きに見える場合があり、大きく改変されたClaudeのテキストは検出可能性を失う場合がある。

つまり、ウォーターマークの結果は来歴に関する一つの手がかりとして扱うべきだ。文書履歴、プロンプト記録、改訂ログ、引用、証言と組み合わせれば調査を支援できる。単独で最終判断として用いるべきではない。

誤った帰属には実務上の影響がある。学生は処分を受けるかもしれず、従業員は誠実性に関する調査を受けるかもしれず、執筆者は仕事を失うかもしれない。そうした判断には、信頼度データから切り離された二値のバッジよりも強い証拠が必要だ。

セキュリティ上の問題もある。検出の価値が高まれば、敵対者にはマークを除去したり偽造したりする動機が生じる。悪意ある主体は、本物の人間の文章をモデル生成と見せかけたり、繰り返しの言い換えで自動化されたプロパガンダを隠したりしようとするかもしれない。

非公開の検出キーは偽造を難しくできるが、ガバナンス上の問題を生む。誰が検出器を実行できるのか、誰が監査できるのか、そして告発された人はどのように結果へ異議を申し立てられるのか。Anthropicはまだ完全な公開回答を示していない。

同社の文書では、直接引用についても説明する必要がある。Claudeがマーク付き応答内で人間が執筆した文章を繰り返す場合、その部分の周囲にある統計的パターンが検出に影響する可能性がある。それでも結果から、文ごとの著者性を割り当てることはできない。

これらはウォーターマーキングを放棄すべき理由ではない。出力を正確に説明すべき理由である。「Claudeがこの文章を処理した可能性が高い」は、「Claudeがこの文書を書いた」よりも妥当な表現だ。

テキスト・ウォーターマークが万能検出器になれない理由

AnthropicやGoogleのウォーターマーキング・システムがすべてのAIテキストを識別できるわけではない。検出は、生成時に既知のシグナルを適用する提供事業者に依存するからだ。

生成的ウォーターマークは、一般的なAI文章検出器ではない。意図的に埋め込まれたパターンを探すものだ。マークのないモデル、旧世代のモデル、または別の手法を採用する提供事業者のテキストには、その特定の証拠は含まれない。

ローカルモデルやオープンウェイトモデルは、普遍的なカバー範囲をさらに難しくする。推論を制御する開発者は、任意のウォーターマーク機能を無効化したり、そのキーを変更したり、デコード処理を変えたりできる。規制は提供事業者に義務を課せるが、ソフトウェアは準拠サービスの外部でも動作しうる。

モデルは制約のあるコンテンツも生成する。コード、数式、名称、直接引用では、代替となるトークン選択の余地が限られる。それらを変更すれば正確性を損なう可能性があり、正確性を維持すればシグナルは弱まるかもしれない。

温度も重要だ。温度は、モデルがトークンを選ぶ際にどの程度のランダム性を使うかを制御する。低温度での生成は利用可能な選択肢を狭め、パターンを埋め込める余地を減らす可能性がある。

短いコンテンツも別の境界となる。検出器には、意図的なシグナルと通常の言語変動を区別するために十分な観測数が必要だ。一文だけの回答は実際にマークされていても、統計的には結論に至らない場合がある。

言語変換によって、追加の証拠が失われることもある。翻訳ではほとんどのトークンが置き換わる。要約では元のシーケンスの大部分が削除される。複数の情報源を組み合わせると、マーク付きパターンは無関係なテキストによって薄められる。

こうした制約があるため、Googleは生成的ウォーターマーキングを他の手法を補完するものとして説明している。同社の研究は、SynthID-Textをすべての機械生成言語を対象とする完全な検出器として提示していない。

メタデータとコンテンツ認証情報は、ファイルに関する一部の隙間を埋められる。署名付き記録は画像を作成したシステムを特定し、その後にアセットが変更されたかどうかを示せる。しかし、ピクセルを新しいファイルにコピーすれば、通常のメタデータは取り除かれる可能性がある。

コンテンツベースのウォーターマークは、メディアそのものの内部にシグナルを配置することで、その操作に耐えようとする。画像、音声、動画、テキストでは、それぞれが許容できる変更が異なるため、アプローチも異なる。

テキストは特に脆弱だ。読者はすべての単語が編集可能であることを期待しており、わずかな修正でも統計的なシーケンスを変えうる。画像における微妙なピクセル変動のように、シグナルを手つかずで残せる不可視の領域は存在しない。

したがって、信頼できるエコシステムには複数の層が必要になる。提供事業者はモデルレベルのマークを埋め込める。ファイル形式は署名付き認証情報を保持できる。プラットフォームは来歴記録を維持できる。出版社は重要な利用を開示でき、組織は監査証跡を保てる。

次の課題は相互運用性だ。検出器が最も有用になるのは、偽造を可能にするキーを公開せずに、独立した第三者がコンテンツを検証できる場合である。提供事業者は、インターフェース、信頼度の報告、セキュリティ管理について合意する必要がある。

EUのコードはその調整の場を作るが、市場のインセンティブは依然として異なる。ある企業は信頼を築くために幅広い検証を望むかもしれない。同時に、自社独自の生成手法を守り、敵対者が検出器に対して最適化することを防ぎたいとも考えるかもしれない。

ユーザーにも独自のインセンティブがある。公式文書やライセンス済みコンテンツについて検証可能な来歴を求める人もいる。一方で、非公開の下書きを重視し、自分の言葉とともに持ち運ばれる恒久的な提供事業者シグナルに抵抗する人もいる。

この緊張関係は、統計精度の向上だけでは消えない。アクセス、保持、同意、検出の許容される利用法について、政策上の選択が必要になる。技術的な正確性は必要だが、それだけでは十分ではない。

Anthropic、Google、Claudeユーザーが次に示すべきこと

次の三つのシグナルが、Claudeのウォーターマーキングが有用な来歴インフラになるのか、それとも信頼できないAI検出バッジの一つにとどまるのかを決める。

第一に、Anthropicは検出器と評価フレームワークを公開する必要がある。ユーザーには、文書化された閾値、対応言語、最小テキスト長、一般的な編集後の結果が必要だ。独立研究者にも、回避や誤帰属を検証するための十分なアクセスが必要になる。

信頼できる公開では、検出と棄権の両方を報告すべきだ。すべての文章を「Claude」か「Claudeではない」かに強制的に分類するのではなく、証拠が不十分な場合にはその旨を示さなければならない。信頼度は結果とともに提示される必要がある。

外部テストが、測定可能な品質低下なしに低いエラー率を確認すれば、公開はAnthropicの立場を強化するだろう。特に学校、雇用主、プラットフォームが検出器の出力に基づく判断を始めるなら、不透明な状態が続くことは同社の立場を弱める。

第二に、既存モデルに関する2026年12月2日の移行期限を注視すべきだ。この展開により、Anthropicが消費者向け製品、API、クラウドパートナー、旧世代のClaudeファミリーにわたって一貫したマーキングを適用できるかが分かる。

この移行では、どの正確なモデルが検出をサポートし、いつサポートするのかが明確になるはずだ。また、Anthropicがサードパーティープラットフォームを通じて生成された出力をどのように扱うかも明らかになる。一貫性のないカバー範囲では、否定的な結果はさらに情報量の少ないものになる。

円滑な拡大は、モデルレベルのマーキングが世界共通の標準を生むというAnthropicの主張を裏付けるだろう。遅延、除外、説明のない製品差は、発表が示唆するほどコンプライアンスが統一されていないことを示す。

第三に、Anthropic、Google、OpenAIが一般ユーザーに検証をどのように提供するかを比較すべきだ。Googleはすでに、自社エコシステムを通じてSynthID検出を提供しており、開発者向けにテキスト・ウォーターマーキングの実装も公開している。Anthropicは、より多くの検出関連ドキュメントを公開予定だとしている。

重要な問いは、どの企業が最初にウォーターマークを発表するかではない。ユーザーがシグナルを検証し、その制約を理解し、誤った結論に異議を唱えられるかどうかだ。

AnthropicとGoogleの競争は、不可視のパターンが存在するかどうかではなく、証拠の質によって決まる。提供事業者は、日常的な支援を機械による著者性の告発に変えることなく、マークが現実的な編集を経ても残ることを示さなければならない。

開発者や企業の購入担当者は、検出を中心に据えた執行システムを構築する前に、モデル固有の文書を求めるべきだ。出版社は、ウォーターマークのスキャンを最終的な証拠として扱うのではなく、改訂履歴と編集上の責任を維持すべきである。

ナレッジワーカーにとって、直ちに取るべき行動はより単純だ。AIが重要な資料にどのように寄与したかを記録し、人間による情報源を保持し、公開前にすべての主張を見直すことだ。クライアントや雇用主がAI利用を制限している場合は、編集や翻訳も含まれるのかを確認すべきである。

Claudeのウォーターマークは、モデルの関与をより追跡しやすくできる。しかし、誰がアイデアを著したのか、誰が信頼に値するのかを決めることはできない。次の試金石は、Anthropicがユーザーに、その区別を保つため十分な証拠を提供できるかどうかだ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page