top of page

AnthropicとGoogleの透かし計画、ありふれた言葉をAIラベルに変える

Anthropicは、通常の編集によってシグナルが弱まったり消えたりする可能性を認めながらも、新しいClaudeモデルに不可視のテキスト透かしを導入する方針を示した。AnthropicとGoogleの比較が重要になっているのは、両社が機械可読なAI来歴情報への高まる要求に応えるため、統計的な語句選択を利用しているからだ。

Anthropicによれば、そのシステムは内容に影響しない表現上の選択を通じてテキストを識別する。GoogleのSynthID Textも同様に、モデルが回答を生成する際にトークンの確率を調整する。いずれの方法も、目に見えるラベル、隠しUnicode文字、恒久的な所有権スタンプを挿入するものではない。

この違いが中心的な対立を生む。規制当局は生成コンテンツを識別可能な状態に保つことを求めているが、言語は書き換え、翻訳、短縮、人間の作業との組み合わせが非常に容易だ。透かしは来歴確認を支援できる一方、文書を実際に誰が執筆したかを証明するものではない。

背景には規制のタイミングがある。欧州連合のAI Act第50条は、2026年8月2日に適用開始となった。その透明性に関する規定は、技術的に実現可能な場合、プロバイダーに対して生成出力を機械可読な形式で検出可能にすることを求めている。

企業、開発者、出版社、学生にとって、この問題はClaudeやGeminiにとどまらない。統計的なマーキングはコピー&ペーストを経てもテキストに残りうる。しかし、AIシステムが人間の文章を翻訳、整形、推敲しただけの文書にも印が付く可能性がある。

Anthropicの新モデルは世界中でテキストを識別する

Anthropicは、透かしを欧州ユーザーに限定した地域機能ではなく、モデルレベルの要件として扱っている。

同社のマーキングに関するガイダンスによると、新モデルは初回リリース時から生成コンテンツを識別する。Anthropicは、欧州連合以外の市場を含め、これらのモデルが提供されるあらゆる地域でこの手法を適用する。

この範囲は、Claude製品や配信チャネル全体にわたってマークが現れうることを意味する。Claudeのウェブサイトからコピーしたテキストだけに限定されない。APIやクラウドパートナー経由で提供される出力にも、同じ統計的シグナルが含まれる可能性がある。

この方針は、EUの義務が適用開始となった2026年8月2日以降にリリースされたモデルを対象とする。Anthropicはまた、12月2日に終了する移行期間中に、対象となる旧モデルも要件に適合させる計画だ。

Anthropicのテキスト透かしは、ファイルのメタデータとは異なる仕組みで動作する。シグナルは、同社が内容に影響しないと説明する選択を通じて、生成言語に織り込まれる。これは、複数の単語が回答を実質的に変えることなく、ほぼ同じ考えを伝えられる箇所だ。

生成ファイルには別の来歴情報レイヤーが付加される。Anthropicによると、SVG、PNG、JPGファイルを含む対応画像には、C2PAコンテンツ来歴標準に基づく署名付きメタデータを含められる。

C2PAクレデンシャルは、互換性のあるファイルがどのように作成・編集されたかに関する情報を記録する。この情報は、プレーンテキストに使われる統計パターンではなく、署名付きマニフェストとして伝達される。

手法を分けるのは、それぞれの媒体の性質を反映している。画像には調整可能なピクセルが多数あり、構造化メタデータも保持できる。プレーンテキストでは、意味を変えずに情報を隠せる箇所はより少ない。

Anthropicの発表は、多数の利害関係者によるプロセスを経て策定された自主的なコンプライアンス枠組み、EU透明性コードに続くものだ。このコードは、コンテンツを識別するプロバイダーの義務と、目に見えるラベルを付けるデプロイヤーの義務を分けている。

この区分は重要だ。機械可読な透かしはソフトウェアによる出力の検査を助けるが、読者にAIが関与したことを自動的に伝えるわけではない。出版社などのデプロイヤーには、別途開示義務が課される場合がある。

第50条も、AI支援を受けたすべての文に公的な警告表示を付けるという普遍的なルールを定めているわけではない。法律には、編集上のレビュー、公共の利益に関するコンテンツ、芸術作品、出版責任に関する例外や区別が含まれる。

Anthropicの実装は、最低限の地理的適用範囲を超えている。世界的に一貫したモデルであれば、欧州向けと欧州外向けのリクエストで別々の生成挙動を維持する必要がない。また、下流の開発者には文書化すべき来歴ポリシーが一つになる。

この一貫性には代償もある。カナダや米国のユーザーにサービスを提供する開発者でも、基盤モデルが世界共通の方針に従うため、マーク付きの出力を受け取る可能性がある。ユーザーの所在地がシグナルを必ずしも取り除くわけではない。

したがって、この出来事が変えるのはClaudeのコンプライアンス文書だけではない。将来のモデルにおける通常の生成経路に来歴情報を組み込み、EUの透明性ルールを世界的な製品挙動へと変えるものだ。

AnthropicとGoogleのテキスト透かしは語句選択をどう使うのか

この透かしは、一つの単語に隠された秘密のメッセージではなく、多数の選択に分散した統計的傾向である。

言語モデルは、一度に一つのトークンを生成してテキストを作る。トークンとは、モデルが生成単位として処理する単語、句読点、または単語の断片だ。

各ステップで、モデルは次に続く可能性のあるトークンに確率を割り当てる。文が唯一の正解を要求しない場合、複数の候補が受け入れ可能である。透かしシステムは、秘密のパターンに従って特定の候補を優先できる。

会議に関するありふれた文を考えてみよう。モデルは、核心的な情報を変えずに「however」「still」「yet」のいずれかを選べる。こうした小さな選択の積み重ねが、より長い応答全体にわたって検出可能な統計的署名を生み出すことがある。

Anthropicは、自社のマーキングを内容に影響しない単語という観点で説明している。この表現は、置き換えても意味、事実の正確性、有用な詳細を変えないはずの選択をシステムが対象としていることを示唆する。

同社は、すべての実装パラメーターを公表しているわけではない。そのため、読者は検出器、秘密鍵の構造、スコアリング閾値がGoogleの設計と一致すると想定すべきではない。

Googleは自社の手法をより詳細に説明している。Google SynthID textは、生成中にトークン確率を変更し、検出時にその結果として生じるパターンを評価する。

Googleによると、この方法は長く多様な応答で最も効果を発揮する。エッセイ、脚本、複数のメール下書きでは、モデルがもっともらしいトークンの中から選ぶ機会が多い。

事実を問うプロンプトはより難しいケースとなる。短く正確な答えが一つしかない質問では、モデルに選択の自由がほとんどない。重要な語を変えると応答の正確性が下がる可能性があり、安全な透かしに使える選択肢は少なくなる。

同じ制約は、ソースコード、数式、引用、法的条項、標準化された表現にも当てはまる。構文や正確な表現が重要な場合、本来は影響しないはずの置換が重要な意味を持つ可能性がある。

Googleは、Natureに掲載した研究のために、約2,000万件のGemini応答でSynthID Textを評価した。研究者らは、応答品質に関するユーザーフィードバックも含め、透かし付きと透かしなしの生成結果を比較した。

その透かし研究では、非歪曲的な設計が説明されている。この枠組みでは、システムは透かしなしのモデルが選択できなかったトークンに確率を割り当てない。

この性質は品質維持を支えるが、シグナルを破壊不能にするものではない。Googleは、切り詰め、少数の編集、軽度の言い換えの後でも、ある程度の検出可能性が残ることがあるとしている。大幅な書き換えや翻訳では、信頼度が急激に低下する可能性がある。

Anthropicも同様の警告を示している。短いテキストには、検出器が十分な信頼度に達するだけの選択が含まれていない可能性がある。マーク付きとマークなしの文章を組み合わせると、パターンが薄まることがある。

大幅な編集は、より根本的な問題をもたらす。統計的な透かしは選択された並びに依存する。改訂文書が元の意味を保っていても、十分な数の単語を置き換えれば異なる並びが生成される。

テキストをワードプロセッサにコピーしても、それ自体でシグナルが消えるわけではない。マークは単語によって表現されるため、通常のコピー&ペーストでは関連する並びが維持される。

書式変更はより複雑だ。段落を移動しても多くの局所的パターンは維持されるかもしれないが、積極的な要約ではそれらが失われる可能性がある。翻訳ではほぼすべてのトークンが再生成されるため、元の署名が消えることがある。

この仕組みは、不可視であることが恒久的であることを意味しない理由を説明する。また、検出器が反論の余地のないシリアル番号を発見するのではなく、信頼度を伴う証拠を返す理由でもある。

したがって、実務上のAnthropicとGoogleの違いは、見出しが示唆するほど大きくない。どちらの手法も、生成された言語全体にわたる統計的規則性に依存している。どちらも、検出可能性、品質、編集耐性の間にある同じ対立に直面している。

AnthropicとGoogleの比較は本質的にコンプライアンスの問題だ

AnthropicとGoogleが透かし技術に収束しているのは、技術がなお不完全であっても、規制が導入可能な来歴情報を評価するようになったためだ。

Googleは2023年に画像向けSynthIDを導入し、2024年にはテキストと動画へ拡大した。その後、同社はテキストコンポーネントをオープンソース化し、他のモデル開発者が生成パイプラインに透かしを組み込めるようにした。

2026年7月、GoogleはEUのAI生成コンテンツ透明性実践規範に署名した。同社の規範に関するコミットメントでは、SynthID、C2PA、相互運用可能な透かし技術を支援するパートナーシップが取り上げられた。

Anthropicは以前、より慎重な公開姿勢を取っていた。2023年に米国政府へ提出した意見書では、透かしは有望だが悪意ある行為者に容易に破られうると述べた。

同社はまた、有害または誤解を招くテキストにも有効なマークが付く可能性があると警告した。透かしはモデルの関与を示せても、結果として生まれた主張が正確または安全であることを保証するものではない。

この以前の評価が無意味になったわけではない。Anthropicの2026年の方針には明確な限界が含まれており、導入が透かしを独立した説明責任システムとして全面的に信頼していることを意味しないと示している。

変化したのはコンプライアンス環境だ。欧州委員会によると、第50条の義務は、マーキング、検出、ラベリングの要件を通じて、欺瞞と操作に対処するものだ。

欧州委員会は、透明性コードをコンプライアンスを示すための適切な自主的ルートとして承認している。署名者は、EU加盟国全体で共通の実装枠組みを得る。

別のルートを選ぶプロバイダーも、なおコンプライアンスを満たすことはできる。ただし、その代替措置が法律を満たすことを証明しなければならない。個別評価は、不確実性と事務作業を増やす可能性がある。

このため、技術的に不完全な透かしにも商業的な合理性がある。標準化され文書化されたシグナルは、あらゆる攻撃に耐えられなくても、コンプライアンスのワークフロー、プラットフォーム統合、監査記録を支えられる。

主要な対立相手は、競合ベンダーとしてのAnthropic対Googleではない。永続的な識別を求める規制上の需要と、編集可能な言語の性質との対立だ。

両社は検出器、鍵、生成手法を改善できる。しかし、ユーザーがまったく異なる言葉で同じ考えを伝えることを防ぐことはできない。

OpenAIも欧州の透明性コードを支持し、モダリティをまたいで来歴シグナルを拡大する意向を示している。この広範な足並みの一致は、業界共通の基準に向けた圧力を強めている。

主要なプロバイダーごとに異なる方式でテキストをマークするなら、プラットフォームは統合上の問題に直面する。出版社、学校、企業は、Claude、Gemini、ChatGPT、小規模モデル向けに、それぞれ別の検出器とポリシーを必要とするかもしれない。

相互運用性はその負担を軽減できる。しかし、共通標準には、検出器へのアクセス、秘密情報の管理、しきい値、異議申し立て、独立検証に関するガバナンス上の課題も伴う。

オープンソースモデルは、さらに別の複雑さをもたらす。配布者はウォーターマークを有効にできるが、モデルの重みと推論ソフトウェアを管理するユーザーは、その挙動を取り除ける。

クローズドなサービスでは、ユーザーが生成パイプラインを制御しないため、より一貫してマークを強制できる。この違いは、ホスト型システムと自ら運用するシステムの間で、不均衡なコンプライアンス期待を生むおそれがある。

帰属の問題もある。検出可能なマークは、あるモデルファミリーの関与を示せても、その周囲にある人間の作業フローまでは明らかにしない。

広報担当者がリリース原稿を書き、Claudeに句読点の修正を依頼する場合がある。翻訳者が一段落だけClaudeを使うこともある。開発者が、はるかに長い生成回答のうち数行だけを採用することもある。

検出だけでは、こうした判断を復元できない。人間がすべての主張を承認したか、あるいは文書の論旨をモデルが生み出したのかも判断できない。

そのため組織には、出力レベルのシグナルと並行して、作業フローの記録が必要になる。構造化されたナレッジマネジメントのプロセスは、著者性が重要な場合に、情報源、草稿、承認、改訂履歴を保持できる。

ウォーターマーキングは、その記録の一部を補う。調査者に、機械可読な手がかりをもう一つ与えるものだ。プロンプト、編集、人間によるレビュー、公開責任に関する文書化の代わりにはならない。

検出されたマークはAI著者性の証明ではない

最大のリスクは、ウォーターマークが常に失敗することではなく、人々が不確実なシグナルを決定的な判定として扱うことにある。

Anthropicは、マーク付きテキストが人間の文章から始まる場合があると注意を促している。Claudeが文章を校正、再整形、翻訳した場合、返された版にはモデルの統計的シグネチャが含まれ得る。

その結果は、Claudeが論旨、調査、基礎となる事実を生み出したことを意味しない。調査対象となった文字列の生成に、モデルが関与したことを意味するにすぎない。

逆の推論も成り立たない。マークがないからといって、人がそのテキストを書いたとは証明できない。その文章が短すぎる、大幅に編集されている、翻訳されている、あるいはマークのないモデルで生成されている可能性がある。

こうした限界は、検出器の結果が非難のきっかけになり得る学校や職場で重要だ。確率的なシグナルを、懲戒、解雇、盗用認定の唯一の根拠にすべきではない。

この問題は既存のAI文章分類器に似ているが、プロバイダーが生成を制御する場合、ウォーターマーキングにはより強固な技術的基盤がある。検出器は文体から推測するのではなく、意図的に埋め込まれたパターンを検査できる。

それでも、検出器はしきい値を設定して動作しなければならない。厳格なしきい値を設定すれば、マーク付きテキストを見逃す可能性がある。しきい値を下げれば、マークのない素材や人間が執筆した素材に対する誤警告が増える可能性がある。

独立研究は、慎重であるべき理由を示している。2026年7月のプレプリントは、提案されたフォレンジック対応性フレームワークの下で、3つのテキスト・ウォーターマーキング手法の実装を評価した。

そのフォレンジック評価では、テストした構成で高い偽陰性率が報告された。研究者らは、SynthID実装についても誤警告と大きな不確実性を確認した。

これらの結果を、Anthropicの非公開システムに対する直接監査とみなすべきではない。テストされたのは代表的な実装と特定の実験設定であり、Anthropicの本番用検出器ではない。

ただし、展開に関する主張には再現可能な評価が必要である理由は示している。性能は、テキストの長さ、言語、モデル、ウォーターマークの強度、検出器のしきい値、編集、攻撃者の知識に左右される。

品質も未解決の問題だ。Anthropicは重要でない語句のみを変更するとしているが、重要性は文脈に依存し得る。

マーケティング文では機能する同義語が、契約書では曖昧さを持ち込むかもしれない。プログラムの一般的な意図を保つトークン変更でも、コンパイルを壊したり、実行時の挙動を変えたりする可能性がある。

モデルは制約のある部分をマーク対象から除外できるが、例外が増えるほど利用可能なシグナルは減る。厳密な表現を保護するシステムは、回答内に残る柔軟な部分から証拠を集めなければならない。

開発者は、散文、ソースコード、構造化データ、混合文書について、別々の結果を求めるだろう。単一の平均検出率では、これらの形式間にある重要な差異が隠れてしまう。

多言語利用も別の課題を生む。翻訳によって元のウォーターマークが消える場合がある一方、他言語での直接生成には、その言語のトークン化と文法について十分なテストが必要になる。

この問題は、グローバルモデルにとって特に重要だ。Anthropicの世界展開は、英語の散文だけでなく、言語や表記体系をまたいでこの機能を拡張する。

敵対者にも単純な選択肢がある。別のモデルに出力を書き換えさせる、二度翻訳する、無関係なテキストと混ぜる、といった方法だ。

どのウォーターマーキング企業も、一つのシグナルで意欲的な運用者を止められるとは主張していない。Googleも、SynthIDは決意した敵対者に対する完全な防御として設計されたものではないと明言している。

これはウォーターマーキングが無用だという意味ではない。多くの安全対策は、すべての攻撃者を打ち負かすことなく、コストを引き上げたり、日常的な識別を支援したりする。

スパムフィルターは一部のメッセージを見逃す。改ざん耐性のあるメタデータも削除され得る。認証システムはフィッシングの被害に遭い得る。その価値は、重層的な利用、限界の測定、適切な対応から生まれる。

テキスト・ウォーターマークも同じモデルに従うべきだ。プラットフォームは、署名付きメタデータ、アカウント記録、目に見える開示、コンテンツ分析、人間による調査と組み合わせられる。

企業はまた、来歴と真実性を分けて考えるべきだ。マーク付きの段落に正確な情報が含まれることもあれば、マークのない人間の段落に誤情報が含まれることもある。

マークが答えるのは、生成プロセスに関する限定的な問いだ。引用の妥当性を保証したり、著作権の所有権を確定したり、編集上の責任を立証したりするものではない。

その境界は、製品インターフェースでも明確に保たれなければならない。検出器は確信度と限界を報告すべきであり、ソフトウェアが著者のAI利用を「捕捉した」とする真っ赤な宣言を出すべきではない。

人に影響する決定が行われる場では、異議申し立ての仕組みが重要になる。ユーザーには、混合著者性、翻訳、アクセシビリティ支援、編集作業フローを説明する手段が必要だ。

こうした保護策がなければ、来歴技術は新たな誤った確信のカテゴリーを生み出しかねない。合成メディアに対する規制対応が、それ自体の信頼問題を招くことになる。

Anthropicのウォーターマーク展開後に注目すべき点

統計的なテキストマーキングが有用なインフラになるか、それとも脆弱な検出機能の一つにとどまるかは、3つのシグナルによって決まる。

第一のシグナルは、Anthropicのテキスト・ウォーターマーキングに対する独立テストだ。研究者には、検出ツール、評価プロトコル、マーク付きモデルからの代表的なサンプルへの認可されたアクセスが必要になる。

テストでは、回答の長さ、言語、コード、事実に関する回答、創作的な散文、翻訳、要約、人間と機械による混合文書にわたる結果を報告すべきだ。偽陽性率と偽陰性率も公開すべきである。

こうした条件全体で強い結果が得られれば、重要でない語の選択が有用なシグナルを提供するというAnthropicの主張を支持することになる。長い英語散文以外で性能が弱ければ、この機能の実用的な役割は限定される。

第二のシグナルは、Anthropic、Google、OpenAI、プラットフォーム、標準化団体の間の相互運用性だ。作成者だけが非公開のプロセスで検出できるなら、ウォーターマークの到達範囲は限られる。

安全な検出器アクセスは難しい均衡を生む。広範なアクセスは出版社や研究者を助ける一方、詳細な開示は攻撃者によるシグナルの特定と除去を助けかねない。

市場には実行可能な信頼モデルが必要だ。承認された検証者は、生成時に使われる秘密情報を受け取ることなく、認証済みの検出サービスを利用できるかもしれない。

SynthIDをめぐるGoogleのパートナーシップは、より広範な採用への道筋を示している。一方、C2PAは署名付きファイル来歴の補完的なフレームワークを提供する。テキストには依然として、確信度と混合著者性を報告するための慣行が必要だ。

プロバイダーが互換性のある出力と共通の評価ルールを公表すれば、第50条は来歴をインフラへと押し進め得る。断片化した非公開の検出器では、この成果は弱まる。

第三のシグナルは、旧モデルの移行期間後における執行だ。プロバイダーは、対象となる既存システムを新しい枠組みに適合させるため、2026年12月2日まで猶予を与えられている。

規制当局は、「検出可能」と「技術的に実現可能」が実務上何を意味するのかを明確にする必要がある。これらの定義は、弱いマークでも法律を満たすのか、測定可能な耐性が必要なのかを決める。

執行判断はまた、当局がオープンソースモデル、短い回答、コード、第三者API上に構築されたサービスをどう扱うかも示す。どのケースも、単純なプロバイダー中心のルールに挑戦する。

AnthropicとGoogleの収束は、すでに一つの重要な方向性を確立している。機械可読な来歴は、自主的な安全性研究から、通常の製品アーキテクチャへと移行しつつある。

なお未解決なのは、その来歴が持つ証拠上の重みだ。検出可能なシグナルは調査を支援できるが、文書の完全な履歴を語ることはできない。

組織は、検出器が日常的に使われるようになる前に備えるべきだ。AI生成、AI支援、人間によるレビュー、最終的な編集責任を区別するポリシーが必要になる。

帰属に法的、学術的、評判上の影響が伴う場合は、草稿と情報源を保存すべきだ。また、一つの検出器の結果に基づく自動的な処罰も禁止すべきである。

日常的なユーザーにとって、実務上の問いはシンプルだ。コピーしたClaudeの文章が、チャットを離れた後も検出可能なシグナルを伴うとして、受け入れられるだろうか。

答えが文脈に左右されるなら、その文脈を記録しておくべきだ。人間が書いた草稿を保管し、主張を検証し、必要に応じて実質的な生成利用を開示し、Anthropic・Googleのウォーターマークは判決ではなく証拠として扱うべきである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page