top of page

Anthropic 称 AI 模型正在为文本添加水印:你会察觉吗?

9月10日
讀畢需時 14 分鐘

Anthropic 表示,未来每个 Claude 模型都将标记生成的文本,尽管用户无法看到这一信号。AI 模型正通过细微的选词模式为文本添加水印,而不是使用可见标签或隐藏字符。此举旨在帮助获授权的检测工具判断 Claude 是否参与生成某段文字。

这一决定紧随欧盟于 2026 年 8 月 2 日生效的透明度规则。Google 已在 Gemini 中采用相关技术,而 OpenAI 表示计划将内容来源信号扩展至文本。始于研究提案的技术,正逐渐成为大型 AI 产品的标准基础设施。

核心问题不在于读者是否会注意到奇怪的措辞或改变后的写作风格。他们大概率不会。更棘手的问题是,提供商能否在不限制模型最佳回答的前提下,让水印可被检测,尤其是在简短、事实性、翻译过或经过大量编辑的文本中。

Anthropic 将为未来 Claude 模型加入什么

Anthropic 正将文本来源追溯从一项可选实验,转变为未来 Claude 输出的默认属性。

该公司宣布,未来的 Claude 模型将生成带水印的文本。其水印说明称,该系统会估计 Claude 参与生成某段文字的可能性。

这一区别很重要。阳性结果并不能证明最终文档由谁撰写、为何创建,或其中的主张是否准确。它只表明 Claude 很可能参与选择了至少部分措辞。

Anthropic 还表示,水印不包含任何有关用户、组织、账户或对话的信息。检测到水印的人不应能够还原提示词,或将该段文字追溯至特定客户。

回复中不会附加任何可见内容。普通文本不会带有 Claude 标志、披露语句、异常 Unicode 字符或元数据字段。因此,只要措辞整体上保持完好,将输出复制到其他编辑器时应仍能保留该信号。

水印在生成过程中发挥作用。语言模型生成的是 token,即作为独立单元处理的词语或词语片段。每一步中,模型都会为多个可能的下一 token 分配概率。

许多选项含义相近。完成一则有关天气的句子时,模型可以合理地选择“阴沉”、“多云”或“灰蒙蒙”。水印通过反复利用这些低风险的选择,形成一种统计模式。

Anthropic 表示,其系统会改变用于在可接受候选项之间进行选择的随机性来源。密钥有助于引导这些选择。持有该密钥的检测工具,之后可检验这一序列是否与带水印的生成过程异常一致。

该方法不会强制使用固定词汇。它也不意味着每一条 Claude 回复都会包含可辨认的语言习惯。证据会在多个选择中逐步累积,因此长篇文本比简短回答更容易评估。

Claude 的检测工具初期将仅限部分对象使用。Anthropic 表示,正向符合资格的监管机构、研究人员、媒体组织、事实核查机构、教育机构、执法部门及部分企业私密预览提供检测 API。

这种受控访问有两个目的:它可以减少逆向破解该信号的尝试,也能让负有法律责任的组织获得验证内容的方式。不过,受限的检测权限也意味着普通读者无法独立测试他们遇到的每一段文字。

较早的 Claude 模型处于暂时的过渡状态。Anthropic 表示,正努力为 8 月 2 日前发布的模型添加水印,计划在随后数月内完成部署。

该公司在发布时将系统应用于全球,因为其表示按地区隔离尚不够可靠。因此,一项欧洲合规要求将影响远在欧洲之外的 Claude 用户。

这是第一个重大转变。欧盟影响的不再只是区域性披露界面,而是一个全球部署的语言模型如何选择词语。

为什么欧盟 AI 法案正推动一场全球性变革

直接压力来自监管,但实际结果是国际 AI 服务中出现了一层新的技术机制。

《欧盟 AI 法案》第 50 条要求生成式系统提供商使合成音频、图像、视频和文本具备机器可读性及可检测性。官方透明度指引适用于系统输出在欧盟境内使用的情形,即便提供商位于欧洲以外。

这些规则于 2026 年 8 月 2 日生效。在该日期前已投放市场的系统,针对标记和检测义务可获得有限宽限期,直至 2026 年 12 月 2 日。

法律没有规定一种通用水印。它要求在技术可行的情况下,标记应当有效、可靠、可互操作且稳健。提供商可以使用水印、元数据、加密溯源方法、指纹,或这些方式的组合。

这种灵活性反映了一个棘手现实:与图像文件、音频录音或视频容器不同,文本并不会天然携带来源信息。人们经常将文本复制到电子邮件、文档、即时通信应用、网站和代码编辑器中,并在过程中剥离普通元数据。

统计水印能够在复制后保留,因为它存在于词序之中。然而,它传达的上下文少于已签名的元数据。检测工具可以报告模型可能参与其中,但无法重建完整的创作历史。

法律还区分了提供商标记与发布者披露。模型提供商必须在受规制的输出中构建机器可读信号。发布某些由 AI 生成的公共利益材料的个人或组织,可能还需履行额外的可见标签义务。

人工审核在第二类中很重要。欧盟指引称,经过实质性人工审核和编辑控制的公共利益文本,可以与未经审核的输出区别对待。仅进行表层拼写或语法检查,不构成有意义的审核。

多项例外缩小了提供商义务的范围。指引排除了源代码、简短的数字或符号字符串、部分机器对机器输出,以及某些封闭式工业工作流。标准编辑辅助功能也可能不受标记要求约束。

这些区别与技术局限相吻合。精确代码、方程式、引文和事实性回答几乎没有可互换的 token。当只有一个选择正确时,水印无法安全地引导模型选择不同选项。

欧盟委员会表示,国家市场监管机构将承担大部分执法工作。根据违规情况,罚款最高可达 1,500 万欧元或全球年度营业额的 3%。

这种风险敞口为模型开发商采取行动提供了明确理由。Anthropic 还与其他组织共同加入了一项自愿透明度准则,旨在提供一条可预测的合规路径。

结果是,所有服务欧洲市场的主要提供商都面临压力。公司可以维持区域独立的生成系统、撤回受影响功能,或在全线产品中采用内容来源机制。Anthropic 选择全球部署,因为区域隔离不够可靠。

对用户而言,这意味着地理位置不再决定体验。加拿大的写作者、新加坡的开发者和美国的分析师,都可能收到受欧洲市场规则塑造的文本。

因此,监管正在加速形成行业标准,而用户、学校、出版商和雇主尚未就应如何解读检测结果达成共识。技术先行,围绕它的社会规则仍未明朗。

AI 模型通过 token 选择为文本添加水印

水印是一种统计指纹,而非可见印记;其可靠性取决于模型写作时拥有多大的选择自由度。

Claude 的方法基于 Google 的 SynthID-Text 研究。Google 在 Anthropic 宣布采用该技术之前,已在 Gemini 中推出文本水印,为这项技术提供了大规模生产环境测试。

基本机制始于概率分布。当语言模型准备生成下一个 token 时,多个候选项可能获得相近分数。采样过程选择其中一个候选项,并不断重复,直至回复完成。

SynthID-Text 修改了这一采样过程。它在候选项选择中加入基于密钥的评分模式,同时试图保留高质量回答原有的概率分布。

该密钥使获授权的检测工具能够计算最终序列的分数。如果足够多被选中的 token 与预期模式一致,检测工具便可报告该段文字由兼容模型生成的证据。

这更像是在检验一枚硬币是否产生了异常序列,而不是寻找隐藏信息。一次选择几乎无法证明什么;漫长的序列则能提供更有力的统计证据。

Google 经同行评审的SynthID-Text 研究评估了近 2,000 万条带水印和未带水印的 Gemini 回复。用户反馈显示,两组之间没有统计显著的质量差异。

该研究还邀请人工评审者测试了 3,000 个回答。这些评审者发现,两组在语法质量、相关性、正确性、帮助性和整体质量方面没有显著偏好差异。

研究称,在生产环境中计算开销微不足道。由于该系统改变的是采样方式,而不是增加解释性文本,因此并不天然需要更多输出 token。

Anthropic 提出了类似说法。该公司表示,内部测试发现,水印对 Claude 的内容、可读性或创造力没有实际影响。它还称,该系统的延迟微乎其微,且不会增加提供回复的成本。

这些结果支持这样一种观点:经过谨慎配置的水印在典型聊天机器人使用过程中可以不易察觉。但它们并不能证明每一种可能的强度设置都对质量保持中性。

研究描述了无失真和有失真两种配置。无失真设计旨在保持输出质量,同时提供有用的可检测性。更强的配置会改善检测效果,但也接受一定的质量损失。

即使是无失真设置,也涉及设计取舍。更严格的保留质量约束可能降低可检测性,或提高计算复杂度。较宽松的约束则可能降低文本质量和多样性。

Gemini 的在线实验提供了有价值的证据,因为它覆盖了真实提示词,而非小型实验室基准测试。不过,汇总后的点赞与点踩率可能掩盖某些局部弱点。

水印可能在文章、电子邮件、摘要和创意回复中表现良好,却对代码、引文或简洁的事实性回答提供较弱证据。整体满意度分数未必能反映这些差异。

因此,“AI 模型正在为文本添加水印”并不意味着每条模型回复都同样容易被检测。检测强度会随文本长度、语言、编辑程度、模型设置以及合理选词的数量而变化。

它也解释了为什么用户不应期待能从表面看出端倪。如果实现按设计运作,读者无法仅凭偏好的形容词、句子节奏或标点符号,可靠地识别出这一信号。

传统的 AI 检测器则采用不同方式。它使用分类器,即经过训练、用于识别与生成式写作相关模式的系统。这类工具根据观察到的风格进行推测,却并不掌握提供商的密钥。

水印检测则是测试是否存在刻意嵌入的模式。当信号得以保留时,这种方法可提供更有力的溯源证据;但它只适用于检测器所支持的模型和水印密钥。

这并不自动意味着会有通用检测器。Claude、Gemini 以及未来的 OpenAI 系统可能采用不同的密钥、配置或溯源层。互操作性需要技术标准、治理机制和访问协议,而不只是生成方法本身。

最棘手的输出中会显现质量权衡

最大的未知并非平均文本质量,而是当准确性令模型几乎没有多少可接受选择时会发生什么。

事实性回答通常具有较低的熵,这意味着模型可选的合理下一个 token 更少。询问法国首都的问题后,应当出现“Paris”。若为了增强水印而选择另一座城市,回答就会出错。

代码也会带来同样的压力。函数名、运算符、语法、库调用和缩进往往具有受限的形式。当替代 token 会破坏程序时,采样调整必须让位。

Anthropic 表示,在精确性决定答案的地方,水印不会被应用。它仍可能出现在注释或较灵活的命名选择中,但这些机会可能过于稀少,无法实现可靠检测。

校对同样提供不了多少空间。如果 Claude 在一份很长的人类文档中只修改了两个逗号并纠正了一个动词,几乎所有其余文字都来自用户。检测器不应将该文档视作一段由 Claude 从零起草的内容。

这些情况揭示了核心权衡。保持正确性需要更弱或更稀疏的信号。增强信号则需要影响更多选择,这可能限制多样性或影响质量。

一项独立技术分析强调了短文本中的这一张力。研究人员 Vinu Sankar Sadasivan 认为,一篇短帖可能需要异常高比例的偏好用词,才能实现可靠检测。

该分析还指出,在有利条件下,Google 公布结果中的检测率约为 95%,但对某些短回复则降至 50% 以下。这些数字描述的是特定实验设置,而非对 Claude 的保证分数。

Anthropic 尚未公开披露所有实现参数。其公开说明确立了总体机制,但外部人士无法全面评估它如何在所有使用场景中平衡检测强度与回答灵活性。

这一缺口并不能反驳公司的质量主张,但限制了这些主张应被解读的广泛程度。汇总测试中的“没有实际影响”,并不等同于每一种边缘情况都毫无影响。

彻底改写会带来另一项弱点。轻微编辑可能保留足够的 token 模式以供检测,而替换大部分词语则可能摧毁它。由另一套系统进行翻译,也可能显著降低置信度。

Google 的技术概述承认,检测在较长、变化更多的回答中效果最佳。经过大量改写或翻译后,其效力会下降。

有动机的操作者可以利用这一局限。试图隐藏模型使用的人,可以让第二个模型改写第一个模型的输出,进行两次翻译,或逐节重写。

OpenAI 此前在评估文本溯源时提出过这一担忧。其研究摘要称,对于意志坚定的行为者而言,全局转换可能令规避水印变得轻而易举。

OpenAI 还警告了社会后果。它指出,基于水印的执法可能使使用 AI 写作辅助的人遭受污名化,其中包括非英语母语者。

当机构将溯源与不当行为混为一谈时,这种担忧就会变得严重。水印可以显示模型很可能参与其中,却无法证明学生作弊、员工违反政策,或作者放弃了编辑责任。

误报和漏报进一步增加了风险。任何统计检测器都依赖阈值。提高阈值可以减少错误指控,却会漏掉更多生成文本;降低阈值则可能捕捉更多输出,并标记更多无关段落。

短样本尤其需要谨慎对待,因为其提供的统计证据有限。检测器应传达置信度、样本限制和支持的模型,而不是返回一个没有解释的“AI”标签。

组织还需要申诉程序。招聘经理、教师、编辑或合规官绝不应依据一个不透明的分数施加严重处罚。

更好的用途是调查性使用。水印结果可以引出有关流程、披露、来源或审核的问题,但不应取代这些问题。

Anthropic、Google 与 OpenAI 正在以不均衡的方式趋同

主要提供商正朝向溯源发展,但尚未就一种信号、一个检测器或一种解释达成一致。

Google 建立了最清晰的文本水印先例。它在 Gemini 中部署了 SynthID-Text,并发布了描述其生产环境行为的研究。

Anthropic 为未来的 Claude 模型采用了该方法的一个版本。该公司还在为受支持的文件添加 C2PA 凭证,包括由 Claude 生成或处理的图像和文档。

C2PA 是一种用于加密签名内容历史的标准。它可以记录哪种工具处理过文件,以及对文件执行过的某些操作。与文本水印不同,它位于元数据中,而非措辞本身。

元数据可以携带更丰富的信息,但平台和文件转换可能会将其剥离。统计型文本水印能够在普通复制中保留,但通常能揭示的创作链信息较少。

OpenAI 正在推进多层溯源。其当前的溯源文档描述了适用于受支持图像和音频的 SynthID 水印,以及适用于受支持图像的 C2PA 凭证。

OpenAI 表示,其目标是将溯源信号扩展到文本。这是既定方向,并不确认当前每条 ChatGPT 回复都带有文本水印。

这种差异很重要,因为用户经常假定 AI 检测器适用于所有系统。专用于 Claude 的检测器无法可靠识别未加水印的 ChatGPT 输出。它也不能仅因两家提供商采用相关研究,就识别每一段 Gemini 文本。

即使是阳性检测,其含义也很有限。Anthropic 表示,其水印无法区分“Claude 写了这段内容”和“Claude 对这段内容进行了大量编辑”。两种活动都可能留下由 Claude 选择的语言。

对于知识工作者而言,这种模糊性反映了 AI 的实际使用方式。一个人可能先拟定报告大纲,让 Claude 重组内容,重写若干段落,恢复原始措辞,再完成最终的人工编辑。

为这一过程分配单一的二元作者标签具有误导性。溯源可以显示工具参与,而作者身份则取决于贡献、判断、责任与机构政策。

这正是良好知识实践变得有价值的地方。维护来源笔记、草稿历史和决策记录,可提供水印无法提供的背景。一套结构化的第二大脑可以保留成稿背后的证据。

开发者面临另一项问题。基于模型 API 构建的应用可能会在生成后转换回复。模板、检索系统、安全过滤器、本地化服务和用户编辑,都可能改变可检测的模式。

因此,产品团队需要了解水印在其工作流的哪个环节进入,以及后续哪些操作会削弱它。合规不能止步于选择模型提供商。

企业还需要制定涵盖检测器访问的政策。Anthropic 的私有预览 API 将验证能力交给了获选机构和负有义务的公司。这种方式可以保护水印密钥,但也集中了解释权力。

独立研究人员需要获得足够的访问权限,以测试不同语言、领域和模型版本中的错误率。没有外部验证,买方就必须高度依赖由提供商主导的评估。

标准机构可以帮助统一术语和报告方式。一项有用的结果应标明所支持的提供商、置信度、样本长度、已知转换,以及检测器版本。

单纯的“检测到水印”结果并不足够。它没有说明事实准确性、许可、版权、原创性,或人类是否批准了该内容。

各提供商正将溯源视为一项责任而趋同。但距离一个普通读者能够一致使用的共享系统,仍相去甚远。

用户接下来应关注什么

下一阶段将检验,无形标记会成为可靠的溯源基础设施,还是另一种饱受争议的检测分数。

第一个信号是 Anthropic 向较旧 Claude 模型的推广。针对在 8 月 2 日前投放市场的系统,欧盟宽限期将于 2026 年 12 月 2 日结束。

用户应关注哪些模型获得水印、API 行为是否不同于面向消费者的 Claude 界面,以及 Anthropic 如何处理现有企业部署。清晰的版本级文档将加强该公司的透明度论据。

第二个信号是更广泛地开放 Claude 的检测 API。监管机构和获选机构可在私有预览期间进行测试,但更广泛的独立评估仍不可或缺。

有价值的研究应衡量长文、短帖、翻译、事实性回答、代码,以及人类与 AI 混合文档中的误报和漏报率。它们还应测试常见编辑工作流,而非只测试蓄意攻击。

如果结果在这些类别中保持稳定,水印将更像可靠的基础设施。如果准确性在没有明确警告的情况下剧烈波动,组织就需要对其使用施加更严格的限制。

第三个信号是 OpenAI 的文本实现。OpenAI 目前描述了将溯源信号扩展到不同模态的意图,但其公开文档并未表示所有文本输出都已被标记。

其最终设计将显示,行业是会趋同于 SynthID-Text,还是会在水印、签名元数据和分类器之间分化。共享方法会让验证更容易,而不兼容的系统则需要多种针对提供商的工具。

用户还应关注平台如何保留这些信号。水印比元数据更能经受复制粘贴,但大幅改写仍可将其抹去。社交网络、出版商、文档套件和学校仍需要制定呈现检测结果的规则。

对于个人写作者而言,无需立即进行视觉上的调整。Claude 的输出应当看起来正常,水印也不应暴露账户信息。

实际需要调整的是流程。保留原始来源,记录重要编辑,审查事实主张,并在政策要求时披露 AI 的使用。无论水印是否留存,这些做法都能保护作者与读者。

雇主和学校应在部署检测器之前更新相关政策。政策应明确允许哪些辅助方式,区分编辑润色与完整生成,要求人工审核,并提供对检测结果提出异议的渠道。

读者应将内容溯源视为多项信号之一。检测到水印可以表明某个受支持的模型参与了生成过程,但无法说明这段文字是否真实、具有误导性、存在抄袭、经过审慎审核,或被负责任地发布。

这条边界将决定水印技术能否赢得信任。谨慎使用时,它能够在不改变阅读体验的前提下帮助追溯合成内容;若被当作自动化裁决,则可能重演早期 AI 写作检测器所带来的问题。

AI 模型正在为文本添加水印,因为监管机构和服务提供商希望实现机器可读的问责机制。对大多数读者而言,这种标记仍将不可见,但围绕它制定的政策会很容易被察觉。

因此,未来几个月的关键问题很实际:服务提供商是否会公开足够的证据、检测器访问渠道和保障措施,使这一不可见的信号保持公平?在将任何水印检测结果视为证据之前,读者、开发者、教育工作者和企业采购方都应要求得到这些答案。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page