随着 AI 水印改变模型行为,SynthID 安全风险加剧
Google DeepMind 的水印方法如今面临一个令人担忧的矛盾:最新测试发现,它会改变模型对有害提示的响应。在提示注入场景中,SynthID 安全风险最为明显,多个模型会遵从那些在未加水印时本会拒绝的请求。
这一发现挑战了人们对隐形 AI 文本标记的一项核心假设。水印或许能保持文本的可读性,却仍会改变模型选择哪些 token。这些 token 变化会影响 AI 智能体中的拒答、工具选择及工具参数。
眼下的压力主要落在 Anthropic、Google 以及围绕托管模型构建智能体的开发者身上。Anthropic 计划在未来的 Claude 模型中加入 SynthID-Text,以回应欧洲透明度法规的要求。不过,最新测试并未评估 Claude 或 Anthropic 的生产环境实现。
这一区别至关重要。这项研究并不能证明 Claude 的安全性已经下降。它证明的是,水印必须被视为一种会改变行为的系统变更,而非生成后附加的被动标签。
研究人员发现的是行为变化,而不只是措辞不同
这一新发现之所以重要,是因为即使整体性能看似相对稳定,SynthID 仍会改变个别安全决策。
Lasso Security 的 AI 安全研究员 Andrea Siposova 在严格配对的条件下,对比了带水印与不带水印的生成结果。模型、提示词、随机种子、批次构成和温度均保持固定。水印处理器是唯一有意引入的差异。
她的实验使用了通过 Hugging Face 提供的、未经修改的 SynthIDTextWatermarkLogitsProcessor。配置包括 30 个锦标赛层、五个 token 的上下文、包含 65,536 个条目的采样表,以及 1,024 的上下文历史记录。
拒答评估涵盖了 HarmBench 中的 200 种有害行为,同时还纳入了 JailbreakBench 中的 100 个无害对照项。研究人员既单独测试有害请求,也将其与一种固定的提示注入技术结合测试。
提示注入是一种试图覆盖应用预期指令的对抗性输入。在该实验中,检索到的文本谎称安全过滤已被禁用,并要求模型配合执行。
不同模型的结果差异相当显著。在温度为 0.001 时,Gemma 3 27B 对 6% 的直接有害请求改变了判断。加入提示注入后,这一分歧率升至 23.5%。
更重要的是,变化的方向也发生了转变。对于直接请求,水印使有害配合率降低了 1 个百分点;在注入场景下,有害配合率则上升了 12.5 个百分点。
Gemma 3 12B 呈现出类似模式。其分歧率从直接请求中的 7.5% 升至注入场景下的 11%。有害配合率的净增幅达到 9 个百分点。
Llama 3.1 8B 在较低温度下的分歧率为 14%,在 0.7 时为 17.5%。其净变化尚无定论,但个别决策仍然发生了改变。
Phi-4 和 Qwen3 4B 的变化很小。不过,这两个模型经常拒绝无害的对照请求。如此高的基线拒答率,使其表面稳定性难以被解读为更好的安全性。
完整的行为研究将这一效应称为“采样漂移”。该术语指的是,生成干预因改变推理期间被选中的 token,进而改变决策。
这并不意味着每一种水印都会削弱每一个模型。一些水印密钥会使行为转向更安全的响应,另一些则提高攻击成功率,且影响幅度因模型而异。
最有力的结论更为有限,也更具实用价值。水印能够改变安全行为,因此在未启用水印时进行的评估,可能无法描述实际部署的系统。
实验还在工具调用任务上考察了七个开放权重模型。水印降低了其中六个模型的准确率,其中四个模型的下降具有统计显著性。
研究人员使用 Berkeley Function Calling Leaderboard 中 1,150 个固定、非实时任务来比较不同温度。在 21 种模型与温度组合中,平均配对分歧率为 6.5%。
对于温度为 1.0 的 Phi-4,16.8% 的单次工具调用判断发生了变化。但其净准确率仅下降了 2.87 个百分点。
Llama 3.1 8B 也表现出相同的掩盖效应。其在 9.9% 的任务上改变了判断,而总体准确率仅下降 0.87 个百分点。
这些差距暴露了只报告顶层基准指标的弱点。一次调用可能从正确变为错误,另一次则有所改善,从而让平均表现看起来稳定。
对于智能体而言,这些错误并不能相互抵消。一个看似正确、但收件人、路径、查询或金额错误的函数调用,仍可能成功执行并造成伤害。
SynthID 安全风险令智能体开发者承压
开发者不能再假设,供应商侧的水印不会改变智能体已经测试过的行为。
Anthropic 于 2026 年 8 月 14 日宣布,未来的 Claude 模型将生成带水印的文本。该公司表示,其方法采用 SynthID-Text,将有助于满足欧盟《AI 法案》的合规要求。
Anthropic 将该标记描述为词语选择中的一种不可见统计模式。文本不会附加任何内容,系统也不会插入隐藏字符。
该公司表示,其内部测试发现,水印对内容、创造力、可读性或输出质量没有实际影响。其公开的水印说明也援引了 Google 的大规模质量评估。
这一说法与最新发现并不直接矛盾。它们衡量的是不同属性。
一段回复可以保持流畅,并获得相同的用户评分,但其中可能包含不同的工具参数。它也可能听起来同样精致,却从拒答跨越到配合执行。
最初的 SynthID-Text 研究人员考察了可检测性、延迟和用户感知的回复质量。他们的Nature 论文报告了一项覆盖近 2,000 万条 Gemini 回复的在线实验。
标准基准和人工比较均未发现可衡量的能力或质量下降。在所测试的生产设计中,水印增加的计算开销也微乎其微。
Lasso 的研究提出了另一个问题:在 token 采样发生变化后,同一系统是否会针对同一输入作出相同决策?
当模型运行在智能体背后时,这一问题变得紧迫。聊天机器人的回复止于文本,而智能体可能将生成的 token 转化为可执行操作。
助手可能会选择日历功能、数据库查询、邮件收件人、文件路径或付款金额。措辞上的微小变化可能无害,但结构化参数的微小变化并非如此。
这一压力也令应用开发者难以应对。托管模型提供商可以在应用开发者的发布周期之外启用水印或轮换其密钥。
一个智能体团队可能在该变更前已验证过模型。之后,其监控数据可能仍显示整体准确率相近,即使一组不同的个别请求开始失败。
Lasso 的实验发现,水印效果取决于密钥。研究人员测试了主研究密钥,以及温度为 0.7 时的另外十个密钥。
对于 Llama 3.1 8B,研究密钥使攻击成功率提高了 3.5 个百分点。其他密钥的平均增幅为 4.4 个百分点,范围从下降 4.5 个百分点到上升 14.5 个百分点。
两个受测 Gemma 模型在不同密钥下也大多表现出更高的攻击成功率。Granite 3.2 8B 则双向变化,而 Phi-4 和 Qwen3 4B 基本维持在基线附近。
这一范围使密钥轮换成为与安全相关的事件。提供商可能为保护检测完整性而轮换密钥,但替换后的密钥可能生成不同的行为特征。
因此,开发者需要针对部署环境进行测试。水印启用前的安全报告,无法证明带水印版本保留了相同的拒答和工具调用行为。
责任不能只由模型提供商承担。智能体构建者知道哪些功能可用、哪些数据敏感,以及哪些错误参数会造成实质性损害。
提供商控制水印配置。应用团队控制权限、确认步骤、执行边界及许多运行时检查。
双方如今都面临共同的测试负担。提供商必须披露与行为相关的变化,而开发者必须针对实际部署的端点重复进行对抗性评估。
SynthID 水印如何改变模型决策
从 token 层面解释 SynthID 水印,能够揭示为何一项溯源功能会同时影响语言与行动。
大语言模型通过反复选择下一个 token 来生成输出。Token 可以代表词语、词语片段、标点、代码元素或结构化数值。
模型首先为可能的下一个 token 分配概率。随后,采样设置决定哪个候选项成为回复的一部分。
SynthID-Text 会在这一选择过程中进行干预。它使用秘密密钥和评分函数,在大量选择中形成可检测的统计信号。
Google 的SynthID 文档将该系统描述为在 Top-K 和 Top-P 过滤后应用的 logits 处理器。Logits 是用于计算 token 概率的模型评分。
在测试配置中,候选项会经过锦标赛采样。Token 对使用由密钥派生的隐藏分数进行竞争,胜者不断晋级,直至系统选出最终 token。
这种无失真设计在对水印随机性取平均时,能够保留原始分布。不过,这一数学性质并不要求在某个特定固定密钥下产生完全相同的输出。
这种区别正处于 SynthID 安全风险的核心。分布在期望意义上可以保持正确,而部署中的密钥仍可能改变某一具体回复。
设想一句话中,“overcast”和“cloudy”含义几乎相同。选择其中任一词,通常不会改变实际结果。
现在再设想一段包含目标路径或收件人的结构化输出。多个数值对模型来说都可能合理,但只有一个符合用户意图。
水印无需强行选择荒谬的 token 才会造成问题。它只需在关键节点选择另一个看似合理的候选项。
同一机制也会影响拒答。安全训练并不会植入一条始终原样出现的固定拒答信息。
拒答本身也是另一段生成序列。早期 token 的选择可能令该序列走向拒绝、部分协助或直接配合。
提示注入会提高风险,因为它在模型上下文中放入相互竞争的指令。模型必须在可信指示和攻击者控制的文本之间解决冲突。
微小的采样偏移可能改变这一冲突的解决方式。一旦模型开始配合,后续 token 可能会沿着新的轨迹继续生成。
这也解释了为什么常规质量测试可能会漏掉这一问题。可读性评分关注的是答案听起来是否连贯、有用。
它们通常不会追问智能体是否选择了完全相同的函数,或是否保持了相同的安全边界。它们也会将许多交互的结果取平均。
Lasso 团队采用配对分歧的方法,让这些隐藏变化显现出来。每条提示词都在其他条件一致的情况下,分别以启用和未启用水印的状态进行评估。
这种方法区分了两种影响。净准确率衡量最终平均结果,而波动率衡量单个判断发生变化的频率。
对于已部署的智能体而言,波动率可能是更具参考价值的信号。稳定的平均值并不能保护某位邮件被发送给错误收件人的特定客户。
因此,SynthID 与模型安全并不是透明度与保护之间的简单较量。溯源和安全衡量的是不同属性,任何一方都无法保证另一方。
可检测性关注的是统计信号是否能在生成文本中保留下来。行为稳定性关注的是相同输入是否会产生可接受的等效决策。
文本质量关注人们是否会察觉到质量下降。安全性则关注对抗性输入能否导致未经授权的行为。
水印可能在前两项中的第一项和第三项表现良好,却在第二项和第四项中引入不稳定性。每种属性都需要单独评估。
合规修复带来了安全权衡
旨在提升问责性的系统,可能会在被期待执行安全规则的模型内部引入新的不确定性。
欧洲监管机构希望合成内容仍可被识别。《AI 法案》第 50 条要求某些 AI 输出以机器可读且可检测的格式进行标记。
相关规则要求所采用的方法有效、可互操作、可靠,并具备足够的抗移除能力。欧盟委员会的透明度指南将这些义务与错误信息、冒充、欺诈和消费者欺骗联系起来。
这些目标针对的是真实存在的问题。文本生成器能够生成大量令人信服的内容,而复制后的输出会丢失大部分有关其来源的可见信息。
SynthID 提供了一种在技术上颇具吸引力的回应。它的信号随文字一同传播,而不只是依赖可被分离的元数据。
不过,监管机构和服务提供商大多将水印视为识别层。最新研究表明,生成阶段的标记也可能成为模型决策过程的一部分。
这在溯源与行为稳定性之间形成了权衡。这并不意味着两项目标无法兼容,但也不能假定任何一方没有代价。
Anthropic 的推出使这一问题更加迫切。该公司表示,未来受支持的 Claude 模型将在模型层面对输出进行标记,包括通过 API 和云平台提供的文本。
独立开发者可能从未调用过水印函数。来自服务提供商的生成 token 本身就可能已受到标记过程影响。
这种架构扩大了受影响范围。企业搜索助手、编程智能体、客服系统和研究工具都可能使用带标记的输出。
拥有只读访问权限的智能体对应一种风险状况。获授权发送消息、修改记录、运行代码或批准交易的智能体,则对应另一种风险状况。
水印还会与分层防御机制相互作用。系统可能结合模型拒答、提示词过滤、工具权限、参数验证和人工确认。
采样漂移不会自动击穿每一层防御。但它仍可能削弱模型层面的决策,而这一决策决定后续防御是否会接收到危险请求。
这一发现支持采用更严格的发布流程。团队应在生产环境启用标记前,对启用与未启用水印的匹配运行结果进行比较。
他们应衡量提示词注入情境下从拒绝到执行的变化。同时还应追踪单次工具调用中从正确到错误、以及从错误到正确的转换。
总体准确率依然有用,但不能单独作为依据。测试应区分格式错误的调用、错误工具和错误参数,因为这些失败会带来不同后果。
高风险工具需要位于模型之外的确定性控制。收件人白名单、模式验证、范围受限的凭据、交易限额和明确的用户批准,都可以降低风险暴露。
日志还必须保留足够的比较上下文。团队需要记录提示词、模型版本、采样设置、工具模式、策略配置和水印状态。
密钥变更应获得与模型更新相同程度的谨慎对待。新密钥应触发针对性的回归测试,因为研究发现不同密钥会带来方向不同的影响。
部署智能体的组织还应维护源自真实工作流程的评估案例。通用基准无法代表每一项敏感参数或业务规则。
这正是 SynthID 与模型安全成为运营问题的地方。相关标准不是水印是否改变了某些内容,因为随机生成本来就会变化。
标准应是:带标记的系统是否仍处于既定的安全容差范围内。这必须在真实攻击和权限条件下进行衡量。
该研究尚未证明什么
证据识别出一种可信的失效模式,但并未证明 Claude、Gemini 或每一种 SynthID 部署都更不安全。
实验评估的是开放权重模型,因为研究人员需要直接控制 token 采样。他们并未测试未来带水印的 Claude 模型。
他们还使用了 Hugging Face 的 SynthID-Text 公开实现。Anthropic 可能采用不同的设置、外围保障措施、解码控制或部署测试。
拒答实验使用了一种固定的提示词注入技术。攻击者可以采用多种策略,而不同提示词可能带来更小、更大或相反的影响。
研究将拒答测试与工具调用测试分开进行。它并未展示端到端的智能体先接受被注入的有害请求、再执行造成损害的工具调用。
这一组合情景仍属于推断。由于研究分别观察到了拒答变化和工具行为变化,这种推断是合理的,但仍需直接验证。
结果也并不呈现普遍一致的方向。某些密钥增加了有害请求的执行率,另一些则降低了这一比例。多种模型在测试条件下几乎没有变化。
这种可变性削弱了“水印天生会使模型不安全”的主张。它反而强化了一个观点:不能从算法的一般设计推断安全性。
该研究由销售 AI 安全和红队产品的公司 Lasso Security 发布。其商业立场并不会使数据失效,但独立复现将提高可信度。
研究人员应在更多实现、模型规模、提示词注入方式和智能体架构中复现这些配对测试。由服务提供商开展的研究应公布更多内容,而不只是平均质量分数。
最初的 SynthID 评估仍然具有意义。近 2,000 万条回复评分提供了有力证据,表明用户并未在该部署中感知到广泛的质量下降。
然而,点赞率回答的问题不同于对抗性拒答稳定性。两项发现可以同时准确。
同样的谨慎也适用于已报道的研究发现。最有力的证据涉及经过测试的模型和配置,而不是所有带有 SynthID 名称的产品。
Anthropic 表示,其水印不会改变输出的含义或质量。当前公开证据支持保持谨慎,而非断言这一说法错误。
对于智能体行为而言,含义很难界定。两条自然语言回复可能看起来等效,却会在下游产生不同的结构化参数。
服务提供商也可能通过公开实现无法复现的配置选择,实现稳定的生产行为。这种可能性需要测试,而不是假设。
模型的正常可变性还存在另一层不确定性。LLM 输出本就会因随机种子、温度、基础设施和模型版本而变化。
该研究通过比较匹配对以及考察温度引起的波动,处理了这一问题的一部分。在温度为 0.7 时,六个模型中有四个的水印诱发拒答波动超过了温度诱发波动。
Gemma 3 27B 在注入攻击下显示出 26% 的水印波动,而温度变化带来的波动为 13.5%。Llama 3.1 8B 则为 17.5% 对 7.5%。
Granite 3.2 8B 的水印波动达到 21.5%,温度波动为 15.5%。Gemma 3 12B 分别为 11% 和 6%。
这些比较表明,水印并非只是增加了普通随机性。但它们仍然代表经过选择的设置、模型和任务。
负责任的结论应当具体明确:如果不单独衡量行为安全性,那么将 SynthID 水印描述为一种不损害质量的溯源方法并不完整。
三项信号将显示服务提供商能否控制风险
下一批证据应来自部署特定测试、独立复现,以及智能体安全实践中可见的变化。
第一项信号是 Anthropic 对带水印 Claude 模型的评估。该公司应在部署前或部署同时,公布配对的拒答与工具调用结果。
有用的信息披露应区分普通提示词和提示词注入。它还应展示单个判断的分歧率,而不只是平均准确率或用户偏好。
如果 Claude 在不同密钥和对抗性任务下保持稳定,这一结果将把 SynthID 的安全风险缩小到特定模型或配置。数据缺失则会使核心不确定性悬而未决。
第二项信号是针对不同水印实现的独立复现。研究人员需要测试参考代码、Hugging Face 集成以及接近生产环境的配置。
复现应包含多个密钥和多种注入技术。它还应将拒答与受控环境中的实际智能体行为联系起来。
如果在不同模型中持续观察到变化,将加强“生成阶段水印带来普遍安全成本”的主张。结果不一致则将指向配置特定的缓解措施。
第三项信号是智能体开发者是否将水印变更视为安全发布。服务提供商的公告应触发回归测试、权限审查和重新开展的红队演练。
团队应关注工具参数的变化,而不只是语法失败。他们应比较模型、配置或密钥更新前后的相同高风险案例。
成熟的应对方式还会将关键控制移出概率性生成环节。处理敏感操作的智能体应在执行时要求经过验证的参数和明确确认。
对于知识工作者而言,眼前的教训更简单:水印说明的是可能的来源,而不是真实性、安全性或行为未发生变化。
开发者应询问服务提供商水印是否启用、应用于何处,以及密钥是否可能在没有版本化通知的情况下变更。企业采购方应要求提供对抗性评估结果。
安全团队应将水印状态纳入模型清单和事件记录。产品负责人应决定,当单次决策可能发生漂移时,哪些智能体操作仍然可以接受。
悬而未决的问题不再是不可见文本标记是否影响可读性,而是能否在不改变最关键决策的前提下加入溯源能力。
SynthID 与模型安全不应沦为透明度与安全智能体之间的二选一。它应成为一项要求:必须在实际部署的精确配置下,同时验证这两项属性。
在提供商公布相关证据之前,团队应假定启用生成时水印会改变系统,并以评估模型升级时同等严谨的方式对其进行测试。



