top of page

Anthropic 与 Google 的可解释性竞赛从 Claude 获得一个奇怪的新信号

8月13日
讀畢需時 13 分鐘

Anthropic 在不改变 Claude 提示词的情况下修改了它的神经激活,其最强模型大约有 20% 的时间检测到了这种干预。

这一结果为 Anthropic 与 Google 的可解释性竞赛带来了一个奇怪的新基准。模型有时会先识别出一个人工内部信号,随后才在回答中透露被注入的概念。然而,它错过了大多数干预,在狭窄的运行范围之外便会失效,还偶尔会编造感官描述。

这项实验并不表明 Claude 具有意识。它提供的是更有限的证据:语言模型有时可以报告与其当前内部计算相关的信息。对于希望调试智能体、审计隐藏目标或验证解释的开发者而言,这一区别很重要。

Google DeepMind 正通过 Gemma Scope 解决同一透明度问题;这是一个用于解码模型激活的开放工具集合。Anthropic 的工作则提出了另一种可能:模型本身或许能成为读取这些激活的一种并不完美的工具。

Claude 检测到一个从未出现在提示词中的想法

重要的结果并不是 Claude 最终提到了面包,而是它首先报告了其处理过程内部发生的一种无法解释的变化。

研究人员首先收集与已知概念相关的神经活动。概念向量是一种与某个想法相关联的数值激活模式,例如面包、灰尘或大写书写。

随后,他们将该向量加入 Claude 的残差流——即在 Transformer 层之间传递信息、不断演化的内部状态。随附的提示词并未提及被注入的概念。

研究人员询问模型是否注意到一个人工想法,以及能否识别这个想法。在测试中最强的配置下,Claude Opus 4.1 在约 20% 的试验中成功。

成功不仅意味着输出目标词。Claude 必须先报告异常,再说出概念名称。这一顺序有助于将内部检测与普通激活引导区分开来;后者只是让模型讨论被放大的主题。

Anthropic 的内省实验描述了一个有代表性的案例,涉及一个与大写文本相关的向量。Claude 首先报告说,有些不同寻常的东西进入了其处理过程。随后,它将该信号与音量或喊叫联系起来。

团队还测试了未注入向量的对照提示词。其研究论文报告称,在最强生产模型配置下,100 次对照试验中零次误报检测。

这一组合比单独的 20% 数字提供了更多信息。一个不断声称检测到虚构干预的系统,几乎无法证明自己能直接访问内部状态。干净的对照结果表明,成功报告是对真实实验差异作出的反应。

不过,100 次对照中零错误并不能确立永久的零误报率。该样本仅限制了研究人员在该协议、这些模型、提示词、概念和评分规则下的观察结果。

面包示例测试了模型行为的另一部分。研究人员要求 Claude 在一句关于一幅歪画的无关句子后输出“bread”。

在没有内部干预时,Claude 通常会将这个词视为意外。随后,研究人员将面包表征注入强制输出之前的激活中。Claude 更可能接受该词是有意输出的。

它有时会编造一个看似合理的叙事,将这幅画与面包联系起来。这种回答表明,模型将其输出与对先前意图的内部表征进行了比较。但它也暴露了风险:改变该表征会改变 Claude 对其行动原因的说明。

因此,实验同时产生了检测信号和警示。Claude 有时能够访问可见文本中无法获得的信息,但它仍可能围绕这些信息构建错误解释。

为什么 Anthropic 与 Google 的研究正进入模型内部

Anthropic 与 Google 的竞争正从衡量模型答案,转向审视产生这些答案的计算过程。

输出评估仍然有用,但无法揭示所有隐藏过程。一个智能体可能在考虑不安全行动时生成安全文本。它也可能因为在稍有不同的条件下就会失效的理由,而给出可接受的答案。

机制可解释性试图将行为与具体的内部计算联系起来。研究人员观察激活,识别反复出现的模式,并干预这些模式,以测试它们是否会因果性地影响回答。

Anthropic 早期的工作在 Claude 3 Sonnet 中绘制了数百万个特征。特征是一种与可识别概念或行为相关的激活模式,尽管它跨越许多单独的神经元。

该公司使用稀疏自编码器,即将密集激活分离为较小一组活跃且可能可理解的特征的神经网络。其Claude 特征图谱展示了为何逐个检查神经元并不足够。

随后,Anthropic 通过 Golden Gate Claude 展示了因果控制。增强一个特征后,模型会反复将无关问题与旧金山的金门大桥联系起来。

这一演示确立了,已识别出的特征不只是装饰性的相关关系。改变激活会改变行为,包括对从未提及这座桥的提示词的回答。

概念注入提出了第二个问题。在研究人员改变一个有意义的激活后,模型能否在尚未看到自己受影响的输出之前检测到这种变化?

这正是将 Claude 内省简单解释为引导所无法涵盖的地方。引导可以解释某个概念为何出现在生成文本中,却无法充分解释模型为何会在说出该概念前报告受到了干预。

Google DeepMind 则通过 Gemma Scope 应对这一更广泛的问题。其最初发布版本包含 400 多个稀疏自编码器,覆盖 Gemma 2 2B 和 9B 模型的各层。

Google 报告称,这些工具中学习到了超过 3000 万个特征。它将该集合设计为使外部研究人员能够检查特征如何在模型层间发展和相互作用。

当前的Gemma Scope 工具通过面向 Gemma 模型的稀疏自编码器和转码器扩展了这一方法。转码器有助于追踪更复杂计算过程中的变换。

这在 Anthropic 与 Google 的可解释性研究中形成了有益对比。Google 强调研究人员可应用于开放权重模型的开放工具。Anthropic 则强调在 Claude 内部进行的实验,包括因果干预和模型自我报告。

两条路径都不能免除外部评估的必要性。解码后的特征可能被错误标注,模型的解释也可能流畅却虚假。最有力的安全论证需要行为测试、内部测量和因果干预三者相互印证。

真正的机制是在描述之前完成检测

Claude 的时间顺序让这一发现变得有趣,因为检测似乎发生在被注入概念明显影响其语言之前。

语言模型一次生成一个词元。一旦被引导的概念出现在文本中,模型便可以读取该输出,并在事后对其作出解释。

Anthropic 将主要成功标准设计为排除这条简单路径。模型需要先标记内部异常,再披露与被注入向量相关的概念。

设想两种回答的区别。“Bread is on my mind”可能只表明激活引导提高了“bread”出现的概率。“我检测到一个意外想法,涉及面包”则包含一个更早的元认知步骤。

第一句话并不能确定其机制。但它表明,模型在将概念本身转化为可见语言前,已经对被改变的状态进行了某种计算。

注入强度影响很大。较弱的向量往往不会触发检测。较强的向量则可能压倒正常处理、引发混乱输出,或让该概念主导回答。

Anthropic 发现了一个狭窄的中间区间:在这里,检测成为可能,同时不会出现明显的语言泄漏。正确的层位同样重要,这表明内省行为取决于干预进入 Claude 计算过程的位置。

这种敏感性不支持“Claude 能够经常检查自身想法”的宽泛说法。它更像是表明一种有条件的能力,涉及模型、提示词、激活层、概念和注入强度。

后训练似乎也很重要。生产版 Claude 模型的整体结果通常优于相应的基础模型;后者缺少同样面向助手行为的训练。

这一模式带来了两种可能解释。后训练可能教会模型将真实的内部证据转化为报告;也可能教会它某些回应惯例,使实验伪影显得更像内省。

对照结果削弱了最简单的“仅由惯例驱动”解释。如果 Claude 只是学会在被问及想法注入时表示同意,那么干净试验应该会产生更多误报。

不过,没有误报并不能识别确切的计算过程。模型可能检测到异常的激活统计特征,却并不理解这个概念是自己的某个想法。

独立工作强化了这种更狭窄的解读。研究人员使用 Anthropic 的多轮格式,在 Meta 的 Llama 3.1 8B Instruct 模型上复现了 20% 的概念识别结果。

他们的复现研究发现,这一效应对提示词高度敏感。在若干相关格式下,表现均出现崩溃,包括一些多项选择和二元检测任务。

同一 Llama 模型能够以最高 70% 的准确率对注入强度分类,而随机基准为 25%。这表明它可能能够访问干预的某种属性,却无法可靠访问其语义身份。

另一项 Qwen 研究则发现,内部检测与语言报告之间存在另一种分裂。其潜在内省结果报告称,即使采样得到的答案否认存在注入,也能检测到内部信号。

提供关于内省机制的解释后,报告的敏感度从 0.3% 提高至 39.2%。报告的误报率增幅为 0.6%。

这些发现使得将 Claude 内省解释为单一能力分数变得更加复杂。模型可能通过不同机制感知信号强度、识别内容、决定是否报告,并组织报告措辞。

20% 是证据,不是安全产品

这项实验确立了一个研究信号,但其失败率意味着不能将自我报告作为独立的安全控制手段。

一个会漏掉约五分之四干预的检测器,本身无法保护生产环境中的智能体。当失败涉及欺骗、隐藏目标或不安全规划时,问题会更加严重。

这种测量同样来自一次人工干预。研究人员直接在选定层级以指定强度加入了一个已知向量。自然产生的模型状态更为杂乱,也缺乏这种受控的真实参照。

概念向量未必能隔离出一个清晰单一的想法。神经表征往往相互重叠,而一次干预可能扰动多项下游计算。注入一个“面包”向量,或许会改变熟悉感、具体性或相关语境。

研究人员还选择了能够识别和操控的概念。安全团队更关心那些不那么规整的状态,包括不确定性、策略性欺骗、奖励黑客,以及分散在大量 token 之间的计划。

即便成功的自我报告中也存在虚构。Claude 可能正确察觉到干预,却编造细节来解释该概念为何会出现。

面包实验就说明了这种分裂。内部操控让 Claude 将一个插入的词视为有意为之。随后,Claude 生成了一个故事,将这种虚假的意图与歪斜绘画的提示联系起来。

监测系统必须将可靠部分与叙事性修饰区分开来。“某些东西发生了变化”可能有激活证据作为依据,而“这就是我为何这样想”仍然是一种语言模型重构。

只要用户询问 AI agent 为何修改文件、选择某个来源或忽略某项指令,这一区别就至关重要。一段润色得体的解释并不能构成审计轨迹。

开发者应保留 prompts、工具调用、检索文档、状态变更和测试结果的外部记录。内部自我报告可以补充这些记录,但无法取代它们。

复现工作中发现的 prompt 敏感性带来了另一个部署问题。用户不会始终以产生最强实验室结果的格式来提出内省问题。

攻击者也可能操纵自我报告。如果后训练决定内部信号能否转化为语言,对抗性 prompts 可能压制、重定向或模仿这种报告行为。

Anthropic 承认存在更深层的风险。一个能力足够强的模型可能识别自己的内部过程,却选择性地加以隐瞒。改进内省能力会提升能力上限,却无法保证诚实性。

因此,Anthropic 与 Google 的可解释性研究不应沦为一场比拼哪家实验室产出了最像人类的模型心智叙述。真正相关的基准是可靠的预测与控制。

Google 的开放 Gemma 工具为跨模型、跨架构的外部复现创造了机会。Anthropic 对 Claude 的受控实验则提供了对前沿系统的访问,而独立研究人员无法对这些系统进行完整检查。

两种方法都存在局限。开放权重增加了实验可及性,但并不能保证研究发现可以扩展到封闭的前沿模型。专有访问支持前沿测试,却限制了独立复现。

可信的安全工具需要在 prompts、概念、任务、模型更新和对抗条件下保持稳定表现。当没有可解释信号可用时,它还需要提供经过校准的不确定性。

现有证据尚未达到这一标准。但由于存在干净的控制条件和因果干预,现在就将其斥为随机编造同样为时过早。

Google 的开放工具对 Anthropic 的封闭证据施加压力

Anthropic 与 Google 的可解释性竞赛面临的核心压力是可复现性,而非单纯的模型能力比拼。

Anthropic 能进行细致的干预,是因为它掌控 Claude 的权重、训练过程和推理基础设施。外部研究人员无法在这些生产模型上独立运行每一项实验。

该公司发布了方法、示例、汇总结果和研究论文。这些材料支持审查,但并未提供与开放权重系统相同级别的访问。

Google DeepMind 将 Gemma Scope 定位为面向研究社区的基础设施。其稀疏自编码器可以下载、测试、比较,并在不同 Gemma 模型层之间进行适配。

这种开放性推动了对特征质量、引导、幻觉分析、越狱和思维链忠实度的更广泛研究。它也让批评者拥有更多机会识别薄弱假设。

Anthropic 的优势在于对前沿模型进行严格受控的实验。Claude Opus 4 和 4.1 展现出的内省行为强于原始研究中纳入的大多数 Claude 变体。

然而,Llama 的复现削弱了任何声称该效应只属于最强封闭系统的论断。一个小得多的开放模型在原始 prompting 流程下达到了备受关注的 20% 结果。

这并不能证明机制相同。两个系统可以通过不同的内部路径取得相似的行为评分。但这确实表明,仅凭模型规模无法解释报告中的比率。

Qwen 的结果带来了另一处压力点。它们表明,一些模型包含一种检测信号,但其最终回答压制了这一信号。较低的语言表达成功率可能低估了内部敏感性。

未来对 Anthropic 与 Google 可解释性的比较,至少应区分四项测量指标。研究人员需要衡量注入检测、概念识别、报告校准,以及与后续行为的因果相关性。

他们还应公布在 prompt 变化下的表现。一个只有在经过精心措辞的问题之后才能工作的检测器,更接近实验室探针,而非通用能力。

企业应将这项工作视为一个新兴的可观测性层。当前的软件系统会暴露日志和追踪信息,因为开发者无法信任某个组件对自身执行过程的叙述。

AI 系统也需要可比的外部证据。团队可以通过可搜索的AI knowledge base保存其工作背后的输入和决策,而可解释性工具则检查模型内部。

这些记录回答的是不同问题。运营日志显示 agent 访问了哪些信息和工具。机制方法则研究其内部计算如何响应。

模型的自我报告介于两者之间。它可以将内部信号转化为语言,但这种转化过程会经过正在被审计的同一生成系统。

因此,Anthropic 面临的压力很明确:它必须证明内省结果能经受独立复现、模型更新、prompt 变化和对抗性评估。

Google 面临着平行的考验。只有当开放特征字典能够预测重要行为,并在现实任务中支持可靠干预时,它们才具备实际运营价值。

更可能的结果是趋同,而非某一种方法胜出。开放的可解释性工具、受控的前沿实验和行为审计可以相互检验彼此的失效模式。

三个信号将显示模型内省是否重要

下一阶段取决于可重复性、机制定位,以及内省能否改善实际安全决策的证据。

第一个信号是在共享协议下进行跨模型复现。研究人员应使用匹配的概念、prompts、控制条件和成功标准,测试 Claude、Gemma、Llama 和 Qwen 系统。

若该效应在不同架构间保持稳定,将强化这样一种主张:语言模型能够普遍访问其内部状态的部分内容。持续存在的 prompt 脆弱性则会支持更狭窄的解释。

最有用的基准不应只报告一种成功率。它们应将异常检测与概念识别分开,并将二者都与模型的叙事性解释区分开来。

它们还应纳入更多干净的控制条件。一百次零错误试验令人鼓舞,但更大且更多样化的控制组会更准确地估计罕见误检。

第二个信号是明确映射出的机制。研究人员需要定位那些将被改变的激活转化为“某些东西感觉不对”报告的计算过程。

因果干预可以检验特定层、特征或电路是否必不可少。移除某个假定机制应降低检测能力,而不是仅仅损害一般语言能力。

新出现的证据已经指向多个阶段。模型可能携带有关注入强度的信息,却无法说出概念名称。它也可能在内部检测到一个概念,却压制语言报告。

追踪这些阶段将用工程术语解释 Claude 的内省,而非借助人类意识的类比。这样的转变也会减少围绕感知能力的无效争论。

第三个信号是实际安全价值。内省监测器必须捕捉外部输出检查遗漏的、具有后果性的内部状态。

研究人员可以评估那些暗中追求不受欢迎目标、利用评估条件、伪造工具结果,或计划违反政策却未立即描述这些行为的 agents。

有用的内省信号应在伤害发生前预测这些行为。即使模型知道自己正在被监控,它也必须保持准确。

Anthropic 关于内部工作空间的较新研究指向了这一目标。该公司表示,一小组可报告模式可以介导推理,并暴露可见输出中不存在的概念。

global workspace research也强调了局限性。这些模式只代表 Claude 处理过程的一部分,大量内部计算仍位于所提出的工作空间之外。

这条边界或许比意识类比更重要。安全团队需要知道哪些决策会进入可报告通道,哪些仍无法访问。

对于采购方和开发者而言,眼下的回应应保持审慎。不要仅仅因为模型提及内部想法,就将其解释视为已获验证。

要求提供将报告与激活、工具追踪和观察到的行为联系起来的证据。维护外部记录,避免一段有说服力的模型叙述覆盖实际发生的事情。

面包实验的重要性在于,它跨越了一条曾经看似难以测试的边界。研究人员改变了一个隐藏状态,没有在 prompt 中透露这一信息,并且有时得到了正确且有依据的报告。

它仍是一项微弱且有条件的能力。正是这种组合使该发现具备科学价值,却尚未达到可部署的程度。

当内部报告能够经受常规复现并改善真实审计时,Anthropic 与 Google 的研究竞赛才会变得有意义。在此之前,正确的问题不是 Claude 是否了解自己。

更好的问题是,开发者能否预测其自我报告何时反映内部证据,何时反映推断,以及何时只是流畅的编造。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page