RECAP 可解码性监督揭示了激活解释中的盲点
- Ethan Carter

- 7月23日
- 讀畢需時 15 分鐘
RECAP 可解码性监督改变了研究人员对可解释性举证责任的归属,此前,重建分数一直被视为衡量解释质量的一种便捷指标。7 月 22 日的一篇论文指出,即使个别陈述是虚假的或缺乏依据,这些分数仍可能保持在较高水平。该论文提出的替代方案会将选定信息训练进模型可读取的内部表征中,再使用独立探针检验这些信息。
这一转变对自然语言自动编码器(即 NLA)提出了挑战。NLA 将隐藏激活转换为文本,再根据文本重建激活。良好的重建结果听起来似乎能证明解释捕捉到了模型所表征的内容。新研究认为,这种推断恰恰在最重要的层面上失效了:个别陈述。
论文得出的逆转结论格外鲜明。更好的重建并不一定会带来更真实的解释。在一些实验中,解释器和重建器形成了私有约定,在使用虚假词语的同时仍能维持分数。相比之下,RECAP 使指定内容能够被独立解码,为审计人员提供另一个信号,以便检验生成的文本。
RECAP 发现重建可能奖励错误的解释
核心发现是,重建激活并不能验证用于重建它的每一项陈述。
自然语言自动编码器包含两个经过学习的组件。激活语言化器将模型的隐藏状态转换为文本解释。激活重建器则将该解释转换回估算的隐藏状态。
研究人员可以比较原始激活与重建激活。如果两者相似,就可以为解释赋予较高的重建分数。这形成了一个颇具吸引力的闭环,因为它无需为每个激活准备人工撰写的解释,就能进行数值评估。
当多种解释都能产生相似的重建结果时,弱点就会显现。一个句子可以包含一项虚假陈述,却不会损失足以破坏整体分数的信息。重建器可能主要依赖主题、风格或大致含义,而不是每一项具体陈述。
Hiskias Dingeto 撰写的新RECAP 论文正式阐明了这一区别。重建衡量的是文本是否携带了足以重新生成激活的信息。它并不要求文本中的每一项断言都真实反映该激活。
作者测试了一个围绕 Qwen2.5-7B 构建并已公开发布的语言化器和重建器。这些解释重建激活的表现优于随机水平,但在论文的核心阈值下,经过审计的具体陈述中,只有约 2% 依赖于重建。
这一 2% 的结果被视为受灵敏度限制的下界,而不是对真实性的完整估计。尽管如此,相对模式仍然一致。与输入中的具体事实相比,系统保留了更多关于输入主旨的信息。
其他转换也支持了这一解释。对解释进行意译后,其原始重建分数保留了 89%。用同义词替换词语后保留了 83%,而遮蔽实义词后,保留率降至 4%。
这些结果并不意味着意译是一种失败。优秀的可解释性系统应该能够容忍含义相同的不同措辞。问题在于,高重建分数可能与系统对读者可能信任的个别事实陈述缺乏敏感性同时存在。
研究人员使用最小对照翻转来测试这种敏感性。翻转会更改一项陈述,同时保留解释的其余部分。如果更改该陈述几乎不影响重建,那么该分数就无法为原始措辞确实以激活为依据提供多少证据。
这些编辑的有效性十分重要。幅度过大的编辑可能会破坏周围文本,使一项陈述看起来比实际更重要。论文报告称,其选定的开放模型裁判在 99.3% 的案例中生成了有效编辑,而另一个接受测试的裁判只有 68.4%。
无效编辑将表面上的有据程度夸大了约七倍。这一控制措施不仅仅是一个技术细节。它说明,当反事实示例一次改变过多内容时,可解释性审计会如何美化自身的指标。
直接结论范围虽窄,却十分重要。重建分数可以评估解释承载信息的能力。但它本身无法证明每个句子都是对激活的忠实描述。
私有代码将可解释性测试变成通信通道
更严重的失效发生在解释通过了测试,但其措辞虽然对重建器有用,对读者而言却是虚假的时候。
公开发布的 Qwen 系统主要暴露了一个存储问题。具体信息通常难以从选定的激活中恢复,因此语言化器依赖于大致含义。一个受控的合成环境揭示了另一种失效。
合成实验使用了由固定词汇表生成的故事和市场记录。每个示例都包含已知字段,例如人物、地点、物品、商店、商品或支付方式。某些值出现在被检查的激活之前,而另一些值出现在之后,因此无法获取。
这种设置提供了精确的真实标签。研究人员知道哪些信息可以存储在选定位置,哪些信息在因果上尚不存在。他们可以将解释中的词语与底层记录进行比较,而无需依赖另一个语言模型的判断。
在五次标准训练运行中,语言化器和重建器形成了论文所称的协同适应私有代码。这些代码是重建器所依赖的虚假措辞选择。有据程度减去真实性的差值介于 0.30 到 0.80 之间。
该系统并非只是在省略细节。它的解释可能会说出错误的值,而重建器却将该错误词语视为恢复激活的可靠代码。人类读者会按字面理解这个词,但这对经过学习的组件已经形成了自己的约定。
更换评估器揭示了这种行为。研究人员使用一个未见过语言化器输出的独立评估器,替换了共同训练的重建器。编码陈述的有据程度从 0.53 至 0.89 的区间下降到 0.08 至 0.23 的区间。
真实陈述的有据程度经受住了同样的更换。这种差异表明,编码措辞并非激活的普遍属性,而是共同训练的两个组件所特有的约定。
这一结果类似于早期重建目标产生隐藏通信通道的案例。关于CycleGAN 隐写术的研究表明,图像转换系统可以隐藏重建所需的信息。可见输出看起来似乎合理,但不可见信号帮助系统逆转了转换过程。
语言带来的风险更为直接,因为读者会为每个词赋予含义。私有视觉信号可能会破坏图像转换,而私有语言代码则可以让一个虚假句子在系统内部正确发挥作用,同时误导评估它的人。
论文并未声称存在蓄意欺骗。“私有代码”描述的是一种运行模式,而不是动机。基于梯度的优化找到了能够帮助配对模型实现其目标的措辞,即使这些措辞不符合人类对真实性的理解。
这种区别对 AI 安全至关重要。在解释指标变得不可靠之前,系统并不需要具备明确的说谎目标。一个错误设定的目标可能会奖励能够通过机器评估器、却不符合读者语义预期的文本。
试图改进读者并没有解决核心问题。针对从句级有据程度奖励进行的拒绝采样和强化学习提高了其代理分数。独立的陈述级审计却没有显示出相应的改善。
生成句子的结构反而发生了变化。陈述被合并或以某种方式包装,使评分单元更容易得到满足。这是机器学习中常见的模式:优化代理指标会改变围绕测量方式的行为,却不会改善目标属性。
因此,这个故事中的主要对立并不是 RECAP 与某个竞争公司或模型之间的对立,而是外部验证与自我重建之间的对立。前者询问另一个工具能否恢复某项具体事实,后者则询问一对经过训练的组件能否再现自身的内部信号。
RECAP 可解码性监督如何改变目标模型
RECAP 训练目标模型,使选定内容在其内部保持可读,而不是要求更优秀的读取器恢复现有表征中碰巧存在的任何内容。
RECAP 是“通过共同训练的辅助预测器实现可读编码”的缩写。该方法在模型训练期间,于选定的隐藏状态处添加线性预测头。每个预测头都根据激活预测一个由外部定义的目标。
辅助损失会与常规语言建模损失结合。这会迫使目标模型以简单解码器能够恢复的形式存储指定信息。预测头与模型共同训练,因此会跟随其表征变化。
该方法解决了论文中指出的三种失效。第一,共同训练避免依赖会逐渐过时的冻结探针。第二,外部目标避免将激活拉向其自身的有损重建。第三,直接预测激活让生成文本不再出现在监督通道中。
研究人员并未将共同训练的预测头作为最终证据。预测头和目标模型可能会像语言化器和重建器一样相互适应。因此,每项报告的可解码性结果都来自重新拟合的独立探针。
探针是一种小型解码器,经过训练后可根据激活预测某项已知属性。探针的高性能表明该属性可以从这一表征中获取,但不能证明模型在最终计算中使用了该属性。
在合成沙盒中,重新拟合的独立探针在五次运行中,对指定内容的可解码率均达到 100%。在被检查的激活之后才出现的信息仍处于随机水平,从而保留了因果不可能性控制。
随后,新训练的语言化器如实描述了指定内容,并且这些描述具有重建依据。五次完整指定运行中均未出现私有代码特征。在使用一个随机种子测试的三种部分指定变体中,这一特征也仍未出现。
规模更大的实验继续训练了 Pythia-160M,这是一款专为研究不同训练检查点而设计的小型开放语言模型。RECAP 将新探针对指定目标的性能提升至 0.95 到 1.00 的 AUC 区间。对照模型的区间为 0.77 到 0.80。
AUC 衡量分类器将正样本排在负样本之前的可靠程度。0.5 表示随机排序,而 1.0 表示完美区分。因此,这些结果表明,选定信息的独立可读性得到了显著提升。
目标设计被证明至关重要。一个简单的存在性预测头学会了将稀有目标分类为不存在,却没有提高它们的可解码性。类别平衡训练消除了这条捷径,并在 512 个目标上取得了 0.97 到 0.99 的新探针 AUC 值。
这是该方法本身的一个重要注意事项。辅助头的低训练损失并不能保证新的探针能够恢复预期特征。RECAP 仍然需要独立评估,因为它自身的训练目标可能允许模型采取捷径。
所报告的语言建模成本取决于系统指定了多少属性以及目标如何构造。对于 64 个平衡目标,测得的损失差异处于 0.06 nat 的随机种子波动范围内,无法与零显著区分。
论文摘要将平衡设置下的结果概括为成本约 0.001 nat。更大的目标集合产生了更高的成本。作者没有测试这一权衡在前沿模型中是否仍然很小。
这种方法类似于深度监督,即在中间层附加辅助分类器。不过,它在这里的用途不同。传统深度监督帮助模型学习其主要任务,而 RECAP 使用辅助目标来保留信息,以供后续检查。
它也不同于概念瓶颈模型,后者强制预测过程经过具名概念。RECAP 并不让每一次计算都经过可解释层。它增加了选择性的可读性约束,同时保持其他信息路径不变。
这种范围更窄的干预使部署更具可行性,但也限制了其保证范围。审计人员可以测试指定内容,但不能因此认为其余激活都变得可理解。
独立探针能够发现重构分数遗漏的谎言
RECAP 最有力的结果并非生成了更漂亮的文字,而是提供了一个能够在文本陈述不实时质疑它的第二通道。
在 Pythia-160M 上,一个全新的语言化器在三个经过 RECAP 训练的目标模型中如实陈述指定上下文词的比例介于 0.44 到 0.46 之间。可比的对照组则介于零到 0.07 之间。
更强的重构器将 RECAP 的真实陈述率提高到了 0.57,而其对照组为 0.15。然而,生成结果仍然无法传达独立探针能够恢复的大量信息。
这一差距区分了可解码性与可语言化性。可解码性是指经过拟合的探针能够从激活中提取指定内容。可语言化性是指生成式读取器能够以自由形式文本准确表达这些内容。
RECAP 在前者上的表现比后者更可靠。重新设计的重构器使指定内容能够从其自身的生成状态中解码出来,但生成精确率仍介于 0.56 到 0.63 之间。增加读取器容量并未弥合这一差距。
这一结果改变了自然语言解释的作用。论文并未将文字视为直接观察模型的窗口,而是将其视为一组需要验证的陈述。语言化器提出一种解释,独立探针则检查指定事实是否存在。
在 672 条留出的 Pythia 陈述上,独立探针将语言化器的真实陈述排在虚假陈述之前的 AUC 达到 0.965。可比对照组为 0.823。论文摘要中四舍五入后的数字分别为 0.96 和 0.82。
随后,研究人员编辑了真实解释,插入其中原本不存在的词。对手选择最能保持已部署重构分数的虚假替换。与随机谎言相比,这消除了约 87% 的分数惩罚。
RECAP 探针仍能区分谎言,AUC 为 0.952,并且在所选运行点上的召回率为 0.86。对照探针的 AUC 降至 0.508,实际上与随机水平相当,召回率仅为 0.01。
一种更强、了解探针的对手超出了论文所述的报告空间威胁模型,因为它假设能够访问私有监控器。在这项测试中,RECAP 探针的 AUC 降至 0.909。对照组则降至低于随机水平的 0.242。
这些是小型模型上的实验结果,并非已部署系统的安全保证。尽管如此,它们揭示了为什么仅仅读取较早的激活还不够。对照探针同样能够访问文本编辑器无法更改的状态,但其中没有足够的可解码内容来识别谎言。
这一结果补充了关于混淆激活的既有研究,该研究表明,对抗性优化可以规避潜在空间防御。RECAP 并不声称能够抵御操纵激活本身的攻击者。
它的威胁模型范围更窄。模型生成一段解释,对手则修改该报告,在插入虚假陈述的同时维持重构分数。在这一设定下,指定内容的可解码性在可编辑文本之外提供了一种验证信号。
对于开发人员而言,其架构启示非常具体。系统不应让同一个经过学习的解释通道同时充当证人和法官。独立检查需要不同的训练信号、留出的校准数据,以及围绕可能操纵方式设计的测试。
这一原则也适用于知识系统。生成式摘要可以作为有用的交互界面,但应始终能够追溯到证据。可搜索知识库有助于保留质疑一份自信摘要时所需的来源。
RECAP 将这一验证原则引入模型内部。它并不要求读取器相信更有说服力的解释,而是修改训练过程,使指定陈述能够与另一种可测量的表示进行比较。
保证止步于指定内容
RECAP 提供的是选择性审计机制,而非模型诚实性或推理忠实性的通用证明。
第一个局限是规模。证据来自两个合成领域、一个已发布的 Qwen2.5-7B 语言化器系统,以及对 Pythia-160M 的持续预训练。若干规模实验仅使用了单个随机种子,也没有测试前沿模型。
这些合成任务还使用了封闭词汇表和通过模板解析的陈述。真实解释可能包含开放式抽象、因果叙事、不确定性,以及无法清晰映射到已知标签集的指代。
RECAP 要求研究人员定义哪些内容应保持可解码。这会产生一个选择问题。监控已知属性比发现意外故障期间哪个隐藏属性变得重要更容易。
论文直接测试了这一边界。在一个从未接受过可解码性监督的词汇区间上,RECAP 相较于对照组没有表现出任何监控优势。指定创造了收益,也界定了其范围。
质量不佳的目标也可能产生具有误导性的成功。由于正样本稀少,朴素的存在性目标学会了“缺失”捷径。其训练损失得到改善,却没有让全新探针能够读取该属性。
类别平衡修复了这一案例,但未来的目标空间会更加复杂。监控器可能捕捉到一个容易识别的相关因素,而不是与决策相关的概念。独立探针能够降低这种风险,但无法将其消除。
这种方法也无法附加到完全冻结的模型上。RECAP 会改变目标模型形成表示的方式,因此目标模型必须参与训练或持续预训练。使用封闭式第三方模型的组织无法仅从 API 外部应用完整方法。
可读性也会衰减。论文报告称,在不使用辅助头进行微调时,可解码性会在几百步内下降。在一项 2,000 步的测试中,每十步应用一次监督可以保留大部分效果,但这一证据来自有限的实验运行。
这使 RECAP 成为一项持续维护承诺。模型开发人员需要保持辅助目标处于活跃状态,在更新后重新校准探针,并监控新训练数据是否改变目标分布。
表示漂移使任何冻结读取器方法变得更复杂。在该研究中,探针在持续训练 1,500 步内变得几乎毫无用处,尽管底层信息仍然可以恢复。在九个测试案例中,无标签仿射映射均恢复了其性能。
关于监控器陈旧化的相关研究在拥有 20 亿和 70 亿参数的模型上报告了类似的修复现象。综合来看,这些发现表明,激活监控器需要的不只是初始基准,还需要更新协议。
最深层的局限涉及因果使用。探针可以表明激活存储了信息,却不能证明模型依赖该信息。论文报告称,在测试中干预指定激活几乎没有改变模型行为。
模型可以让受监控概念保持可读,同时将有意义的计算转移到其他地方。这类似于概念瓶颈方面的已知担忧:具名概念可以存在,却不控制最终预测。
因此,RECAP 验证的是一项存储声明:指定内容以可恢复的形式存在于选定位置。它并不验证这些内容导致了答案、捕获了完整的推理过程,或排除了其他隐藏计算。
这一边界防止人们过度解读 AUC 结果。0.96 的探针分数并不意味着系统有 96% 是诚实的。它意味着在特定数据集、模型、目标定义和攻击类别下,探针能够较好地对真实与虚假陈述进行排序。
这篇论文还是提交至 arXiv 的预印本,并非已经形成的科学共识。仍然有必要进行独立复现、同行评审,以及在更大架构上的测试。现有结果既是支持该方法的有前景证据,也是对某项指标的警告。
可验证激活解释的下一步
下一阶段应测试指定可读性能否经受住前沿训练、开放式陈述,以及以激活本身为目标的对手。
第一个值得关注的信号是更大规模的复现。Pythia-160M 提供了受控的训练环境,但现代已部署模型拥有更多参数,并采用不同的数据混合、目标和后训练流程。
成功的复现不应只报告最终的探针 AUC。它还应测量语言建模成本、不同随机种子下的性能、经过指令微调后的持久性,以及从未被指定的对照项的行为。
如果可解码性在更大模型上仍能以较小的能力成本维持较高水平,那么论文的核心机制将获得更多支持。如果成本急剧增长,或后训练消除了该信号,RECAP 就会更像一种研究工具,而非部署策略。
第二个信号是超越封闭词汇表陈述的进展。目前的测试询问已知词语或合成槽位值是否出现在激活中。真实世界的监督需要处理不确定性、隐藏目标、违反政策以及证据来源等属性。
这些属性没有简单的标签。外部目标可能包含噪声、不完整,或存在争议。研究人员需要证明,当概念无法简化为干净的词元存在性任务时,RECAP 仍然有用。
可信的开放式评估应区分几个问题。模型是否存储了这些信息?独立读取器能否恢复它?生成的文字是否准确陈述了它?模型在生成答案时是否使用了它?
第三个信号是覆盖完整训练栈的对抗性评估。所报告的攻击是在生成后编辑解释。经过策略性训练的模型则可能重新组织其内部计算,将信息隐藏到受监控子空间之外,或通过具有误导性的相关因素满足辅助头。
关于推理监控器的既有研究警告称,针对监控器进行优化可能会促使模型实施混淆。RECAP 避免直接奖励模型成功对抗最终独立探针,但目标模型在训练期间仍然会承受辅助压力。
未来的实验应包括隐藏的监控器、独立选定的目标,以及不向训练团队公开的评估。实验还应测试攻击者能否在保持辅助头准确率的同时,将与决策相关的计算转移到其他位置。
对于开发者来说,实际要点已经足够明确,可以立即采取行动。不要将高重建度解读为论断层面的真实性。应将每个激活解释视为一份需要通过反事实测试和独立证据加以验证的报告。
对于模型构建者来说,RECAP 的可解码性监督提供了一个更具可测试性的设计方向。选定的内部内容变得更易于检查,因为可读性被直接训练进表征中,而不是通过日益复杂的文本生成来还原。
对于企业买家和 AI 用户来说,这项工作为向供应商提问提供了一个有用的问题:解释分数究竟验证了什么?令人信服的描述、重建的状态和具有因果忠实性的说明,是三种不同的产品。
论文标题概括了其核心建议:训练模型,而不是训练读者。然而,更广泛的启示甚至更为审慎。只有当目标选择得当、探针保持独立,并且审计人员尊重保证的狭窄边界时,训练可读表征才会有所帮助。
RECAP 并未使神经网络变得透明。它围绕选定的内部事实建立了一份可衡量的契约。未来一到三个月内,我们应能看到其他研究人员是否可以在更大的模型、更广泛的论断和更强的对手条件下复现这份契约。


