神经系统可以弃答或修订,却仍难以同时做到两者
- Sophie Larsen

- 8月6日
- 讀畢需時 16 分鐘
8 月 6 日发布的一场 Horizon MachineLearning 讨论提出:尽管针对其中每项测试的研究已持续数十年,是否存在一个系统能同时通过四项测试。它必须保留一项尚未解决的命题,留存其来源及暂缓判断的理由,在相关证据到来时重新审视它,并避免无关变更。
这一组合带来的挑战比普通的不确定性估计更为尖锐。模型不能只是说:“我不知道。”它必须准确记住哪些内容仍然未知,说明为何暂缓判断,并识别能够改变这一状态的证据。
原始讨论并未提出新模型或实验结果,而是汇集多个成熟领域,提出了一个研究问题。值得注意的发现是,似乎尚无被广泛接受的端到端评估将它们结合起来。
选择性预测处理拒答。归因将输出与证据相连。持续学习处理后续信息。模型编辑改变选定行为。真值维护系统追踪论证依据,并撤回依赖于这些依据的信念。
每个领域都提供了部分机制,但没有哪个领域显然涵盖了帖子所描述的完整生命周期。
这一缺口之所以重要,是因为已部署的神经系统越来越多地面对不断变化的证据。医疗记录会收到新的检测结果。合规团队会替换过时政策。调查人员会在新文件出现后重新评估主张。个人知识系统则会整合可靠性随时间变化的笔记。
因此,核心较量并非一种架构对抗另一种架构,而是模块化成功与生命周期完整性之间的较量。当同一命题必须跨越时间、来源、修订和相邻知识而持续存在时,单个组件看似具备的能力便会受到考验。
Horizon MachineLearning 问题究竟在问什么
所提出的测试关注的是一项未决主张的生命周期,而不只是模型能否拒绝给出某个答案。
假设系统从来源 S 接收到命题 P。系统缺乏足够证据,无法因某个特定理由 R 将 P 判定为真或假。
传统分类器可能给出较低的置信度分数。选择性预测器可能选择弃答。语言模型可能回应称,现有证据不足。
这些回应处理的是即时输出,但并不保证系统会在交互结束后,仍将 P 作为一个独立的未决对象保留。
所要求的行为增加了持久性。系统应分别保留 P、S 和 R,而不是把不确定性转化为一种弱持有的事实关联。
它还增加了条件式修订。只有当新证据 E 针对已记录的暂缓理由,或以其他方式改变相关证据状态时,系统才应重新审视 P。
重复同一未经支持断言的来源不应符合条件。有关相邻主题的无关信息不应触发修订。后来的矛盾信息也不应悄然覆盖原始溯源信息。
最后,系统应限制连带改变。修订 P 应更新合理的后果,同时保留不依赖于 P 的主张。
这些要求可以分为四项可观察属性。
第一,持续的认知暂缓意味着系统能够跨越时间和后续查询,维持一种不作承诺的状态。如果模型之后又将 P 表述为已有定论,那么一次即时拒答并不充分。
第二,溯源保留意味着系统会记住 P 来自何处,以及为何未被接受。附在生成文本上的引用只覆盖了这一要求的一部分。
第三,证据触发的修订意味着证据的相关变化会导致受控的状态转换。仅仅接触更多文本不应算数。
第四,有界的连带改变意味着更新会修改适当的下游行为,而不会损害无关能力。这类似于模型编辑中的局部性,但还包含时间和证据条件。
评估需要联合测试这四项属性。通过四个彼此独立的基准测试,无法证明同一个系统保持了它们之间的关系。
这一差别很重要。一个流程可以在数据库中存储引用,却在生成时丢失它们。它可以在摄取阶段准确估计不确定性,却在之后丢弃暂缓状态。
它也可以成功执行一次编辑,却无法证明该编辑是由新证据引发的。同样的机制可能会像接受经核实的修正一样轻易地接受未经支持的指令。
因此,这个问题要求的不只是功能聚合。它要问的是,系统能否从首次接触到后续修订,维持一份连贯的认知记录。
选择性预测解决的是第一次决策,而非等待期
选择性预测为神经系统提供了有原则的拒答选项,但其标准评估对于持续暂缓而言结束得太早。
选择性分类将预测器与选择函数配对。模型会回答覆盖范围内的案例,并对被视为风险过高的案例弃答。
研究人员通常通过风险—覆盖率权衡来评估这种行为。覆盖率衡量获得预测的样本占比。选择性风险则衡量被接受样本中的错误。
该框架直接处理了普通分类的一项高代价弱点:被迫回答每个输入的模型,无法区分困难案例和能够可靠处理的案例。
SelectiveNet 将拒答选项纳入端到端训练。其作者联合优化预测与拒绝,而非仅在预训练网络上设置置信度阈值。
SelectiveNet 论文报告称,在多个分类和回归数据集上,其风险—覆盖率表现有所提升。这一结果为学习式弃答建立了有用先例。
后续工作通过校准置信度估计器、保形方法和特定任务的拒答目标扩展了选择性预测。这些方法能够判断何时一个答案带有过高的估计风险。
然而,拒答决策通常只附着于某一评估时刻的单个输入。基准测试询问的是系统是否正确弃答,而非之后这项未决内容发生了什么。
这留下了几个未解问题:系统是否将该命题作为未决事项存储?是否保留了理由?在后续训练或交互之后,能否检索到相同的状态?
不确定性估计呈现了一个相关边界。认知不确定性描述与知识有限相关的不确定性,而偶然不确定性则涉及观测中不可约的变异性。
集成方法、贝叶斯近似、校准方法和分布外检测器估计不确定性的不同方面。然而,不确定性分数并非结构化的理由说明。
接近二分之一的概率无法说明:系统是缺乏证据、面对相互矛盾的来源、不信任该来源,还是无法解释这项主张。这些理由意味着不同的修订触发条件。
校准构成了另一项部分先例。校准后的模型会在既定条件下,使报告的置信度与观察到的正确率频率相一致。
这对于决定是否采取行动很有价值,却不会形成一份持久记录,解释某项特定命题为何仍未得到解决。
即使保形预测也提供了比完整设想更狭窄的保证。它可以在特定假设下生成具备覆盖率属性的预测集合,但并不天然维护按来源区分的信念历史。
这是文献中的第一条主要边界。选择性预测建模的是现在是否回答;所提出的生命周期还建模了等待期间应保留什么。
这种等待状态不能被视为空输出。它包含后续行动所需的信息:命题、其溯源、未解决的理由,以及符合条件的证据条件。
对于已部署系统,这一区别会改变产品行为。临床助手应区分“尚无检测结果”和“两项经验证检测结果相互矛盾”。
政策助手应区分“规则未作规定”和“所提供文件的权威性不确定”。两种情况都足以支持弃答,但它们需要不同的后续证据。
选择性预测仍是描述初始决策的最有力术语。持续认知暂缓是这一较长生命周期状态的合理名称,尽管它尚未成为标准化基准类别。
溯源可以为答案提供依据,却不必然保留信念历史
归因研究将输出与来源相连,但来源支撑并不会自动保留一项主张为何未解决。
自然语言生成研究越来越多地评估输出能否得到已识别证据的支持。这与溯源密切相关,尽管分析单位通常是生成文本。
“可归因于已识别来源”框架将关于外部世界的主张视为可根据所提供来源进行验证。其评估流程会询问:被引用的来源是否支持输出,以及该来源是否可识别。
AIS 框架在对话式问答、摘要和表格到文本生成任务中验证了这一方法。它为基于来源的输出评估提供了具体语言。
检索增强生成则加入了另一种相关机制。检索器选择外部段落,生成器据此生成回答。
一些系统保留文档标识符或引用跨度。另一些系统使用自然语言推理来检查生成的主张是否可由检索上下文推出。
一篇 EMNLP 行业论文推出了名为 Provenance 的轻量级事实性检查器。它使用紧凑的推理模型,将疑似非事实输出追溯到特定上下文块。
Provenance 检查器表明,局部来源追踪可以支持下游修正。这为将输出失败与其证据相连提供了有意义的先例。
然而,输出归因与信念溯源回答的是不同问题。归因询问的是:哪个来源支持这条生成的陈述?信念溯源询问的是:系统为何目前为某项主张赋予特定的认知状态?
系统可以引用 S,却仍未记录 S 被视为不可靠。它可以保留检索到的文本,却不保留阻止其接受该主张的确切冲突。
它还可以完全不生成答案。在这种情况下,传统引用评估可能无内容可评分,尽管未决记录仍然很重要。
因此,溯源保留需要比引用列表更丰富的状态。每项命题可能都需要来源身份、摄取时间、提取上下文、信任评估和依赖关系链接。
它还需要负面信息和程序性信息。系统应记录证据不足、彼此矛盾、已过时、超出来源能力范围,或受另一项条件阻碍的情况。
这些元数据会影响修订。较新的文档可能解决过时性问题,但未必能确立权威性。权威来源可能解决可信度问题,却仍无法消除直接矛盾。
关于数据血缘的研究提供了有用的基础设施概念。数据血缘记录某个工件如何在系统中被创建、转换和使用。
然而,血缘通常关注数据集、特征、训练运行或生成工件。它未必能建模一个命题被暂缓判断时的真值状态。
知识图谱提供了另一种部分结构。它们可以将主张、来源、时间戳和关系表示为显式的节点与边。
命名图和具体化可以为单个陈述附加溯源信息。规则系统随后可以依据这些注释传播或撤回结论。
当神经组件压缩这些结构时,挑战便会出现。神经表征可能支持流畅的检索,却会掩盖究竟是哪一个来源导致了哪一种关联。
这正是为什么即使不需要新的神经架构,外部记忆仍可能至关重要。系统可以将认识论记录存储在模型权重之外,并使用神经模型进行检索、比较和生成。
这种设计将持久状态与概率推断分离开来。它也让溯源检查和修订变得更可行。
代价是集成复杂度。开发者必须确保生成的答案遵循外部记录,尤其是在模型参数中包含相互冲突的已学习关联时。
设计良好的知识库可以保留来源上下文,供人工审查。它本身并不能保证神经行为会对证据保持敏感。
研究缺口正位于这一边界。溯源信息必须塑造系统的弃答与后续修订,而不应只是出现在最终答案旁边。
真值维护具备语义,而神经学习具备规模
经典信念修订系统比大多数神经基准更直接地描述了所需的状态转换。
真值维护系统旨在跟踪信念、其正当理由,以及假设变化带来的后果。它们或许为这一完整需求提供了最接近的概念先例。
基于假设的真值维护系统可以表示替代性上下文,并识别支撑某个结论的假设组合。基于正当理由的系统则记录信念之间的依赖关系。
当某个前提失效时,依赖它的结论可以被撤回。只要支撑理由依然成立,不相关的结论便会保持不变。
这种行为类似于由证据触发、且附带有限连带变化的修订。区别在于,经典系统通常在显式符号表征上运行。
信念修订还提供了额外术语。扩展是加入一项信念,收缩是移除一项信念,而修订是在恢复一致性的同时纳入一项信念。
非单调推理同样重要。在非单调系统中,新信息到来后,既有结论可以被撤回;这不同于纯粹的单调逻辑。
这项 Reddit 提议在修订之前增加了一项独特要求。系统必须保留一个命题,但既不接受它,也不接受其否定。
这类似于多值逻辑中的显式“未定”状态。它也类似于论证框架中对已接受、已拒绝和未决定主张的区分。
这些传统早已将暂缓判断视为有意义的状态。它们还可以保留理由、反对论证和依赖结构。
神经系统带来两项复杂因素。首先,其内部知识通常分布在许多参数之中,而不是以显式命题的形式存储。
其次,其输出取决于提示词、上下文、解码方式,以及已学习模式之间的交互。更新一个关联可能影响任何可见依赖图之外的行为。
神经符号系统试图结合统计学习与显式推理。它们提供了自然的架构方向,因为符号记忆可以保留命题级状态。
不过,将解决方案称为神经符号并不能解决评估问题。一个系统可以暴露符号记录,却仍允许其生成器与这些记录相矛盾。
基准必须测试系统在改写、上下文、时间步和相关证据上的可观察行为。若系统暴露了存储的溯源信息,也必须检查这些信息。
一种现实的测试序列可以从来自低权威来源的模糊主张开始。系统应当弃答,并记录与该来源相关的具体原因。
研究人员随后会提出不相关的查询、加入干扰文档,并改变相邻事实。暂缓状态应保持稳定。
接着,他们会提供多种证据类型。其中一些应当相关但不足够;另一些则应当解决已记录的理由,却并不支持该命题。
只有符合条件的证据才应触发修订。新状态应在直接提问、改写表述和有效的下游推论中一致呈现。
最后,研究人员会测试不相关行为是否发生漂移。他们还会检查,移除或使新证据失效后,系统是否恢复到恰当的状态。
最后一步揭示了它与普通持续学习的另一项差异。学习新数据并不等同于维护可撤销的正当理由。
持续学习关注在连续更新后获取新任务或数据,同时减少灾难性遗忘,即顺序更新后的广泛性能损失。
回放缓冲区、参数隔离和正则化可以保留既有能力。这些方法通常并不决定某一具体证据是否足以支持修订某一具体命题。
它们保护跨时间的学习,但未必能为变化提供认识论条件。
因此,最接近端到端方案的系统可能需要结合多个传统。选择性预测提供拒答决策。显式记忆保留命题和溯源信息。
真值维护逻辑负责管理依赖关系和修订触发条件。持续学习或模型编辑则控制之后神经行为如何变化。
集成目标很明确。悬而未决的问题是,这些部分能否形成一份连贯且可测量的契约。
局部模型编辑揭示了连带变化问题
模型编辑直接衡量定向修订,但当前证据警示,看似局部的变化可能隐藏着更广泛的损害。
知识编辑旨在改变模型的特定行为,而无需重新训练整个模型。典型基准会测试编辑是否成功、能否泛化到改写表述,以及是否保留不相关输出。
可靠性考察编辑后的模型是否会针对目标查询返回预期答案。泛化性检查等价表述或相关上下文。
局部性衡量预期编辑范围之外的行为是否保持稳定。可迁移性有时测试新事实是否能在相关情境中支持恰当推理。
这些维度与所提生命周期的后半部分高度匹配。一个命题发生变化,相关行为随之变化,而不相关知识应保持完整。
然而,模型编辑通常以给定的目标答案为起点。它未必评估证据是否证明该目标答案正当,或是否解决了先前暂缓判断的理由。
编辑器会接收诸如将一个事实关联替换为另一个关联的指令。认识论决策已经在该方法之外作出。
这使编辑成为实施修订的机制,而不是关于何时应发生修订的完整解释。
ROME、MEMIT、MEND 及相关方法提供了不同的模型行为修改方式。有些修改选定权重,另一些则使用学习型编辑器或外部记忆。
它们的基准形成了有用的术语,尤其是有效性、泛化性、局部性和可迁移性。这些术语可以为未来评估中有限变化的部分提供锚点。
不过,近期评估对乐观的局部性结果提出了质疑。一项 NeurIPS 2024 研究考察了编辑后的更广泛能力,而不止是标准的目标和邻域测试。
这项编辑评估报告称,随着编辑不断累积,模型在通用基准上的表现出现恶化。它还发现,编辑后的模型安全行为有所减弱。
这些结果并不表明所有编辑方法都会在每种部署中失败。它们表明,狭义定义的局部性指标可能遗漏更广泛的行为变化。
一篇 2026 年预印本进一步强化了这一担忧,它质疑常见的特异性协议是否足够敏感地衡量知识保留。特异性是编辑局部性的另一种说法。
这篇局部性批评认为,既有协议存在概念和测量层面的弱点。其作者提出了一种更敏感的评估方法。
这些证据支持 Reddit 讨论中最具挑战性的要求。有限的连带变化不能从一小组不相关查询的成功结果中推断出来。
更强的测试需要覆盖与目标的多个距离。它应涵盖直接改写、合理后果、相近但独立的事实、遥远能力,以及安全行为。
预期结果也随距离而变化。直接改写应当一致地改变。只有当其前提确实依赖于 P 时,逻辑后果才应改变。
相近但独立的事实应保持稳定。广泛能力和安全约束不应出现实质性退化。
基准必须区分传播与连带损害。完全不影响相关后果的修订过于狭窄,而改变松散关联内容的修订则过于宽泛。
来源溯源还增加了另一种困难情形。如果两个来源相互矛盾,系统可能需要依赖上下文给出不同答案,而不是进行一次全局权重编辑。
外部记忆层可以更自然地保留相互竞争的主张。检索随后可以根据时间、权威性、司法辖区或用户上下文选择证据。
但外部记忆并不能消除模型行为风险。生成器可能忽略检索到的证据、错误地合并来源,或表达出超出记录所支持程度的确定性。
这表明,没有单一局部性指标能够解决这一问题。评估必须包含存储状态、检索行为、生成的主张和下游决策。
同样的原则适用于知识融合。只有在来源边界和冲突仍可供检查时,整合信息才有价值。
因此,模型编辑最有力的先例是方法论上的。它展示了如何测试定向变化,也展示了狭窄评估多么容易夸大控制能力。
三个信号将表明研究缺口正在缩小
相比又一个孤立的弃答或编辑分数,该领域更迫切需要的是一个共享的纵向基准。
第一个信号是围绕命题历史而非独立样本构建的基准。每个案例都应包含来源、暂缓理由、干扰项、后续证据和依赖结构。
该基准应测试跨时间的重复交互。单轮回答无法证明持续的认识论暂缓。
它还应包含多种相互竞争的不确定性理由。缺失证据、冲突证据、低来源权威性、时间歧义和实体歧义需要不同的解决条件。
通过该基准将要求在符合条件的证据到来前保持稳定的未解决状态。之后也必须出现具有正当理由的状态变化。
第二个信号是一项具备溯源意识的修订策略,并包含明确的触发测试。研究人员应说明哪些证据属性允许发生每一种状态转换。
仅有相关性并不足够。一段文字可能提到 P,却未触及暂停判断的原因。
该策略应考虑来源身份、证据独立性、时间因素、矛盾情况,以及应用场景需要时的权威性。这些条件必须保持可检查性。
反事实测试能让这项策略更难被钻空子。研究人员可以在保留文本不变的情况下更改来源标签,或在保留来源不变的情况下更改文本。
他们还可以提供同一主张的重复副本。行为良好的系统不应将重复视为独立确认。
第三个信号是更广泛的附带变更审计。它应衡量修订后传播不足和过度传播两种情况。
研究人员需要准备目标查询、改述、依赖性主张、相邻事实、遥远任务以及安全检查。他们应在一系列修订后重复这些测试。
在应用支持的情况下,该审计还应包含可逆性。如果证据被撤回或失去可信度,系统应重新评估依赖于该证据的主张。
仅会覆盖旧行为的模型无法完整表达这种依赖关系。它可能需要在自身参数之外保留明确记录。
这些信号将强化相关领域正在趋同的主张。缺少这些信号则会支持当前结论:这一问题仍然碎片化。
开发者应关注术语,也应关注系统。相关工作可能以选择性预测、带归属的生成、时序知识编辑、非单调推理、可撤销推断或信念修订等名义出现。
研究人员也可能使用溯源、谱系、真值维护、认知状态或依赖导向回溯等术语。只搜索“AI abstention”会错过大量基础工作。
对于企业采购方而言,实际问题很直接:供应商能否展示系统拒绝相信什么、为何拒绝,以及后来是什么改变了其立场?
通用置信度分数无法回答这一点。遗忘先前冲突的引用界面同样无法回答。
对于开发者而言,这一问题会影响架构。持久的认知状态很可能应置于可检查的记忆层中,即使神经模型负责信息提取和推理。
对于知识工作者而言,保留溯源的修订决定了助手能否在项目演进中持续值得信赖。旧决策往往依赖于后来发生变化的证据。
现有文献支持每个主要组成部分。选择性预测支持弃答。归属支持来源锚定。真值维护支持有依据的撤回。
持续学习支持时序适应。模型编辑支持有针对性的行为改变,并为局部性问题提供警示性证据。
仍不明确的是,是否已有成熟评估在同一套协议下结合这些组成部分。8 月 6 日的讨论应被视为一个研究问题,而不是不存在此类评估的证据。
一个有说服力的答案需要的不只是相邻论文的清单。它应识别出一个系统:该系统从最初的暂缓判断,到证据触发的修订,再到附带影响测试,均经过评估。
在这类工作出现之前,最恰当的描述是整合缺口。各个组成部分已经存在,但它们的保证并不会自动组合。
研究人员可以通过发布命题历史、触发条件和具备依赖意识的局部性测试,将这一缺口具体化。实践者也可以要求已部署系统提供同样的证据。
下次当助手说它缺乏证据时,问问它保留了什么。然后再问,哪些确切证据会改变其状态,以及还有哪些结论会随之变化。
这些问题会将 horizon machinelearning 的讨论转化为可操作的测试。它们也会揭示,“我不知道”究竟代表持久的认知纪律,还是仅仅一句谨慎的表述。


