top of page

幻觉检测器研究发现的是下限,而非通用信号

r/MachineLearning 上的一名研究者称,一种预注册检测器在首个 token 出现前,已在 20 次模型部署中的 18 次达到目标。然而,这一结果并未证明存在通用的幻觉检测器。相反,它指向了一个由模型内部几何结构构成的共享性能下限。

这一区别很重要。即使无法识别每一个错误答案,能够跨越多种模型迁移的检测器仍可成为有用的路由信号。不过,目前的证据来自一篇社交媒体帖子,其中描述的实验尚未发表,或尚未经过独立审查。

该帖子还报告了一个值得注意的反转结果:加入模型自身置信度后,部署覆盖范围并未超过仅使用几何信息的检测器。失败的仍是同样两次部署,表明在这项测试中,置信度与几何信息捕捉到了重叠的信息。

这一发现给两种常见方法带来压力。一种将 token 概率视为便捷的事实性评分;另一种则预期单一内部特征能够跨架构、数据集和幻觉类型泛化。报告中的实验并不支持这两种预期的最强形式。

预注册测试在 20 次部署中通过了 18 次

核心结果是一项有限条件下的成功:据称,一种基于几何信息的检测器达到了其预注册覆盖率门槛,但并不具备通用性。

根据原始的 MachineLearning 帖子,该研究者在十个语言模型上评估了两项任务。这在首次运行中形成了 20 个模型—任务部署组合。

该项目考察了来自四大类的 29 种模型内部信号。这些类别涵盖注意力模式、残差流运动、读出几何结构和置信度。随后,选择器会根据评估数据出现前就已制定的规则,为每个模型选出一种信号。

一次前向传播是模型针对给定输入完成的一整套计算。该检测器会在生成文本可用前检查这项计算。这使它区别于那些依据文档验证已完成答案,或比较多个采样回复的系统。

生成前限制使得所报告的 18/20 结果颇具意义。如果能够复现,检测器可在应用花费时间生成长答案之前分配风险等级。产品随后可能请求检索、将查询路由至另一模型,或要求人工审核。

按照预注册规则,仅几何检测器至少需要通过 17 次部署。帖子称其通过了 18 次。这支持了一项较窄的主张:源自几何信息的信号能够在受测条件下建立广泛但不完整的覆盖范围。

这个数字并不意味着检测器捕捉到了 90% 的幻觉。部署覆盖率和检测准确率是不同的衡量指标。在 18 次部署中达到阈值,只说明该方法在这些设置下满足了特定标准。

底层阈值、类别平衡、数据集构建方式、校准过程和每次部署的不确定性,都会影响读者对这一计数的解读。在缺少完整实验材料的情况下,这一结果无法换算为生产环境中的错误率。

预注册通过限制在看到结果后修改假设的机会,增强了研究设计。它并不能验证标签、排除实现错误,也不能保证所选测试能够代表真实应用。

帖子称该流程进行了两次预注册。这一细节表明,研究者尝试将探索性决策与验证性测试分开。若能独立获取两份注册材料,将有助于澄清哪些特征、阈值、排除条件和统计测试是预先固定的。

因此,最严谨的解读仍应有所限定。据称,仅几何方法在大多数受测部署中跨过了既定门槛。其余失败案例同样重要,因为它们界定了该主张的边界。

为什么置信度未能扩大覆盖范围

最显著的反转并不是置信度表现不佳,而是据称它在几何信息之外没有增加任何覆盖。

模型置信度通常指分配给可能的下一个 token 的概率。较高数值意味着模型强烈偏向某一种续写,而非其他选项。这并不能证明该续写符合外部现实。

据称,该实验将几何信息与模型置信度结合。该组合检测器同样在 20 次部署中通过了 18 次。它错过了相同的两次部署,也没有挽回任何一次。

针对更强主张的预注册门槛是至少通过 19 次部署。组合方法未能达到这一标准。按照报告中的决策规则,置信度扩大覆盖范围这一命题被证伪。

这一结果并不表明置信度不含任何有用信息。它表明,在这些任务和模型中,其有用变化可能与所选几何信号重叠。不同的数据集或校准方法或许会揭示互补信息。

这里的几何信息指内部表征之间可测量的空间关系。这些表征是模型处理提示词时用于编码信息的向量。它们的范数、角度、方向以及跨层运动,都可能与答案正确性相关。

置信度源于同一个底层网络。因此,模型输出附近的几何测量很可能已捕捉到 token 概率所表达的大部分信息。帖子报告的零挽回结果与这一解释一致。

近期研究也警告,几何指标并不能相互替代。2026 年一项关于几何检测指标的研究发现,不同统计量会对不同属性作出响应,包括正确性、相关性、连贯性、完整性和置信度。

该研究还报告了对领域迁移的显著敏感性。能够区分正确与错误历史答案的信号,在数学任务上可能表现不同。其作者引入了归一化方法,并报告其在多领域评估中的提升,突显了校准如何塑造结果。

更广泛的教训是,“幻觉”涵盖了多种失败机制。模型可能一贯陈述常见误解、在多个答案中猜测、忽略已提供证据,或出现推理错误。这些失败不一定共享同一种内部特征。

置信度对于弃答策略仍然有用,尤其是在已知部署分布上完成校准时。不过,应用不应仅仅因为原始置信度易于获取,就把它视为独立的事实性证据。

这一区别会影响产品设计。置信度阈值或许能识别不确定性,而几何评分则识别相关的不稳定性。组合两个高度相关的信号,可能营造出冗余的表象,却没有增加新的证据来源。

真正互补的层应当检查不同的事物。它可以将主张与检索到的记录进行比较、测试逻辑一致性、核验引用,或检查工具结果是否支持答案。这些检查针对的是证据,而非内部犹豫。

MachineLearning 的主张挑战通用检测

共享下限在运营上具有价值,但通用检测器需要在任务、模型和错误定义上提供更强的证据。

据报告,该实验始于一个雄心勃勃的问题:一类内部信号能否在生成前广泛地用于检测幻觉?其答案似乎是:可以形成下限,但不能实现通用性。

这并非语义上的区别。通用检测器应当无需依赖有利的任务结构、架构特定的校准,或狭窄的错误定义就能迁移。在 20 次部署中出现两次失败,已足以否定这一绝对主张。

结果仍有现实价值。生产系统很少需要一个评分来判定每一个事实问题。它们需要的是一个能够可靠识别足够多高风险案例的闸门,以证明采用成本更高的验证路径是合理的。

设想一个回答内部政策问题的企业助手。生成前评分可以在开始起草之前,将高风险提示词路由至检索流程。最终答案仍需由检索到的政策文件支撑。

代码助手则是不同的场景。相关失败可能涉及虚构的库方法、不兼容的版本,或跨多个文件的错误推理。针对简短事实答案校准的检测器未必能迁移到这一环境。

长篇研究则形成了另一重边界。一份回复可能包含数十项主张,其中一些有证据支持,另一些则是错误的。在第一个 token 出现前取得的单一评分,无法识别后续哪一句会失败。

这一限制解释了为什么部署覆盖率不应与主张层面的验证混为一谈。检测器或许可以估计提示词—回复轨迹是否存在风险,但无法独立证明其后每一项命题的真实性。

相关研究支持早期信号存在的可能性。2026 年论文 Before the First Token 使用来自三个事实性数据集的 552 个标注样本,评估了七个自回归 Transformer。

其作者报告称,对于参数量低于 4 亿的模型,探针性能处于随机水平。在约 10 亿参数以上,他们在一些模型中观察到更强的生成前信号。这一模式还取决于指令微调。

论文发现,Pythia-1.4B 和 Qwen2.5-7B 存在显著的位置零效应。然而,尽管规模更大,Pythia-6.9B 仍表现出平坦的时间轮廓。这一对比反驳了基于参数量的简单规则。

研究人员还报告称,沿检测到的方向进行激活引导并不能纠正幻觉。换言之,该信号是相关性的,而非因果性的。检测到风险状态,并不意味着改变这一状态就会产生真实答案。

这一边界应当引导人们解读 Reddit 上的主张。内部模式可以预测结果,却不代表存在专门的真相回路。它可能编码任务难度、提示词熟悉度、可回答性,或其他与正确性相关的变量。

通用检测器需要区分这些替代解释。它应当在新领域、提示词格式、语言、模型家族和后训练形式下保持性能,也应当经受住旨在破坏其假设的刻意尝试。

因此,帖子中邀请他人复现或质疑结果至关重要。下一阶段不应是更大的标题,而应是围绕两次遗漏案例,以及原始任务未涵盖场景设计的对抗性测试套件。

现有检测器解决的是问题的不同部分

该领域正趋向分层检测,因为内部几何信息、语义不确定性和外部验证回答的是不同问题。

一种颇具影响力的方法测量语义熵,即多个生成答案在含义层面的不确定性。如果重复回答表达了不同主张,模型更有可能在编造内容。

一项经同行评审的语义熵研究测试了参数规模从 7B 到 70B 的 LLaMA、Falcon 和 Mistral 模型家族。研究报告称,在所评估的这些模型家族和规模中,AUROC 值稳定在 0.78 至 0.81 之间。

AUROC 衡量的是一个评分在不同阈值下将正例排在负例之前的能力。它并不说明某一具体应用会遇到怎样的假阳性率。运营方仍需根据自身成本设定合适的阈值。

语义熵与生成前检测器有显著区别。Nature 的方法在主要的句子级实验中使用了十次生成。它先按语义对答案分组,再衡量这些答案的变化程度。

这一程序能够检测在不同样本中变化的任意错误答案。但若模型始终自信地重复同一错误说法,它可能无法检测到。作者明确将该方法限定于检测编造内容,而非所有被标记为幻觉的行为。

成本也不同。采样多个答案并比较其语义,需要的计算量大于读取一个内部状态。单次通过的检测器可作为有吸引力的早期筛选器,尤其是在大多数查询都很常规的情况下。

黑盒系统带来了另一项限制。商业应用开发者通常无法查看注意力图、残差流或隐藏向量。他们通过 API 得到的往往只是文本,或许还有 token 概率。

因此,内部几何特征更适用于开放权重模型、自托管部署,或愿意暴露适当遥测数据的提供商。语义一致性方法可以适用于黑盒文本输出,但需要重复生成。

基于检索的验证走的是第三条路径。它检查答案是否以提供的文档为依据。当正确证据存在时,这能捕捉到自信的错误,但检索本身也会引入失败模式。

检索器可能返回过时的政策、遗漏相关段落,或将误导性文档排在首位。语言模型随后可能引用一个并不支持其句子的来源。基于事实依据的系统需要主张级检查,而不只是确认文档是否存在。

在高风险场景中,人工审核仍然必不可少。风险评分可以帮助确定优先级,但审核人员需要访问原始证据和审计轨迹。一个可搜索的知识库可以帮助团队保留这些来源上下文。

这些方法应被视为不同层次,而非可以直接互相替代的方案。内部检测器关注模型的计算过程是否类似于高风险案例。语义熵关注采样语义是否保持稳定。检索则关注现有证据是否支持该主张。

生产流程可以结合三者,而不假装它们彼此独立。早期信号负责路由查询,语义检查审视不确定的输出,证据检查验证重要主张。人工审核则处理后果足以证明其成本合理的案例。

置信度与几何特征之间被报告存在的冗余,进一步支持了这种分层观点。从同一网络添加更多测量指标,并不一定会带来更多知识。系统中的某个环节必须引入独立证据。

验证缺口仍然很大

所报告的预注册提高了可信度,但在其他人能够检查和复现实验之前,公开主张仍然不完整。

原始帖子提供的是结果摘要,而不是经过同行评审的记录。读者需要查看注册材料、代码、数据集、模型检查点、提示词、标签以及完整的部署级结果,才能评估这一发现。

“诚实选择器”这一表述也需要精确定义。当研究人员利用评估数据选择指标、层、符号、阈值或转换方式时,特征选择可能泄露信息。一个干净的数据划分必须覆盖每一项自适应决策。

为每个模型选择一个信号带来了第二个问题。一组特征可以广泛迁移,但最终选定的特征可能因模型而异。这并不像一个参数固定、在任何地方都保持不变的单一检测器那样具有普遍性。

特定模型的选择在实际运营中仍可能是合理的。团队通常会为每个部署校准安全阈值。不过,这一主张应区分通用特征族与参数固定的通用检测器。

相比汇总计数,两个部署失败的情况更值得关注。它们可能共享某种架构、任务、规模、调优方法或标签分布。共同原因将有助于识别所提“底线”在哪些地方失效。

真实标签的不确定性同样重要。幻觉标签可能取决于任务衡量的是事实正确性、对上下文的忠实性、相关性还是逻辑一致性。在不了解目标定义的情况下,无法解读检测器。

“之前”一词也可能掩盖技术选择。模型在选择第一个输出 token 之前,已经处理了完整提示词。因此,它的隐藏状态可能编码了提示词难度、熟悉程度以及可能的答案内容。

这仍然属于生成前检测,但并不意味着无需模型计算的预测。应用至少必须完成提示词处理阶段。对于长上下文,这一阶段可能占据推理成本中相当有意义的一部分。

实验还应报告类别患病率和置信区间。仅凭通过次数无法看出某个部署是勉强越过阈值,还是远超阈值。小型测试集可能产生不稳定的排序。

自适应攻击带来了另一个挑战。用户可以改写问题、注入无关上下文、要求特定答案风格,或迫使模型进行长篇推理。在常规提示词上校准的检测器,可能会在提示词结构变化时失效。

即使产品品牌保持不变,模型更新也可能改变内部几何特征。量化、微调、适配器、系统提示词和推理设置都可能改变测得的信号。每一次变化都可能需要重新验证。

研究模型与托管前沿系统之间也存在差异。对于架构、路由和后训练过程仍未公开的系统,不能假定内部状态技术可以直接迁移。

关于模型为何产生幻觉的近期研究又增加了一层复杂性。一项 2026 年的评估激励研究认为,下一个 token 训练和以准确率为中心的评估,会奖励猜测而非弃答。

检测器可以标记高风险猜测,但无法改变促使猜测出现的激励机制。部署团队可能需要采用奖励适当拒答的评分规则,同时结合检索、验证与风险检测。

因此,“20 个中有 18 个”应当是调查的起点,而不是终点。一项有价值的复现实验应冻结已发布的流程,测试未见过的模型家族,并披露每一次失败,而不是替换原始阈值。

三项测试将决定这条底线是否成立

如果同一条底线能够经受独立复现、分布偏移和生产式路由测试,其主张就变得重要。

第一个需要关注的信号是完整发布。发布内容应包括两份预注册记录、代码、特征定义、模型标识符、任务数据、标签、阈值和部署级评分。

这样的发布能让信息泄露和选择决策接受审计,从而强化主张。若缺少注册记录或各模型结果不完整,尤其是仅提供成功配置时,主张就会被削弱。

第二个信号是在未见模型和任务上的独立复现。信息量最大的测试应包括未参与开发的开放权重架构、多语言提示词、长文本回答、工具使用以及基于文档的生成。

复现应先保留原始流程,再允许研究人员进行任何调优。如果性能只在领域偏移后下降,该检测器或许仍可作为经校准的本地闸门使用。但这并不足以支持通用底线的说法。

第三个信号是与运营结果挂钩的路由试验。研究人员应衡量:当早期评分触发检索、拒答、重新采样或人工审核时,是否能减少缺乏支持的主张。

这种试验需要的不只是 AUROC。它还应报告误报、漏报、延迟、额外计算量、审核量以及被接受答案的准确率。这些指标决定检测器究竟是在节省资源,还是仅仅转移错误。

最有希望的结果并不是一个完美的真相计量器,而是一个低成本的第一道闸门:它能在生成前捕捉到稳定的一部分高风险提示词,并将其交给一种真正不同的验证机制。

所报告的置信度结果使这一设计更具紧迫性。如果置信度与几何特征仍然冗余,团队就应停止将二者的组合视为两张独立选票。它们应将内部评分与来源检索或主张验证相结合。

评估这项工作的开发者可以立即提出三个问题。检测器能否在我们的数据上保持其阈值?它的漏报是否集中于某种可识别的失败类型?在计入所有成本后,对被标记的提示词进行路由是否改善了最终准确率?

更广泛的机器学习社区应通过受控测试来尝试推翻这条所提底线,而不是依赖孤立的轶事。失败的复现会缩小主张范围。成功的复现则会建立一个有用的共享信号,而不假装它能检测每一种幻觉。

这正是所报告结果的真正价值。它将寻找单一通用检测器的目标,替换为一个可衡量的假设:模型几何特征或许能够提供广泛的早期预警,但真相仍需要独立证据。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page