Sakana AI 同行评审捕获了 73% 的核心错误,但真实论文暴露出其局限
Sakana AI 表示,其同行评审系统检测出了影响论文核心主张的 73.43% 人为植入错误。然而,这一亮眼结果来自对合成矛盾的四次评审,而非对未经修改研究论文的常规评审。
这套名为 Multi-Layered Review 的系统,在 Sakana AI 新推出的基准测试中表现远超三个自动化评审基线系统。不过,在针对已记录问题的撤回 arXiv 论文进行测试时,其精确检测率降至 16.11%。
这一差距才是事件真正的核心。Sakana AI 同行评审提供了证据,表明谨慎的多轮阅读能够改善自动化批评能力。但它并未证明 LLM 能够可靠地验证科学研究。
这项研究反而促使开发者重新思考如何评估 AI 评审系统。仅仅匹配人类评分或生成有说服力的反馈并不足够。一个有用的评审者必须能够充分关联主张、方法、实验与证据,从而发现它们之间的冲突。
Sakana AI 的结果也出现在一段复杂的历史背景之下。该公司此前曾使用 AI 生成科学论文,并因此面临“通过同行评审究竟证明了什么”的质疑。其最新项目则将同一问题反转:AI 是否能够帮助人类识别薄弱研究。
Sakana AI 同行评审改变了测试方式
最重要的变化并非 73.43% 这一结果,而是决定以 AI 评审是否能发现错误作为评价标准。
此前许多自动化同行评审研究衡量的是相似性。研究人员会将 AI 生成的评审与人类反馈进行比较,检查二者评分是否相关,或衡量评论之间的重合度。
这些测试能够反映系统是否表现得像一名评审者,却无法直接证明它是否注意到了论文的核心错误。
Sakana AI 的同行评审论文提出了一种侧重验证的替代方案。其作者认为,错误检测是同行评审中最重要且最耗费资源的功能之一。
团队构建了一个包含 1,164 个修改版论文的 Contradiction Benchmark。这些变体源自 257 篇发表于 2025 年 ACL、AISTATS、CVPR 和 ICML,以及 2024 年 NeurIPS 的论文。
研究人员将收集范围限制为采用宽松 Creative Commons 许可的论文。这一限制使他们能够修改并重新分发这些稿件。
对于每篇论文,Gemini 2.5 Pro 都会生成一张知识图谱。知识图谱将主张、方法、证据及其关系表示为相互连接的节点。
随后,研究人员测量每个节点与主要主张之间的距离。距离为零意味着该节点代表核心主张;距离越大,则代表越边缘的细节。
GPT-4.1 重写了选定段落,使其与相应节点相矛盾。修改后的文本被插入原始源文件,并重新编译为完整 PDF。
这一流程让研究人员拥有已知的错误及其已知位置,也使他们能够根据每个错误对论文主要结论的直接威胁程度进行分类。
o3 模型负责判断生成的评审是否检测到每一处矛盾。评判过程针对每个样本运行十次,研究人员再对结果取平均值。
研究称,在干净论文上,评判模型的准确率达到 99.9%。人工分析发现,经确认的检测结果具有 86.8% 的灵敏度,表明自动化评分有时会漏掉合理的错误识别。
与判断模型是否听起来像评审者相比,这种设置提供了更清晰的测试。系统要么指出了植入的矛盾,要么没有。
不过,该基准测试衡量的只是评审工作中经过精确定义的一部分。它并不涵盖科学研究失败的所有形式,包括数据造假、不恰当的统计假设、隐藏的预处理错误或无法复现的实验。
这一区别很重要,因为标题中的数字专门指向核心主张矛盾。它不应被解读为科学评审整体具有 73% 的准确率。
Sakana AI MLR 系统为何能发现更多错误
Multi-Layered Review 通过迫使模型在评判论文前先理解论文,从而提升了错误检测能力。
完整的 Sakana AI MLR 系统包含三个角色:Appendix Agent、Literature Review Agent 和 Review Agent。这些组件在形成综合评估前,会处理稿件的不同部分。
Appendix Agent 使用 Claude Haiku 3.5,总结正文之外的实现与实验细节。此步骤有助于避免系统批评那些附录其实已经回应的遗漏。
可选的 Literature Review Agent 使用 Claude Sonnet 4 和网络搜索。其任务是将稿件置于现有研究背景中,并检验其新颖性主张是否合理。
核心的 Review Agent 同样使用 Claude Sonnet 4。它接收最多十页 PDF 格式的正文,保留公式、图表和版面信息,而这些内容可能会在纯文本提取中受损。
其工作流程借鉴了阅读研究论文时广为采用的三遍阅读法。第一遍会创建关于稿件主要思想的高层概要。
第二遍进行更细致的阅读,并将这些思想与支持它们的证据联系起来,同时记录假设、缺口和弱点。
第三遍将这些笔记与相关的附录和文献发现结合,随后给出优点、缺点、问题、建议、评分及行动清单。
这一序列解决了 LLM 评审工具中的常见失败模式。单一的大型提示词可能会要求模型同时概括、验证、比较、批评、评分并格式化一篇论文。
模型或许能够生成一份精致的评审,却未能构建对研究的稳定表征。它可能重复摘要中的主张,同时忽略结果中与之相悖的证据。
MLR 将理解与评估分离。这一设计为模型提供了中间笔记,使其能够将结论与支持结论的方法或实验联系起来。
基准结果表明,模型选择与工作流程设计都对改进有所贡献。在较简单的 LLM-Review 基线中,将 GPT-4.1 替换为 Claude Sonnet 4,令核心错误检测率从 14.56% 提升至 35.40%。
随后,单次 MLR 评审在同类核心矛盾上达到 60.79%。由四次 MLR 评审组成的集成将检测率提升至 73.43%。
在核心主张错误方面,表现最好的竞争结果为 AgentReview 达到的 14.81%。AI Reviewer 达到 11.17%,而原始 LLM-Review 配置达到 14.56%。
在所有被测严重程度的矛盾中,四次 MLR 评审检测到 40.95%。竞争系统则维持在 5.95% 至 6.50% 之间。
这些比较让其机制比绝对分数更值得关注。更换底层模型带来了显著提升,而多轮评审设计则进一步带来增益。
这意味着买家不能将“多智能体”视为对性能的充分解释。AgentReview 已经采用评审者、作者和领域主席角色,但其基准结果仍明显更低。
关键问题在于这些智能体实际做了什么。将一项任务分配给若干角色,与把稿件拆分为承载证据的组成部分、并通过反复阅读建立理解,是两回事。
MLR 也挑战了“更多 token 会自动带来更高评审质量”的假设。研究中,它每次完整评审使用 189,062 个输入 token,不到 AI Reviewer 的 403,654 个的一半。
较简单的 LLM-Review 仅使用 6,517 个输入 token,部分原因是它截断了较长内容。这种方法消耗的资源较少,却丢失了可能暴露矛盾的信息。
因此,有意义的取舍并不只是小与大,而在于系统是否把上下文投入到构建可供评审的论文模型上。
73% 的主张在基准测试之外大幅缩水
反对将 MLR 视为自主裁判的最有力证据,来自 Sakana AI 自己开展的真实错误评估。
研究人员使用 WithdrarXiv-Check 测试了 Review Agent。该数据集基于被撤回的 arXiv 论文及其相关撤稿说明,测试集包含 211 篇论文。
这项评估比检测植入式矛盾更难。真实研究错误可能分散在假设、推导、引用和实验之中,并不会产生显而易见的句子层面冲突。
作者为此次测试关闭了文献搜索组件。否则,系统可能会找到公开的撤稿通知,而非从稿件中自行发现问题。
MLR 在 16.11% 的案例中与记录的撤稿问题形成精确匹配。按照更宽松的标准,即接受实质上相似的担忧,它达到 26.07%。
最强基线在精确匹配上达到 9%,在相似匹配上达到 18.48%。MLR 仍然领先,但领先幅度远小于其在合成基准上的表现。
撤稿论文数据集还主要包含理论数学和物理学研究。这些评审系统围绕机器学习会议论文设计,限制了直接比较的有效性。
即便存在领域不匹配,性能差距仍揭示出一个核心限制。植入式矛盾给评审者提供了一个清晰可寻的分歧。真实缺陷往往需要重建证明、重新运行代码、检查数据,或具备专业领域知识。
该基准的作者也承认了另一个问题。人工评分者检查了 50 处合成矛盾,发现其中 34% 与相邻句子缺乏连贯的衔接。
只有 8% 听起来明显由 AI 生成,但被打乱的上下文仍可能提供检测线索。自动化评审者可能注意到某段文字不协调,却并不理解其背后的科学为何有误。
作者认为,这让基准测试更容易,而非失效。即使部分插入错误包含可检测的不规则之处,基线系统仍然表现吃力。
这一解释是合理的,但它改变了 73.43% 的含义。该数字是在受控矛盾任务上的高分,而不是对 MLR 在投稿论文中发现严重错误频率的估计。
四次评审的设置也值得注意。只要四份独立评审中的任意一份提及某个错误,集成系统就将该错误计为已检测。
这对作者端筛查很有用,因为收集多个警示信号可以扩大覆盖范围。但它不太能直接与“用一份自动化评审替代一位人工评审者”相比较。
单次 MLR 评审取得的 60.79% 核心错误结果依然可观。不过,在单次评审配置下,近十分之四的植入式核心矛盾仍未被发现。
随着矛盾距离论文的主要主张更远,性能也会下降。这一模式支持知识图谱的严重程度衡量方式,但也表明详细的次级错误仍然难以发现。
因此,对研究团队而言,实际使用场景是投稿前审计。自动化系统可以标记可能存在的不一致之处,并将人工注意力引向脆弱的主张。
它尚未准备好认证有效性。没有收到警告的论文不能被假定为正确,而收到警告也不能被假定为合理。
人类一致性有用,但并非科学验证
MLR 给出的判断与人类评审分数相似,但与评审者达成一致,仍不等同于发现真相。
在 ICLR 2025 投稿中,MLR 的分数与人类评分的 Pearson 相关系数为 0.586。人类评审者之间的参考值为 0.742。
在 NeurIPS 2024 论文中,MLR 达到 0.451,而人类参考值为 0.781。在 ICML 2025 上,MLR 达到 0.429,略低于 AI Reviewer 的 0.439。
这些数字显示出有意义的一致性,尤其是相较于那些几乎无法区分被接收与被拒论文的系统而言。不过,它们并不能证明人类或自动化决策在事实层面是正确的。
同行评审包含对重要性、清晰度和新颖性等主观问题的判断。两位严谨的评审者可能一致认为一篇论文值得接收,却同时忽略了同一个技术缺陷。
Sakana AI 的分析还发现,人类和自动化系统所强调的内容存在差异。MLR 更重视有效性和实验,而人类评审者则更关注清晰度和新颖性。
这种差异可能有益。当评审助手能够揭示被忽视的问题,而不是仅仅预测人类会写出什么评论时,它更有价值。
然而,互补性的关注点也带来了自身的校准问题。系统必须区分真正的方法学缺陷与看似合理、却无法由论文内容支撑的批评。
该研究的用户评估说明了这一挑战。活跃研究人员使用完整的 MLR 工作流完成了 38 次评审会话。
在收到直接认同反馈的 378 条评论中,用户接受了 81%。
建议获得了 94% 的认同,优点获得了 92% 的认同。
问题获得了 79% 的认同,行动清单项目获得了 78%。缺点的认同率最低,仅为 68%。
作者并不是评判批评的中立裁判,因此分歧并不必然意味着系统出错。尽管如此,缺点正是虚假指控可能造成最大损害的地方。
如果评审者错误地声称存在数学错误或缺失实验,就可能扭曲编辑决策。流畅的语言会让这种指控显得比其证据所支持的程度更加确定。
人类评审者也可能犯同样的错误。不同之处在于,自动化系统可能将一种错误解读复制到数千篇投稿中。
这正是 Sakana AI 的同行评审系统更适合作为第二读者,而非决策者的原因。它可以扩展人类需要审查的问题范围,但不应拥有对接收与否的最终决定权。
该系统的结构化笔记也可能帮助作者管理复杂证据。已经在使用可搜索知识库的团队,可以采用类似原则,将主张与实验、引用和未解决的问题关联起来。
这并不能自动完成验证,但能让人类更容易检查证据链。
提示注入暴露自动化风险
能够理解论文的评审系统,仍可能被植入论文中的文本操控。
Sakana AI 通过在 50 篇被拒稿件的结论之后添加隐藏指令,测试了显式提示注入;其中大部分稿件最初投稿于 ICLR 2025。
提示注入是指文档中的内容试图覆盖约束阅读该文档的模型所遵循的指令。恶意段落可能要求自动评审者忽略缺点或给出高分。
四个评审系统均受到注入文本的显著影响。在某些衡量方式下,MLR 的平均分数变化最小,但其结果方差较高。
它仅在 50 篇论文中的 8 篇里明确检测到这种操控。在其余案例中,注入内容影响了评审,却未能被可靠识别为恶意内容。
研究人员认为,MLR 的“先理解后评审”工作流和多模态输入提供了一定保护。Claude 同时看到文档文本和渲染后的页面,而注入指令并未出现在可见图像中。
这种不匹配可能向系统发出信号:隐藏文本并不属于论文内容。但这不足以持续防止操控。
这一弱点很重要,因为同行评审涉及不受信任的文档。作者控制 PDF、源文件、补充材料、引用,有时还控制链接的代码仓库。
任何具备浏览或代码执行工具的自动评审者,都会面临更广泛的攻击面。链接页面可能包含指令,代码仓库可能包含对抗性评论,补充数据也可能隐藏误导性元数据。
会议政策已经认识到,使用 LLM 需要披露并谨慎处理。ICLR 评审指南将人类责任置于自动化辅助之上。
安全部署需要将文档内容与系统指令隔离。它还需要限制工具、记录模型操作、标记隐藏文本,并要求人类确认具有实质影响的主张。
即使具备这些控制措施,也无法解决所有形式的操控。某段文字可以在不包含明显指令的情况下影响模型。
作者可以选择性地呈现比较结果、掩埋失败实验,或使用自信的语言来引导注意力。这些手段同样会影响人类评审者,但自动化系统可能形成可预测的盲点。
Sakana AI 早期的工作提供了相关警示。2025 年,该公司在一篇 AI 生成的研讨论文被接收后将其撤回,并说明生成研究中存在引用错误。
外部研究人员质疑,这一事件究竟表明了自主科学能力,还是表明人类能够有效筛选 AI 输出。后续一篇同行评审分析强调了通过评审与贡献可靠知识之间的区别。
MLR 通过在已知错误上测试评审者,解决了这一问题的一部分。然而,其提示注入结果表明,由同一类模型构建的评估器仍容易受到策略性文本输入的影响。
自动化作者和自动化评审者最终可能彼此优化。作者可能学会哪些措辞能避开批评,而评审者可能奖励那些看起来像已接收作品的模式。
如果缺乏独立检查,这个循环可能提高分数,却无法改善科学质量。
LLM 同行评审基准之后应关注什么
三个信号将决定 Sakana AI 的成果会成为有用的研究工具,还是仅仅停留在令人印象深刻的受控实验。
第一个信号是独立复现。Sakana AI 表示,数据和代码可应请求提供,而不是通过一个可立即访问的公共仓库发布。
外部团队需要使用相同的论文、提示词、模型版本和评判流程复现该基准。他们还应测试不同的裁判模型,并人工审查存在争议的检测结果。
复现应当在衡量召回率的同时衡量误报率。如果系统也生成大量看似合理却不正确的批评,发现更多错误的价值就很有限。
第二个信号是系统对自然缺陷的表现。未来基准应包括经过验证的统计错误、缺乏支持的因果主张、引用失误、不可复现的结果以及存在漏洞的证明。
有些任务需要访问代码和数据,而不仅是一份 PDF。严肃的研究审计者可能需要运行实验、检查预处理过程,并将报告数值与生成输出进行比较。
16.11% 的精确匹配结果提供了一个起点。如果未来系统能在多样化、独立策划的论文上提高这一比例,其提供实际辅助的理由将更有说服力。
第三个信号是会议是否会在具备可执行保障措施的前提下部署这些系统。相关指标包括披露规则、隐私控制、提示注入防御和有记录可查的人类监督。
一项向评审者提供私密、可选警告的有限试验,可以在不委托决策权的前提下测试增强效果。自动为投稿评分的系统则会带来大得多的风险。
研究人员还应关注模型变化如何影响 Sakana AI 的 MLR 系统。消融实验显示,更换底层模型占据了性能提升的很大部分。
这带来了维护压力。经由某个模型版本验证的工作流,可能在供应商更新模型或停用某个端点后表现不同。
这也引出了可复现性问题。当商业模型发生变化、却未保留相同的公共检查点时,科学基准会变得更难解读。
因此,Beyond Imitation 更深层的贡献在于方法论。其 LLM 同行评审基准提出了一个比“生成评论是否像人类评论”更好的问题。
AI 评审者能否发现一个威胁论文推理的具体问题?
Sakana AI 的答案在受控条件下令人鼓舞,在真实撤稿作品上则令人警醒。报告中的测试清楚表明,多轮理解优于浅层模仿。
但剩余差距仍然过大,无法赋予自动化系统决策权。真实论文包含不会以矛盾形式自行暴露的错误,而恶意论文可以直接操控评审者。
开发者应将 73.43% 这一数字视为边界明确的基准结果。编辑应在将自动化评分纳入发表决策之前,要求独立验证。
研究人员今天仍可运用该系统的核心思路。让 AI 助手将每一项主要主张映射到其证据,检查由此生成的关联,并手动调查每一个缺乏支撑的推理跳跃。
下一个决定性结果不会是又一项合成记录,而会是一个经复现的系统:它能发现细微、自然的错误,而不会用误报淹没评审者,也不会服从藏在稿件中的指令。



