top of page

QED Science 声称能筛选出排名前 1% 的预印本。研究人员应当信任它吗?

8月11日
讀畢需時 13 分鐘

尽管其 AI 如何定义科研质量仍存在悬而未决的问题,QED Science 仍对 57,455 篇生命科学预印本进行了排序,并选出其中 574 篇列入前 1%。

这家特拉维夫初创公司表示,其系统在评估原创性和有效性时,不会查看作者、所属机构、引用次数或期刊名称。这一承诺使 QED Score 与研究人员目前常常无奈地用来应对海量文献的声望信号形成对照。

Horizon Nature 报道所提出的核心问题,不是人工智能能否比人更快地阅读论文——显然可以。问题在于,在独立研究人员尚未充分检验其假设之前,一个专有评分能否成为值得信赖的筛选工具。

QED Science 将一整年的预印本汇成一份排序名单

QED Science 将科学分流从阅读问题转化为排序问题。

该公司于 2026 年 6 月 24 日推出“The 1%”。它将该项目描述为对 12 个月期间发布的最具原创性、科学有效性最高的生命科学预印本所作的遴选。

QED 分析了 2025 年 5 月至 2026 年 4 月间提交至 bioRxiv 的 57,455 篇手稿。最终名单包含 574 篇论文,恰好对应这一评分群体中的前 1%。

预印本是指在正式接受期刊同行评审前公开发布的手稿。它能让研究结果迅速传播,但读者必须在缺少编辑评审保障的情况下自行判断证据质量。

这种速度既带来价值,也带来风险。研究人员可以在期刊发表前数月接触重要发现,但同时也要面对任何个人都无法逐篇深入评估的大量材料。

QED 表示,若对其全部语料库进行传统评审,需要 860,000 至 1,030,000 小时的专家工作。根据该公司的验证论文,这相当于超过 400 个研究人员年。

其系统在数小时内完成了评估。这种差异解释了其吸引力,尤其是对资助方、研究团队和关注快速发展领域的企业而言。

该结果并非录用决定。QED 将 The 1% 描述为一种早期信号,用于判断哪些手稿值得关注。

这一差异很重要。期刊编辑可以要求修改、征询审稿人意见、审查披露信息,并在发现致命问题后拒绝论文。一个评分则将另一种过程压缩成单一数字。

QED 的公开名单涵盖 bioRxiv 的生命科学类别。神经科学在 11,058 篇被评估手稿中贡献了 83 篇入选论文,而细胞生物学在 3,408 篇中贡献了 55 篇。

其他类别包括基因组学、免疫学、微生物学、癌症生物学、生物信息学、遗传学和合成生物学。这一分布既反映领域规模,也反映 QED 的评估结果。

QED 还报告称,其应用范围已超出该排序项目。截至 5 月 31 日,其平台服务了 70 多个国家、1,500 多家机构中的超过 10,000 个实验室。

这些数据来自 QED,而非独立的使用情况审计。尽管如此,它们表明 AI 辅助手稿评估正在走出实验室试验阶段。

因此,Horizon Nature 提出的问题不止关乎一份名单。如果研究人员使用 QED 来决定阅读、引用、资助或开发哪些研究,其判断便可能在同行评审开始前塑造关注焦点。

这才是真正的变化。QED 不只是总结预印本,而是在科学关注的入口处提出设置一道自动化关卡。

为什么 Horizon Nature 的争论此刻尤为重要

压力来自研究成果出现速度越来越快,而专家评估速度依然缓慢,两者之间的差距不断扩大。

预印本服务器让科学家无需等待期刊完整的评审周期即可分享发现。当研究人员需要迅速获取新兴生物医学证据时,这一模式尤其引人注目。

它也移除了一个熟悉的排序机制。刚刚发布在 bioRxiv 上的手稿没有最终期刊归属、既有引用记录或完成的同行评审历史。

研究人员以并不完美的信号作为补偿。他们辨认实验室、机构、作者、方法和研究主题;他们关注社交推荐,并审阅那些通过专业网络获得关注的内容。

这些习惯可以节省时间,但也可能复制声望偏见。来自知名机构的研究,比陌生团队产出的同样优秀的工作更容易获得关注。

QED 正是在瞄准这一弱点。其发布公告称,每篇手稿都会在评分前匿名化。

系统会移除作者姓名、所属机构及其他身份信息,也会忽略引用次数、发表平台和期刊声誉。

QED 联合创始人兼首席科学家 Oded Rechavi 认为,科学质量应当通过研究工作本身来判断。盲审旨在防止声誉取代证据。

这一目标具有可信基础。人工评审可能受机构地位、职业关系、语言,以及对何种人会产出重要成果的预期影响。

然而,匿名并不会自动带来中立性。手稿可能包含有关其来源的间接信号,包括研究主题、设备、数据集、写作模式和参考文献。

AI 模型也可能从训练数据中继承关联性。将机构名称从输入中移除,并不能抹去模型开发期间学到的所有关系。

先前研究已经说明这种区别为何重要。一项 2024 年研究利用配有不同所属机构信息的 30 篇医学摘要测试了 GPT-3.5。

研究人员在随机化所属机构条件下生成了 232,500 份个别评审。其机构偏见研究发现,机构信息会影响模型的判断。

QED 的匿名化措施解决了这一问题最直接的形式。然而,该公司尚未公开足够的系统细节,让外部人士能够梳理所有仍可能存在的影响路径。

规模问题也在加剧。生成式 AI 已降低起草技术文本、生成看似合理的引文和制作润色完善手稿所需的成本。

这并不意味着每篇 AI 辅助论文都不可靠。它意味着表面上的流畅性已成为更弱的科学质量信号。

bioRxiv 联合创始人 Richard Sever 在有关合成科学内容的报道中描述了一种更黑暗的可能性。当人为制造的论文淹没真实发现时,预印本系统会变得更难使用。

在这种环境下,自动化评估似乎几乎不可避免。编辑和科学家无法用无限的人力评审来应对无限的机器生成投稿。

QED 提供了一种应对方案:使用 AI 分解每篇手稿、检验其主张,并将稀缺的人类注意力引向最有力的候选论文。

压力首先落在进行文献综述的研究人员身上。它也影响期刊编辑、资助方、生物技术团队,以及任何基于早期证据作出决策的人。

这些群体需要更快的筛选,也需要知道一篇论文为何通过筛选、系统遗漏了什么,以及其错误会以多高频率重复发生。

排序可以减少信息过载,同时也可能形成新的影响力集中。如果某一种评分获得广泛信任,评分层面的错误就可能改变整个领域的关注方向。

这正是争论如今出现的原因。科学出版需要机器规模的分流机制,但验证这种分流机制的标准仍未定论。

QED Score 挑战的是声望,而非同行评审

支持 QED 的最有力理由,不是它取代同行评审,而是它比期刊排名更直接地检验论文。

QED Score 评估两个明确维度。原创性衡量一项发现推动既有知识向前发展的程度;有效性衡量证据是否支持手稿的结论。

该公司称,其多智能体架构首先将每篇论文拆解为元主张、主要主张、相关主张和支撑实验。

随后,专门化 AI 智能体并行检查不同特征。它们寻找图表不一致、统计薄弱点、与既有文献的冲突、替代性假设,以及报告标准问题。

验证层会重新检查被标记的问题。评分层对各项主张进行评级,聚合器再将这些评估组合为经过校准的百分位数。

得分为 80 意味着该手稿超过了参考语料库中 80% 的论文。它并不意味着该论文有 80% 的概率是正确的。

当复杂判断变成一个熟悉的数字时,这一区别很容易被忽略。百分位数描述的是相对位置,而非绝对真相。

QED 在三项研究中测试了其指标。第一项研究使用了 185 位作者发表的 925 篇论文,这些论文由领域专家归入 Limited、Satisfactory 或 Strong 类别。

评分流程并未获得这些标签。QED 报告称,在区分 Limited 论文与其他类别时,曲线下面积为 0.867。

曲线下面积,即 AUC,衡量系统区分两个类别的能力。0.5 代表随机水平,1.0 代表完美区分。

对于同时拥有 QED Scores 和期刊排名数据的 795 篇论文,QED 在两项比较中报告了更强的结果。在识别 Limited 论文方面,其得分为 0.863,而期刊排名指标为 0.804。

对于 Strong 论文,结果则更为接近。QED 报告为 0.782,而期刊排名指标为 0.774。

第二项研究对 2025 年 4 月的 4,953 篇 bioRxiv 预印本进行了评分。随后,QED 追踪这些论文最终发表在哪些期刊。

研究人员将 2,879 篇预印本与带有关联期刊排名的已发表版本进行了匹配。QED 报告称,其预印本评分与最终期刊排名之间的 Spearman 相关系数为 0.63。

这一相关性在 21 个学科之间存在差异。遗传学中达到 0.78,但在系统生物学中降至 0.39。

这些差异值得关注。单一的跨学科百分位数可能掩盖模型表现、证据惯例和发表行为方面的重要差异。

第三项研究聚焦于分歧。QED 创建了 100 对论文,其中其评分更偏好发表在排名较低期刊上的论文。

15 名领域专家在看不到 QED Scores 或发表平台的情况下审阅了这些论文对。他们作出了 70 项有把握的判断,在排除平局后,其中包括 60 项明确选择。

在这些明确案例中,专家有 75% 的情况选择了 QED 更偏好的论文。报告的 95% 置信区间为 63% 至 84%。

这一结果支持 QED 的论点:发表平台的声望可能无法准确反映论文层面的质量。但它并不能证明 QED 无需人类判断便可识别真相。

发表平台本身也是一个不太理想的基准。期刊归属取决于新颖性、编辑范围、时机、呈现方式、审稿人可用性以及战略性投稿选择。

与期刊排名相关的评分,可以验证其与既有发表结果的一致性。但它本身无法验证系统摆脱了发表体系偏见这一主张。

QED 也承认一项重要边界。其方法论称,The 1% 并非同行评审的替代品。

这是合理的界定。QED 可以优先安排稿件接受审阅,但较高的百分位不应为临床决策背书,也不能终结科学争议。

因此,核心之争在于直接评估与基于声望的推断。QED 提出的问题是:读者是否应当审查主张与证据,而不是借用期刊的声誉来判断。

即便 QED 的评分仍不够完善,这一挑战依然有价值。期刊品牌一直以来都将许多判断压缩成一种速记符号,而读者可能会误用它。

经过严谨验证的 AI 评分或许会成为另一种信号。但它不应成为唯一信号,更不应成为一种公众问责更少的新声望标签。

“前 1%”这一主张无法证明什么

QED 的内部结果足以支持严肃测试,但尚不足以证明其值得无条件信任。

最主要的限制在于独立性。QED Science 开发了该系统、设计了验证方案、发布了方法论,并报告了核心性能数据。

由公司主导的研究可以提供有价值的证据。但当产品的商业价值依赖于同一组性能主张时,独立复现就变得至关重要。

一项外部审查指出,三项验证研究都存在不足。该批评由另一项基于 AI 的研究评估服务提出,因此并非决定性的人类独立复现。

不过,其中提出的问题很具体。这份审查报告认为,QED 的研究使用了彼此相关的参考信号,而非提供完全独立的确认。

第一项研究依赖专家赋予的质量分类。第二项将期刊排名作为结果指标。第三项则挑选 QED 与期刊排名明显分歧的案例。

这种结构可以证明 QED 在其所选择的测试下具有一致性。但它并未回答:在由外部研究人员定义的前瞻性决策中,该系统表现如何。

第二项研究也只将 4,953 篇预印本中的 2,879 篇与具有期刊排名数据的正式发表版本匹配。这意味着有 2,074 篇稿件未被纳入所报告的相关性分析。

部分未匹配论文可能会在之后发表、出现在不具备所需指标的期刊,或根本不会正式发表。将其排除可能改变表面上的关系。

选择效应很重要,因为发表并非随机过程。高质量工作可能一直未发表,而低质量工作也可能通过同行评审。

第三项研究提供了有说服力的分歧数据,但它采用的是一个刻意挑选的非典型样本。研究人员之所以选择这些论文对,是因为 QED 与期刊排名指向相反的结论。

这一设计测试了一个相关的冲突情境。但它无法估计在普通论文中,QED 多久会做出更好的选择。

75% 的偏好结果也仅来自 60 项明确判断。它具有参考价值,但与 The 1% 收录的 57,455 篇稿件相比,样本量仍然很小。

这份精选名单还带来另一个问题。“前 1%”听起来很客观,但它仍然是相对于 QED 的语料库、类别处理方式、评分版本和选定的评估维度而言。

原创性和有效性都是有价值的标准,但它们并未涵盖科学家关心的所有质量维度。

一篇技术上有效的论文可能范围狭窄或不够重要。一篇原创论文可能依赖脆弱的测量结果。一项复现研究可能原创性有限,却具有巨大的科学价值。

伦理、数据可得性、方法透明度、可复现性、实际重要性和利益冲突,也会影响读者应如何使用一项研究结果。

QED 的代理会审查若干相关因素,但外部人士需要更清楚地了解这些因素的权重。他们还需要误差分析、领域层面的校准结果,以及误报案例。

模型不透明性带来了操作层面的问题。QED 表示,其架构结合了多个大型语言模型和专有模型。

其公开方法论并未列出每个底层模型、提示词、组件权重或更新计划。这些细节可能影响可复现性。

如果模型提供商改变系统,同一篇稿件可能得到不同结果。QED 需要提供版本化评分和稳定的审计记录,才能支持具有重要后果的使用场景。

研究已经表明,LLM 评估者可能复现社会偏见。一项大型经济学实验针对 9,030 篇论文生成了 27,090 次评估。

这项同行评审实验发现,模型能够区分质量,但更偏好知名机构、男性作者和著名经济学家。

QED 的盲态输入应能减少其中若干影响。但这并不能回答:其模型是否学会了对熟悉方法、热门议题或传统论证结构的其他偏好。

该系统也可能奖励更容易被模型解析的稿件。清晰的主张结构是好事,但可读性不应悄然成为证据强度的替代指标。

对抗性行为是另一个担忧。一旦作者了解评分系统奖励什么,一些人就会为该指标优化稿件。

这种模式出现在所有通过排名分配关注度的场景中。搜索引擎、大学指标、引用衡量标准和期刊影响因子,都曾鼓励策略性行为。

因此,公开评分需要具备抗操纵能力。它还需要监测隐藏提示词、伪造引用、重复证据,以及旨在影响评估者的文体策略。

在这些问题获得独立答案之前,研究人员应将 QED 视为发现辅助工具。高分可以成为更早阅读一篇论文的理由,而不是更早相信它的理由。

反过来也同样重要。低分不应在没有申诉渠道或明确解释的情况下,悄然埋没非传统研究。

对于追踪科学主张的知识工作者而言,保留来源语境比收集排名更重要。一个可搜索的知识库可以将论文、批评、更新和相互冲突的证据一并保存。

这一工作流程让评分回归其恰当角色。它成为附着于来源的一项筛选条件,而不是脱离底层研究工作的裁决。

三个信号将决定研究人员是否应信任它

信任将取决于独立验证、跨领域的稳定表现,以及科学家在使用该评分时不会放弃自身判断的证据。

第一个信号是由 QED Science 以外的研究人员开展前瞻性、预注册研究。独立团队应在看到结果之前定义评估标准。

他们应测试模型和评估者都未曾接触过的新稿件。研究应包括已发表论文、未发表论文、复现研究、阴性结果和刻意设置缺陷的投稿。

外部专家应在未获知 QED 标签的情况下评估主张和证据。研究人员随后可以将 QED 与人工评审小组、期刊决定、复现结果以及后续更正进行比较。

没有单一基准能提供完美的真实标准。多个真正独立指标之间的一致性,比另一项由公司主导的比较更能强化 QED 的主张。

如果在这些条件下表现不佳,将削弱“QED 能够普遍可靠地衡量科学质量”的说法。它仍可能适用于更狭窄的分流任务。

第二个信号是随时间推移保持透明的领域级表现。QED 已报告,其跨学科相关性介于 0.39 至 0.78 之间。

未来版本应披露每个领域的误报模式、漏报模式、校准漂移和评分变化。总体准确率可能掩盖专业领域中的薄弱表现。

版本管理尤为重要。每项评分都应标明系统版本、参考语料库、评估日期,以及排名的不确定性。

研究人员还需要能够将评分关联到具体主张和实验的解释。没有可追溯推理的百分位,无法支持有意义的纠正。

如果 QED 发布稳定、可复现的领域级结果,其论据会更有力。如果评分在模型变更后悄然变化,研究人员应将该工具限于非正式发现用途。

第三个信号是机构如何使用这项排名。阅读推荐的风险低于资金筛选、招聘过滤或临床证据决策。

一项帮助科学家发现被忽视论文的工具,可以减少声望偏见。如果机构将评分视为门槛,同一工具也可能制造算法化声望。

应关注资助方和期刊是在专家审查之中使用 QED,还是在专家审查之前使用它。还应关注作者能否质疑错误,并在修订后获得重新评分。

最健康的采用方式应保留人类责任。研究人员会使用 QED 识别论文、审查其推理,然后评估底层证据。

风险最高的采用方式则会将决策隐藏在百分位之后。机构可能自动拒绝研究工作,同时声称因为去除了姓名,流程便是中立的。

Nature 提出的问题有一个条件性的答案。研究人员应足够信任 QED,以测试其推荐结果;但不应信任到将科学判断外包出去。

QED 针对一个真实瓶颈给出了可信回应。其规模、盲态评分和主张层面的分析值得接受谨慎的独立审查。

Horizon Nature 的争论现在需要公司之外的证据。在接下来的几个月里,应关注预注册复现、按领域划分的误差报告,以及披露的机构使用情况。

QED 评分会改变你优先阅读哪篇预印本吗?它或许应该会。它会让你在不核查方法和证据的情况下改变自己相信什么吗?不应该。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page