top of page

Merlin AI 模型基准测试:成本高出九倍,准确性却未提升

2小时前
讀畢需時 13 分鐘

Merlin Search Technologies 测试了七个 AI 模型,发现了一个鲜明的反转:成本最高的模型每份报告消耗的成本超过九倍,却没有带来更高的引文准确性。

Merlin AI 模型基准测试向每个系统提供了相同的阿片类药物诉讼文件、两个调查问题和一项报告任务。最便宜、最快的模型在该供应商的忠实度指标中排名第一,最昂贵的模型则排在第四。

这一结果挑战了一种常见的采购捷径。较新或更昂贵的前沿模型,并不必然是每一项专业任务的最佳模型。不过,Merlin 并未披露每个匿名标签对应哪款产品,且六个模型在统计意义上并列。

该研究衡量的也是一种较为狭窄的质量维度:它检查陈述能否追溯到所提供的文件,并未判定哪份报告提供了最强的法律推理、识别出最重要的证据,或展现出最佳判断力。

这些限定条件并没有削弱结果的价值,反而使其更具参考意义。Merlin 的测试表明,企业在将每项任务都交给高端模型之前,需要进行任务特定的评估、考察置信区间,并确保引文可审计。

Merlin AI 模型基准测试实际测了什么

Merlin 在一个受控的法律调查工作流中比较了七个模型,随后对其引文和来源忠实度进行评分。

该公司通过其调查与证据开示平台 Alchemy,测试了来自 OpenAI、Anthropic 和 Google 的模型。参与阵容包括 GPT-6 Astra、GPT-5.6 Sol、GPT-5.6 Terra、Claude Fable 5.1、Claude Opus 5、Claude Sonnet 5 和 Gemini 3.1 Pro。

每个模型都获得了同一组公开可用的阿片类药物诉讼文件。这些材料涉及 Mallinckrodt,也提及了 McKesson、Insys 和 Valeant。

Merlin 避开了客户数据。这一选择降低了保密方面的顾虑,也让这组材料更适合重复使用;不过,基础报告并未被作为公开、可独立复现的基准测试包呈现。

模型回答了两个问题。其中一个涉及该公司疼痛管理产品中的相关问题,另一个询问内部笔记和分析师评论揭示了哪些财务困境与信贷问题。

第二个问题设置了一个刻意的陷阱。部分信贷评论涉及其他公司,而 Mallinckrodt 的部分记录描述的是常规账单纠纷。粗心的系统可能会将这些线索混为一谈,并暗示证据并不支持的财务危机。

随后,每个模型都生成了一份附有引文的完整调查报告。根据已发布的方法说明,这七份报告共生成 777 条引文和 454 个含引文的句子。

Merlin 在评分前将输出匿名化为模型 A 至 G。因此,评估人员未获知供应商名称,尽管该公司保留了记录在案的随机种子,以便重建标签对应关系。

公开评分卡仍保持了这种匿名处理。读者可以比较结果,但无法独立判断模型 D 是 OpenAI、Anthropic 还是 Google 的产品。

模型 D 以 3.3 的忠实度得分领先,分数越低越好。它平均用时 37 秒完成每份报告,在展示结果中没有出现损坏或指向错误的引文。

模型 C 的忠实度得分为 4.1,平均耗时 110 秒。它是此次测试中成本最高的系统,每份报告消耗的成本超过模型 D 的九倍。

模型 E 以 4.9 的忠实度得分垫底。其余六个模型的置信区间存在重叠,因此 Merlin 将它们视为统计意义上的并列,而非给出虚假的精确排名。

这一差异很重要。研究中的标题性反转确实存在,但并不能证明模型 D 具有普适的准确性优势。它证明的是:在这一特定测试中,支付高得多的费用并未带来可检测到的忠实度提升。

最便宜的模型在一项狭窄但重要的测试中胜出

该基准测试削弱了将价格视为准确性代理指标的做法,但并未认定某个模型是普遍意义上的赢家。

模型 D 拥有最干净的引文记录、最短的平均完成时间,以及比较中最低的运营成本。模型 C 的成本高出九倍以上,却在展示的评分卡中位列第四。

两款最新发布的模型 GPT-6 Astra 和 Claude Fable 5.1 均未夺得第一。由于 Merlin 未公开标签对应表,公众无法确切知道这两款模型分别排在何处。

这种保密性限制了采购参考价值。法律团队无法仅凭这篇文章便有把握地选择某一家特定供应商。但他们可以摒弃这样一种假设:最新的高端选项理应默认承担所有工作负载。

结果还揭示了单一排名无法体现的差异。模型 A 覆盖了最广泛的不同议题,广度得分为 24.9。它没有产生损坏的引文,但有两条引文指向了错误的支持段落。

模型 G 的广度几乎同样出色,得分为 23.6。不过,在其核查的 93 项主张中,有九项将读者引向错误段落。Merlin 表示,相关事实在其他位置确实存在,但律师若沿着这些引用查找,仍需自行搜索。

模型 D 更精确,但覆盖范围较窄。其广度得分仅为 15.9,明显低于模型 A 和 G。一份谨慎的报告若遗漏了决定性主题,仍可能不如一份覆盖更广、但存在少数可修复引文错误的报告有用。

这正是核心反转:最便宜的模型在忠实度排名中领先,但它的胜出并未消除覆盖范围、综合分析或法律判断的价值。

研究发现,七份报告中没有任何一份包含虚构事实。在 Merlin 的评分体系下,每一个具体姓名、数字、日期和引文都可以追溯至这组文件。

这一发现令人鼓舞,但其适用范围仍应限定于该任务。模型基于受控证据集工作,并在 Alchemy 内生成带引文的报告;它们并未被要求开展开放网络法律研究,或从不受限制的数据库中检索权威资料。

在经过策划的资料集合中保持事实依据的模型,面临的问题不同于凭记忆回答问题的聊天机器人。检索控制、引文结构和周边应用都可能显著改变失误率。

较早的学术研究说明了这一背景。Stanford 的研究人员在评估商业法律研究产品时,将幻觉定义为不正确或没有得到恰当事实依据支撑的回答。他们的法律 AI 研究发现,仅靠检索并不能消除缺乏支持的回答。

因此,Merlin 的结果指向的是整个系统,而不只是基础模型。Alchemy 提供了文件摘要、引文标记、提示词、报告结构和核查流程。获胜输出来自这一组合环境。

正确的结论并非更便宜的模型总是更准确,而是模型价格本身几乎无法证明其在既定企业工作流中的表现。

八轮评估如何核查每一条引文

Merlin 最重要的贡献在于其评估流程:只要可由计算替代模型判断的环节,就采用确定性检查。

流程始于隐藏模型身份,并移除报告中意外出现的相关提及。后续阶段只会看到固定的匿名标签。

第二轮审核了 Alchemy 自身的来源摘要。每份摘要都包含将其连接到原始文件段落的标记,但其中一些标记存在缺陷。

审核发现了 24 个有问题的摘要部分。对于仅因平台提供了错误标记而失败的引文,Merlin 予以豁免。这样可以避免基准测试因上游数据错误而惩罚模型。

这一步很容易被忽视。评估往往把所有可见失误都归咎于语言模型,即使问题源自检索、解析或文件准备。

第三轮以机械方式解析引文。代码检查每个引用的文件和章节是否存在,以及引用段落是否位于识别出的范围内。

没有章节或段落的简单文件引用被视为正文表述,而非失败引文。这项规则避免检查器因过于激进的解析而夸大错误数量。

第四轮评估含引文的句子是否基于所提供的摘要。这是第一个使用 AI 评审模型的阶段。

Merlin 表示,早期版本会将所有未出现在列举引文中的事实视为虚构。这种方法会惩罚综合分析:当模型只引用支撑多来源句子的一部分证据时尤其如此。

修订后的系统采用两个阶段。首先,评分器识别它无法在被引用材料中找到的信息;第二阶段则在更广泛的资料集合中搜索,再给出判定。

可能结果包括:有支持、未引用来源、过度推断或虚构。未引用来源意味着事实存在于集合中的其他位置;过度推断则意味着结论超出了证据范围,但没有虚构可核查的事实。

虚构涵盖在整个资料集合中均找不到的具体姓名、数字、日期或引文。Merlin 对该类别赋予三倍权重,因为捏造的细节可能进入法庭文件或客户备忘录。

第五轮衡量广度和重复度。系统将句子转换为语义向量,即意义的数学表征,并估算每份报告包含多少独立观点。

这一设计旨在避免单纯奖励篇幅。如果额外句子只是重复相同观点,较长的报告不会自动获得优势。

第六轮计算分数和不确定性区间。成本和速度显示在评分卡中,但不会影响准确性排名。

Merlin 通过对两个问题进行重采样来估计置信区间。当区间重叠时,它将模型判为并列。这也是为什么七个系统中有六个尽管展示顺序不同,却同属领先统计组。

第七轮对评分器进行评分。来自不同供应商的另外两名 AI 评审,复核了每一项被标记的主张,以及部分通过的主张样本。

分歧由多数票解决。在最初的 33 项标记中,有三项被推翻,报告的误报率为 9%。评审人员还抽查了 37 项通过的主张,没有标记出任何问题。

三名评分器在 70 项经审查主张中的 58 项上完全一致。这仍意味着存在值得重视的分歧,但相关披露让读者能够更清楚地了解测量不确定性。

第八轮生成书面备忘录。AI 系统起草文字,而所有数字均由计算指标提供,评分卡则由代码生成。

Merlin 还要求每一项批评都必须点名一个表现更好的对比模型。其完整评估报告包含定义、指标和按发现分类的附录。

这种确定性检查与受限 AI 判断相结合的方式,遵循了一项可靠的通用原则。存在性测试、范围、计数和可复现计算应交给代码完成;而算术无法回答的语义问题,则应留给概率型评估器。

这也与 NIST 的建议相呼应:组织应记录测试集、指标、不确定性和部署条件。AI RMF Core 还要求开展可重复的评估,并在部署后持续监控。

对于构建可搜索知识库的团队而言,这一教训不止适用于诉讼场景。引文检查应同时检验检索与生成环节,因为任一层都可能破坏证据链。

为什么这一结果会给企业 AI 采购方带来压力

该基准测试给那些在衡量实际工作负载前,就将单一高端模型定为标准的采购方带来了压力。

企业采购往往将模型视作软件版本。价格更高或更新的选项似乎更可靠,因为它承诺更强的推理能力、更大的上下文窗口,或在通用基准上取得更高分数。

Merlin 的测试揭示了这套逻辑的弱点。通用能力上的优势,并不保证模型在以文档为依据的调查工作流中表现更好。

这项任务要求多种不同能力。模型必须阅读摘要、区分涉及不同公司的证据、避免夸大常规争议、综合产品问题,并附上有用的引文。

其中一个模型的引文处理得很干净,但覆盖的问题较少。其他模型发现了更多不同线索,却带来了更多引文摩擦。正确选择取决于哪类错误会造成更大的专业风险。

对大量材料进行初步审查时,可能更看重速度和广泛召回。为法律顾问准备最终报告时,则可能更重视精确引文、完整综合和审慎结论。

这种差异支持模型路由,即根据每项任务经测量得出的需求,为其分配相应模型。但这并不意味着应自动选择最便宜的系统。

一项站得住脚的路由政策应从风险出发。团队应明确任务是否需要事实提取、问题识别、长篇综合、法律判断或最终客户沟通。

随后,他们应在与生产环境相同的提示词、检索设置和文档条件下,对具有代表性的案例进行测试。公开排行榜无法复现这些条件。

模型选择还会影响审查成本。一个速度快但报告范围较窄的系统,可能将工作转回给必须寻找遗漏主题的律师。一个覆盖广但引文精度较弱的系统则会造成另一种负担,因为审查者必须手动追溯主张。

该基准的运营成本指标未包含这部分下游人工成本。它衡量的是生成报告的模型使用成本,而不是审查、纠正和批准报告的总成本。

对于法律采购方而言,这一区别尤为重要。美国律师协会的AI 伦理意见指出,律师必须考虑与胜任能力、保密性、沟通、监督、坦诚义务和合理收费有关的职责。

模型生成的流畅文本并不会将责任从法律顾问身上转移。律师仍需建立与任务及错误或无依据陈述所带来风险相称的审查程序。

同样的原则也适用于法律之外。金融分析师、合规团队、研究人员和产品经理都依赖于将大量证据材料压缩为决策依据的输出。

模型可以引用真实文档,却仍然遗漏决定性问题;也可能得出合理结论,却指向错误段落。这是两种独立的失败模式,应分别衡量。

因此,采购方不应依赖单一的综合“质量”评分。他们需要反映实际工作的评分卡:引文有效性、主张依据、覆盖范围、矛盾处理、延迟和人工纠正时间。

Merlin 还主张让用户可以在不同模型提供商之间选择。由于 Alchemy 提供多个模型系列,这一立场也服务于该公司的商业设计。

不过,证据支持的是一个更有限的观点:当六个模型在保真度上统计学意义相当,却在速度、广度和运营成本上存在差异时,将所有任务锁定给单一提供商,就会放弃可量化的权衡空间。

该基准测试不能证明什么

这是一次由供应商主导、围绕单一工作流开展的评估;模型身份被隐藏,且其准确性定义刻意有限。

Merlin 开发了 Alchemy、运行了这项基准测试、设计了评分流程,并发布了解读。EDRM 转载该文章时附注说明,其中观点属于作者。

这并不会使该工作失效。但这意味着读者应将这些发现视为有文档记录的供应商评估,而非独立的比较性试验。

隐藏答案键带来了另一项限制。匿名化使评估者免受品牌偏见影响,但持续保密也阻碍了公众在模型层面的审查。

读者无法将报告中的排名与其他基准进行比较,也无法检验某一模型已知的行为特征是否能解释其在广度、速度或引文错误方面的特定模式。

该基准使用了来自一组诉讼材料的两个问题。两个问题可以暴露有意义的失败模式,但无法代表所有证据开示任务或法律领域。

报告中的置信区间试图承认这种不确定性。然而,对两个问题进行重采样,无法产生覆盖合同、监管事务、特权审查、时间线构建或相互冲突的证人陈述等更大测试集所具备的多样性。

这些模型显然是在一种配置下完成了一次评估运行。重复试验可能揭示输出方差,尤其是在生成设置允许使用不同措辞或选择不同证据时。

公开材料也没有提供足够信息,使人们能够独立计算提示词、摘要质量、检索限制和模型配置所造成的总体系统影响。不同的应用程序框架可能改变排序结果。

最重要的是,保真度并不等同于法律准确性。该测试衡量的是陈述能否追溯至来源,以及引文是否指向正确材料。

它没有评价法律推理的质量,也没有判断模型是否识别出最重要的证据、是否有说服力地调和了冲突,或是否预判了对方的论点。

Merlin 直接承认了这一限制。模型可以通过列出得到谨慎支持的事实来获得高排名,同时回避那些使调查报告真正有用的困难结论。

未检测到捏造内容同样需要谨慎解读。这意味着评估流程没有在这七份报告中发现任何具体的虚构事实;并不意味着这些模型、Alchemy 或法律 AI 整体的幻觉率为零。

系统的失败率会随任务而变化。开放式研究、不完整的材料集合、模糊问题和对抗性文档,与受控综合练习面临的压力不同。

自动化评分本身也带来不确定性。Merlin 的额外评审器推翻了三项初始标记,说明不应让单一模型充当不受质疑的评估者。

评审器对 70 项已审查主张中的 58 项达成一致。这属于较高程度的一致,但也表明语义分类仍存在可争议空间。

独立的人类法律审查将增强证据力度。领域专家可以判断评估类别是否符合专业预期,以及一项据称得到支持的主张是否保留了来源原意。

NIST 的生成式 AI 概况强调部署前测试,同时承认风险在模型、应用和生态系统层面各不相同。Merlin 的基准将三层一并评估,却无法将它们完全隔离。

因此,这一结果应改变采购行为,但不应终结调查。它是反对基于价格进行选择的证据,而非证明某个匿名的经济型模型应取代前沿系统。

将检验成本与准确性逆转的三个信号

接下来的检验在于,Merlin 的逆转结果能否在更广泛的任务、独立审查和反复的模型更新中持续成立。

第一个信号是更大规模的判断基准。Merlin 表示,它正在为相互冲突的证据、因果推理、问题重要性和相反论点构建另一套评估。

这一测试很重要,因为高端模型通常以推理能力而非引文机制来证明其更高运营成本的合理性。如果经济型模型在那里仍具竞争力,那么默认将任务路由至前沿模型的理由将显著减弱。

如果高端系统取得明显领先,当前结果就更像是任务专业化。届时,团队可以将前沿模型保留给复杂综合任务,同时使用经济型系统进行以证据为依据的报告。

第二个信号是独立复现。一项可信的后续研究应披露提示词、设置、模型版本、重复运行、评分代码,以及在许可允许的情况下可复用的文档包。

它还应纳入不为平台供应商工作的人工法律审查者。确定性检查、自动化评审器与领域专家之间的一致性,将增强该方法的可信度。

复现研究可以在评分期间保持匿名,同时在之后公布标签键。这种设计既能保留对品牌偏见的防护,也能为采购方提供可操作的模型层面证据。

第三个信号是模型和平台更新后的性能漂移。提供商频繁修订模型快照、推理系统和定价结构,检索流水线和摘要提示词也会发生变化。

Merlin 表示,新加入的模型会接受相同测试。发布稳定的时间序列将显示排名是否持续,还是仅仅捕捉到某个有利快照。

团队不应只关注获胜者。损坏引文、错误指向的参考资料、覆盖广度、评审器分歧、延迟和纠正时间的变化,都将揭示工作流是否正在改善。

Merlin AI 模型基准为采购方留下了一项实际挑战:不要再抽象地追问哪个模型最好。应定义工作内容、识别代价高昂的失败模式,并以自己的证据开展受控评估。

对于法律团队而言,这意味着检查引文是否存在、段落是否支持主张,以及报告是否涵盖关键问题;也意味着让律师继续对最终判断负责。

对于其他知识密集型团队,问题类似:该系统是否帮助人们作出站得住脚的决策,还是仅仅生成流畅文本?

九倍的成本差距构成了令人印象深刻的标题。更持久的教训则要求更高:衡量任务、审计证据链、纳入不确定性,并在模型或工作流发生变化时重新测试。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page