AI 基准测试已失效:为什么排行榜不再能预测真实世界性能
- Aisha Washington

- 6月5日
- 讀畢需時 3 分鐘
已更新:6月17日
AI 基准测试不再能预测模型在实际工作中的表现。MMLU 和 HumanEval 的分数与用户对任务完成情况的真实反馈存在偏差。
MMLU 曾通过广泛的知识测试对模型进行排名。HumanEval 测量短函数的代码生成能力。Chatbot Arena 收集用户的成对投票。现在的生产团队报告称,在部署相同模型时,排名表现各不相同。
基准测试污染导致了部分不匹配。训练数据现在包含了大量的考试题目和基准测试条目。模型是在记忆模式,而不是学习通用技能。2025 年的一项研究发现,超过 30% 的 MMLU 问题出现在用于预训练的公开网络爬虫数据中。
Goodhart's Law 解释了其余部分。当团队针对某个指标进行优化时,该指标就不再能衡量原始目标。实验室在公开排行榜上追求微小的增益。他们根据测试分布调整提示词和训练后数据。结果是虚高的数字,一旦测试分布发生变化,这些数字就会失效。
真实世界的评估显示,实际表现与这些分数的相关性较弱。一项企业研究追踪了模型在客户支持工单上的输出。在 MMLU 上领先的模型在解决率和客户满意度方面仅处于中等水平。而在排行榜上排名较低的模型在处理边缘案例时反而更可靠。
污染传播速度比实验室承认的更快
测试集通过重复的网络抓取泄露到训练语料库中。几所大学的研究人员在 2023 年和 2024 年的 Common Crawl 快照中发现了完整的 MMLU 章节。在这些快照上训练的模型可以在不理解底层概念的情况下正确回答相同的题目。
HumanEval 面临类似问题。基准测试中的代码片段出现在用于训练的 GitHub 仓库中。模型能够完成测试函数是因为它在预训练期间看到了解决方案,而不是因为它对算法进行了推理。
Chatbot Arena 降低了部分污染风险,因为投票来自真实用户的新鲜提示。即便如此,实验室仍可以操纵结果。他们会发布在常见主题上表现良好,但在生产环境中至关重要的罕见查询上表现滞后的微调变体。
实践中的 Goodhart's Law
团队现在将大量算力分配给排行榜优化。训练后阶段专门针对 MMLU 中出现的特定问题风格。其结果是狭隘的提升,无法迁移到新任务中。
买家在进行内部测试时注意到了这种差距。一个在 MMLU 上得分 85 的模型,在私有客户数据上可能会降至 65。而另一个在 MMLU 上得分 78 的模型,在同样的私有数据集上却能维持 80 分,因为它接受的针对排行榜的微调较少。
追求高分数的压力产生了反向激励。实验室发表论文,报告在已饱和的基准测试中取得的 state-of-the-art 结果。他们很少在更难的私有评估中发布相同的模型。这隐藏了真实的性能上限。
更好的评估应该是什么样子
一些机构转向使用从未在网上出现的私有留出集(hold-out sets)。另一些机构则在自己的产品内部运行实时 A/B 测试。这些方法成本更高、耗时更长,但它们产生的排名与用户反馈更一致。
基于代理的评估测量多步骤任务完成情况。模型接收的不再是单轮问题,而是需要规划、工具使用和纠错的目标。早期结果显示,这种方式产生的模型排序与 MMLU 表格完全不同。
领域专家的人类反馈仍然是最强的信号。金融团队、法律部门和工程组各自需要不同的优势。单一排行榜无法同时捕捉所有这些需求。
买家应该如何测试模型
在您自己的文档和工作流上运行模型。跟踪对您的用例至关重要的错误类型。并排比较输出结果,而不是依赖发布的平均值。
在采购过程中检查污染迹象。询问供应商哪些公共基准测试进入了他们的训练数据。索取在模型发布日期之后收集的数据集上的性能数据。这些数字揭示了得分反映的是记忆力还是真正的能力。
在您的流量模式下测试延迟、成本和可靠性。排行榜忽略了这些因素。当高分模型成本过高或响应过慢时,生产系统就会失效。
评估的未来之路
未来的基准测试将需要持续更新和私有测试集。公开排行榜仍可作为快速筛选工具,但它们无法取代对实际任务的内部验证。投资于自身评估流水线的组织能获得更清晰的信号,了解哪种模型真正改善了结果。


