top of page

Yann LeCun 证实 Meta 篡改了 Llama 4 基准测试。该丑闻比单一模型更大。

2026年1月,Meta即将离任的首席AI科学家、现代深度学习先驱之一的Yann LeCun告诉《金融时报》,这改写了Llama 4的历史。Meta在2025年4月发布模型时公布的基准结果“fudged a little bit”。他说,团队“used different models for different tests。”

每个基准使用不同模型。不是一个模型在标准测试套件中公平测试。Meta挑选在每个单独测试中得分最高的Llama 4变体,将结果挑选到一个表格中,并呈现为好像一个模型实现了所有这些。独立测试者表示,公开发布的模型得分明显低于声称的数字。

这并非来自举报人或调查记者的坦白。而是来自建立Meta AI研究部门的科学家。其影响远远超出一家公司的一个模型。

发生了什么

Llama 4于2025年4月5日发布,有两个变体:Scout和Maverick。Meta的博客文章声称这些模型“equally well or better”于OpenAI和Google的闭源竞争对手。基准表格看起来令人印象深刻。社区在几天内表示怀疑。

独立测试者运行自己的评估 consistently found lower scores than Meta had published. The discrepancies were not marginal. On key reasoning and coding benchmarks, community-run tests showed Llama 4 performing significantly below Meta's claimed levels. On LMSys Chatbot Arena, the most visible public benchmark, Maverick dropped from 2nd place to 32nd. Scout fell out of the top 100 entirely.

Meta的最初回应是否认。Meta副总裁Ahmad Al-Dahle将差异归因于Meta内部测试环境与公共部署之间的“cloud differences”。这个解释几乎没有说服任何人。社区已经给这个问题命名:Meta没有测试一个模型。它在测试多个模型并报告每个模型的最佳分数。

LeCun在2026年1月接受《金融时报》采访时证实了这一点。“The results were fudged a little bit,”he told the FT。他强调自己并未领导的团队“used different versions of the model for specific benchmarks, completely violating the principle of fair evaluation。”方法很简单:训练多个检查点,在每个基准上运行每个检查点,选择每个测试的最高分,编译成一个表格。没有单一模型真正达到公布的结果。

没有人被解雇。Meta反而在Alexandr Wang(前Scale AI CEO)的领导下创建了Superintelligence Labs,实际上替换了监督Llama 4的AI研究领导层。该组织被split into four divisions:TBD Lab负责Wang本人领导的基础模型,FAIR负责研究,Products和Infrastructure。四次重组在六个月内完成。LeCun离职创办了自己的AI初创公司。Llama品牌继续存在,但由新管理层领导,信誉永久受损。

为什么重要

Llama 4丑闻并非关于一个模型在一次基准测试中作弊。而是关于整个评估经济激励这种行为。

AI行业依赖排行榜。公司根据基准分数选择模型。投资者根据排行榜位置评估AI实验室。研究人员通过基准改进建立职业生涯。操纵这些基准的激励是结构性的,而非偶然的。Meta的罪过不是作弊。而是它被抓住了,并且其首席科学家证实了这一点。

排行榜经济的规模惊人。One analysis estimated that a $10 billion industry has been built on leaderboard gaming, where model selection strategies are driven by scores that may not reflect real-world performance. When the scores are unreliable, every downstream decision built on them, which model to use, which lab to invest in, which API to integrate, is also unreliable.

Meta在针对基准优化方面并非独一无二。它在被抓住并由首席科学家确认方面是独一无二的。每个主要AI实验室都针对基准进行优化。不同之处在于,大多数实验室没有让其最高级研究人员公开承认优化已越过界限变成操纵。r/LocalLLaMA上的社区回应迅速且持久:对官方基准数字的信任已永久受损。独立的社区运行评估现在已成为严肃模型比较的事实标准。

Meta的结构性回应证实了问题的系统性。该公司没有惩罚任何操纵行为。它在新的领导下创建了一个新组织。信息很明确:Llama 4团队的执行是问题所在,而不是产生它的根本激励。这些激励保持不变。如今每个AI实验室都面临Meta曾面临的同样压力:发布超越竞争对手的数字,否则就会在资金、人才和市场地位上输给这样做的实验室。

真正的问题是基准,而不是模型

基准不是中立的测量。它们是目标。当你把某事设为目标时,人们就会瞄准它。

AI行业的基准文化创造了一个恶性循环。基准发布。实验室针对该基准优化模型。分数提高。基准变得饱和。新的基准被创建。循环重复。在每个阶段,优化是真实的,但泛化值得怀疑。在推理基准上得分95%的模型可能仍会在与基准分布略有不同的推理任务上失败。

Llama 4没有发明这个问题。它暴露了它。LeCun的坦白之所以重要,正是因为它来自系统内部。他不是有议程的外部批评者。他是十多年来负责Meta AI研究的人。他仍然说结果被fudged。当内部人士不再相信基准时,我们其他人也应该停止相信。

结构性改革会是什么样子?独立的、实验室无法控制的第三方评估机构。随每个评估周期变化的动态基准,使过拟合不可能。强制披露用于每个公布分数的精确模型版本。以及重视现实世界可靠性而非排行榜位置的文化转变。这些改革在技术上都不困难。它们在政治上都很困难,因为它们威胁到AI行业围绕基准至上建立的营销机器。

社区已经开始构建替代方案。LMSys Chatbot Arena和类似平台获得了可信度,因为它们比静态基准更难操纵。由人类偏好判断的盲对盲比较正在取代自动准确性指标。但即使是竞技场也有自己的操纵向量。Llama 4丑闻表明,竞技场操纵经济是真实且不断增长的。唯一无法被操纵的评估是你自己在自己的数据上、为自己的用例运行的评估。其他一切都是营销。

Meta的AI信誉会怎样

Meta通过开源领导力建立了其AI声誉。Llama 1、2和3确立了该公司作为开源权重模型冠军的地位,是OpenAI和Google封闭生态系统的制衡。Llama 4本应延续这一遗产。相反,它成为开源社区对企业AI不信任的一切象征:基准被操纵,透明度是选择性的,声明未经独立测试无法验证。

Alexandr Wang时代代表了对产生丑闻的文化直接否定。Wang建立了价值140亿美元的数据基础设施公司Scale AI,于2025年6月被聘为Meta首席AI官。Superintelligence Labs是他的组织。四部门结构(TBD Lab负责模型,FAIR负责研究,Products负责部署,Infrastructure负责计算)中嵌入的信息是,Meta现在将AI视为产品工程问题而非研究问题。“发布研究人员生产的任何东西并希望基准能撑住”的时代结束了。

历史平行令人不安。大众汽车是一家以工程卓越闻名的公司,却被发现系统性地操纵测试结果。这个平行并不完美,基准操纵不像排放作弊那样非法,但结构性动态相同:针对测试优化,而非针对现实世界,并希望没人注意到。大众的声誉从未完全恢复。Meta的AI信誉可能遵循同样的轨迹。

开源社区已成为正式评估生态系统从未有过的问责机制。r/LocalLLaMA在发布后几天内就发现了Llama 4的差异,而基准行业花了几个月才承认问题。这是一种新的AI评估模型:社区驱动、透明、持续更新,且对任何供应商都不负责。它并不完美。但它比实验室自己公布的数字更可信。

接下来会怎样

Llama 4的继任者,预计将从Wang领导的Superintelligence Labs中诞生,将面临前所未有的审查。每个基准数字都会在发布后数小时内被独立验证。社区已经了解到,Meta的数字不能按字面意思接受。举证责任已从怀疑者转移到发布者。

基准行业本身面临改革压力。静态基准正在被动态、持续更新的评估取代。竞技场式的人类偏好排名正在补充传统的准确性指标。转变是向多维度评估:不只是“分数有多高”,而是“模型在生产中、在真实任务上、随时间的可靠性如何”。

未回答的问题是最重要的。如果Meta在Yann LeCun担任首席科学家的情况下操纵了基准,是什么阻止其他所有实验室做同样的事?答案是什么都没有。唯一的约束是害怕被抓住。正如LeCun的坦白所表明的,被抓住可能会让你失去首席科学家和信誉,但不会改变使作弊在最初变得合理的激励结构。产生Llama 4丑闻的系统仍然存在。它正在等待下一个模型发布。对于希望在不依赖供应商声明的情况下评估模型的开发者来说,running your own tests is the only reliable path.

FAQ: Common Questions About the Llama 4 Benchmark Scandal

Did Meta admit to cheating?

是的。Yann LeCun告诉《金融时报》,Llama 4基准结果“fudged a little bit”,团队为不同测试使用了不同模型版本。这是AI行业见过的最接近官方承认基准操纵的情况。

Were the publicly released models different from the benchmarked ones?

根据独立测试者和LeCun的确认,是的。用于产生公布分数的模型与公开发布的模型不同。社区评估一致发现性能低于Meta声称的水平。

Does this affect other AI companies?

它影响整个生态系统。如果最突出的开源AI公司在其首席科学家知情的情况下操纵了基准,所有供应商公布数字的可信度都值得怀疑。这一丑闻加速了向独立、社区运行评估的转变。

What happened to the Llama 4 team?

Meta在Alexandr Wang的领导下创建了Superintelligence Labs,实际上替换了AI研究领导层。LeCun作为首席AI科学家离职创办了自己的初创公司。Llama品牌在新的管理下继续存在。

Should developers still use Llama models?

基准丑闻是关于Meta的评估实践,而不一定是关于Llama 4的实际能力。独立评估表明Llama 4有能力,只是没有Meta数字声称的那么强。在决定之前,请在您的特定用例上运行自己的评估。

Llama 4基准丑闻将被铭记为AI行业承认每个人都怀疑的那一刻:数字不是真实的。不完全真实。不一致。确认这一点的人不是批评者。他是建立实验室的科学家。当内部人士不再相信基准时,我们其他人也应该停止相信。只有你自己在自己的硬件上、用自己的数据验证的数字才重要。其他一切都是营销。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page