Dwarkesh Patel 预训练研究发现:数据胜过模型改进
Dwarkesh Patel 与 Jerry Han 发布了一项预训练研究,得出了一个引人注目的结果:数据改进带来了 12 倍的计算效率提升。在相同的实验框架下,模型配方改进带来了 3.7 倍的提升。因此,Dwarkesh Patel 的预训练研究将数据带来的效率进步归因于模型改进的约 3.24 倍。
这一发现挑战了人们对语言模型进步的一种常见叙事。公开讨论往往聚焦于架构、优化器、更大的集群以及新的注意力机制。Patel 和 Han 则发现,在其测试范围内,更优质的语料带来了更大的效率优势。
研究人员重建了六年的开放预训练进展,从 GPT-2 时代的系统一路追溯至 OLMo-2 时代的配方。他们将具有代表性的模型设计与代表性数据集组合,并在多个计算预算下训练这些组合。这让两种解释得以直接较量:更好的机器与更好的材料。
这一结果并不能说明 OpenAI、Anthropic、Google DeepMind 或 Meta 内部发生了什么。这些公司披露的当前训练数据相关信息有限。不过,它确实改变了举证责任:任何将数据工程视为次要事项的人,都需要拿出更有力的证据。
Dwarkesh Patel 预训练研究重建了六年的进展
Patel 和 Han 试图分离两个通常会同步变化的变量:模型配方与训练语料。
他们的预训练实验于 2026 年 9 月 8 日发布。研究涵盖了 2019 年至 2025 年间发布的代表性开放模型配方和公共数据集。作者从零开始训练了这些要素的各种组合。
模型配方包括架构、优化器、初始化、学习率调度、归一化方法以及其他训练选择。语料则是被转换为 token、用于预训练的文本集合。大多数公开模型发布会同时改变这两个组成部分,使得各自的贡献难以分离。
模型维度以 GPT-2 配方为起点,以 OLMo-2 为终点。中间的变化包括旋转位置嵌入、RMSNorm、SwiGLU 激活函数、调整后的归一化位置、QK 归一化以及更干净的初始化方法。每一项改进都会改变模型表征信息的方式,或提升其训练过程中的稳定性。
数据维度始于 OpenWebText。这个 2019 年的语料库包含约 90 亿 token,来源是被足够热门的 Reddit 帖子链接到的网页。后续数据集采用了覆盖面更广的网络抓取、更强的内容提取、去重,以及愈发严格的质量过滤。
2025 年的终点是 UltraFineWeb。其流程对规模大得多的网页文档池应用了更复杂的过滤。一些现代过滤器使用经过训练的分类器,来预测哪些文档能够提升模型的下游表现。
Patel 和 Han 测试了五个标称计算预算,范围从 100 千万亿 FLOPs 到 100 亿亿 FLOPs,即写作 1e17 至 1e19 FLOPs。FLOPs 衡量训练期间消耗的算术运算次数。
在每个预算下,研究人员都改变了模型规模与 token 数量。这一过程让他们能够估计每种模型与语料配对下的计算最优组合。计算最优意味着在固定训练计算量内取得最强的实测结果。
他们还控制了实验中的若干其他选择。每次运行都使用 GPT-2 BPE 分词器,其词表大小为 50,257 个 token。每次运行还采用 2,048-token 的上下文长度,以及包含 262,144 个 token 的批次。
研究人员通过 OLMES 评估最终能力,OLMES 是由十项相对易于获取的基准构成的集合。其中大多数采用多项选择问答。他们选择能力评估,是因为跨不同训练数据集比较交叉熵损失会造成不公平的测试。
这一选择很重要。若根据用于定义训练分布的同一语料来评估模型,模型可能获得人为优势。下游任务提供了共同目标,尽管也会引入更多统计噪声。
团队针对计算扩展曲线运行了多个独立随机种子。随机种子会改变随机初始化和数据排序,有助于揭示结果是否能在不同训练变动下持续存在。在 3.16e18 FLOPs 的更大 7×7 网格中,每个组合使用了一个随机种子。
在 1e19 FLOP 的预算下,较新的数据相较于 2019 年的数据基准产生了 12 倍的计算乘数。较新的模型配方相较于 GPT-2 配方产生了 3.7 倍乘数。两者的比值得出了数据拥有 3.24 倍优势这一核心结论。
计算乘数描述的是,较新的要素达到旧要素性能所需计算量减少了多少。它并不意味着模型变得聪明了十二倍。它描述的是在特定性能水平和评估套件下的效率。
作者还发现,在 3.16e18 FLOPs 下,数据与模型带来的收益在很大程度上相互独立。一个加性统计模型解释了 OLMES 分数变异的 88%。仅约 12% 留给了交互作用、高阶效应或评估噪声。
这一结果表明,更好的数据并不需要某种特殊架构才能带来收益。同样,架构改进通常在不同语料中都依然有效。这种独立性让人更难将数据贡献视为某一幸运模型与数据集配对的偶然结果。
数据工程赢得了效率竞赛
在这项实验中,改进模型阅读的内容,比改进其阅读机制更重要。
这一结果与日益壮大的以数据为中心的语言模型研究相吻合。现代语料库不只是更庞大的互联网文本堆。其构建者会提取更干净的内容、删除重复、平衡来源、过滤低价值文档,并控制污染问题。
去重会删除完全相同或近乎相同的材料。若不进行去重,被频繁复制的页面可能主导训练,并降低语料的有效多样性。内容提取则将有意义的文本与菜单、广告、模板内容及损坏的标记分离开来。
过滤随后决定哪些文档值得占用有限的训练计算资源。早期过滤器高度依赖语言、长度、重复度和标点相关规则。较新的流程则越来越多地应用分类器,这些分类器基于有用与无用文本样本进行训练。
DataComp-LM 通过受控的数据集竞赛让这一方法变得可量化。其研究人员发布了一个包含 240 万亿 token 的 Common Crawl 数据池,并为参与者固定了训练配方。团队因此可以通过过滤和数据混合策略竞争,而不是修改模型。
DataComp-LM 结果发现,基于模型的过滤是其最强基线的核心。其 70 亿参数模型在 2.6 万亿 token 上训练后,在 MMLU 上取得了 64% 的五样本准确率。
该模型在报告的基准上表现可与更大的开放模型相当。作者还报告称,与 MAP-Neo 相比,其 MMLU 成绩高出 6.6 个百分点,同时训练计算量少用 40%。这些是独立实验,但其方向支持 Patel 和 Han 的结果。
DataComp-LM 还揭示,过滤器设计的重要性可能超出预期。在一个测试规模下,更换过滤模型可使五样本 MMLU 准确率从 35% 升至 44%。所有方法使用的底层原始网页池保持不变。
令人意外的是,表现最佳的测试过滤器使用的是一个相对简单的二元语法分类器,并配以经过谨慎挑选的正负样本。在这些实验中,人类对文档质量的判断价值有限。对读者而言精致的内容,并不总能带来更好的学习信号。
FineWeb 研究得出了相关结论。其创建者比较了大规模网页语料中的提取、语言过滤、去重和质量选择方案。这项工作将数据集创建视为一门实证工程学科,而不是清理步骤。
FineWeb 数据集还产出了一个通过训练分类器选出的教育导向子集。该策略强调与高质量教育材料相似的页面。这类过滤器旨在提高每个 token 所含的有效推理与事实密度。
这段历史解释了 Dwarkesh Patel 关于数据的发现。OpenWebText 已经对网页进行了过滤,但它将 Reddit 热度作为宽泛的质量信号。后续流程则根据实际模型表现测试了更直接的信号。
这种差异类似于用经过测量的课程替代通用推荐列表。两者都包含可读材料,只有后者会优化学习者从每小时中获得的收益。
这种预训练数据效率之所以重要,是因为每个 token 都会消耗计算资源。低价值重复内容、损坏文本和无关模板内容,会在固定预算内与有用样本争夺资源。更好的筛选能让相同的加速器时间产出更多学习成果。
经济影响超出单次训练运行。一个数据集流程可以支持重复实验、多代模型和专用变体。对这一流程的改进,可能在整个组织的研究计划中不断累积。
数据也塑造了哪些能力会涌现。富含代码的语料不会与以对话散文为主的语料表现相同。科学论文、法律文本、多语言文档和合成推理轨迹,都会从不同方向推动学习。
这给前沿实验室带来了压力。它们不能假设再订购一批硬件就能弥补薄弱的语料设计。它们需要在来源追溯、授权、提取、过滤、混合设计、评估和持续更新方面建立更强的系统。
这种压力同样延伸至较小的模型开发者。加速器资源有限的团队无法在直接投入上取胜,但它们仍可以提升每个训练批次的信息密度,并让语料针对特定能力进行优化。
不过,这项研究并不意味着每个狭窄的数据集都更好。在报告的实验中,The Pile 在 OLMES 上的表现逊于 OpenWebText。The Pile 包含来自论文、代码、专利和法律文档等来源的多样化材料。
OLMES 主要评估英语网页风格的多项选择任务。因此,即使专门材料在其他领域支持了有价值的能力,也可能几乎得不到认可。脱离目标,数据质量并不存在普适定义。
更好的模型仍让更大规模训练成为可能
12 倍的数据结果衡量的是效率,但模型研究同样扩大了有用训练能够持续进行的规模。
Patel 和 Han 明确反对对其核心结论最简单化的解读。他们的实验并未表明六年的模型研究贡献甚微。它衡量的是在相对较小规模下,达到特定下游分数所需的计算量。
许多模型创新服务于不同目的。它们让训练在参数规模、上下文窗口、数据量和加速器集群扩大时仍保持稳定。某项能防止超大规模训练崩溃的改进,未必会在小规模效率图表中占据主导地位。
更大的训练集群会带来大量故障点。梯度可能爆炸或消失。通信带宽可能成为瓶颈。内存压力可能限制序列长度、批量大小或优化器状态。
归一化调整可以提升稳定性。更好的初始化可以避免训练早期发散。内核层面的优化可以让加速器持续工作,而非等待内存搬运。
FlashAttention 提供了一个重要的历史案例。它围绕内存访问重组了精确注意力计算,减少不同内存层级之间代价高昂的数据传输。这可以在不改变基本注意力结果的前提下,扩展可行的序列长度。
混合专家模型解决了另一项扩展约束。它们仅为每个 token 激活网络的一部分,使总参数容量能够增长,而每个 token 的计算量不必等比例增加。这类设计会使路由和分布式训练更加复杂。
分组查询注意力可以降低推理期间缓存键和值所需的内存。当模型需要服务数百万条提示词时,这一点尤为重要。Patel 和 Han 指出,这类推理改进并未纳入其预训练计算倍数中。
分词器改进同样不在实验范围内。分词器决定文本如何转化为模型可读取的单元。更高效的分词可以缩短序列长度,或改善跨语言和跨领域的表示效果。
因此,核心对立并非数据工作者与模型研究者,而是数据效率与模型所支持的规模。更好的语料库有助于系统在固定预算下学到更多。更好的模型工程则让实验室能够部署更大预算,而不会陷入不稳定或难以承受的额外开销。
Google DeepMind 的 Chinchilla 工作说明了这些变量如何交汇。早期的扩展实践经常在未按比例增加训练数据的情况下扩大参数规模。由此产生的模型消耗了大量推理资源,却仍处于训练不足的状态。
DeepMind 训练了超过 400 个模型,以估计参数与 token 之间的最优分配。其 compute-optimal research 得出结论:在其测试条件下,模型规模和 token 数量应同步增长。
Chinchilla 使用了 700 亿参数和 1.4 万亿训练 token。Gopher 在相近的计算预算下使用了 2800 亿参数。规模更小、训练更充分的 Chinchilla 在大多数已报告评测中优于 Gopher。
这一结果将关注重点从参数数量转向训练时长和数据集规模。它并未否定架构研究,而是表明模型规模本身无法很好地描述计算资源被利用得有多有效。
Patel 和 Han 通过区分语料版本与配方版本,延续了这场讨论。Chinchilla 所问的是:在给定计算预算下,应购买多少参数和 token。新研究则追问,进步更多来自容器,还是来自其内容。
在这一规模下,答案倾向于内容。然而,容器决定了能够承载多少内容。Patel 和 Han 将小模型比作帆船,将前沿系统比作集装箱船。
对于容量稀缺的帆船而言,精心挑选的货物至关重要。集装箱船可以运载多得多的材料,并经受更恶劣的条件。它的价值体现在规模和可靠性上,而不仅仅是速度。
对于 AI 实验室而言,这两种能力仍然不可或缺。没有稳定的软件和硬件,干净的语料库无法完成训练。高效的架构若训练批次中充满重复或低价值材料,依然会浪费计算资源。
这项研究所提出的有益反转更为狭窄。架构不应再因每一代性能提升而自动获得全部功劳。当数据和配方都在改进时,必须通过受控消融实验确定哪项改变造成了观察到的增益。
12 倍发现并未证明什么
最有力的结论同样边界明确:在一项开放的小规模预训练实验和一套能力评测中,数据占据了主导地位。
作者反复强调这些限制。他们的最高预算为 1e19 FLOPs,远低于现代前沿训练运行。依赖规模的技术在小模型中可能几乎没有明显收益,直到更晚阶段才变得不可或缺。
小模型的容量有限。低价值 token 可能挤占重要材料,因为模型无法吸收所有内容。因此,激进筛选对小模型的帮助可能大于对表征容量大得多的系统。
即便平均文档质量下降,大模型也可能从广泛覆盖中受益。更大的容量可以将微弱信号与噪声区分开来。过度过滤可能移除罕见事实、非典型文风、少数语言或小众技术材料。
激进过滤也会缩小独特语料库。开发者随后必须在更多 epoch 中重复保留下来的材料,也就是对相同样本进行更多轮遍历。重复可能带来收益递减或过拟合。
关于 data-constrained scaling 的研究发现,重复数据仍然有用,但随着额外遍历次数增加,其价值会下降。这就在平均质量、总体多样性和重复之间形成了权衡。
Patel 和 Han 提出了更大的不确定性。前沿模型的训练往往超出经典 Chinchilla 最优 token 分配,因为较小模型可以降低后续推理成本。在这一策略下,经过筛选的数据集可能需要大量重复。
OLMES 评测带来了另一项限制。其十项任务相对容易,且主要基于多项选择问答。不同的评测可能改变模型配方、数据集或两者的排名。
编程基准可能更青睐代码仓库和技术文档。科学基准可能更偏向论文和专业解释。多语言测试则会重视以英语为中心的评测套件可能忽视的语言覆盖度。
作者观察到与这一测量问题一致的异常现象。尽管 NeoX 在较低测试预算下胜过 GPT-2,但在 1e19 FLOPs 的 OLMES 上表现更差。NeoX 在留出的 FineWeb-Edu 损失上也表现更好。
The Pile 的广泛混合来源在 OLMES 上同样不如 OpenWebText。这并不能证明多样化来源普遍低效,而可能表明该评测对其专业知识给予的认可有限。
部分报告的倍数需要外推。NeoX 和 The Pile 的曲线并不总能在测量范围内达到所需的参考性能。将拟合曲线延伸到已观测结果之外会引入额外不确定性。
超参数调优也构成另一项误差来源。最终能力会随峰值学习率、批量大小、初始化和训练计划而变化。研究人员在选定的锚点上扫描了学习率,但无法测试所有可能配置。
他们认为,模型配方倍数的不确定性超过图中显示的统计误差条。这些误差条反映其估计流程带来的变化,却无法捕捉有限超参数优化的所有后果。
报告中的年度效率率进一步说明需要保持谨慎。模型变化带来了 1.24 倍的年度乘数,数据变化带来了 1.51 倍。两者合计,测得的年度增益为 1.57 倍。
这些数字低于此前约为每年三倍的软件效率提升估计。Patel 和 Han 提出了若干解释,包括依赖规模的增益、被排除的推理优化、分词器变化,以及代表性配方的选择。
该研究还排除了现代能力进步的重要来源。它聚焦于预训练,即模型从广泛语料中学习通用模式的阶段。它并未拆解强化学习、后训练、工具使用或测试时计算的影响。
Patel 和 Han 指出,在发表前两年里,强化学习推动了许多可见的进步。模型无需改变其基础预训练效率,也可以在推理或遵循指令方面变得更强。
合成数据仍是另一项重大空白。前沿实验室利用模型生成解释、代码、推理轨迹和任务示例。该实验考察的是主要从 Common Crawl 中筛选子集的公开语料。
作者没有测试合成生成能否扩充数量有限的高质量信息供给。他们也没有比较合成扩充与在更多 epoch 中重复原始文档的效果。
最后,该研究并未复现封闭的前沿流程。大型实验室很少披露完整的数据集组成、过滤分类器、混合权重或污染控制措施。其内部系统可能与公开配方存在显著差异。
恰当的解读应当谨慎,但也具有意义。该实验提供证据表明,语料进步应获得更多因果归因。它并未为所有模型、规模、基准或实验室提供一条普适的 12 倍定律。
数据质量正成为一项一级扩展变量
行业正日益将数据质量视为可测量的扩展输入,而非语料库的非正式属性。
传统扩展定律将性能与模型规模、训练 token 和计算量联系起来。它们往往假定一个 token 与另一个 token 具有可比性。真实数据集会因噪声、重复、领域差异和信息密度不均而违背这一假设。
近期研究开始直接对质量建模。一篇 ICLR 2026 论文引入了无量纲质量参数,并扩展了 Chinchilla 风格的扩展定律。其目标是同时根据数据量、模型规模和数据质量预测损失。
该 quality-aware model 使用基于损坏程度和数据集缺陷的代理指标。受控实验发现,更高质量的数据可以减少达到目标损失所需的模型规模和计算量。
这一方法并未验证 Patel 和 Han 的精确倍数,但支持了其结果背后的更广泛机制。拥有相同 token 数量的两个语料库,能够提供非常不同的有效学习量。
这改变了团队描述扩展的方式。token 数量仍然必要,但无法揭示这些 token 是否独特、相关、准确或具有教育价值。单凭计算量数字也无法揭示训练批次是否携带有用信号。
同样的原则也适用于前沿之下。将模型适配到自身领域的公司,必须决定哪些文档代表可信知识。将所有可用文件输入管线,可能放大重复、过时政策和相互冲突的指令。
良好的信息基础设施会保留来源信息,并使冲突材料清晰可见。它也能帮助人们找到模型生成答案背后的来源。一个 searchable knowledge base 将类似的纪律应用于组织规模。
因此,开发者应区分三个问题。第一,语料库是否包含目标任务所需的知识?第二,管线能否干净地提取并表示这些知识?第三,评测是否奖励了预期能力?
企业采购方在评估专业模型时也应提出相关问题。供应商的参数数量几乎无法说明领域覆盖度或来源新鲜度。基准分数同样可能掩盖狭窄的数据选择,而这些选择在真实工作流中会失效。
知识工作者也面临同类问题的缩小版。保存更多材料并不会自动带来更好的检索或推理。其价值取决于相关性、组织方式、时效性,以及系统连接证据的能力。
对于前沿实验室而言,更好的数据管线可能会成为可与模型代码媲美的专有资产。公开架构往往很快被复制。高质量数据混合需要持续获取渠道、法律审查、实验,以及来自训练运行的反馈。
这由此形成了一道不那么显眼的竞争鸿沟。资金充足的实验室能够购买授权数据集、由专业人士制作的示例、私有代码库和合成环境。规模较小的团队则更依赖公开网络语料和可复现的筛选机制。
这一转变也带来了治理问题。更严格的筛选需要先定义何为有用。这一定义可能会压制方言、少数群体视角、有争议的材料,或与分类器偏好示例不同的知识。
优化也可能过于直接地瞄准基准测试。针对评估表现训练的过滤器,可能会选择与已知测试相似的文档。若缺乏污染控制,看似更高的数据质量可能实际上是隐蔽的基准暴露。
因此,数据集工程需要接受与模型设计同等严格的审查。研究人员需要进行消融实验、记录数据来源、开展留出评估、污染测试,并检验跨多个领域的表现。单一综合分数无法涵盖所有权衡。
Patel 和 Han 的工作通过将数据年代作为独立实验轴,为此提供了帮助。未来研究可以将这一设计扩展至不同语言、领域、模型规模和合成数据混合。它们也可以衡量事实准确性、编程、推理、安全性和长上下文使用能力。
最重要的运营变化其实很简单。团队应停止将训练数据视为在严肃工作开始前就选定的静态输入。即使不出现在架构图中,语料设计也是模型的一部分。
三项信号将检验“数据优先”论点
接下来的证据必须表明,这一结果能否经受前沿规模、合成扩展和更广泛能力测试的考验。
第一个信号是更大规模的复现。Patel 和 Han 的计算量达到 1e19 FLOPs,并将其实验描述为极小规模。后续研究必须将同样的交叉设计扩展至更大的模型和显著更高的计算预算。
这项复现应保持核心区分不变。研究人员需要针对多个语料年代采用具有代表性的模型配方,而不是进行所有变量同时变化的比较。多个随机种子和相当的超参数调优投入同样重要。
如果数据乘数在更高规模下仍然更大,核心论点就会得到显著增强。前沿实验室将拥有更坚实的证据,证明数据策展仍是主导性的效率杠杆。乘数缩小则会支持作者提出的集装箱船解释。
第二个信号是一项受控的合成数据研究。研究人员应从有限但高质量的语料开始,并比较两种策略。一种重复使用原始材料,另一种则通过精心生成的合成示例来扩展数据。
评估不能只检查基准准确率。它还应衡量新颖性、事实可靠性、多样性、记忆化程度,以及在生成器最强领域之外的表现。否则,合成扩展可能只是在复制熟悉的模式。
显著的合成数据优势将削弱“固定数据墙正在逼近”的观点。实验室可以将有限的人类创作材料转化为规模大得多的训练课程。结果若不理想,则会提升授权数据和专家生成数据的战略价值。
第三个信号是评估广度。未来复现应测试编程、数学、多语言能力、事实检索、科学推理和长上下文任务。研究也应分别报告结果,而不是将其隐藏在一个平均值中。
若这些类别中均呈现一致的数据优势,将增强 Dwarkesh Patel 预训练研究的说服力。不同类别之间的巨大差异则会表明,语料质量高度依赖于所选目标。这一结果将支持专业化数据混合,而非单一通用排名。
读者还应关注信息披露方式。如果开放模型构建者发布更好的数据集卡、混合细节和筛选实验,独立研究人员就能更严格地检验这一主张。持续保密将维持公开证据与前沿现实之间的巨大差距。
对开发者而言,眼下的启示并不是放弃架构工作,而是以同等严肃的态度衡量数据管线。追踪重复率、来源贡献、混合权重、时效性,以及每项筛选决策带来的性能变化。
对企业团队而言,启示是要询问模型知识来自何处,以及这些知识如何维护。更大的模型无法保证答案是最新、相关或可追溯的。在增加一层模型复杂性之前,更好的信息输入往往更重要。
对知识工作者而言,实际问题也类似:哪些信息值得占用有限的注意力?更好的选择能够改善人类和机器的推理。毫无结构地收集一切,只是把筛选问题转移到了别处。
Dwarkesh Patel 的数据研究结果使一个结论难以忽视。公开叙事过度强调了可见的模型变化,因为架构比语料管线更容易被命名。受控证据如今赋予这个更安静的变量更大的作用。
接下来的三项测试将决定这一作用能延伸多远。关注更高计算量的复现、合成数据与重复训练的比较,以及多样化的能力评估。它们共同能够确认或收窄这样一种主张:预训练的进步主要来自数据。
在此之前,应将 12 倍结果视为强有力的实验信号,而不是普适常数。审计输入系统的信息,针对真实任务测试变化,并保留支撑每项结论的来源。更好的模型依然重要,但它们的表现始于它们被允许学习的内容。



