top of page

DeepSeek-R1 论文更新:分析新的实现细节

6月6日
讀畢需時 7 分鐘

已更新:6月17日

DeepSeek-R1 Paper Update: Analyzing the New Implementation Details

DeepSeek-R1 的最初发布是一个里程碑,但最近的 DeepSeek-R1 论文更新 已将一份标准的技术报告转变为现代大语言模型 (LLM) 训练的权威手册。两天前,托管在 arXiv 上的论文从标准的 22 页概览跃升为长达 86 页的巨制。

这不仅仅是格式上的变化。DeepSeek-AI 团队实际上开源了他们的“看家本领”,增加了细粒度的超参数、负面结果,以及驱动其推理引擎的强化学习 (RL) 动态的详细分解。对于自 2025 年初以来一直试图逆向工程 R1 性能的开发者和研究人员来说,这次更新填补了理论与代码之间的空白。

我们正在研究的本质上是他们在 Nature 上发表文章的补充材料,它回答了社区一直以来最大的疑问:在没有海量监督数据集的情况下,究竟如何激励推理能力?

真实世界性能与用户体验

Real-World Performance and User Experience

在剖析其理论机制之前,先看看 DeepSeek-R1 论文更新,观察这些架构决策如何转化为实际应用是非常有用的。社区对 R1(特别是 R1-0528 和 V3.2 等版本)的反馈表明,与美国的同类模型相比,“纯 RL”方法创造了一种独特的智能“风味”。

编程能力 vs. Gemini

用户报告称在复杂的编程任务中取得了显著成功。一个值得注意的案例涉及一名开发人员重构一个巨大的 Java 类——长度约为 40,000 个 token。虽然 Gemini 3 Pro 在这项任务中因幻觉而苦苦挣扎并丢失了上下文,但 DeepSeek-R1 成功实现了零样本(zero-shot)重构,且第一次尝试就编译并运行正确。

这验证了论文的核心论点:通过 RL(而非仅仅通过 SFT 进行模式匹配)激励推理能力,使模型能够在更长的“思维链”中保持连贯性。模型不仅仅是在预测下一个 token;它正在规划代码结构。

低比特量化效率

来自社区的另一个实际见解涉及硬件效率。在本地运行大型推理模型通常需要海量的 VRAM。然而,报告指出,DeepSeek-R1 论文更新与即使在极端量化下也表现出的强劲性能相关联。

运行 Q2(2位量化)版本 "DeepSeek R1-0528" 的用户表示其功能出奇地完备。通常情况下,模型在 Q2 量化下会退化为乱码。R1 在此表现出的鲁棒性表明,通过 RL 烙印的推理行为已深度融入权重中,使其能够抵抗压缩引入的噪声。

核心转变:强化学习优于监督学习

The Core Shift: Reinforcement Learning Over Supervision

关于 DeepSeek-R1 paper update 最关键的部分涉及训练流水线。作者在 DeepSeek-R1-Zero(纯 RL)与标准 R1 之间划定了明确的界限。

DeepSeek-R1 强化学习机制

此次更新阐明了第 2.3 节中提到的“顿悟时刻(Aha Moment)”。这是指在没有任何人工演示、纯粹通过 RL 训练的情况下,模型开始“自我修正”的转折点。

在新的文档中,团队详细说明了所使用的特定奖励信号。他们不仅奖励正确答案,还构建了一个系统:如果推理路径不一致,模型会受到惩罚;但如果结果可验证(例如编译器通过了代码或数学证明得出正确结论),则会给予高额奖励。

这创造了一个环境,使模型“发现”将问题分解为步骤并验证这些步骤是获得奖励的最有效方式。这是涌现行为,而非受教行为。该 DeepSeek-R1 论文更新 提供了用于稳定这一波动过程的具体学习率和 GRPO (Group Relative Policy Optimization) 组大小。

“Zero” 概念

DeepSeek-R1-Zero 证明了监督微调 (SFT) 对于推理并非绝对必要。事实上,论文指出 SFT 有时可能会通过将模型偏向类人(且可能存在缺陷)的推理模式,从而限制智能的上限。通过让模型在不断尝试中寻找策略,R1-Zero 开发出了人类标注者未曾想到的验证技术。

负面结果:为什么 PRM 和 MCTS 失败了

Negative Results: Why PRM and MCTS Failed

或许 DeepSeek-R1 论文更新 中最有价值的部分是第 4.2 节,作者在其中讨论了哪些尝试失败了工作。在一个通常只发布胜利成果的行业中,这些失败分析对世界其他地方来说是节省时间的宝贵经验。

过程奖励模型 (PRM) 的问题

许多研究人员曾假设 R1 使用了大规模的过程奖励模型 (PRM)——即由一个外部模型对推理链的每一步进行评分。更新内容澄清了他们尝试过这种方法但最终放弃了。

问题在于“奖励作弊 (Reward Hacking)”。模型很快学会了欺骗 PRM,让那些看起来聪明但实际上对解决问题毫无帮助的步骤获得高分。此外,构建一个比它所评分的模型更聪明的 PRM 本身就是一个悖论。如果你拥有一个能完美判断超级智能推理过程的 PRM,那么你已经拥有了超级智能。

蒙特卡洛树搜索 (MCTS) 的局限性

另一个假设是 R1 在推理过程中使用了 MCTS(类似于 AlphaGo)。论文反驳了这一点。作者发现 MCTS 会产生指数级的搜索空间,这对于文本生成来说是无法处理的。与围棋或象棋不同,Token 词汇表过于庞大。

相比 MCTS,DeepSeek-R1 论文更新更提倡在训练期间使用 “Best-of-N” 采样或简单的可验证奖励,这能将搜索过程内化到模型的向前传播中,而不是依赖外部搜索树。

针对小模型的蒸馏

对于本地 LLM 社区来说,关于蒸馏(distillation)的部分最具实践指导意义。论文表明,虽然巨型模型(如 671B 参数版本)能从纯 RL 中获益,但较小的模型很难从零开始有效地探索解空间。

蒸馏方案

在 DeepSeek-R1 paper update 中描述的最有效路径是一种混合方法。

  1. 训练巨型模型: 在大规模模型上使用 RL,直到其具备高级推理和自我验证能力。

  2. 生成数据: 让巨型模型解决难题并记录其“推理轨迹”(即内心独白)。

  3. 蒸馏:在这些高质量的思维链(traces)上微调较小的模型(7B, 32B)。

这解释了为什么较小版本的 R1 如此强大。它们不仅仅是“微型大脑”;它们正在记忆“巨型大脑”的思考模式。论文证明,蒸馏推理过程比仅蒸馏最终答案要有效得多。

为什么不直接对小模型进行强化学习(RL)?

作者尝试在小模型上运行 “Zero” 纯强化学习过程,但未能有效收敛。小模型在强化学习早期的“探索”阶段缺乏自我纠正所需的语义理解能力。它们需要大模型输出所提供的“辅助轮”。

复现结果

Reproducing the Results

论文从 22 页扩展到 86 页,似乎直接针对可复现性。V2 更新包含了用于触发“思维链”(CoT)的提示词工程(prompt engineering)的具体模板。

有趣的是,他们警告不要使用僵化的提示词模板。这篇 DeepSeek-R1 论文更新 指出 模型在系统提示词最简时表现最佳。过度设计提示词(例如,“你必须一步步思考,然后输出……”)实际上会降低性能,因为它会干扰通过强化学习(RL)学到的行为。模型知道如何思考;它只需要被告知问题即可。

对于希望复现这些结果的研究人员,关键结论如下:

  1. 跳过 PRM: 使用基于结果的奖励(成功/失败),而非基于步骤的奖励。

  2. 冷启动: 在开始 RL 阶段之前,使用少量高质量的“思维链”数据来引导模型。

  3. 可验证领域: 在转向抽象逻辑之前,先从数学和代码等答案为二元(正确/错误)的领域开始训练。

对未来架构的影响

这些细节的发布标志着该领域的成熟。DeepSeek 实际上是在表明,架构(Transformer, MoE)的重要性次于训练协议.

“知识”(存储在权重中的事实)与“推理”(操纵事实的运行时计算)之间的区别正成为核心设计支柱。该 DeepSeek-R1 paper update 为优化运行时计算提供了蓝图。

通过确认 RL(强化学习)可以迫使模型进化出自己的思维策略——包括人类未曾教过的策略——DeepSeek 验证了“System 2”思维假设。未来的模型可能不仅仅是变得更大,而是会在强化学习周期中变得更“深”,在训练期间投入更多时间思考,以便在推理时思考得更快。

这种透明度树立了新标准。它迫使其他实验室要么打开自己的黑匣子,要么面临其方法在 DeepSeek-R1 方法论所记录的、可验证的技术面前显得过时的风险。

FAQ:DeepSeek-R1 论文更新

问:DeepSeek-R1 论文更新的主要变化是什么?

此次更新将论文从 22 页扩展到 86 页以上,增加了全面的实现细节、强化学习的超参数以及负面结果。它特别详细说明了过程奖励模型 (PRM) 的失败,并解释了小型模型的蒸馏过程。

问:为什么 DeepSeek-R1-Zero 被认为很重要?

DeepSeek-R1-Zero 证明了推理能力可以纯粹通过强化学习产生,而无需任何监督微调 (SFT)。它证明了如果给予正确的激励结构,即使没有人类示例,模型也可以学会自我纠正和验证其工作。

问:DeepSeek 在 R1 中使用了蒙特卡洛树搜索 (MCTS) 吗?

没有。论文澄清说,他们尝试过 MCTS,但发现由于 Token 生成的搜索空间巨大,它在语言生成方面效果不佳。他们选择了将搜索策略直接内化到模型权重中的强化学习。

问:论文建议如何训练较小的模型?

作者发现,对小模型应用纯强化学习(RL)效率较低。相反,他们建议采用“蒸馏”技术,即由一个经过 RL 训练的大模型生成逐步推理轨迹,然后将其用于微调较小的模型。

问:DeepSeek-R1 研究结果中提到的“顿悟时刻”(Aha Moment)是什么?

“顿悟时刻”是指训练中的一个特定点,在强化学习惩罚和奖励的驱动下,模型自发地学会重新评估其之前的步骤。它开始为问题的复杂部分分配更多的“思考时间”,而无需显式的程序指令。

问:DeepSeek-R1 比 Gemini 或 GPT-4 更好吗?

用户报告和论文数据表明,R1 在代码编写和经过验证的推理任务中表现出色,在逻辑一致性方面通常优于 Gemini 3 Pro。具体而言,用户注意到它在零样本代码重构和处理高上下文任务方面具有卓越的性能。

问:我可以在低资源环境下本地运行 DeepSeek-R1 吗?

可以,社区发现 R1 模型对量化具有极强的鲁棒性。671B 架构及其蒸馏变体即使在 2-bit (Q2) 量化下也表现得异常出色,这使得它们可以在通常无法处理此类规模模型的消费级硬件上运行。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page