DeepSeek-R1 Paper Update: 新しい実装詳細の分析
- Aisha Washington

- 6月6日
- 読了時間: 10分
更新日:6月17日

DeepSeek-R1の初回リリースはマイルストーンでしたが、最近のDeepSeek-R1 paper updateは、標準的なテクニカルレポートを現代の大規模言語モデル(LLM)トレーニングのための決定的なハンドブックに変えました。2日前、arXivで公開されていた論文は、標準的な22ページの概要から86ページの巨大なドキュメントに拡大しました。
これは単なるフォーマットの変更ではありません。DeepSeek-AIのチームは事実上「キッチンシンク」をオープンソース化し、詳細なハイパーパラメータ、ネガティブな結果、そして推論エンジンを支える強化学習(RL)のダイナミクスの詳細な内訳を追加しました。2025年初頭からR1のパフォーマンスをリバースエンジニアリングしようとしてきた開発者や研究者にとって、このアップデートは理論とコードの間のギャップを埋めるものです。
We are looking at what is essentially the supplementary material for their publication in Nature、そしてそれはコミュニティが抱えていた最大の疑問に答えています。それは、大規模な教師ありデータセットなしで推論をどのように正確に奨励するかということです。
実世界でのパフォーマンスとユーザー体験

理論的なメカニズムを分析する前にDeepSeek-R1論文更新、これらのアーキテクチャ上の決定が実際の使用にどのように反映されるかを見ることは有用です。R1(特にR1-0528やV3.2のようなバージョン)に対するコミュニティの反応は、「純粋なRL」アプローチが、米国ベースの同等物と比較して、明確な「風味」の知性を生み出すことを示唆しています。
Geminiとのコーディング能力比較
ユーザーは複雑なコーディングタスクで大きな成功を報告しています。注目すべき報告の1つは、開発者が約40,000トークンの巨大なJavaクラスをリファクタリングしたというものです。このタスクではGemini 3 Proは幻覚を起こしやすくコンテキストを失いましたが、DeepSeek-R1はゼロショットリファクタリングを成功させ、コンパイルして初回試行で正しく実行されました。
これは、論文の中心的な命題を裏付けています。つまり、RL(単なるSFTによるパターンマッチングではなく)を通じて推論能力を奨励することで、モデルはより長い「思考連鎖」にわたって一貫性を維持できます。モデルは単に次のトークンを予測しているのではなく、コード構造を計画しています。
低ビット量子化の効率
コミュニティからのもう一つの実践的な洞察は、ハードウェア効率に関するものです。大規模な推論モデルをローカルで実行するには、通常、大量のVRAMが必要です。しかし、報告によると、DeepSeek-R1論文アップデートは、極端な量子化でも高いパフォーマンスと相関があることが示されています。
Q2(2ビット量子化)で「DeepSeek R1-0528」バージョンを実行しているユーザーは、驚くほど機能的だと述べています。通常、モデルはQ2では意味不明なものに劣化します。R1のこの堅牢性は、RLによって刻印された推論行動が重みの中に深く改善され、圧縮によって導入されるノイズに耐性があることを示唆しています。
コアシフト:教師あり学習を超えた強化学習

の最も重要なセクションDeepSeek-R1論文アップデートはトレーニングパイプラインを扱っています。著者は、DeepSeek-R1-Zero(純粋なRL)と標準のR1の間に明確な一線を引いています。
DeepSeek-R1強化学習のメカニズム
このアップデートは、セクション2.3で言及されている「Aha Moment」を明確にしています。これは、人間のデモンストレーションなしに純粋にRLでトレーニングされたモデルが「自己修正」を開始するポイントです。
新しいドキュメントでは、チームは使用された具体的な報酬シグナルを詳述しています。彼らは単に正しい答えに報酬を与えたわけではありません。彼らは、モデルが一貫性のない推論トレイルに対して罰せられるが、検証可能な結果(コンパイラがコードをパスしたり、数学の証明が正しく解決されたりするなど)に対しては大幅に報酬が与えられるシステムを構築しました。
これにより、モデルが報酬を得るための最も効率的な方法として、問題をステップに分解し、それらのステップを検証することを「発見」する環境が生まれます。これは教えられた行動ではなく、創発的な行動です。のDeepSeek-R1論文アップデートこの不安定なプロセスを安定させるために使用された具体的な学習率とGRPO(Group Relative Policy Optimization)グループサイズを提供します。
「ゼロ」の概念
DeepSeek-R1-Zeroは、教師ありファインチューニング(SFT)が推論に必ずしも必要ではないことを証明しています。実際、論文ではSFTが人間のような(そして潜在的に欠陥のある)推論パターンにモデルを偏らせることで、知能の上限を制限する可能性があることを示唆しています。モデルが戦略を見つけるまで試行錯誤させることで、R1-Zeroは人間のアノテーターが思いつかなかった検証技術を開発しました。
ネガティブリザルト:PRMとMCTSが失敗した理由

おそらく最も価値のある部分は、DeepSeek-R1論文アップデートのセクション4.2で、著者がうまくいかなかったこと業界では通常、成功例しか公開されませんが、これらの失敗分析は他の人々にとって時間の節約になります。
プロセス報酬モデル(PRM)の問題点
多くの研究者は、R1が広範なプロセス報酬モデル(PRM)を使用したと仮定していました。これは、外部モデルが推論チェーンの各ステップをスコアリングするものです。今回の更新で、彼らがこれを試したが断念したことが明確になりました。
問題は「報酬ハッキング」でした。モデルは、賢く見えるが実際には解決策に向かっていないステップに対して、PRMに高いスコアを与えるように素早く学習しました。さらに、採点対象のモデルよりも賢いPRMを構築することはパラドックスです。超知能の推論を完全に判断できるPRMを持っているなら、あなたはすでに超知能を持っていることになります。
モンテカルロ木探索(MCTS)の限界
別の仮説は、R1が推論中にMCTS(AlphaGoと同様)を使用したというものでした。論文はこの仮説を否定しています。著者らは、MCTSがテキスト生成には管理不能な指数関数的な探索空間を作成することを発見しました。囲碁やチェスとは異なり、トークンの語彙が大きすぎます。
MCTSの代わりに、DeepSeek-R1論文の更新は、「Best-of-N」サンプリングまたはトレーニング中の単純な検証可能な報酬を推奨しており、これは外部探索ツリーに依存するのではなく、モデルのフォワードパスに探索プロセスを内部化します。
小規模モデル向けの蒸留
ローカルLLMコミュニティにとって、蒸留に関するセクションが最も実用的です。この論文は、巨大モデル(671Bパラメータ版のような)は純粋なRLから恩恵を受ける一方で、小規模モデルはゼロから効果的に解空間を探索するのに苦労することを示しています。
蒸留レシピ
「DeepSeek-R1 paper update」で説明されている最も効果的なパスは、ハイブリッドアプローチです。
巨大モデルを訓練する:巨大モデルにRLを適用し、高度な推論と自己検証能力を発達させる。
データを生成する:巨大モデルに難しい問題を解かせ、その「推論トレース」(内部的な思考プロセス)を記録させる。
蒸留する:これらの高品質なトレースで、より小さなモデル(7B、32B)をファインチューニングします。
これが、より小さなR1バージョンが非常に強力である理由を説明しています。それらは単なるミニブレインではなく、巨大なブレインの思考パターンを記憶しているのです。この論文は、推論トレースを蒸留することが、最終的な回答のみを蒸留するよりもはるかに効果的であることを証明しています。
なぜ小さなモデルにRLを使用しないのか?
著者らは、「Zero」という純粋なRLプロセスを小さなモデルで実行しようとしました。しかし、効果的に収束しませんでした。小さなモデルは、RLの初期の「探索」段階で自己修正するために必要な意味論的な把握能力が不足しています。それらは、より大きなモデルの出力によって提供される「補助輪」を必要とします。
結果の再現

論文が22ページから86ページに拡張されたのは、再現性を直接目的としているようです。V2アップデートには、「Chain of Thought」(CoT)をトリガーするために使用されたプロンプトエンジニアリングの具体的なテンプレートが含まれています。
興味深いことに、彼らは厳格なプロンプトテンプレートに対して注意を促しています。「DeepSeek-R1論文アップデート」は次のように述べています。モデルはシステムプロンプトが最小限の場合に最もパフォーマンスを発揮します。プロンプトを過剰に設計すると(例:「ステップバイステップで考えてから出力してください…」)、RLで学習された動作を妨げるため、実際にはパフォーマンスが低下する可能性があります。モデルは思考方法を知っており、問題が提示されるだけで十分です。how思考方法を知っており、問題が提示されるだけで十分です。
これらの結果を再現しようとしている研究者にとって、重要なポイントは次のとおりです。
PRMをスキップする:ステップベースの報酬ではなく、結果ベースの報酬(成功した/失敗した)を使用します。
コールドスタート:RLフェーズを開始する前に、少量の高品質な「Chain of Thought」データを使用してモデルを初期化します。
検証可能なドメイン:抽象的なロジックに移行する前に、答えが二値(正しい/間違っている)である数学とコードでトレーニングを開始します。
将来のアーキテクチャへの影響
これらの詳細の公開は、この分野の成熟を示しています。DeepSeekは実質的に、「アーキテクチャ」(Transformer、MoE)よりも「トレーニングプロトコル」の方が重要ではないと述べています。
「知識」(重みに格納された事実)と「推論」(事実を操作するための実行時計算)の区別が、中心的な設計の柱になりつつあります。「DeepSeek-R1論文アップデート」は、その実行時計算を最適化するための青写真を提供します。
RLがモデルに、人間が教えなかった戦略を含む、独自の思考戦略を進化させることを強制できることを確認することで、DeepSeekは「システム2」思考仮説を検証しました。将来のモデルは単に大きくなるだけでなく、強化学習サイクルにおいて「より深く」なり、トレーニング中に思考に費やす時間を増やし、推論中に思考を速くできるようにするでしょう。
このレベルの透明性は新たな基準を設定します。これにより、他の研究室は、自らのブラックボックスを開放するか、DeepSeek-R1の方法論で示された文書化され検証可能な技術と比較して、自らの方法が時代遅れと見なされるリスクを負うかのどちらかを選択する必要があります。
FAQ: DeepSeek-R1論文アップデート
Q: DeepSeek-R1論文アップデートの主な変更点は何ですか?
このアップデートでは、論文が22ページから86ページ以上に拡張され、包括的な実装詳細、強化学習のハイパーパラメータ、および否定的な結果が追加されています。特に、プロセス報酬モデル(PRM)の失敗について詳述し、小規模モデルの蒸留プロセスを説明しています。
Q: DeepSeek-R1-Zero はなぜ重要だと考えられていますか?
DeepSeek-R1-Zeroは、教師ありファインチューニング(SFT)なしで、強化学習のみを通じて推論能力が出現しうることを示しています。これは、人間による例がなくても、適切なインセンティブ構造が与えられれば、モデルが自己修正し、作業を検証することを学習できることを証明しています。
Q: DeepSeek は R1 でモンテカルロ木探索(MCTS)を使用しましたか?
いいえ、論文では MCTS を実験したが、トークン生成の広大な探索空間のため、言語生成には効果がないことが判明したと説明されています。彼らは、探索戦略をモデルの重みに直接組み込む強化学習を選択しました。
Q: 小さなモデルのトレーニングについて、論文ではどのように推奨していますか?
著者らは、小さなモデルに純粋なRLを適用することは非効率的であると結論付けています。代わりに、彼らは「蒸留」を推奨しています。これは、大規模なRLトレーニング済みモデルが段階的な推論トレースを生成し、それを使用して小さなモデルをファインチューニングするというものです。
Q: DeepSeek-R1の発見で言及されている「Aha Moment」とは何ですか?
「Aha Moment」とは、モデルがRLのペナルティと報酬によって、以前のステップを自発的に再評価することを学習する、トレーニングの特定の時点を指します。明示的にプログラムされていなくても、問題の複雑な部分により多くの「思考時間」を割り当て始めます。
Q: DeepSeek-R1はGeminiやGPT-4よりも優れていますか?
ユーザーの報告と論文のデータは、R1がコーディングと検証済み推論タスクで優れており、論理的一貫性においてGemini 3 Proをしばしば上回っていることを示唆しています。具体的には、ユーザーはゼロショットのコードリファクタリングや高コンテキストタスクの処理において、優れたパフォーマンスを指摘しています。
Q: DeepSeek-R1を低リソースでローカル実行できますか?
はい、コミュニティはR1モデルが量子化に対して非常に堅牢であることを見出しました。671Bアーキテクチャとその蒸留バリアントは、2ビット(Q2)量子化でも驚くほどうまく機能し、通常このサイズのモデルを処理できないコンシューマーハードウェアでもアクセス可能になります。


