DeepSeek-R1:強化学習によるLLMの推論能力創発とオープン化
純粋強化学習による自己反省と「ひらめき」の創発、および高効率蒸留により、推論モデルのオープン革命を起こした新時代の礎
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
論文の書誌情報と関連リンク
- 発表日
- 掲載先
- arXiv 2025 / DeepSeek-AI
読み方の2つの軸
現在:しくみ × 全体像
語彙 使うことば・数式・例え方
深さ 研究のどこまで読むか
この2本は、本文下のスライダーからいつでも変更できます。
概要
DeepSeek-R1は、数学やプログラミングのように答えを自動で確かめやすい問題を使い、正解への点数から言語モデルの問題を解く力を伸ばした研究です。著者らは、人が書いた途中説明を最初に与えないR1-Zeroでも、長く考え直す振る舞いが現れたと報告しました。完成版R1では、読みやすさや幅広い課題への対応のため、少量の例を使う学習も組み合わせています。
DeepSeek-R1の中心は、複数の答えを一度に作り、同じ問題への答え同士を比べて点数の高い出し方を増やす学習です。数学では最終解、プログラミングではテスト結果のように、自動で正誤を確かめられる信号を使います。R1-Zeroは人が書いた途中説明なしでこの学習を始め、完成版R1は読みやすい出力のための例示学習と、数学以外も含む追加学習を組み合わせました。著者らは複数の数学・コード課題で成績を報告しています。
この研究は、正解を自動で判定できる問題なら、人が途中の考え方を大量に書かなくても、結果への点数から問題の解き方を学べるかを調べました。R1-Zeroでは、同じ問いへの複数の回答を比べる学習を行い、出力を長くしたり途中で方針を見直したりする振る舞いを観察しました。ただし、読みづらさや言語が混ざる問題もありました。完成版R1では、人が用意した少量の例、強化学習、選別した回答による追加学習を段階的に組み合わせ、その後に小型モデルへ回答例を移す実験も行いました。
DeepSeek-R1は、人間の模範思考データ(SFT)を介さずに純粋な強化学習(RL)のみで推論能力と自己検証行動を創発させたオープン推論モデルです。
ベースモデルに対し、答えの正誤のみを判定するルールベース報酬を与えて大規模強化学習を行うことで、モデルが自発的に思考時間を伸ばし、解法の検証や誤り訂正(Aha Moment)を行う現象を発見。さらにCritic不要のGRPOアルゴリズムを開発して学習効率を飛躍させました。
AIME 2024(79.8%)などでOpenAI o1と互角の性能を実証し、その思考データを蒸留した1.5B〜70Bの小型モデル群とともにオープンソース化されました。
DeepSeek-R1は、大規模強化学習を用いて言語モデルの推論能力を向上させた研究です。本論文は「DeepSeek-R1-Zero」と「DeepSeek-R1」の2段階のモデル開発プロセスを提示しています。
事前学習済みDeepSeek-V3-Baseに対し、SFTを一切挟まず直接強化学習(GRPO)を適用。報酬は「数学的解の一致」および「コンパイラ検証」という客観的なルールのみ。学習が進むにつれ、モデルは思考トークン数を自発的に数百から数万へと伸長させ、別解の探索や論理の再考(Self-Correction)を自律的に獲得しました。
R1-Zeroの可読性の低さや言語混合を解決するため、以下の4段階で訓練:
R1から抽出した80万サンプルの思考連鎖を用いてQwenおよびLlamaを微調整し、1.5B〜70Bの小型推論モデル群を構築しました。
本論文は、大規模自己回帰言語モデルにおけるテスト時計算スケーリングと推論能力の獲得を目的とし、純粋強化学習による思考の創発と多段階アライメントを統合した『DeepSeek-R1』の全貌を提示したマイルストーンです。
従来の方策勾配法(PPO)におけるCriticモデルの計算・メモリ負荷を排除するため、グループサンプリングに基づくGRPOを採用します。プロンプト q に対して旧方策から G 個の出力 {o1,…,oG} を生成し、得られた報酬 {r1,…,rG} から以下のようにアドバンテージ Ai を正規化します:
方策パラメータ θ は以下の目的関数を最大化するように更新されます:
DeepSeek-R1-Zeroの強化学習過程において、モデルは明示的な指示なしに推論時間を伸長させ、自然言語による自己反省行動(例: "Wait, let me double check this result..." や "Let me try a different angle")を獲得しました。これは報酬最大化の勾配更新が、自己回帰確率分布の探索空間において「思考による自己検証」という計算パスを自然に強化したことを示しています。
R1の思考トレースから得られたデータを用いた蒸留は、小型モデル(1.5B〜70B)に対して直接RLを適用するよりも遥かに高いベンチマーク精度を達成し、知能の圧縮における蒸留の有効性を報告しました。
DeepSeek-R1論文は、rule-based rewardを用いるGRPOによってreasoning behaviorを学習したR1-Zeroと、cold-start dataを加えたR1を報告します。著者らはAIME 2024で79.8%、MATH-500で97.3%を報告し、distilled model familyも公開しました。
本論文は、大規模言語モデルに対する大規模強化学習の適用を通じて推論能力を創発させた『DeepSeek-R1』の全貌を提示した研究です。
模範解答を一切与えず、数学の正誤やコードの実行結果のみを報酬として強化学習(GRPO)を実施した結果、モデルは思考トークンを自律的に伸ばし、途中での自己訂正行動(Aha Moment)を自発的に獲得しました。
R1-Zeroの言語混在や可読性の課題を解決するため、コールドスタートデータによる初期化、多段階強化学習、および棄却サンプリングを統合しました。
R1から得られた80万サンプルの思考連鎖をQwenおよびLlamaに蒸留し、小型モデル単独での強化学習を上回る推論性能を達成しました。
本論文は、大規模言語モデルにおけるテスト時計算スケーリングと推論能力の獲得を目的とし、純粋強化学習による思考の創発と多段階アライメントを統合した『DeepSeek-R1』の全貌を提示したマイルストーンです。
従来の方策勾配法(PPO)におけるCriticモデルの計算・メモリ負荷を排除するため、グループサンプリングに基づくGRPOを採用します。プロンプト q に対して旧方策から G 個の出力 {o1,…,oG} を生成し、得られた報酬 {r1,…,rG} から以下のようにアドバンテージ Ai を正規化します:
方策パラメータ θ は以下の目的関数を最大化するように更新されます:
DeepSeek-R1-Zeroの強化学習過程において、モデルは明示的な指示なしに推論時間を伸長させ、自然言語による自己反省行動(例: "Wait, let me double check this result..." や "Let me try a different angle")を獲得しました。これは報酬最大化の勾配更新が、自己回帰確率分布の探索空間において「思考による自己検証」という計算パスを自然に強化したことを示しています。
R1の思考トレースから得られたデータを用いた蒸留は、小型モデル(1.5B〜70B)に対して直接RLを適用するよりも遥かに高いベンチマーク精度を達成し、知能の圧縮における蒸留の有効性を報告しました。
著者をもっと詳しく知る(全4名)
論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。
全著者と所属
- Daya GuoDeepSeek-AI
- Dejian YangDeepSeek-AI
- Haowei ZhangDeepSeek-AI
- Xiao BiDeepSeek-AI
確認できた研究背景
- 所属
- : DeepSeek-AI
- 学歴
- : DeepSeek-AI リードリサーチャー
- 主な関心
- : コード言語モデル、強化学習、推論モデル
- 所属
- : DeepSeek-AI
- 学歴
- : DeepSeek-AI リサーチャー
- 主な関心
- : 推論能力創発、大規模強化学習
- 所属
- : DeepSeek-AI
- 学歴
- : DeepSeek-AI エンジニアリングリード
- 主な関心
- : 分散強化学習基盤、GRPO実装
- 所属
- : DeepSeek-AI
- 学歴
- : DeepSeek-AI 創業者 / リードアーキテクト
- 主な関心
- : 基盤モデルアーキテクチャ、オープンソースAI
なぜ歴史的イノベーションなのか
人間が答え方を教えなくても、正解・不正解の判定だけでAIが自力で「じっくり考える力」や「間違いに気づいてやり直す力」を身につけた大革命。推論AIの常識を覆した論文です。
人間の模範解答(SFT)ゼロから純粋強化学習だけで推論能力を創発させる「DeepSeek-R1-Zero」を発見。さらに価値関数を排除した高効率強化学習(GRPO)と小型モデルへの蒸留を確立しました。
大規模強化学習によるテスト時計算スケーリング(Test-time Compute)の完全実証。批判的自己検証行動(Aha Moment)の自律的獲得、多段階アライメント、およびオープン蒸留による推論知能の民主化。
SFTなしの純粋強化学習による思考連鎖の創発と、蒸留によるオープン推論モデル。
Criticモデル不要のGRPOによりGPUメモリを大幅節約。数学・競技プログラミングでOpenAI o1に匹敵する性能を達成し、6つの蒸留密モデルを公開。
グループ相対方策最適化(GRPO)の数理定式化、ルールベース精度報酬とフォーマット報酬の設計、コールドスタートデータと多段階強化学習パイプライン。
DeepSeek-AI(2025)によるDeepSeek-R1の原典。純粋強化学習を通じた推論能力創発と蒸留モデルの包括的オープン化を提示。
推論タスクにおける事後学習スケーリングの新たなパラダイムを確立し、世界中のAI研究開発の潮流を決定づけたマイルストーン論文。
AIME 2024(79.8%)、MATH-500(97.3%)におけるフロンティア推論性能の実証、思考トークン長の自己適応的伸長、および蒸留対強化学習の比較分析。
コミュニティの評価・歴史的インパクト(1件)
- 原文を見る ↗
人間の模範データなしにAIが自ら思考を深め『待てよ、もう一度考え直そう』と自律的に自己訂正を始めるログが公開された瞬間、世界中のAI研究者に電撃が走った。
この読み方に出てくる言葉(2語)
- 強化学習
答えへの点数を手がかりに、よりよい答え方を学ぶ方法。
- 推論
与えられた情報から、途中の関係をたどって答えを導くこと。
どんな問いに向き合ったか
従来のフロンティア推論モデル(OpenAI o1等)はクローズドであり、その思考連鎖の学習原理や創発メカニズムが秘密にされていた。また、人間の書いた模範的推論トレース(SFT)への依存がデータのボトルネックとなっていた。
肝のアイデア
SFTデータを介さず、答えの正誤ルールのみを用いた純粋強化学習(GRPO)によって自律的な思考・自己反省行動(Aha Moment)を創発させ、さらにその思考軌跡を小型モデル(1.5B〜70B)に高密度蒸留する。
どう確かめ、何が分かったか
著者らは、アメリカ数学招待試験(AIME 2024)で79.8%の一発正答率を記録し、OpenAIのo1正式版(79.2%)を上回る成績を達成。高校生数学コンテストMATH-500において97.3%の正答率を達成し、ほぼ満点レベルの推論精度を実証
注意すべきこと
思考プロセスの長大化(数千〜万トークン)に伴う推論遅延と計算リソース消費の増大
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らの結果は、答えを細かく教える例が少なくても、正解を確かめられる問題なら点数を使った学習で考え方が伸びる可能性を示します。別の種類の問題でも再現するなら、教材を人がすべて書く以外の育て方を選べます。ただし、正しさを自動で確かめにくい問題や言語では同じ効果は分かりません。
この読み方に出てくる言葉(3語)
- 強化学習
答えへの点数を手がかりに、よりよい答え方を学ぶ方法。
- 推論
与えられた情報から、途中の関係をたどって答えを導くこと。
- 報酬
出力の良し悪しを学習側へ伝える点数。
どんな問いに向き合ったか
従来のフロンティア推論モデル(OpenAI o1等)はクローズドであり、その思考連鎖の学習原理や創発メカニズムが秘密にされていた。また、人間の書いた模範的推論トレース(SFT)への依存がデータのボトルネックとなっていた。
従来の方法と課題
大量の人手作成CoTデータを用いたSFT、プロプライエタリなブラックボックス推論モデル、およびCriticモデルを伴う高メモリ負荷なPPO強化学習。
肝のアイデア
SFTデータを介さず、答えの正誤ルールのみを用いた純粋強化学習(GRPO)によって自律的な思考・自己反省行動(Aha Moment)を創発させ、さらにその思考軌跡を小型モデル(1.5B〜70B)に高密度蒸留する。
どういうしくみか
DeepSeek-R1の中核技術は、以下の手法群に基づいています。
従来のPPOでは、方策モデルと同規模の「批判モデル(Critic / Value Network)」をメモリ上に配置する必要があり、多くのVRAMを消費していました。DeepSeekが開発したGRPOは、単一のプロンプトからグループとして複数の回答(例えば 対応する値 個)をサンプリングし、そのグループ内の相対的なスコアの平均と標準偏差からアドバンテージを算出します。Criticモデルを排除したことで、GPUメモリを約半分に削減し、長い思考連鎖の強化学習を可能にしました。
報酬モデルのハッキング(お世辞や冗長さに騙される現象)を避けるため、数学やコードの「最終的な正誤判定(正解なら1、不正解なら0)」を行うルールベースの精度報酬と、思考を <think>...</think> タグ内に収めるフォーマット報酬のみを採用しました。
DeepSeek-R1が生成した80万件の高品質な推論データを、QwenやLlama(1.5B〜70B)に教師データとして学習させました。その結果、小型モデル単体に強化学習を施すよりも高い推論性能が達成され、小型モデルでも成績が向上したと報告しました。
どう確かめたか
著者らは、AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217(79.2%)を上回る推論精度を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイル(レーティング2029)を達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型モデル(o1-mini等)を上回る結果
何が分かったか
その評価で著者らは、AIME 2024(米国招待数学試験)において、DeepSeek-R1が79.8%(Pass@1)を達成し、OpenAI-o1-1217(79.2%)を上回る。MATH-500において97.3%の正答率を記録し、Codeforces(競技プログラミング)で上位3.7%に相当する96.3パーセンタイルを達成。DeepSeek-R1から蒸留されたQwen-32Bベースの小型モデルが、AIME 2024で72.6%を記録し、OpenAIのo1-miniを上回ったと報告
どこまで使えるか
中心となる証拠は、答えを自動で採点しやすい数学やコードの問題です。正しさを機械で確かめにくい相談や創作でも同じ学び方が有効か、途中説明が信頼できるかは別に調べる必要があります。
限界と未解決の問い
思考連鎖が非常に長くなるため、推論レイテンシが増加し、リアルタイム性が要求されるチャット応答には向かない点。自由形式の創作や一般的な世界知識の質問において、過剰に論理的推論を展開しようとして回答が長文化するオーバーシンキング現象。思考プロセスの長大化(数千〜万トークン)に伴う推論遅延と計算リソース消費の増大。客観的な正誤判定関数(Verifier)が存在しない非数学的・主観的タスクに対する報酬適用の難しさ。純粋RLモデルにおける多言語混在現象と可読性の課題
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らの結果は、答えを細かく教える例が少なくても、正解を確かめられる問題なら点数を使った学習で考え方が伸びる可能性を示します。別の種類の問題でも再現するなら、教材を人がすべて書く以外の育て方を選べます。ただし、正しさを自動で確かめにくい問題や言語では同じ効果は分かりません。
この読み方に出てくる言葉(4語)
- 強化学習
答えへの点数を手がかりに、よりよい答え方を学ぶ方法。
- 推論
与えられた情報から、途中の関係をたどって答えを導くこと。
- 報酬
出力の良し悪しを学習側へ伝える点数。
- 蒸留
大きなモデルの出力を教材にして、小さなモデルを学ばせること。
問題設定と前提
従来のフロンティア推論モデル(OpenAI o1等)はクローズドであり、その思考連鎖の学習原理や創発メカニズムが秘密にされていた。また、人間の書いた模範的推論トレース(SFT)への依存がデータのボトルネックとなっていた。
関連研究の中での位置づけ
大量の人手作成CoTデータを用いたSFT、プロプライエタリなブラックボックス推論モデル、およびCriticモデルを伴う高メモリ負荷なPPO強化学習。
提案手法の全体像
SFTデータを介さず、答えの正誤ルールのみを用いた純粋強化学習(GRPO)によって自律的な思考・自己反省行動(Aha Moment)を創発させ、さらにその思考軌跡を小型モデル(1.5B〜70B)に高密度蒸留する。
定式化と設計判断
DeepSeek-R1は、Group Relative Policy Optimization(GRPO)を中核とする多段階学習仕組みによって構築されています。
プロンプト 対応する値 に対し、旧方策 対応する値 からグループサイズ 対応する値 の出力集合 対応する値 をサンプリングします。各出力 対応する値 に対する正規化アドバンテージ 対応する値 は次式で算出されます:
対応する値
目的関数 対応する値 は、PPOのクリッピング機構とKL正則化を統合した次式を最大化します:
対応する値
この定式化により、方策モデルと同等サイズのCriticネットワークが不要となり、学習時VRAMを約50%節約できます。
精度報酬(Accuracy Reward): 数学問題ではSymPy等による数式一致、LeetCode等のプログラミングではテストケース実行によるバイナリ報酬(1または0)。
フォーマット報酬(Format Reward): 思考プロセスを <think> と </think> タグで正確に分離しているかを強制する構文的ペナルティ。
DeepSeek-R1-Zero: SFTなしで純粋強化学習のみにより自律的思考と自己検証(Aha Moment)を創発。Group Relative Policy Optimization(GRPO): Criticモデルを排除し、グループサンプリングの相対スコアからアドバンテージを算出してVRAMを約50%削減。ルールベース精度報酬(数学解の一致やコンパイラ実行)とフォーマット報酬(<think>タグ分離)の適用。DeepSeek-R1: コールドスタートSFT、推論RL、棄却サンプリング、全シナリオRLからなる多段階学習。蒸留(Distillation): R1の800k思考連鎖を用いたQwen/Llama(1.5B〜70B)への推論知能移植
学習・推論・実験条件
DeepSeek-R1-Zero: SFTなしで純粋強化学習のみにより自律的思考と自己検証(Aha Moment)を創発。Group Relative Policy Optimization(GRPO): Criticモデルを排除し、グループサンプリングの相対スコアからアドバンテージを算出してVRAMを約50%削減。ルールベース精度報酬(数学解の一致やコンパイラ実行)とフォーマット報酬(<think>タグ分離)の適用。DeepSeek-R1: コールドスタートSFT、推論RL、棄却サンプリング、全シナリオRLからなる多段階学習。蒸留(Distillation): R1の800k思考連鎖を用いたQwen/Llama(1.5B〜70B)への推論知能移植
評価設計
著者らは、AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217(79.2%)を上回る推論精度を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイル(レーティング2029)を達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型モデル(o1-mini等)を上回る結果
AIME 2024で79.8%(Pass@1)を達成し、OpenAI-o1(79.2%)をオープンソースとして初めて撃破。MATH-500において97.3%の正答率、Codeforcesでレーティング2029(96.3パーセンタイル)を記録。蒸留されたDeepSeek-R1-Distill-Qwen-32BがAIME 2024で72.6%を記録し、o1-miniを上回る結果
何が分かったか
その条件で著者らは、AIME 2024で79.8%(Pass@1)を達成し、OpenAI-o1(79.2%)をオープンソースとして初めて撃破。MATH-500において97.3%の正答率、Codeforcesでレーティング2029(96.3パーセンタイル)を記録。蒸留されたDeepSeek-R1-Distill-Qwen-32BがAIME 2024で72.6%を記録し、o1-miniを上回る結果
AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217(79.2%)を上回る推論精度を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイル(レーティング2029)を達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型モデル(o1-mini等)を上回る結果
アブレーションと失敗例
既存資料で報告された失敗や切り分けの範囲は次の通りです。答えを出すときの思考トークン数が数千〜1万トークン超に肥大化し、コンテキスト窓と生成レイテンシを圧迫する点。客観的な検証関数(Verifier)が存在しない一般的なオープンエンドタスク(創作文、主観的議論等)に対する報酬設計の困難さ。
別の解釈と評価上の注意
成績向上は強化学習による一般的な問題を解く力ではなく、正解を自動判定できる課題への適応を反映した可能性があります。検証しにくい課題への転移は別に評価する必要があります。
限界と未解決の問い
答えを出すときの思考トークン数が数千〜1万トークン超に肥大化し、コンテキスト窓と生成レイテンシを圧迫する点。客観的な検証関数(Verifier)が存在しない一般的なオープンエンドタスク(創作文、主観的議論等)に対する報酬設計の困難さ。思考プロセスの長大化(数千〜万トークン)に伴う推論遅延と計算リソース消費の増大。客観的な正誤判定関数(Verifier)が存在しない非数学的・主観的タスクに対する報酬適用の難しさ。純粋RLモデルにおける多言語混在現象と可読性の課題
残された問い
答えを自動検証できない課題でも同じ学習が有効か。正答率と、読みやすく信頼できる途中説明をどう両立するかという課題が残ります。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らの結果は、答えを細かく教える例が少なくても、正解を確かめられる問題なら点数を使った学習で考え方が伸びる可能性を示します。別の種類の問題でも再現するなら、教材を人がすべて書く以外の育て方を選べます。ただし、正しさを自動で確かめにくい問題や言語では同じ効果は分かりません。
この読み方に出てくる言葉(2語)
- 強化学習
答えへの点数を手がかりに、よりよい答え方を学ぶ方法。
- 推論
与えられた情報から、途中の関係をたどって答えを導く概念。
どんな問いに向き合ったか
従来のフロンティア推論モデル(OpenAI o1等)はクローズドであり、その思考連鎖の学習原理や創発メカニズムが秘密にされていた。また、人間の書いた模範的推論トレース(SFT)への依存がデータのボトルネックとなっていた。
肝のアイデア
SFTデータを介さず、答えの正誤ルールのみを用いた純粋強化学習(GRPO)によって自律的な思考・自己反省行動(Aha Moment)を創発させ、さらにその思考軌跡を小型モデル(1.5B〜70B)に高密度蒸留する。
どう確かめ、何が分かったか
著者らは、AIME 2024で79.8%、MATH-500で97.3%を達成。蒸留された32BモデルがOpenAI o1-miniを上回る推論精度を記録
注意すべきこと
思考プロセスの長大化(数千〜万トークン)に伴う推論遅延と計算リソース消費の増大
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
検証可能な報酬による推論改善が他領域でも再現するなら、教師あり推論軌跡を大量に用意することは唯一の経路ではありません。ただし、報酬を信頼できる課題への偏り、出力の可読性、言語間の性能差があり、強化学習だけで一般的推論能力を説明することはできません。
この読み方に出てくる言葉(3語)
- 強化学習
答えへの点数を手がかりに、よりよい答え方を学ぶ方法。
- 推論
与えられた情報から、途中の関係をたどって答えを導く概念。
- 報酬
出力の良し悪しを学習側へ伝える点数。
どんな問いに向き合ったか
従来のフロンティア推論モデル(OpenAI o1等)はクローズドであり、その思考連鎖の学習原理や創発メカニズムが秘密にされていた。また、人間の書いた模範的推論トレース(SFT)への依存がデータのボトルネックとなっていた。
従来の方法と課題
大量の人手作成CoTデータを用いたSFT、プロプライエタリなブラックボックス推論モデル、およびCriticモデルを伴う高メモリ負荷なPPO強化学習。
肝のアイデア
SFTデータを介さず、答えの正誤ルールのみを用いた純粋強化学習(GRPO)によって自律的な思考・自己反省行動(Aha Moment)を創発させ、さらにその思考軌跡を小型モデル(1.5B〜70B)に高密度蒸留する。
どういうしくみか
GRPOアルゴリズム、ルールベース検証報酬、コールドスタート初期化、多段階RLパイプライン、知識蒸留。
どう確かめたか
著者らは、AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217(79.2%)を上回る推論精度を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイル(レーティング2029)を達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型モデル(o1-mini等)を上回る結果
何が分かったか
その評価で著者らは、AIME 2024においてPass@1で79.8%(Consensus@64で90.0%以上)を記録しOpenAI o1に匹敵。MATH-500で97.3%、Codeforcesでレーティング2029を達成。蒸留モデル(DeepSeek-R1-Distill-Qwen-14B/32B)が同規模の強化学習単独モデルを一貫して上回る結果
どこまで使えるか
主張の中心は検証可能な報酬を置ける数学・コード課題と、その推論データの蒸留です。自由記述課題、報酬検証器の誤り、推論文の忠実性や言語差は射程外または未解決です。
限界と未解決の問い
多言語混在現象や過剰な思考トークン生成(オーバーシンキング)。ソフトウェア開発全体の自律実行など長期コンテキストを要する実務タスクでの課題
思考プロセスの長大化(数千〜万トークン)に伴う推論遅延と計算リソース消費の増大。客観的な正誤判定関数(Verifier)が存在しない非数学的・主観的タスクに対する報酬適用の難しさ。純粋RLモデルにおける多言語混在現象と可読性の課題
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
検証可能な報酬による推論改善が他領域でも再現するなら、教師あり推論軌跡を大量に用意することは唯一の経路ではありません。ただし、報酬を信頼できる課題への偏り、出力の可読性、言語間の性能差があり、強化学習だけで一般的推論能力を説明することはできません。
この読み方に出てくる言葉(4語)
- 強化学習
答えへの点数を手がかりに、よりよい答え方を学ぶ方法。
- 推論
与えられた情報から、途中の関係をたどって答えを導く概念。
- 報酬
出力の良し悪しを学習側へ伝える点数。
- 蒸留
大きなモデルの出力を教材にして、小さなモデルを学ばせる概念。
問題設定と前提
従来のフロンティア推論モデル(OpenAI o1等)はクローズドであり、その思考連鎖の学習原理や創発メカニズムが秘密にされていた。また、人間の書いた模範的推論トレース(SFT)への依存がデータのボトルネックとなっていた。
関連研究の中での位置づけ
大量の人手作成CoTデータを用いたSFT、プロプライエタリなブラックボックス推論モデル、およびCriticモデルを伴う高メモリ負荷なPPO強化学習。
提案手法の全体像
SFTデータを介さず、答えの正誤ルールのみを用いた純粋強化学習(GRPO)によって自律的な思考・自己反省行動(Aha Moment)を創発させ、さらにその思考軌跡を小型モデル(1.5B〜70B)に高密度蒸留する。
定式化と設計判断
Group Relative Policy Optimization(GRPO)、ルールベース決定論的報酬関数、多段階ハイブリッド学習、推論トレース蒸留。
DeepSeek-R1-Zero: SFTなしで純粋強化学習のみにより自律的思考と自己検証(Aha Moment)を創発。Group Relative Policy Optimization(GRPO): Criticモデルを排除し、グループサンプリングの相対スコアからアドバンテージを算出してVRAMを約50%削減。ルールベース精度報酬(数学解の一致やコンパイラ実行)とフォーマット報酬(<think>タグ分離)の適用。DeepSeek-R1: コールドスタートSFT、推論RL、棄却サンプリング、全シナリオRLからなる多段階学習。蒸留(Distillation): R1の800k思考連鎖を用いたQwen/Llama(1.5B〜70B)への推論知能移植
学習・推論・実験条件
DeepSeek-R1-Zero: SFTなしで純粋強化学習のみにより自律的思考と自己検証(Aha Moment)を創発。Group Relative Policy Optimization(GRPO): Criticモデルを排除し、グループサンプリングの相対スコアからアドバンテージを算出してVRAMを約50%削減。ルールベース精度報酬(数学解の一致やコンパイラ実行)とフォーマット報酬(<think>タグ分離)の適用。DeepSeek-R1: コールドスタートSFT、推論RL、棄却サンプリング、全シナリオRLからなる多段階学習。蒸留(Distillation): R1の800k思考連鎖を用いたQwen/Llama(1.5B〜70B)への推論知能移植
評価設計
著者らは、AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217(79.2%)を上回る推論精度を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイル(レーティング2029)を達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型モデル(o1-mini等)を上回る結果
AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217とに互角の推論性能を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイルを達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型推論モデルを上回ったと報告
何が分かったか
その条件で著者らは、AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217とに互角の推論性能を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイルを達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型推論モデルを上回ったと報告
AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217(79.2%)を上回る推論精度を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイル(レーティング2029)を達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型モデル(o1-mini等)を上回る結果
アブレーションと失敗例
既存資料で報告された失敗や切り分けの範囲は次の通りです。思考トークンの肥大化に伴うサービングコストおよびレイテンシの増大。客観的な検証オラクル(Verifier)が存在しない非数学的タスクにおける報酬整列の限界
別の解釈と評価上の注意
成績向上は強化学習による一般的な推論能力ではなく、正解を自動判定できる課題への適応を反映した可能性があります。検証しにくい課題への転移は別に評価する必要があります。
限界と未解決の問い
思考トークンの肥大化に伴うサービングコストおよびレイテンシの増大。客観的な検証オラクル(Verifier)が存在しない非数学的タスクにおける報酬整列の限界
思考プロセスの長大化(数千〜万トークン)に伴う推論遅延と計算リソース消費の増大。客観的な正誤判定関数(Verifier)が存在しない非数学的・主観的タスクに対する報酬適用の難しさ。純粋RLモデルにおける多言語混在現象と可読性の課題
残された問い
答えを自動検証できない課題でも同じ学習が有効か。正答率と、読みやすく信頼できる途中説明をどう両立するかが残ります。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
検証可能な報酬による推論改善が他領域でも再現するなら、教師あり推論軌跡を大量に用意することは唯一の経路ではありません。ただし、報酬を信頼できる課題への偏り、出力の可読性、言語間の性能差があり、強化学習だけで一般的推論能力を説明することはできません。
この読み方に出てくる言葉(2語)
- 強化学習
答えへの点数を手がかりに、よりよい答え方を学ぶ方法。
- 推論
与えられた情報から、途中の関係をたどって答えを導く概念。
どんな問いに向き合ったか
従来のフロンティア推論モデル(OpenAI o1等)はクローズドであり、その思考連鎖の学習原理や創発メカニズムが秘密にされていた。また、人間の書いた模範的推論トレース(SFT)への依存がデータのボトルネックとなっていた。
肝のアイデア
SFTデータを介さず、答えの正誤ルールのみを用いた純粋強化学習(GRPO)によって自律的な思考・自己反省行動(Aha Moment)を創発させ、さらにその思考軌跡を小型モデル(1.5B〜70B)に高密度蒸留する。
どう確かめ、何が分かったか
著者らは、AIME 2024で79.8%(Pass@1)を達成。MATH-500で97.3%の正答率を記録
注意すべきこと
思考プロセスの長大化(数千〜万トークン)に伴う推論遅延と計算リソース消費の増大
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
R1-Zero/R1の結果が別の検証可能タスクでも再現するなら、process supervisionなしのoutcome rewardでも推論方策を形成できる可能性がある。ただし、報酬検証器が定義できる領域への選択偏り、言語混在、可読性の問題があり、一般的な推論能力への外挿には追加評価が必要である。
この読み方に出てくる言葉(3語)
- 強化学習
答えへの点数を手がかりに、よりよい答え方を学ぶ方法。
- 推論
与えられた情報から、途中の関係をたどって答えを導く概念。
- 報酬
出力の良し悪しを学習側へ伝える点数。
どんな問いに向き合ったか
従来のフロンティア推論モデル(OpenAI o1等)はクローズドであり、その思考連鎖の学習原理や創発メカニズムが秘密にされていた。また、人間の書いた模範的推論トレース(SFT)への依存がデータのボトルネックとなっていた。
従来の方法と課題
大量の人手作成CoTデータを用いたSFT、プロプライエタリなブラックボックス推論モデル、およびCriticモデルを伴う高メモリ負荷なPPO強化学習。
肝のアイデア
SFTデータを介さず、答えの正誤ルールのみを用いた純粋強化学習(GRPO)によって自律的な思考・自己反省行動(Aha Moment)を創発させ、さらにその思考軌跡を小型モデル(1.5B〜70B)に高密度蒸留する。
どういうしくみか
GRPO、決定論的ルールベース報酬、コールドスタート、多段階RL、推論データ蒸留。
どう確かめたか
著者らは、AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217(79.2%)を上回る推論精度を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイル(レーティング2029)を達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型モデル(o1-mini等)を上回る結果
何が分かったか
その評価で著者らは、AIME 2024 Pass@1で79.8%、MATH-500で97.3%を達成。蒸留された32BモデルがOpenAI o1-miniを上回る推論精度を記録
どこまで使えるか
実証範囲はverifiable outcome rewardを定義できる数学・コード中心の評価とdistillationである。open-ended task、verifier bias、reasoning trace faithfulness、多言語挙動への外的妥当性は確立していない。
限界と未解決の問い
思考プロセスの長大化に伴うサービングコストの増大。客観的正誤判定が存在しない主観タスクでの報酬設計の難しさ
思考プロセスの長大化(数千〜万トークン)に伴う推論遅延と計算リソース消費の増大。客観的な正誤判定関数(Verifier)が存在しない非数学的・主観的タスクに対する報酬適用の難しさ。純粋RLモデルにおける多言語混在現象と可読性の課題
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
R1-Zero/R1の結果が別の検証可能タスクでも再現するなら、process supervisionなしのoutcome rewardでも推論方策を形成できる可能性がある。ただし、報酬検証器が定義できる領域への選択偏り、言語混在、可読性の問題があり、一般的な推論能力への外挿には追加評価が必要である。
この読み方に出てくる言葉(4語)
- 強化学習
答えへの点数を手がかりに、よりよい答え方を学ぶ方法。
- 推論
与えられた情報から、途中の関係をたどって答えを導く概念。
- 報酬
出力の良し悪しを学習側へ伝える点数。
- 蒸留
大きなモデルの出力を教材にして、小さなモデルを学ばせる概念。
問題設定と前提
従来のフロンティア推論モデル(OpenAI o1等)はクローズドであり、その思考連鎖の学習原理や創発メカニズムが秘密にされていた。また、人間の書いた模範的推論トレース(SFT)への依存がデータのボトルネックとなっていた。
関連研究の中での位置づけ
大量の人手作成CoTデータを用いたSFT、プロプライエタリなブラックボックス推論モデル、およびCriticモデルを伴う高メモリ負荷なPPO強化学習。
提案手法の全体像
SFTデータを介さず、答えの正誤ルールのみを用いた純粋強化学習(GRPO)によって自律的な思考・自己反省行動(Aha Moment)を創発させ、さらにその思考軌跡を小型モデル(1.5B〜70B)に高密度蒸留する。
定式化と設計判断
Group Relative Policy Optimization(GRPO)、ルールベース決定論的報酬関数、多段階ハイブリッド学習、推論トレース蒸留。
DeepSeek-R1-Zero: SFTなしで純粋強化学習のみにより自律的思考と自己検証(Aha Moment)を創発。Group Relative Policy Optimization(GRPO): Criticモデルを排除し、グループサンプリングの相対スコアからアドバンテージを算出してVRAMを約50%削減。ルールベース精度報酬(数学解の一致やコンパイラ実行)とフォーマット報酬(<think>タグ分離)の適用。DeepSeek-R1: コールドスタートSFT、推論RL、棄却サンプリング、全シナリオRLからなる多段階学習。蒸留(Distillation): R1の800k思考連鎖を用いたQwen/Llama(1.5B〜70B)への推論知能移植
学習・推論・実験条件
DeepSeek-R1-Zero: SFTなしで純粋強化学習のみにより自律的思考と自己検証(Aha Moment)を創発。Group Relative Policy Optimization(GRPO): Criticモデルを排除し、グループサンプリングの相対スコアからアドバンテージを算出してVRAMを約50%削減。ルールベース精度報酬(数学解の一致やコンパイラ実行)とフォーマット報酬(<think>タグ分離)の適用。DeepSeek-R1: コールドスタートSFT、推論RL、棄却サンプリング、全シナリオRLからなる多段階学習。蒸留(Distillation): R1の800k思考連鎖を用いたQwen/Llama(1.5B〜70B)への推論知能移植
評価設計
著者らは、AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217(79.2%)を上回る推論精度を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイル(レーティング2029)を達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型モデル(o1-mini等)を上回る結果
AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217とに互角の推論性能を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイルを達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型推論モデルを上回ったと報告
何が分かったか
その条件で著者らは、AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217とに互角の推論性能を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイルを達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型推論モデルを上回ったと報告
AIME 2024で79.8%(Pass@1)を達成しOpenAI o1-1217(79.2%)を上回る推論精度を記録。MATH-500において97.3%、Codeforcesで96.3パーセンタイル(レーティング2029)を達成。蒸留されたQwen-32BモデルがAIMEで72.6%を記録し商用小型モデル(o1-mini等)を上回る結果
アブレーションと失敗例
既存資料で報告された失敗や切り分けの範囲は次の通りです。思考トークンの肥大化に伴うサービングコストおよびレイテンシの増大。客観的な検証オラクル(Verifier)が存在しない非数学的タスクにおける報酬整列の限界
別の解釈と評価上の注意
成績向上は強化学習による一般的な推論能力ではなく、正解を自動判定できる課題への適応を反映した可能性があります。検証しにくい課題への転移は別に評価する必要があります。
限界と未解決の問い
思考トークンの肥大化に伴うサービングコストおよびレイテンシの増大。客観的な検証オラクル(Verifier)が存在しない非数学的タスクにおける報酬整列の限界
思考プロセスの長大化(数千〜万トークン)に伴う推論遅延と計算リソース消費の増大。客観的な正誤判定関数(Verifier)が存在しない非数学的・主観的タスクに対する報酬適用の難しさ。純粋RLモデルにおける多言語混在現象と可読性の課題
残された問い
答えを自動検証できない課題でも同じ学習が有効か。正答率と、読みやすく信頼できる途中説明をどう両立するかが残ります。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
R1-Zero/R1の結果が別の検証可能タスクでも再現するなら、process supervisionなしのoutcome rewardでも推論方策を形成できる可能性がある。ただし、報酬検証器が定義できる領域への選択偏り、言語混在、可読性の問題があり、一般的な推論能力への外挿には追加評価が必要である。