Tier 2: 現代の標準技術推論スケーリング・思考蒸留HF 430 votes
推論モデルテスト時スケーリングs1

s1:単純なテスト時スケーリング(思考トークン強制による軽量推論革命)

わずか1,000件の思考データと推論時待った(budget forcing)だけで、巨額強化学習なしにOpenAI o1互換の自己反省推論を再現した超軽量オープン推論モデル

s1: Simple test-time scaling

論文の書誌情報と関連リンク

発表日
掲載先
arXiv 2025 / Stanford University & University of Washington

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

s1は、1,000件の推論例で追加学習し、答えを出す途中の長さを簡単な合図で調整する研究です。大規模な強化学習を使わず、考える量を増減させました。

s1は、難しさや質で選んだ1,000件の問題と解答を使い、モデルへ長い推論の形を教えます。回答時には、考えが短すぎれば続ける合図、長すぎれば結論へ進む合図を与えました。

s1論文は、少数の学習例の選び方と、回答時の計算量を制御する方法を分けて調べます。数学課題で改善を報告する一方、合図の繰り返しや、対象分野が限られる点が残ります。

s1は、1K reasoning tracesによるSFTとbudget forcingを組み合わせたtest-time scaling手法です。

s1はdifficulty・quality・diversityで選んだs1Kを用いてQwen系base modelをSFTし、推論時にwait tokenの追加またはEOS挿入でthinking budgetを制御します。

本論文は、データ選別、SFT、budget forcing、sequential scalingを分離して評価します。数学benchmarkでの著者報告結果に加え、反復、早期終了、domain transferの制約を検討します。

s1は、1,000-sample SFT datasetとbudget forcingでtest-time computeをscaleする手法です。

s1Kはdifficulty、quality、diversityで選別され、budget forcingはpremature EOS時のwait insertionと上限到達時のforced terminationを用います。

本論文はs1K selection、supervised fine-tuning、budget forcing、sequential samplingを比較します。AIME等の結果が各要素をどこまで支持するか、反復的reasoningとdomain generalizationを含めて読みます。

Niklas MuennighoffStanford University
Luke ZettlemoyerUniversity of Washington
著者をもっと詳しく知る

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

Niklas Muennighoff
所属
: Stanford University
学歴
: Stanford University博士課程。多言語モデルやデータスケーリングの若手トップ研究者。
研究の系譜
: BLOOMプロジェクト、OctoPack等の中心開発者。
代表的な論文
: s1の着想、s1Kデータセット構築、budget forcingアルゴリズムの発明
Luke Zettlemoyer
所属
: University of Washington
学歴
: University of Washington教授。計算言語学・意味解析の世界的権威。
研究の系譜
: RoBERTa、Llamaプロジェクト等の主要共著者。
代表的な論文
: テスト時スケーリング則の理論的検証と研究総括

なぜ歴史的イノベーションなのか

2025年1月の公開直後からHugging Faceのトレンド首位を独占し、わずか50ドルの計算コストでo1級推論が手に入る事実が世界中の開発者を熱狂させました。

2025年1月の公開直後からHugging Faceのトレンド首位を独占し、わずか50ドルの計算コストでo1級推論が手に入る事実が世界中の開発者を熱狂させました。

2025年1月の公開直後からHugging Faceのトレンド首位を独占し、わずか50ドルの計算コストでo1級推論が手に入る事実が世界中の開発者を熱狂させました。

2025年1月の公開直後からHugging Faceのトレンド首位を独占し、わずか50ドルの計算コストでo1級推論が手に入る事実が世界中の開発者を熱狂させました。

2025年1月の公開直後からHugging Faceのトレンド首位を独占し、わずか50ドルの計算コストでo1級推論が手に入る事実が世界中の開発者を熱狂させました。

2025年1月の公開直後からHugging Faceのトレンド首位を独占し、わずか50ドルの計算コストでo1級推論が手に入る事実が世界中の開発者を熱狂させました。

2025年1月の公開直後からHugging Faceのトレンド首位を独占し、わずか50ドルの計算コストでo1級推論が手に入る事実が世界中の開発者を熱狂させました。

2025年1月の公開直後からHugging Faceのトレンド首位を独占し、わずか50ドルの計算コストでo1級推論が手に入る事実が世界中の開発者を熱狂させました。

2025年1月の公開直後からHugging Faceのトレンド首位を独占し、わずか50ドルの計算コストでo1級推論が手に入る事実が世界中の開発者を熱狂させました。

コミュニティの評価・歴史的インパクト(1件)
  • DeepSeek-R1が強化学習の奇跡なら、s1は推論時制御(Test-time control)のミニマリズムの極致。2025年の必読論文。

    原文を見る ↗
この読み方に出てくる言葉(2語)
推論

学習済みモデルから出力を生成する処理。

トークン

言語モデルが入出力を扱う離散的な単位。

どんな問いに向き合ったか

推論モデルの開発には数千時間のRL訓練が必要という通説を覆し、良質な思考トレースの模倣と推論時介入のみで同様の計算スケーリング挙動が得られることを示しました。

従来の方法と課題

この研究が比べた従来案と課題は、提案の説明では次のように位置づけられています。

推論モデルの開発には数千時間のRL訓練が必要という通説を覆し、良質な思考トレースの模倣と推論時介入のみで同様の計算スケーリング挙動が得られることを示しました。

肝のアイデア

・最小データ主義(Data Minimalism)による推論思考スタイルの確立

・ロジット介入による思考ステップ長の動的外部コントロール機構

どういうしくみか

パイプライン:①s1K構築:多様なドメインの難問に対し、高品質フロンティアモデルから推論トレースを抽出し、解法の一貫性と長さでフィルタした1,000サンプル。②訓練:Qwen2.5-32B-Instructに対し、LR 4×1064 \times 10^{-6}、シーケンス長16k、16エポックでSFTを実施。③Budget Forcing:デコーディング中に終了トークン EOTEOT のロジットを -\infty に固定し、プロンプト末尾に Wait, を注入してモデルの再検討を強制。目標トークン数(例: 2k, 4k, 8k)に到達した段階で介入を解除します。

どう確かめたか

著者報告の結果は次の評価条件に基づきます。

・AIME 2024において、ベースモデル比で+11.1ポイント(15.6% → 26.7%)の大幅改善を達成

・MATH-500において80.4%を記録し、大規模RLアプローチ(QwQ-32B-Preview等)と同等の精度を発揮

何が分かったか

著者報告の結果は次の評価条件に基づきます。

・思考トークン数の増加に対して正解率が対数線形にスケールする挙動を実証

どこまで使えるか

この結果が直接支えるのは、論文が評価した課題と比較条件です。別の用途へ広げる場合は、同じ傾向が保たれるかを改めて測る必要があります。

・多数決サンプリング(Parallel Scaling)に対する逐次思考伸長(Sequential Scaling)のトークン効率性の実証

限界と未解決の問い

・過剰な延長時に発生する同語反復やループ現象への耐性欠如

・探索ツリーの体系的な枝刈り(MCTS等)を伴わない純粋な線形トークン伸長

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

s1は1,000件の学習例とbudget forcingで数学ベンチマークの改善を報告しました。この観察が自分のデータと計算条件でも保たれるなら、学習規模だけでなく、回答時に使う計算量の配分も性能設計の変数になり得ます。対象は主に数学課題で、反復的な長文推論が正しさを保証するわけではありませんので、同じbaselineとmetricでの比較が前提です。