オンポリシー蒸留終了トークン応答長制御

Semantic EOS Aggregation:オンポリシー蒸留の長文化を終了トークン不整合から捉える

異なるEOS表現を一つの停止行動として学習するSemantic EOS Aggregation

When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

文章を作るAIに別のAIの答え方を学ばせると、答えを終えるための印が食い違い、文章が必要以上に長くなることがあります。この論文は、同じ「ここで終わる」を表す印をまとめて学ばせる方法を調べました。

この論文は、学ぶ側のAIと教える側のAIが「答えを終える印」を別々に好むと、学ぶ側が終われなくなり、文章が生成上限まで伸びることがあると示します。対策は、同じ働きをする複数の終了の印を、一つの停止行動としてまとめて学ばせることです。

この研究は、AIに別のAIから答え方を学ばせるとき、両者が同じ「終了」を違う印で表すだけで、学ぶ側が止まりにくくなる問題を調べます。著者らは、同じ働きの終了の印に向けられた確率を合計して学ばせると、3つのモデル系列で長文化と生成上限への到達が減ると報告しました。ただし、学習後半に残る別の長文化や、終了ごとに意味が違う会話型の仕事は解決していません。

本論文は、sampled-token型のオンポリシー蒸留(OPD)で、教師と生徒が機能的に同じ終了を異なるEOSトークンへ割り当てると、生徒の停止確率が抑制され得ると分析する。対策は、等価EOS群の確率質量を単一の意味的stop行動として比較するSemantic EOS Aggregationである。

本論文は、sampled-tokenオンポリシー蒸留(OPD)の長文化を、教師と生徒の終了トークン選好の不一致から分析する。機能的に等価なEOSの確率質量を意味的stop行動へ集約すると、Qwen3、Llama 3.2、Gemma 3で応答長と生成上限到達が減る。ただしK2-Horizonの後期長文化は残り、停止整合だけでは全挙動を説明できない。

本論文は、sampled-tokenオンポリシー蒸留(OPD)における長文化の一因を、教師・生徒間のtermination-token mismatchとして特定する。個別EOSではなく機能的に等価なEOS集合の総確率を意味的stop行動として扱うSemantic EOS Aggregationは、Qwen3、Llama 3.2、Gemma 3で長さとclippingを低減する。一方、K2-Horizonでは補正後にも後期の停止崩壊が残り、この機構は長さ動態の部分的説明にとどまる。

本論文は、sampled-token OPDにおけるlength inflationの一因として、base studentとpost-trained teacherのtermination-token mismatchを特定する。機能的に等価なEOSの確率質量をsemantic stop actionへ集約するSemantic EOS Aggregationを提案し、3モデル系列で検証する。

本論文は、sampled-token on-policy distillation(OPD)で生じるlength inflationを、teacher–student間のtermination-token mismatchから分析する。Semantic EOS Aggregationは、機能的に等価なEOS集合の総確率をsemantic stop actionとして扱い、Qwen3、Llama 3.2、Gemma 3で平均応答長とclippingを低減する。ただしK2-Horizonのstage-wise分析は、alignment後にも残る後期崩壊を示す。

本論文は、sampled-token on-policy distillation(OPD)のlength inflationに対し、base studentとpost-trained teacherのtermination-token mismatchというmechanistic accountを提示する。Semantic EOS Aggregationは、機能的に等価なEOS集合の確率質量をsemantic stop actionとして集約し、Qwen3、Llama 3.2、Gemma 3でlengthとclippingを低減する。stage-wise K2-Horizon分析は、EOS preferenceが訓練段階で大きく変化する一方、alignment後にも別のlate-stage inflationが残ることを示す。

著者をもっと詳しく知る(全9名)

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

全著者と所属

  1. Yuxiao Yang
    所属情報なし
  2. Tianrun Yu
    所属情報なし
  3. Shangzhe Li
    所属情報なし
  4. Kaixiang Zhao
    所属情報なし
  5. Xuchao Zhang
    所属情報なし
  6. Chetan Bansal
    所属情報なし
  7. Huaxiu Yao
    所属情報なし
  8. Taylor W. Killian
    所属情報なし
  9. Weitong Zhang
    所属情報なし

確認できた研究背景

Yuxiao Yang
関連情報
: 本研究の4人の同等貢献学生著者の一人で、EOS不整合を特定し、Shangzhe LiとQwenで検証したと著者貢献欄に記載されています。
Tianrun Yu
関連情報
: 本研究の4人の同等貢献学生著者の一人で、Gemma・Llamaへの拡張とK2-Horizonの段階別現象の確認に参加したと記載されています。
Shangzhe Li
関連情報
: 本研究の4人の同等貢献学生著者の一人で、長文化の観測、緩和機構・解法の提案、Qwenでの検証、モデル系列横断の検証に関与したと記載されています。
Kaixiang Zhao
関連情報
: 本研究の4人の同等貢献学生著者の一人で、Gemma・Llamaへの拡張とK2-Horizonの段階別現象の確認に参加したと記載されています。

なぜ注目されているか

取得時点でHF上の71 upvotes、5件のコメント、著者参加が確認されています。

取得時点でHF上の71 upvotes、5件のコメント、著者参加が確認されています。

取得時点でHF上の71 upvotes、5件のコメント、著者参加が確認されています。

取得時点でHF上の71 upvotes、5件のコメント、著者参加が確認されています。

取得時点でHF上の71 upvotes、5件のコメント、著者参加が確認されています。

取得時点でHF上の71 upvotes、5件のコメント、著者参加が確認されています。

取得時点でHF上の71 upvotes、5件のコメント、著者参加が確認されています。

取得時点でHF上の71 upvotes、5件のコメント、著者参加が確認されています。

取得時点でHF上の71 upvotes、5件のコメント、著者参加が確認されています。

議論全体へのリンク
この読み方に出てくる言葉(7語)
sampled-token OPD

生徒が実際にサンプルした各トークンに対し、教師と生徒の対数確率差を用いて生徒を更新するオンポリシー蒸留。

EOS

系列生成を終了させる特殊トークン。

この論文では

単一ターン応答の同じ停止イベントを表す複数トークンを機能的に等価とみなす。

Semantic EOS Aggregation

等価EOS集合の総確率を教師・生徒で比較し、意味的stop行動に対する更新へ置き換える方法。

clipping ratio

ロールアウトが7168トークンの応答上限に到達した割合。

ベースライン

提案法の効果を判断する比較基準。本論文では未補正の通常OPDなどを指す。

Avg@16

各問題で16回答の正解率を求め、AMC23、AIME24、AIME25を等重み平均した指標。

アブレーション

手法の一部だけを変更し、どの要素が結果に効いたかを切り分ける比較。

どんな問いに向き合ったか

sampled-token OPDでは、教師は生徒が生成したトークンだけを直接評価する。教師と生徒が宣言上は同じ停止集合を持っていても、停止確率を異なるEOSへ置く場合がある。本論文は、この不一致が生徒固有の終了行動を抑え、過度な長文化や生成上限到達を生む機構か、また意味的な停止行動を整合すれば緩和できるかを検証する。

従来の方法と課題

既存研究は、逆KL型の目的、長い軌跡での教師信号劣化、エントロピー崩壊などをOPDの長文化機構として論じてきた。本論文はEOS不整合を、それらと競合する単一原因ではなく、補完的で低水準の要因と位置づける。

最も単純な対策は、教師と生徒が使う複数のEOSをデコーダの停止集合へ登録することだ。しかしこれは生成時にどのトークンで停止するかを変えるだけで、学習目的内の個別トークン確率は変えない。このFix 1が提案法の重要なベースラインとなる。

肝のアイデア

教師が等価EOSの一方へ停止確率を集中させ、生徒が別のEOSを生成すると、意味的には正しい停止でもサンプルされたEOSの係数が負になり得る。さらに教師優先EOSに対する生徒確率が極小なら、そのEOSをサンプルして正の信号を受ける機会もほぼない。

Semantic EOS Aggregationは、等価EOS集合に属する確率を各モデル内で合計し、EOSがサンプルされた場合は総停止確率の対数比を更新信号に使う。これにより表層トークンの選択差と、停止するか継続するかという行動差を分離する。

どういうしくみか

通常のsampled-token OPDでは、生徒が生成したトークンについて教師確率と生徒確率の対数差が更新係数になる。したがって、教師が生徒EOSへ低い確率しか与えないと、生徒が自然終了するたびにそのEOSが抑制される。Qwen3の通常OPDでは、教師優先の<|im_end|>に対する生徒確率が終端付近で約10のマイナス11乗であり、生徒固有の<|endoftext|>確率は約0.8からほぼゼロへ低下したと報告された。

Fix 1は停止集合のみを共有する。Fix 2は教師の全等価EOS質量を、生徒がすでに支持する正準EOSへ写像する。Fix 3であるSemantic EOS Aggregationは教師・生徒双方の総EOS質量を比較する。Fix 4は教師質量を正準EOSへ集約し、生徒の他EOSをサンプリング分布から除いて再正規化する。Fix 3では生徒の分布を保ち、非EOSトークンの扱いも維持できる。

どう確かめたか

主実験はQwen3-1.7B-Baseを生徒、非思考モードの固定Qwen3-4Bを教師とし、DAPO-Math-17K、TTRL形式、200学習ステップで4方式を比較する。応答上限は7168トークンである。系列横断の確認にはLlama 3.2とGemma 3を用い、学習段階による違いにはK2-Horizonを用いる。

学習時は平均応答長、clipping ratio、最終位置のEOS確率を追跡する。独立評価のAvg@16は、AMC23、AIME24、AIME25で各問題16回答を生成し、問題内正解率を平均してから3ベンチマークを等重みで平均する。これは長さ制御と数学性能を分離して見るための設計である。

何が分かったか

Qwen3でFix 1は通常OPDとほぼ同じ平均長・clipping軌跡を示し、デコード停止集合の整合だけでは不十分だった。Semantic EOS AggregationはQwen3、Llama 3.2、Gemma 3の全系列で通常OPDより応答長とclippingを大幅に低減した。ただしLlama 3.2では教師参照長との差がより大きく残った。

K2-HorizonのmidtrainingおよびSFT初期化では、教師EOSがすでに十分支持されており、補正の有無で長さ、clipping、EOS確率、下流正解率に一貫した差はなかった。一方、Pretrain-to-Finalでは初期増加、高止まりして変動するplateau、後期再増加が現れた。後期には停止確率がゼロへ近づき、ほぼ全ロールアウトが上限へ到達し、この傾向は集約後にも残った。

どこまで使えるか

適用候補は、教師と生徒が同一のトークナイザーと語彙を共有し、複数EOSが単一ターンの同じ終了イベントを表すbase-to-post-trained蒸留である。生徒固有EOSの確率低下、教師優先EOSの極小なサンプリング確率、Fix 1の失敗を観測できれば、不整合仮説をより具体的に診断できる。

停止表現がすでに整合している場合や、反復、教師信号劣化、局所目的など別機構が支配的な場合には効果を期待できない。また、停止挙動の改善だけから数学推論精度の改善を推定してはならない。

限界と未解決の問い

EOS不整合は重要だが非網羅的な原因であり、K2-Horizon後期に補正後も残る停止崩壊の原因は未解明である。補正後の初期長化について、論文は局所的なOPD更新が将来の教師・生徒不一致を無視する可能性を論じるが、因果的な確定説明ではない。

検証は単一ターン数学推論が中心である。マルチターンやエージェント環境では、ターン終了、文書終了、ツール移譲が異なる制御イベントになり得るため、無条件の集約は不適切である。テンプレートとgraderの分析もQwen3の3テンプレート、2 graderに限られる。同じ教師出力のAvg@16が元graderの6.28%から形式互換パーサの24.34%へ変わったため、評価形式の感度も結論の境界となる。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

3系列で総停止確率の整合が長さとclippingを改善し、Fix 1では改善しなかった観察から、等価EOSを持つOPDでは、デコード設定に加えて損失内の停止確率を監視する設計が妥当な候補になる。ただし、これはEOSが同じ制御イベントを表す条件付きであり、K2-Horizon後期の残存崩壊やマルチターンの意味差を別に検証しなければならない。停止指標とタスク性能も独立に測るべきである。