LLMの後訓練ツール利用エージェント反復サンプリングによる推論時スケーリング

Sharpening Tax:後訓練でエージェントの正答率と解ける問題の幅はどう変わるか

一度で解く確率が上がっても、繰り返せば解ける問題の幅は狭まることがある。後訓練のこの変化を測り、訓練時の温度調整で緩和する研究。

Sharpening Tax in Post-Training

論文の書誌情報と関連リンク

概要

後訓練で一度の成功率が上がっても、何度も試せば解ける課題の範囲は狭まることがある。本研究は、ツールを使うエージェントでもこの変化を調べ、追加試行の価値がどれだけ減ったかを測る「Sharpening Tax」を提案した。著者らの比較では、42ケース中36ケースでこの指標が正になった。さらに、課題の難しさに応じて訓練時の生成温度を変えるPTGSにより、二つの環境で単発精度と反復時の到達範囲の平均が改善した。ただし、正のTaxは到達範囲の損失だけを意味せず、公開モデルの比較から後訓練の因果効果を切り分けることもできない。

著者をもっと詳しく知る(全10名)

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

全著者と所属

  1. Changdae Oh
    論文時点:Meta Superintelligence Labs、University of Wisconsin–Madison
  2. Qi Zeng
    論文時点:Meta Superintelligence Labs
  3. Qi Qi
    論文時点:Meta Superintelligence Labs
  4. Andrey Zhmoginov
    所属情報なし
  5. Deren Lei
    論文時点:Meta Superintelligence Labs
  6. Yun He
    論文時点:Meta Superintelligence Labs
  7. Hoang Phan
    論文時点:Meta Superintelligence Labs、NYU
  8. Hangoo Kang
    論文時点:Stanford University
  9. Azalia Mirhoseini
    論文時点:Stanford University
  10. Sharon Li
    論文時点:University of Wisconsin–Madison

確認できた研究背景

Changdae Oh
所属
: 論文時点:Meta Superintelligence Labs、University of Wisconsin–Madison
代表的な論文
: 論文が引用する共著研究「Neglected free lunch from post-training: progress advantage for llm agents」は、エージェントの後訓練から得られる信号という関連領域を扱う。、論文が引用する共著研究「Dawin: training-free dynamic weight interpolation for robust adaptation」は、結論で今後の分析対象に挙げるモデルマージに関連する。
関連情報
: 論文には研究をMetaで実施したと記載されている。、Sharon Liとともに連絡著者として記載されている。
Hoang Phan
所属
: 論文時点:Meta Superintelligence Labs、NYU
関連情報
: 論文には研究をMetaで実施したと記載されている。
Azalia Mirhoseini
所属
: 論文時点:Stanford University
代表的な論文
: 論文が引用する共著研究「Large language monkeys: scaling inference compute with repeated sampling」は、反復サンプリングで解ける問題の範囲を広げるという本研究の評価軸に関連する。
Sharon Li
所属
: 論文時点:University of Wisconsin–Madison
代表的な論文
: 論文が引用する共著研究「Neglected free lunch from post-training: progress advantage for llm agents」は、エージェントの後訓練から得られる信号という関連領域を扱う。
関連情報
: Changdae Ohとともに連絡著者として記載されている。

なぜ注目されているか

10月7日の取得時点で、Hugging Faceでは102票、コメント2件が記録され、著者の議論参加も示されている。同じ取得データでは、関連GitHubリポジトリのスター数は25だった。

議論全体へのリンク

なぜ重要なのか

モデルを選ぶとき、「一度で成功してほしい」のか、「複数の試行から成功例を一つ得たい」のかで重視する性能は変わる。この研究は、単発の正答率だけでは後者の適性を判断しきれないことを示す材料になる。成功を信頼して判定できる用途なら、試行予算ごとの成功率と、毎回成功する一貫性を評価に加える理由がある。ただし、実際の選定にはトークン数や所要時間を揃えた比較が必要で、本研究だけで費用上の優位は判断できない。

この記事に出てくる言葉(6語)
ベースモデルと後訓練モデル

ベースモデルは事前学習を終えたモデル。後訓練モデルは、そこから指示への応答や課題への対応をさらに学習したモデル。

この論文では

公開モデルの主比較では両者を対応づける。一方、PTGS実験の追加訓練前の参照モデルは、すでに後訓練されたQwen2.5-7B-Instructである。

pass@k

pass@k\mathrm{pass}@k

同じ課題をk回試したとき、少なくとも一度成功する確率。

この論文では

pass@1を単発精度、より大きなkでのpass@kを反復時のカバレッジとして比較する。課題ごとの推定値を等重みで平均する。

pass^k

passk\mathrm{pass}^{k}

同じ課題へのk回の試行がすべて成功する確率。

この論文では

一つの成功例を得る能力と、毎回成功する一貫性を区別するために使う。

Sharpening Tax

後訓練前後で、追加試行によって得られる成功の価値がどれだけ減ったかを表す診断指標。

この論文では

正の値には、反復時の到達範囲の損失と、少数の試行で成功率が飽和する変化の両方が含まれる。

ハーネス

モデルの出力を環境とのやり取りやツール呼び出しにつなぐ補助構成。

この論文では

ベースモデルへツールの説明や出力形式を示し、生成した文章をツール呼び出しとして扱えるようにする。解答例は与えない。

PTGS

課題ごとの成功履歴から難易度を推定し、訓練時の生成温度を変えるposterior-tempered group sampling。

この論文では

推定成功率が目標より低い課題では温度を上げ、高い課題では下げる。主実験では訓練時だけ使う。

1. 読む前に知っておきたいこと

一度の成功と、繰り返した末の成功

LLMの後訓練は、望ましい応答や行動を出しやすくする。その効果を一度の試行だけで測ると、成功率の上昇がそのまま能力の拡大に見える。しかし、同じ課題へ繰り返し挑戦したときに解ける範囲まで広がったかは、別の問いだ。

本研究が扱うのは、ツールを使い、環境とのやり取りを続けるエージェントである。従来、この問いは主に数学やコードで議論されてきた。エージェントでは複数の行動をつなぐ必要があるため、後訓練によって新しい到達可能な解法が生まれる余地もある。著者らは、事前学習だけのモデルにも軽量な補助構成を与え、後訓練版と比較した。

具体例として、買い物の指示に対応するWebShopを見ていく。この評価では、最終報酬が1.0になった試行だけが成功である。一度の買い物試行が成功しやすいモデルと、繰り返し試すことでより多くの指示に成功できるモデルは、同じとは限らない。この例の範囲は、環境が成功を二値で採点できる課題に限られる。自由な文章の良し悪しをそのまま表すものではない。

三つの指標が見る別々の性能

単発精度を表すpass@1は、一度試して成功する確率だ。pass@kは、同じ課題をk回試して少なくとも一度成功する確率を表す。論文は後者をカバレッジ、つまり反復で成功へ到達できる課題の範囲を見るために使う。成功例を選べる状況を想定した指標なので、候補のどれが成功か分からない用途では、数値の高さをそのまま利用価値に置き換えられない。

もう一つのpass^kは、k回すべて成功する確率である。買い物の指示に一度でも対応できることと、毎回対応できることを分けて測る。後訓練が成功行動を出しやすくすれば、少ない試行での精度や一貫性には価値がある。一方、大きな予算から一つの成功例を探すなら、まれに成功する課題を残せるかも重要になる。

著者らは各課題の成功数からこれらを推定し、課題間で等重みに平均した。平均単発精度だけでは、どの課題の成功率が上がり、どの課題が成功しなくなったかを判別できない。そこで、試行数を増やしたときのpass@kの曲線も比較する。

成功を確実にする変化には二つの行き先がある

著者らが注目したのは、時々成功する課題が減り、常に成功する課題と成功しない課題へ分かれる変化だ。前者への移動は望ましい。少ない試行で成功でき、結果も安定する。後者への移動は、追加試行で拾えていた成功の機会を減らす。

WebShopのGemma-4-31Bでは、128試行の一部だけに成功した課題の割合が、ベースの87.6%から後訓練版の30.0%へ減った。全試行に成功した課題は0%から26.0%へ増え、成功なしの課題も12.4%から44.0%へ増えた。これは著者らの有限試行での観測であり、128回成功しなかった課題が無限に試しても解けないという意味ではない。

論文の理論分析は、課題を固定したとき各試行が条件付きで独立だと仮定する。そのモデル化では、成功確率が0か1へ移ると再試行の価値が消える。ただし、実験中の課題分類だけで真の成功確率を0や1と確定することはできない。

2. 手法と評価

ベースモデルをエージェントとして比べる

主評価はGemma-4、Ministral-3、Qwen2.5、Qwen3.5の4ファミリーに属する14組のベース/後訓練モデルを使う。BFCLの200課題、WebShopの先頭500指示、ACEBenchの770課題で、計42ケースを比較した。各課題で128回試行する。WebShopの商品は1,000件。ACEBenchは750件の一般・多段階ツール課題と20件の複数ターン課題を含み、すべてが長い対話の評価というわけではない。

ベースモデルには、ツールの説明、出力形式、会話履歴を文章で示すハーネスを付ける。ハーネスは、モデルが生成した文章を構造化したツール呼び出しへつなぐ補助構成だ。解答例は使わない。後訓練版には各ベンチマークの標準構成を使うため、両者の周辺構成は同一ではない。

主比較では、生成のばらつきを調整する温度をBFCLで0.4、他の二つで0.7に設定した。対応モデルのthinking modeは無効にし、予算はトークン数ではなく試行数で揃えた。したがって、同じ時間や金額でどちらが多く解けるかを測った比較ではない。

周辺構成の影響も別途調べている。8ベースモデルの平均では、ハーネスによりBFCLのpass@1/pass@32が5.6%/15.2%から15.6%/49.1%へ上昇した。一方、ACEBenchでは44.2%/89.2%から42.6%/87.7%へ低下した。ハーネスは一律に性能を上げる補助ではなく、その効果は評価対象によって異なる。

Sharpening Taxは曲線の何を測るか

Sharpening Taxは、最後の成功率の差だけを測る指標ではない。まず、上限の試行数をKとし、pass@Kと、それ以前の各pass@kとの差を足し合わせる。この量をA(K)と呼び、追加試行で回収される成功の面積として扱う。少ない試行で最終水準へ達する曲線ほど、この面積は小さくなる。

次に、A(K)を「K−1」と「初回の失敗率」の積で割ったものをS(K)とする。初回に失敗する余地と試行予算を踏まえて比べるための正規化で、初回成功率が1未満の場合に定義される。ベースのAまたはSから後訓練版の値を引いた差がTaxだ。正なら、後訓練版では追加試行への依存が小さくなったことを表す。

ここには解釈上の注意がある。追加試行の価値は、最終的に解ける課題が減っても小さくなるし、早い段階で成功率が飽和しても小さくなる。したがって、正のTaxだけで「ベースの方が多くの課題を解ける」とは結論できない。pass@1、pass@K、曲線の形を併せて見る必要がある。

主Tax曲線の95%区間は、課題を単位に対応を保って1,000回再標本化する方法で求めた。ただし、128試行からpass@128を求める末端では、各課題に成功があったかどうかだけが残るため、推定は粗くなる。

PTGSは課題ごとに探索の強さを変える

Taxを診断するだけでなく、著者らは訓練時の探索を調整するPTGSを提案した。温度は生成のばらつきに関わる設定で、高くすると異なる行動を試す余地が増える。ただし、難しい課題が高温で必ず解きやすくなるわけではない。

PTGSは、課題ごとの成功数と失敗数を蓄積し、古い記録の重みを減らしながら更新する。そこに事前分布を合わせ、成功率がどの程度ありそうかを表す事後分布を作る。使うのは、0から1の成功率の不確かさを表すBeta分布だ。その分布から成功率の候補を一つ引くThompson samplingにより、推定の不確かさも温度選択へ反映する。

引いた成功率が目標より低ければ温度を上げ、高ければ下げる。難しい課題では別の行動を探し、容易な課題では成功行動を確実に出す方向へ調整する仕組みである。全課題の温度を一律に上げる方法とは、この割り当てが異なる。

ただし、成功履歴は過去の弱いモデルの影響も受ける。著者らの分析では難易度推定が実際の成功率より保守的になる傾向があり、温度を変える適切な幅も環境によって異なった。理論上の改善も、温度変更が対象課題の成功確率を上げる条件に依存する。

診断の比較と、改善策の実験を分ける

PTGSの主実験は、公開ベース/後訓練モデルの比較とは別である。すでに後訓練されたQwen2.5-7B-Instructを出発点とし、Sokobanと滑るFrozenLakeで追加の強化学習を行った。強化学習は成功などの報酬を使って行動を学ぶ訓練で、ここではPPOとGRPOという二つの方式を使う。

固定温度1.0で訓練する比較対象とPTGSを、200ステップの訓練で比べた。評価は未見の64課題に各128試行、推論温度0.5で行い、5回の訓練実行の平均を報告する。PPOは最終モデル、GRPOは各実行で検証成功率が最大のモデルを採用した。GRPOのPTGS設定も検証結果で選ばれているため、方式間の数値は選択条件まで含めて読む必要がある。

主評価の推論時にはPTGSを外している。ここで問うのは、回答時に温度を適応させた効果ではなく、訓練時のサンプリングを変えた後に残る性能である。一律の訓練温度や、生成候補を固定規則で絞る方法との比較も行い、課題別の調整に意味があるかを検討した。

3. 結果と限界

広く見られる傾向でも、ベースが常に勝つわけではない

著者らの報告では、42ケース中36ケースで正規化したTax_S(128)が正だった。WebShopのGemma-4-31Bでは、ハーネス付きベースのpass@128が87.6%、後訓練版の標準構成が56.0%だった。差は31.6ポイントで、95%区間は27.2~36.0ポイント。これは反復時のカバレッジに明確な差が出た個別例であり、Taxが正だった36ケースすべての勝敗を表す数字ではない。

モデル規模による違いもある。各ファミリーの最小モデルを集めた12ケースの平均では、ベースの曲線は128試行以内に後訓練版へ追いつかなかった。各最大モデルを集めた12ケースの平均では、約22試行で逆転した。反復を増やせばどのベースモデルも有利になる、という結論にはならない。

少数試行での診断には有望な結果がある。半分の課題で8試行から推定したTaxと、別の半分で32試行から推定したTaxの順位相関は0.85だった。推定と確認に別課題を使った点は評価できる。ただし、これは42ケースの順位がよく対応したという結果で、任意の実務課題で将来の優位を保証するものではない。

PTGSは平均を改善したが、失った範囲は戻りきらない

SokobanのPPOでは、PTGSによりpass@1が46.5%から61.1%へ、pass@128が55.0%から69.7%へ上がった。改善はそれぞれ14.6ポイントと14.7ポイントで、Tax_Sは0.094から0.081へ下がった。FrozenLakeのPPOでも、pass@1は63.7%から65.0%、pass@128は74.1%から80.0%へ上がり、Tax_Sは0.039から0.020へ下がった。いずれも先述の未見64課題、5回の訓練実行の平均である。

GRPOでも両環境で単発精度とカバレッジの平均が上がり、Taxが下がった。しかし、追加訓練前の参照モデルのpass@128はSokobanで76.6%、FrozenLakeで89.1%だった。PTGSを使ったPPO/GRPOは、それぞれ69.7%/72.5%、80.0%/81.2%にとどまる。探索の損失を緩和したという結果であり、参照の到達範囲を回復しきった結果ではない。

平均順位の解釈にも慎重さが要る。一律温度1.5のPPOとPTGSのSokobanのpass@128は、64.4±11.1%と69.7±9.7%だった。これは5回の平均と95%区間で、区間は重なる。FrozenLakeでは一律温度を上げると平均カバレッジが下がったが、そこでも区間は重なる。PTGSの優位を確定的な有意差として扱えない。

さらにFrozenLakeの全128試行が成功する一貫性は、固定温度PPOの50.9%に対しPTGSが42.5%で、平均では低下した。ここでも区間は重なるものの、カバレッジの改善がすべての評価軸の改善を意味しない点は残る。

次に確認すべきは、同じ予算と実務課題での再現性

公開チェックポイントの比較は観察研究である。事前学習・後訓練のデータと正確な手順が不明なため、見られた差を強化学習だけの因果効果としたり、新しい能力が一切生じない証明としたりはできない。ハーネスの違いも差の解釈に関わる。

評価対象には選択効果もある。両モデルが予算内で非自明な成功を示すベンチマークを選び、BFCLは比較が難易度によって反転しうる中の一カテゴリを使った。ACEBenchではユーザーシミュレータを必要とする課題を除いた。長期の実務エージェント全般、自由生成、マルチモーダルへの一般化は未確認だ。

PTGSの追加訓練も、一つの出発モデルと二つの小規模環境に限られる。次の証拠としては、未見課題と複数の訓練実行で平均改善が再現するか、固定温度にも同じ設定選択の予算を与えてなお差が残るかが重要になる。二値の成功判定を担う検証器の誤判定率についても、独立した検証結果は供給されていない。

追加の推論時PTGS実験は、成功を採点する128回の予備試行と、その後の128回の解答試行を使う。採点されるのは後半だけでも、総数は256回である。主実験の訓練時PTGSと混同せず、追加の試行負担を含めて評価する必要がある。実測時間、トークン数を揃えた比較、金額上の節約を示す結果はなく、実務上の効率は次の検証課題だ。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

WebShopの一例では、後訓練版よりベースの方が128試行で広い範囲に成功した。この観測から変えられるのは、モデル選定を単発精度だけで済ませる習慣だろう。成功を判定でき、反復を許せる用途なら、予算別のpass@K、一貫性、Taxを受け入れ基準に加えることが考えられる。ただし、Taxは早期の成功飽和も含むため、値だけで採否を決めず、成功率の曲線と到達範囲の差を併記する必要がある。さらに本研究は試行数を揃えた比較であり、実時間やトークン数を揃えた実務課題で同じ判断が成り立つかは未確認である。

ホーム画面に追加する

  1. Safariでこのページを開く
  2. ページメニューから「共有」をタップ
  3. 「ホーム画面に追加」を選択
  4. 「Webアプリとして開く」をオンにして「追加」をタップ

追加後は、ホーム画面のアイコンからSingularity Lensを開けます。