OC-SFT:順位精度では見えないLLMスコアラーの順序依存を測り、減らす
順位精度が近いモデルでも、候補を並べ替えると採用文書や回答は変わる。OC-SFTはスコアの順序間分散を学習時に抑える。
Equal Ranking Quality, Different Decisions: Measuring and Reducing Order Dependence in LLM Scorers
論文の書誌情報と関連リンク
- arXiv初回投稿日
- 掲載先
- arXiv preprint
ポッドキャスト形式で聴く
約6分AI生成の会話音声です。記事の要点を短くまとめています。
概要
同じ質問と候補でも、プロンプト内の並び順が変わると、LLMの採点や採用文書が変わる。OC-SFTは、教師の評点を学びながら、並べ替えによるスコアのばらつきを学習時に抑える手法だ。著者らの検索実験では、順位精度が近い学習方式の間でも採用集合の重なりに大きな差があり、OC-SFTが最も安定した。ただし、順序不変性の保証はなく、回答の正確性が改善したことも確認されていない。
なぜ注目されているか
取得時点でHugging Faceでは16 upvotes、論文ディスカッションには2コメントが記録されている。関連GitHubリポジトリのスター数はHFメタデータ上で2。
議論全体へのリンク
なぜ重要なのか
検索結果を使って答えるRAGや、回答候補から選好学習用のペアを作る仕組みでは、順位の良さがそのまま判断の再現性を意味するとは限らない。本研究は、モデル選定で順位指標に加え、固定閾値で何を採用するか、同じ質問への回答がどれだけ変わるかを測る理由を示す。その評価が日本語や下流モデルを再学習した条件でも有効かは、追加検証が必要だ。
この記事に出てくる言葉(6語)
- 共有プロンプト型スコアラー
複数の文書や回答候補を一つのプロンプトに入れ、候補ごとにスコアを出すLLM。
この論文では候補間の文脈を使える一方、並び順によってスコアが変わる対象として扱う。
- OC-SFT
order-consistency SFT。教師評点への適合と、並べ替えた候補のスコア整合性を同時に学ぶ微調整手法。
この論文では同じ候補の順序間分散に罰則を加え、学習後の一順序での採点を安定させる。
- nDCG
関連性の高い候補を上位に置けているかを測る順位品質の指標。
この論文では検索とQAでは上位10件のnDCG@10、回答ランキングでは最上位のnDCG@1を使う。判断の再現性は別に測る。
- Jaccard
二つの集合について、共通する要素数を、どちらかに含まれる要素数で割った重なりの指標。
この論文では提示順序を変えたときの採用文書集合を比べる。高いほど重なりが大きい。
- τ-PSI
τ-PSI
異なる提示順序で得た順位の相関から、順位の変動を測る指標。
この論文では10通りのランダム順序を比較し、低いほど順位が安定していると読む。
- 順序平均蒸留
複数の提示順序で教師が出したスコアを平均し、その平均を学生モデルに学ばせる方法。
この論文では教師の10順序平均を使う比較対象。OC-SFTは学生自身の順序間の違いを直接抑える。
1. 読む前に知っておきたいこと
順位が良くても、採用判断は揺れる
社内資料を検索し、質問への回答に使う文書を選ぶ場面を考える。LLMに複数の候補文書をまとめて渡し、関連性を採点させる。一定の点数以上を採用したり、上位文書を回答生成モデルへ渡したりする仕組みだ。本論文が扱うのは、このように候補ごとのスコアを出すLLMスコアラーである。
ここで、質問も候補文書も変えず、提示順序だけを入れ替える。内容が同じなら採用判断も同じであってほしい。しかし、候補が一つのプロンプトを共有すると、並び順によってスコアが動く。閾値付近の文書が採用から除外へ移り、回答に渡す文書も変わりうる。社内資料の例は仕組みを理解するためのもので、この用途での効果を実証したという意味ではない。
通常の順位評価は、関連性の高い文書を上位へ置けるかを見る。検索で使うnDCG@10は、上位10件の順位品質を測る指標だ。ところが、順位品質が近くても、点数が閾値をまたぐ頻度や回答の変化は同じとは限らない。本研究は、その差を評価の中心に置く。
候補を一緒に読む利点と代償
候補を一件ずつ採点する方式なら、同じプロンプト内の候補順序への依存は構造上避けられる。一方、候補同士を見比べる共有文脈は使えない。複数候補から順位そのものを生成する方式もあるが、候補別スコアを持たないため、固定閾値で採用する仕組みとは扱う対象が異なる。
共有プロンプト型では、一度に読む候補のまとまりを「窓」と呼ぶ。窓の候補数が採点幅Bだ。候補を全体で並べ替えると、同じ窓に入る相手まで変わる場合がある。窓内で順序だけを変えることと、候補の組み合わせを変えることは区別する必要がある。
従来の対策の一つは、複数の順序で採点して平均するBSCである。これは推論を繰り返して変動をならす。順序平均蒸留は、その平均を教師ラベルとして学生へ学ばせる。OC-SFTはさらに別の位置に働きかける。平均ラベルへの適合だけでなく、学生自身が異なる順序で同じ候補に出すスコアを近づける。
一貫性だけを求めても足りない
スコアが変わらないことと、スコアが正しいことは別である。関連性を無視して同じ値を出せば、順序間のばらつきは小さくできる。そこでOC-SFTは、教師の評点に合わせる目的を残しながら、一貫性も求める。
論文は、固定した候補集合に対するスコアを、順序を平均した成分と、順序による残差に分けて考える。残差とは、ある順序のスコアが平均からどれだけずれたかという部分だ。OC-SFTが抑えるのは、この順序に伴うばらつきである。平均スコアそのものを直接固定するわけではない。
また、近い点数の候補では小さな変動でも順位が入れ替わる。学習対象も窓内の並べ替えなので、候補集合や表示用マーカーの変更に対する頑健性まで保証するものではない。狙いは依存を減らすことであり、あらゆる入力変更に対して判断を不変にすることではない。
2. 手法と評価
同じ文書を二つの順序で採点する
本論文の採点は、文章として評点を生成する方式ではない。各候補に固定の評点用骨格を付け、0から3の評点に対応するトークン確率を読む。その確率から期待評点を求め、候補別の連続スコアにする。重みを利用できるモデルではトークンをサンプリングせず、一回のモデル計算で窓内の候補を採点する。生成結果の揺れとは別に、候補の提示によるスコア変動を調べる設計だ。
OC-SFTでは、同じ窓の候補を別の順序にした入力を用意する。これを「ビュー」と呼び、標準設定では二つ使う。最初のビューでは、学生のスコアを教師評点へ近づける。同時に、各候補について二つのビューのスコアをその平均へ近づける。順序間の分散に罰則を加える仕組みである。
教師への適合と整合性の強さを調整する係数がλだ。教師への適合を外す削除実験では、関連性のない一貫したスコアへ崩れた。λをゼロにすると、一順序の教師評点だけを学ぶ通常の蒸留になる。この対比は、関連性と安定性を同時に保つ必要を示している。
何を揃えて学習方式を比べたか
主実験の学生はQwen3-4Bである。標準設定では、微調整前の同じベースモデルを教師にする自己蒸留を使う。OC-SFTの教師ラベルは候補ごとに一順序分で、順序平均蒸留は10順序の平均を使う。学習後は、どちらも一つの順序で採点する。
検索の学習にはMS MARCOの約3万質問、QAにはHotpotQAの3万質問、回答ランキングにはUltraFeedbackの約3.07万プロンプトを使った。採点幅はそれぞれ20、10、4候補で、λは5、3、1。λと学習途中のモデルの選択は、各タスクの検証用順位品質に基づく。安定性指標だけを最大化して選んだ条件ではないが、λの探索は5までで、それを超える値は未検証だ。
比較には一順序蒸留、順序平均蒸留のほか、並べ替えた学習例を見せる方法や別の正則化も含む。これにより、単に異なる順序に触れたから改善したのか、スコアの不一致を直接罰することに意味があるのかを調べた。ただし、二ビューのOC-SFTは学習ステップの計算をおよそ倍にする。教師ラベル生成が一順序で済むことを、総学習計算の十分の一化とは読めない。
順位、採用集合、回答を別々に測る
評価は検索18、QA3、回答ランキング5コレクションを使い、それぞれのコレクションを等重みで集計する。学習方式の主要値は三つの学習乱数設定の平均だ。提示順序は10通りを試し、順位の相関から変動指標τ-PSIを求める。これは低いほど安定している。
社内資料の例でいえば、順位表の揺れに加えて、採用箱に入った文書の重なりを見る。採用閾値は各コレクションの質問の半分でF1に合わせて調整し、残りでは固定する。F1は採用判断の適合率と再現率を合わせた指標だ。集合の再現性にはJaccardを使う。二つの採用集合の共通部分を、どちらかに含まれる全体で割るため、高いほど同じ文書を残せている。
QAでは上位5文書を固定した回答生成モデルへ渡し、正答指標と回答変化率を併記する。回答ランキングでは、選好学習へ渡すchosen、すなわち選ぶ回答と、rejected、すなわち退ける回答の両端が変わるpair flipを測る。順位が揺れること、採用が揺れること、回答が揺れることを同じ尺度で済ませない設計である。
評価が示せる範囲
著者らは、同じ質問を対応づけた再標本化などで区間を算出し、差の不確かさも示している。候補の分割規則だけを変えた対照実験では、未学習Qwen3-4Bの検索nDCG@10が0.370から0.422へ上がった。一方、採用集合Jaccardの差は+0.004で、95%信頼区間は−0.007から+0.016だった。順位改善に伴う安定化は測定上確認できない。
これは、見せ方の変更で順位品質が上がっても、意思決定の再現性まで改善したと推定できないことを示す。また、並べ替えた例を学習に加えるだけの方式では検索τ-PSIが0.129だったのに対し、OC-SFTは0.083だった。別の正則化であるEMA方式も0.119まで下げたが、QAの正答指標を損なう比較があった。安定性だけを改善目標にすると、品質との交換条件を見落としうる。
この評価は固定した閾値や回答生成モデルでの変化を捉える。スコアラーに合わせて下流を再学習した場合や、作った選好ペアで別のモデルを学習した後の性能までは確かめていない。
3. 結果と限界
近い順位精度の裏にあった差
著者報告では、検索18コレクションの五つの学習方式のnDCG@10は0.449から0.459に収まった。完全に同じ品質ではないが、範囲は狭い。その中で、一順序蒸留の採用集合Jaccardは0.656、OC-SFTは0.835だった。τ-PSIも0.209から0.083へ下がり、OC-SFTのnDCG@10は0.459だった。順位品質を保ちながら、採用文書の再現性には大きな差がついた。
QAでも、OC-SFTのnDCG@10と回答変化率は0.961と0.125で、一順序蒸留の0.951と0.177、順序平均蒸留の0.956と0.149より安定していた。回答ランキングでは、OC-SFTのnDCG@1が0.701、pair flipが0.661。一順序蒸留は0.684と0.869、順序平均蒸留は0.693と0.724だった。
ただし、最も安定した比較対象でも選好ペアの変化は残る。低減は不変性の達成を意味しない。また、これらは集計値であり、一順序蒸留より悪化する質問も残った。ArguAnaは繰り返し順位品質へのコストが出る例外として報告されている。
回答が同じになることと、正解すること
固定したGranite-4.1-8Bを回答生成モデルに使った検証では、各QAコレクション200質問、計3コレクションを評価した。一順序蒸留からOC-SFTへの完全一致率EMの差は−0.0058で、95%信頼区間は−0.0153から+0.0035だった。回答F1の差も−0.0016で、区間は−0.0104から+0.0071。どちらもゼロを含み、回答正確性の改善は確認されていない。完全な同等性が証明されたわけでもない。
一方、回答変化率の低減はHotpotQAで0.0487、2WikiMultiHopQAで0.0459、MuSiQueで0.0700で、それぞれの区間はゼロを含まなかった。回答をより再現しやすくしたという結果と、正答を増やしたという結果は分けて読む必要がある。
推論時平均との比較にも境界がある。一順序のOC-SFTは、未学習モデルの10順序平均より採用集合とQA回答で安定したが、選好ペアでは10順序平均が上回った。学習済みモデルの10順序平均にまで、一順序の優位を広げる証拠ではない。
共有文脈の価値はタスクによる
12種類のベースモデルすべてで、OC-SFTの検索τ-PSIは順序平均蒸留より低かった。この広がりは、主結果が一つのベースだけに依存するという説明を弱める。一方、表示用マーカーを変える感度は順序整合性の学習だけでは除去できなかった。順序への対策を、プロンプト変更全般への対策と見なすことはできない。
候補を一緒に読む価値にも差がある。同じOC-SFTの重みで、一件ずつの採点と学習時の幅を比較すると、QAのnDCG@10は0.918から0.961へ上がった。検索18コレクションでは差が0.000だった。回答ランキングではPPE-MATHなどに改善がある一方、RM-Benchでは0.040下がった。幅を広げれば品質も上がるという一律の結論は出ない。
既に一件ずつ採点している仕組みなら、候補順序依存を取り除くという目的だけで導入する理由は乏しい。共有文脈を使う仕組みでは、品質と安定性を併せて評価する余地がある。ただし、検索で20候補幅を学習したモデルは34候補以降で品質と安定性が悪化しており、幅を無制限に広げられるわけではない。
次に必要なのは適用条件の検証
全評価は英語で、候補数は4以上だった。日本語、より少ない候補、学習時の20候補プロンプトを超える長文設定、推論を集中的に要する検索への効果は未検証である。10通りのランダム順序は典型的な変動を見るためのもので、最悪の並べ方に対する保証でもない。
再現性にも制約がある。検索18コレクションには非公開のLegal-A/Bが含まれ、第三者が主平均を全面的に再計算することはできない。教師評点も人手の正解そのものではなく、モデルによる代替ラベルだ。教師のラベル品質と順序整合性が相関するため、学生の品質に対するそれぞれの寄与を独立には特定できない。
微調整可能な共有プロンプト型スコアラーには適用候補となるが、下流まで含む効果は残る問いである。日本語で採用集合と回答の差が再現するか、閾値や回答生成モデルを適応させても差が残るか、安定した選好ペアが学習後のモデルに何をもたらすか。その証拠が揃うほど、今回の結果を具体的なモデル選定へ結びつけやすくなる。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
順位精度が近いスコアラーでも、提示順序を変えたときの採用集合と回答は異なった。この観測から、共有プロンプトを使うRAGの選定では、順位品質に加えて固定閾値と固定した回答生成モデルでの再現性を比較することが考えられる。ただし、安定化が正答の増加を意味するとは確認されていない。英語で得た差が日本語でも残り、下流を再学習した後にも判断上の意味を持つかを確かめることが、次の評価を左右する。