onPanda:トークン単位の修正でオンポリシーなLLM・エージェント用データを作る
最初の不適切なトークンを直し、続きを再生成する反復型アノテーション
onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction
論文の書誌情報と関連リンク
- arXiv初回投稿日
- 掲載先
- arXiv preprint
概要
onPandaは、LLMの回答を人が全面的に書き直す代わりに、「最初に不適切なトークンだけを直し、その地点から続きを再生成する」注釈手法である。この操作を満足できる回答になるまで繰り返し、SFT用の完成回答、選好対、位置付きの訂正記録を同じ過程から得る。著者らの小規模比較では、注釈時間の中央値は330秒で、手動事後編集の681秒より51.5%短かった。出力も元モデルの分布に比較的近かった。ただし、比較は3人、21件、単一モデルに限られ、訂正記録が実際の学習性能を高めるかは未検証である。
なぜ注目されているか
2026年9月22日の観測時点で、Hugging Face Daily Papersでは27件のupvoteと2件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは29 starsだった。
議論全体へのリンク
なぜ重要なのか
この研究が問い直すのは、良いアラインメントデータを作るには、人が完成文を書くか、複数の完成文を順位付けする必要がある、という前提だ。対象モデルの回答が概ね正しく、誤りが局所的なら、人の役割を「執筆者」から「最初の分岐点を見つける監督者」へ変えられる可能性がある。これにより、一つの作業から複数形式の監督データを得られる。ただし判断すべきなのは操作時間だけではない。対象モデルで訂正がどれほど疎か、必要な生成機能を利用できるか、そして得られた信号が下流学習を本当に改善するかを確かめる必要がある。
この記事に出てくる言葉(6語)
- オンポリシーデータ
学習や評価の対象となるモデル自身の生成分布に近いデータ。人が文章全体を書き換えるほど、元モデルが自然に出す系列から離れやすい。
この論文では注釈時のrolloutモデルが大部分のトークンを生成したデータを指す。別モデルや更新後のモデルに対する近さは保証しない。
- トークン
モデルが文章を処理・生成するときの単位。単語全体とは限らず、語の一部や記号になる場合もある。
この論文では注釈者が最初の不適切な位置を指定し、候補選択または自由入力で置換する単位。
- 接頭辞継続生成
回答の先頭から指定位置までを固定し、その続きだけをモデルに生成させること。
この論文では訂正済み部分を保持し、誤りの後ろを捨てて続きを作り直す中核操作。
- PPL
モデルにとって文章がどれほど自然かを見る指標で、一般に低いほどモデルの生成分布に近い。品質そのものを直接測る指標ではない。
この論文では注釈後の出力がrolloutモデルの分布からどの程度離れたかを比較するために使う。
- SFT coverage
各プロンプトについて、教師あり微調整に使える適格な完成回答を得られた割合。
この論文では21件のプロンプトのうち、各方式で適格回答を確保できた件数から算出する。
- Corr.-NG
不適格な回答について、最初の誤り位置と置換内容の両方が正解記録と一致した割合。
この論文ではPanda-CVL上で、モデルが精密なトークン訂正を行えるかを測る。
1. 読む前に知っておきたいこと
完成文の編集と順位付けが残す穴
従来の代表的な作業には、モデルの初期回答を人が事後編集する方法と、複数候補を人が順位付けする方法がある。前者は適格な完成回答を作れる一方、時間がかかり、人が大幅に書き換えると元モデルの生成分布から外れやすい。後者は比較的軽いが、監督信号は回答全体の「どちらが良いか」にとどまる。候補のどれにも良い回答がなければ、どこをどう直すべきかも残らない。論文の比較対象は、POTATOによる手動事後編集と、Argillaによる4候補の選好順位付けである。関連手法Reptileとは環境と行動表現が異なるため、直接比較していない。
最初の誤りを分岐点として扱う
onPandaの発想は、完成した回答を固定物として直すのではなく、生成過程の途中へ戻ることにある。仮に画像記述で、回答中に最初の誤った色を表すトークンが現れたとする。注釈者はその位置を正しい色へ置き換え、それより後ろを削除する。モデルは正しい接頭辞から続きを生成し直す。新しい続きにも問題があれば、同じ操作を繰り返す。この例が示すのは局所的な介入であり、文章全体の整合性が自動的に保証されるという意味ではない。後続を再生成するのは、早い位置の変更が後の内容にも影響するためだ。
この研究でいうオンポリシー性
最終回答の大半をモデル自身に生成させれば、人が全文を書く場合より、そのモデルが出しやすい系列を保ちやすい。論文はこの性質をオンポリシー性として扱う。ただし絶対的な属性ではない。あくまで注釈時に続きを生成したrolloutモデルに対する近さである。別モデルを学習する場合や、同じモデルでも重みが更新された後には、この利点が弱まる可能性がある。また、元回答に誤りが密集していれば、人の置換が増え、時間面と分布面の双方で利点が薄れる。
2. 手法と評価
locate–correct–continueの流れ
注釈者は回答を先頭から読み、最初の不適切なトークンを特定する。次に、モデルが示す上位候補から置換を選ぶか、正しい文字列を自由入力する。候補は既定で20件であり、自由入力部分の確率更新にはprompt_logprobsを使う。システムは訂正点より前を保持し、後続だけを破棄して、修正済みのassistant-message prefixから生成を再開する。「位置を探す、直す、続ける」を適格回答まで反復するため、人は良い部分を入力し直さずに済む。
一つの操作から三種類の監督を残す
各訂正は注釈木の新しい分岐として保存される。記録には訂正位置、置換前後のサンプル、操作ログ、サンプリング設定が含まれる。適格とされたノードはSFT用の完成回答になる。同じプロンプトから生じた適格・不適格ノードは選好対になり、さらに「誤り位置、誤った内容、置換内容」という細粒度の訂正データにも変換できる。つまり、完成回答だけでなく、人がどこで生成を分岐させたかも監督信号として残す設計である。
ツール利用を含む軌跡への拡張
エージェントの回答では、自然文だけでなくreasoning、content、tool_callsのような構造を扱う。onPandaは応答テンプレートにより、こうした構造化メッセージとモデル固有のトークン列を双方向に変換する。MCPで接続したツールについては、注釈者が呼び出しを訂正・承認し、実行結果を文脈へ戻して生成を続けられる。単なるログの書き換えではなく、訂正後の行動による環境結果を次の生成に反映する考え方だ。ただし、新しいモデルのreasoningやtool callを扱うには、モデル固有の応答テンプレートを適応する必要がある。
比較実験が測ったもの
著者らは、3人の非開発者アノテーターと21件の画像記述プロンプトを用い、3方式をラテン方格で割り当てた。rolloutモデルはQwen3.5-35B-A3Bで、temperature 0.7、top-p 0.8である。測定対象は注釈時間、GPT-5.5による提示順を入れ替えた一対比較、rolloutモデル上のPPL、SFT coverage、得られた選好対数だった。さらに3人が0〜10で答える適応版NASA-TLXで作業負荷を測った。この設計は同じ小規模条件でワークフロー全体を比べるが、観測差を個々の画面要素や操作原理へ分解するアブレーションではない。
3. 結果と限界
時間、品質、作業負荷の報告値
著者らの報告では、プロンプト当たりの注釈時間中央値はonPandaが330秒、POTATOが681秒、Argillaが336秒だった。onPandaはPOTATOより51.5%短く、Argillaとは同程度である。平均時間は順に515.6秒、711.1秒、684.5秒だった。GPT-5.5による方式間の一対比較勝率はonPanda 66.7%、POTATO 54.8%、Argilla 28.6%。別の匿名化された小規模な人手比較では、onPandaがPOTATOに対して54.8%で選ばれた。適応版NASA-TLXの平均はonPanda 3.1、Argilla 5.4、POTATO 6.8で、低いほど負荷が小さい。いずれもこの限定的な実験条件での結果である。
分布への近さと得られるデータ量
rolloutモデル上のPPLは、4回再サンプリングした基準の1.171に対し、onPandaが1.181で基準比+0.86%、Argillaが1.161で-0.83%、POTATOが1.596で+36.31%だった。プロンプトごとの再サンプリング変動は約±2.8%であるため、onPandaと基準の小差を過度に読むべきではない。一方、POTATOの差は大きく、手動編集が元モデルの分布から離れやすいという問題設定と整合する。ただしPPLは文章品質の証明ではない。SFT coverageはonPandaが100%(21/21)、Argillaが52%(11/21)、POTATOが100%(21/21)。プロンプト当たりの選好対はそれぞれ7.43、6.00、0.95だった。
運用集計と訂正ベンチマークが示すこと
著者らの本番運用集計では、Vision 25,596、Audio 105,143、Agentic 1,257の計131,996セッションが記録された。適格回答のトークン由来は、モデル生成97.0%、候補選択2.1%、手入力0.9%だった。これは大半をモデル生成に保てたという観測だが、対照群のある実験ではない。公開されたPanda-CVLは7,491セッションからなり、訓練6,839、テスト652。テスト軌跡はgood 652件、not-good 1,474件の計2,126評価インスタンスへ展開された。受理判定、最初の誤り位置、置換内容を評価したところ、最高F1でもGPT-5.5の17.09%、最高Corr.-NGはGPT-6の15.83%で、全モデルが16%未満だった。精密な訂正は既存モデルにとって難しい課題だと読める。
人間の判断にも幅がある
同じ初期回答を4人が独立に訂正したPanda-MultiRef-21では、最初の訂正位置の完全一致率は30.95%、±4トークン以内は44.44%だった。一様ランダム位置ならそれぞれ0.20%、約1.84%であり、人間の判断には明確な共通性がある。同時に、完全一致しない例の多さは、唯一の正解位置を当然視できないことも示す。位置が同じ場合の置換トークン一致率は69.44%だった。したがって、ベンチマークの低い成績にはモデルの難しさだけでなく、許容できる訂正が複数ある可能性も関係し得る。ただし、この代替説明だけで低成績の全てが説明されたとはいえない。
導入判断の境界線
中核操作にはassistant-message prefixからの継続生成と上位候補のlogprobsが必要で、自由入力後の確率再計算にはprompt_logprobsも要る。非対応APIでは、この形のオンポリシー注釈はできない。また、比較実験は社内アノテーター3人、21件、単一rolloutモデルに限られ、品質評価は主にLLM-as-a-judgeである。judge固有の選好を排除できず、エージェント軌跡には制御実験もない。最も重要なのは、論文が注釈効率、品質、分布特性を評価した一方、トークン単位訂正データを使った学習が下流性能を改善するかを検証していない点だ。現時点で支持されるのは有望なデータ作成過程であり、学習効果の確立ではない。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
観測された核心は、適格回答の97.0%のトークンをモデル生成に保った運用集計と、小規模比較で手動事後編集より短い中央値を両立したことにある。ここから、回答が概ね正しい業務では、人が全文を仕上げる運用から、最初の局所誤りを特定して生成を再開させる運用へ変える余地がある。さらに同じ履歴からSFT、選好対、位置付き訂正を得る設計は、別々の注釈工程を当然とする判断も見直し得る。ただし、この推論が成り立つのは誤りが疎で、必要なprefix継続生成とlogprobsを利用できる場合に限られる。対象モデルが外し続ければ訂正は密になり、効率とオンポリシー性の双方が弱まる。加えて、下流学習の改善はまだ示されていない。次に見るべき証拠は、対象業務ごとの訂正密度、より広い参加者・課題・モデルでの再現、エージェントの制御比較、そして三種類の監督データが実際の学習結果へ与える効果である。