LLMの確信度推定キャリブレーション経験メモリ

XConf:過去の類似課題の成績からLLMの確信度を補正する

自己申告の確信度を過去の成功率で補正し、回答・再試行・委任の判断につなげる

Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

XConfは、言葉の上では自信満々でも実際には間違えやすい言語モデルに、過去の似た問題での成績を見せて、自信の数字を言い直させる方法です。著者らは、今の答えだけを見る方法より、正解と不正解を記録した経験も使う方が、答えを採用するか人に確かめてもらうかを決めやすいと報告しました。

XConfは、言語モデルの自信を「今うまく答えられた気がするか」だけで決めず、過去の似た課題における実際の成功率で直す方法です。採点済みの経験を探す段階と、その記録から繰り返す失敗を考え直す段階を組み合わせます。著者らは9種類の試験で、正しい答えと誤った答えを自信の差で見分ける力や、自信の低い回答を外した後の正解率を調べました。

XConfは、言語モデルが今回述べた自信を、同じモデルの採点済みの過去経験で補う方法です。似た課題と似た自信の記録から成功率を読み、具体的な失敗例を見たモデルに自信を言い直させ、二つを平均します。著者らは9種類の試験で、複数回答を使う方法などと比べました。多くの条件で正誤を見分ける力が高まりましたが、正しい外部採点、十分な失敗例、モデルと仕事の安定が必要です。

XConfは、現在の推論だけから確信度を出すという従来の前提を外し、同一モデルの採点済み履歴を利用するブラックボックス型推定器である。類似課題かつ類似した自己申告確信度の履歴から得る成功率と、失敗履歴を読んだモデルの再申告値を平均する。

XConfは、LLMの確信度推定に同一モデルの外部採点済み経験を導入する。Recallが類似課題・類似自己申告確信度の履歴から成功率を推定し、Reflectが検索例に現れる失敗パターンを踏まえて確信度を再申告する。著者らは9ベンチマークと4モデルで、識別、較正、選択的予測を比較し、多くの条件で10サンプルのself-consistencyを上回るか同等だったと報告する。

XConfは、正答確率の推定を現在の推論内情報だけに閉じず、同一actorの外部採点済みエピソードを条件として利用する。検索ベースのRecallと、事例を用いたReflectを等重みで統合し、重み更新やロジットアクセスなしに識別と較正を改善することを狙う。9ベンチマーク、4モデルの著者実験は広い優位性を示す一方、独立ラベル、十分な少数クラス例、actorと分布の安定性が主要条件となる。

XConfは、確信度推定を現在の推論内情報に限定せず、同一actorの外部採点済みエピソードで条件付ける手法である。類似課題・類似自己申告確信度の近傍成功率を返すRecallと、検索例から失敗モードを抽出して再申告するReflectを等重みで統合する。

XConfは、現在の推論過程だけに依存する既存の確信度推定に対し、同一actorの外部採点済み履歴を導入する。学習済み距離空間上の局所成功率を返すRecallと、検索例のlessonから失敗モードを反映するReflectを統合する。9ベンチマーク、3系列4モデルの著者実験では、識別、較正、選択的予測で広範な改善が報告された。

XConfは、LLM確信度推定を現在の推論内信号から同一actorの検証済み履歴へ拡張するexperience-conditioned estimatorである。検索空間を学習して近傍成功率を返すRecallと、取得例のlessonから失敗モードを反映するReflectを等重みで統合する。広範な著者内評価は識別・較正・選択的予測の改善を示すが、外部ラベルの独立性、履歴量、actor同一性、分布安定性が識別可能性と適用範囲を規定する。

著者をもっと詳しく知る(全6名)

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

全著者と所属

  1. Caiqi Zhang
    所属情報なし
  2. Xiaochen Zhu
    所属情報なし
  3. Chengzu Li
    所属情報なし
  4. Yulong Chen
    所属情報なし
  5. Dharshan Kumaran
    所属情報なし
  6. Nigel Collier
    所属情報なし

なぜ注目されているか

Hugging Faceで54件のupvoteと2件のコメントが確認され、登録GitHubリポジトリは2 stars。コメント内容は未取得。

Hugging Faceで54件のupvoteと2件のコメントが確認され、登録GitHubリポジトリは2 stars。コメント内容は未取得。

Hugging Faceで54件のupvoteと2件のコメントが確認され、登録GitHubリポジトリは2 stars。コメント内容は未取得。

Hugging Faceで54件のupvoteと2件のコメントが確認され、登録GitHubリポジトリは2 stars。コメント内容は未取得。

Hugging Faceで54件のupvoteと2件のコメントが確認され、登録GitHubリポジトリは2 stars。コメント内容は未取得。

Hugging Faceで54件のupvoteと2件のコメントが確認され、登録GitHubリポジトリは2 stars。コメント内容は未取得。

Hugging Faceで54件のupvoteと2件のコメントが確認され、登録GitHubリポジトリは2 stars。コメント内容は未取得。

Hugging Faceで54件のupvoteと2件のコメントが確認され、登録GitHubリポジトリは2 stars。コメント内容は未取得。

Hugging Faceで54件のupvoteと2件のコメントが確認され、登録GitHubリポジトリは2 stars。コメント内容は未取得。

議論全体へのリンク
この読み方に出てくる言葉(6語)
確信度較正

予測した正解確率と、同じ予測値を持つ集団の実際の正解率を対応させること。

Recall

検索した類似履歴の外部採点結果から歴史的成功率を得る段階。

この論文では

近傍50件に確信度カーネルを適用する。

Reflect

検索履歴の失敗パターンをモデル自身に読ませ、現在の確信度を再申告させる段階。

この論文では

上位8件のカードを使う。

AUROC

正例が負例より高いスコアを得る確率として解釈できる順位識別指標。

この論文では

正答と誤答を確信度で識別する。

ECE

予測確率と観測正解率の区間別乖離を集約する較正誤差。

アブレーション

構成要素を除き、性能差からその要素の寄与を調べる実験。

どんな問いに向き合ったか

既存の確信度推定は、言語化された自己評価、トークン尤度、複数サンプルの一致、現在のロールアウトを読む判定器など、現在の推論に情報を限定しがちである。著者らの問いは、同一モデルが類似課題で示した実際の成否を条件に加えることで、反復的な過信を検出し、正答確率の推定を改善できるかである。推定対象は、課題と生成済み回答が与えられたときに正答である確率である。

従来の方法と課題

比較対象は、言語化確信度、SC@10、semantic entropy、P(True)、単一ロールアウトを読むLLM judge、Platt・isotonic・histogramによる較正、conformal prediction、訓練済みverifierである。尤度法にはロジットアクセス、self-consistencyには複数生成と比較可能な出力、学習型推定器には更新可能なパラメータや再学習が必要になり得る。XConfはブラックボックス性を保ちつつ、現在の推論ではなく時間をまたぐ採点履歴を追加情報源にする。

肝のアイデア

各経験は、課題、推論またはロールアウト、出力、採点前の反省、自己申告確信度、外部評価ラベルから成る。結果判明後にlessonを一度だけ生成するが、これは採点前反省から隔離する。新規課題では、その時点より前に採点済みの経験のみを銀行に置く。

Recallは類似した課題と反省に加え、自己申告確信度が近い経験を検索し、外部ラベルの局所成功率を返す。Reflectは具体的な履歴から反復的失敗を言語化し、現在の課題への該当性を判断して確信度を更新する。両出力の算術平均が最終値となる。

どういうしくみか

検索特徴は、課題埋め込み、採点前反省の埋め込み、自己申告確信度、推論長、反省長である。埋め込みは学習fold内で各30次元へPCA縮約され、全特徴を標準化する。L2正則化ロジスティックprobeの係数絶対値で距離空間を再重み付けするが、probeの予測値そのものは使わない。この分離により、probeは近傍の定義を学ぶだけで、最終確率を直接支配しない。

再重み付け空間で50近傍を取得し、幅0.08の確信度カーネルによってラベルを重み付けする。Reflectには上位8件を、課題要約、当時の確信度、結果、lessonのカードとして渡す。モデルは共通する失敗を一文で抽出し、現在も同じ失敗にさらされるかを判断する。モデル重みと回答文字列は検索に使わない。

どう確かめたか

評価範囲は推論4、コード1、マルチモーダルQA1、対話型エージェント3の計9ベンチマーク、3系列4モデルである。正誤ラベルはexact match、LLM verifier、unit tests、環境スコアを課題に応じて用いる。5-fold rotationにより、各推定時に自身の課題・結果と同一評価foldを銀行から除外する。

識別は主にAUROC、較正はECEで測り、AURCとBrier scoreも評価された。AUROCは閾値に依存せず正答を誤答より上位に置く能力を測る一方、ECEは数値としての確率が観測頻度と合うかを見る。選択的予測では最低確信度10%を棄却し、残存集合の正解率を棄却前と比較した。

何が分かったか

推論・コード・マルチモーダルの24モデル×データセット比較で、XConfはSC@10に対してAUROCで21勝2分1敗、計23件で勝利または同等だった。LiveCodeBenchの4モデルでは、XConfのAUROCが0.830〜0.887、ECEが0.018〜0.062で、コード類似度を用いるSC@10はAUROC 0.742〜0.804、ECE 0.256〜0.392だった。

ScienceWorld、AppWorld、SWE-bench Verifiedの12セルでは、言語化確信度、LLM judge、訓練済みverifierとの比較でAUROCが全セル最良または同等だった。最低確信度10%の棄却後、残存集合の正解率は36セル平均で4.8ポイント上昇し、最大は0.805から0.892への8.7ポイント上昇だった。これらはすべて著者報告である。

どこまで使えるか

適合しやすいのは、unit tests、環境スコア、人手確認など、actorの自己評価から独立した結果が継続的に得られる環境である。同一actorと比較的安定した課題分布の下で履歴を再利用でき、長文、コード、マルチモーダル出力、エージェント軌跡のように10生成の一致を定義しにくい用途が候補となる。確信度は回答の採用、再試行、追加検証、人間への委任を振り分ける補助信号として位置付けられる。

限界と未解決の問い

自己生成ラベルは、確信を持った誤答を成功として記録し得るため性能が崩れ、独立した採点信号が必要だった。短い投票可能な事実検索ではself-consistencyが強い場合があり、主要比較の唯一の敗北もその種のセルだった。別モデルの銀行への移行では6データセット中5つでAUROCが0.03〜0.06低下し、異なるタスク系列への移行コスト中央値は0.08だった。

能力が変化するactorでは古い履歴への忘却や時間重み付けが必要になり得るが未検証である。コールドスタートでは少数クラス、概して約20件の失敗例が制約となった。さらに生成コスト10分の1は回答生成回数の比較であり、埋め込み往復と短いReflect呼び出しは別に存在する。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

最低確信度10%の棄却で残存正解率が平均4.8ポイント上昇した結果は、確信度を順位指標として眺めるだけでなく、検証資源の配分へ接続する可能性を示す。外部ラベルが継続し、actorと分布が安定するなら、採用・再試行・委任の方針をXConfで比較評価する価値がある。ただし、自己生成ラベルは過信を自己強化し、能力ドリフトは履歴の条件を変える。したがって有効性は、AUROCだけでなく、ラベル独立性、棄却後性能、分布変化時の劣化を含む運用単位で判断すべきである。