AIベンチマーク検索評価エビデンスの来歴管理日次ディスカバリー

Benchmark Radar:AIベンチマークの出典・採用履歴・スコア推移を追跡する検索基盤

比較できないスコアを無理に束ねず、評価の根拠までたどれる「生きた」ベンチマーク台帳

Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation

論文の書誌情報と関連リンク

arXiv初回投稿日
掲載先
arXiv preprint (cs.AI), version 2

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

Benchmark Radarは、AIの実力を試す問題集を探し、その出典や採点条件まで確かめるための検索基盤です。著者らは、点数を一つの順位表へ急いでまとめず、「その点数は本当に比べられるか」を先に調べられるようにしました。

Benchmark Radarは、AIを試す問題集を探す作業と、その点数の根拠を確かめる作業をつなぐ検索基盤です。37の情報源から新しい資料を集め、論文、プログラム、データ、モデルの報告、点数の履歴を結びます。重要なのは、条件の違う点数を無理に一つの順位へまとめないことです。

Benchmark Radarは、AIを試す問題集について、見つける、出典をたどる、過去の利用と点数を調べる、比べられる条件か判断する、という作業をつなぐ仕組みです。著者らは大きな記録集を監査し、多くの数値があっても同じ物差しで安全に比べられるとは限らないことを示しました。一方、検索そのものの正確さや実務での効果はまだ測っていません。

Benchmark Radarは、AIベンチマークの発見、成果物、モデル報告での採用、スコア観測、引用を、出典を保ったまま接続する検索・監査基盤である。目的はランキングの統合ではなく、候補検索から評価証拠の確認までを追跡可能にすることにある。

Benchmark Radarは、ベンチマーク探索を情報検索だけで終わらせず、成果物、採用履歴、数値観測、引用、日付根拠へ接続するシステムである。ソース単位の同一性を保持し、検索結果の根拠を表示し、スコア比較を尺度条件と評価プロトコルの確認へ分解する。論文はカタログ全件監査を示すが、検索品質や利用者の作業改善は検証していない。

Benchmark Radarは、AIベンチマークの継続的発見、カタログ検索、成果物・引用・モデル言及・スコア履歴の接続、固定版での再現検索を統合する。設計上の要点は、同一性リンクと集計上の統合を区別し、比較適格性を分析ごとに判定することにある。全件監査はデータの規模と欠損構造を記述するが、検索有効性、利用者成果、速度は評価対象外である。

Benchmark Radarは、AIベンチマークの日次発見、ソース別カタログ、モデル報告での言及、スコア履歴、引用・成果物を接続する検索・監査基盤である。ソース同一性と観測単位を保持し、候補検索と人手による適合性判断を分離する。

Benchmark Radarは、継続的なベンチマーク発見、ソース保持型カタログ、モデル報告での採用、スコア観測、引用、成果物を統一識別子で接続する。BM25Fによる説明可能な語彙検索と固定版のオフライン再現を提供し、比較適格性を分析単位で判定する。監査はカタログの構成を定量化するが、検索有効性や利用者成果は評価していない。

Benchmark Radarは、ベンチマークの継続的発見から証拠監査までを、ソース同一性を保持したデータモデル上で統合する。37ソースの収集、BM25F検索、レビュー済み同一性リンク、固定アーカイブ、全件監査を組み合わせる。主要な実証結果はカタログの規模と欠損・尺度構成に関する記述統計であり、検索性能、利用者成果、レイテンシの比較評価ではない。

著者をもっと詳しく知る(全8名)

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

全著者と所属

  1. Koutian Wu
    論文掲載時:Earth-Space-AI、Tacite AI
  2. Junjie Zhou
    論文掲載時:Hangzhou Dianzi University
  3. Ergan Shang
    論文掲載時:Carnegie Mellon University
  4. Jiayu Wang
    論文掲載時:Xi’an Jiaotong University
  5. Pengqian Han
    論文掲載時:The University of Auckland
  6. Junkai Wang
    論文掲載時:Tsinghua University
  7. Wanghan Xu
    論文掲載時:Shanghai Jiao Tong University
  8. Lin Shi
    論文掲載時:Cornell Tech

確認できた研究背景

Koutian Wu
所属
: 論文掲載時:Earth-Space-AI、Tacite AI
代表的な論文
: ESM-BENCH:AIエージェントが地球システムモデルの物理とコードを理解できるかを評価するベンチマーク。
関連情報
: 本研究を主導して原稿作成を担当し、初期収集パイプラインと複数ソースのデータ集約を実装した。
Junjie Zhou
所属
: 論文掲載時:Hangzhou Dianzi University
関連情報
: スコアアーカイブ監査を準備し、報告書の改訂に貢献した。
Ergan Shang
所属
: 論文掲載時:Carnegie Mellon University
代表的な論文
: LLM Evaluation on Unseen Questions:未見質問に対する文脈的・多次元IRTモデルを扱う評価研究。
関連情報
: 図を準備し、コピー編集に貢献した。
Jiayu Wang
所属
: 論文掲載時:Xi’an Jiaotong University
関連情報
: 先行研究確認の実例と、その裏付け資料に貢献した。
Pengqian Han
所属
: 論文掲載時:The University of Auckland
関連情報
: データ分析とコピー編集に貢献した。
Junkai Wang
所属
: 論文掲載時:Tsinghua University
関連情報
: レビューとコピー編集に貢献した。
Wanghan Xu
所属
: 論文掲載時:Shanghai Jiao Tong University
代表的な論文
: ResearchClawBench:自律的な科学研究を端から端まで評価するベンチマーク。
関連情報
: レビューとコピー編集に貢献した。
Lin Shi
所属
: 論文掲載時:Cornell Tech
代表的な論文
: Harbor adapters and Harbor-Index:エージェント評価の共通実行基盤と、29ベンチマークから選んだ82課題のメタデータセット。
関連情報
: 構想と方法論に貢献し、本研究に助言した。

なぜ注目されているか

取得時点でHugging Faceの207 upvotes、9コメント、著者参加が確認され、関連GitHubリポジトリは227 starsでした。

取得時点でHugging Faceの207 upvotes、9コメント、著者参加が確認され、関連GitHubリポジトリは227 starsでした。

取得時点でHugging Faceの207 upvotes、9コメント、著者参加が確認され、関連GitHubリポジトリは227 starsでした。

取得時点でHugging Faceの207 upvotes、9コメント、著者参加が確認され、関連GitHubリポジトリは227 starsでした。

取得時点でHugging Faceの207 upvotes、9コメント、著者参加が確認され、関連GitHubリポジトリは227 starsでした。

取得時点でHugging Faceの207 upvotes、9コメント、著者参加が確認され、関連GitHubリポジトリは227 starsでした。

取得時点でHugging Faceの207 upvotes、9コメント、著者参加が確認され、関連GitHubリポジトリは227 starsでした。

取得時点でHugging Faceの207 upvotes、9コメント、著者参加が確認され、関連GitHubリポジトリは227 starsでした。

取得時点でHugging Faceの207 upvotes、9コメント、著者参加が確認され、関連GitHubリポジトリは227 starsでした。

議論全体へのリンク
この読み方に出てくる言葉(4語)
BM25F

文書内の複数フィールドを別々に重み付けし、クエリ語との一致度を算出する検索法。

この論文では

名前一致とフレーズ一致に上限付きブーストを加え、ソース所属は順位要因にしない。

ソース記録

寄与元が提供した一つのカタログ項目。

この論文では

同一性リンクを付けても、観測と集計件数は統合しない。

マニフェスト

保存データのハッシュ、スキーマ版、来歴を記載し、再利用時の整合性確認に使う付随情報。

比較適格性

指定した要約や比較に含めるための尺度上の最低条件。

この論文では

百分率要約には単位明示、方向既知、0〜100内という三条件を要求する。

どんな問いに向き合ったか

ベンチマーク研究者やモデル開発者は、関連評価を検索した後、データとコードを見つけ、報告スコアの設定を確認する必要がある。既存情報が論文、リポジトリ、データセット、モデルカード、技術報告へ分散する中で、検索から証拠監査までを一貫した識別子で支えることが課題である。

従来の方法と課題

LLM Stats、OpenCompass、Artificial Analysisなどはランキング、評価基盤、モデル分析を提供する。しかし著者らは、新規ベンチマークからタスク成果物、後続モデルでの採用、具体的な評価条件まで追跡するには複数資源の横断が必要だったと位置付ける。

肝のアイデア

Benchmark Radarは、ソース記録の来歴を失わずに共通フィールドへ正規化し、レビュー済み同一性リンクで関連記録を接続する。欠損値を理由に記録を除去せず、関連記録の観測値も合算しない。これにより、候補集合の取得と、人間によるタスク適合性・比較可能性の判断を分離する。

どういうしくみか

日次発見は13の直接コネクタと24の一次フィードを使う。各実行は48時間窓を検索し、未来日付を除外し、件数とエラーを記録する。中核三ソースが正常な場合のみ公開する。検索はBM25Fに上限付きの名称・フレーズ一致ブーストを加え、一致語、欠落語、一致フィールド、スコア構成を返す。Web、CLI、HTTP、エクスポートは同じIDと応答形式を共有する。CLIは保存データのSHA-256、スキーマ版、来歴を検証し、固定版をオフラインで再検索できる。

どう確かめたか

全件監査はv0.11.0の1,283ソース記録をフィルターなしで処理した。数値観測は観測IDごとに一度だけ数え、モデルと引用文書も記録内のソースIDで重複排除した。百分率尺度の要約は、単位が明示され、改善方向が既知で、値が0〜100内の場合に限定した。ただし、テスト版、プロンプト、ツール、試行回数、評価者の一致は、この尺度判定に含まれない。

何が分かったか

著者らは790記録から12,916数値観測を確認し、493記録には数値がなかったと報告する。未採点493記録のうち464記録には論文、リポジトリ、データセットの少なくとも一つがあった。採点済み790記録中、百分率条件を満たしたのは82記録で、708記録は他尺度または未検証尺度だった。さらに公開日は615記録で既知、668記録で不明だった。スコアに付随するモデル発表日や文書公開日は評価実施日ではない。

どこまで使えるか

適用先は、評価設計前の先行研究探索、スコアの尺度・方向・引用・日付根拠の監査、固定データ版による再現検索である。未採点記録も成果物探索に利用できる。一方、意味的な言い換えを高再現率で取得する用途、検索性能の保証が必要な意思決定、異質な評価設定のスコアを追加確認なしで統合する用途には適さない。

限界と未解決の問い

クエリ単位の関連性判定がないため、検索精度と意味検索の改善幅は不明である。実例はWeb検索を併用し、管理されたベースラインを持たない。収集上限、要求失敗、識別子欠損、スナップショット日の差が網羅性へ影響する。能力分類は未検証であり、実行時間や対話レイテンシの比較測定も報告されていない。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

790の採点済み記録のうち百分率尺度の最低条件を通過したのは82記録で、通過後もプロトコル確認が必要だった。したがって、検索システムの出力を即座にランキングへ変換せず、単位、方向、版、プロンプト、ツール、試行回数、評価者、日付根拠を検査する段階を設ける設計が合理的である。ただし、その段階が判断品質を高めるか、調査時間とのトレードオフに見合うかは未評価である。