オープン語彙関係予測シーングラフ生成正例・未ラベル学習

RelateAnything:物体ラベルなしで任意の領域間関係をリアルタイム予測

領域の出所と述語語彙を推論時に差し替えられる、53Mパラメータの関係予測モデル

RelateAnything: Real-Time Open-Vocabulary Relation Prediction From Any Inputs

論文の書誌情報と関連リンク

概要

画像内の物体間関係を認識するシーングラフ生成は、従来、少数の固定関係語や特定の物体検出器に強く縛られていました。RelateAnythingは53Mパラメータのモデルで、物体ラベルを入力とせず、任意の検出器から得た領域対と推論時に渡した述語文字列群との類似度を直接照合するオープン語彙モデルです。著者報告によると、4つの外部データセットへの転移評価において、既存の比較モデルに対し平均再現率で2.3〜3.5倍を記録しました。ただし、学習に用いた430万件超の関係コーパスは人手監査のない生成データであること、評価述語自体は学習語彙に含まれ完全な未知概念への一般化は未検証であること、さらに実環境では検出器が両端の物体を見落とすと関係を回収できない上限(検証環境で69.6%)が存在することに留意が必要です。

Maëlic Neau
著者をもっと詳しく知る

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

Maëlic Neau
主な関心
: シーングラフ生成、オープン語彙関係予測、リアルタイム視覚モデル
代表的な論文
: IndoorVG:サービスロボティクス向けのシーングラフ生成を扱った先行研究、REACT:リアルタイムのシーングラフ生成における速度と精度の両立を扱った先行研究、REACT++:効率的なクロスアテンションによるリアルタイム・シーングラフ生成を扱った先行研究

なぜ注目されているか

2026年9月20日の取得時点で、Hugging Face Daily Papersでは3 upvotesと2件のコメントが確認され、関連GitHubリポジトリは288 starsを集めている。コメント本文は取得されておらず、反応の内容や評価傾向までは判断できない。

議論全体へのリンク

なぜ重要なのか

従来の関係認識システムでは、認識させたい述語を変更するたび、あるいは前段の物体検出器を更新するたびに、モデル全体の再学習や専用ヘッドの改修が必要でした。RelateAnythingが示した「物体ラベルを介さず領域特徴とテキスト埋め込みを直接照合する」設計が成立するなら、物体検出と関係推定を疎結合に分離できます。たとえば点検業務において、現場ごとに検出器を切り替えつつ、推論時に点検項目リストを文字列として柔軟に渡す運用形態が現実味を帯びます。ただし、本モデルは関係候補を多く拾う一方で誤検出も生じやすいため、偽陽性を厳しく嫌う業務への導入には慎重さが求められます。また、学習データ規模倍増の効果が同一データ内では大きく見えても転移先では約5分の1に縮小するという知見は、単一ベンチマークの数値だけで採否を決める評価方針の見直しを促します。

この記事に出てくる言葉(4語)
述語(Predicate)

二つの物体の間に成り立つ位置関係や動作、所属関係を表す言葉。

この論文では

モデル内部の固定クラスではなく、推論時に文字列一覧として外部から与えられる関係ラベル。

平均再現率(mR@50)

mR@50

予測上位50件を対象に、頻出語と希少語の偏りを抑えて述語カテゴリごとに算出し平均した再現率。

この論文では

特定コーパスの頻度偏りに左右されず、外部データセットへの転移性能を公平に測る主指標。

正例・未ラベル学習

正解とラベルなし候補のみがある環境で、注釈のない候補を一律に不正解と決めつけずに学ぶ手法。

この論文では

注釈漏れの真の関係を誤って負例として罰しないよう、条件付き確率に基づき負例ペナルティを割り引く損失設計。

ペア検出上限(pair-recall ceiling)

関係の両端となる二つの物体が、前段の検出器によって正しく検出された割合。

この論文では

関係予測モデルがどれほど優れていても、両端点が検出されなければ関係を回収できないため、実用上の再現率の上限を規定する。

1. 読む前に知っておきたいこと

従来のシーングラフ生成が抱えていた三つの制約

画像に写る物体同士の関係を「主語・述語・目的語」の組として読み取る技術はシーングラフ生成と呼ばれます。従来のモデルは、特定データセットの50〜56種類程度の固定述語に縛られていました。また、関係を予測する処理部が「人」や「自転車」といった物体のクラス名(物体ラベル)を直接入力として受け取る構造になっており、特定の物体検出器と強く結合していました。

著者らは、この従来構成がオープンな語彙へ展開できなかった背景として三つの障壁を挙げています。第一に、自由なテキストで記述され、かつ品質が検証された大規模な関係データセットが存在しなかった点です。第二に、物体のクラス名に依存する構造では、学習時に含まれなかった未知の語彙や、クラス名を持たない領域を受け入れられない点です。第三に、従来の評価指標が学習データの頻度分布との一致を過剰に報いるため、語彙を広げて多様な関係を予測すると、かえってスコアが低下する(性能後退と判定される)という測定上の欠陥があった点です。

業務の点検リストにたとえるオープン語彙の考え方

オープン語彙とは、学習済みの固定クラスに限定されず、推論時に与えられた任意の単語リストに基づいて認識を行う枠組みです。これを業務にたとえると、物流倉庫や製造現場における安全点検の自動化をイメージするとわかりやすいでしょう。

カメラ映像に映る二つの領域(作業員と台車など)に対し、あらかじめ決められた少数の選択肢から選ぶのではなく、点検担当者が現場基準に合わせて作成した確認項目リスト(「押している」「積載している」「隣にある」など)を文字列として渡し、各項目が画像と合致する度合いを判定させる使い方です。RelateAnythingでは、述語の分類体系をモデル内部から切り離し、外部から推論時に投入する入力情報へと位置づけ直しています。

ただし、この点検リストのたとえには限界があります。人間は業務マニュアルの意図や物理常識を理解して現場を判断しますが、本モデルは画像領域から抽出した視覚特徴と単語テキスト特徴の類似度を計算しているにすぎません。モデル自身が論理的な推論を行っているわけではなく、学習した特徴空間の範囲内で照合しているにすぎない点には留意が必要です。

前段の検出器と評価指標に潜む前提条件

この手法を実環境で検討する際には、見落としてはならない前提条件があります。第一に、関係予測は「画像内の領域がすでに与えられている」ことを前提に動作する点です。二つの物体の関係を正しく答えるには、前段の検出器が主語と目的語の両方を正確に捉えていなければなりません。どちらか一方でも検出から漏れれば、関係モデルがいかに優れていても関係を拾い上げることは不可能です。この限界値は「ペア検出上限」と呼ばれます。

第二に、評価指標に対する前提の転換です。特定の学習データに対する再現率だけを測定していると、そのデータで頻出する関係(たとえば「〜の上にある」など)を過剰に出力するモデルが高得点を得てしまいます。しかし、異なるカメラ環境や新しい現場へ適用する際には、頻出語以外の希少な関係を捉えられるか、意図的な誤答を見分けられるか、そして未知データへ転移できるかを多面的に検証する必要があります。

2. 手法と評価

RelateAnythingの設計:物体ラベルを排除した二枝アーキテクチャ

RelateAnythingは53Mパラメータで構成されています。入力は448×448ピクセルの画像、任意の出所から得られた領域対、そして推論時に文字列として与えられる述語リストです。物体のクラス名は入力しません。

画像は視覚バックボーン(DINOv3)に入力され、深さの異なる三段階のパッチ特徴を正規化して統合します。領域特徴は、座標のフーリエ表現から作ったクエリを用い、全パッチ特徴を柔らかく集約(ソフトプーリング)して抽出します。次に、主語領域、目的語領域、和集合領域、接触領域、19次元の幾何特徴を連結し、512次元の領域対表現を生成します。さらに、領域対同士の自己注意、全体文脈を与えるシーントークンとの交差注意、領域外も参照できる変形可能サンプリングを組み合わせ、局所接触と周辺文脈を統合します。サンプラーは幾何的妥当性で400対、学習済み関連度で128対へ絞り込み、注釈正例の99.79%を保持したと報告されています。

スコア計算は、位置関係を担う「空間枝」と、見た目の振る舞いを担う「意味枝」に分かれます。両経路はそれぞれ述語テキスト埋め込みとのコサイン類似度を計算し、テキスト埋め込みのみから決まる「述語依存ゲート」で統合されます。物体ラベルを参照しないため、任意の検出器やセグメンテーション手法と組み合わせが可能です。

反意語の分離と正例・未ラベル学習による訓練基盤

推論時に自由な文字列を受け入れるため、テキスト空間の改良と注釈漏れへの対策が施されています。

既存の対照学習テキストエンコーダでは、「上」と「下」のような反意語がコサイン類似度0.95前後という極めて近い位置に埋め込まれる問題がありました。そこで著者らは、反意語反発、同義語凝集、近傍保存を含む目的関数で512次元の専用テキストエンコーダを蒸留しました。この結果、同義語と反意語の分離AUCは0.854から0.989へ向上し、反意語間の平均コサイン類似度は0.92から0.09へ低下し、同義語間の類似度(0.71)を維持したと報告されています。

また、大規模な関係データでは、真実であっても注釈が抜けている候補が多発します。これを機械的に負例と見なすとモデルが不当に罰せられるため、注釈付き同義語を正例とし、未注釈述語の負例寄与を推定条件付き確率で割り引く「正例・未ラベル学習」を採用しました。ただし方向の逆語は割り引きません。

訓練には、番号付き矩形枠マーカーを見せたVLMの3段階生成と、物理的矛盾を排除する幾何ゲート(候補の11.3%を拒否)を用いて構築した生成コーパス「RA-4M」(47万4413画像、1万102述語、428万2531関係)を使用し、漏洩除去済みVisual GenomeやHICO-DETと混合して12エポック学習を行いました。

OV-SGG-Bench:単一の再現率に頼らない6軸評価設計

単一コーパス内での再現率に偏った評価を脱するため、著者らは6本の評価軸からなる「OV-SGG-Bench」を構築しました。

  1. クロスデータセット転移(A1):学習に用いていない4つの外部データ(VG150、PSG、IndoorVG、HICO-DETゼロショット)に対し、正解領域を与えた条件で上位50件の平均再現率(mR@50)を測定。
  2. 明示的な負例(A2):正誤が明確なデータセット「Haystack」を用い、平均適合率(fAP)、希少述語適合率、ROC-AUCを測定。
  3. 1万9103語の開放語彙(A3):広範な語彙における関係予測を検証。
  4. 共通検出器モード(A4):実用を想定し、共通のYOLO-World検出領域を与えて関係再現率とペア検出上限を測定。
  5. グラフ情報量(A5):出力グラフ全体の情報量とVLM判定器による受容性を評価。
  6. 敵対的空間負例(A6):紛らわしい位置関係を含む「SpatialSense」でマクロAUCを測定。

比較対象には、同等規模のオープン語彙モデル「OvSGTR」を中心に据え、一部で3B規模の視覚言語モデルとも比較しています。

3. 結果と限界

著者報告による性能比較:転移性と希少語における優位

著者らの報告によると、RelateAnythingは外部データへの転移評価において比較対象を上回りました。

正解領域を用いた転移評価(A1)の上位50件平均再現率(mR@50)は、VG150で28.2(OvSGTRは10.4)、PSGで30.6(同8.8)、IndoorVGで29.5(同12.8)、HICO-DETゼロショットで12.7(同4.5)となり、既存手法の2.3〜3.5倍の数値を達成しました。また、53Mパラメータでありながら、3B規模の視覚言語モデルのスコアを上回ったと述べています。

明示的負例を含むHaystack評価(A2)でも、平均適合率で72.6対52.1、希少述語適合率で70.7対44.6、ROC-AUCで93.7対83.9と優位を示しました。ただし正解付きセルのカバー率はOvSGTRの100%に対し89.0%でした。共通のYOLO-World領域を用いた評価(A4)でも、PSGのmR@50は20.5対6.2、希少語再現率は17.0対1.2と差を維持しました。推論速度はコンパイル済みバッチサイズ1で、A40で20.3ミリ秒、H100で18.1ミリ秒と報告されています。

同一分布の過大評価と空間推論における否定的な証拠

一方で、実験結果は重要な限界も示しています。

第一に、学習データ倍増時のスケーリング効果の偏りです。同一分布内では再現率(R@50)が+15%、平均再現率(mR@50)が+56%と大きく伸びたのに対し、外部転移先での伸びはR@50で+2.5〜3.8%、mR@50で+9.9〜11.9%にとどまりました。著者は、同一分布内の測定が転移効果を約5倍過大評価すると結論づけています。

第二に、空間推論(A6)の疑義です。SpatialSenseのマクロAUCは69.0でOvSGTRの59.1を上回ったものの、画像を見ず矩形枠の座標情報のみを用いる既存手法の基準値が68.8%を記録しており(別集計の対応値は62.5%)、視覚的な空間理解の証拠とは言えず幾何事前の影響を排除できません。

第三に、生成グラフ全体の受容性(A5)です。RelateAnythingは関係エッジを多く出力するため情報量指標では優れるものの、実運用時のグラフ長でVLMによる評価を行うと、判定器はOvSGTRを好む傾向が見られ、単一関係の受容率もOvSGTRがわずかに上回りました。偽陽性を嫌う用途では短く絞られたグラフが好まれる場合があります。

残された未検証領域と実運用上の境界条件

実務での意思決定に関わる境界条件も示されています。

まず、学習用コーパス「RA-4M」には人手監査による精度推定がなく、視線など幾何で検証できない関係、誤った物体への結びつけ、接触誤認が残っています。また、評価データの画像や様式は未見でも、述語文字列自体は学習語彙に含まれており、完全な未知概念への一般化は未検証です。

さらに運用上、前段の検出器が性能を制限します。共通検出器実験でのペア検出上限は69.6%であり、両端点が検出されなければ関係モデル単独で関係を回収することはできません。加えて、実験の一部は単一シード(測定ノイズ床1.3%)に基づいており、約20ミリ秒という処理速度もコンパイル済み環境の数値であって、精度測定時のeager実行条件とは異なります。

適合するのは、既存検出器が返す領域へ再学習なしで用途別述語を付与したい場面や、希少語・負例耐性を多面的に評価したい研究用途です。反対に、誤検出を極度に嫌う業務、物体の検出漏れが多い環境、人手監査された精度保証が必須の用途には適していません。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

学習データを倍増させた際の改善幅が、同一分布内では平均再現率で+56%と大きく現れたのに対し、外部データへの転移先では+9.9〜11.9%にとどまり、同一分布内の測定が転移時の伸びを約5倍過大評価するという著者の分析、ならびに前段の物体検出器が両端の物体を捉えられた割合(検証環境で69.6%)が関係回収の上限になるという測定結果は、視覚関係モデルの選定方法に再考を促します。もしこの傾向が他モデルにも通じるなら、開発データ単独の再現率スコアを根拠に導入を決める従来の慣行を改め、未知データへの転移指標、明示的負例に対する適合率、および検出器が課すペア検出上限を同一の表で照合する運用設計へ移行できる可能性があります。ただし、本研究の空間関係スコアには画像を見ない座標情報だけで説明できる成分が含まれ、学習用コーパスの人手監査も未実施であるため、この選定基準が実際の業務現場や異なる検出器の組み合わせでも同様に機能するかは、個別の実環境における追試が必要です。

ホーム画面に追加する

  1. Safariでこのページを開く
  2. ページメニューから「共有」をタップ
  3. 「ホーム画面に追加」を選択
  4. 「Webアプリとして開く」をオンにして「追加」をタップ

追加後は、ホーム画面のアイコンからSingularity Lensを開けます。