Tier 1: 世界のルールを不可逆に変えた原典マルチモーダルHF 310 votes
マルチモーダル対照学習ゼロショット認識

CLIP:自然言語による教師あり学習を用いた汎用視覚モデルの獲得

4億組の画像・テキスト対から対照学習(InfoNCE)で共通埋め込み空間を学習し、ゼロショット画像認識とあらゆるマルチモーダルAIの基盤を確立

Learning Transferable Visual Models From Natural Language Supervision

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

CLIPは、正しい画像と説明文を近づけ、間違った組み合わせを遠ざけるように学びます。分類するときは、候補名を文章にして画像と最も近いものを選ぶため、新しい分類用の正解画像で学び直さずに試せます。 研究の問い、方法、主結果、主要な注意点に絞ります。

CLIPは、正しい画像と説明文を近づけ、間違った組み合わせを遠ざけるように学びます。分類するときは、候補名を文章にして画像と最も近いものを選ぶため、新しい分類用の正解画像で学び直さずに試せます。 背景から評価方法、使える範囲まで順に見ます。

CLIPは、正しい画像と説明文を近づけ、間違った組み合わせを遠ざけるように学びます。分類するときは、候補名を文章にして画像と最も近いものを選ぶため、新しい分類用の正解画像で学び直さずに試せます。 前提や評価の弱点、まだ答えのない点まで丁寧に確かめます。

CLIPは4億組の画像・テキスト対から二つのエンコーダを対照学習し、共有埋め込み空間の類似度でzero-shot classificationを行います。原論文はImageNetと分布シフトを含む多数のデータセットで転移性能を評価しました。 研究課題、中心機構、代表結果、主要な制約を要約します。

CLIPは4億組の画像・テキスト対から二つのエンコーダを対照学習し、共有埋め込み空間の類似度でzero-shot classificationを行います。原論文はImageNetと分布シフトを含む多数のデータセットで転移性能を評価しました。 先行法との差、処理の流れ、評価条件、適用範囲まで確認します。

CLIPは4億組の画像・テキスト対から二つのエンコーダを対照学習し、共有埋め込み空間の類似度でzero-shot classificationを行います。原論文はImageNetと分布シフトを含む多数のデータセットで転移性能を評価しました。 設計上の仮定、実験条件、別の解釈、未解決点まで検討します。

CLIPはimage encoderとtext encoderを対称InfoNCE objectiveで学習し、class promptのtext embeddingをclassifier weightとしてzero-shot transferします。原論文は30以上のdatasetでlinear probe、zero-shot、分布シフト耐性を比較しています。 research question、method、headline result、principal caveatを原論文用語で整理します。

CLIPはimage encoderとtext encoderを対称InfoNCE objectiveで学習し、class promptのtext embeddingをclassifier weightとしてzero-shot transferします。原論文は30以上のdatasetでlinear probe、zero-shot、分布シフト耐性を比較しています。 prior work、formulation、evaluation protocol、scopeを追います。

CLIPはimage encoderとtext encoderを対称InfoNCE objectiveで学習し、class promptのtext embeddingをclassifier weightとしてzero-shot transferします。原論文は30以上のdatasetでlinear probe、zero-shot、分布シフト耐性を比較しています。 assumption、ablationの有無、external validity、open questionまで精査します。

Alec RadfordOpenAI
Ilya SutskeverOpenAI / SSI
著者をもっと詳しく知る

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

所属
: OpenAI
学歴
: Olin College of Engineering 学士
経歴
: Indico、OpenAI Lead Researcher
研究の系譜
: Ilya Sutskever
代表的な論文
: DCGAN、GPT-1、GPT-2、GPT-3、Whisper
関連情報
: GPTシリーズの生みの親であり、CLIPやWhisperを含むOpenAIの基礎モデル研究を先導
所属
: OpenAI / SSI
学歴
: University of Toronto 博士、Geoffrey Hintonの門下生
経歴
: Google Brain、OpenAI 共同創業者・Chief Scientist
研究の系譜
: Geoffrey Hinton(深層学習の父)
代表的な論文
: AlexNet、Sequence to Sequence、Transformer、GPT-4
関連情報
: OpenAIの共同創業者兼チーフサイエンティストとしてCLIPの設計を統括

なぜ歴史的イノベーションなのか

自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典

自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典

自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典

自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典

自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典

自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典

自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典

自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典

自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典

コミュニティの評価・歴史的インパクト(1件)
  • 4億組の画像・テキスト対から対照学習(InfoNCE)で共通埋め込み空間を学習し、ゼロショット画像認識とあらゆるマルチモーダルAIの基盤を確立

    原文を見る ↗
この読み方に出てくる言葉(7語)
画像エンコーダ

画像を比較可能な数値の並びへ変換するモデル。 この論文では処理の流れの中で役割を区別して扱う。

テキストエンコーダ

文章を比較可能な数値の並びへ変換するモデル。 この論文では処理の流れの中で役割を区別して扱う。

対照学習

正しい画像と文章の組を近づけ、誤った組を遠ざける学習法。 この論文では処理の流れの中で役割を区別して扱う。

ゼロショット

対象課題の正解例で追加学習せずに分類する設定。 この論文では処理の流れの中で役割を区別して扱う。

埋め込み

画像や文章の意味を比較するためのベクトル表現。 この論文では処理の流れの中で役割を区別して扱う。

コサイン類似度

二つのベクトルが同じ方向を向く度合いを測る値。 この論文では処理の流れの中で役割を区別して扱う。

ImageNet

多数の物体カテゴリを含む代表的な画像分類データセット。 この論文では処理の流れの中で役割を区別して扱う。

どんな問いに向き合ったか

従来のコンピュータビジョンは「ImageNetの固定された1000クラス」など閉じたラベルセットに縛られており、新しい概念を認識するたびに再学習とアノテーションが必要だった。

この問いに対し、提案手法と比較手法を同じ評価条件で比べる。

従来の方法と課題

固定カテゴリに対するクロスエントロピー分類、ImageNet事前学習モデルの下流ファインチューニング。

提案の差分は、この先行手法の制約に対して読む必要がある。

肝のアイデア

CLIPは4億組の画像・テキスト対から二つのエンコーダを対照学習し、共有埋め込み空間の類似度でzero-shot classificationを行います。原論文はImageNetと分布シフトを含む多数のデータセットで転移性能を評価しました。

この中心アイデアを、先行法との差と評価結果を分けて確認する。

どういうしくみか

WebImageText(400M)、ViT-B/16、Transformer、対称対照学習、ゼロショットプロンプト推論。

中心となる流れは次の通り。

  1. 1. バッチサイズ N=32768N = 32768 内の画像 IiI_i とテキスト TjT_j に対し、それぞれResNet/ViTおよびTransformerで埋め込みベクトルを計算
  2. 2. コサイン類似度行列 Sij=IiTjIiTj/τS_{ij} = \frac{I_i \cdot T_j}{\|I_i\| \|T_j\|} / \tau を計算
  3. 3. 画像からテキスト、テキストから画像の双方向クロスエントロピー損失(対称InfoNCE)を最小化
  4. 4. 下流タスクでは「A photo of a {label}」というプロンプトのテキスト埋め込みと画像埋め込みの内積でゼロショット分類。

どう確かめたか

原論文に記録された評価結果は次の通り。

  1. 追加学習なしのゼロショットCLIP(ResNet-50)が、教師ありResNet-50(76.2%)と同等のImageNet精度を達成(指標はImageNet Top-1 Accuracy、値は76.2%、比較対象はSupervised ResNet-50 (76.2%))。これは著者報告の結果として読む必要がある。
  2. 分布シフトベンチマークImageNet-Aにおいて、教師ありモデルの数倍の耐久スコアを記録(指標はImageNet-A Top-1、値は77.1%、比較対象はSupervised Model (~2.0%))。これは著者報告の結果として読む必要がある。

評価では、記載された比較対象と指標を固定したうえで提案手法との差を確認している。

何が分かったか

著者らが報告した主な結果は次の通り。

  1. ImageNetゼロショット精度76.2%
  2. 30以上のタスクでの高汎化性能。

これらは原論文の著者報告であり、比較対象、データ、指標をそろえた範囲で解釈する。

どこまで使えるか

この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。

限界と未解決の問い

確認すべき限界は次の通り。

  1. Fine-grainedな属性バインディング(色の取り違え等)の脆弱性
  2. OCRや数理グラフ認識の精度の低さ。

評価対象と異なるデータ、規模、計算条件へ結論を広げるには追加検証が必要になる。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

著者らは、自然言語のクラス名を使うゼロショット分類が、ImageNetで教師ありResNet-50に近い精度へ達したと報告しています。同じ制約がある場面で再現できるなら、分類名を文章で与える方式は、固定ラベルごとの追加学習を減らせる可能性があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。数え上げや位置関係に弱く、Web由来データの偏りや不適切な対応関係も表現へ入りえます。