CLIP:自然言語による教師あり学習を用いた汎用視覚モデルの獲得
4億組の画像・テキスト対から対照学習(InfoNCE)で共通埋め込み空間を学習し、ゼロショット画像認識とあらゆるマルチモーダルAIの基盤を確立
Learning Transferable Visual Models From Natural Language Supervision
論文の書誌情報と関連リンク
- 発表日
- 掲載先
- ICML 2021 / OpenAI
読み方の2つの軸
現在:しくみ × 全体像
語彙 使うことば・数式・例え方
深さ 研究のどこまで読むか
この2本は、本文下のスライダーからいつでも変更できます。
概要
CLIPは、正しい画像と説明文を近づけ、間違った組み合わせを遠ざけるように学びます。分類するときは、候補名を文章にして画像と最も近いものを選ぶため、新しい分類用の正解画像で学び直さずに試せます。 研究の問い、方法、主結果、主要な注意点に絞ります。
CLIPは、正しい画像と説明文を近づけ、間違った組み合わせを遠ざけるように学びます。分類するときは、候補名を文章にして画像と最も近いものを選ぶため、新しい分類用の正解画像で学び直さずに試せます。 背景から評価方法、使える範囲まで順に見ます。
CLIPは、正しい画像と説明文を近づけ、間違った組み合わせを遠ざけるように学びます。分類するときは、候補名を文章にして画像と最も近いものを選ぶため、新しい分類用の正解画像で学び直さずに試せます。 前提や評価の弱点、まだ答えのない点まで丁寧に確かめます。
CLIPは4億組の画像・テキスト対から二つのエンコーダを対照学習し、共有埋め込み空間の類似度でzero-shot classificationを行います。原論文はImageNetと分布シフトを含む多数のデータセットで転移性能を評価しました。 研究課題、中心機構、代表結果、主要な制約を要約します。
CLIPは4億組の画像・テキスト対から二つのエンコーダを対照学習し、共有埋め込み空間の類似度でzero-shot classificationを行います。原論文はImageNetと分布シフトを含む多数のデータセットで転移性能を評価しました。 先行法との差、処理の流れ、評価条件、適用範囲まで確認します。
CLIPは4億組の画像・テキスト対から二つのエンコーダを対照学習し、共有埋め込み空間の類似度でzero-shot classificationを行います。原論文はImageNetと分布シフトを含む多数のデータセットで転移性能を評価しました。 設計上の仮定、実験条件、別の解釈、未解決点まで検討します。
CLIPはimage encoderとtext encoderを対称InfoNCE objectiveで学習し、class promptのtext embeddingをclassifier weightとしてzero-shot transferします。原論文は30以上のdatasetでlinear probe、zero-shot、分布シフト耐性を比較しています。 research question、method、headline result、principal caveatを原論文用語で整理します。
CLIPはimage encoderとtext encoderを対称InfoNCE objectiveで学習し、class promptのtext embeddingをclassifier weightとしてzero-shot transferします。原論文は30以上のdatasetでlinear probe、zero-shot、分布シフト耐性を比較しています。 prior work、formulation、evaluation protocol、scopeを追います。
CLIPはimage encoderとtext encoderを対称InfoNCE objectiveで学習し、class promptのtext embeddingをclassifier weightとしてzero-shot transferします。原論文は30以上のdatasetでlinear probe、zero-shot、分布シフト耐性を比較しています。 assumption、ablationの有無、external validity、open questionまで精査します。
著者をもっと詳しく知る
論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。
- 所属
- : OpenAI
- 学歴
- : Olin College of Engineering 学士
- 経歴
- : Indico、OpenAI Lead Researcher
- 研究の系譜
- : Ilya Sutskever
- 代表的な論文
- : DCGAN、GPT-1、GPT-2、GPT-3、Whisper
- 関連情報
- : GPTシリーズの生みの親であり、CLIPやWhisperを含むOpenAIの基礎モデル研究を先導
- 所属
- : OpenAI / SSI
- 学歴
- : University of Toronto 博士、Geoffrey Hintonの門下生
- 経歴
- : Google Brain、OpenAI 共同創業者・Chief Scientist
- 研究の系譜
- : Geoffrey Hinton(深層学習の父)
- 代表的な論文
- : AlexNet、Sequence to Sequence、Transformer、GPT-4
- 関連情報
- : OpenAIの共同創業者兼チーフサイエンティストとしてCLIPの設計を統括
なぜ歴史的イノベーションなのか
自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典
自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典
自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典
自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典
自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典
自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典
自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典
自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典
自然言語監督による対照学習で視覚と言語の共通空間を構築しゼロショット画像認識を確立した原典
コミュニティの評価・歴史的インパクト(1件)
- 原文を見る ↗
4億組の画像・テキスト対から対照学習(InfoNCE)で共通埋め込み空間を学習し、ゼロショット画像認識とあらゆるマルチモーダルAIの基盤を確立
この読み方に出てくる言葉(4語)
- 画像エンコーダ
画像を比較可能な数値の並びへ変換するモデル。
- テキストエンコーダ
文章を比較可能な数値の並びへ変換するモデル。
- 対照学習
正しい画像と文章の組を近づけ、誤った組を遠ざける学習法。
- ゼロショット
対象課題の正解例で追加学習せずに分類する設定。
どんな問いに向き合ったか
画像分類は通常、決められた分類名ごとに正解画像を集めて学習します。新しい分類を追加するたびに同じ作業が必要になる問題を、画像と自然言語の組から減らせるかが問いです。
肝のアイデア
CLIPは、正しい画像と説明文の組を近づけ、同じ一まとまりの中にある別の組を遠ざけます。分類時には候補名を短い文章にし、画像に最も近い文章を答えとして選びます。
どう確かめ、何が分かったか
著者らは4億組の画像と文章で学習し、30を超えるデータセットで追加学習なしの分類を評価しました。ImageNetではゼロショットで76.2%と報告されています。
注意すべきこと
数を数えることや上下左右などの位置関係は弱く、候補文の書き方でも結果が変わります。Webから集めたデータの偏りや不適切な内容も表現に入りえます。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
論文では、自然言語のクラス名を使うゼロショット分類が、ImageNetで教師ありResNet-50に近い精度へ達したと報告しています。この結果が対象に近い条件でも確かめられるなら、分類名を文章で与える方式は、固定ラベルごとの追加学習を減らせる可能性があります。ただし、数え上げや位置関係に弱く、Web由来データの偏りや不適切な対応関係も表現へ入りえます。
この読み方に出てくる言葉(7語)
- 画像エンコーダ
画像を比較可能な数値の並びへ変換するモデル。
- テキストエンコーダ
文章を比較可能な数値の並びへ変換するモデル。
- 対照学習
正しい画像と文章の組を近づけ、誤った組を遠ざける学習法。
- ゼロショット
対象課題の正解例で追加学習せずに分類する設定。
- 埋め込み
画像や文章の意味を比較するためのベクトル表現。
- コサイン類似度
二つのベクトルが同じ方向を向く度合いを測る値。
- ImageNet
多数の物体カテゴリを含む代表的な画像分類データセット。
どんな問いに向き合ったか
画像分類は通常、決められた分類名ごとに正解画像を集めて学習します。新しい分類を追加するたびに同じ作業が必要になる問題を、画像と自然言語の組から減らせるかが問いです。
著者らは提案手法と比較手法を同じデータと指標で比べ、この問いを検証しました。
従来の方法と課題
従来の画像分類は、あらかじめ決めた分類名ごとに正解画像を集めて学習し、新しい用途ではそのモデルを追加学習する方法が中心でした。
肝のアイデア
CLIPは、正しい画像と説明文の組を近づけ、同じ一まとまりの中にある別の組を遠ざけます。分類時には候補名を短い文章にし、画像に最も近い文章を答えとして選びます。
この中心アイデアを、先行法との差と評価結果を分けて確認する。
どういうしくみか
画像を数値の並びに変えるモデルと、文章を同じ種類の数値へ変えるモデルを同時に学習します。一回の学習では正しい組の近さを上げ、誤った組の近さを下げます。分類時には「ある分類名の写真」のような候補文を作り、画像との近さを比べます。
どう確かめたか
原論文に記録された評価結果は次の通り。
- 追加学習なしのゼロショットCLIP(ResNet-50)が、教師ありResNet-50(76.2%)と同等のImageNet精度を達成(指標はImageNet Top-1 Accuracy、値は76.2%、比較対象はSupervised ResNet-50 (76.2%))。これは著者報告の結果として読む必要がある。
- 分布シフトベンチマークImageNet-Aにおいて、教師ありモデルの数倍の耐久スコアを記録(指標はImageNet-A Top-1、値は77.1%、比較対象はSupervised Model (~2.0%))。これは著者報告の結果として読む必要がある。 評価では、記載された比較対象と指標を固定したうえで提案手法との差を確認している。
何が分かったか
著者らは4億組の画像と文章で学習し、30を超えるデータセットで追加学習なしの分類を評価しました。ImageNetではゼロショットで76.2%と報告されています。
これらは原論文の著者報告であり、比較対象、データ、指標をそろえた範囲で解釈する。
どこまで使えるか
この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。
限界と未解決の問い
確認すべき限界は次の通り。
- 微細な空間関係(例:左にあるか右にあるか)の弁別精度
- 複雑な合成推論タスクでの限界。 評価対象と異なるデータ、規模、計算条件へ結論を広げるには追加検証が必要になる。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
論文では、自然言語のクラス名を使うゼロショット分類が、ImageNetで教師ありResNet-50に近い精度へ達したと報告しています。同じ制約がある場面で再現できるなら、分類名を文章で与える方式は、固定ラベルごとの追加学習を減らせる可能性があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。数え上げや位置関係に弱く、Web由来データの偏りや不適切な対応関係も表現へ入りえます。
この読み方に出てくる言葉(8語)
- 画像エンコーダ
画像を比較可能な数値の並びへ変換するモデル。
- テキストエンコーダ
文章を比較可能な数値の並びへ変換するモデル。
- 対照学習
正しい画像と文章の組を近づけ、誤った組を遠ざける学習法。
- ゼロショット
対象課題の正解例で追加学習せずに分類する設定。
- 埋め込み
画像や文章の意味を比較するためのベクトル表現。
- コサイン類似度
二つのベクトルが同じ方向を向く度合いを測る値。
- ImageNet
多数の物体カテゴリを含む代表的な画像分類データセット。
- プロンプト
分類名を自然な文章としてモデルへ与える入力。
問題設定と前提
画像分類は通常、決められた分類名ごとに正解画像を集めて学習します。新しい分類を追加するたびに同じ作業が必要になる問題を、画像と自然言語の組から減らせるかが問いです。
ここでの結論は、原論文が使ったデータ、モデル規模、比較条件を前提とします。条件が変われば、性能と計算量の関係も測り直す必要があります。
関連研究の中での位置づけ
従来の画像分類は、あらかじめ決めた分類名ごとに正解画像を集めて学習し、新しい用途ではそのモデルを追加学習する方法が中心でした。
この違いを踏まえ、何を共有・圧縮・追加したのかと、どの条件で結果を比べたのかを分けて読みます。
提案手法の全体像
CLIPは、正しい画像と説明文の組を近づけ、同じ一まとまりの中にある別の組を遠ざけます。分類時には候補名を短い文章にし、画像に最も近い文章を答えとして選びます。
次節では、入力から出力までに何を更新し、どの部分の計算や学習を変えたのかを整理する。
定式化と設計判断
画像を数値の並びに変えるモデルと、文章を同じ種類の数値へ変えるモデルを同時に学習します。一回の学習では正しい組の近さを上げ、誤った組の近さを下げます。分類時には「ある分類名の写真」のような候補文を作り、画像との近さを比べます。
この流れの各段階を分けて考えると、どこで情報を減らし、どこで結果を確かめる必要があるかが見える。論文に記録されていない細かな設定は推測せず、評価条件と合わせて読む。
学習・推論・実験条件
原論文に記録された評価結果は次の通り。
- 追加学習なしのゼロショットCLIP(ResNet-50)が、教師ありResNet-50(76.2%)と同等のImageNet精度を達成(指標はImageNet Top-1 Accuracy、値は76.2%、比較対象はSupervised ResNet-50 (76.2%))。これは著者報告の結果として読む必要がある。
- 分布シフトベンチマークImageNet-Aにおいて、教師ありモデルの数倍の耐久スコアを記録(指標はImageNet-A Top-1、値は77.1%、比較対象はSupervised Model (~2.0%))。これは著者報告の結果として読む必要がある。 既存データに明記されていない訓練設定や推論設定は補わない。その不足は、結果を別環境で再現するときの確認事項として残る。
評価設計
評価の根拠は、論文が選んだデータセット、指標、比較対象にある。 原論文に記録された評価結果は次の通り。
- 追加学習なしのゼロショットCLIP(ResNet-50)が、教師ありResNet-50(76.2%)と同等のImageNet精度を達成(指標はImageNet Top-1 Accuracy、値は76.2%、比較対象はSupervised ResNet-50 (76.2%))。これは著者報告の結果として読む必要がある。
- 分布シフトベンチマークImageNet-Aにおいて、教師ありモデルの数倍の耐久スコアを記録(指標はImageNet-A Top-1、値は77.1%、比較対象はSupervised Model (~2.0%))。これは著者報告の結果として読む必要がある。 指標が測る性質と、実利用で必要な性質が一致するかは分けて判断する必要がある。
何が分かったか
著者らが報告した主な結果は次の通り。
- ゼロショットImageNetトップ1精度76.2%(教師ありResNet-50匹敵)
- ImageNet-Aでの精度低下を教師ありモデルの数分の一に抑制
- 30以上のビジョンデータセットでの強力な転移性能。 これらは原論文の著者報告であり、後続研究による独立検証とは区別する。
アブレーションと失敗例
確認すべき限界は次の通り。
- 空間的・構文的関係(Spatial Reasoning)の理解不足(Bag-of-words的傾向)
- ピクセル精度の密な予測(セグメンテーションや物体検出)への直接適用の困難さ。 正典データに独立したアブレーション結果が記録されていない要素については、各構成要素の寄与を数値で分離できない。失敗条件の範囲も、記録された限界を超えて推測しない。
別の解釈と評価上の注意
報告された改善は提案全体を支持するが、評価条件が限定される場合、特定の構成要素、データ、計算量の寄与を完全には切り分けられない。別の比較条件でも差が残るかが、より強い解釈に必要になる。 この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。
限界と未解決の問い
確認すべき限界は次の通り。
- 空間的・構文的関係(Spatial Reasoning)の理解不足(Bag-of-words的傾向)
- ピクセル精度の密な予測(セグメンテーションや物体検出)への直接適用の困難さ。 数え上げ(Counting)や空間的位置関係(上・下・左右)の把握の弱さ。 Webスクレイピングデータに含まれるバイアスや不適切なコンテンツの埋め込み。 性能値だけでは、評価外の分布、規模、資源条件での頑健性までは示せない。
残された問い
残る問いは、数え上げ(Counting)や空間的位置関係(上・下・左右)の把握の弱さをどの条件まで解消できるかである。 同一条件での追試、異なる規模やデータでの比較、構成要素ごとの切り分けが、結論の適用範囲を明確にする。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
論文では、自然言語のクラス名を使うゼロショット分類が、ImageNetで教師ありResNet-50に近い精度へ達したと報告しています。同じ制約がある場面で再現できるなら、分類名を文章で与える方式は、固定ラベルごとの追加学習を減らせる可能性があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。数え上げや位置関係に弱く、Web由来データの偏りや不適切な対応関係も表現へ入りえます。
さらに、改善が中心機構によるものか、データ・規模・計算条件にも依存するのかを構成要素別の比較で確かめる必要があります。異なる条件での追試が、結論をどこまで広げられるかを判断する材料になります。
この読み方に出てくる言葉(4語)
- 画像エンコーダ
画像を比較可能な数値の並びへ変換するモデル。 この論文では処理の流れの中で役割を区別して扱う。
- テキストエンコーダ
文章を比較可能な数値の並びへ変換するモデル。 この論文では処理の流れの中で役割を区別して扱う。
- 対照学習
正しい画像と文章の組を近づけ、誤った組を遠ざける学習法。 この論文では処理の流れの中で役割を区別して扱う。
- ゼロショット
対象課題の正解例で追加学習せずに分類する設定。 この論文では処理の流れの中で役割を区別して扱う。
どんな問いに向き合ったか
従来のコンピュータビジョンは「ImageNetの固定された1000クラス」など閉じたラベルセットに縛られており、新しい概念を認識するたびに再学習とアノテーションが必要だった。
肝のアイデア
Webから収集した4億組の画像・テキスト対に対し、画像エンコーダとテキストエンコーダの出力ベクトルが同一の意味空間で正のペアは近づき、負のペアは離れるように対称対照学習(InfoNCE損失)を適用した。
InfoNCE対照損失、大規模バッチ並列学習(N=32768)、プロンプトエンジニアリング。
どう確かめ、何が分かったか
著者らが報告した主な結果は次の通り。
- ImageNetゼロショット精度76.2%
- 30以上のタスクでの高汎化性能。
数値は原論文における著者報告である。
注意すべきこと
確認すべき限界は次の通り。
- 物体のカウントや幾何関係の誤認
- Webデータ由来のノイズとバイアス。
評価条件の外で同じ結果が得られるとは限らない。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らは、自然言語のクラス名を使うゼロショット分類が、ImageNetで教師ありResNet-50に近い精度へ達したと報告しています。この結果が対象に近い条件でも確かめられるなら、分類名を文章で与える方式は、固定ラベルごとの追加学習を減らせる可能性があります。ただし、数え上げや位置関係に弱く、Web由来データの偏りや不適切な対応関係も表現へ入りえます。
この読み方に出てくる言葉(7語)
- 画像エンコーダ
画像を比較可能な数値の並びへ変換するモデル。 この論文では処理の流れの中で役割を区別して扱う。
- テキストエンコーダ
文章を比較可能な数値の並びへ変換するモデル。 この論文では処理の流れの中で役割を区別して扱う。
- 対照学習
正しい画像と文章の組を近づけ、誤った組を遠ざける学習法。 この論文では処理の流れの中で役割を区別して扱う。
- ゼロショット
対象課題の正解例で追加学習せずに分類する設定。 この論文では処理の流れの中で役割を区別して扱う。
- 埋め込み
画像や文章の意味を比較するためのベクトル表現。 この論文では処理の流れの中で役割を区別して扱う。
- コサイン類似度
二つのベクトルが同じ方向を向く度合いを測る値。 この論文では処理の流れの中で役割を区別して扱う。
- ImageNet
多数の物体カテゴリを含む代表的な画像分類データセット。 この論文では処理の流れの中で役割を区別して扱う。
どんな問いに向き合ったか
従来のコンピュータビジョンは「ImageNetの固定された1000クラス」など閉じたラベルセットに縛られており、新しい概念を認識するたびに再学習とアノテーションが必要だった。
この問いに対し、提案手法と比較手法を同じ評価条件で比べる。
従来の方法と課題
固定カテゴリに対するクロスエントロピー分類、ImageNet事前学習モデルの下流ファインチューニング。
提案の差分は、この先行手法の制約に対して読む必要がある。
肝のアイデア
CLIPは4億組の画像・テキスト対から二つのエンコーダを対照学習し、共有埋め込み空間の類似度でzero-shot classificationを行います。原論文はImageNetと分布シフトを含む多数のデータセットで転移性能を評価しました。
この中心アイデアを、先行法との差と評価結果を分けて確認する。
どういうしくみか
WebImageText(400M)、ViT-B/16、Transformer、対称対照学習、ゼロショットプロンプト推論。
中心となる流れは次の通り。
- 1. バッチサイズ N=32768 内の画像 Ii とテキスト Tj に対し、それぞれResNet/ViTおよびTransformerで埋め込みベクトルを計算
- 2. コサイン類似度行列 Sij=∥Ii∥∥Tj∥Ii⋅Tj/τ を計算
- 3. 画像からテキスト、テキストから画像の双方向クロスエントロピー損失(対称InfoNCE)を最小化
- 4. 下流タスクでは「A photo of a {label}」というプロンプトのテキスト埋め込みと画像埋め込みの内積でゼロショット分類。
どう確かめたか
原論文に記録された評価結果は次の通り。
- 追加学習なしのゼロショットCLIP(ResNet-50)が、教師ありResNet-50(76.2%)と同等のImageNet精度を達成(指標はImageNet Top-1 Accuracy、値は76.2%、比較対象はSupervised ResNet-50 (76.2%))。これは著者報告の結果として読む必要がある。
- 分布シフトベンチマークImageNet-Aにおいて、教師ありモデルの数倍の耐久スコアを記録(指標はImageNet-A Top-1、値は77.1%、比較対象はSupervised Model (~2.0%))。これは著者報告の結果として読む必要がある。
評価では、記載された比較対象と指標を固定したうえで提案手法との差を確認している。
何が分かったか
著者らが報告した主な結果は次の通り。
- ImageNetゼロショット精度76.2%
- 30以上のタスクでの高汎化性能。
これらは原論文の著者報告であり、比較対象、データ、指標をそろえた範囲で解釈する。
どこまで使えるか
この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。
限界と未解決の問い
確認すべき限界は次の通り。
- Fine-grainedな属性バインディング(色の取り違え等)の脆弱性
- OCRや数理グラフ認識の精度の低さ。
評価対象と異なるデータ、規模、計算条件へ結論を広げるには追加検証が必要になる。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らは、自然言語のクラス名を使うゼロショット分類が、ImageNetで教師ありResNet-50に近い精度へ達したと報告しています。同じ制約がある場面で再現できるなら、分類名を文章で与える方式は、固定ラベルごとの追加学習を減らせる可能性があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。数え上げや位置関係に弱く、Web由来データの偏りや不適切な対応関係も表現へ入りえます。
この読み方に出てくる言葉(8語)
- 画像エンコーダ
画像を比較可能な数値の並びへ変換するモデル。 この論文では処理の流れの中で役割を区別して扱う。
- テキストエンコーダ
文章を比較可能な数値の並びへ変換するモデル。 この論文では処理の流れの中で役割を区別して扱う。
- 対照学習
正しい画像と文章の組を近づけ、誤った組を遠ざける学習法。 この論文では処理の流れの中で役割を区別して扱う。
- ゼロショット
対象課題の正解例で追加学習せずに分類する設定。 この論文では処理の流れの中で役割を区別して扱う。
- 埋め込み
画像や文章の意味を比較するためのベクトル表現。 この論文では処理の流れの中で役割を区別して扱う。
- コサイン類似度
二つのベクトルが同じ方向を向く度合いを測る値。 この論文では処理の流れの中で役割を区別して扱う。
- ImageNet
多数の物体カテゴリを含む代表的な画像分類データセット。 この論文では処理の流れの中で役割を区別して扱う。
- プロンプト
分類名を自然な文章としてモデルへ与える入力。 この論文では処理の流れの中で役割を区別して扱う。
問題設定と前提
従来のコンピュータビジョンは「ImageNetの固定された1000クラス」など閉じたラベルセットに縛られており、新しい概念を認識するたびに再学習とアノテーションが必要だった。
結論は原論文に記載されたモデル、データ、計算環境を前提とし、条件外へはそのまま外挿しない。
関連研究の中での位置づけ
固定カテゴリに対するクロスエントロピー分類、ImageNet事前学習モデルの下流ファインチューニング。
提案の位置づけは、先行法から変えた要素と、比較実験で固定した条件を分けて読む必要がある。
提案手法の全体像
CLIPは4億組の画像・テキスト対から二つのエンコーダを対照学習し、共有埋め込み空間の類似度でzero-shot classificationを行います。原論文はImageNetと分布シフトを含む多数のデータセットで転移性能を評価しました。
次節では、入力から出力までに何を更新し、どの部分の計算や学習を変えたのかを整理する。
定式化と設計判断
400M WebImageText, InfoNCE with learnable temperature, ViT-L/14, Multi-modal dual encoder, Zero-shot prompt evaluation.
中心となる流れは次の通り。
- 1. バッチサイズ N=32768 内の画像 Ii とテキスト Tj に対し、それぞれResNet/ViTおよびTransformerで埋め込みベクトルを計算
- 2. コサイン類似度行列 Sij=∥Ii∥∥Tj∥Ii⋅Tj/τ を計算
- 3. 画像からテキスト、テキストから画像の双方向クロスエントロピー損失(対称InfoNCE)を最小化
- 4. 下流タスクでは「A photo of a {label}」というプロンプトのテキスト埋め込みと画像埋め込みの内積でゼロショット分類。
学習・推論・実験条件
原論文に記録された評価結果は次の通り。
- 追加学習なしのゼロショットCLIP(ResNet-50)が、教師ありResNet-50(76.2%)と同等のImageNet精度を達成(指標はImageNet Top-1 Accuracy、値は76.2%、比較対象はSupervised ResNet-50 (76.2%))。これは著者報告の結果として読む必要がある。
- 分布シフトベンチマークImageNet-Aにおいて、教師ありモデルの数倍の耐久スコアを記録(指標はImageNet-A Top-1、値は77.1%、比較対象はSupervised Model (~2.0%))。これは著者報告の結果として読む必要がある。
既存データに明記されていない訓練設定や推論設定は補わない。その不足は、結果を別環境で再現するときの確認事項として残る。
評価設計
評価の根拠は、論文が選んだデータセット、指標、比較対象にある。
原論文に記録された評価結果は次の通り。
- 追加学習なしのゼロショットCLIP(ResNet-50)が、教師ありResNet-50(76.2%)と同等のImageNet精度を達成(指標はImageNet Top-1 Accuracy、値は76.2%、比較対象はSupervised ResNet-50 (76.2%))。これは著者報告の結果として読む必要がある。
- 分布シフトベンチマークImageNet-Aにおいて、教師ありモデルの数倍の耐久スコアを記録(指標はImageNet-A Top-1、値は77.1%、比較対象はSupervised Model (~2.0%))。これは著者報告の結果として読む必要がある。
指標が測る性質と、実利用で必要な性質が一致するかは分けて判断する必要がある。
何が分かったか
著者らが報告した主な結果は次の通り。
- ViT-L/14@336pxモデルでImageNetゼロショット77.9%を達成
- ImageNet Adversarial(ImageNet-A)で77.1%の大きな耐性を記録
これらは原論文の著者報告であり、後続研究による独立検証とは区別する。
アブレーションと失敗例
確認すべき限界は次の通り。
- 否定構文や関係詞などの複雑な統語論の理解不良
- ゼロショット分類におけるプロンプト表現への過敏性。
正典データに独立したアブレーション結果が記録されていない要素については、各構成要素の寄与を数値で分離できない。失敗条件の範囲も、記録された限界を超えて推測しない。
別の解釈と評価上の注意
報告された改善は提案全体を支持するが、評価条件が限定される場合、特定の構成要素、データ、計算量の寄与を完全には切り分けられない。別の比較条件でも差が残るかが、より強い解釈に必要になる。
この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。
限界と未解決の問い
確認すべき限界は次の通り。
- 否定構文や関係詞などの複雑な統語論の理解不良
- ゼロショット分類におけるプロンプト表現への過敏性。
数え上げ(Counting)や空間的位置関係(上・下・左右)の把握の弱さ。
Webスクレイピングデータに含まれるバイアスや不適切なコンテンツの埋め込み。
性能値だけでは、評価外の分布、規模、資源条件での頑健性までは示せない。
残された問い
残る問いは、数え上げ(Counting)や空間的位置関係(上・下・左右)の把握の弱さをどの条件まで解消できるかである。
同一条件での追試、異なる規模やデータでの比較、構成要素ごとの切り分けが、結論の適用範囲を明確にする。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らは、自然言語のクラス名を使うゼロショット分類が、ImageNetで教師ありResNet-50に近い精度へ達したと報告しています。同じ制約がある場面で再現できるなら、分類名を文章で与える方式は、固定ラベルごとの追加学習を減らせる可能性があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。数え上げや位置関係に弱く、Web由来データの偏りや不適切な対応関係も表現へ入りえます。
さらに、改善が中心機構によるものか、データ・規模・計算条件にも依存するのかを構成要素別の比較で確かめる必要があります。異なる条件での追試が、結論をどこまで広げられるかを判断する材料になります。
この読み方に出てくる言葉(4語)
- 画像エンコーダ
画像を比較可能な数値の並びへ変換するモデル。 原論文の定義、比較条件、表記に沿って読む。
- テキストエンコーダ
文章を比較可能な数値の並びへ変換するモデル。 原論文の定義、比較条件、表記に沿って読む。
- 対照学習
正しい画像と文章の組を近づけ、誤った組を遠ざける学習法。 原論文の定義、比較条件、表記に沿って読む。
- ゼロショット
対象課題の正解例で追加学習せずに分類する設定。 原論文の定義、比較条件、表記に沿って読む。
どんな問いに向き合ったか
従来のコンピュータビジョンは「ImageNetの固定された1000クラス」など閉じたラベルセットに縛られており、新しい概念を認識するたびに再学習とアノテーションが必要だった。
肝のアイデア
Webから収集した4億組の画像・テキスト対に対し、画像エンコーダとテキストエンコーダの出力ベクトルが同一の意味空間で正のペアは近づき、負のペアは離れるように対称対照学習(InfoNCE損失)を適用した。
対称InfoNCE対照損失、二重エンコーダ(ViT/Transformer)、ゼロショットプロンプト推論。
どう確かめ、何が分かったか
著者らが報告した主な結果は次の通り。
- ImageNetゼロショット精度76.2%
- 30以上の公開データセットでの優れた汎化性能。
結果は原論文の著者報告として扱う。
注意すべきこと
確認すべき限界は次の通り。
- 空間的論理推論の弱さ
- データセット由来のバイアス。
外的妥当性は評価条件の範囲に限定される。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らは、自然言語のクラス名を使うゼロショット分類が、ImageNetで教師ありResNet-50に近い精度へ達したと報告しています。この結果が対象に近い条件でも確かめられるなら、分類名を文章で与える方式は、固定ラベルごとの追加学習を減らせる可能性があります。ただし、数え上げや位置関係に弱く、Web由来データの偏りや不適切な対応関係も表現へ入りえます。
この読み方に出てくる言葉(7語)
- 画像エンコーダ
画像を比較可能な数値の並びへ変換するモデル。 原論文の定義、比較条件、表記に沿って読む。
- テキストエンコーダ
文章を比較可能な数値の並びへ変換するモデル。 原論文の定義、比較条件、表記に沿って読む。
- 対照学習
正しい画像と文章の組を近づけ、誤った組を遠ざける学習法。 原論文の定義、比較条件、表記に沿って読む。
- ゼロショット
対象課題の正解例で追加学習せずに分類する設定。 原論文の定義、比較条件、表記に沿って読む。
- 埋め込み
画像や文章の意味を比較するためのベクトル表現。 原論文の定義、比較条件、表記に沿って読む。
- コサイン類似度
二つのベクトルが同じ方向を向く度合いを測る値。 原論文の定義、比較条件、表記に沿って読む。
- ImageNet
多数の物体カテゴリを含む代表的な画像分類データセット。 原論文の定義、比較条件、表記に沿って読む。
どんな問いに向き合ったか
従来のコンピュータビジョンは「ImageNetの固定された1000クラス」など閉じたラベルセットに縛られており、新しい概念を認識するたびに再学習とアノテーションが必要だった。
この問いに対し、提案手法と比較手法を同じ評価条件で比べる。
従来の方法と課題
固定カテゴリに対するクロスエントロピー分類、ImageNet事前学習モデルの下流ファインチューニング。
提案の差分は、この先行手法の制約に対して読む必要がある。
肝のアイデア
CLIPはimage encoderとtext encoderを対称InfoNCE objectiveで学習し、class promptのtext embeddingをclassifier weightとしてzero-shot transferします。原論文は30以上のdatasetでlinear probe、zero-shot、分布シフト耐性を比較しています。
この中心アイデアを、先行法との差と評価結果を分けて確認する。
どういうしくみか
400MペアでのContrastive Pre-training、InfoNCE損失、ゼロショット分類。
中心となる流れは次の通り。
- 1. バッチサイズ N=32768 内の画像 Ii とテキスト Tj に対し、それぞれResNet/ViTおよびTransformerで埋め込みベクトルを計算
- 2. コサイン類似度行列 Sij=∥Ii∥∥Tj∥Ii⋅Tj/τ を計算
- 3. 画像からテキスト、テキストから画像の双方向クロスエントロピー損失(対称InfoNCE)を最小化
- 4. 下流タスクでは「A photo of a {label}」というプロンプトのテキスト埋め込みと画像埋め込みの内積でゼロショット分類。
どう確かめたか
原論文に記録された評価結果は次の通り。
- 追加学習なしのゼロショットCLIP(ResNet-50)が、教師ありResNet-50(76.2%)と同等のImageNet精度を達成(指標はImageNet Top-1 Accuracy、値は76.2%、比較対象はSupervised ResNet-50 (76.2%))。これは著者報告の結果として読む必要がある。
- 分布シフトベンチマークImageNet-Aにおいて、教師ありモデルの数倍の耐久スコアを記録(指標はImageNet-A Top-1、値は77.1%、比較対象はSupervised Model (~2.0%))。これは著者報告の結果として読む必要がある。
評価では、記載された比較対象と指標を固定したうえで提案手法との差を確認している。
何が分かったか
著者らが報告した主な結果は次の通り。
- ImageNetゼロショット精度76.2%
- 30以上の公開データセットでの優れた汎化性能。
これらは原論文の著者報告であり、比較対象、データ、指標をそろえた範囲で解釈する。
どこまで使えるか
この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。
限界と未解決の問い
確認すべき限界は次の通り。
- カウントタスク等の局所的幾何理解の制約
- プロンプトの設計依存性。
評価対象と異なるデータ、規模、計算条件へ結論を広げるには追加検証が必要になる。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らは、自然言語のクラス名を使うゼロショット分類が、ImageNetで教師ありResNet-50に近い精度へ達したと報告しています。同じ制約がある場面で再現できるなら、分類名を文章で与える方式は、固定ラベルごとの追加学習を減らせる可能性があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。数え上げや位置関係に弱く、Web由来データの偏りや不適切な対応関係も表現へ入りえます。
この読み方に出てくる言葉(8語)
- 画像エンコーダ
画像を比較可能な数値の並びへ変換するモデル。 原論文の定義、比較条件、表記に沿って読む。
- テキストエンコーダ
文章を比較可能な数値の並びへ変換するモデル。 原論文の定義、比較条件、表記に沿って読む。
- 対照学習
正しい画像と文章の組を近づけ、誤った組を遠ざける学習法。 原論文の定義、比較条件、表記に沿って読む。
- ゼロショット
対象課題の正解例で追加学習せずに分類する設定。 原論文の定義、比較条件、表記に沿って読む。
- 埋め込み
画像や文章の意味を比較するためのベクトル表現。 原論文の定義、比較条件、表記に沿って読む。
- コサイン類似度
二つのベクトルが同じ方向を向く度合いを測る値。 原論文の定義、比較条件、表記に沿って読む。
- ImageNet
多数の物体カテゴリを含む代表的な画像分類データセット。 原論文の定義、比較条件、表記に沿って読む。
- プロンプト
分類名を自然な文章としてモデルへ与える入力。 原論文の定義、比較条件、表記に沿って読む。
問題設定と前提
従来のコンピュータビジョンは「ImageNetの固定された1000クラス」など閉じたラベルセットに縛られており、新しい概念を認識するたびに再学習とアノテーションが必要だった。
結論は原論文に記載されたモデル、データ、計算環境を前提とし、条件外へはそのまま外挿しない。
関連研究の中での位置づけ
固定カテゴリに対するクロスエントロピー分類、ImageNet事前学習モデルの下流ファインチューニング。
提案の位置づけは、先行法から変えた要素と、比較実験で固定した条件を分けて読む必要がある。
提案手法の全体像
CLIPはimage encoderとtext encoderを対称InfoNCE objectiveで学習し、class promptのtext embeddingをclassifier weightとしてzero-shot transferします。原論文は30以上のdatasetでlinear probe、zero-shot、分布シフト耐性を比較しています。
次節では、入力から出力までに何を更新し、どの部分の計算や学習を変えたのかを整理する。
定式化と設計判断
400M Image-Text Pairs, InfoNCE Contrastive Loss, ViT/ResNet Dual Encoder, Zero-shot Transfer.
中心となる流れは次の通り。
- 1. バッチサイズ N=32768 内の画像 Ii とテキスト Tj に対し、それぞれResNet/ViTおよびTransformerで埋め込みベクトルを計算
- 2. コサイン類似度行列 Sij=∥Ii∥∥Tj∥Ii⋅Tj/τ を計算
- 3. 画像からテキスト、テキストから画像の双方向クロスエントロピー損失(対称InfoNCE)を最小化
- 4. 下流タスクでは「A photo of a {label}」というプロンプトのテキスト埋め込みと画像埋め込みの内積でゼロショット分類。
学習・推論・実験条件
原論文に記録された評価結果は次の通り。
- 追加学習なしのゼロショットCLIP(ResNet-50)が、教師ありResNet-50(76.2%)と同等のImageNet精度を達成(指標はImageNet Top-1 Accuracy、値は76.2%、比較対象はSupervised ResNet-50 (76.2%))。これは著者報告の結果として読む必要がある。
- 分布シフトベンチマークImageNet-Aにおいて、教師ありモデルの数倍の耐久スコアを記録(指標はImageNet-A Top-1、値は77.1%、比較対象はSupervised Model (~2.0%))。これは著者報告の結果として読む必要がある。
既存データに明記されていない訓練設定や推論設定は補わない。その不足は、結果を別環境で再現するときの確認事項として残る。
評価設計
評価の根拠は、論文が選んだデータセット、指標、比較対象にある。
原論文に記録された評価結果は次の通り。
- 追加学習なしのゼロショットCLIP(ResNet-50)が、教師ありResNet-50(76.2%)と同等のImageNet精度を達成(指標はImageNet Top-1 Accuracy、値は76.2%、比較対象はSupervised ResNet-50 (76.2%))。これは著者報告の結果として読む必要がある。
- 分布シフトベンチマークImageNet-Aにおいて、教師ありモデルの数倍の耐久スコアを記録(指標はImageNet-A Top-1、値は77.1%、比較対象はSupervised Model (~2.0%))。これは著者報告の結果として読む必要がある。
指標が測る性質と、実利用で必要な性質が一致するかは分けて判断する必要がある。
何が分かったか
著者らが報告した主な結果は次の通り。
- ImageNetゼロショット76.2%(ResNet-50)〜77.9%(ViT-L/14)
これらは原論文の著者報告であり、後続研究による独立検証とは区別する。
アブレーションと失敗例
確認すべき限界は次の通り。
- 位置関係や複合的構文の解釈の限界
- プロンプトテンプレートによる性能の変動。
正典データに独立したアブレーション結果が記録されていない要素については、各構成要素の寄与を数値で分離できない。失敗条件の範囲も、記録された限界を超えて推測しない。
別の解釈と評価上の注意
報告された改善は提案全体を支持するが、評価条件が限定される場合、特定の構成要素、データ、計算量の寄与を完全には切り分けられない。別の比較条件でも差が残るかが、より強い解釈に必要になる。
この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。
限界と未解決の問い
確認すべき限界は次の通り。
- 位置関係や複合的構文の解釈の限界
- プロンプトテンプレートによる性能の変動。
数え上げ(Counting)や空間的位置関係(上・下・左右)の把握の弱さ。
Webスクレイピングデータに含まれるバイアスや不適切なコンテンツの埋め込み。
性能値だけでは、評価外の分布、規模、資源条件での頑健性までは示せない。
残された問い
残る問いは、数え上げ(Counting)や空間的位置関係(上・下・左右)の把握の弱さをどの条件まで解消できるかである。
同一条件での追試、異なる規模やデータでの比較、構成要素ごとの切り分けが、結論の適用範囲を明確にする。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らは、自然言語のクラス名を使うゼロショット分類が、ImageNetで教師ありResNet-50に近い精度へ達したと報告しています。同じ制約がある場面で再現できるなら、分類名を文章で与える方式は、固定ラベルごとの追加学習を減らせる可能性があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。数え上げや位置関係に弱く、Web由来データの偏りや不適切な対応関係も表現へ入りえます。
さらに、改善が中心機構によるものか、データ・規模・計算条件にも依存するのかを構成要素別の比較で確かめる必要があります。異なる条件での追試が、結論をどこまで広げられるかを判断する材料になります。