Tier 1: 世界のルールを不可逆に変えた原典LLM・スケーリングHF 48 votes
GPT-3In-Context Learning大規模言語モデル

GPT-3:巨大言語モデルにおけるFew-Shot学習と創発的能力

1750億パラメータへのスケーリングにより、重み更新なしのコンテキスト内指示のみで多様なタスクを解く現代LLMの原典

Language Models are Few-Shot Learners

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

GPT-3は、課題ごとに学習し直す代わりに、入力文の中へ説明や少数の例を置くだけで答え方を変えられるかを調べた研究です。1750億個の調整値を持つ言語モデルを多数の課題で試し、規模を増やすと少数例から学ぶ成績が伸びる傾向を報告しました。 研究の問い、方法、主結果、主要な注意点に絞ります。

GPT-3は、課題ごとに学習し直す代わりに、入力文の中へ説明や少数の例を置くだけで答え方を変えられるかを調べた研究です。1750億個の調整値を持つ言語モデルを多数の課題で試し、規模を増やすと少数例から学ぶ成績が伸びる傾向を報告しました。 背景から評価方法、使える範囲まで順に見ます。

GPT-3は、課題ごとに学習し直す代わりに、入力文の中へ説明や少数の例を置くだけで答え方を変えられるかを調べた研究です。1750億個の調整値を持つ言語モデルを多数の課題で試し、規模を増やすと少数例から学ぶ成績が伸びる傾向を報告しました。 前提や評価の弱点、まだ答えのない点まで丁寧に確かめます。

GPT-3は175B parameterの自己回帰Transformerを用い、weight updateなしのzero-shot、one-shot、few-shot設定を多数のNLP taskで評価しました。モデル規模とin-context learning性能の関係が中心ですが、課題間のばらつきも大きい結果です。 研究課題、中心機構、代表結果、主要な制約を要約します。

GPT-3は175B parameterの自己回帰Transformerを用い、weight updateなしのzero-shot、one-shot、few-shot設定を多数のNLP taskで評価しました。モデル規模とin-context learning性能の関係が中心ですが、課題間のばらつきも大きい結果です。 先行法との差、処理の流れ、評価条件、適用範囲まで確認します。

GPT-3は175B parameterの自己回帰Transformerを用い、weight updateなしのzero-shot、one-shot、few-shot設定を多数のNLP taskで評価しました。モデル規模とin-context learning性能の関係が中心ですが、課題間のばらつきも大きい結果です。 設計上の仮定、実験条件、別の解釈、未解決点まで検討します。

Brown et al.は最大175B parameterのautoregressive language modelを学習し、zero/one/few-shot promptingをtask-specific gradient updateなしで評価しました。SuperGLUE、LAMBADA、翻訳、QA、算術などを横断し、scale依存の改善と失敗例を報告しています。 research question、method、headline result、principal caveatを原論文用語で整理します。

Brown et al.は最大175B parameterのautoregressive language modelを学習し、zero/one/few-shot promptingをtask-specific gradient updateなしで評価しました。SuperGLUE、LAMBADA、翻訳、QA、算術などを横断し、scale依存の改善と失敗例を報告しています。 prior work、formulation、evaluation protocol、scopeを追います。

Brown et al.は最大175B parameterのautoregressive language modelを学習し、zero/one/few-shot promptingをtask-specific gradient updateなしで評価しました。SuperGLUE、LAMBADA、翻訳、QA、算術などを横断し、scale依存の改善と失敗例を報告しています。 assumption、ablationの有無、external validity、open questionまで精査します。

著者をもっと詳しく知る(全6名)

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

全著者と所属

  1. Tom B. Brown
    OpenAI
  2. Benjamin Mann
    OpenAI
  3. Jared Kaplan
    Johns Hopkins University / OpenAI
  4. Alec Radford
    OpenAI
  5. Ilya Sutskever
    OpenAI
  6. Dario Amodei
    OpenAI

確認できた研究背景

Tom B. Brown
所属
: OpenAI
学歴
: OpenAI リードリサーチャー
主な関心
: 大規模言語モデル、スケーリングインフラ
Benjamin Mann
所属
: OpenAI
学歴
: OpenAI 研究員(現Anthropic共同創業者)
主な関心
: 大規模分散学習、GPUクラスタ最適化
Jared Kaplan
所属
: Johns Hopkins University / OpenAI
学歴
: 理論物理学博士、ジョンズ・ホプキンス大学准教授(現Anthropic共同創業者)
主な関心
: スケーリング則、ニューラルネット理論
Alec Radford
所属
: OpenAI
学歴
: OpenAI Chief Scientist
主な関心
: 生成モデル、GPT/CLIP/Whisperアーキテクト
Ilya Sutskever
所属
: OpenAI
学歴
: トロント大学博士、OpenAI元Chief Scientist(現SSI共同創業者)
主な関心
: 深層学習理論、汎用人工知能
Dario Amodei
所属
: OpenAI
学歴
: プリンストン大学物理学博士、OpenAI元VP of Research(現Anthropic CEO)
主な関心
: AIアライメント、安全性とスケーリング

なぜ歴史的イノベーションなのか

AIに専用の再学習をさせなくても、画面に仕事の指示と2〜3個の例を見せるだけで何でもこなせることを証明した歴史的論文。ChatGPTの直接の原点です。

従来の『タスクごとに数万件の正解データで再学習する』常識を破壊。1750億パラメータに巨大化したことで、言葉で指示するだけで即座に理解して動く『文脈内学習(In-Context Learning)』を実現しました。

物理法則のような『スケーリング則』を信じてモデルを桁違いに巨大化させた結果、予測もしなかった多様な推論能力や計算力が突然立ち現れる(創発する)ことを実証したAI史の特異点です。

175Bパラメータの自己回帰型Transformer。勾配更新を一切行わないIn-Context Few-Shot評価において、従来の教師ありSOTAモデルに肉薄・凌駕する性能を実証。

96層・d_model=12288・96ヘッドの超巨大構成。3000億トークンのフィルタリング済みコーパスで事前学習し、Zero/One/Few-Shotプロンプティングの有効性を網羅的に検証。

大規模事前学習により暗黙的なメタ学習(In-Context Learning)が成立することを実証。データ汚染(13-gram重複除去)の厳格な検証や、自己回帰性の限界、偏見・ハルシネーション等の構造的課題を包括的に報告。

Brownら(2020)によるGPT-3の原典。175Bパラメータの自己回帰LMにより、パラメータ更新を伴わないFew-Shot汎化性能の成立を提示。

NLPにおける『事前学習+ファインチューニング』パラダイムから『事前学習+In-Contextプロンプティング』への転換を決定づけたNeurIPS 2020最優秀論文。

自己回帰言語モデルのパラメータ規模拡大に伴う対数線形な性能向上と、In-Context Few-Shot能力の非線形な立ち上がり(創発)を実証的に定式化したマイルストーン。

コミュニティの評価・歴史的インパクト(1件)
  • モデルパラメータを10倍以上にスケールさせるだけで、明示的に学習させていないコード生成や翻訳、計算が文脈から解けるようになるという現象が世界中の研究者に衝撃を与えた。

    原文を見る ↗
この読み方に出てくる言葉(5語)
言語モデル

前までの文章から次に来る語を予測するモデル。 この論文では処理の流れの中で役割を区別して扱う。

Few-shot

少数の例を入力中に示して、新しい課題を解かせる設定。 この論文では処理の流れの中で役割を区別して扱う。

プロンプト

モデルへ与える指示や例を含む入力文。 この論文では処理の流れの中で役割を区別して扱う。

パラメータ

学習によって調整されるモデル内部の数値。 この論文では処理の流れの中で役割を区別して扱う。

ベンチマーク

複数の手法を同じ条件で比べるための課題と評価方法。 この論文では処理の流れの中で役割を区別して扱う。

どんな問いに向き合ったか

従来の自然言語処理では、目的のタスク(翻訳、要約、質疑応答など)ごとに数万件の専用ラベル付きデータを用意してファインチューニングを行う必要があり、人間のような汎用的なタスク適応が困難だった。

この問いに対し、提案手法と比較手法を同じ評価条件で比べる。

従来の方法と課題

BERTやT5などに代表される『事前学習+タスク固有ファインチューニング』のアプローチ。タスクごとに重みの勾配更新が必須。

提案の差分は、この先行手法の制約に対して読む必要がある。

肝のアイデア

GPT-3は175B parameterの自己回帰Transformerを用い、weight updateなしのzero-shot、one-shot、few-shot設定を多数のNLP taskで評価しました。モデル規模とin-context learning性能の関係が中心ですが、課題間のばらつきも大きい結果です。

この中心アイデアを、先行法との差と評価結果を分けて確認する。

どういうしくみか

  1. アーキテクチャとハイパーパラメータ

GPT-3 175Bは、96層のTransformerデコーダブロック、各層96アテンションヘッド、隠れ層次元 dmodel=12288d_{model} = 12288 を持ちます。アテンション機構には、全結合密アテンションと局所帯状アテンション(locally banded sparse attention patterns)が交互に適用され、シーケンス長 N=2048N = 2048 におけるメモリ効率を高めています。

  1. データセット構成(計3000億トークン)

Common Crawl: 45Bトークン(低品質ページのテキスト分類器によるフィルタリングと重複排除、サンプリング重み60%)

WebText2: 19Bトークン(Redditの3upvotes以上のリンク抽出、重み22%)

Books1 / Books2: 計24Bトークン(インターネット書籍コーパス、重み各8%)

Wikipedia: 3Bトークン(英語版Wikipedia、重み3%)

高品質なデータセットほどエポック内で高頻度にリサンプリングされる重み付け学習を実施しました。

  1. In-Context Learningの定式化

推論時、入力系列 X=(x1,y1,x2,y2,,xk,yk,xtest)X = (x_1, y_1, x_2, y_2, \dots, x_k, y_k, x_{test}) を与え、モデルの条件付き確率 P(yX)P(y | X) から貪欲法またはビームサーチで正解ラベル yy を生成させます。パラメータ θ\theta に対する勾配更新 θL\nabla_\theta \mathcal{L} は一切発生しません。

中心となる流れは次の通り。

  1. 自己回帰型Transformer(GPT-2のアーキテクチャを相似拡大した96層、d_model=12288、96ヘッドの構成)
  2. In-Context Learning: プロンプト内でタスクの自然言語指示とK個のデモンストレーションを提示し、次単語予測の確率分布で解答を出力
  3. Sparse Transformerの局所注意バンドを交互に導入し、2048トークンのコンテキスト長で効率的な計算を担保
  4. Common Crawl、WebText2、Books1/2、Wikipediaからなる約3000億トークンの大規模フィルタリングコーパスでの事前学習
  5. テンソル並列とパイプライン並列を組み合わせた数千基のGPUクラスタによる分散学習。

どう確かめたか

原論文に記録された評価結果は次の通り。

  1. SuperGLUEベンチマークにおいて、重みの更新を伴わないFew-Shot設定で当時のBERT系ファインチューニングSOTAに匹敵する精度を記録(指標はSuperGLUE Score)。これは著者報告の結果として読む必要がある。
  2. LAMBADA長文脈単語予測タスクにおいて、従来のファインチューニングSOTA(68%)を大幅に上回る76%の精度をZero-Shotで達成(指標はAccuracy、値は76%)。これは著者報告の結果として読む必要がある。
  3. 3桁の加減算や単語のアナグラム並び替えなど、記号的処理をプロンプトからの文脈学習のみで高精度に実行可能であることを実証。これは著者報告の結果として読む必要がある。

評価では、記載された比較対象と指標を固定したうえで提案手法との差を確認している。

何が分かったか

著者らが報告した主な結果は次の通り。

  1. SuperGLUEベンチマークでFew-Shot設定で71.8点を記録し、専用ファインチューニングモデルに匹敵
  2. LAMBADA(長文文脈予測)で76.2%(Zero-Shot 75.3%)を達成しSOTA更新
  3. 三桁加減算において80%以上の正答率を記録。

これらは原論文の著者報告であり、比較対象、データ、指標をそろえた範囲で解釈する。

どこまで使えるか

この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。

限界と未解決の問い

確認すべき限界は次の通り。

  1. コンテキスト窓(2048トークン)の壁: 提示可能なFew-Shotのサンプル数 KK が物理的に制限される
  2. アライメントの欠如: Instruction TuningやRLHFが行われていないため、プロンプトのわずかな書式変化で出力が激しく変動する脆弱性
  3. 多段階推論の破綻: 4桁以上の計算やシンボリック論理パズルでの急激な精度低下
  4. コーパス由来のバイアス: フィルタリング後も残存する人種・宗教・性別に対するバイアスの出力。

評価対象と異なるデータ、規模、計算条件へ結論を広げるには追加検証が必要になる。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

著者らは、モデルを大きくすると、重みを更新せず入力中の例だけで複数課題へ適応する性能が概して向上すると報告しています。同じ制約がある場面で再現できるなら、少数の例を入力インターフェースとして使う方法は、専用学習データを作る前の評価や試作に利用できます。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。課題ごとの成績差、計算資源、偏見や有害表現、計算・論理の失敗が残り、例を示すだけで信頼性が保証されるわけではありません。