Tier 1: 世界のルールを不可逆に変えた原典オープンソースLLMHF 252 votes
LLaMAオープンソースLLM推論効率化

LLaMA:オープンで高効率な基盤言語モデル

推論効率を極限まで高めるオーバートレーニングと現代標準アーキテクチャにより、オープンソースAI革命を点火した原典

LLaMA: Open and Efficient Foundation Language Models

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

LLaMAは、7Bから65Bまでの複数サイズを公開データで長く学習し、モデルを大きくする以外の配分を調べた言語モデルです。著者らは、13Bモデルが複数の評価でより大きなGPT-3を上回ったと報告しました。 研究の問い、方法、主結果、主要な注意点に絞ります。

LLaMAは、7Bから65Bまでの複数サイズを公開データで長く学習し、モデルを大きくする以外の配分を調べた言語モデルです。著者らは、13Bモデルが複数の評価でより大きなGPT-3を上回ったと報告しました。 背景から評価方法、使える範囲まで順に見ます。

LLaMAは、7Bから65Bまでの複数サイズを公開データで長く学習し、モデルを大きくする以外の配分を調べた言語モデルです。著者らは、13Bモデルが複数の評価でより大きなGPT-3を上回ったと報告しました。 前提や評価の弱点、まだ答えのない点まで丁寧に確かめます。

LLaMAは7B〜65Bのdecoder-only Transformerを公開データで最大1.4T token学習し、RMSNorm、SwiGLU、RoPEを組み合わせたモデル群です。著者らは13Bと65Bを複数のzero/few-shot benchmarkで大規模モデルと比較しました。 研究課題、中心機構、代表結果、主要な制約を要約します。

LLaMAは7B〜65Bのdecoder-only Transformerを公開データで最大1.4T token学習し、RMSNorm、SwiGLU、RoPEを組み合わせたモデル群です。著者らは13Bと65Bを複数のzero/few-shot benchmarkで大規模モデルと比較しました。 先行法との差、処理の流れ、評価条件、適用範囲まで確認します。

LLaMAは7B〜65Bのdecoder-only Transformerを公開データで最大1.4T token学習し、RMSNorm、SwiGLU、RoPEを組み合わせたモデル群です。著者らは13Bと65Bを複数のzero/few-shot benchmarkで大規模モデルと比較しました。 設計上の仮定、実験条件、別の解釈、未解決点まで検討します。

LLaMAは7B、13B、33B、65Bのdecoder-only model familyで、公開データのみを用い最大1.4T tokenでpretrainされています。原論文はRMSNorm、SwiGLU、RoPEを採用し、BoolQ、PIQA、MMLUなどでGPT-3、Chinchilla、PaLMと比較しています。 research question、method、headline result、principal caveatを原論文用語で整理します。

LLaMAは7B、13B、33B、65Bのdecoder-only model familyで、公開データのみを用い最大1.4T tokenでpretrainされています。原論文はRMSNorm、SwiGLU、RoPEを採用し、BoolQ、PIQA、MMLUなどでGPT-3、Chinchilla、PaLMと比較しています。 prior work、formulation、evaluation protocol、scopeを追います。

LLaMAは7B、13B、33B、65Bのdecoder-only model familyで、公開データのみを用い最大1.4T tokenでpretrainされています。原論文はRMSNorm、SwiGLU、RoPEを採用し、BoolQ、PIQA、MMLUなどでGPT-3、Chinchilla、PaLMと比較しています。 assumption、ablationの有無、external validity、open questionまで精査します。

著者をもっと詳しく知る(全4名)

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

全著者と所属

  1. Hugo Touvron
    Meta AI
  2. Thibaut Lavril
    Meta AI
  3. Guillaume Lample
    Meta AI
  4. Armand Joulin
    Meta AI

確認できた研究背景

Hugo Touvron
所属
: Meta AI
学歴
: Meta AI リサーチサイエンティスト
主な関心
: 深層学習アーキテクチャ、ビジョントランスフォーマー、LLM
Thibaut Lavril
所属
: Meta AI
学歴
: Meta AI ソフトウェアエンジニア
主な関心
: 大規模分散学習、モデル最適化
Guillaume Lample
所属
: Meta AI
学歴
: Meta AI リサーチディレクター(現Mistral AI共同創業者)
主な関心
: 機械翻訳、自己教師あり学習、大規模推論
Armand Joulin
所属
: Meta AI
学歴
: Meta AI ディレクター(現Apple)
主な関心
: 自然言語処理、コンピュータビジョン

なぜ歴史的イノベーションなのか

「巨大企業の秘密の巨大AI」と同等以上の頭脳を、一般のパソコンで動くサイズで公開した歴史的モデル。オープンソースAIの爆発を引き起こした立役者です。

モデルを大きくするのではなく「小さなモデルに膨大なデータ(1.4兆単語)を徹底的に読ませる(オーバートレーニング)」ことで推論コストを最小化。RMSNormやRoPEなどの現代標準構造を確立しました。

Chinchillaの計算最適則(Compute-optimal)に対し、運用時の推論総コストを最小化する推論最適(Inference-budget optimal)の設計思想を提示。公開データのみでGPT-3やPaLM-540Bに肉薄する性能を達成。

公開データのみ1.4Tトークンで訓練された7B〜65Bのオープン基盤言語モデル。

LLaMA-13BがGPT-3(175B)を多数のベンチマークで凌駕。RMSNorm、SwiGLU活性化関数、RoPE(回転位置埋め込み)を採用した現代Transformerの標準形。

推論バジェット最適化の観点からのオーバートレーニング思想、FlashAttentionや活性化チェックポインティングによる学習高速化、およびオープンソースLLMの生態系構築。

Touvronら(Meta AI, 2023)によるLLaMAの原典。公開データのみで訓練された高効率基盤モデルコレクションを提示。

計算リソース独占からオープンサイエンスへの転換点を創出し、以後のオープンウェイトモデルの構造標準を決定づけた論文。

トークンスケーリング則の実証的再解釈、多言語・コードを含むオープンデータセットの精製プロトコル、およびImageNet分類等に匹敵する広範なNLUベンチマーク評価。

コミュニティの評価・歴史的インパクト(1件)
  • 巨大テックのブラックボックスだった最高峰AIが、重み公開によって世界中のオープンソース開発者の手元に届き、AI研究の民主化が一気に加速した。

    原文を見る ↗
この読み方に出てくる言葉(6語)
基盤モデル

幅広い用途へ調整できるよう、大量データで事前学習したモデル。 この論文では処理の流れの中で役割を区別して扱う。

トークン

言語モデルが文章を処理するときの文字列の単位。 この論文では処理の流れの中で役割を区別して扱う。

パラメータ

学習で調整されるモデル内部の数値。 この論文では処理の流れの中で役割を区別して扱う。

事前学習

個別用途へ調整する前に、大量データから一般的なパターンを学ぶ段階。 この論文では処理の流れの中で役割を区別して扱う。

Chinchilla

モデル規模と学習トークン量の配分を重視する先行研究。 この論文では処理の流れの中で役割を区別して扱う。

ベンチマーク

同じ課題と指標でモデルを比較する評価枠組み。 この論文では処理の流れの中で役割を区別して扱う。

どんな問いに向き合ったか

従来のフロンティアLLM(GPT-3、PaLMなど)は数千億パラメータに肥大化し、かつ非公開データによるプロプライエタリなモデルであったため、オープンな学術研究や単一GPUでのローカル実行が不可能だった。

この問いに対し、提案手法と比較手法を同じ評価条件で比べる。

従来の方法と課題

Chinchilla計算最適則に基づくパラメータとトークンの1:1スケーリング、非公開データに依存したメガモデル(PaLM-540B、GPT-3-175B)。

提案の差分は、この先行手法の制約に対して読む必要がある。

肝のアイデア

LLaMAは7B〜65Bのdecoder-only Transformerを公開データで最大1.4T token学習し、RMSNorm、SwiGLU、RoPEを組み合わせたモデル群です。著者らは13Bと65Bを複数のzero/few-shot benchmarkで大規模モデルと比較しました。

この中心アイデアを、先行法との差と評価結果を分けて確認する。

どういうしくみか

RMSNorm、SwiGLU、RoPE、AdamW(β1=0.9,β2=0.95\beta_1=0.9, \beta_2=0.95)、コサイン学習率減衰スケジュール、1.4T公開トークン学習。

中心となる流れは次の通り。

  1. 事前正規化(RMSNorm)による勾配消失・爆発の抑制と計算高速化
  2. 回転位置埋め込み(RoPE)の全層適用による相対位置情報モデリングと長文脈外挿性
  3. CommonCrawl、C4、GitHub、Wikipedia等からなる1.4Tトークンの公開データ精製パイプライン
  4. FlashAttentionと勾配チェックポインティングによる学習スループットの極大化。

どう確かめたか

原論文に記録された評価結果は次の通り。

  1. LLaMA-13BがGPT-3(175B)をBoolQ、PIQA、SIQA等の主要NLUベンチマークの大部分で上回り(指標はBenchmark Accuracy、比較対象はGPT-3 (175B))。これは著者報告の結果として読む必要がある。
  2. LLaMA-65BがChinchilla-70BやPaLM-540Bと同等以上の総合スコアを達成(指標はMMLU / GSM8K Score、比較対象はChinchilla-70B, PaLM-540B)。これは著者報告の結果として読む必要がある。

評価では、記載された比較対象と指標を固定したうえで提案手法との差を確認している。

何が分かったか

著者らが報告した主な結果は次の通り。

  1. LLaMA-13BがGPT-3(175B)を主要NLUベンチマークで上回った
  2. LLaMA-65BがChinchilla-70BやPaLM-540Bと互角の性能を実証。

これらは原論文の著者報告であり、比較対象、データ、指標をそろえた範囲で解釈する。

どこまで使えるか

この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。

限界と未解決の問い

確認すべき限界は次の通り。

  1. 事前学習コーパスにおけるコード比率(4.5%)の低さに伴う複雑プログラミングタスクでの制約
  2. 安全アライメントの未適用による有害表現出力リスク(コミュニティの事後学習に依存)。

評価対象と異なるデータ、規模、計算条件へ結論を広げるには追加検証が必要になる。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

著者らは、比較的小さなモデルへ多くの学習トークンを配分し、LLaMA-13Bが複数のベンチマークでGPT-3 175Bを上回ったと報告しています。運用時の計算量も重視する場合、パラメータ数と学習トークン量の配分を別々に検討する価値があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。評価は英語中心で、指示追従の追加学習も含まれないため、対話用途や非英語で同じ比較が成り立つとは限りません。