LLaMA:オープンで高効率な基盤言語モデル
推論効率を極限まで高めるオーバートレーニングと現代標準アーキテクチャにより、オープンソースAI革命を点火した原典
LLaMA: Open and Efficient Foundation Language Models
論文の書誌情報と関連リンク
- 発表日
- 掲載先
- arXiv 2023 / Meta AI
読み方の2つの軸
現在:しくみ × 全体像
語彙 使うことば・数式・例え方
深さ 研究のどこまで読むか
この2本は、本文下のスライダーからいつでも変更できます。
概要
LLaMAは、7Bから65Bまでの複数サイズを公開データで長く学習し、モデルを大きくする以外の配分を調べた言語モデルです。著者らは、13Bモデルが複数の評価でより大きなGPT-3を上回ったと報告しました。 研究の問い、方法、主結果、主要な注意点に絞ります。
LLaMAは、7Bから65Bまでの複数サイズを公開データで長く学習し、モデルを大きくする以外の配分を調べた言語モデルです。著者らは、13Bモデルが複数の評価でより大きなGPT-3を上回ったと報告しました。 背景から評価方法、使える範囲まで順に見ます。
LLaMAは、7Bから65Bまでの複数サイズを公開データで長く学習し、モデルを大きくする以外の配分を調べた言語モデルです。著者らは、13Bモデルが複数の評価でより大きなGPT-3を上回ったと報告しました。 前提や評価の弱点、まだ答えのない点まで丁寧に確かめます。
LLaMAは7B〜65Bのdecoder-only Transformerを公開データで最大1.4T token学習し、RMSNorm、SwiGLU、RoPEを組み合わせたモデル群です。著者らは13Bと65Bを複数のzero/few-shot benchmarkで大規模モデルと比較しました。 研究課題、中心機構、代表結果、主要な制約を要約します。
LLaMAは7B〜65Bのdecoder-only Transformerを公開データで最大1.4T token学習し、RMSNorm、SwiGLU、RoPEを組み合わせたモデル群です。著者らは13Bと65Bを複数のzero/few-shot benchmarkで大規模モデルと比較しました。 先行法との差、処理の流れ、評価条件、適用範囲まで確認します。
LLaMAは7B〜65Bのdecoder-only Transformerを公開データで最大1.4T token学習し、RMSNorm、SwiGLU、RoPEを組み合わせたモデル群です。著者らは13Bと65Bを複数のzero/few-shot benchmarkで大規模モデルと比較しました。 設計上の仮定、実験条件、別の解釈、未解決点まで検討します。
LLaMAは7B、13B、33B、65Bのdecoder-only model familyで、公開データのみを用い最大1.4T tokenでpretrainされています。原論文はRMSNorm、SwiGLU、RoPEを採用し、BoolQ、PIQA、MMLUなどでGPT-3、Chinchilla、PaLMと比較しています。 research question、method、headline result、principal caveatを原論文用語で整理します。
LLaMAは7B、13B、33B、65Bのdecoder-only model familyで、公開データのみを用い最大1.4T tokenでpretrainされています。原論文はRMSNorm、SwiGLU、RoPEを採用し、BoolQ、PIQA、MMLUなどでGPT-3、Chinchilla、PaLMと比較しています。 prior work、formulation、evaluation protocol、scopeを追います。
LLaMAは7B、13B、33B、65Bのdecoder-only model familyで、公開データのみを用い最大1.4T tokenでpretrainされています。原論文はRMSNorm、SwiGLU、RoPEを採用し、BoolQ、PIQA、MMLUなどでGPT-3、Chinchilla、PaLMと比較しています。 assumption、ablationの有無、external validity、open questionまで精査します。
著者をもっと詳しく知る(全4名)
論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。
全著者と所属
- Hugo TouvronMeta AI
- Thibaut LavrilMeta AI
- Guillaume LampleMeta AI
- Armand JoulinMeta AI
確認できた研究背景
- 所属
- : Meta AI
- 学歴
- : Meta AI リサーチサイエンティスト
- 主な関心
- : 深層学習アーキテクチャ、ビジョントランスフォーマー、LLM
- 所属
- : Meta AI
- 学歴
- : Meta AI ソフトウェアエンジニア
- 主な関心
- : 大規模分散学習、モデル最適化
- 所属
- : Meta AI
- 学歴
- : Meta AI リサーチディレクター(現Mistral AI共同創業者)
- 主な関心
- : 機械翻訳、自己教師あり学習、大規模推論
- 所属
- : Meta AI
- 学歴
- : Meta AI ディレクター(現Apple)
- 主な関心
- : 自然言語処理、コンピュータビジョン
なぜ歴史的イノベーションなのか
「巨大企業の秘密の巨大AI」と同等以上の頭脳を、一般のパソコンで動くサイズで公開した歴史的モデル。オープンソースAIの爆発を引き起こした立役者です。
モデルを大きくするのではなく「小さなモデルに膨大なデータ(1.4兆単語)を徹底的に読ませる(オーバートレーニング)」ことで推論コストを最小化。RMSNormやRoPEなどの現代標準構造を確立しました。
Chinchillaの計算最適則(Compute-optimal)に対し、運用時の推論総コストを最小化する推論最適(Inference-budget optimal)の設計思想を提示。公開データのみでGPT-3やPaLM-540Bに肉薄する性能を達成。
公開データのみ1.4Tトークンで訓練された7B〜65Bのオープン基盤言語モデル。
LLaMA-13BがGPT-3(175B)を多数のベンチマークで凌駕。RMSNorm、SwiGLU活性化関数、RoPE(回転位置埋め込み)を採用した現代Transformerの標準形。
推論バジェット最適化の観点からのオーバートレーニング思想、FlashAttentionや活性化チェックポインティングによる学習高速化、およびオープンソースLLMの生態系構築。
Touvronら(Meta AI, 2023)によるLLaMAの原典。公開データのみで訓練された高効率基盤モデルコレクションを提示。
計算リソース独占からオープンサイエンスへの転換点を創出し、以後のオープンウェイトモデルの構造標準を決定づけた論文。
トークンスケーリング則の実証的再解釈、多言語・コードを含むオープンデータセットの精製プロトコル、およびImageNet分類等に匹敵する広範なNLUベンチマーク評価。
コミュニティの評価・歴史的インパクト(1件)
- 原文を見る ↗
巨大テックのブラックボックスだった最高峰AIが、重み公開によって世界中のオープンソース開発者の手元に届き、AI研究の民主化が一気に加速した。
この読み方に出てくる言葉(4語)
- 基盤モデル
幅広い用途へ調整できるよう、大量データで事前学習したモデル。
- Transformer
入力中の関係をアテンションで捉えるニューラルネットワーク。
- トークン
言語モデルが文章を処理するときの文字列の単位。
- パラメータ
学習で調整されるモデル内部の数値。
どんな問いに向き合ったか
大きな言語モデルは高い性能を示す一方、毎回の推論にも多くの計算が必要です。公開データだけを使い、モデルの大きさと学習する文章量の配分を変えて性能を高められるかが課題です。
肝のアイデア
LLaMAは70億から650億個の調整値を持つ四つのモデルを、最大1.4兆トークンの公開データで学習しました。モデルをむやみに大きくせず、比較的小さいモデルへ多くの文章を読ませる設計です。
どう確かめ、何が分かったか
著者らは、LLaMA-13BがBoolQやPIQAなど複数の評価でGPT-3 175Bを上回り、LLaMA-65BがChinchilla-70BやPaLM-540Bと同程度以上の結果を示したと報告しました。
注意すべきこと
学習データは英語が中心で、日本語などに同じ結果を広げることはできません。また、対話の指示に合わせる追加学習をしていない基礎モデルなので、会話用モデルの評価とは分けて読む必要があります。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
論文では、比較的小さなモデルへ多くの学習トークンを配分し、LLaMA-13Bが複数のベンチマークでGPT-3 175Bを上回ったと報告しています。この結果が対象に近い条件でも確かめられるなら、運用時の計算量も重視するなら、パラメータ数と学習トークン量の配分を別々に検討する価値があります。ただし、評価は英語中心で、指示追従の追加学習も含まれないため、対話用途や非英語で同じ比較が成り立つとは限りません。
この読み方に出てくる言葉(6語)
- 基盤モデル
幅広い用途へ調整できるよう、大量データで事前学習したモデル。
- Transformer
入力中の関係をアテンションで捉えるニューラルネットワーク。
- トークン
言語モデルが文章を処理するときの文字列の単位。
- パラメータ
学習で調整されるモデル内部の数値。
- Chinchilla
モデル規模と学習トークン量の配分を重視する先行研究。
- ベンチマーク
同じ課題と指標でモデルを比較する評価枠組み。
どんな問いに向き合ったか
大きな言語モデルは高い性能を示す一方、毎回の推論にも多くの計算が必要です。公開データだけを使い、モデルの大きさと学習する文章量の配分を変えて性能を高められるかが課題です。
著者らは提案手法と比較手法を同じデータと指標で比べ、この問いを検証しました。
従来の方法と課題
先行する大規模言語モデルは、学習に使える計算量の中でモデル本体と学習文章量を釣り合わせる考え方を採っていました。一方、モデルが大きいほど利用時の計算も増えます。
肝のアイデア
LLaMAは70億から650億個の調整値を持つ四つのモデルを、最大1.4兆トークンの公開データで学習しました。モデルをむやみに大きくせず、比較的小さいモデルへ多くの文章を読ませる設計です。
この中心アイデアを、先行法との差と評価結果を分けて確認する。
どういうしくみか
文章を一方向に読み、次のトークンを予測するTransformerを使います。層の安定化、情報の通し方、語順の表し方に既存研究の方法を組み合わせました。主な設計判断は、各サイズのモデルへ従来より多くの学習トークンを配分し、学習後の推論負担も考えることです。
どう確かめたか
原論文に記録された評価結果は次の通り。
- LLaMA-13BがGPT-3(175B)をBoolQ、PIQA、SIQA等の主要NLUベンチマークの大部分で上回り(指標はBenchmark Accuracy、比較対象はGPT-3 (175B))。これは著者報告の結果として読む必要がある。
- LLaMA-65BがChinchilla-70BやPaLM-540Bと同等以上の総合スコアを達成(指標はMMLU / GSM8K Score、比較対象はChinchilla-70B, PaLM-540B)。これは著者報告の結果として読む必要がある。 評価では、記載された比較対象と指標を固定したうえで提案手法との差を確認している。
何が分かったか
著者らは、LLaMA-13BがBoolQやPIQAなど複数の評価でGPT-3 175Bを上回り、LLaMA-65BがChinchilla-70BやPaLM-540Bと同程度以上の結果を示したと報告しました。
これらは原論文の著者報告であり、比較対象、データ、指標をそろえた範囲で解釈する。
どこまで使えるか
この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。
限界と未解決の問い
確認すべき限界は次の通り。
- 学習データセットのうち英語が約67%、コードが4.5%を占め、日本語を含む非英語言語の割合が低かったため、多言語タスクでは英語ほどの性能を発揮できませんでした。
- 公開当時は研究目的の非商用ライセンス(後にLlama 2で商用開放)に制限されていました。 評価対象と異なるデータ、規模、計算条件へ結論を広げるには追加検証が必要になる。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
論文では、比較的小さなモデルへ多くの学習トークンを配分し、LLaMA-13Bが複数のベンチマークでGPT-3 175Bを上回ったと報告しています。運用時の計算量も重視する場合、パラメータ数と学習トークン量の配分を別々に検討する価値があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。評価は英語中心で、指示追従の追加学習も含まれないため、対話用途や非英語で同じ比較が成り立つとは限りません。
この読み方に出てくる言葉(7語)
- 基盤モデル
幅広い用途へ調整できるよう、大量データで事前学習したモデル。
- Transformer
入力中の関係をアテンションで捉えるニューラルネットワーク。
- トークン
言語モデルが文章を処理するときの文字列の単位。
- パラメータ
学習で調整されるモデル内部の数値。
- 事前学習
個別用途へ調整する前に、大量データから一般的なパターンを学ぶ段階。
- Chinchilla
モデル規模と学習トークン量の配分を重視する先行研究。
- ベンチマーク
同じ課題と指標でモデルを比較する評価枠組み。
問題設定と前提
大きな言語モデルは高い性能を示す一方、毎回の推論にも多くの計算が必要です。公開データだけを使い、モデルの大きさと学習する文章量の配分を変えて性能を高められるかが課題です。
ここでの結論は、原論文が使ったデータ、モデル規模、比較条件を前提とします。条件が変われば、性能と計算量の関係も測り直す必要があります。
関連研究の中での位置づけ
先行する大規模言語モデルは、学習に使える計算量の中でモデル本体と学習文章量を釣り合わせる考え方を採っていました。一方、モデルが大きいほど利用時の計算も増えます。
この違いを踏まえ、何を共有・圧縮・追加したのかと、どの条件で結果を比べたのかを分けて読みます。
提案手法の全体像
LLaMAは70億から650億個の調整値を持つ四つのモデルを、最大1.4兆トークンの公開データで学習しました。モデルをむやみに大きくせず、比較的小さいモデルへ多くの文章を読ませる設計です。
次節では、入力から出力までに何を更新し、どの部分の計算や学習を変えたのかを整理する。
定式化と設計判断
文章を一方向に読み、次のトークンを予測するTransformerを使います。層の安定化、情報の通し方、語順の表し方に既存研究の方法を組み合わせました。主な設計判断は、各サイズのモデルへ従来より多くの学習トークンを配分し、学習後の推論負担も考えることです。
この流れの各段階を分けて考えると、どこで情報を減らし、どこで結果を確かめる必要があるかが見える。論文に記録されていない細かな設定は推測せず、評価条件と合わせて読む。
学習・推論・実験条件
原論文に記録された評価結果は次の通り。
- LLaMA-13BがGPT-3(175B)をBoolQ、PIQA、SIQA等の主要NLUベンチマークの大部分で上回り(指標はBenchmark Accuracy、比較対象はGPT-3 (175B))。これは著者報告の結果として読む必要がある。
- LLaMA-65BがChinchilla-70BやPaLM-540Bと同等以上の総合スコアを達成(指標はMMLU / GSM8K Score、比較対象はChinchilla-70B, PaLM-540B)。これは著者報告の結果として読む必要がある。 既存データに明記されていない訓練設定や推論設定は補わない。その不足は、結果を別環境で再現するときの確認事項として残る。
評価設計
評価の根拠は、論文が選んだデータセット、指標、比較対象にある。 原論文に記録された評価結果は次の通り。
- LLaMA-13BがGPT-3(175B)をBoolQ、PIQA、SIQA等の主要NLUベンチマークの大部分で上回り(指標はBenchmark Accuracy、比較対象はGPT-3 (175B))。これは著者報告の結果として読む必要がある。
- LLaMA-65BがChinchilla-70BやPaLM-540Bと同等以上の総合スコアを達成(指標はMMLU / GSM8K Score、比較対象はChinchilla-70B, PaLM-540B)。これは著者報告の結果として読む必要がある。 指標が測る性質と、実利用で必要な性質が一致するかは分けて判断する必要がある。
何が分かったか
著者らが報告した主な結果は次の通り。
- LLaMA-13BがGPT-3(175B)に対し、ARC、BoolQ、PIQA、SIQA等のベンチマークで一貫して同等以上の性能を達成
- LLaMA-65BがMATH、GSM8K、HumanEvalなどの推論・コードタスクにおいてPaLM-540BやChinchilla-70Bと互角のスコアを記録
- 単一のNVIDIA A100-80GB GPU上で量子化(INT4/INT8)を用いることで、65Bモデルのローカル推論が実現可能であることをコミュニティが実証。 これらは原論文の著者報告であり、後続研究による独立検証とは区別する。
アブレーションと失敗例
確認すべき限界は次の通り。
- 事前学習データセットの約82%が英語関連であり、低リソース言語における語彙分割効率と表現力が制約された点。
- 事後学習(RLHF/SFT)が施されていないため、プロンプトの微細な表現によって出力品質が変動するベースモデル特有の扱いづらさ。 正典データに独立したアブレーション結果が記録されていない要素については、各構成要素の寄与を数値で分離できない。失敗条件の範囲も、記録された限界を超えて推測しない。
別の解釈と評価上の注意
報告された改善は提案全体を支持するが、評価条件が限定される場合、特定の構成要素、データ、計算量の寄与を完全には切り分けられない。別の比較条件でも差が残るかが、より強い解釈に必要になる。 この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。
限界と未解決の問い
確認すべき限界は次の通り。
- 事前学習データセットの約82%が英語関連であり、低リソース言語における語彙分割効率と表現力が制約された点。
- 事後学習(RLHF/SFT)が施されていないため、プロンプトの微細な表現によって出力品質が変動するベースモデル特有の扱いづらさ。 英語データ偏重(約82%)による非英語言語(日本語等)でのトークン分割効率と表現力の制約。 ベースモデルとしての公開に伴う指示追従アライメント(RLHF/SFT)の未適用。 性能値だけでは、評価外の分布、規模、資源条件での頑健性までは示せない。
残された問い
残る問いは、英語データ偏重(約82%)による非英語言語(日本語等)でのトークン分割効率と表現力の制約をどの条件まで解消できるかである。 同一条件での追試、異なる規模やデータでの比較、構成要素ごとの切り分けが、結論の適用範囲を明確にする。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
論文では、比較的小さなモデルへ多くの学習トークンを配分し、LLaMA-13Bが複数のベンチマークでGPT-3 175Bを上回ったと報告しています。運用時の計算量も重視する場合、パラメータ数と学習トークン量の配分を別々に検討する価値があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。評価は英語中心で、指示追従の追加学習も含まれないため、対話用途や非英語で同じ比較が成り立つとは限りません。
さらに、改善が中心機構によるものか、データ・規模・計算条件にも依存するのかを構成要素別の比較で確かめる必要があります。異なる条件での追試が、結論をどこまで広げられるかを判断する材料になります。
この読み方に出てくる言葉(4語)
- 基盤モデル
幅広い用途へ調整できるよう、大量データで事前学習したモデル。 この論文では処理の流れの中で役割を区別して扱う。
- Transformer
入力中の関係をアテンションで捉えるニューラルネットワーク。 この論文では処理の流れの中で役割を区別して扱う。
- トークン
言語モデルが文章を処理するときの文字列の単位。 この論文では処理の流れの中で役割を区別して扱う。
- パラメータ
学習で調整されるモデル内部の数値。 この論文では処理の流れの中で役割を区別して扱う。
どんな問いに向き合ったか
従来のフロンティアLLM(GPT-3、PaLMなど)は数千億パラメータに肥大化し、かつ非公開データによるプロプライエタリなモデルであったため、オープンな学術研究や単一GPUでのローカル実行が不可能だった。
肝のアイデア
推論フェーズの総計算コストを最小化するため、比較的小さなモデル群(7B〜65B)に対して公開データのみを用いた1.4Tトークンの徹底的なオーバートレーニングを行い、RMSNorm・SwiGLU・RoPEを統合した洗練されたオープン基盤モデルを構築する。
Transformerデコーダ、RMSNorm事前正規化、SwiGLU、Rotary Positional Embeddings(RoPE)、1.4Tトークンの公開テキストコーパス。
どう確かめ、何が分かったか
著者らが報告した主な結果は次の通り。
- LLaMA-13BがGPT-3(175B)を主要NLUベンチマークで上回った
- LLaMA-65BがChinchilla-70BやPaLM-540Bと互角の性能を実証。
数値は原論文における著者報告である。
注意すべきこと
確認すべき限界は次の通り。
- 非英語言語データの不足による多言語能力の偏り
- ベースモデルとしてのリリースに伴う事後アライメントの未適用。
評価条件の外で同じ結果が得られるとは限らない。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らは、比較的小さなモデルへ多くの学習トークンを配分し、LLaMA-13Bが複数のベンチマークでGPT-3 175Bを上回ったと報告しています。この結果が対象に近い条件でも確かめられるなら、運用時の計算量も重視するなら、パラメータ数と学習トークン量の配分を別々に検討する価値があります。ただし、評価は英語中心で、指示追従の追加学習も含まれないため、対話用途や非英語で同じ比較が成り立つとは限りません。
この読み方に出てくる言葉(6語)
- 基盤モデル
幅広い用途へ調整できるよう、大量データで事前学習したモデル。 この論文では処理の流れの中で役割を区別して扱う。
- トークン
言語モデルが文章を処理するときの文字列の単位。 この論文では処理の流れの中で役割を区別して扱う。
- パラメータ
学習で調整されるモデル内部の数値。 この論文では処理の流れの中で役割を区別して扱う。
- 事前学習
個別用途へ調整する前に、大量データから一般的なパターンを学ぶ段階。 この論文では処理の流れの中で役割を区別して扱う。
- Chinchilla
モデル規模と学習トークン量の配分を重視する先行研究。 この論文では処理の流れの中で役割を区別して扱う。
- ベンチマーク
同じ課題と指標でモデルを比較する評価枠組み。 この論文では処理の流れの中で役割を区別して扱う。
どんな問いに向き合ったか
従来のフロンティアLLM(GPT-3、PaLMなど)は数千億パラメータに肥大化し、かつ非公開データによるプロプライエタリなモデルであったため、オープンな学術研究や単一GPUでのローカル実行が不可能だった。
この問いに対し、提案手法と比較手法を同じ評価条件で比べる。
従来の方法と課題
Chinchilla計算最適則に基づくパラメータとトークンの1:1スケーリング、非公開データに依存したメガモデル(PaLM-540B、GPT-3-175B)。
提案の差分は、この先行手法の制約に対して読む必要がある。
肝のアイデア
LLaMAは7B〜65Bのdecoder-only Transformerを公開データで最大1.4T token学習し、RMSNorm、SwiGLU、RoPEを組み合わせたモデル群です。著者らは13Bと65Bを複数のzero/few-shot benchmarkで大規模モデルと比較しました。
この中心アイデアを、先行法との差と評価結果を分けて確認する。
どういうしくみか
RMSNorm、SwiGLU、RoPE、AdamW(β1=0.9,β2=0.95)、コサイン学習率減衰スケジュール、1.4T公開トークン学習。
中心となる流れは次の通り。
- 事前正規化(RMSNorm)による勾配消失・爆発の抑制と計算高速化
- 回転位置埋め込み(RoPE)の全層適用による相対位置情報モデリングと長文脈外挿性
- CommonCrawl、C4、GitHub、Wikipedia等からなる1.4Tトークンの公開データ精製パイプライン
- FlashAttentionと勾配チェックポインティングによる学習スループットの極大化。
どう確かめたか
原論文に記録された評価結果は次の通り。
- LLaMA-13BがGPT-3(175B)をBoolQ、PIQA、SIQA等の主要NLUベンチマークの大部分で上回り(指標はBenchmark Accuracy、比較対象はGPT-3 (175B))。これは著者報告の結果として読む必要がある。
- LLaMA-65BがChinchilla-70BやPaLM-540Bと同等以上の総合スコアを達成(指標はMMLU / GSM8K Score、比較対象はChinchilla-70B, PaLM-540B)。これは著者報告の結果として読む必要がある。
評価では、記載された比較対象と指標を固定したうえで提案手法との差を確認している。
何が分かったか
著者らが報告した主な結果は次の通り。
- LLaMA-13BがGPT-3(175B)を主要NLUベンチマークで上回った
- LLaMA-65BがChinchilla-70BやPaLM-540Bと互角の性能を実証。
これらは原論文の著者報告であり、比較対象、データ、指標をそろえた範囲で解釈する。
どこまで使えるか
この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。
限界と未解決の問い
確認すべき限界は次の通り。
- 事前学習コーパスにおけるコード比率(4.5%)の低さに伴う複雑プログラミングタスクでの制約
- 安全アライメントの未適用による有害表現出力リスク(コミュニティの事後学習に依存)。
評価対象と異なるデータ、規模、計算条件へ結論を広げるには追加検証が必要になる。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らは、比較的小さなモデルへ多くの学習トークンを配分し、LLaMA-13Bが複数のベンチマークでGPT-3 175Bを上回ったと報告しています。運用時の計算量も重視する場合、パラメータ数と学習トークン量の配分を別々に検討する価値があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。評価は英語中心で、指示追従の追加学習も含まれないため、対話用途や非英語で同じ比較が成り立つとは限りません。
この読み方に出てくる言葉(6語)
- 基盤モデル
幅広い用途へ調整できるよう、大量データで事前学習したモデル。 この論文では処理の流れの中で役割を区別して扱う。
- Transformer
入力中の関係をアテンションで捉えるニューラルネットワーク。 この論文では処理の流れの中で役割を区別して扱う。
- トークン
言語モデルが文章を処理するときの文字列の単位。 この論文では処理の流れの中で役割を区別して扱う。
- パラメータ
学習で調整されるモデル内部の数値。 この論文では処理の流れの中で役割を区別して扱う。
- Chinchilla
モデル規模と学習トークン量の配分を重視する先行研究。 この論文では処理の流れの中で役割を区別して扱う。
- ベンチマーク
同じ課題と指標でモデルを比較する評価枠組み。 この論文では処理の流れの中で役割を区別して扱う。
問題設定と前提
従来のフロンティアLLM(GPT-3、PaLMなど)は数千億パラメータに肥大化し、かつ非公開データによるプロプライエタリなモデルであったため、オープンな学術研究や単一GPUでのローカル実行が不可能だった。
結論は原論文に記載されたモデル、データ、計算環境を前提とし、条件外へはそのまま外挿しない。
関連研究の中での位置づけ
Chinchilla計算最適則に基づくパラメータとトークンの1:1スケーリング、非公開データに依存したメガモデル(PaLM-540B、GPT-3-175B)。
提案の位置づけは、先行法から変えた要素と、比較実験で固定した条件を分けて読む必要がある。
提案手法の全体像
LLaMAは7B〜65Bのdecoder-only Transformerを公開データで最大1.4T token学習し、RMSNorm、SwiGLU、RoPEを組み合わせたモデル群です。著者らは13Bと65Bを複数のzero/few-shot benchmarkで大規模モデルと比較しました。
次節では、入力から出力までに何を更新し、どの部分の計算や学習を変えたのかを整理する。
定式化と設計判断
RMSNorm、SwiGLU、RoPE、FlashAttention、トークンオーバートレーニング(最大1.4Tトークン)、AdamWオプティマイザ。
中心となる流れは次の通り。
- 事前正規化(RMSNorm)による勾配消失・爆発の抑制と計算高速化
- 回転位置埋め込み(RoPE)の全層適用による相対位置情報モデリングと長文脈外挿性
- CommonCrawl、C4、GitHub、Wikipedia等からなる1.4Tトークンの公開データ精製パイプライン
- FlashAttentionと勾配チェックポインティングによる学習スループットの極大化。
学習・推論・実験条件
原論文に記録された評価結果は次の通り。
- LLaMA-13BがGPT-3(175B)をBoolQ、PIQA、SIQA等の主要NLUベンチマークの大部分で上回り(指標はBenchmark Accuracy、比較対象はGPT-3 (175B))。これは著者報告の結果として読む必要がある。
- LLaMA-65BがChinchilla-70BやPaLM-540Bと同等以上の総合スコアを達成(指標はMMLU / GSM8K Score、比較対象はChinchilla-70B, PaLM-540B)。これは著者報告の結果として読む必要がある。
既存データに明記されていない訓練設定や推論設定は補わない。その不足は、結果を別環境で再現するときの確認事項として残る。
評価設計
評価の根拠は、論文が選んだデータセット、指標、比較対象にある。
原論文に記録された評価結果は次の通り。
- LLaMA-13BがGPT-3(175B)をBoolQ、PIQA、SIQA等の主要NLUベンチマークの大部分で上回り(指標はBenchmark Accuracy、比較対象はGPT-3 (175B))。これは著者報告の結果として読む必要がある。
- LLaMA-65BがChinchilla-70BやPaLM-540Bと同等以上の総合スコアを達成(指標はMMLU / GSM8K Score、比較対象はChinchilla-70B, PaLM-540B)。これは著者報告の結果として読む必要がある。
指標が測る性質と、実利用で必要な性質が一致するかは分けて判断する必要がある。
何が分かったか
著者らが報告した主な結果は次の通り。
- LLaMA-13BがGPT-3(175B)を常識推論・読解ベンチマークで一貫して上回った
- LLaMA-65BがPaLM-540Bと同等水準の総合能力を達成
- 量子化(4-bit GPTQ等)との親和性により、コンシューマハードウェアでの実行可能性を報告。
これらは原論文の著者報告であり、後続研究による独立検証とは区別する。
アブレーションと失敗例
確認すべき限界は次の通り。
- 英語以外の言語におけるByte-Pair Encoding(BPE)のトークン圧縮率の低さ(語彙サイズ32k)
- RLHF等のアライメント工程の欠如によるプロンプト依存性。
正典データに独立したアブレーション結果が記録されていない要素については、各構成要素の寄与を数値で分離できない。失敗条件の範囲も、記録された限界を超えて推測しない。
別の解釈と評価上の注意
報告された改善は提案全体を支持するが、評価条件が限定される場合、特定の構成要素、データ、計算量の寄与を完全には切り分けられない。別の比較条件でも差が残るかが、より強い解釈に必要になる。
この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。
限界と未解決の問い
確認すべき限界は次の通り。
- 英語以外の言語におけるByte-Pair Encoding(BPE)のトークン圧縮率の低さ(語彙サイズ32k)
- RLHF等のアライメント工程の欠如によるプロンプト依存性。
英語データ偏重(約82%)による非英語言語(日本語等)でのトークン分割効率と表現力の制約。
ベースモデルとしての公開に伴う指示追従アライメント(RLHF/SFT)の未適用。
性能値だけでは、評価外の分布、規模、資源条件での頑健性までは示せない。
残された問い
残る問いは、英語データ偏重(約82%)による非英語言語(日本語等)でのトークン分割効率と表現力の制約をどの条件まで解消できるかである。
同一条件での追試、異なる規模やデータでの比較、構成要素ごとの切り分けが、結論の適用範囲を明確にする。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らは、比較的小さなモデルへ多くの学習トークンを配分し、LLaMA-13Bが複数のベンチマークでGPT-3 175Bを上回ったと報告しています。運用時の計算量も重視する場合、パラメータ数と学習トークン量の配分を別々に検討する価値があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。評価は英語中心で、指示追従の追加学習も含まれないため、対話用途や非英語で同じ比較が成り立つとは限りません。
さらに、改善が中心機構によるものか、データ・規模・計算条件にも依存するのかを構成要素別の比較で確かめる必要があります。異なる条件での追試が、結論をどこまで広げられるかを判断する材料になります。
この読み方に出てくる言葉(4語)
- 基盤モデル
幅広い用途へ調整できるよう、大量データで事前学習したモデル。 原論文の定義、比較条件、表記に沿って読む。
- トークン
言語モデルが文章を処理するときの文字列の単位。 原論文の定義、比較条件、表記に沿って読む。
- パラメータ
学習で調整されるモデル内部の数値。 原論文の定義、比較条件、表記に沿って読む。
- 事前学習
個別用途へ調整する前に、大量データから一般的なパターンを学ぶ段階。 原論文の定義、比較条件、表記に沿って読む。
どんな問いに向き合ったか
従来のフロンティアLLM(GPT-3、PaLMなど)は数千億パラメータに肥大化し、かつ非公開データによるプロプライエタリなモデルであったため、オープンな学術研究や単一GPUでのローカル実行が不可能だった。
肝のアイデア
推論フェーズの総計算コストを最小化するため、比較的小さなモデル群(7B〜65B)に対して公開データのみを用いた1.4Tトークンの徹底的なオーバートレーニングを行い、RMSNorm・SwiGLU・RoPEを統合した洗練されたオープン基盤モデルを構築する。
RMSNorm先行正規化、SwiGLU、RoPE、FlashAttention、1.4Tトークンに及ぶオープンコーパスでの事前学習。
どう確かめ、何が分かったか
著者らが報告した主な結果は次の通り。
- LLaMA-13BがGPT-3(175B)を多数の常識推論タスクで上回った
- LLaMA-65BがChinchilla-70BやPaLM-540Bに匹敵する性能を記録。
結果は原論文の著者報告として扱う。
注意すべきこと
確認すべき限界は次の通り。
- 英語偏重のデータセットによる他言語能力の制約
- アライメント未適用によるハルシネーションと有害出力のリスク。
外的妥当性は評価条件の範囲に限定される。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らは、比較的小さなモデルへ多くの学習トークンを配分し、LLaMA-13Bが複数のベンチマークでGPT-3 175Bを上回ったと報告しています。この結果が対象に近い条件でも確かめられるなら、運用時の計算量も重視するなら、パラメータ数と学習トークン量の配分を別々に検討する価値があります。ただし、評価は英語中心で、指示追従の追加学習も含まれないため、対話用途や非英語で同じ比較が成り立つとは限りません。
この読み方に出てくる言葉(5語)
- 基盤モデル
幅広い用途へ調整できるよう、大量データで事前学習したモデル。 原論文の定義、比較条件、表記に沿って読む。
- トークン
言語モデルが文章を処理するときの文字列の単位。 原論文の定義、比較条件、表記に沿って読む。
- パラメータ
学習で調整されるモデル内部の数値。 原論文の定義、比較条件、表記に沿って読む。
- Chinchilla
モデル規模と学習トークン量の配分を重視する先行研究。 原論文の定義、比較条件、表記に沿って読む。
- ベンチマーク
同じ課題と指標でモデルを比較する評価枠組み。 原論文の定義、比較条件、表記に沿って読む。
どんな問いに向き合ったか
従来のフロンティアLLM(GPT-3、PaLMなど)は数千億パラメータに肥大化し、かつ非公開データによるプロプライエタリなモデルであったため、オープンな学術研究や単一GPUでのローカル実行が不可能だった。
この問いに対し、提案手法と比較手法を同じ評価条件で比べる。
従来の方法と課題
Chinchilla計算最適則に基づくパラメータとトークンの1:1スケーリング、非公開データに依存したメガモデル(PaLM-540B、GPT-3-175B)。
提案の差分は、この先行手法の制約に対して読む必要がある。
肝のアイデア
LLaMAは7B、13B、33B、65Bのdecoder-only model familyで、公開データのみを用い最大1.4T tokenでpretrainされています。原論文はRMSNorm、SwiGLU、RoPEを採用し、BoolQ、PIQA、MMLUなどでGPT-3、Chinchilla、PaLMと比較しています。
この中心アイデアを、先行法との差と評価結果を分けて確認する。
どういうしくみか
RMSNorm、SwiGLU、RoPE、FlashAttention、公開データ1.4Tトークンのオーバートレーニング。
中心となる流れは次の通り。
- 事前正規化(RMSNorm)による勾配消失・爆発の抑制と計算高速化
- 回転位置埋め込み(RoPE)の全層適用による相対位置情報モデリングと長文脈外挿性
- CommonCrawl、C4、GitHub、Wikipedia等からなる1.4Tトークンの公開データ精製パイプライン
- FlashAttentionと勾配チェックポインティングによる学習スループットの極大化。
どう確かめたか
原論文に記録された評価結果は次の通り。
- LLaMA-13BがGPT-3(175B)をBoolQ、PIQA、SIQA等の主要NLUベンチマークの大部分で上回り(指標はBenchmark Accuracy、比較対象はGPT-3 (175B))。これは著者報告の結果として読む必要がある。
- LLaMA-65BがChinchilla-70BやPaLM-540Bと同等以上の総合スコアを達成(指標はMMLU / GSM8K Score、比較対象はChinchilla-70B, PaLM-540B)。これは著者報告の結果として読む必要がある。
評価では、記載された比較対象と指標を固定したうえで提案手法との差を確認している。
何が分かったか
著者らが報告した主な結果は次の通り。
- LLaMA-13BがGPT-3(175B)を多数の常識推論タスクで上回った
- LLaMA-65BがChinchilla-70BやPaLM-540Bに匹敵する性能を記録。
これらは原論文の著者報告であり、比較対象、データ、指標をそろえた範囲で解釈する。
どこまで使えるか
この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。
限界と未解決の問い
確認すべき限界は次の通り。
- 非英語言語におけるByte-Pair Encodingの効率性低下
- 人間との対話に不可欠なインストラクションチューニングの未実施。
評価対象と異なるデータ、規模、計算条件へ結論を広げるには追加検証が必要になる。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らは、比較的小さなモデルへ多くの学習トークンを配分し、LLaMA-13Bが複数のベンチマークでGPT-3 175Bを上回ったと報告しています。運用時の計算量も重視する場合、パラメータ数と学習トークン量の配分を別々に検討する価値があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。評価は英語中心で、指示追従の追加学習も含まれないため、対話用途や非英語で同じ比較が成り立つとは限りません。
この読み方に出てくる言葉(6語)
- 基盤モデル
幅広い用途へ調整できるよう、大量データで事前学習したモデル。 原論文の定義、比較条件、表記に沿って読む。
- Transformer
入力中の関係をアテンションで捉えるニューラルネットワーク。 原論文の定義、比較条件、表記に沿って読む。
- トークン
言語モデルが文章を処理するときの文字列の単位。 原論文の定義、比較条件、表記に沿って読む。
- パラメータ
学習で調整されるモデル内部の数値。 原論文の定義、比較条件、表記に沿って読む。
- Chinchilla
モデル規模と学習トークン量の配分を重視する先行研究。 原論文の定義、比較条件、表記に沿って読む。
- ベンチマーク
同じ課題と指標でモデルを比較する評価枠組み。 原論文の定義、比較条件、表記に沿って読む。
問題設定と前提
従来のフロンティアLLM(GPT-3、PaLMなど)は数千億パラメータに肥大化し、かつ非公開データによるプロプライエタリなモデルであったため、オープンな学術研究や単一GPUでのローカル実行が不可能だった。
結論は原論文に記載されたモデル、データ、計算環境を前提とし、条件外へはそのまま外挿しない。
関連研究の中での位置づけ
Chinchilla計算最適則に基づくパラメータとトークンの1:1スケーリング、非公開データに依存したメガモデル(PaLM-540B、GPT-3-175B)。
提案の位置づけは、先行法から変えた要素と、比較実験で固定した条件を分けて読む必要がある。
提案手法の全体像
LLaMAは7B、13B、33B、65Bのdecoder-only model familyで、公開データのみを用い最大1.4T tokenでpretrainされています。原論文はRMSNorm、SwiGLU、RoPEを採用し、BoolQ、PIQA、MMLUなどでGPT-3、Chinchilla、PaLMと比較しています。
次節では、入力から出力までに何を更新し、どの部分の計算や学習を変えたのかを整理する。
定式化と設計判断
RMSNorm先行正規化、SwiGLU、RoPE、FlashAttention、トークンオーバートレーニング(最大1.4Tトークン)、AdamWオプティマイザ。
中心となる流れは次の通り。
- 事前正規化(RMSNorm)による勾配消失・爆発の抑制と計算高速化
- 回転位置埋め込み(RoPE)の全層適用による相対位置情報モデリングと長文脈外挿性
- CommonCrawl、C4、GitHub、Wikipedia等からなる1.4Tトークンの公開データ精製パイプライン
- FlashAttentionと勾配チェックポインティングによる学習スループットの極大化。
学習・推論・実験条件
原論文に記録された評価結果は次の通り。
- LLaMA-13BがGPT-3(175B)をBoolQ、PIQA、SIQA等の主要NLUベンチマークの大部分で上回り(指標はBenchmark Accuracy、比較対象はGPT-3 (175B))。これは著者報告の結果として読む必要がある。
- LLaMA-65BがChinchilla-70BやPaLM-540Bと同等以上の総合スコアを達成(指標はMMLU / GSM8K Score、比較対象はChinchilla-70B, PaLM-540B)。これは著者報告の結果として読む必要がある。
既存データに明記されていない訓練設定や推論設定は補わない。その不足は、結果を別環境で再現するときの確認事項として残る。
評価設計
評価の根拠は、論文が選んだデータセット、指標、比較対象にある。
原論文に記録された評価結果は次の通り。
- LLaMA-13BがGPT-3(175B)をBoolQ、PIQA、SIQA等の主要NLUベンチマークの大部分で上回り(指標はBenchmark Accuracy、比較対象はGPT-3 (175B))。これは著者報告の結果として読む必要がある。
- LLaMA-65BがChinchilla-70BやPaLM-540Bと同等以上の総合スコアを達成(指標はMMLU / GSM8K Score、比較対象はChinchilla-70B, PaLM-540B)。これは著者報告の結果として読む必要がある。
指標が測る性質と、実利用で必要な性質が一致するかは分けて判断する必要がある。
何が分かったか
著者らが報告した主な結果は次の通り。
- LLaMA-13BがGPT-3(175B)を主要NLU・常識推論タスクで上回った
- LLaMA-65Bが540B級モデルに匹敵するMMLUスコア(63.4%)を達成
- オープンウェイトによる何万もの派生研究・微調整モデルの創出。
これらは原論文の著者報告であり、後続研究による独立検証とは区別する。
アブレーションと失敗例
確認すべき限界は次の通り。
- 語彙サイズ32kのBPEによる多言語(特にCJK言語)トークン効率の低下
- 安全性アライメント(RLHF)未適用によるプロンプトインジェクション脆弱性。
正典データに独立したアブレーション結果が記録されていない要素については、各構成要素の寄与を数値で分離できない。失敗条件の範囲も、記録された限界を超えて推測しない。
別の解釈と評価上の注意
報告された改善は提案全体を支持するが、評価条件が限定される場合、特定の構成要素、データ、計算量の寄与を完全には切り分けられない。別の比較条件でも差が残るかが、より強い解釈に必要になる。
この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。
限界と未解決の問い
確認すべき限界は次の通り。
- 語彙サイズ32kのBPEによる多言語(特にCJK言語)トークン効率の低下
- 安全性アライメント(RLHF)未適用によるプロンプトインジェクション脆弱性。
英語データ偏重(約82%)による非英語言語(日本語等)でのトークン分割効率と表現力の制約。
ベースモデルとしての公開に伴う指示追従アライメント(RLHF/SFT)の未適用。
性能値だけでは、評価外の分布、規模、資源条件での頑健性までは示せない。
残された問い
残る問いは、英語データ偏重(約82%)による非英語言語(日本語等)でのトークン分割効率と表現力の制約をどの条件まで解消できるかである。
同一条件での追試、異なる規模やデータでの比較、構成要素ごとの切り分けが、結論の適用範囲を明確にする。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らは、比較的小さなモデルへ多くの学習トークンを配分し、LLaMA-13Bが複数のベンチマークでGPT-3 175Bを上回ったと報告しています。運用時の計算量も重視する場合、パラメータ数と学習トークン量の配分を別々に検討する価値があります。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。評価は英語中心で、指示追従の追加学習も含まれないため、対話用途や非英語で同じ比較が成り立つとは限りません。
さらに、改善が中心機構によるものか、データ・規模・計算条件にも依存するのかを構成要素別の比較で確かめる必要があります。異なる条件での追試が、結論をどこまで広げられるかを判断する材料になります。