Tier 2: 現代の標準技術モデルアーキテクチャ・オープンモデルHF 680 votes
Mixture of ExpertsMoEオープンウェイト

Mixtral of Experts:スパースMoEによるオープンウェイト言語モデルの新基準

全47Bパラメータ中トークンあたり13Bのみ活性化。Llama 2 70BやGPT-3.5を凌駕する推論速度と性能を両立したオープンMoEの決定版

Mixtral of Experts

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

Mixtralは、内部に8つの専門部分を用意し、単語ごとに2つだけを選んで動かす言語モデルです。全体では多くの調整値を持ちながら、一回の処理で使う量を抑える考え方を、複数の言語・推論・コード課題で評価しました。 研究の問い、方法、主結果、主要な注意点に絞ります。

Mixtralは、内部に8つの専門部分を用意し、単語ごとに2つだけを選んで動かす言語モデルです。全体では多くの調整値を持ちながら、一回の処理で使う量を抑える考え方を、複数の言語・推論・コード課題で評価しました。 背景から評価方法、使える範囲まで順に見ます。

Mixtralは、内部に8つの専門部分を用意し、単語ごとに2つだけを選んで動かす言語モデルです。全体では多くの調整値を持ちながら、一回の処理で使う量を抑える考え方を、複数の言語・推論・コード課題で評価しました。 前提や評価の弱点、まだ答えのない点まで丁寧に確かめます。

Mixtral 8x7Bは、各Transformer blockのFFNを8 expertへ置き換え、routerがtokenごとにTop-2を選ぶSparse MoEです。総46.7B parameterに対してtoken当たり12.9Bを使用し、原論文はLlama 2 70Bなどと各種benchmarkで比較しました。 研究課題、中心機構、代表結果、主要な制約を要約します。

Mixtral 8x7Bは、各Transformer blockのFFNを8 expertへ置き換え、routerがtokenごとにTop-2を選ぶSparse MoEです。総46.7B parameterに対してtoken当たり12.9Bを使用し、原論文はLlama 2 70Bなどと各種benchmarkで比較しました。 先行法との差、処理の流れ、評価条件、適用範囲まで確認します。

Mixtral 8x7Bは、各Transformer blockのFFNを8 expertへ置き換え、routerがtokenごとにTop-2を選ぶSparse MoEです。総46.7B parameterに対してtoken当たり12.9Bを使用し、原論文はLlama 2 70Bなどと各種benchmarkで比較しました。 設計上の仮定、実験条件、別の解釈、未解決点まで検討します。

Mixtral 8x7Bは8個のSwiGLU expertとTop-2 routingを持つdecoder-only SMoEです。各tokenでは二つのexpert出力をrouter weightで合成し、総46.7Bに対して12.9B parameterをactiveにします。MMLU、GSM8K、HumanEval、多言語、長文評価が報告されています。 research question、method、headline result、principal caveatを原論文用語で整理します。

Mixtral 8x7Bは8個のSwiGLU expertとTop-2 routingを持つdecoder-only SMoEです。各tokenでは二つのexpert出力をrouter weightで合成し、総46.7Bに対して12.9B parameterをactiveにします。MMLU、GSM8K、HumanEval、多言語、長文評価が報告されています。 prior work、formulation、evaluation protocol、scopeを追います。

Mixtral 8x7Bは8個のSwiGLU expertとTop-2 routingを持つdecoder-only SMoEです。各tokenでは二つのexpert出力をrouter weightで合成し、総46.7Bに対して12.9B parameterをactiveにします。MMLU、GSM8K、HumanEval、多言語、長文評価が報告されています。 assumption、ablationの有無、external validity、open questionまで精査します。

Albert Q. JiangMistral AI
Arthur MenschMistral AI
Guillaume LampleMistral AI
著者をもっと詳しく知る

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

Albert Q. Jiang
所属
: Mistral AI
学歴
: Mistral AIファウンディングチーム・リサーチャー。
研究の系譜
: Mistral 7B、Mixtral 8x7Bなどの高効率モデル開発を中心的に主導。
代表的な論文
: Mixtral 8x7Bのモデル設計と事前学習・評価の統括
Arthur Mensch
所属
: Mistral AI
学歴
: Mistral AI CEO兼共同創業者(元DeepMindリサーチサイエンティスト)。
研究の系譜
: Chinchilla Scaling Lawsの共著者であり、効率的学習・推論の権威。
代表的な論文
: プロジェクト統括とオープンモデル戦略の策定
Guillaume Lample
所属
: Mistral AI
学歴
: Mistral AI共同創業者兼Chief Scientist(元Meta AIリサーチサイエンティスト)。
研究の系譜
: LLaMA論文の主著者の一人であり、オープンソースLLM革命の立役者。
代表的な論文
: MoEルーティング設計とアーキテクチャ最適化

なぜ歴史的イノベーションなのか

Mistral AIがリリースしたMixtral 8x7Bは、オープンモデルとして初めてGPT-3.5級の性能を軽量な推論コストで実現し、世界中で熱狂的な支持を集めました。

Mistral AIがリリースしたMixtral 8x7Bは、オープンモデルとして初めてGPT-3.5級の性能を軽量な推論コストで実現し、世界中で熱狂的な支持を集めました。

Mistral AIがリリースしたMixtral 8x7Bは、オープンモデルとして初めてGPT-3.5級の性能を軽量な推論コストで実現し、世界中で熱狂的な支持を集めました。

Mistral AIがリリースしたMixtral 8x7Bは、オープンモデルとして初めてGPT-3.5級の性能を軽量な推論コストで実現し、世界中で熱狂的な支持を集めました。

Mistral AIがリリースしたMixtral 8x7Bは、オープンモデルとして初めてGPT-3.5級の性能を軽量な推論コストで実現し、世界中で熱狂的な支持を集めました。

Mistral AIがリリースしたMixtral 8x7Bは、オープンモデルとして初めてGPT-3.5級の性能を軽量な推論コストで実現し、世界中で熱狂的な支持を集めました。

Mistral AIがリリースしたMixtral 8x7Bは、オープンモデルとして初めてGPT-3.5級の性能を軽量な推論コストで実現し、世界中で熱狂的な支持を集めました。

Mistral AIがリリースしたMixtral 8x7Bは、オープンモデルとして初めてGPT-3.5級の性能を軽量な推論コストで実現し、世界中で熱狂的な支持を集めました。

Mistral AIがリリースしたMixtral 8x7Bは、オープンモデルとして初めてGPT-3.5級の性能を軽量な推論コストで実現し、世界中で熱狂的な支持を集めました。

コミュニティの評価・歴史的インパクト(1件)
  • オープンモデルの常識を覆した。高価なGPUクラスタがなくても、実質13Bの軽さで70B超級の知能がローカルで動く。

    原文を見る ↗
この読み方に出てくる言葉(4語)
エキスパート

入力の一部を担当する個別のフィードフォワード部分。 この論文では処理の流れの中で役割を区別して扱う。

ルーター

各トークンをどのエキスパートへ送るか決める仕組み。 この論文では処理の流れの中で役割を区別して扱う。

アクティブパラメータ

一つの入力を処理するとき実際に使われるパラメータ。 この論文では処理の流れの中で役割を区別して扱う。

ベンチマーク

同じ課題と指標で複数モデルを比べる評価枠組み。 この論文では処理の流れの中で役割を区別して扱う。

どんな問いに向き合ったか

Dense Transformerは容量を増やすと各tokenの計算量も増える。総parameter数を増やしながら、token当たりにactiveな計算を一部へ限定できるかが研究課題である。

この問いに対し、提案手法と比較手法を同じ評価条件で比べる。

従来の方法と課題

Dense modelは各tokenで全FFN parameterを使う。従来のMixture-of-Expertsは疎な活性化を可能にする一方、routingの偏りや分散実行時の通信を考慮する必要がある。

肝のアイデア

Mixtral 8x7Bは、各Transformer blockのFFNを8 expertへ置き換え、routerがtokenごとにTop-2を選ぶSparse MoEです。総46.7B parameterに対してtoken当たり12.9Bを使用し、原論文はLlama 2 70Bなどと各種benchmarkで比較しました。

この中心アイデアを、先行法との差と評価結果を分けて確認する。

どういうしくみか

中心となる流れは次の通り。

  1. 1. 数理的・アルゴリズム的アプローチの再設計による効率化
  2. 2. 入出力および内部状態の表現空間の最適化
  3. 3. 実装レベルでのメモリ階層や並列化パイプラインの緊密な協調。

どう確かめたか

著者らはLlama 2 70Bなどを比較対象に、知識、推論、コード、多言語、長文検索を評価した。Mixtralの報告値はMMLU 70.6%、GSM8K 58.4%、HumanEval 40.2%で、32K文脈のpasskey retrievalも調べている。

何が分かったか

著者らが報告した主な結果は次の通り。

  1. MMLUで70.6%を達成し、Llama 2 70B(69.8%)およびGPT-3.5(70.0%)と同等以上を記録
  2. GSM8Kにおいて58.4%を達成し、Llama 2 70B(34.1%)を大幅に上回った
  3. CodeforcesやHumanEval(40.2%)で高いプログラミング適性を実証。

これらは原論文の著者報告であり、比較対象、データ、指標をそろえた範囲で解釈する。

どこまで使えるか

この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。

限界と未解決の問い

確認すべき限界は次の通り。

  1. Expert Parallelism(EP)展開時、各GPUへのトークン分散と集約に伴うネットワーク帯域(All-to-All通信)への依存度が高い
  2. 小バッチ推論ではアクティブパラメータの小ささが活きるが、大バッチ時には全エキスパートが活性化しキャッシュヒット率が低下する。

評価対象と異なるデータ、規模、計算条件へ結論を広げるには追加検証が必要になる。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

著者らは、総46.7Bパラメータのうち各トークンで12.9Bを使い、複数の評価でLlama 2 70Bを上回る結果を報告しています。同じ制約がある場面で再現できるなら、モデル容量と一回の演算量を分けたい場合、疎な専門家選択は比較対象になりえます。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。計算しない専門家の重みもメモリへ置く必要があり、ルーティングの偏りや分散時の通信も制約になります。