Tier 2: 現代の標準技術モデルアーキテクチャ・オープンモデルHF 820 votes
DeepSeek-V3Multi-Head Latent AttentionDeepSeekMoE

DeepSeek-V3 技術報告書:MLAと極小スパースMoEがもたらす超低コストフロンティアモデル

671B総パラメータ(活性化37B)をわずか557万ドルの事前学習コストで達成。MLAとDeepSeekMoE、FP8混合精度で業界を震撼させたオープンフラッグシップ

DeepSeek-V3 Technical Report

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

DeepSeek-V3は、質問ごとにモデルの一部だけを動かすことで、大きなモデルの計算量を抑える設計をまとめた技術報告です。著者らは、6710億個の調整値を持ちながら、一度の入力で使うのは370億個だと説明しています。知識、数学、プログラミングなどの共通テストで他モデルと比較し、学習に使った計算量も報告しました。

DeepSeek-V3は、役割の異なる多数の専門部分から入力ごとに一部を選ぶモデルです。過去の文章を覚えるための情報を小さくまとめる方法、専門部分への仕事の偏りを抑える方法、少ない桁数で学習する方法を組み合わせています。著者らは、知識、数学、プログラミングの共通テストと学習計算量を報告しました。複数の変更を同時に使っているため、どれが結果へどれだけ効いたかは分けて見る必要があります。

DeepSeek-V3は、総671Bパラメータのうち各トークンで37Bを使うMoE、KVキャッシュを小さくするMLA、FP8学習、計算と通信を重ねるDualPipeを組み合わせたモデルです。著者らは14.8兆トークンの学習に278.8万H800 GPU時間を使い、事前学習の計算費を557.6万ドルと見積もりました。これは開発全体の費用ではなく、特定の設備と算定範囲での著者推計です。

DeepSeek-V3は、総パラメータ671B(活性化37B)のMoEモデルで、MLA、DeepSeekMoE、FP8混合精度訓練、DualPipe並列化を融合した超高効率フロンティアLLMです。

DeepSeek-V3は、MLA(Multi-Head Latent Attention)、DeepSeekMoE(細粒度+共有エキスパート)、FP8混合精度訓練、DualPipe通信パイプラインを統合した671B MoEアーキテクチャです。

DeepSeek-V3のMulti-Head Latent Attention(MLA)数理、DeepSeekMoE細粒度ルーティング、FP8混合精度実装、DualPipeパイプライン並列化、Multi-Token Prediction(MTP)の技術解説。

DeepSeek-AI(Chen et al., 2024)によるDeepSeek-V3は、671Bパラメータ(37Bアクティブ)のMoE基盤モデルであり、MLA、DeepSeekMoE、FP8学習、DualPipe並列化を導入した技術報告論文です。

原論文(DeepSeek-AI, arXiv:2412.19437)に基づき、DeepSeek-V3のアーキテクチャ、Multi-Head Latent Attention(MLA)、DeepSeekMoE、FP8学習フレームワーク、DualPipe並列化を詳細に解説します。

DeepSeek-V3技術報告書(DeepSeek-AI, 2024)の数理分析。MLAの代数的展開、バイアス調整型MoEルーティング、FP8混合精度スケールダイナミクス、DualPipe通信隠蔽、Multi-Token Prediction(MTP)の損失定式化の精読。

DeepSeek-AIDeepSeek-AI
Liang WenfengDeepSeek-AI
著者をもっと詳しく知る

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

DeepSeek-AI
所属
: DeepSeek-AI
学歴
: 中国・杭州を拠点とするAIフロンティア研究機関。
研究の系譜
: DeepSeek-LLM、DeepSeek-Coder、DeepSeek-Math、DeepSeek-V2/V3、DeepSeek-R1と革新モデルを連続開発。
代表的な論文
: MLA、DeepSeekMoE、FP8分散学習フレームワークの統合設計
Liang Wenfeng
所属
: DeepSeek-AI
学歴
: DeepSeek創業者兼CEO。クオンツヘッジファンドHigh-Flyer創業者。
研究の系譜
: 自社スーパーコンピューティングクラスタの構築と、基礎研究重視のエンジニアリング文化を統率。
代表的な論文
: 計算資源インフラの設計とプロジェクト全体の研究戦略指揮

なぜ歴史的イノベーションなのか

2024年末に公開され、その圧倒的なコストパフォーマンスと緻密なエンジニアリングの詳細を包み隠さず明かした技術報告書は、学術界と産業界に空前の衝撃を与えました。

2024年末に公開され、その圧倒的なコストパフォーマンスと緻密なエンジニアリングの詳細を包み隠さず明かした技術報告書は、学術界と産業界に空前の衝撃を与えました。

2024年末に公開され、その圧倒的なコストパフォーマンスと緻密なエンジニアリングの詳細を包み隠さず明かした技術報告書は、学術界と産業界に空前の衝撃を与えました。

2024年末に公開され、その圧倒的なコストパフォーマンスと緻密なエンジニアリングの詳細を包み隠さず明かした技術報告書は、学術界と産業界に空前の衝撃を与えました。

2024年末に公開され、その圧倒的なコストパフォーマンスと緻密なエンジニアリングの詳細を包み隠さず明かした技術報告書は、学術界と産業界に空前の衝撃を与えました。

2024年末に公開され、その圧倒的なコストパフォーマンスと緻密なエンジニアリングの詳細を包み隠さず明かした技術報告書は、学術界と産業界に空前の衝撃を与えました。

2024年末に公開され、その圧倒的なコストパフォーマンスと緻密なエンジニアリングの詳細を包み隠さず明かした技術報告書は、学術界と産業界に空前の衝撃を与えました。

2024年末に公開され、その圧倒的なコストパフォーマンスと緻密なエンジニアリングの詳細を包み隠さず明かした技術報告書は、学術界と産業界に空前の衝撃を与えました。

2024年末に公開され、その圧倒的なコストパフォーマンスと緻密なエンジニアリングの詳細を包み隠さず明かした技術報告書は、学術界と産業界に空前の衝撃を与えました。

コミュニティの評価・歴史的インパクト(1件)
  • これぞオープンサイエンスの勝利。ハードウェアの制約をアルゴリズムと通信の工夫で突破し、米国のメガテックに並ぶ知能をわずか数億円で作った驚異の報告書。

    原文を見る ↗
この読み方に出てくる言葉(2語)
負荷分散

選ばれる専門部分が一部だけに偏らないよう調整する概念。

FP8

数値を少ないビット数で表し、計算量やメモリを抑える形式。

どんな問いに向き合ったか

従来の技術では計算量、メモリ、または推論・学習効率において重大なボトルネックが存在していた。

従来の方法と課題

計算資源の大量投入や既存の標準的アプローチに依存していた。

肝のアイデア

わずか557万ドルの事前学習コストでGPT-4o級の性能を達成し、世界のAI開発の経済性とアーキテクチャを再定義した超巨大MoE

どういうしくみか

MLAではアテンションのKey/Valueを低ランク行列 WDKVW^{DKV} で圧縮潜在空間 ctKVc_t^{KV} に射影。位置情報はRoPE用ベクトルとして分離保持。DeepSeekMoEではエキスパート数を256に細分化し、1つの共有エキスパート+上位8エキスパートを動的に選択。ルーターの各エキスパートロジットにバイアス項 bib_i を動的に加減算することで、損失関数にペナルティ項を加えることなく均等な負荷分散を示しました。

どう確かめたか

著者らは、DeepSeek-V3 技術報告書:MLAと極小スパースMoEがもたらす超低コストフロンティアモデルにおける顕著な性能向上と計算効率の改善を実証

何が分かったか

その評価で著者らは、総合ベンチマーク(MMLU 88.5%, GSM8K 89.3%, MATH-500 90.2%)でGPT-4oおよびClaude 3.5 Sonnetと互角以上。KVキャッシュサイズが従来のMulti-Head Attention(MHA)の数分の一に激減し、並行推論バッチサイズが向上。14.8Tトークンを学習させる総計算コストがわずか557.6万H800 GPU時間(約600万ドル未満)であることを報告

どこまで使えるか

射程はMoE、負荷分散、FP8などを統合した単一の大規模訓練系における著者報告です。データ、ハードウェア、会計範囲への依存があり、各要素の独立寄与や総費用の一般化は限定されます。

限界と未解決の問い

FP8訓練の数値キャリブレーション(ファイングレインタイル単位スケーリング)はNVIDIA Hopper以降のハードウェアに強く依存。モデル展開に最低でも8台以上のH100/H800ノードを要求する高メモリフットプリント

特定ハードウェアや分散構成に対する依存性。極限スケールにおけるハイパーパラメータチューニングの難しさ

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

報告された性能と学習効率が他の計算環境でも再現するなら、総パラメータ数より活性パラメータ、専門家の負荷分散、数値精度をまとめて設計する意義があります。ただし、大規模学習条件への依存と独立再現の難しさがあり、各要素の寄与は分けて検証する必要があります。