Qwen2.5 技術報告書:コード・数学・長文推論におけるオープン基盤モデルの包括的フロンティア
0.5Bから72Bまで同一アーキテクチャで網羅。18兆トークン事前学習と合成データ強化学習により、オープンソースLLMの標準的到達点を大幅に押し上げた決定打
Qwen2.5 Technical Report
論文の書誌情報と関連リンク
- 発表日
- 掲載先
- arXiv 2024 / Alibaba Cloud Qwen Team
読み方の2つの軸
現在:しくみ × 全体像
語彙 使うことば・数式・例え方
深さ 研究のどこまで読むか
この2本は、本文下のスライダーからいつでも変更できます。
概要
Qwen2.5は、小型から大型まで七つのサイズをそろえ、数学、プログラミング、多言語、長い文章の処理を幅広く評価した公開モデル群です。
Qwen2.5は、最大18兆個の文章単位を学び、0.5Bから72Bまで同じ設計方針で展開したモデル群です。著者らは数学、コード、多言語、長文の共通テストで性能を報告しました。
Qwen2.5の報告書は、学習データの拡張、合成データ、回答を調整する追加学習、長文対応を一つのモデル群でどう組み合わせたかを説明します。結果は幅広い一方、サイズごとの能力差と計算資源の大きさも残ります。
Qwen2.5は、0.5B〜72Bのモデル群を最大18Tトークンで事前学習し、数学・コード・多言語・長文処理を評価した技術報告です。
Qwen2.5は、GQA、SwiGLU、RMSNorm、RoPEを用いるモデル群に、拡張コーパスと段階的なポストトレーニングを組み合わせています。著者らは各サイズを複数ベンチマークで比較しました。
Qwen2.5報告書は、モデル系列、18Tトークンのデータ設計、長文対応、合成データを含むポストトレーニング、サイズ別評価をまとめています。評価値は著者報告であり、計算条件と小型モデルへの一般化を分けて読む必要があります。
Qwen2.5 Technical Reportは、0.5B〜72Bのdense model familyと専門モデルの学習・評価を記述した報告です。
本報告は、GQAを含むモデル仕様、最大18T tokensのpre-training、instruction tuningとRL、128K context評価、および一般・数学・コード・多言語benchmarkを示します。
本報告を読む焦点は、Qwen2.5 familyのdata mixture、architecture、post-training、long-context extensionと、各benchmarkがどの主張を支えるかです。著者報告値とモデルサイズ別の制約を切り分けます。
著者をもっと詳しく知る
論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。
- 所属
- : Alibaba Cloud
- 学歴
- : Alibaba Cloudの大規模基盤モデル研究開発グループ。
- 研究の系譜
- : Qwen-7B/14B/72B、Qwen1.5、Qwen2、Qwen2.5、Qwen2.5-Coder/Mathを継続的に開発・オープン化。
- 代表的な論文
- : 18Tトークン事前学習、合成データ強化学習、長文推論パイプラインの設計
- 所属
- : Alibaba Cloud
- 学歴
- : Qwenプロジェクトのリードサイエンティスト・責任者。
- 研究の系譜
- : 自然言語処理、マルチモーダルモデル、オープンソースLLMスケーリングの権威。
- 代表的な論文
- : Qwen2.5プロジェクトの統括と全体アラインメント戦略の主導
なぜ歴史的イノベーションなのか
Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。
Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。
Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。
Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。
Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。
Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。
Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。
Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。
Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。
コミュニティの評価・歴史的インパクト(1件)
- 原文を見る ↗
ローカルAIやエージェント開発においてQwen2.5を使わない日はない。極めて安定した指示追従性と驚異的なコーディング能力。
この読み方に出てくる言葉(1語)
- ベンチマーク
方法どうしを同じ条件で比べる共通テスト。
どんな問いに向き合ったか
著者らが取り組んだのは、英語だけでなく多言語、数学、コード、長い文章を扱えるモデル群を、小型から大型まで同じ系列で用意することです。Qwen2.5は0.5Bから72Bまでの複数サイズを学習し、用途と計算量に応じて選べる範囲を広げました。
肝のアイデア
世界中から集めた18兆文字に及ぶ超巨大かつ高品質なデータで基礎を徹底的に鍛え上げ、さらにAI自身に良質な問題と解答を作らせて自己改善させる『合成データ技術』を活用しました。
・0.5B(超小型)から72B(超大型)まで、同一の高品質な設計で揃えた完璧なラインナップ
どう確かめ、何が分かったか
著者は、次の共通テストや課題で結果を報告しています。
・数学の難問テスト(MATH)で83.1%を記録し、同規模の競合オープンモデルを大きく上回る
・コード生成テスト(HumanEval)で86.6%を達成し、プロのエンジニアを支援できる高い実用性を示し
注意すべきこと
・最大の72Bモデルを快適に動かすには高価なGPU(RTX 4090複数枚やA100)が必要
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
Qwen2.5は複数の数学・コード・多言語ベンチマークで既存の比較モデルを上回る値を報告しています。この結果は、一つのモデル系列から、計算予算に応じたサイズを選ぶ設計には意味があります。ただし、評価値は著者報告であり、大型モデルには大きな計算資源が必要です
この読み方に出てくる言葉(4語)
- 事前学習
特定の仕事を教える前に、大量の例から基本を学ばせる段階。
- 強化学習
試した結果の点数を手がかりに、より良い行動を学ぶ方法。
- 推論
学習を終えたAIが、入力に対して答えを作る段階。
- トークン
AIが文章を読むときに分ける、単語や文字の小さなまとまり。
どんな問いに向き合ったか
従来、オープンソースの王者はMetaのLlamaシリーズでした。しかしQwen 2.5は、アジア言語(日本語・中国語)の流暢さと、理系分野(数学・コード・論理推論)での突出した知能を武器に、世界の開発者や企業から『最も実用的なオープンモデル』として選ばれる存在へと躍進しました。
従来の方法と課題
この研究が比べた従来案と課題は、提案の説明では次のように位置づけられています。
従来、オープンソースの王者はMetaのLlamaシリーズでした。しかしQwen 2.5は、アジア言語(日本語・中国語)の流暢さと、理系分野(数学・コード・論理推論)での突出した知能を武器に、世界の開発者や企業から『最も実用的なオープンモデル』として選ばれる存在へと躍進しました。
肝のアイデア
・0.5B, 1.5B, 3B, 7B, 14B, 32B, 72Bというきめ細やかなサイズ展開
・128kトークン(約20万文字)の超長文一度に読める入力範囲(コンテキスト)に詳細な対応し、長大なドキュメントを正確に要約
どういうしくみか
事前学習データを18兆トークンに拡大し、合成データ(AIが生成した良質な解説やコード)を大量に注入してデータの質を高めました。また、指示追従(ポストトレーニング)において、ルールベースの正誤判定器(Verifier)を用いた強化学習を取り入れ、数学やコードの嘘(もっともらしい誤り(ハルシネーション))を減らしています。
どう確かめたか
著者は、次の共通テストや課題で結果を報告しています。
・知識テスト(MMLU)で86.8%を記録し、オープンソースモデルとしてトップレベルの知能を実証
・数学(MATH 83.1%)およびコード(HumanEval 86.6%)でGPT-4oの初期バージョンに匹敵する精度を達成
何が分かったか
著者は、次の共通テストや課題で結果を報告しています。
・長文検索テスト(Needle In A Haystack)において、128kトークンの全領域で100%の情報回収率を達成
どこまで使えるか
この結果が直接支えるのは、論文が評価した課題と比較条件です。別の用途へ広げる場合は、同じ傾向が保たれるかを改めて測る必要があります。
・日本語を含む29以上の言語において、母国語レベルの高い理解力と自然な文章生成力を実現
限界と未解決の問い
・72Bモデルの推論には大量のVRAMが必要(4bit量子化しても40GB以上のGPUメモリを推奨)
・合成データを大量に使っているため、特定の定型表現や過度に丁寧な言い回しが出やすい傾向がある
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
Qwen2.5は複数の数学・コード・多言語ベンチマークで既存の比較モデルを上回る値を報告しています。同じ傾向が対象の課題でも確認できるなら、一つのモデル系列から、計算予算に応じたサイズを選ぶ設計には意味があります。判断の前に、評価値は著者報告であり、大型モデルには大きな計算資源が必要です
この読み方に出てくる言葉(4語)
- 事前学習
特定の仕事を教える前に、大量の例から基本を学ばせる段階。
- 強化学習
試した結果の点数を手がかりに、より良い行動を学ぶ方法。
- 推論
学習を終えたAIが、入力に対して答えを作る段階。
- トークン
AIが文章を読むときに分ける、単語や文字の小さなまとまり。
問題設定と前提
オープンソースAIが真に実用的なツールになるためには、『英語だけでなく多言語が使えること』『プログラミングと数学という厳密な論理を解けること』『エッジデバイスからクラウドまで同じ知能がスケールすること』の3つが必要でした。Qwen 2.5はそのすべてを高い完成度で実現し、世界中の開発基盤を変える一因となりました。
関連研究の中での位置づけ
従来、オープンソースの王者はMetaのLlamaシリーズでした。しかしQwen 2.5は、アジア言語(日本語・中国語)の流暢さと、理系分野(数学・コード・論理推論)での突出した知能を武器に、世界の開発者や企業から『最も実用的なオープンモデル』として選ばれる存在へと躍進しました。
提案手法の全体像
提案の流れは次の要素から成ります。
・18兆トークンの事前学習コーパス:フィルタリング、重複排除、品質スコアリング、合成データ生成を多段適用
・長文読解(128k一度に読める入力範囲(コンテキスト))と構造化出力(JSON出力、関数呼び出し / Function Calling)の堅牢性
定式化と設計判断
モデル構造にはSwiGLU、RoPE、RMSNorm、GQA(Grouped-Query Attention)という現代の最高水準の標準技術を採用。長文対応にはRoPEの基底周波数を100万に引き上げ、さらに長文専用の継続事前学習を実施。ポストトレーニングでは、数学やプログラミングのように『正解が自動判定できるタスク』に対してコード実行環境や数式検証器を用いた強化学習(RL)を集中的に行い、論理的推論力を向上させました。
学習・推論・実験条件
既存の記述だけでは、学習・推論条件の全項目を特定できません。この不足は再現性を判断する際の留保です。
評価設計
著者は、次の共通テストや課題で結果を報告しています。 データセット、指標、比較対象をそろえて読む必要があります。
・Qwen2.5-72B-InstructがMMLUで86.8%, MMLU-Proで71.6%を記録し、Llama 3.1 70Bを明確にリード
・MATHで83.1%, GSM8Kで91.6%という、オープンモデルとして数学的推論精度を達成
何が分かったか
著者は、次の共通テストや課題で結果を報告しています。
・HumanEval 86.6%, MultiPL-E(多言語コード生成)でも数値を叩き出し、プログラミング支援能力の高さを示し
アブレーションと失敗例
・特に32Bモデルが前世代の72Bモデルに匹敵する性能を達成し、推論コスト効率の新たな黄金比を確立
既存の記述で個別の除去実験が確認できない要素については、各部品の寄与を切り分けられません。失敗条件としては、後述の制約を同時に見る必要があります。
別の解釈と評価上の注意
報告された差は提案手法だけでなく、データ、モデル規模、計算条件、比較対象の違いを含む可能性があります。したがって、ここで支持されるのは論文の評価設定内の結論です。
限界と未解決の問い
・多言語データの比率において東アジア言語が充実している一方、一部のマイナー言語では英語・中国語に比べて性能差が存在する
・72Bモデルは単一のコンシューマGPUでは動作せず、実務運用にはvLLMやTensorRT-LLMによる複数GPU並列サービングが前提となる
残された問い
残る問いは、報告された改善が別のデータや規模でも保たれるか、そして次の制約をどこまで減らせるかです。
・多言語データの比率において東アジア言語が充実している一方、一部のマイナー言語では英語・中国語に比べて性能差が存在する
・72Bモデルは単一のコンシューマGPUでは動作せず、実務運用にはvLLMやTensorRT-LLMによる複数GPU並列サービングが前提となる
追試では同じ比較条件を再現したうえで、未報告の条件と失敗例を分けて測る必要があります。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
Qwen2.5は複数の数学・コード・多言語ベンチマークで既存の比較モデルを上回る値を報告しています。ここから得られる示唆には追加検証が必要です。一つのモデル系列から、計算予算に応じたサイズを選ぶ設計には意味があります。一方で、評価値は著者報告であり、大型モデルには大きな計算資源が必要です。次に見るべき証拠は、条件を変えた追試と失敗例です。
この読み方に出てくる言葉(4語)
- 事前学習
大規模データから一般的な予測能力を獲得する学習段階。
- 強化学習
行動への報酬が高くなるよう方策を更新する学習。
- 推論
学習済みモデルから出力を生成する処理。
- トークン
言語モデルが入出力を扱う離散的な単位。
どんな問いに向き合ったか
MetaのLlama 3.1 70Bを多くのベンチマークで凌駕し、特にコーディング(HumanEval 86.6%)と数学(MATH 83.1%)でオープンモデルの新たな高いを確立しました。
肝のアイデア
GQA、SwiGLU、RMSNormを採用。長文対応のためRoPE base frequencyを 106 に拡張し128kトークンをサポート。SFTに加え、ルールベース検証器を用いたマルチステージ強化学習を導入しました。
・18Tトークンに及ぶ大規模多言語・コード事前学習コーパスの構築
どう確かめ、何が分かったか
著者らは72BモデルについてMMLU 86.8%、MMLU-Pro 71.6%、MATH 83.1%、GSM8K 91.6%を報告しました。これらは技術報告書のモデル版、プロンプト、採点条件に基づく値であり、課題全般の能力を一つの順位として示すものではありません。
注意すべきこと
・72Bモデルの推論メモリフットプリント(FP16で約144GB、AWQ/GPTQ量子化で約40GB)
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
Qwen2.5は複数の数学・コード・多言語ベンチマークで既存の比較モデルを上回る値を報告しています。したがって、対象条件が近い場合は、一つのモデル系列から、計算予算に応じたサイズを選ぶ設計には意味があります。ただし、評価値は著者報告であり、大型モデルには大きな計算資源が必要です
この読み方に出てくる言葉(6語)
- 事前学習
大規模データから一般的な予測能力を獲得する学習段階。
- 強化学習
行動への報酬が高くなるよう方策を更新する学習。
- 推論
学習済みモデルから出力を生成する処理。
- トークン
言語モデルが入出力を扱う離散的な単位。
- パラメータ
モデルがデータから学習する重み。
- RLHF
人間の選好を報酬へ変換して言語モデルを最適化する方法。
どんな問いに向き合ったか
商用プロプライエタリモデル(GPT-4o、Claude 3.5 Sonnet)に匹敵するコード生成力と数学的推論力をオープンウェイトで実現。特に32Bサイズが前世代の72Bを上回るパラメータ効率を達成し、オンプレミス・エッジ運用の経済性を激変させました。
従来の方法と課題
この研究が比べた従来案と課題は、提案の説明では次のように位置づけられています。
商用プロプライエタリモデル(GPT-4o、Claude 3.5 Sonnet)に匹敵するコード生成力と数学的推論力をオープンウェイトで実現。特に32Bサイズが前世代の72Bを上回るパラメータ効率を達成し、オンプレミス・エッジ運用の経済性を激変させました。
肝のアイデア
・合成データ生成によるコード・数学推論トレースの多段拡張パイプライン
・128kコンテキストにおける情報抽出能力と最大8kトークンの生成能力
どういうしくみか
アーキテクチャ:Qwen2.5-72Bはレイヤー数80、アテンションヘッド数64、KVヘッド数8(GQA)、隠れ層次元8192。長文対応にはRoPEの基底周波数を 106 に設定。ポストトレーニングでは、高品質な指示データによるSFTに加え、数学の記号検証器やコードのサンドボックス実行環境によるフィードバックを用いた強化学習(RLHF/DPO/PPO)を適用しました。
どう確かめたか
著者報告の結果は次の評価条件に基づきます。
・MMLU 86.8%, GPQA 49.3%, MATH 83.1%を記録し、オープンウェイトモデルとして首位を獲得
・HumanEval 86.6%, EvalPlus 81.7%により、専用コーディングモデルに匹敵するプログラム生成精度を達成
何が分かったか
著者報告の結果は次の評価条件に基づきます。
・Needle In A Haystack評価において、128k長・全深度で100%のリトリーバル精度を達成
どこまで使えるか
この結果が直接支えるのは、論文が評価した課題と比較条件です。別の用途へ広げる場合は、同じ傾向が保たれるかを改めて測る必要があります。
・構造化データ出力(JSON、YAML)およびツール利用(Function Calling)における誤り率の極小化
限界と未解決の問い
・72Bの大規模運用にはTensor Parallelism(TP=2または4)が必須となり、ノード間通信環境への配慮が必要
・推論時の安全ガードレールが厳格なクエリにおいて過度に保守的な応答(過剰拒絶)を示すケースがある
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
Qwen2.5は複数の数学・コード・多言語ベンチマークで既存の比較モデルを上回る値を報告しています。この観察が自分のデータと計算条件でも保たれるなら、一つのモデル系列から、計算予算に応じたサイズを選ぶ設計には意味があります。評価値は著者報告であり、大型モデルには大きな計算資源が必要ですので、同じbaselineとmetricでの比較が前提です。
この読み方に出てくる言葉(6語)
- 強化学習
行動への報酬が高くなるよう方策を更新する学習。
- 推論
学習済みモデルから出力を生成する処理。
- トークン
言語モデルが入出力を扱う離散的な単位。
- パラメータ
モデルがデータから学習する重み。
- ベンチマーク
モデル性能を比較する標準化された評価課題。
- 損失
予測と目標のずれを表す最適化対象。
問題設定と前提
モデルスケーリングの成功要因が『データ量』から『データ品質と推論データ比率』へと移行したことを示し。オープンモデルが直面していた数学・コードの壁を自律的合成データ生成と環境フィードバックで打ち破った開発論の集大成です。
関連研究の中での位置づけ
商用プロプライエタリモデル(GPT-4o、Claude 3.5 Sonnet)に匹敵するコード生成力と数学的推論力をオープンウェイトで実現。特に32Bサイズが前世代の72Bを上回るパラメータ効率を達成し、オンプレミス・エッジ運用の経済性を激変させました。
提案手法の全体像
提案の流れは次の要素から成ります。
・自己指導型合成データ拡張(Evol-Instruct + Execution Verification)による高難度推論データの自律生成
・GQAと長文RoPEスケーリングの相乗効果による128k超長文処理の高速・低メモリ化
定式化と設計判断
構造諸元:Qwen2.5-72B(L=80,d=8192,dffn=29568,HQ=64,HKV=8)。アテンション計算にはGQAを採用しKVキャッシュ消費を1/8に圧縮。RoPE周波数 θ=106 による位置符号化外挿。データエンジニアリング:18Tトークン中、プログラミングおよび数学データの割合を大幅に増強。ポストトレーニング:段階的強化学習を採用。第1段階でDPOによる選好整流、第2段階で環境フィードバック(ユニットテスト通過、数式等価性判定)に基づくPPO強化学習を実施し、ハルシネーションを抑制。
学習・推論・実験条件
既存の記述だけでは、学習・推論条件の全項目を特定できません。この不足は再現性を判断する際の留保です。
評価設計
著者報告の結果は次の評価条件に基づきます。 データセット、指標、比較対象をそろえて読む必要があります。
・MMLU 86.8%, MMLU-Pro 71.6%, GPQA 49.3%(Llama 3.1 70B: MMLU 83.6%, MATH 68.0%を大きく凌駕)
・MATH 83.1%, GSM8K 91.6%(オープンモデルで数学的推論能力)
何が分かったか
著者報告の結果は次の評価条件に基づきます。
・HumanEval 86.6%, MultiPL-E(Python, C++, Java, JS, etc.)で平均75%以上の高精度コード生成を達成
・128kトークンのPasskeyリトリーバルにおいて深度0%〜100%全域で精度100%を記録
アブレーションと失敗例
・0.5Bから72Bに至る全7サイズにおいて、Compute-Optimalな学習損失と下流タスク精度の整合性を実証
既存の記述で個別の除去実験が確認できない要素については、各部品の寄与を切り分けられません。失敗条件としては、後述の制約を同時に見る必要があります。
別の解釈と評価上の注意
報告された差は提案手法だけでなく、データ、モデル規模、計算条件、比較対象の違いを含む可能性があります。したがって、ここで支持されるのは論文の評価設定内の結論です。
限界と未解決の問い
・VRAM要件:72BモデルのFP16推論には約144GBのVRAMが必要であり、A100/H100 80GBが2基以上、または4bit量子化(AWQ)による40GB以上のメモリ確保が前提
・モデルサイズ間の性能ギャップ:7B以下では数学・推論における難問解決能力が大幅に低下するスケーリング限界
残された問い
残る問いは、報告された改善が別のデータや規模でも保たれるか、そして次の制約をどこまで減らせるかです。
・VRAM要件:72BモデルのFP16推論には約144GBのVRAMが必要であり、A100/H100 80GBが2基以上、または4bit量子化(AWQ)による40GB以上のメモリ確保が前提
・モデルサイズ間の性能ギャップ:7B以下では数学・推論における難問解決能力が大幅に低下するスケーリング限界
追試では同じ比較条件を再現したうえで、未報告の条件と失敗例を分けて測る必要があります。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
Qwen2.5は複数の数学・コード・多言語ベンチマークで既存の比較モデルを上回る値を報告しています。結果から得られる示唆は次の通りです。一つのモデル系列から、計算予算に応じたサイズを選ぶ設計には意味があります。ただし、この観察だけで因果関係までは確定できません。評価値は著者報告であり、大型モデルには大きな計算資源が必要です。再現実験では条件を固定し、分布外データと失敗率を併記すべきです。
この読み方に出てくる言葉(4語)
- 事前学習
下流適応に先立つpre-training段階。
- 強化学習
報酬信号に基づいて方策を最適化するreinforcement learning。
- 推論
学習済みパラメータを用いるinference。
- トークン
tokenizerで離散化された系列単位。
どんな問いに向き合ったか
MetaのLlama 3.1を包括的に凌駕し、オープンモデルとして初めて商用プロプライエタリフロンティアモデルと正面から競合可能な推論・コード・多言語性能を示しました。
肝のアイデア
GQA、SwiGLU、RoPE(θ=106)を統合。18Tトークンの高品質コーパス事前学習と、ルールベース検証器(コード実行・数学示し)による強化学習ポストトレーニングを実施しました。
・18兆トークンに及ぶ事前学習データセットの構築と多言語・コード領域の大きな拡充
どう確かめ、何が分かったか
以下は論文で報告された評価結果であり、独立検証済みの値ではありません。
・MMLU 86.8%, MMLU-Pro 71.6%(Llama 3.1 70B: 83.6%を凌駕)
・MATH 83.1%(オープンモデル世界トップクラス)
注意すべきこと
・72Bモデルにおけるハードウェアサービング要件(マルチGPU構成)
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
Qwen2.5は複数の数学・コード・多言語ベンチマークで既存の比較モデルを上回る値を報告しています。この結果から得られる示唆は次の通りです。一つのモデル系列から、計算予算に応じたサイズを選ぶ設計には意味があります。ただし、評価値は著者報告であり、大型モデルには大きな計算資源が必要です
この読み方に出てくる言葉(7語)
- 基盤モデル
広範なコーパスで事前学習されたfoundation model。
- 事前学習
下流適応に先立つpre-training段階。
- 強化学習
報酬信号に基づいて方策を最適化するreinforcement learning。
- 推論
学習済みパラメータを用いるinference。
- トークン
tokenizerで離散化された系列単位。
- ベンチマーク
既定データセットと指標からなるbenchmark。
- 指示チューニング
instruction-responseデータによるinstruction tuning。
どんな問いに向き合ったか
従来オープンモデルの弱点とされてきた数学・プログラミング・非英語多言語の3大領域を克服し、汎用基盤モデルとしての完成度を高めました。
従来の方法と課題
この研究が比べた従来案と課題は、提案の説明では次のように位置づけられています。
従来オープンモデルの弱点とされてきた数学・プログラミング・非英語多言語の3大領域を克服し、汎用基盤モデルとしての完成度を高めました。
肝のアイデア
・高品質合成データ(Evol-Instruct + Code execution validation)の大規模統合
・GQAと拡張RoPEによる128kコンテキスト長におけるNeedle In A Haystack 100%達成
どういうしくみか
アーキテクチャ:Qwen2.5-72B(L=80,d=8192,dffn=29568,HQ=64,HKV=8、SwiGLU、RMSNorm)。RoPE基底周波数 θ=106。データセット:ウェブテキスト、書籍、コード、合成推論トレースを含む18Tトークン。ポストトレーニング:指示チューニング(SFT)後に、数学問題に対する記号ソルバーフィードバックおよびコードに対する単体テスト実行結果を報酬とする強化学習(RL)を展開しました。
どう確かめたか
以下は論文で報告された評価結果であり、独立検証済みの値ではありません。
・MMLU 86.8%, GPQA 49.3%, MATH 83.1%, GSM8K 91.6%を記録
・HumanEval 86.6%, MBPP 85.0%, EvalPlus 81.7%を達成
何が分かったか
以下は論文で報告された評価結果であり、独立検証済みの値ではありません。
・日本語・中国語を含む29以上の言語ベンチマークで商用モデル同等の理解力を実証
どこまで使えるか
この結果が直接支えるのは、論文が評価した課題と比較条件です。別の用途へ広げる場合は、同じ傾向が保たれるかを改めて測る必要があります。
・32Bモデルにおけるアーキテクチャ効率の最適化(前世代72B超えの実現)
限界と未解決の問い
・大規模分散学習におけるクラスタフォールトトレランスとチェックポイント同期オーバーヘッド
・推論時におけるロングコンテキストKVキャッシュのVRAMフットプリント
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
Qwen2.5は複数の数学・コード・多言語ベンチマークで既存の比較モデルを上回る値を報告しています。このevidenceが同一protocolで再現される範囲では、一つのモデル系列から、計算予算に応じたサイズを選ぶ設計には意味があります。ただし、評価値は著者報告であり、大型モデルには大きな計算資源が必要です。reported setting外への一般化には追加評価が要ります。
この読み方に出てくる言葉(8語)
- 基盤モデル
広範なコーパスで事前学習されたfoundation model。
- 事前学習
下流適応に先立つpre-training段階。
- 強化学習
報酬信号に基づいて方策を最適化するreinforcement learning。
- 位置埋め込み
トークン位置を表現へ注入するpositional embedding。
- 推論
学習済みパラメータを用いるinference。
- スケーリング則
モデル規模・データ量・計算量に対するlossのpower-law関係。
- トークン
tokenizerで離散化された系列単位。
- パラメータ
最適化対象となるmodel parameters。
問題設定と前提
Meta(Llama)、Google(Gemma)、Mistral等の欧米勢が主導してきたオープンLLM研究において、アジア発のモデルが数学・コード・多言語という最高難度の知的領域で世界的リーダーシップを確立した分岐点です。
関連研究の中での位置づけ
従来オープンモデルの弱点とされてきた数学・プログラミング・非英語多言語の3大領域を克服し、汎用基盤モデルとしての完成度を高めました。
提案手法の全体像
提案の流れは次の要素から成ります。
・環境フィードバック型強化学習(Execution-guided Reinforcement Learning)の全スケールへの適用
・合成データの生成・フィルタリングループによるハルシネーション率の客観的低減
定式化と設計判断
数理設計:アテンション層におけるGQA構成比率 HKVHQ=8。RoPE位置埋め込み:RΘ,md において θi=1000000−2(i−1)/d。事前学習コーパス:18Tトークンの多段階カリキュラム学習(初期段階での広範な汎用知識獲得から、後半段階における高品質コード・数学・推論データのウェイト引き上げ)。強化学習定式化:目的関数 maxθE(x,y)∼D[R(x,y)]−βDKL(πθ(y∣x)∥πref(y∣x))。ここで報酬 R(x,y) は人間選好モデルに加え、コードコンパイラ実行結果 I(Pass) および数学ソルバー検証結果 I(Correct) を直接報酬シグナルとして統合。
学習・推論・実験条件
既存の記述だけでは、学習・推論条件の全項目を特定できません。この不足は再現性を判断する際の留保です。
評価設計
以下は論文で報告された評価結果であり、独立検証済みの値ではありません。 データセット、指標、比較対象をそろえて読む必要があります。
・Qwen2.5-72B-Instruct: MMLU 86.8%, MMLU-Pro 71.6%, GPQA Diamond 49.3%, MATH 83.1%
・HumanEval 86.6%, MultiPL-E(複数言語平均)75.8%を達成し、Claude 3.5 SonnetやGPT-4oと並ぶコード生成水準を記録
何が分かったか
以下は論文で報告された評価結果であり、独立検証済みの値ではありません。
・128kトークンコンテキスト長におけるNeedle In A Haystack評価で全レイヤー・全位置100%の正解率を保持
・32BモデルがMMLU 83.3%, MATH 78.4%を記録し、前世代Qwen1.5-72B(MMLU 77.5%)を大きく上回る
アブレーションと失敗例
・全7モデルサイズ(0.5B〜72B)におけるハイパーパラメータスケーリング則の追跡可能性
既存の記述で個別の除去実験が確認できない要素については、各部品の寄与を切り分けられません。失敗条件としては、後述の制約を同時に見る必要があります。
別の解釈と評価上の注意
報告された差は提案手法だけでなく、データ、モデル規模、計算条件、比較対象の違いを含む可能性があります。したがって、ここで支持されるのは論文の評価設定内の結論です。
限界と未解決の問い
・極小パラメータモデル(0.5B/1.5B)における合成データの暗記・過剰適合(Overfitting)リスク
・高コンテキスト推論時における分散アテンションカーネルの通信同期レイテンシ
残された問い
残る問いは、報告された改善が別のデータや規模でも保たれるか、そして次の制約をどこまで減らせるかです。
・極小パラメータモデル(0.5B/1.5B)における合成データの暗記・過剰適合(Overfitting)リスク
・高コンテキスト推論時における分散アテンションカーネルの通信同期レイテンシ
追試では同じ比較条件を再現したうえで、未報告の条件と失敗例を分けて測る必要があります。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
Qwen2.5は複数の数学・コード・多言語ベンチマークで既存の比較モデルを上回る値を報告しています。この観測から得られる示唆は次の通りです。一つのモデル系列から、計算予算に応じたサイズを選ぶ設計には意味があります。ただし、代替要因は残ります。評価値は著者報告であり、大型モデルには大きな計算資源が必要です。確認すべきなのは、同一条件での再現、ablation、distribution shift下の結果です。