Tier 2: 現代の標準技術モデルアーキテクチャ・オープンモデルHF 750 votes
Qwen2.5オープンモデル合成データ

Qwen2.5 技術報告書:コード・数学・長文推論におけるオープン基盤モデルの包括的フロンティア

0.5Bから72Bまで同一アーキテクチャで網羅。18兆トークン事前学習と合成データ強化学習により、オープンソースLLMの標準的到達点を大幅に押し上げた決定打

Qwen2.5 Technical Report

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

Qwen2.5は、小型から大型まで七つのサイズをそろえ、数学、プログラミング、多言語、長い文章の処理を幅広く評価した公開モデル群です。

Qwen2.5は、最大18兆個の文章単位を学び、0.5Bから72Bまで同じ設計方針で展開したモデル群です。著者らは数学、コード、多言語、長文の共通テストで性能を報告しました。

Qwen2.5の報告書は、学習データの拡張、合成データ、回答を調整する追加学習、長文対応を一つのモデル群でどう組み合わせたかを説明します。結果は幅広い一方、サイズごとの能力差と計算資源の大きさも残ります。

Qwen2.5は、0.5B〜72Bのモデル群を最大18Tトークンで事前学習し、数学・コード・多言語・長文処理を評価した技術報告です。

Qwen2.5は、GQA、SwiGLU、RMSNorm、RoPEを用いるモデル群に、拡張コーパスと段階的なポストトレーニングを組み合わせています。著者らは各サイズを複数ベンチマークで比較しました。

Qwen2.5報告書は、モデル系列、18Tトークンのデータ設計、長文対応、合成データを含むポストトレーニング、サイズ別評価をまとめています。評価値は著者報告であり、計算条件と小型モデルへの一般化を分けて読む必要があります。

Qwen2.5 Technical Reportは、0.5B〜72Bのdense model familyと専門モデルの学習・評価を記述した報告です。

本報告は、GQAを含むモデル仕様、最大18T tokensのpre-training、instruction tuningとRL、128K context評価、および一般・数学・コード・多言語benchmarkを示します。

本報告を読む焦点は、Qwen2.5 familyのdata mixture、architecture、post-training、long-context extensionと、各benchmarkがどの主張を支えるかです。著者報告値とモデルサイズ別の制約を切り分けます。

Qwen Team, Alibaba CloudAlibaba Cloud
Junyang LinAlibaba Cloud
著者をもっと詳しく知る

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

Qwen Team, Alibaba Cloud
所属
: Alibaba Cloud
学歴
: Alibaba Cloudの大規模基盤モデル研究開発グループ。
研究の系譜
: Qwen-7B/14B/72B、Qwen1.5、Qwen2、Qwen2.5、Qwen2.5-Coder/Mathを継続的に開発・オープン化。
代表的な論文
: 18Tトークン事前学習、合成データ強化学習、長文推論パイプラインの設計
Junyang Lin
所属
: Alibaba Cloud
学歴
: Qwenプロジェクトのリードサイエンティスト・責任者。
研究の系譜
: 自然言語処理、マルチモーダルモデル、オープンソースLLMスケーリングの権威。
代表的な論文
: Qwen2.5プロジェクトの統括と全体アラインメント戦略の主導

なぜ歴史的イノベーションなのか

Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。

Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。

Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。

Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。

Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。

Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。

Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。

Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。

Alibaba CloudのQwenチームが放ったQwen2.5ファミリーは、特にプログラミング(Coder)と数学(Math)において商用最高峰モデルを凌駕し、世界中の開発環境に組み込まれました。

コミュニティの評価・歴史的インパクト(1件)
  • ローカルAIやエージェント開発においてQwen2.5を使わない日はない。極めて安定した指示追従性と驚異的なコーディング能力。

    原文を見る ↗
この読み方に出てくる言葉(6語)
事前学習

大規模データから一般的な予測能力を獲得する学習段階。

強化学習

行動への報酬が高くなるよう方策を更新する学習。

推論

学習済みモデルから出力を生成する処理。

トークン

言語モデルが入出力を扱う離散的な単位。

パラメータ

モデルがデータから学習する重み。

RLHF

人間の選好を報酬へ変換して言語モデルを最適化する方法。

どんな問いに向き合ったか

商用プロプライエタリモデル(GPT-4o、Claude 3.5 Sonnet)に匹敵するコード生成力と数学的推論力をオープンウェイトで実現。特に32Bサイズが前世代の72Bを上回るパラメータ効率を達成し、オンプレミス・エッジ運用の経済性を激変させました。

従来の方法と課題

この研究が比べた従来案と課題は、提案の説明では次のように位置づけられています。

商用プロプライエタリモデル(GPT-4o、Claude 3.5 Sonnet)に匹敵するコード生成力と数学的推論力をオープンウェイトで実現。特に32Bサイズが前世代の72Bを上回るパラメータ効率を達成し、オンプレミス・エッジ運用の経済性を激変させました。

肝のアイデア

・合成データ生成によるコード・数学推論トレースの多段拡張パイプライン

・128kコンテキストにおける情報抽出能力と最大8kトークンの生成能力

どういうしくみか

アーキテクチャ:Qwen2.5-72Bはレイヤー数80、アテンションヘッド数64、KVヘッド数8(GQA)、隠れ層次元8192。長文対応にはRoPEの基底周波数を 10610^6 に設定。ポストトレーニングでは、高品質な指示データによるSFTに加え、数学の記号検証器やコードのサンドボックス実行環境によるフィードバックを用いた強化学習(RLHF/DPO/PPO)を適用しました。

どう確かめたか

著者報告の結果は次の評価条件に基づきます。

・MMLU 86.8%, GPQA 49.3%, MATH 83.1%を記録し、オープンウェイトモデルとして首位を獲得

・HumanEval 86.6%, EvalPlus 81.7%により、専用コーディングモデルに匹敵するプログラム生成精度を達成

何が分かったか

著者報告の結果は次の評価条件に基づきます。

・Needle In A Haystack評価において、128k長・全深度で100%のリトリーバル精度を達成

どこまで使えるか

この結果が直接支えるのは、論文が評価した課題と比較条件です。別の用途へ広げる場合は、同じ傾向が保たれるかを改めて測る必要があります。

・構造化データ出力(JSON、YAML)およびツール利用(Function Calling)における誤り率の極小化

限界と未解決の問い

・72Bの大規模運用にはTensor Parallelism(TP=2または4)が必須となり、ノード間通信環境への配慮が必要

・推論時の安全ガードレールが厳格なクエリにおいて過度に保守的な応答(過剰拒絶)を示すケースがある

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

Qwen2.5は複数の数学・コード・多言語ベンチマークで既存の比較モデルを上回る値を報告しています。この観察が自分のデータと計算条件でも保たれるなら、一つのモデル系列から、計算予算に応じたサイズを選ぶ設計には意味があります。評価値は著者報告であり、大型モデルには大きな計算資源が必要ですので、同じbaselineとmetricでの比較が前提です。