基盤モデル効率的学習長文脈モデル

ZGCM-1:内部推論とツール利用を統合した高効率な7B基盤モデル

7.39Bモデルは長文脈・段階学習・外部ツールで容量制約をどこまで補えるか

ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

ZGCM-1は、覚えられる情報量が限られた小さめのAIに、長く考える力と外の道具で調べる力を組み合わせたモデルです。著者らは、長い文章を扱うときの負担を抑える仕組みと、道具の使い方を学ぶ手順を一つにまとめました。数学やWeb調査では強い結果を報告する一方、道具なしの知識問題や一般的な端末操作には弱さが残ります。

ZGCM-1は、7.39Bという規模のAIに、長い文章を扱う仕組み、段階を追って考える学習、検索や解析道具の利用をまとめた研究です。著者らは、モデルの中にすべてを覚え込ませるのではなく、必要な情報を外から得る力で容量の限界を補おうとしました。数学、Web調査、プログラム解析では一部の強い結果を報告していますが、知識の暗記、一般的なソフトウェア修正、端末操作には明確な弱さがあります。

ZGCM-1は、7.39Bの小さめなAIが持つ「内部に覚えられる量」の限界を、長く考えることと外部ツールで調べることで補おうとした研究です。近くの言葉を見る処理を多くし、文章全体を見る処理を少数だけ置くことで、最大256Kの長い入力を扱います。学習する文章を段階的に長くし、道具を使った記録を「今の状況から次の行動を選ぶ問題」へ変換します。数学、Web調査、プログラム解析で成果を報告しますが、比較条件、道具の安定性、知識の暗記、一般的な端末作業には重要な限界があります。

ZGCM-1は、7.39B dense modelの容量制約を、長い内部推論と外部ツールによる情報取得で補う設計です。32層を27層のgated sliding-window attentionと5層のglobal attentionに分け、段階的な長文脈化と、状態から次行動を予測する中間学習を統合します。数学・検索・バイナリ解析で競争力のある値を報告しますが、closed-book想起と一般的なソフトウェア操作は弱いままです。

ZGCM-1は、7.39B dense foundation modelのパラメータ容量を内部推論と外部ツール利用で補うという仮説を、ハイブリッド注意、FP8学習、段階的長文脈化、MDP形式の中間学習、SFTとRLに落とし込んだ研究です。長文脈のスループットとKV cache、数学、Web検索、バイナリ解析で肯定的な結果を報告します。一方、効率4.2倍は複数要因の積による概算であり、Web比較や一般エージェンシーにも重要な条件があります。

ZGCM-1は、7.39B dense modelの容量制約を、内部推論と外部情報取得の結合で補うend-to-end設計です。27層のgated SWAと5層のglobal attention、FP8・Muon・TWEO、16Kから256Kへのcurriculum、MDP形式のagent mid-training、混合SFT、結果報酬によるRLを統合します。長文脈効率、数学、Web調査、Binary Function Searchに肯定的な結果がありますが、比較の統制、closed-book知識、一般エージェンシー、環境依存性が結論の範囲を限定します。

ZGCM-1は、7.39B dense modelのparametric capacityをdeliberate reasoningとactive tool useで補うことを狙い、5:1のgated SWA/global attention、FP8-Muon training、progressive context extension、MDP-style agent mid-trainingを統合した公開レシピです。長文脈効率と数学・agentic searchで強い結果を報告しますが、closed-book recall、一般エージェンシー、評価環境依存性が主な境界です。

ZGCM-1は、compact dense modelの容量制約をinternal reasoningとexternal tool useの結合で補うという設計仮説を、architecture-system co-designからpost-trainingまで一貫して実装した7.39B modelです。27 gated SWA layersと5 global layers、FP8-Muon-TWEO、16K→64K→256K curriculum、MDP-style trace reformulation、mixed SFT、GRPOを統合します。長文脈効率と複数benchmarkで競争力を示す一方、4.2倍効率は合成推定であり、Web比較と一般エージェンシーには厳しい限定があります。

ZGCM-1は、7.39B dense foundation modelのparametric capacityをinternal deliberationとactive external retrievalで補う仮説を、architecture、numerics、curriculum、agent supervision、post-trainingのco-designとして提示します。5:1 gated SWA/global attention、hybrid FP8とMuon/TWEO、16K→64K→256K mid-training、MDP-style trace decomposition、mixed think/no-think SFT、GRPOを統合し、stage-wise artifactsの公開を掲げます。長文脈効率、数学、Web search、binary analysisで有望な結果を報告しますが、効率値の合成推定、非統一Web baseline、closed-book capacity、general agency failureが主張を限定します。

著者をもっと詳しく知る(全22名)

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

全著者と所属

  1. Jiyan He
    所属情報なし
  2. Guang Liang
    所属情報なし
  3. Hao Liu
    所属情報なし
  4. Haoxiang Guan
    所属情報なし
  5. Jinbo Sun
    所属情報なし
  6. Junyi Guo
    所属情報なし
  7. Wenjun Feng
    所属情報なし
  8. Yantai Xie
    所属情報なし
  9. Yifei Shen
    所属情報なし
  10. Bin Shao
    所属情報なし
  11. Chuyang Wei
    所属情報なし
  12. Kai Chen
    所属情報なし
  13. Kexin Zhou
    所属情報なし
  14. Minghang Zhu
    所属情報なし
  15. Shuxin Zheng
    所属情報なし
  16. Tie-Yan Liu
    所属情報なし
  17. Taine Zhao
    所属情報なし
  18. Wenhui Zhu
    所属情報なし
  19. Xueyin Xu
    所属情報なし
  20. Xiaoqing Zhang
    所属情報なし
  21. Yatao Li
    所属情報なし
  22. Yuxuan Ren
    所属情報なし

確認できた研究背景

Jiyan He
関連情報
: 論文ではProject Leadとして記載。
Guang Liang
関連情報
: 論文ではCore Contributorとして記載。
Hao Liu
関連情報
: 論文ではCore Contributorとして記載。
Haoxiang Guan
関連情報
: 論文ではCore Contributorとして記載。
Jinbo Sun
関連情報
: 論文ではCore Contributorとして記載。
Junyi Guo
関連情報
: 論文ではCore Contributorとして記載。
Wenjun Feng
関連情報
: 論文ではCore Contributorとして記載。
Yantai Xie
関連情報
: 論文ではCore Contributorとして記載。
Yifei Shen
関連情報
: 論文ではCore Contributorとして記載。
Bin Shao
関連情報
: 論文ではContributorとして記載。
Chuyang Wei
関連情報
: 論文ではContributorとして記載。
Kai Chen
関連情報
: 論文ではContributorとして記載。
Kexin Zhou
関連情報
: 論文ではContributorとして記載。
Minghang Zhu
関連情報
: 論文ではContributorとして記載。
Shuxin Zheng
関連情報
: 論文ではContributorとして記載。
Tie-Yan Liu
関連情報
: 論文ではContributorとして記載。
Taine Zhao
関連情報
: 論文ではContributorとして記載。
Wenhui Zhu
関連情報
: 論文ではContributorとして記載。
Xueyin Xu
関連情報
: 論文ではContributorとして記載。
Xiaoqing Zhang
関連情報
: 論文ではContributorとして記載。
Yatao Li
関連情報
: 論文ではContributorとして記載。
Yuxuan Ren
関連情報
: 論文ではContributorとして記載。

なぜ注目されているか

Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。

Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。

Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。

Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。

Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。

Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。

Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。

Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。

Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。

議論全体へのリンク
この読み方に出てくる言葉(6語)
gated SWAGatedSWA

局所窓の注意出力を、入力から学習した要素単位のgateで調整する注意層です。

この論文では

128-token windowで27層に用いられます。

Muon

主に行列パラメータへ適用する最適化手法です。

この論文では

スカラーパラメータ用Adamと併用されます。

FP8FP8

行列積を8-bit浮動小数点で計算し、計算効率を狙う数値形式です。

この論文では

forwardにE4M3、backwardにE5M2を使います。

SFTSFT

望ましい推論、回答、tool callの例を教師として行う追加学習です。

GRPOGRPO

複数出力の相対的な報酬を利用する強化学習手法です。

mean pass@1mean pass@1

複数回の試行について、一回の生成で正解する確率を平均した指標です。

この論文では

非エージェント課題は原則32 runsで測ります。

どんな問いに向き合ったか

7B級のdense modelでは、静的知識容量と計算量が限られます。研究課題は、256Kの長文脈、数学的推論、環境観測に応じた複数段階のツール利用を、一つの効率的な学習系で獲得できるかです。加えて、重みだけでなく段階別checkpoint、学習コード、data recipe、ログ、評価系まで公開し、設計判断を追跡可能にすることを目指します。

従来の方法と課題

比較対象となる設計は、全層full attention、BF16とAdamWによる標準的事前学習、最初から256Kへ拡張する経路、対話軌跡全体の模倣です。注意機構についてはMLA、linear attention、複数のSWA比率も比較されます。full attentionは長距離関係を各層で扱えますが、系列長とともに注意計算とKV cacheが重くなります。完全軌跡だけの学習は長期的な流れを保持する一方、各観測から次行動を選ぶ局所的な教師信号を明示しにくいという位置付けです。

肝のアイデア

32層のうち27層を128-token gated SWA、5層をglobal causal attentionとし、局所対大域を5:1で配置します。局所層は近傍の情報統合を低コストで行い、global層は窓を越える依存関係の経路を提供します。学習系はMuon、Adam、hybrid FP8、delayed scaling、TWEOを組み合わせます。データ面では16Kから64K、256Kへ文脈を拡張し、agent traceをMDP風の状態・行動例へ再構成します。

どういうしくみか

gated SWAでは、局所注意の出力と、現在のhidden stateから得たsigmoid gateを要素単位で掛け、出力射影へ渡します。gateは局所情報をどの程度通すかを入力依存で調整します。global層を残すことで、局所窓だけでは結べない遠距離情報の伝達経路を確保します。

中間学習では、タスク、対話履歴、現在の環境フィードバックをstateとし、次のtool actionをtargetにします。これにより、長い軌跡全体の再現だけでなく、観測後の意思決定を直接教師化します。完全軌跡も併用するため、局所的な方策学習と長期的整合性を両立させる設計です。

どう確かめたか

公開256K SFT checkpointをthink modeで評価し、非エージェント課題は原則32 runsのmean pass@1を報告します。Web評価は最大64 search-and-read stepsを許します。Binary Function Searchは10 projectsから各5件の50 tasksを作り、Ghidra経由でfunction-entry ELF virtual addressが厳密一致した場合のみ正解です。

効率比較では同一7B backboneと一定tokens/stepを用います。KV cache比較はbatch 1、bf16、256K、等パラメータです。評価条件が異なるため、数学スコア、Webスコア、exact-address accuracyを単一尺度として扱うことはできません。

何が分かったか

SWA 5:1のfull attention比スループットは4Kで1.13倍、256Kで3.94倍でした。256KのKV cacheは5.0 GiBで、full attentionの32.0 GiBに対して6.4倍の削減です。10B-token、sequence length 4,096、8 H100の比較では、tail loss 1.93を保ち、9,566 tokens/s/GPUでした。

数学ではAIME 2026が75.00%、MATH-500が97.13%、HMMT 2025が70.42%です。WebではWebWalkerQA 63.09%、BrowseComp 19.43%、GAIA text-only 42.52%。Binary Function Searchは31/50、62.00%で、表中のQwen3-8Bは6/50、12.00%でした。すべて著者報告です。

どこまで使えるか

適用候補は、長文脈でKV cacheとattention throughputが制約となるモデル、外部検索や解析結果を受けて次行動を選ぶagent、SFTデータの量と品質を比較する研究です。検索なしで大量の静的知識を保持する用途、tool schemaや観測形式が頻繁に変わる環境、高い成功率が必須の一般的なrepository修正や非構造的terminal操作には適合しにくいと考えられます。

16K time-to-lossの約4.2倍は、SWA 1.4倍、FP8約1.5倍、Muonのstep-to-loss約1.8倍、Pre-LNの推定1.1倍を乗算した値です。単一のend-to-end対照ではなく、別環境の時間や費用へ直接移せません。

限界と未解決の問い

closed-book想起では7.39Bの静的知識容量が制約となり、大規模モデルに劣ります。長い推論教師を増やしすぎると冗長性が生じ、厳密なinstruction followingを損なう場合があります。一般エージェンシーの監査済み結果はSWE-bench Verified Mini50が2/50、Terminal-Bench 2.0が2/89です。

Web評価は検索日、provider、抽出、要約、LLM judge、retry policyに依存し、外部baselineの多くは統一環境での再実行ではありません。agent traceもschema整合性、観測ノイズ、tool-call形式、API latencyに敏感です。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

256KでKV cacheが32.0 GiBから5.0 GiBへ減ったという条件付き結果は、長文脈モデルでglobal attentionを全層に置く前提を再検討する材料です。別のモデル規模とハードウェアでもタスク精度が維持されるなら、global layerの比率を独立した設計変数として探索する価値があります。ただし、agent性能はtool schemaと環境応答の安定性にも依存します。したがって採用判断では、メモリとスループットに加え、長距離情報の取りこぼしと観測ノイズ下の軌跡成功率を同一環境で測るべきです。