ZGCM-1:内部推論とツール利用を統合した高効率な7B基盤モデル
7.39Bモデルは長文脈・段階学習・外部ツールで容量制約をどこまで補えるか
ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
論文の書誌情報と関連リンク
- arXiv初回投稿日
- 掲載先
- arXiv preprint, cs.AI, v1
読み方の2つの軸
現在:しくみ × 全体像
語彙 使うことば・数式・例え方
深さ 研究のどこまで読むか
この2本は、本文下のスライダーからいつでも変更できます。
概要
ZGCM-1は、覚えられる情報量が限られた小さめのAIに、長く考える力と外の道具で調べる力を組み合わせたモデルです。著者らは、長い文章を扱うときの負担を抑える仕組みと、道具の使い方を学ぶ手順を一つにまとめました。数学やWeb調査では強い結果を報告する一方、道具なしの知識問題や一般的な端末操作には弱さが残ります。
ZGCM-1は、7.39Bという規模のAIに、長い文章を扱う仕組み、段階を追って考える学習、検索や解析道具の利用をまとめた研究です。著者らは、モデルの中にすべてを覚え込ませるのではなく、必要な情報を外から得る力で容量の限界を補おうとしました。数学、Web調査、プログラム解析では一部の強い結果を報告していますが、知識の暗記、一般的なソフトウェア修正、端末操作には明確な弱さがあります。
ZGCM-1は、7.39Bの小さめなAIが持つ「内部に覚えられる量」の限界を、長く考えることと外部ツールで調べることで補おうとした研究です。近くの言葉を見る処理を多くし、文章全体を見る処理を少数だけ置くことで、最大256Kの長い入力を扱います。学習する文章を段階的に長くし、道具を使った記録を「今の状況から次の行動を選ぶ問題」へ変換します。数学、Web調査、プログラム解析で成果を報告しますが、比較条件、道具の安定性、知識の暗記、一般的な端末作業には重要な限界があります。
ZGCM-1は、7.39B dense modelの容量制約を、長い内部推論と外部ツールによる情報取得で補う設計です。32層を27層のgated sliding-window attentionと5層のglobal attentionに分け、段階的な長文脈化と、状態から次行動を予測する中間学習を統合します。数学・検索・バイナリ解析で競争力のある値を報告しますが、closed-book想起と一般的なソフトウェア操作は弱いままです。
ZGCM-1は、7.39B dense foundation modelのパラメータ容量を内部推論と外部ツール利用で補うという仮説を、ハイブリッド注意、FP8学習、段階的長文脈化、MDP形式の中間学習、SFTとRLに落とし込んだ研究です。長文脈のスループットとKV cache、数学、Web検索、バイナリ解析で肯定的な結果を報告します。一方、効率4.2倍は複数要因の積による概算であり、Web比較や一般エージェンシーにも重要な条件があります。
ZGCM-1は、7.39B dense modelの容量制約を、内部推論と外部情報取得の結合で補うend-to-end設計です。27層のgated SWAと5層のglobal attention、FP8・Muon・TWEO、16Kから256Kへのcurriculum、MDP形式のagent mid-training、混合SFT、結果報酬によるRLを統合します。長文脈効率、数学、Web調査、Binary Function Searchに肯定的な結果がありますが、比較の統制、closed-book知識、一般エージェンシー、環境依存性が結論の範囲を限定します。
ZGCM-1は、7.39B dense modelのparametric capacityをdeliberate reasoningとactive tool useで補うことを狙い、5:1のgated SWA/global attention、FP8-Muon training、progressive context extension、MDP-style agent mid-trainingを統合した公開レシピです。長文脈効率と数学・agentic searchで強い結果を報告しますが、closed-book recall、一般エージェンシー、評価環境依存性が主な境界です。
ZGCM-1は、compact dense modelの容量制約をinternal reasoningとexternal tool useの結合で補うという設計仮説を、architecture-system co-designからpost-trainingまで一貫して実装した7.39B modelです。27 gated SWA layersと5 global layers、FP8-Muon-TWEO、16K→64K→256K curriculum、MDP-style trace reformulation、mixed SFT、GRPOを統合します。長文脈効率と複数benchmarkで競争力を示す一方、4.2倍効率は合成推定であり、Web比較と一般エージェンシーには厳しい限定があります。
ZGCM-1は、7.39B dense foundation modelのparametric capacityをinternal deliberationとactive external retrievalで補う仮説を、architecture、numerics、curriculum、agent supervision、post-trainingのco-designとして提示します。5:1 gated SWA/global attention、hybrid FP8とMuon/TWEO、16K→64K→256K mid-training、MDP-style trace decomposition、mixed think/no-think SFT、GRPOを統合し、stage-wise artifactsの公開を掲げます。長文脈効率、数学、Web search、binary analysisで有望な結果を報告しますが、効率値の合成推定、非統一Web baseline、closed-book capacity、general agency failureが主張を限定します。
著者をもっと詳しく知る(全22名)
論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。
全著者と所属
- Jiyan He所属情報なし
- Guang Liang所属情報なし
- Hao Liu所属情報なし
- Haoxiang Guan所属情報なし
- Jinbo Sun所属情報なし
- Junyi Guo所属情報なし
- Wenjun Feng所属情報なし
- Yantai Xie所属情報なし
- Yifei Shen所属情報なし
- Bin Shao所属情報なし
- Chuyang Wei所属情報なし
- Kai Chen所属情報なし
- Kexin Zhou所属情報なし
- Minghang Zhu所属情報なし
- Shuxin Zheng所属情報なし
- Tie-Yan Liu所属情報なし
- Taine Zhao所属情報なし
- Wenhui Zhu所属情報なし
- Xueyin Xu所属情報なし
- Xiaoqing Zhang所属情報なし
- Yatao Li所属情報なし
- Yuxuan Ren所属情報なし
確認できた研究背景
- 関連情報
- : 論文ではProject Leadとして記載。
- 関連情報
- : 論文ではCore Contributorとして記載。
- 関連情報
- : 論文ではCore Contributorとして記載。
- 関連情報
- : 論文ではCore Contributorとして記載。
- 関連情報
- : 論文ではCore Contributorとして記載。
- 関連情報
- : 論文ではCore Contributorとして記載。
- 関連情報
- : 論文ではCore Contributorとして記載。
- 関連情報
- : 論文ではCore Contributorとして記載。
- 関連情報
- : 論文ではCore Contributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
- 関連情報
- : 論文ではContributorとして記載。
なぜ注目されているか
Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。
Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。
Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。
Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。
Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。
Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。
Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。
Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。
Hugging Faceで307件のupvoteと7件のコメントがあり、著者も議論に参加している。関連GitHubリポジトリは424 stars。
議論全体へのリンク
この読み方に出てくる言葉(3語)
- 文脈
AIが答えを作るときに一度に読んで手がかりにできる文章の範囲です。
- 局所注意
文章全体ではなく、近くにある言葉を中心に見る仕組みです。
- 外部ツール
検索や解析など、AIの外にある道具です。
どんな問いに向き合ったか
小さめのAIは、内部に覚えられる知識と使える計算量が限られます。それでも、長い文章を読み、数学を考え、検索などを何段階も使えるようにできるかが問いです。
肝のアイデア
32層のうち多くは近くの言葉だけを見て、少数の層だけが文章全体を見ます。さらに、過去のやり取りと道具から返った情報を見て、次に何をするかを学ばせます。たとえば、長い資料を読む人が、普段は今のページ周辺を読み、ときどき目次から全体を確かめ、分からない点は検索するような組み合わせです。ただし、AIが人と同じ読み方をするという意味ではありません。
どう確かめ、何が分かったか
著者らの比較では、長さ256Kの入力で、処理中に保持する記憶は全体を毎回見る方式の32.0 GiBに対して5.0 GiBでした。公開した学習途中のモデルを考えながら答える設定で試すと、AIME 2026は75.00%、MATH-500は97.13%、HMMT 2025は70.42%と報告されています。通常の課題は原則32回試した平均です。
注意すべきこと
結果は万能さを示しません。検索なしで知識を思い出す課題では大きなモデルに劣り、一般的なソフトウェア修正は50件中2件、端末操作は89件中2件でした。Webの点数も、検索日や使うサービス、採点役などで変わります。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
長い入力で必要な記憶が小さかったという報告は、すべてを常に見る設計を当然とせず、近くを見る部分と全体を見る部分を分けて試す理由になります。もし別の機械や大きさでも正確さを保てるなら、有力な選択肢でしょう。ただし、道具の返答や呼び出し方が不安定だと一連の作業は崩れるため、採用前に実際の環境で確かめる必要があります。
この読み方に出てくる言葉(5語)
- 密モデル
入力を処理するとき、部品の一部だけを選ぶのではなく、基本的に同じ一組の部品を使うAIです。
- 文脈
AIが一度に読み、答えの手がかりにできる文章の範囲です。
- 注意
答えを作る際に、入力中のどの言葉をどれほど参照するかを決める仕組みです。
- 学習途中のモデル
学習のある段階で保存したAIの状態です。
この論文では評価では、最大256Kの文章を扱うよう調整した状態が使われました。
- 正解率
用意された問題のうち、決められた採点方法で正解した割合です。
どんな問いに向き合ったか
小さめのAIは、内部に保存できる知識にも、一度に使える計算にも限りがあります。一方、数学では長く考えること、調査では検索結果を読みながら次の行動を選ぶこと、長い資料では遠く離れた情報を結び付けることが必要です。研究の問いは、これらを別々の追加機能にせず、一つの学習の流れで身につけさせられるかです。もう一つの問題は、競争力のあるモデルの作り方が公開されず、設計判断を他者が確かめにくいことでした。
従来の方法と課題
著者らが比べた標準的な方法は、各層が文章全体を見る設計と、一般的な数の表し方や調整方法を使う学習です。対話の学習では、一連のやり取りを最初から最後まで再現させる方法もあります。これらは分かりやすい一方、文章が長くなるほど処理中の記憶と計算が増えます。また、小さなAIが必要な事実をすべて内部に覚えるという考え方にも限界があります。
肝のアイデア
著者らは、32層のうち27層を近くの128語分だけを見る仕組みにし、5層を文章全体を見る仕組みにしました。近くを見る層には、得た情報をどれだけ次へ渡すかを調整する門もあります。モデル内部での推論に加え、検索などの外部ツールから情報を取る行動も学ばせます。重み、学習途中の状態、学習用コード、データの作り方、実験記録、試験用の仕組みを公開すると論文は述べています。
どういうしくみか
料理の練習帳で考えると、仕組みを追いやすくなります。普段は今読んでいる手順の周辺を確認し、ときどき最初から全体の流れを見直します。材料が分からなければ辞書で調べ、その結果を受けて次の手順を選びます。ZGCM-1も、近くを見る処理と全体を見る処理を組み合わせます。
学習する文章の長さは、16K、64K、256Kへ段階的に伸ばします。短い文章も後の段階で再び混ぜます。道具を使う記録は、仕事の説明、これまでのやり取り、道具から返った情報を「今の状態」としてまとめ、次に選ぶ行動を当てる短い問題へ作り替えます。完全なやり取りも併用します。この比較は理解の助けにすぎず、AIが手順の意味を人のように理解するとは限りません。
どう確かめたか
数学など道具を使わない課題では、最大256Kを扱う学習途中のモデルに、考える過程を出させ、原則32回試した平均の一回正解率を使いました。Web調査では検索と閲覧を最大64段階まで許しました。プログラム解析では、10個の計画から計50件を選び、目的の機能が始まる位置を完全に当てた場合だけ正解としました。このように課題ごとに採点法が異なるため、数字同士を単純に一つの能力として足し合わせることはできません。
何が分かったか
著者らは、AIME 2026で75.00%、MATH-500で97.13%、HMMT 2025で70.42%と報告しました。Web調査ではWebWalkerQAが63.09%、BrowseCompが19.43%、文字だけのGAIAが42.52%でした。プログラム中の目的の機能を探す試験では50件中31件、62.00%でした。
長い入力で処理中に保持する記憶は、長さ256K、同じ規模、同じ数の表し方という条件で5.0 GiBでした。文章全体を見る方式は32.0 GiBです。また、64Kで10B語分、その後256Kで20B語分を学ぶ順番では、間違いの小ささを示す値が1.16となり、256Kを30B語分だけ直接学ぶ経路の1.19をわずかに下回りました。
どこまで使えるか
この研究は、長い文章で処理中の記憶が問題になる場合、検索や解析道具から情報を取る場合、道具の結果を見て次の行動を学ばせたい場合に参考になります。反対に、検索なしで大量の事実を覚えておく用途や、道具の呼び出し方が頻繁に変わる環境には合いにくい設計です。約4.2倍という学習効率は、複数の改善分を掛け合わせた見積もりであり、別の機械での時間や費用を直接予測する数字ではありません。
限界と未解決の問い
検索なしで知識を思い出す課題では、大きなモデルに劣ると著者らは認めています。長い思考例を増やしすぎると、回りくどくなり、細かな指示を守りにくくなる場合もあります。一般的なソフトウェア修正は50件中2件、形の定まらない端末操作は89件中2件でした。
Webの結果は検索日、検索・文章抽出サービス、要約、採点役、やり直し方に左右されます。他モデルの多くの数字も同じ環境で試し直したものではありません。したがって、Webの順位をモデルだけの差とは断定できません。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
長い入力で保持する記憶が32.0 GiBから5.0 GiBになったという条件付きの結果は、料理の練習帳を常に全ページ読み返すような設計だけでなく、近くを読みつつ要所で全体を見る設計を候補にできることを示します。もし別の機械、別のモデルの大きさ、必要な課題でも正確さが保たれるなら、設計を選ぶ基準は「全体を見られるか」だけでなく「いつ全体を見る必要があるか」に変わるかもしれません。ただし、道具の形式のずれや返答の乱れで作業が崩れるため、実際の環境で記憶量、正確さ、失敗の仕方を一緒に測る必要があります。
この読み方に出てくる言葉(8語)
- 密モデル
入力ごとに一部だけを選ぶのではなく、基本的に同じ一組の部品で処理するAIです。
- 文脈
AIが一度に読み、答えの手がかりにできる文章の範囲です。
- 局所注意
入力全体ではなく、各位置の近くにある言葉を中心に参照する仕組みです。
- 大域注意
近くに限らず、前にある入力全体を参照できる仕組みです。
- 門
ある処理から得た情報をどれほど次へ通すかを、AIが学びながら調整する部分です。
- 教師信号
学習中のAIに、どんな答えや行動を目指すべきか示す手本です。
- 一回正解率
同じ問題を何度か解かせたとき、一回の回答が正解する平均的な割合です。
- 切り分け比較
設計の一部を変えて試し、その部分が結果にどう関係するかを見る比較です。
問題設定と前提
研究が扱うのは、限られた大きさのAIに、数学の長い思考、長文の読解、外部環境での複数段階の道具利用を同時に持たせる問題です。土台にある考えは、小さなAIが公開Webの知識を内部にすべて覚えるのは難しくても、必要なときに考え、外から情報を得れば弱さを一部補える、というものです。
ただし、この考えは道具を利用できること、道具の呼び出し方と返答の形が安定していること、必要な情報を検索先から得られることを前提にします。検索を禁止された知識問題には同じ補い方を使えません。また、長い入力を扱えることと、遠く離れた情報を必ず正しく結び付けられることは同じではありません。
関連研究の中での位置づけ
著者らが対比する標準的な設計では、各層が前の入力全体を見ます。これは情報を広く結び付けやすい一方、文章が長くなるほど処理中に保持する記憶と計算が増えます。別の選択肢として、近くを見る層と全体を見る層の割合を変える方式や、異なる注意の仕組みがあります。
学習の面では、最初から最大長の文章を使う経路、短いものから段階的に伸ばす経路、道具との完全なやり取りだけを再現する経路、いろいろな種類の例を順番または混合で学ぶ経路があります。ZGCM-1は、これらの選択を単独の工夫ではなく、一つの公開手順にまとめようとしています。
提案手法の全体像
モデルは32層、7.39Bの密モデルです。27層は各位置の近く128語分を見る局所注意、5層は前にある文章全体を見る大域注意で、局所と大域を5対1で並べます。局所注意には、得た情報を要素ごとにどれだけ通すか決める門があります。
学習は、一般的な文章による二段階の初期学習、長い文章と道具利用を学ぶ中間段階、回答例を使った仕上げ、結果の良し悪しを使う追加調整へ進みます。文章の最大長は16K、64K、256Kと伸ばします。公開すると著者らが記した対象には、重み、段階別の保存状態、コードと設定、データの作り方、実験記録、試験用の仕組みが含まれます。
定式化と設計判断
料理の練習帳を使う場面に置き換えると、設計の役割を追えます。普段は今の手順の周囲だけを確認し、何段階かごとに目次や前の全手順を見直します。分からない材料があれば検索し、返ってきた説明とそれまでの作業から次の行動を選びます。毎回全ページを読み直さないので負担を抑えられますが、遠くの注意書きを見落とす危険は残ります。
道具を使った記録は、仕事の説明、過去のやり取り、現在の道具の返答をひとまとめにし、次の道具操作を当てる一段階の問題へ作り替えます。完全なやり取りも併用するため、局所的な行動選びと長い流れの両方を学ばせる狙いです。この比較が示すのは情報を見る範囲と行動のつながりだけであり、AIが料理の目的や意味を人と同じように理解するとは限りません。
学習・推論・実験条件
最初の一般学習は約0.99T語分と約3.20T語分の二段階です。第1段階では一般言語だけを、使われる語の複雑さが低い順に並べ、コードと数学は別に混ぜます。中間学習では2.86T語分の候補から600.51B語分を採用し、16K、64K、256Kへ文章を長くします。後の段階でも短い例を再び混ぜます。
仕上げ用の集まりは4,921,933例で、一般データ96.46%、道具を使うデータ3.54%です。考える過程を出す例と出さない例を混ぜ、AI自身の推論、回答、道具の呼び出しだけを答え合わせの対象にします。公開モデルの256K版は、詰め合わせた19.46B語分を10周学習しました。その後、数学、コード、一般能力で、最終結果に応じた点を使う追加調整も行います。
評価設計
数学など道具を使わない課題では、公開された256K対応の学習途中モデルに考える過程を出させ、原則32回試した平均の一回正解率を測ります。Web調査では、検索と閲覧を最大64段階まで許します。点数は検索日、利用する検索先、文章の抜き出し方、要約、採点役、やり直し方にも左右されます。
プログラム解析では、10個の計画から各5件、計50件を選び、目的の機能が始まる位置を完全に当てたときだけ正解です。一般的なソフトウェア修正と端末操作は監査済みの小規模試験も示されます。これらは採点法も環境も違うため、一つの総合能力の順位とは読めません。
何が分かったか
著者らは、数学でAIME 2026が75.00%、MATH-500が97.13%、HMMT 2025が70.42%と報告しました。Web調査ではWebWalkerQA 63.09%、BrowseComp 19.43%、文字だけのGAIA 42.52%です。プログラム中の目的の機能を探す試験では50件中31件、62.00%で、同じ表のQwen3-8Bは6件、12.00%でした。
長さ256K、同規模、1件ずつ処理する条件で、処理中に保持する記憶は局所と大域を5対1にした方式が5.0 GiB、全体を見る方式が32.0 GiBでした。処理速度は全体を見る方式に比べ、長さ4Kで1.13倍、256Kで3.94倍と報告されています。
長文を段階的に伸ばす比較では、64Kを10B語分、その後256Kを20B語分学ぶ経路の最終的な間違いの値が1.16でした。256Kを30B語分直接学ぶ経路は1.19です。差は小さく、この条件で段階経路がわずかに良かったという結果です。
アブレーションと失敗例
注意の割合を比べた小規模試験では、5対1の方式が、最後の50段階の平均的な間違い1.93を保ちながら、GPU一基、一秒当たり9,566語を処理しました。全体を見る方式の間違いも1.93でした。3対1は1.92でしたが、処理速度は5対1より低い結果でした。
仕上げ用データの品質を厳しく選んだ比較では、約1.145M例で六つの試験平均68.83となり、ほぼ未処理の約2.08M例、67.78を上回りました。ただし、すべての課題が良くなったわけではありません。
考える例と考えない例を混ぜる前後の観察では、考えない設定のAIME 2025が10.00から43.33へ上がる一方、MMLUは72.63から70.03、HumanEval+は73.78から66.46へ下がりました。学習量やデータ構成などを同じにした比較ではないため、混合だけが原因とは言えません。
別の解釈と評価上の注意
数学やWeb調査の結果は、小さなモデルの内部知識が大きなモデルと同等になったことを直接示しません。長く考える設定、外部検索、課題に合った採点法が結果を支えた可能性があります。これは研究の狙いと一致しますが、「小さなモデルがあらゆる面で大きなモデルに追いついた」という読み方とは異なります。
長文での速さと保持記憶の改善も、特定のモデル規模、機械、数の表し方、入力長での結果です。約4.2倍の学習効率は、一つの最初から最後までの対照試験ではなく、四つの改善分を掛け合わせた概算です。実時間や費用が4.2分の1になるとの証拠ではありません。
限界と未解決の問い
7.39Bという内部知識の容量には限界があり、検索なしで記憶から答える課題では大きなモデルに劣ります。長い思考の手本を増やしすぎると、回答が回りくどくなり、厳密な指示を守りにくくなる場合があります。
一般的なソフトウェア修正は50件中2件、形の定まらない端末操作は89件中2件でした。道具を使う作業は、呼び出し方と返答の形が一致することに強く依存し、観測の乱れ、形式のずれ、検索サービスの遅れで途中の流れが壊れ得ます。Web比較の外部モデル値の多くも、同じ環境で一斉に試し直したものではありません。
残された問い
近くを見る層と全体を見る層の5対1という割合は、別の大きさ、機械、文章の種類でも良い選択でしょうか。道具の返答に誤りや遅れがあるとき、一連の行動はどの地点で崩れるのでしょうか。段階的な長文化の1.16対1.19という差は、学習を繰り返しても保たれるでしょうか。
品質選別で平均点が上がる一方、個別課題が一様に改善しない理由も切り分けが必要です。公開するとされた一式を異なる環境で再現し、速さ、正確さ、失敗の種類を同時に測ることが、この研究の主張を確かめる次の課題です。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
256Kの入力で、処理中に保持する記憶が32.0 GiBではなく5.0 GiBだったという報告は、「すべての段階で文章全体を見る必要がある」という前提を問い直します。料理の練習帳のように、普段は現在地の周辺を見て、必要な段階だけ全体を確認する分担が、別の課題でも正確さを保つなら、モデル設計は最大の見渡し範囲だけでなく、その範囲を使う頻度で選べるかもしれません。しかし、別の機械や規模で同じ倍率になるかは未確認です。さらに、外部ツールの形式や返答が乱れると複数段階の作業が崩れます。したがって次に試すべきなのは、記憶量だけでなく、全体を見る回数を減らしたときの見落としと、道具の乱れに対する失敗を同じ実環境で測ることです。
この読み方に出てくる言葉(3語)
- SWASWA
各トークンが限られた近傍だけを参照するsliding-window attentionです。
この論文では128-token windowを使い、global attention層と5:1で配置します。
- KV cacheKV cache
自己注意で過去トークンのkeyとvalueを再利用するために保持するメモリです。
- MDP形式MDP
現在の状態に条件付けて次の行動を学ぶ形です。
この論文ではタスク、履歴、環境フィードバックを状態、次のtool actionを教師信号にします。
どんな問いに向き合ったか
限られたパラメータ容量と計算資源の7B級モデルに、数学推論、256K文脈、複数段階のツール利用を同時に持たせ、設計判断を検証可能な公開レシピとして提示できるかが中心課題です。
肝のアイデア
局所計算を担う27層の128-token gated SWAと、長距離依存を担う5層のglobal causal attentionを5:1で交互配置します。学習では16K、64K、256Kへ文脈を伸ばし、対話軌跡を「タスク・履歴・観測から次の行動を予測する」単一ステップ例に変換して完全軌跡と併用します。
どう確かめ、何が分かったか
著者報告では、batch 1、bf16、256Kの等パラメータ比較でKV cacheは5.0 GiBで、full attentionの32.0 GiBから6.4倍減りました。公開256K SFT checkpointのthink modeではAIME 2026が75.00%、MATH-500が97.13%、HMMT 2025が70.42%です。非エージェント課題は原則32 runsのmean pass@1です。
注意すべきこと
7.39Bの静的知識容量はclosed-book想起で制約になります。一般エージェンシーも弱く、SWE-bench Verified Mini50は2/50、Terminal-Bench 2.0は2/89でした。Web評価は検索日、provider、抽出、judge、retry policyにも依存します。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
256KでのKV cache削減は、長文脈設計でglobal attentionの頻度自体を検討変数にする根拠になります。別の規模とハードウェアでも精度を維持できるなら、5:1型の構成は有力候補です。ただし、ツールschemaや環境応答のずれで軌跡が崩れ得るため、メモリ効率だけで採用を決めず、対象環境で再測定する必要があります。
この読み方に出てくる言葉(6語)
- gated SWAGatedSWA
局所窓の注意出力を、入力から学習した要素単位のgateで調整する注意層です。
この論文では128-token windowで27層に用いられます。
- Muon
主に行列パラメータへ適用する最適化手法です。
この論文ではスカラーパラメータ用Adamと併用されます。
- FP8FP8
行列積を8-bit浮動小数点で計算し、計算効率を狙う数値形式です。
この論文ではforwardにE4M3、backwardにE5M2を使います。
- SFTSFT
望ましい推論、回答、tool callの例を教師として行う追加学習です。
- GRPOGRPO
複数出力の相対的な報酬を利用する強化学習手法です。
- mean pass@1mean pass@1
複数回の試行について、一回の生成で正解する確率を平均した指標です。
この論文では非エージェント課題は原則32 runsで測ります。
どんな問いに向き合ったか
7B級のdense modelでは、静的知識容量と計算量が限られます。研究課題は、256Kの長文脈、数学的推論、環境観測に応じた複数段階のツール利用を、一つの効率的な学習系で獲得できるかです。加えて、重みだけでなく段階別checkpoint、学習コード、data recipe、ログ、評価系まで公開し、設計判断を追跡可能にすることを目指します。
従来の方法と課題
比較対象となる設計は、全層full attention、BF16とAdamWによる標準的事前学習、最初から256Kへ拡張する経路、対話軌跡全体の模倣です。注意機構についてはMLA、linear attention、複数のSWA比率も比較されます。full attentionは長距離関係を各層で扱えますが、系列長とともに注意計算とKV cacheが重くなります。完全軌跡だけの学習は長期的な流れを保持する一方、各観測から次行動を選ぶ局所的な教師信号を明示しにくいという位置付けです。
肝のアイデア
32層のうち27層を128-token gated SWA、5層をglobal causal attentionとし、局所対大域を5:1で配置します。局所層は近傍の情報統合を低コストで行い、global層は窓を越える依存関係の経路を提供します。学習系はMuon、Adam、hybrid FP8、delayed scaling、TWEOを組み合わせます。データ面では16Kから64K、256Kへ文脈を拡張し、agent traceをMDP風の状態・行動例へ再構成します。
どういうしくみか
gated SWAでは、局所注意の出力と、現在のhidden stateから得たsigmoid gateを要素単位で掛け、出力射影へ渡します。gateは局所情報をどの程度通すかを入力依存で調整します。global層を残すことで、局所窓だけでは結べない遠距離情報の伝達経路を確保します。
中間学習では、タスク、対話履歴、現在の環境フィードバックをstateとし、次のtool actionをtargetにします。これにより、長い軌跡全体の再現だけでなく、観測後の意思決定を直接教師化します。完全軌跡も併用するため、局所的な方策学習と長期的整合性を両立させる設計です。
どう確かめたか
公開256K SFT checkpointをthink modeで評価し、非エージェント課題は原則32 runsのmean pass@1を報告します。Web評価は最大64 search-and-read stepsを許します。Binary Function Searchは10 projectsから各5件の50 tasksを作り、Ghidra経由でfunction-entry ELF virtual addressが厳密一致した場合のみ正解です。
効率比較では同一7B backboneと一定tokens/stepを用います。KV cache比較はbatch 1、bf16、256K、等パラメータです。評価条件が異なるため、数学スコア、Webスコア、exact-address accuracyを単一尺度として扱うことはできません。
何が分かったか
SWA 5:1のfull attention比スループットは4Kで1.13倍、256Kで3.94倍でした。256KのKV cacheは5.0 GiBで、full attentionの32.0 GiBに対して6.4倍の削減です。10B-token、sequence length 4,096、8 H100の比較では、tail loss 1.93を保ち、9,566 tokens/s/GPUでした。
数学ではAIME 2026が75.00%、MATH-500が97.13%、HMMT 2025が70.42%です。WebではWebWalkerQA 63.09%、BrowseComp 19.43%、GAIA text-only 42.52%。Binary Function Searchは31/50、62.00%で、表中のQwen3-8Bは6/50、12.00%でした。すべて著者報告です。
どこまで使えるか
適用候補は、長文脈でKV cacheとattention throughputが制約となるモデル、外部検索や解析結果を受けて次行動を選ぶagent、SFTデータの量と品質を比較する研究です。検索なしで大量の静的知識を保持する用途、tool schemaや観測形式が頻繁に変わる環境、高い成功率が必須の一般的なrepository修正や非構造的terminal操作には適合しにくいと考えられます。
16K time-to-lossの約4.2倍は、SWA 1.4倍、FP8約1.5倍、Muonのstep-to-loss約1.8倍、Pre-LNの推定1.1倍を乗算した値です。単一のend-to-end対照ではなく、別環境の時間や費用へ直接移せません。
限界と未解決の問い
closed-book想起では7.39Bの静的知識容量が制約となり、大規模モデルに劣ります。長い推論教師を増やしすぎると冗長性が生じ、厳密なinstruction followingを損なう場合があります。一般エージェンシーの監査済み結果はSWE-bench Verified Mini50が2/50、Terminal-Bench 2.0が2/89です。
Web評価は検索日、provider、抽出、要約、LLM judge、retry policyに依存し、外部baselineの多くは統一環境での再実行ではありません。agent traceもschema整合性、観測ノイズ、tool-call形式、API latencyに敏感です。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
256KでKV cacheが32.0 GiBから5.0 GiBへ減ったという条件付き結果は、長文脈モデルでglobal attentionを全層に置く前提を再検討する材料です。別のモデル規模とハードウェアでもタスク精度が維持されるなら、global layerの比率を独立した設計変数として探索する価値があります。ただし、agent性能はtool schemaと環境応答の安定性にも依存します。したがって採用判断では、メモリとスループットに加え、長距離情報の取りこぼしと観測ノイズ下の軌跡成功率を同一環境で測るべきです。
この読み方に出てくる言葉(9語)
- gated SWAGatedSWA
固定幅の局所注意出力を、hidden state由来のsigmoid gateで要素単位に調整する層です。
この論文ではwindow size 128で、27層に採用されます。
- global causal attention
現在位置より前の全トークンを参照可能な因果的自己注意です。
この論文では32層中5層に配置されます。
- TWEOTWEO
学習中の極端なactivationを抑えるために用いられる処理です。
- MDPMDP
stateに基づいてactionを選び、環境遷移を扱う枠組みです。
この論文ではagent traceをstate-conditioned next-action predictionへ変換する表現を指します。
- SFTSFT
正解例を用いてモデル出力を教師あり学習する段階です。
- GRPOGRPO
group内の相対報酬を利用する方策最適化手法です。
- tail loss
学習末尾の複数stepで平均したtoken予測損失です。
この論文では注意機構比較では最終50 stepsの平均です。
- mean pass@1mean pass@1
反復生成における一回生成の平均正解率です。
この論文では非エージェント課題は原則32 runsです。
- ablation
一部の設計やデータ処理を変え、その寄与や副作用を調べる比較です。
問題設定と前提
対象は、7B級dense modelに数学推論、256K context、環境とのmulti-step interactionを同時に持たせる問題です。中心仮説は、compact modelがopen webをパラメータへ受動的に記憶することは難しくても、deliberate internal reasoningとactive tool useを結合すれば容量制約を一部補えるというものです。
この仮説には、必要な外部情報へアクセスできること、tool schemaとobservationが学習時・実行時で整合すること、複数stepにわたり誤差が致命的に蓄積しないことが含まれます。retrievalを許さない課題、環境応答が不安定な課題、静的知識そのものを要求する課題には同じ利点を期待できません。
関連研究の中での位置づけ
構造面の比較対象はfull attention、MLA、linear attention、複数のSWA比率です。full attentionは全層で長距離依存を直接扱える一方、長文脈ではattention計算とKV cacheが大きな制約になります。局所注意だけでは窓を越える情報伝播が間接的になるため、ZGCM-1は少数のglobal層を周期的に残します。
学習面ではBF16・AdamWの標準構成、random-order pre-training、256Kへの直接拡張、完全なinteraction traceの模倣が対照となります。著者らはarchitecture、数値形式、optimizer、data curriculum、agent supervisionを一体として設計し、段階別checkpointやログを含む公開レシピとして提示します。
提案手法の全体像
モデルは7.39B parameters、32 layersです。27 layersが128-token gated SWA、5 layersがglobal causal attentionで、local-to-global ratioは5:1です。backboneはGQA、RMSNorm、SwiGLU、RoPE、QK normalization、rotary fraction 0.33のPartial RoPEを用い、最大contextは256Kです。
一般事前学習の後、long-contextとagent traceを含むmid-training、一般・agent混合SFT、数学・コード・一般能力を対象とするGRPOへ進みます。行列パラメータはMuon、scalarはAdamで更新し、行列積にforward E4M3、backward E5M2のhybrid FP8とdelayed scalingを使い、TWEOで極端なactivationを抑えます。
定式化と設計判断
局所注意層の中心的な関係は次です。
ここで、hは入力hidden state、q,k,vはそこから得るquery、key、value、ASWAは128-token window内の注意出力、gprojはgate用射影、σはsigmoid、⊙は要素積、oprojは出力射影です。gateは局所注意出力の各要素を入力依存で調整します。
agent mid-trainingでは、タスク、履歴、現在のenvironment feedbackをstate、次のtool actionをtargetとする単一step例へtraceを再構成します。完全軌跡も併用するため、各decision pointの教師密度を高めつつ、長期的なtrajectory structureを残す設計です。
学習・推論・実験条件
一般事前学習は約0.99T tokensのStage 1と約3.20T tokensのStage 2です。Stage 1では一般言語のみをlexical complexityの低い順に並べ、codeとmathは別に混合します。mid-trainingは2.86T-token candidate poolから600.51B tokensを採用し、16K、64K、256Kへ累積的にcontextを拡張します。後段でもshort sequenceをreplayします。
SFT corpusは4,921,933 examplesで、general 96.46%、agent 3.54%です。thinkとno-thinkを同じ重みで混合し、system、user、tool observationをlossからmaskし、assistant reasoning、answer、tool callのみを対象にします。公開256K SFT variantは19.46B packed tokensを10 epochs学習します。RLは数学、code、general能力を混合し、数学の正答やcodeのtest pass fractionなど領域別のoutcome rewardを用います。
評価設計
評価対象は公開256K SFT checkpointのthink modeです。非エージェント課題は原則32 runsのmean pass@1です。Web環境では最大64 search-and-read stepsを許し、WebWalkerQA、BrowseComp、GAIA text-onlyを測ります。検索日、provider、retrieval、extraction、summarization、LLM judge、retry policyが測定系に含まれます。
Binary Function Searchは10 projectsから各5件を抽出した50 tasksで、Ghidraを介し、function-entry ELF virtual addressのexact matchを採点します。効率評価は同一7B backbone、一定tokens/stepでfull attentionと比較します。KV cacheはbatch 1、bf16、256K、等パラメータ条件です。SWE-bench Verified Mini50とTerminal-Bench 2.0は監査済みの小規模評価として一般エージェンシーの弱点を測ります。
何が分かったか
10B-token、sequence length 4,096、8 H100のarchitecture comparisonで、SWA 5:1は最終50-step平均loss 1.93、9,566 tokens/s/GPUでした。full attentionもtail loss 1.93です。一定token budget/stepではfull attention比throughputが4Kで1.13倍、256Kで3.94倍へ増えました。256K KV cacheは5.0 GiBで、full attention 32.0 GiBに対し6.4倍削減されました。
64Kを10B tokens、その後256Kを20B tokens学習したcurriculumはfinal token-level cross-entropy loss 1.16で、256Kを30B tokens直接学習した経路は1.19でした。
数学はAIME 2026 75.00%、MATH-500 97.13%、HMMT 2025 70.42%。WebはWebWalkerQA 63.09%、BrowseComp 19.43%、GAIA text-only 42.52%。Binary Function Searchは31/50、62.00%で、Qwen3-8Bは6/50、12.00%、GLM-5.1は33/50、66.00%でした。いずれも著者報告です。
アブレーションと失敗例
SWA ratio比較では3:1がloss 1.92とわずかに低い一方、throughputは5:1より低く、5:1はloss 1.93と速度のtrade-offとして選ばれました。context curriculumの1.16対1.19は段階拡張を支持しますが、一設定での小差です。
同一base checkpointとrapid SFT条件のquality-pruning ablationでは、最も厳格な約1.145M examplesが6-benchmark average 68.83、minimal processingの約2.08M examplesが67.78でした。ただしtask別改善は一様ではありません。
mixed think/no-think SFT前後の観察比較では、no-think AIME 2025が10.00から43.33へ33.33 points上昇する一方、MMLUは2.60 points、HumanEval+は7.32 points低下しました。総token数、data composition、history、optimization条件を統制したablationではないため、因果帰属はできません。一般エージェンシーはSWE-benchで2/50、Terminal-Benchで2/89でした。
別の解釈と評価上の注意
数学とagentic searchの結果は、7.39B modelの静的知識がfrontier model相当になったことを意味しません。think mode、外部retrieval、最大64 steps、課題固有のexecution environmentが性能に寄与しており、論文の仮説は能力の置換よりも、内部容量と外部取得の役割分担として読む方が整合的です。
約4.2倍の16K time-to-lossは、SWA 1.4倍、FP8約1.5倍、Muon step-to-loss約1.8倍、Pre-LNの推定data efficiency 1.1倍を乗算した概算です。相互作用を含む単一end-to-end対照ではないため、wall-clock timeや費用の同倍率削減とは解釈できません。またWeb baselineの多くは統一harnessでの再実行ではなく、model rankingには測定系の差が混在します。
限界と未解決の問い
第一に、7.39Bのparametric capacityはclosed-book recallで制約となります。第二に、long-reasoning supervisionを増やしすぎると冗長性とinstruction-following低下を招き得ます。第三に、一般的なrepository repairと非構造的terminal操作の成功率は低く、構造化Web調査やbinary analysisから一般agent能力へ直接一般化できません。
第四に、trajectory executionはtool schema、environment feedback、observation noise、tool-call serialization、search API latencyに敏感です。第五に、Web評価は検索時点と複数の外部componentに依存し、外部比較値も統一再実行ではありません。公開すると記載されたartifactの完全性や異種環境での再現性も、論文記載だけでは確定しません。
残された問い
5:1 ratioはmodel scale、window size、hardware、task distributionを変えてもPareto-optimalでしょうか。global layerの位置と頻度がlong-range retrieval accuracyへ与える寄与を、throughputと同時に切り分ける必要があります。段階的context extensionの1.16対1.19がseedやdata orderを変えて安定するかも未確定です。
MDP形式の単一step例と完全軌跡の相対寄与、short-sequence replayの必要量、schema perturbationやobservation noiseへの耐性も個別ablationが必要です。SFT quality pruningでは平均値だけでなくtask別の負の変化を追跡し、公開artifactを別hardwareで再現して、time-to-loss概算と実測end-to-end改善の差を測ることが次の検証になります。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
256K、batch 1、bf16の等パラメータ条件でKV cacheが32.0 GiBから5.0 GiBへ減った結果は、global attentionの配置頻度を長文脈システムの主要な設計変数にする根拠です。別scaleとhardwareでもaccuracy-throughput trade-offが維持されるなら、全層globalを既定値にせず、必要な長距離経路の密度を測定して選ぶ実務へ変えられます。ただし、agent trajectoryはtool schemaやobservationの安定性に強く依存します。次の判断には、KV cache、throughput、long-range recallに加え、schemaずれと観測ノイズ下でのend-to-end成功率を同一条件で測る必要があります。
この読み方に出てくる言葉(3語)
- gated SWAGatedSWA
sliding-window attention出力にhidden-state依存のsigmoid gateを要素積する局所注意です。
この論文ではwindow 128、27/32 layersに使用します。
- MDP mid-trainingMDP
interaction traceをstate-conditioned next-action predictionへ再構成する中間学習です。
- time-to-loss
所定のloss水準へ到達するまでの時間効率です。
この論文では約4.2倍は四要因の積による概算です。
どんな問いに向き合ったか
7B級dense modelで、256K context、数学推論、multi-step tool useを同時に成立させ、weightsからtraining/evaluation artifactsまで追跡可能なレシピを提示できるかを問います。
肝のアイデア
32 layersを27 gated SWA layersと5 global causal-attention layersへ5:1で配置し、hybrid FP8、Muon、TWEOを用います。16K、64K、256Kへcontextを拡張し、task・history・environment feedbackをstate、次のtool actionをtargetとするMDP-style samplesをfull trajectoriesと併用します。
どう確かめ、何が分かったか
著者報告では、batch 1、bf16、256KでKV cacheは5.0 GiBで、full attentionの32.0 GiBから6.4倍減少しました。公開256K SFT checkpointのthink-mode評価はAIME 2026 75.00%、MATH-500 97.13%、HMMT 2025 70.42%。非エージェント課題は原則32-run mean pass@1です。
注意すべきこと
closed-book recallではparametric capacityが制約です。SWE-bench Verified Mini50は2/50、Terminal-Bench 2.0は2/89で、一般エージェンシーは未成熟です。Web評価は検索時点、provider、judge、retry policyに依存し、外部baselineの多くは統一再実行ではありません。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
256K条件のKV cache削減は、global-attention densityを独立したarchitecture variableとして探索する根拠になります。別scaleとhardwareでも精度が維持されるなら5:1構成は有力ですが、tool schemaとenvironment feedbackへの脆弱性がend-to-end性能を制約するため、メモリ効率だけでは採用を正当化できません。
この読み方に出てくる言葉(6語)
- GatedSWAGatedSWA
local attention outputをhidden-state由来のsigmoid gateでelement-wise modulationする層です。
この論文では128-token windowを用い、global layerと5:1で配置します。
- Partial RoPERoPE
head dimensionの一部にのみrotary positional embeddingを適用する構成です。
この論文ではrotary fractionは0.33です。
- Muon
行列パラメータ向けoptimizerです。
この論文ではscalar parameter用Adamと併用します。
- TWEOTWEO
extreme activationを抑制してFP8 trainingの安定性を支える処理です。
- MDP-style sampleMDP
stateから次actionを予測する単一decision-pointの学習例です。
この論文ではtask、history、environment feedbackをstateとします。
- mean pass@1mean pass@1
反復試行から推定するsingle-sample success rateの平均です。
この論文では非エージェント課題では原則32 runsです。
どんな問いに向き合ったか
研究課題は、7B級dense modelに数学推論、256K context、multi-turn environment interactionを同時に獲得させ、parametric capacityとtraining computeの制約を克服できるかです。モデル能力だけでなく、非公開recipeにより設計判断を検証できない問題も対象とし、stage-wise weights、code/config、data recipe、W&B logs、evaluation harnessの公開を掲げます。
従来の方法と課題
architecture baselinesはfull attention、MLA、linear attention、異なるSWA/global ratiosです。training baselinesはBF16/AdamW、random-order pre-training、direct 256K extensionです。agent supervisionではfull-trajectory imitation、sequential Agent-SFT、mixed Agent-SFTが比較軸です。
full attentionは各層に直接的なglobal receptive fieldを与えますが、long contextでthroughputとKV cacheが悪化します。pure local attentionは効率的でもlong-range pathを弱めます。ZGCM-1は少数global layersを周期配置して両者のtrade-offを取ります。
肝のアイデア
modelは7.39B parameters、32 layersで、27 layersの128-token gated SWAと5 layersのglobal causal attentionを5:1で配置します。GQA、RMSNorm、SwiGLU、QK normalization、rotary fraction 0.33のPartial RoPEを採用します。matrix parameterはMuon、scalarはAdam、matmulはforward E4M3/backward E5M2のhybrid FP8とdelayed scalingを使い、TWEOを組み合わせます。
データ側ではgeneral pre-training、long-context/agent mid-training、mixed SFT、outcome-reward RLを連結します。compact model内の静的知識だけでなく、推論時に外部情報を取得して行動を更新する能力を同一recipeの対象にします。
どういうしくみか
gated local layerは次式です。
hはhidden state、q,k,vはquery/key/value、ASWAはwindowed attention、gprojはgate projection、σはsigmoid、oprojはoutput projectionです。gateがlocal attention outputを入力依存に変調し、global layersがwindowを越える情報経路を提供します。
agent traceはtask、history、current environment feedbackをstate、next tool actionをtargetとするMDP-style single-step examplesへ変換され、full trajectoriesと併用されます。これにより各decision pointのsupervisionを明示します。
どう確かめたか
公開256K SFT checkpointをthink modeで評価し、non-agent benchmarkは原則32-run mean pass@1です。Web environmentは最大64 search-and-read stepsです。Binary Function Searchは10 projects×5 tasksで、Ghidra経由のexact function-entry ELF virtual-address matchを用います。
architecture comparisonは10B tokens、sequence length 4,096、8 H100。context-length throughputは同一7B backboneかつ一定tokens/stepです。KV cache比較はbatch 1、bf16、256K、equal-parameter settingです。これらの条件差は各結果の適用範囲を規定します。
何が分かったか
SWA 5:1はtail loss 1.93と9,566 tokens/s/GPUを記録し、full attentionもtail loss 1.93でした。full-attention比throughputは4Kの1.13倍から256Kの3.94倍へ拡大しました。KV cacheは5.0 GiBで、full attentionの32.0 GiBに対し6.4倍削減です。
progressive context extensionは64K/10B tokens後に256K/20B tokensでfinal loss 1.16、direct 256K/30B tokensは1.19でした。benchmarkはAIME 2026 75.00%、MATH-500 97.13%、HMMT 2025 70.42%。WebWalkerQA 63.09%、BrowseComp 19.43%、GAIA text-only 42.52%。Binary Function Searchは31/50、62.00%です。いずれも著者報告です。
どこまで使えるか
本設計は、long-context KV cacheとthroughputがbottleneckとなるdense model、state-conditioned tool actionを学ぶagent mid-training、SFT quality pruningやthink/no-think mixingの研究に適します。retrievalなしの知識保持、schemaが頻繁に変化するenvironment、高信頼なgeneral repository repairやunstructured terminal operationには適合しにくいです。
約4.2倍の16K time-to-lossはSWA 1.4倍、FP8約1.5倍、Muon step-to-loss約1.8倍、Pre-LNの推定data efficiency 1.1倍の積です。単一end-to-end runの実測ではなく、hardware移植時のwall-clockやcostを予測する値ではありません。
限界と未解決の問い
parametric capacityの制約によりclosed-book recallではlarge modelに劣ります。long-reasoning supervisionは冗長性を増やし、strict instruction followingを損なう場合があります。一般エージェンシーはSWE-bench Verified Mini50 2/50、Terminal-Bench 2.0 2/89です。
agent executionはschema alignment、observation noise、tool-call format、search API latencyに依存します。Web評価も検索日、provider、extraction、summarization、LLM judge、retry policyの影響を受け、外部baselineの多くは統一harnessで再実行されていません。したがって絶対値とmodel rankingの双方にenvironmental confoundingがあります。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
256K、batch 1、bf16、equal-parameter条件での32.0 GiBから5.0 GiBへのKV cache削減は、global-attention densityをarchitecture searchの中心変数にする実証的根拠です。別scale、hardware、taskでもaccuracyを維持できるなら、5:1型hybridはfull attentionに対する有力なdesign pointになります。ただしagentic performanceはtool schemaとenvironment responseに強く依存するため、採用判断にはmemory/throughputだけでなく、long-range retrievalとperturbed-environment下のtrajectory successを含む再評価が必要です。
この読み方に出てくる言葉(11語)
- GatedSWAGatedSWA
sliding-window attention outputをhidden-state-conditioned sigmoid gateでelement-wise modulationする注意層です。
この論文ではwindow 128、27/32 layersに適用します。
- GQAGQA
query head群でkey/value headを共有するattention parameterizationです。
- Partial RoPERoPE
head dimensionの一部へrotary positional embeddingを適用する方式です。
この論文ではrotary fraction 0.33です。
- hybrid FP8FP8
forwardとbackwardで異なるFP8形式を使うmatrix-multiplication構成です。
この論文ではforward E4M3、backward E5M2です。
- Muon
matrix parameter向けoptimizerです。
この論文ではscalar parameter用Adamと併用します。
- TWEOTWEO
extreme activationを抑制して低精度学習の安定性を支える処理です。
- MDP reformulationMDP
interaction traceをstate-conditioned next-action examplesへ分解する表現です。
この論文ではstateはtask、history、current environment feedbackです。
- GRPOGRPO
group-relative rewardを用いるpolicy optimization手法です。
- tail loss
training run末尾の一定stepで平均したtoken-level lossです。
この論文ではarchitecture ablationではlast 50 stepsの平均です。
- mean pass@1mean pass@1
反復runから得るsingle-generation correctnessの平均です。
この論文ではnon-agent tasksでは原則32 runsです。
- time-to-loss
特定lossへ到達するまでのwall-clock効率です。
この論文では約4.2倍は独立要因の測定・推定値を乗算した概算です。
問題設定と前提
問題設定は、7B級dense modelの限られたparametric capacityとcompute budgetの下で、数学推論、256K context processing、multi-step tool interactionを共同獲得することです。中心命題は、compact modelがopen-web knowledgeを静的に記憶し切れなくても、deliberate internal reasoningとactive external tool useを結合すれば容量制約を補完できる、というものです。
この命題はretrieval availability、tool schema consistency、environment observability、multi-step execution stabilityを暗黙の条件とします。closed-book taskでは外部取得による補完が使えず、noisy observationやAPI latencyはtrajectory-level errorを増幅します。また256K context capacityは、その全範囲の情報を均等に利用できることを保証しません。
関連研究の中での位置づけ
architecture lineage上の比較軸はfull attention、MLA、linear attention、異なるSWA/global ratiosです。full attentionはlayerごとにglobal receptive fieldを持つ一方、sequence length増加に伴いattention throughputとKV cacheが支配的になります。local attentionは効率を改善しますが、long-range communication pathを制限します。ZGCM-1は5:1でglobal layersを挿入し、このtrade-offを調整します。
training側ではBF16/AdamW、random-order pre-training、direct 256K extension、full-trajectory imitationが対照です。本研究はarchitecture-system co-design、progressive curriculum、agent trace reformulationを同一pipelineで扱います。さらにweights、pre/mid/post-training checkpoints、training code/config、per-stage data recipes、W&B logs、evaluation harnessを公開すると記載し、recipe-level reproducibilityを研究対象に含めます。
提案手法の全体像
ZGCM-1は7.39B parameters、32 transformer layersです。27 layersが128-token GatedSWA、5 layersがglobal causal attentionで、local-to-global ratioは5:1です。GQA、RMSNorm、SwiGLU、QK normalization、Partial RoPEを採用し、rotary fractionは0.33、maximum context lengthは256Kです。
optimizationはmatrix parameterにMuon、scalarにAdamを適用します。matrix multiplicationはforward E4M3、backward E5M2のhybrid FP8、delayed scaling、TWEOを組み合わせます。training pipelineはgeneral pre-training、long-context/agent mid-training、SFT、RLで構成され、内部推論とexternal action policyを段階的に統合します。
定式化と設計判断
GatedSWA layerは論文中で次のように定義されます。
hはlayer input、q,k,vはquery、key、value、ASWAは128-token sliding-window attention、gprojはgate projection、σはsigmoid、⊙はHadamard product、oprojはoutput projectionです。local attention outputをfeature-wiseに制御しつつ、5層のglobal attentionでwindow外の因果的接続を供給します。
agent dataでは一般的なtrajectoryを、task、interaction history、current environment feedbackからなるstateとnext tool action targetへ変換します。single-step MDP-style examplesは各decision pointを直接superviseし、full trajectoriesはlong-horizon coherenceを保持します。両者の併用が本論文におけるagent mid-trainingの特徴です。
学習・推論・実験条件
general pre-trainingは約0.99T tokensのStage 1と約3.20T tokensのStage 2です。Stage 1ではgeneral-language dataのみをlexical complexityでcurriculum化し、codeとmathは別にmixします。mid-trainingは2.86T-token candidate poolから600.51B tokensを選び、16K、64K、256Kへcumulative context extensionを行い、later stagesでもshort sequenceをreplayします。
SFT corpusは4,921,933 examplesで、general 96.46%、agent 3.54%。think/no-think samplesをequal weightで混合し、system、user、tool observation tokenをloss maskし、assistant reasoning、answer、tool callのみをsuperviseします。公開modelは256K SFT variantで、19.46B packed tokensを10 epochs学習します。RLはmath、code、general domainsを混合し、GRPOとdomain-specific outcome rewardsを使用します。mathはcorrectness、codeはpassed-test fractionなどを報酬にします。
評価設計
main evaluationは公開256K SFT checkpointのthink modeです。non-agent tasksは原則32 independent runsのmean pass@1です。WebWalkerQA、BrowseComp、GAIA text-onlyは最大64 search-and-read stepsのWeb environmentで測定します。このprotocolには検索時点、provider、retrieval/extraction、model summarization、LLM judge、retry policyが含まれます。
Binary Function Searchは10 projectsから各5 tasks、計50 tasksを抽出し、Ghidra経由のfunction-entry ELF virtual address exact matchをmetricとします。architecture ablationは10B tokens、sequence length 4,096、8 H100。throughput scalingは同一7B backboneかつ一定tokens/step。KV cacheはbatch 1、bf16、256K、equal parameter countです。
一般agencyは監査済みSWE-bench Verified Mini50とTerminal-Bench 2.0で補足します。task suiteごとにtool availability、step budget、metricが異なるため、cross-suite aggregate capabilityとしての解釈は支持されません。
何が分かったか
architecture comparisonではSWA 5:1がlast-50-step mean loss 1.93、9,566 tokens/s/GPUを達成し、full attentionのtail lossも1.93でした。SWA 3:1はloss 1.92ですがthroughputは5:1を下回りました。同一tokens/stepでのfull-attention比throughputは4Kで1.13倍、256Kで3.94倍です。256K KV cacheはSWA 5:1が5.0 GiB、GDN 3:1が7.0 GiB、full attentionが32.0 GiBでした。
context extensionでは64Kを10B tokens、続いて256Kを20B tokens学習したpathがfinal token-level cross-entropy 1.16、direct 256Kを30B tokens学習したpathが1.19でした。
数学benchmarkはAIME 2026 75.00%、MATH-500 97.13%、HMMT 2025 70.42%。Web evaluationはWebWalkerQA 63.09%、BrowseComp 19.43%、GAIA text-only 42.52%。Binary Function Searchは31/50、62.00%で、Qwen3-8B 6/50、12.00%、GLM-5.1 33/50、66.00%でした。これらは著者報告値です。
アブレーションと失敗例
attention-ratio ablationは5:1がfull-attention-equivalent tail lossと高throughputを両立するdesign pointであることを示しますが、3:1のlossは0.01低く、単一予算でのtrade-off選択です。progressive context extensionの1.16対1.19も段階経路を支持しますが、小差であり、seed variationは示されていません。
SFT quality-pruning ablationでは、同一base checkpointとrapid-SFT settingの下、strictest variantが約1.145M examples、six-benchmark average 68.83、minimal processingが約2.08M examples、67.78でした。データ量の増加よりquality filteringが有効な可能性を示しますが、individual tasksは一様に改善しません。
mixed think/no-think SFT前後のobservational checkpoint comparisonでは、no-think AIME 2025が10.00から43.33へ上昇し、MMLUは72.63から70.03、HumanEval+は73.78から66.46へ低下しました。token budget、data composition、training history、optimizationを統制していないため、mixed SFTの因果効果ではありません。一般agencyはSWE-bench 2/50、Terminal-Bench 2/89と低い結果です。
別の解釈と評価上の注意
frontier-scale modelとの一部benchmark上の競争力は、parametric knowledge parityを示しません。think-mode inference、external retrieval、最大64-step interaction、task-specific toolsが結果の一部を担います。したがって主張は「7B modelがlarge modelを一般に代替する」ではなく、「内部推論と外部取得の組合せが、特定条件でcapacity gapを補える」と読むべきです。
16K pre-training time-to-lossの約4.2倍は、SWA 1.4倍、FP8約1.5倍、Muon step-to-loss約1.8倍、Pre-LNの推定data efficiency 1.1倍を乗算したengineering estimateです。component interactionを含むsingle end-to-end controlled runではなく、wall-clock、energy、monetary costの同率削減を支持しません。
Web baselineの多くは公開報告から取得され、統一provider、date、judgeで再実行されていません。model differenceとevaluation-stack differenceを分離できないため、絶対スコアは当該protocolでの能力証拠ですが、細かなmodel rankingの証拠としては弱くなります。
限界と未解決の問い
7.39Bのstatic knowledge capacityはclosed-book recallでlarge modelに劣る主要因です。long-reasoning supervisionの過剰化はverbosityを誘発し、strict instruction followingを毀損し得ます。structured Web researchとbinary analysisでの成功は、general repository repairやunstructured terminal operationへ一般化せず、監査済み結果はそれぞれ2/50と2/89です。
agent executionはtool schema alignment、environment-feedback stability、observation noise、tool-call formatting、search API latencyに敏感です。複数stepでは局所的なformat errorが後続trajectoryを崩し得ます。Web evaluationは検索日、provider、extraction、summarization、judge、retry policyに依存します。
また、約4.2倍値は合成概算です。公開を宣言したartifactの完全性、異種hardwareでのreproducibility、AI-native R&D workflow自体の寄与について、提示された比較だけでは独立に確定できません。
残された問い
architectureについては、5:1 ratio、128-token window、global-layer placementがmodel scale、hardware、context distributionを変えた際にもoptimalかを検証する必要があります。throughputとKV cacheだけでなく、needle retrievalやmulti-hop long-range dependencyを含むaccuracy frontierを測るべきです。progressive extensionのloss差についてはseeds、data order、token allocationを変えた再現が必要です。
trainingについてはMuon、FP8、TWEO、curriculumのinteractionをend-to-end factorial designで測り、4.2倍合成値との差を確認する余地があります。agent supervisionではMDP-style single-step samples、full trajectories、short-sequence replay、mixed Agent-SFTの独立寄与が未分離です。
evaluationについてはschema perturbation、delayed/noisy observations、provider changesに対するrobustness、Web baselineの統一再実行、general agency failureのerror taxonomyが必要です。SFT quality pruningもaverage scoreだけでなくtask-level regressionをselection criterionへ組み込めるかが未解決です。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
equal-parameter、batch 1、bf16、256K条件でKV cacheがfull attentionの32.0 GiBから5.0 GiBへ減った結果は、global-attention densityを長文脈architectureのfirst-class variableとして扱う根拠になります。もし異なるscale、hardware、long-range taskでもaccuracy frontierが維持されるなら、5:1 hybridは全層globalという既定設計を置き換える候補です。ただし、その含意はagentic system全体の信頼性には直結しません。tool schema mismatch、observation noise、API latencyがtrajectoryを崩し得るため、次の設計判断ではmemory、throughput、long-range accuracyに加え、perturbed environment下のend-to-end successを同一protocolで共同測定すべきです。