Multilingual GSM-Symbolic:15言語の数学問題で探る、LLMの能力移転を左右する要因
言語全体の難しさは予測できても、特定モデルの苦手言語は残る
Multilingual GSM-Symbolic: What determines capability transfer across languages?
論文の書誌情報と関連リンク
- arXiv初回投稿日
- 掲載先
- arXiv preprint
ポッドキャスト形式で聴く
約6分AI生成の会話音声です。記事の要点を短くまとめています。
概要
英語で数学問題を解けるLLMは、別の言語でも同じように解けるのか。Multilingual GSM-Symbolicは、数学的な構造をそろえた30,000問を15言語で用意し、モデル規模や言語の特徴と正解率の関係を調べた研究だ。著者らの主分析では、言語間の変動の92%を説明できた一方、個別モデルと言語の組み合わせに固有の変動は23%しか説明できなかった。未評価言語の性能予測は、対象言語の10テンプレートによる実測を加えると平均誤差が縮まった。ただし、対象は小学校算数の文章題であり、一般的な言語能力や学習方法の因果的な効果を示すものではない。
なぜ注目されているか
取得時点のHugging Face Daily Papersでは10 upvotes、論文ページには1件のコメントが記録されています。関連GitHubリポジトリのstarsはHFデータ上で4でした。
議論全体へのリンク
なぜ重要なのか
多言語で使うモデルを選ぶ際、言語ごとの評価をどこまで予測で補えるかは重要な判断になる。この研究は、言語全体の難しさには見通しを立てられても、特定モデルの苦手言語には実測が必要だと示唆する。同様の課題とモデル群で結果が再現するなら、性能予測と対象言語の評価を組み合わせる根拠になる。ただし、少数の問題を追加すれば必ず予測が改善するわけではなく、評価する問題構造の数も考える必要がある。
この記事に出てくる言葉(6語)
- 言語間の能力移転
ある言語で発揮できる能力を、別の言語でも使えること。
この論文では数学的な操作と推論構造をそろえた文章題の成績から調べる。学習介入で能力が移る過程を直接観察する研究ではない。
- 記号的テンプレート
問題の構造を保ちながら、数値や名前などを変えて問題を生成するためのひな型。
この論文では100テンプレートを15言語で対応させ、それぞれ20例を生成する。
- 混合効果モデル
全体に共通する特徴の関係と、集団や項目に固有のばらつきを分けて扱う統計モデル。
この論文では規模や言語特徴の関係を推定しながら、モデル系列、問題、モデルと言語の組み合わせなどの差を考慮する。
- 言語資源量
その言語で利用できるテキストの量を表す指標。
この論文ではCommon Crawlのページ数を代理指標にする。各モデルが実際に学習した量やテキストの品質そのものではない。
- 類型的距離
文法などの特徴に基づく、言語同士の隔たり。
この論文では103の形態・統語特徴から英語との距離を測る。地理的な距離ではない。
- 平均絶対誤差
MAE
予測値と実測値の差の大きさを平均した指標。小さいほど予測が近い。
この論文ではモデルの正解率をどれだけ正確に予測できるかを測る。単位は正解率のパーセントポイントで、相対的な増減率とは異なる。
1. 読む前に知っておきたいこと
同じ能力を比べるには、同じ難しさが必要
多言語LLMの評価では、言語ごとの正解率を並べるだけでは能力の差を読み取りにくい。問題が別々なら、難度、出題形式、必要な文化的知識も違う。英語の成績が高くても、言語の扱いが得意なのか、英語側の問題が解きやすかったのかを区別できない。固定された有名な問題には、学習データへの混入という別の懸念もある。
本論文が調べる「言語間の能力移転」は、ある言語で発揮する能力を別の言語でも使えるかという問いだ。比較の土台には小学校算数の文章題を選ぶ。必要な数学的操作と推論構造をそろえれば、問題内容の違いを抑えながら言語による成績差を調べられる。ただし、ここで測る移転は成績上の関係である。ある言語で学習させ、別の言語への効果を確かめる因果実験ではない。
翻訳した固定問題から、変種を作れる評価へ
著者らの整理では、既存のMGSMはGSM8Kの固定問題を翻訳した評価で、GSM-Symbolicは英語の問題をテンプレート化したものだ。テンプレートとは、問題の構造を保ち、数値や名前などを変えられるひな型を指す。同じ構造から新しい問題を作れるため、特定の問題を覚えていることと、構造を理解して解けることを切り分けやすくなる。
多言語テンプレートを使うMGSM-Proについては、テンプレートと生成コードが非公開であり、mGSM-Symbolicについては生成済み問題の翻訳による静的な評価だと本論文は位置づける。提案するMultilingual GSM-Symbolicでは、言語間で対応するテンプレートから変種を生成できるようにする。著者らはデータ、コード、応答ログ、拡張用のパッケージなどを公開したと報告している。ただし、数値を変えても公開テンプレート自体の記憶は排除できず、汚染の問題が解消したわけではない。
何を言語の特徴として測るのか
分析の中心は、モデル規模、推論モード、言語資源量、英語からの類型的距離だ。規模にはパラメータ数を使う。推論モードはオンとオフを区別する要因であり、通常の文章の意味で「推論が正しかったか」を採点した値ではない。資源量にはCommon Crawlのページ数を用い、類型的距離には103の形態・統語特徴に基づく英語との隔たりを用いる。
これらは性能に関わりそうな特徴だが、完全な説明ではない。ウェブ上のページ数は、各モデルの言語別学習量やデータ品質をそのまま表さない。また、類型的距離は、テキストをどれだけ多くのトークンに分割するかという指標とも強く相関する。したがって、距離との関連が見つかっても、原因を文法構造だけに帰属できない。論文を読むうえでは、測定できる代理指標と、実際に知りたい要因を区別する必要がある。
2. 手法と評価
数学的構造をそろえ、表現を現地化する
データセットは、GSM-Symbolic由来の100問題を基に、英語、日本語、マラーティー語など15言語の対応テンプレートを作る。各テンプレートから20例を生成し、合計30,000問とする。「同じ問題」の基準は逐語的な一致ではなく、必要な数学的操作と推論構造の一致だ。名前、通貨、単位、文化的参照、数字表記は現地化する。表現を自然にしながら、解くべき数学をそろえる設計である。
翻訳は技術的知識を持つ母語話者がLLMの補助を使って行い、人手で修正する。翻訳補助モデルは評価対象に含めない。さらに、Claude Opus 4.8が生成例を誤答したテンプレートでは、その解答過程を人が確認し、翻訳先の母語話者が必要な修正を行う。自動テストでも、既定の値から元問題を再現できるか、生成条件を満たすかを検査する。これは問題の品質を確認する手順であり、補助モデルの回答を正解の根拠にする手順ではない。
規模と系列の違いを分けて分析する
主分析には、公開重みの指示調整済みモデルから選んだ9系列、35ベースモデル、46評価変種を使う。最高性能のモデルを集めるより、系列と規模の違いから要因を推定することを優先した選択だ。もともとの48評価変種のうち、2つは生成不良のため主分析から除外している。
正解・不正解には、混合効果モデルを当てはめる。これは、規模などに共通する関係と、モデル系列や問題ごとのばらつきを分けて扱う方法だ。同じ系列のモデルをすべて独立した証拠として数えず、テンプレートの難しさやモデルと言語の組み合わせに固有の差も考慮する。規模と資源量は対数に変換し、連続する特徴は標準化して比較する。規模や推論モードによって、資源量や距離との関係が変わるかも同時に調べる。この設計は複数要因の重なりを扱えるが、観察データから因果関係を確定するものではない。
正解率の中に、回答形式への追従も入る
評価はゼロショットで行う。つまり、解答例を提示せずに問題を解かせる。各言語で人手翻訳した指示を使い、段階的な解答と、単位などを含めない指定形式の最終数値回答を求める。採点は最終数値の完全一致で、回答から数値を読み取れない応答も不正解になる。
このため、スコアは数学だけの純粋な測定ではない。計算ができても回答形式に従えなければ不正解となり、指示追従の差も成績に含まれる。著者らは別の検証として、元問題と数値などを変えた記号的変種を比べ、翻訳の人手検証や単位系の変更も調べている。高正解率に近づくほど差が見えにくくなる「飽和」の影響も検証する。こうした確認は主結果の解釈を支えるが、すべての言語で翻訳品質や採点上の問題を完全に取り除いた証明にはならない。
未知言語への予測を、言語丸ごとの除外で試す
予測評価では15言語を順番に丸ごと除外し、残った言語で統計モデルを当てはめ直す。標準化も残った言語のデータだけで計算する。除外した言語の正解率を使わず、その言語の特徴から性能を見積もれるかを試す設計だ。ただし、モデル系列、個別モデル、評価変種、テンプレートは既知のものを使う。未知なのは言語であり、新しいモデルや新しい問題構造への予測を同時に検証するものではない。
素朴な比較基準には、残った言語での各モデルの平均正解率を使う。これとは別に、統計モデルの予測へ対象言語の少数テンプレートによる実測を加え、補正の効果を測る。補助評価は各テンプレート20例で、予算ごとに3回抽出する。指標は予測正解率と実測正解率の平均絶対誤差だ。補助評価なしの統計モデルの誤差と、素朴な平均による予測の誤差は別であり、供給された記録には後者の具体的な値はない。
3. 結果と限界
規模と推論には関連があるが、距離の壁は残る
著者らの主分析では、規模、資源量、推論オンは正解しやすさと正に関連し、英語からの類型的距離は負に関連した。係数は順に1.768、0.773、0.669、−0.253だった。これは正解率の増減幅ではなく、正解と不正解の確率の比を対数で表した「対数オッズ」への係数だ。連続する特徴は1標準偏差の変化、推論はオフとの比較であり、例えば規模の係数を正解率の1.768ポイント上昇と読むことはできない。
規模と推論オンは、低資源言語の相対的不利を縮める方向にも関連した。一方、規模によって類型的距離の不利が縮むという効果は有意ではなかった。推論には小さな関連が出たが、別の分析仕様では再現しなかった。高正解率モデルを除く検証でも、資源量と規模の関係は残ったものの、係数は弱まった。主結果の一部が飽和で増幅されていたことになる。この部分集合では推論オン・オフの対が少なく、推論との関係は解釈していない。
92%は、個別モデルの成績を説明した割合ではない
主分析では、規模だけを使う基準仕様に言語特徴を加えると、言語間のばらつきを表す分散が92%減った。一方、モデルと言語の組み合わせに固有の分散の減少は23%だった。この差が論文の重要な境界線だ。言語全体としての難しさを捉えても、あるモデルだけが特定言語で苦戦する理由は多く残る。92%を、個々のモデルの正解率をほぼ説明できたという意味で読むべきではない。
実際、未知言語予測ではApertus-70Bの英語が予測約75%に対して実測約23%となるなど、大きな外れが報告されている。また、テンプレートと言語の組み合わせに固有の効果を追加すると適合は改善し、付録の説明率も変わる。付録の数値は本文の92%・23%と一致せず、その対応には不明な点が残る。著者らは事後的な仕様選択を避けて初期仕様を報告したと説明するが、精密な説明率には仕様依存性がある。
少数の実測は役立つが、少なすぎると悪化する
言語を丸ごと除外した予測で、モデル正解率の平均絶対誤差は、補助評価なしで5.98パーセントポイント、対象言語の10テンプレートを使うと4.19ポイントだった。95%区間はそれぞれ5.22〜6.86、3.75〜4.69ポイントで、15言語を再標本化して求めている。これは正解率の差であり、相対的な誤差率ではない。また、平均誤差なので、すべての予測がこの範囲に収まる保証もない。
改善は単調ではなかった。1テンプレートでは8.38ポイント、2テンプレートでは7.02ポイントと、実測なしより悪化した。5、10、20テンプレートでは順に5.63、4.19、2.73ポイントとなる。少数の実測を加えること自体が成功条件ではない。
順位の安定性も、正解率の精度とは別だ。10テンプレートで、100テンプレートによる順位との相関は0.964と高かったが、個別モデルと言語の正解率には7.26ポイントの標準誤差が残った。現生成器ではテンプレート間の違いが分散を支配するため、同じ構造から例を増やすだけでは精度改善に限界がある。
変種への弱さと翻訳品質を、移転とは分けて見る
記号的変種の正解率は、本文の705モデルと言語の組み合わせで、元問題より平均3.14パーセントポイント低かった。元問題と変種を同時に扱う付録の分析では、この落ち込みと資源量や類型的距離との関連は確認されなかった。新しい数値などに対応する弱さと、言語間の成績差は、同じ要因だけでは説明できないという結果だ。
翻訳の検証も省けない。全評価モデルの平均スコアを1ポイント幅で同等か調べたところ、アイスランド語の機械翻訳と人手検証後の問題は同等性を示さなかった。一方、英語の単位系を変更した比較では同等性が支持された。同等性を示せなかったことだけから、差の方向や大きさまでは決められないが、未検証の翻訳をそのまま同じ評価と扱う根拠にはならない。
対象は100テンプレート、15言語の小学校算数と、指示調整済み公開重みモデルである。他領域、基盤モデル、専門家混合型のMoEモデル、一般的な言語利用能力への一般化は未確認だ。次に見るべき証拠は、別の課題やモデル群でも予測精度が再現するか、個別モデルの大きな外れを説明できるかである。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
言語特徴を加えると、言語間の分散は大きく減る一方、モデルと言語の組み合わせに固有の差は多く残った。この観測からは、多言語モデルの選定で「その言語は全体として難しいか」と「採用候補のモデルがその言語で使えるか」を分けて判断することが考えられる。性能予測は評価の見通しを立てる材料になるが、対象モデルと対象言語での実測を残す設計が妥当だろう。10テンプレートによる補正はその可能性を示すものの、少なすぎる補助評価では悪化し、大きな予測外れもある。この方針が他領域にも役立つかは、別の課題での再現を待つ必要がある。