Wild AI:Web上のAI生成テキストは事前学習でいつ役立ち、いつ害になるのか
AI生成Webテキストの追加効果は人間由来データの量と評価対象に依存し、混合検証セットは人間の文章への悪影響を隠しうる。
How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text
論文の書誌情報と関連リンク
- arXiv初回投稿日
- 掲載先
- arXiv preprint
ポッドキャスト形式で聴く
約6分AI生成の会話音声です。記事の要点を短くまとめています。
概要
Webから集めたAI生成文は、言語モデルの事前学習で人間の文章と同じ価値を持つのか。Wild AIの研究は、800モデルの学習実験から、その価値が人間由来データの量と評価対象によって変わると報告する。人間データが少なければ追加が役立つこともあるが、利益は頭打ちになり、悪化へ転じる。利益と害を分けた新しいスケーリング則は、学習への適合に使わなかった大きさのモデルで、追加効果の予測誤差を最良の既存則より41%減らした。ただし、検証は英語Webテキストと9億7300万パラメータ以下のモデルが中心で、実用規模への一般化は未確認だ。
なぜ注目されているか
2026年10月3日の取得時点で、Hugging Faceでは2 upvotesと2件のコメントが記録されている。HFが記録した公開リポジトリのGitHub starsは1で、現時点の観測範囲では反応は小規模だ。
議論全体へのリンク
なぜ重要なのか
この結果が対象モデルでも再現するなら、学習データを増やす判断に、量だけでなく由来と評価対象を加える必要がある。とくに、人間の文章への適合を重視する場合、AI文を含む検証セットの平均改善だけでは採用を判断しにくい。AI文追加と人間文の反復を比較し、人間・AI別に損失を見ることが、追加データの選択を見直す材料になる。
この記事に出てくる言葉(6語)
- Wild AI
多様なモデルが人間の読者向けに生成し、Webへ流入したAI文章を集めた英語コーパス。
この論文では訓練目的に整備した合成データとは区別し、Webで自然に収集されるAI文の追加効果を調べる。
- スケーリング則
モデル規模や学習データ量と、予測損失の関係を表す式。
この論文ではAI文追加の飽和する利益と増える害を分けて表し、追加効果を予測する。
- 次トークン損失
文章の続きを予測するときの誤差を表す指標。低いほど評価文章に適合している。
この論文では人間文とAI文を分けて測る。下流の課題を解く能力や、文章品質全般を直接測るものではない。
- bits per byte
BPB
予測損失を、文章の1バイト当たりのビット数で表した指標。低いほどよい。
この論文では最終チェックポイントの文章予測を評価する指標として使う。
- paired RMSE
対応する対照群との差について、予測と実測のずれを二乗平均平方根でまとめた指標。低いほど予測が正確。
この論文ではAI追加による対数損失の変化を、各実行の人間のみの対照群と対応させて評価する。
- TPP_h
TPP_h
モデルの1パラメータ当たりに学習する人間由来トークン数。
この論文では人間データの予算を表す。AI文の追加分はこの数に含めない。
1. 読む前に知っておきたいこと
Webで集まるAI文をどう扱うか
言語モデルの事前学習は、大量の文章から次に来るトークンを予測する学習だ。ここでトークンは、モデルが文章を処理する単位を指す。Webから文章を集める場合、その中には人間が書いた文とAIが生成した文が混ざる。本研究が問うのは、人間由来のコーパスを固定したうえで、Web由来のAI文を足すと、人間の文章の予測がどう変わるかである。
対象の「wild AI text」は、多様なモデルが人間の読者向けに書き、Webへ流入した文章を指す。訓練目的に合わせて生成・整備された合成データとも、モデル自身の出力で再帰的に学習する設定とも異なる。したがって、本研究でAI文追加が不利でも、合成データ全般が役立たないとはいえない。生成の目的と収集の仕方が、比較の前提になっている。
追加トークンを同じ価値で数える限界
スケーリング則とは、モデル規模やデータ量と予測損失の関係を表す式だ。既存のChinchillaは、人間文とAI文を区別せず、総トークン数でデータの効果を表す。多くの反復データ則も、追加トークンの価値を負にはしない。この扱いでは、データを足したために人間文の予測が悪化する現象を十分に表せない。
著者らが報告するのは、人間データが少ないモデルではAI文追加が初めは役立つものの、増量につれて利益が飽和し、害へ転じるという関係だ。人間データの予算が約20 TPP_h、つまり1パラメータ当たり約20人間トークンになると、利益はごく小さく、追加量を増やすと悪化する。同量の新規人間文を追加した場合は損失が下がる。問われているのはデータの量だけでなく、何を足すかである。
「何への適合か」を先に決める
本研究の主な評価は次トークン損失である。これは文章の続きを予測するときの誤差で、低いほど、その評価文章に適合している。人間文の損失とAI文の損失は、同じ方向へ動くとは限らない。この区別が、結果を読むための重要な前提になる。
たとえば、人間の読者向けのWeb記事を扱うモデルについて、追加データの候補を選ぶ場面を考える。AI文を加えて検証全体の損失が下がっても、その検証セットにAI文が含まれていれば、人間文への適合が改善したとは限らない。本研究はこの判断に材料を与える。ただし、記事の正確さや創造性、実際の業務成果を測った実験ではない。文章予測への適合と製品としての有用性の間には、別の評価が必要だ。
2. 手法と評価
人間文とAI文を分けた学習プール
著者らはFineWebを2026年6月まで拡張し、9604万文書、833.1億トークンの英語コーパスWild AIを作成した。EditLensで人間候補とAI候補を選び、Pangramという検出器で文書を判定する。先頭・中央・末尾から最大三つの512トークン窓を調べ、すべての判定が一致した文書だけを人間またはAIとする。混合と判定された文書は学習プールから除いた。
得られた人間プールは421.9億、AIプールは353.2億トークンで、形式とトピックのラベルも付く。ただし、この区分は検出器の判断に依存する。候補を事前選別しているため、Wild AI内のAIトークン比率42%を、自然なWebのAI比率として読むことはできない。明確に分類できる文書を使った実験であり、混合文書を含むWeb全体への適用には、この差を残して考える必要がある。
利益は頭打ちになり、害は増える
提案則は、AI文追加の効果を利益と害の二つに分ける。利益側では、AI文が人間文に換算してどれだけ有効なデータ量を増やすかを表す。ただし、追加を続けても利益は同じ割合では増えず、飽和する。害側はAI追加量とともに増え、人間データの予算とモデル規模にも依存する。この二つを合わせることで、追加トークンの正味価値がプラスからマイナスへ変わることを表現できる。
AI追加比率は、AIトークン数を人間トークン数で割った値だ。比率1なら両者の量は同じになる。これは総データ中のAI割合とは異なる。提案則は、人間予算、モデル規模、この追加比率を使って損失を予測する。AI文がゼロならChinchillaに戻る構造も持つ。ここでの「利益」と「害」は観測された損失の動きを表す項であり、AI文が悪化を起こす原因まで特定したものではない。
800モデルで追加前後を対応させる
学習した800モデルは、1990万から9億7300万パラメータの範囲にある。実際の人間データ予算は2.9~87.5 TPP_h、AI追加比率は0~64だ。共通の学習レシピを使い、AI追加群と人間のみの対照群で、人間文書、その順序、乱数の初期値であるseedをそろえた。これにより、人間データの違いを抑えながら追加効果を比較している。
一方、AI文を足す群では、追加量に応じて学習ステップと学習率の減衰時期も変わる。総計算量を固定して人間文をAI文へ置き換えた実験とは区別すべきだ。703実行は単一seedで、別seedによる97実行の反復は小さい開発用サイズに限られる。さらに、AI除去の19対と人間文反復の6モデルを別途調べた。これら44モデルは、800モデルの式の適合には含まれていない。
何を予測できたかを測る
最終モデルの評価には、損失を1バイト当たりのビット数で表すbits per byte、略してBPBを使う。人間側はC4、FW22、FW26-Hと、Palomaの16ソースのマクロ平均、混合はFW26、AI側はFW26-AIとCosmopediaを評価する。FW26の元プールのAI比率は22.3%だが、系列の切り詰め後に実際に採点するトークンでは20.1%になる。
式の適合には1990万~2億6800万パラメータの726モデルを使い、4億7700万と9億7300万の74モデルで予測を評価した。11種類の既存則も同じ分割と適合手順で比較する。主指標のpaired RMSEは、各追加実行と対応する対照群について、対数損失の変化の予測誤差をまとめた値だ。小さいほど追加効果を正確に予測する。絶対的な損失の予測精度とは別の問いであり、この区別は結果の順位を読む際にも重要になる。
3. 結果と限界
追加効果の予測は改善した
著者らによると、全AI追加比率を対象とした未適合サイズのC4評価で、paired RMSEは提案則が0.83×10⁻³、最良の既存則であるShukorらのjoint lawが1.41×10⁻³、Chinchillaが4.32×10⁻³だった。41%減という結果は、最良既存則に対する予測誤差の相対減少である。モデル自体の能力が41%向上したという意味ではない。
式の要素を一つずつ変えるアブレーションでは、利益項なしの誤差は3.29×10⁻³、害項なしでは3.27×10⁻³となり、両項が精度に寄与した。ただし、別の飽和関数でも同等の結果が得られ、害を損失へ加算する別形式との差も不確実性の範囲内だった。採用した形だけが最良とはいえない。また、関数形の選択には未適合サイズの成績も使われており、完全に手を触れない評価としては読めない。
混合検証は人間側の悪化を隠す
評価対象を分けた結果は、とくに判断への影響が大きい。553のAI追加実行すべてでFW26-AIの損失が下がった一方、人間側では44%が悪化した。FW26-Hで悪化した243実行のうち、AI比率22.3%の設定の混合検証では、95.5%が対照群より改善したと表示された。AI比率5%でも、その割合は49.4%だった。いずれも著者らの報告であり、悪化した実行を分母にした割合である。
記事を扱うモデルの例に戻ると、混合検証の改善だけを見て追加データを採用すると、人間の文章への適合低下を見落とす可能性がある。AI側の改善が平均値を押し下げるためだ。ただし、AI文を予測・理解することが目的なら、その改善には価値がある。結果はAI文の価値を一律に否定するものではなく、評価対象によって追加データの判断が変わることを示している。
除去と反復が有利だった条件
AI比率22.3%の混合と、その人間部分だけを使う19対の比較では、人間予算が約10~15 TPP_hを超えると、AI除去でC4損失が下がる条件が観測された。提案則は19対中18対の変化方向を正しく予測し、paired RMSEは3.28×10⁻³だった。Chinchillaは、実際に改善した13対すべてで逆方向を予測した。データ量が減っても、人間文への適合が改善しうる点が、総量だけで判断する難しさを表している。
人間文の反復も比較した。1990万・3580万パラメータ、20 TPP_hで追加トークン数をそろえると、反復群のC4損失はAI追加群より、追加1エポック後に2.3%、追加8エポック後に6.3~6.4%低かった。エポックはコーパスを一巡する学習単位で、数値は損失の相対差だ。C4・FW22・FW26-Hの18比較すべてで反復が上回った。ただし、これらの規模と条件から、大規模モデルや整備された合成データでも同じ順位になるとはいえない。
能力、規模、計算量には別の検証が要る
予測則の優位には範囲がある。AI追加比率が1未満のC4・FW22では、joint lawとの誤差差の95%区間がゼロを含む。絶対損失の予測ではC4で別の既存則が上回り、混合・AI文への追加効果ではjoint lawが最良だった。提案則は、すべての対象と指標で勝ったわけではない。
下流評価も同じ結論にはならない。20 TPP_hで人間コーパス以上の量を追加したAI群23実行では、標準ベンチマークCOREが対照群比で1.6ポイント上がる一方、C4損失は2.3%増えた。新規人間文を追加した6実行では、COREが1.9ポイント上がり、C4損失は3.0%減った。MMLUは全モデルで偶然水準だった。小規模モデルのこの結果から、実用モデルの下流能力や創造性の低下まで結論することはできない。
計算量については、2億6800万パラメータ、20 TPP_h、AI比率31.1%で同じC4損失に達する場合、人間のみの学習の1.6倍を要するとの推定を示す。これは適合則から得た値で、実測時間や金銭的費用の比較ではない。検証は9億7300万パラメータ以下で、80億モデルは学習していない。実用規模、別言語、事後学習での再現と、検出ラベルの精度、下流能力との関係が次の確認点になる。著者らはコーパス、800モデル、実験コードの公開を報告しているが、提供記録には独立再現の証拠はない。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
本研究で採用判断を変えうるのは、人間文で悪化した実行の多くが、混合検証では改善と表示された点だ。人間の文章への適合を目的とするなら、検証全体の平均に加えて、人間・AI別の損失を意思決定へ入れる設計が考えられる。目的に対応する評価を分けることで、AI側の改善に隠れた悪化を点検できる。ただし、この判断が実用モデルでも有効かは、対象コーパスの検出ラベルが信頼できることと、人間側の損失変化が必要な下流能力にどう結び付くかに依存する。次に見るべき証拠は、実用規模でこの二つを同時に確かめる評価だ。