一言で
スケーリング則は、言語モデルの性能が、モデルの大きさ・学習に使うデータの量・学習に使う計算の量に応じてどう良くなるかを、実験から割り出した関係です。2020年1月に OpenAI などの研究者が論文で示しました。
このページで分かること
- 2020年の論文が、何と何の関係を見つけたとしているか
- 論文自身が書いている条件と限界
- 決まった計算の量をモデルとデータにどう振り分けるかで、2022年の論文の結論が違うこと
先に知っておく言葉
- パラメータ:学習で決まる、モデルの中の数値。その数がモデルの大きさを表す(→ 別ページ「パラメータとモデルの大きさ」)
- トークン:AI が文章を区切って扱う単位。学習に使うデータの量もこの数で表す(→ 別ページ「トークン」)
- 学習(事前学習)と推論:データを読ませてモデルを作ることと、できたモデルで答えを出すこと(→ 別ページ「学習(事前学習)と推論」)
- GPU・データセンター:AI の計算を速く進める部品と、その機械を大量に置いて動かす施設(→ 別ページ「GPU と計算資源・データセンター」)
- 埋め込み:言葉などを数の並びに置き換えたもの(→ 別ページ「埋め込み(ベクトル)」)
- Transformer:大規模言語モデルなどで使われているモデルの作り(→ 別ページ「Transformer と注意(アテンション)」)
- 損失(loss):モデルの予測が正解からどれだけ外れているかを表す数。小さいほど予測が当たっている
- 過学習:学習に使ったデータに合わせすぎて、新しいデータでは当たらなくなること
2020年の論文が示したこと
Jared Kaplan らの論文「Scaling Laws for Neural Language Models」(2020年1月23日、arXiv。著者の所属は OpenAI と Johns Hopkins University)は、Transformer の言語モデルを大きさや条件を変えてたくさん学習させ、損失の変わり方を調べました。
- 3つの量に沿って下がる:損失は、モデルの大きさ(埋め込みの部分を除いたパラメータの数)・データの量・学習に使った計算の量のそれぞれに対して、べき乗の関係(一方を何倍かにすると、もう一方が決まった割合で変わる関係)に沿って下がる。これは、残りの2つが足を引っ張っていないときの話。要旨によると、一部の傾向は7桁を超える範囲にわたる
- 形より規模:層の深さと幅の比のような作りの細かい違いは、ある程度の範囲の中では性能にほとんど効かない
- 大きいモデルほど少ないデータで済む:大きいモデルは小さいモデルより少ないデータと少ない学習の回数で、同じ性能に届く
- 計算の量が決まっていて、モデルの大きさやデータの量にほかの縛りが無いときの使い方:とても大きいモデルを、比べると控えめなデータで学習させ、学習が落ち着ききる(収束する)かなり前に止めるのが、最も効率がよいとした。計算が増えたら、その多くはモデルを大きくするほうに回すとよい、としている
- データの足し方:モデルを8倍にするとき、過学習による損を避けるには、データをおよそ5倍にすれば足りる、としている
実験に使ったモデルは、埋め込みを除くパラメータで768から15億まで、データは2200万から230億トークンまでの範囲です。
論文自身が書いている条件
- べき乗の関係なので、規模を大きくするほど、伸びは小さくなっていく
- 調べた範囲の上の端で、傾向から外れる兆しは見ていない。ただ、言葉にはどうしても予測しきれない部分があるので、いずれ頭打ちになるはず、としている。実際に、調べた範囲より何桁も大きい所で、自分たちの式どうしがつじつまの合わなくなる点があり、そこより前でこの関係は成り立たなくなるはず、と書いている
- どの関係にも、まだしっかりした理論の裏付けが無く、どんな場面で信頼してよいかを決めにくい
- 損失が下がり続けることが、実際の言葉の仕事での成績の伸びにつながるかは、確かめる必要がある
2022年の論文は、振り分け方の結論が違う
DeepMind の Jordan Hoffmann らの論文「Training Compute-Optimal Large Language Models」(2022年3月29日、arXiv)は、決まった計算の量の中で、モデルの大きさと学習トークンの数をどう振り分けるのが最もよいかを調べ直しました。
- 同じ点:計算の量に対して最もよい形にするなら、大きいモデルは損失が最も下がるまで学習させなくてよい、という結論は Kaplan らと同じだとしている
- 違う点:Hoffmann らの読み方では、Kaplan らは計算を10倍にするとき、モデルを5.5倍・学習トークンを1.8倍にするよう勧めていた。Hoffmann らは、モデルの大きさと学習トークンの数を同じ割合で増やすべきだとし、モデルを2倍にするなら学習トークンも2倍にする、としている
- 違いが出た理由として挙げていること:Kaplan らはどのモデルでも学習トークンの数と学習率の予定を固定していたこと、Kaplan らの実験の大半はずっと小さなモデルで、1億パラメータ未満のものも多かったこと
- 確かめ方:Gopher(2800億パラメータ)と同じ計算の量で、700億パラメータのモデル Chinchilla を1.4兆トークンで学習させた。Chinchilla は、Gopher や GPT-3(1750億)などを、多くの評価で上回ったとしている。小さい分、推論の費用も大きく下がる、としている
この論文は、当時の大きなモデルの多くが約3000億トークンで学習されていて、大きさに比べて学習が足りていない、とも書いています。一方で、計算の量とモデルの大きさの関係がべき乗に沿うという前提は Kaplan らと同じで、大きいモデルでの曲がりは今後の研究で入れたほうがよいかもしれない、としています。
日本の白書での紹介
総務省の「情報通信白書」令和7年版(2025年7月)は、2020年に OpenAI が、学習データの規模・計算量・パラメータ数が増えるほど大規模言語モデルの性能が上がるというスケーリング則を唱えた、と紹介しています。例として挙げているパラメータの数は、OpenAI の GPT-2(2019年)が15億、GPT-3(2020年)がその約120倍の1,750億、Google の PaLM(2022年4月)が5,400億です。図の注では、最近の大きなモデルはパラメータの数を公表しないことが多いと断っています。白書は、スケーリング則に従って、大手の IT 企業を中心に、GPU やデータセンターにお金をつぎ込む競争が激しくなった、とも書いています(→ 別ページ「GPU と計算資源・データセンター」)。
関連する言葉
- パラメータとモデルの大きさ・大規模言語モデル・学習(事前学習)と推論・GPU と計算資源・データセンター・ベンチマークと評価(→ この欄の別ページ)
出典
- Jared Kaplan ほか「Scaling Laws for Neural Language Models」arXiv、2020年1月23日 arxiv.org ↗
- Jordan Hoffmann ほか「Training Compute-Optimal Large Language Models」arXiv、2022年3月29日 arxiv.org ↗
- 総務省「令和7年版 情報通信白書」2025年7月、第Ⅰ部第1章第2節「激化する世界のAI開発競争」 soumu.go.jp ↗
- Google for Developers「Machine Learning Glossary」の loss・overfitting の項 developers.google.com ↗
確認メモ:2026年10月1日に、上の4つの出典の原文を開いて確かめました。Kaplan らの論文は PDF の文字を取り出し、要旨・1章のまとめ・2.3節(データ)・3章の冒頭・6.3節・8章・付録 C(注意点)を読みました。8章にある「理想気体の法則」のたとえは、長さの都合で載せていません。「言葉にはどうしても予測しきれない部分がある」は、論文の「自然言語のエントロピーはゼロではない」を言い換えたものです。つじつまの合わなくなる点の数字(計算の量やパラメータの数)は、論文自身が前後に1桁ずれうるほど不確かとしているため載せていません。Hoffmann らの論文は PDF の文字を取り出し、要旨・1章・2章・3章の冒頭を読みました。「Kaplan らは10倍の計算でモデル5.5倍・トークン1.8倍を勧めた」は、Hoffmann らの論文の書き方によるもので、Kaplan らの論文にこの数字のままの文はありません。情報通信白書は本文と図の注を読み、図そのものは開いていません。「損失」「過学習」の言い換えは、Google の機械学習の用語集の loss・overfitting の項に合わせて一言で添えたものです。その後のモデルでスケーリング則がどこまで当てはまっているかは、確かめた出典の範囲を超えるため載せていません。AIログのニュースでは、この言葉が出てくる記事の無料部分はまだ無いため、「ニュースでの出方」の節は置いていません。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省「令和7年版 情報通信白書」を加工して作成)。Kaplan らの論文は、要旨では「7桁を超える」、1.1節のまとめでは「6桁を超える」と書いていて、論文の中で書き方が分かれています。