AI Log

AIの基本 / ニュースに出る言葉

スケーリング則:モデル・データ・計算の量と性能の関係を表した経験則

出典を確かめた日 2026年10月1日(木) / 約8分で読めます

一言で

スケーリング則は、言語モデルの性能が、モデルの大きさ・学習に使うデータの量・学習に使う計算の量に応じてどう良くなるかを、実験から割り出した関係です。2020年1月に OpenAI などの研究者が論文で示しました。

このページで分かること

先に知っておく言葉

2020年の論文が示したこと

Jared Kaplan らの論文「Scaling Laws for Neural Language Models」(2020年1月23日、arXiv。著者の所属は OpenAI と Johns Hopkins University)は、Transformer の言語モデルを大きさや条件を変えてたくさん学習させ、損失の変わり方を調べました。

実験に使ったモデルは、埋め込みを除くパラメータで768から15億まで、データは2200万から230億トークンまでの範囲です。

論文自身が書いている条件

2022年の論文は、振り分け方の結論が違う

DeepMind の Jordan Hoffmann らの論文「Training Compute-Optimal Large Language Models」(2022年3月29日、arXiv)は、決まった計算の量の中で、モデルの大きさと学習トークンの数をどう振り分けるのが最もよいかを調べ直しました。

この論文は、当時の大きなモデルの多くが約3000億トークンで学習されていて、大きさに比べて学習が足りていない、とも書いています。一方で、計算の量とモデルの大きさの関係がべき乗に沿うという前提は Kaplan らと同じで、大きいモデルでの曲がりは今後の研究で入れたほうがよいかもしれない、としています。

日本の白書での紹介

総務省の「情報通信白書」令和7年版(2025年7月)は、2020年に OpenAI が、学習データの規模・計算量・パラメータ数が増えるほど大規模言語モデルの性能が上がるというスケーリング則を唱えた、と紹介しています。例として挙げているパラメータの数は、OpenAI の GPT-2(2019年)が15億、GPT-3(2020年)がその約120倍の1,750億、Google の PaLM(2022年4月)が5,400億です。図の注では、最近の大きなモデルはパラメータの数を公表しないことが多いと断っています。白書は、スケーリング則に従って、大手の IT 企業を中心に、GPU やデータセンターにお金をつぎ込む競争が激しくなった、とも書いています(→ 別ページ「GPU と計算資源・データセンター」)。

関連する言葉

出典

  1. Jared Kaplan ほか「Scaling Laws for Neural Language Models」arXiv、2020年1月23日 arxiv.org ↗
  2. Jordan Hoffmann ほか「Training Compute-Optimal Large Language Models」arXiv、2022年3月29日 arxiv.org ↗
  3. 総務省「令和7年版 情報通信白書」2025年7月、第Ⅰ部第1章第2節「激化する世界のAI開発競争」 soumu.go.jp ↗
  4. Google for Developers「Machine Learning Glossary」の loss・overfitting の項 developers.google.com ↗

確認メモ:2026年10月1日に、上の4つの出典の原文を開いて確かめました。Kaplan らの論文は PDF の文字を取り出し、要旨・1章のまとめ・2.3節(データ)・3章の冒頭・6.3節・8章・付録 C(注意点)を読みました。8章にある「理想気体の法則」のたとえは、長さの都合で載せていません。「言葉にはどうしても予測しきれない部分がある」は、論文の「自然言語のエントロピーはゼロではない」を言い換えたものです。つじつまの合わなくなる点の数字(計算の量やパラメータの数)は、論文自身が前後に1桁ずれうるほど不確かとしているため載せていません。Hoffmann らの論文は PDF の文字を取り出し、要旨・1章・2章・3章の冒頭を読みました。「Kaplan らは10倍の計算でモデル5.5倍・トークン1.8倍を勧めた」は、Hoffmann らの論文の書き方によるもので、Kaplan らの論文にこの数字のままの文はありません。情報通信白書は本文と図の注を読み、図そのものは開いていません。「損失」「過学習」の言い換えは、Google の機械学習の用語集の loss・overfitting の項に合わせて一言で添えたものです。その後のモデルでスケーリング則がどこまで当てはまっているかは、確かめた出典の範囲を超えるため載せていません。AIログのニュースでは、この言葉が出てくる記事の無料部分はまだ無いため、「ニュースでの出方」の節は置いていません。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省「令和7年版 情報通信白書」を加工して作成)。Kaplan らの論文は、要旨では「7桁を超える」、1.1節のまとめでは「6桁を超える」と書いていて、論文の中で書き方が分かれています。