一言で
パラメータは、AI のモデルが学習を通して決めていく数値です。論文や用語集では、モデルがこの数値をいくつ持っているか(パラメータの数)で、モデルの大きさを表しています。
このページで分かること
- パラメータが何で、人が決める設定の値(ハイパーパラメータ)とどう違うか
- 「大規模」「数百億のパラメータ」など、大きさの書き方が出典ごとにどう違うか
- 大きさが違うと何が変わると出典が書いているか(GPT-3 の論文の例など)
先に知っておく言葉
- モデル:入力を受け取って、予測などの出力を返す仕組み
- 学習:データを読ませて、モデルの中の数値を少しずつ整えていくこと(→ 別ページ「学習(事前学習)と推論」)
- 推論:学習を終えたモデルを使って、入力に対する答えを出すこと(→ 同じ別ページ)
- 大規模言語モデル:大量の文章で学習した、文章を読み書きするモデル(→ 別ページ)
- トークン:AI が文章を区切って扱う単位(→ 別ページ「トークン」)
パラメータは、学習で決まる数値
Google の機械学習の用語集は、パラメータを「重み(weight)」と「バイアス(bias)」をまとめた呼び方として説明しています。どちらも、モデルが学習のあいだに身につける数値です。
- 重み:モデルが、入ってきた値に掛ける数。用語集によると、学習とはちょうどよい重みを探し当てる作業で、推論とは探し当てた重みで予測を出す作業
- バイアス:出発点のずれを表す数。偏りの意味のバイアス(→ 別ページ「バイアス(偏り)」)とは別物だ、と用語集自身が注意している。用語集の例では、入園料が2ユーロで、1時間いるごとに0.5ユーロ足される遊園地の料金を表すモデルなら、最低でもかかる2ユーロがバイアスに当たる
日本の「AI事業者ガイドライン」も、AI モデルの説明の中で、国際標準(JIS X 22989:2023)にもとづく例を載せています。1次式の形のモデルを、データに合う直線を求める方法(線形回帰)で訓練すると、式の中の数が「3」や「7」のような決まった値になる、という例です。同じガイドラインの脚注には「学習済パラメータ」という言葉も出てきます(→ 別ページ「学習(事前学習)と推論」)。
人が決める値(ハイパーパラメータ)とは別
Google の用語集は、パラメータとは区別して「ハイパーパラメータ」という言葉を挙げています。こちらは、モデルが自分で身につける値ではなく、学習を回す人(または調整を受け持つサービス)が回ごとに決めて入れる値です。代表の例は学習率で、1回ごとに重みとバイアスをどれだけ強く動かすかを決めます。用語集の例では、学習率0.3は0.1の3倍強く動かします。GPT-3 の論文も、モデルごとに使った学習率などを「学習のハイパーパラメータ」として表にまとめています。
「大きい」の書き方は出典ごとに違う
- Google の用語集:大規模言語モデルを、最低限の条件としては、パラメータの数がとても多い言語モデル、と定義している。もっとくだけた使い方では、Transformer という作りにもとづく言語モデル(Gemini や GPT など)全般を指す、としている
- Anthropic(Claude の会社)の用語集:大規模言語モデルを、たくさんのパラメータを持ち、いろいろな役に立つ仕事をこなせる言語モデル、と説明している。何個から「大規模」かの数は書いていない
- NIST(米国の国立標準技術研究所)の生成AI の文書(AI 600-1、2024年7月):米国の大統領令(EO 14110)の定義を引いている。「二重用途の基盤モデル(dual-use foundation model)」を、幅広いデータで学習している・多くの場合は自己教師あり(人が正解を付けないデータでの学習)を使う・パラメータが少なくとも数百億ある・幅広い場面に使える、という条件で定めている
なお、この数は大規模言語モデルではなく「二重用途の基盤モデル」の定義の中の条件です。
GPT-3 の論文に見る「大きさ」
OpenAI の研究者らが2020年5月に出した論文「Language Models are Few-Shot Learners」は、大きさの違うモデルを並べて比べています。
- GPT-3 のパラメータは1750億。論文は、それまでのどの(論文の言う non-sparse の)言語モデルよりも10倍多い、としている
- 同じ設計のまま大きさを変えて、8つのモデルを作った。いちばん小さいもので1億2500万、いちばん大きいものが1750億のパラメータで、3桁にまたがる。ここでのパラメータの数は、学習で動かせるパラメータの総数
- 8つのモデルはどれも、同じ3000億トークンの量で学習している
- モデルの名前は「GPT-3 175B」「125M」のように書かれる。B は billion(10億)、M は million(100万)
- 大きさを何段階も作ったのは、学習データが十分にあれば、モデルの誤差の減り方は大きさに対しておおよそなめらかな形になる、という先の研究の見立て(スケーリング則 → 別ページ)を確かめるためでもある、と書いている
- 結果として、多くの課題では、大きさにつれて成績が比較的なめらかに伸びた、としている
大きいと何が変わるか
- 学べることの幅:Google の用語集は、モデルが学べる問題の込み入り方を「容量」と呼び、容量はふつう、パラメータの数とともに増える、としている
- 使うときの手間:GPT-3 の論文は、限界の1つとして、この規模のモデルは推論に費用がかかり扱いにくいことを挙げている。手立ての候補として、特定の仕事に向けて小さく作り直す「蒸留」(→ 別ページ「小さいモデルと蒸留」)を挙げている
- 返事までの時間:Anthropic の用語集は、返事までの時間に影響しうるものの1つとしてモデルの大きさを挙げている。ほかに、機械の性能・通信の状態・指示と返事の込み入り方も挙げている
- 小さいモデル:Google の用語集は、計算の力が限られたスマートフォン・タブレット・機器に組み込む装置などで動かせるように作った小さいモデルを「compact model」と呼んでいる
関連する言葉
- 大規模言語モデル・学習(事前学習)と推論・スケーリング則・小さいモデルと蒸留・量子化(→ この欄の別ページ)
出典
- Google for Developers「Machine Learning Glossary」の parameter・weight・bias (math)・hyperparameter・learning rate・large language model・model capacity・compact model の項 developers.google.com ↗
- Tom B. Brown ほか「Language Models are Few-Shot Learners」arXiv、2020年5月28日 arxiv.org ↗
- Anthropic「Glossary」の LLM・Latency の項 platform.claude.com ↗
- NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月 doi.org ↗
- 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編 2026年3月31日、第1部の「AI モデル(ML モデル)」の項と第2部の脚注36 soumu.go.jp ↗
確認メモ:2026年10月1日に、上の5つの出典の原文を開いて確かめました。Google の用語集(2026年4月10日更新の版)は、パラメータ・重み・バイアス・ハイパーパラメータ・学習率・大規模言語モデル・容量・compact model の項を読みました。遊園地の料金の例と、学習率0.3と0.1の例は、用語集に載っている例です。GPT-3 の論文は PDF の文字を取り出し、要旨・2章(表2.1を含む)・3章の冒頭・5章の限界の段落を読みました。「B は billion、M は million」は、ふつうの意味を添えたものです。NIST の文書は脚注にある大統領令の定義を読みました。この定義は2024年7月の文書が引いているもので、いまも有効かどうかはこのページでは確かめていません。AI事業者ガイドラインは、第1部の AI モデルの定義と、コンテキスト内学習の脚注36を読みました。「学習率(重みとバイアスをどれだけ強く動かすか)」「自己教師あり」の言い換えは、ふつうの意味を一言で添えたものです。出典の式(1次式・線形の式)は、数式を使わない決まりのため言葉で書き直しました。AIログのニュースでは、パラメータの数が出てくる記事はまだ無いため、「ニュースでの出方」の節は置いていません。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省・経済産業省「AI事業者ガイドライン(第1.2版)」を加工して作成)。