一言で
学習は、データを読ませてモデルの中の数値(パラメータ)を整えていく段階で、推論は、学習を終えたモデルに入力を渡して答えを出させる段階です。事前学習は、大量のデータで最初に行う学習を指します。
このページで分かること
- 学習・事前学習・推論が、それぞれ何を指すか(出典ごとの説明)
- 事前学習を終えたモデルが、そのあとどう整えられるか
- 学習と推論で、かかる計算や電力がどう違うと出典が書いているか
先に知っておく言葉
- モデル:入力を受け取って、予測などの出力を返す仕組み
- パラメータ:モデルが学習で決めていく数値(→ 別ページ「パラメータとモデルの大きさ」)
- 大規模言語モデル:大量の文章で学習した、文章を読み書きするモデル(→ 別ページ)
- プロンプト:モデルに渡す指示や入力の文(→ 別ページ「プロンプトとシステムプロンプト」)
- ファインチューニング:学習を終えたモデルを、追加のデータでさらに学習させること(→ 別ページ)
- RLHF:人の評価をもとにモデルを調整するやり方(→ 別ページ「人の評価で調整する」)
学習:モデルの中の数値を整える段階
Google の機械学習の用語集は、学習(training)を、モデルを形づくるパラメータのちょうどよい値を見つけていく作業、と説明しています。学習のあいだ、仕組みはデータの例を読み込んでは、パラメータを少しずつ動かします。1つの例を使う回数は、数回のこともあれば数十億回のこともある、としています。
日本の「AI事業者ガイドライン」も、AI モデルを、学習データで機械学習をした結果できあがり、入力に応じた予測を出すもの、と定義しています。参考に載せた国際標準(JIS X 22989:2023)の注も、機械学習のモデルは訓練を経てできる、としています。
事前学習:最初に、大量のデータで行う学習
事前学習の説明は、出典によって力点が違います。
- Anthropic(Claude の会社)の用語集:言語モデルを、正解の付いていない大量の文章で学習させる最初の段階。Claude の場合は、文書の中のそれまでの文の流れから、次の単語を予測するように学習させる。こうしてできたモデルは、そのままでは質問に答えたり指示に従ったりするのが得意ではなく、望む動きを引き出すには、プロンプトを書く高い腕前が要ることが多い。そこでファインチューニングと RLHF で手を入れ、幅広い仕事に役立つようにする
- Google の用語集:大きなデータセットでの、最初の学習。例として、英語版 Wikipedia の全ページのような膨大な文章で大規模言語モデルを事前学習させることを挙げている。事前学習を終えたモデルの中には「不器用な巨人」(Google の用語集のたとえ)のようなものもあり、ふつうは追加の学習で磨く必要がある、としている。磨き方として、蒸留(→ 別ページ「小さいモデルと蒸留」)・ファインチューニング・指示に従う力を高める調整(instruction tuning)などを並べている
- AI事業者ガイドライン(第1.2版):学習を、データを使って AI モデルのパラメータを決めたり改善したりする過程とし、場合によって、パラメータを最適化する事前学習と、必要に応じて調整を続ける事後学習の2つに分かれる、としている。事後学習は、事前学習を終えたモデルを特定の用途に合わせるための追加の学習で、主なやり方にファインチューニングなどを挙げている。AI を開発する事業者には、事後学習をするときに、商用で使えるライセンスか・事前学習に使ったデータ・学習と実行に要る機械の性能などを見て、元のモデルを適切に選ぶよう求めている
Google の用語集によると、「事前学習済みモデル(pre-trained model)」は、もとは学習を終えたモデル全般を指しうる言葉ですが、いまはふつう、学習を終えた大規模言語モデルなどの生成AI のモデルを指します。
推論:学習を終えたモデルを使う段階
- Google の用語集:従来の機械学習では、学習を終えたモデルを、正解の付いていないデータに当てはめて予測を出すこと。大規模言語モデルでは、学習を終えたモデルを使って、プロンプトに対する返事を作ること。なお、統計学での「推論」は少し違う意味になる、とも書いている
- AI事業者ガイドライン(第1.2版):推論を、学習を終えたモデルにまだ見ていないデータを入れて、予測・分類・生成などの出力を得る過程、としている。参考に載せた国際標準の定義でも、AI モデルを、入力されたデータや情報をもとに「推論(inference)」や予測を作り出す数学的な構造、としている
例を見せても、パラメータは書き換わらない
推論のときにプロンプトの中で例や説明を見せて、仕事のやり方を合わせることもできます。
- AI事業者ガイドライン:大規模言語モデルをはじめとする生成AI では、使う人がプロンプトを入れることで、学習済みのパラメータを書き換えずに、特定の仕事を学ばせることができる。これを「コンテキスト内学習」と呼ぶ、と脚注で説明している
- GPT-3 の論文(OpenAI の研究者ら、2020年5月):推論のときに仕事の例をいくつか見せるやり方(few-shot)を試している。このやり方では重みの更新は一切しない、としている。そのうえで、このときモデルが新しい仕事を一から学んでいるのか、学習で見た型を見分けているだけなのかは、まだはっきりしない、と書いている
学習と推論で、かかるものが違う
- GPT-3 の論文:1750億パラメータの GPT-3 の事前学習には、計算量の単位(petaflop/s-days)で数千が要った。15億パラメータの GPT-2 では数十だった。一方で、学習を終えたあとは意外なほど効率がよく、1750億パラメータのモデルでも、100ページ分の文章を作るのに使う電力は0.4キロワット時ほど、電気代にして数セントほどだ、としている。ただし同じ論文は、この規模のモデルは推論に費用がかかり扱いにくい点も、限界の1つに挙げている
- NIST(米国の国立標準技術研究所)の生成AI の文書(AI 600-1、2024年7月):生成AI の学習・保守・運用(推論を動かすこと)は、どれも多くの資源を使う。使う電力や出す二酸化炭素は、事前学習・ファインチューニング・推論のどれをするか、扱う中身の種類、使う機械、仕事の種類によって変わる、としている。影響を見積もる決まったやり方は、いまのところ無い、ともしている
ニュースでの出方
- 学習:OpenAI の GPT-6.1 Sol の記事(同じ日に AWS の Amazon Bedrock でも使えるようになった、という部分)では、AWS が、使ったデータを学習に使わないと説明していることを挙げています(→ 別ページ「データの扱い」)
- OpenAI「GPT-6.1 Sol」。上位の Astra に近い力を、5分の1の料金で
- 推論:AWS で Claude を国や地域の中だけで処理できる所が広がった記事では、本文は「処理」と書いています。出典に挙げた AWS の発表の題では、この処理が「inference(推論)」と書かれています
- AWS で Claude を「国の中だけで処理」できる所が、韓国・シンガポール・インドに広がった。日本は?
- 学習(訓練):GPT-6.1 Astra の記事では、同じ日に OpenAI が、強いモデルを訓練するときの安全の示し方の指針を出したことに触れています
- OpenAI、次の上位モデル「GPT-6.1 Astra」を出さないと決めた。理由は「任された範囲を守れない所」
関連する言葉
- パラメータとモデルの大きさ・ファインチューニング・人の評価で調整する(RLHF・Constitutional AI)・プロンプトとシステムプロンプト・データの扱い・GPU と計算資源(→ この欄の別ページ)
出典
- Anthropic「Glossary」の Pretraining の項 platform.claude.com ↗
- Google for Developers「Machine Learning Glossary」の training・pre-training・pre-trained model・inference の項 developers.google.com ↗
- 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編 2026年3月31日、第1部の「AI モデル(ML モデル)」「学習」「推論」の項と脚注17・第2部の脚注36・第3部 D-2)iii. soumu.go.jp ↗
- Tom B. Brown ほか「Language Models are Few-Shot Learners」arXiv、2020年5月28日 arxiv.org ↗
- NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月 doi.org ↗
確認メモ:2026年10月1日に、上の5つの出典の原文を開いて確かめました。Anthropic の用語集は Pretraining の項、Google の用語集(2026年4月10日更新の版)は training・pre-training・pre-trained model・inference の項を読みました。「不器用な巨人」は Google の用語集にあるたとえ(clumsy giants)を訳したものです。AI事業者ガイドラインは、第1部の学習・推論・AI モデルの定義と事後学習の脚注17、第2部のコンテキスト内学習の脚注36、第3部(AI 開発者に関する事項)D-2)iii. の事後学習の段落を読みました。GPT-3 の論文は PDF の文字を取り出し、2章(few-shot の説明)・5章の限界・6.3節(電力)を読みました。電力の数字は論文の書き方(「〜ほど」の見積もり)のとおりです。NIST の文書は2.5節(環境への影響)を読みました。同じ節にある、学習で出る二酸化炭素を飛行機の往復の回数で示した見積もりと、小さく作り直したモデルの影響についての段落は、長さの都合で載せていません。「ニュースでの出方」は、AIログの記事の無料部分にこの言葉が出てくるものを挙げました。このページの「推論」は、英語の inference に当たるものに絞って書いています。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省・経済産業省「AI事業者ガイドライン(第1.2版)」を加工して作成)。