一言で
蒸留は、大きいモデル(教師)の出す答えをお手本にして、小さいモデル(生徒)を学習させ、大きいモデルに近い予測をできるようにする方法です。Google の用語集と講座は、小さいモデルは速く、少ない計算で動かせる一方、予測はふつう元のモデルに及ばない、としています。
このページで分かること
- なぜ小さいモデルが求められるのか(出典ごとの理由)
- 蒸留の仕組み(教師と生徒、お手本の渡し方)
- 蒸留でどこまで成績を保てるか、出典が書いている結果と限界
先に知っておく言葉
- モデル:入力を受け取って、予測などの出力を返す仕組み
- パラメータ:モデルが学習で決めていく数値。この数でモデルの大きさを表す(→ 別ページ「パラメータとモデルの大きさ」)
- 推論:学習を終えたモデルで答えを出すこと(→ 別ページ「学習(事前学習)と推論」)
- ファインチューニング:学習済みのモデルを、特定の仕事向けの例で追加学習させること(→ 別ページ「ファインチューニング」)
なぜ小さいモデルが要るのか
出典によって、挙げている理由の置きどころが違います。
- この方法を「distillation(蒸留)」と名付けた論文(Hinton・Vinyals・Dean、2015年3月):音声や物体の認識のような仕事では、学習の段階は、その場で答える必要がなく、大量の計算を使ってよい。一方、大勢の利用者に向けて動かす段階では、返事の速さと計算の量への要求がずっと厳しい。論文はこれを、幼虫と成虫で体のつくりがまったく違う虫にたとえている(Hinton らの論文のたとえ)。そのうえで、学習では扱いにくいほど大きいモデルを使ってもよく、学習を終えたら、使う段階に向いた小さいモデルへ知識を移せばよい、という考え方を示している
- Google の機械学習の用語集:スマートフォン・タブレット・機器に組み込む装置のように、計算の力が限られたところで動かすために作った小さいモデルを「compact model」と呼んでいる
- GPT-3 の論文(2020年5月):この規模のモデルは推論に費用がかかり扱いにくいことを限界に挙げ、特定の仕事に向けて扱える大きさまで蒸留することを、先の手立ての1つとしている。当時、数千億のパラメータの規模では蒸留はまだ試されていない、とも書いている
- NIST(米国の国立標準技術研究所)の生成AI の文書(AI 600-1、2024年7月):蒸留や圧縮で学習済みのモデルの小さい版を作ると、推論のときの環境への影響を減らせる可能性がある。ただし、そうしたモデルを学習・調整すること自体は環境に影響しうる、としている
- AI事業者ガイドライン(第1.2版、2026年3月31日):「持続可能性の確保」の項で、生成AI のように計算量が多いものについては、目的に応じてモデルを使い分けることや、モデルを軽くすることを対策に挙げている。蒸留という言葉は使っていない
蒸留の仕組み
大きいほうを教師モデル、小さいほうを生徒モデルと呼ぶのは、Google の用語集と講座(Machine Learning Crash Course)や Gholami ほかの論文です(Hinton らの論文は、この呼び方を使っていません)。お手本の渡し方は、出典によって説明が違います。
- Hinton らの論文:教師が出す「どの答えがどれくらい確からしいか」の割合を、生徒の学習の目標にする(論文は soft targets と呼ぶ)。正解だけでなく、外れの答えに付く小さな割合にも、教師がどう一般化しているかの情報が入っているからで、論文の例では、BMW の写真をごみ収集車と取り違える見込みは小さいが、それでもニンジンと取り違えるよりは何倍も大きい。割合のなだらかさを決める値を論文は「温度」と呼び、教師の温度を上げて、なだらかなお手本を作る
- Google の用語集:生徒の予測と教師の予測の差が小さくなるように、生徒を学習させる
- Google の講座:いちばんよくある形は、教師に大量のデータへ一括で答えを付けさせ、そのデータで生徒を学習させる方法。例として、大きいモデルで学習用のコメントに有害さの点数を付け、それで、実際の投稿をその場でさばける大きさの採点モデルを作る、という使い方を挙げている
講座は、ファインチューニングとの違いも書いています。ファインチューニングしたモデルは元のモデルとパラメータの数が同じで、蒸留はパラメータの少ない版を作る、という違いです。
どこまで成績を保てるか
- Hinton らの論文:Android の音声検索で使われていたものを少し古くした版の音声認識のモデル(パラメータは約8500万)で試した。同じ形のモデル10個の平均の予測を教師にし、1個ぶんの大きさのモデルに蒸留したところ、10個にしたことで上がった正解率(音の短い区切りごとの判定の正解率)の伸びの8割を超える分が、1個のモデルに引き継がれた
- Google の用語集と講座:生徒は速く動き、メモリ・計算・エネルギーも少なくて済む。ただし予測は、ふつう教師ほど良くない
- 量子化の手法をまとめた論文(Gholami ほか、2021年):蒸留だけで大きく縮めるのは難しく、強く縮めると無視できない成績の落ち込みが出やすい。量子化(→ 別ページ「量子化」)や、モデルの一部を取り除く方法と組み合わせると、大きな成果が出ている、としている
関連する言葉
- パラメータとモデルの大きさ・ファインチューニング・量子化・学習(事前学習)と推論(→ この欄の別ページ)
出典
- Geoffrey Hinton・Oriol Vinyals・Jeff Dean「Distilling the Knowledge in a Neural Network」arXiv、2015年3月9日 arxiv.org ↗
- Google for Developers「Machine Learning Glossary」の distillation・compact model の項 developers.google.com ↗
- Google for Developers「Machine Learning Crash Course」の「LLMs: Fine-tuning, distillation, and prompt engineering」 developers.google.com ↗
- Tom B. Brown ほか「Language Models are Few-Shot Learners」arXiv、2020年5月28日 arxiv.org ↗
- Amir Gholami ほか「A Survey of Quantization Methods for Efficient Neural Network Inference」arXiv、2021年3月25日 arxiv.org ↗
- NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月 doi.org ↗
- 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」2026年3月31日、第2部 C.「共通の指針」1) 人間中心の「⑥持続可能性の確保」 soumu.go.jp ↗
確認メモ:2026年10月1日に、上の7つの出典の原文を開いて確かめました。Hinton らの論文は PDF の文字を取り出し、要旨・1章・2章・3章・4章(表1)・8章を読みました。虫のたとえ、BMW とごみ収集車とニンジンの例は、この論文に載っているものです。音声認識の数字は、表1の正解率(基準のモデル58.9%、10個の平均61.1%、蒸留したモデル60.8%)と、伸びの8割を超える分が引き継がれたという本文の記述によります。Google の用語集(2026年4月10日更新の版)は distillation と compact model の項を、講座(2025年12月3日更新の版)は Distillation の節と、開いて読む仕組みの説明を読みました。有害さの採点の例は講座に載っている例です。GPT-3 の論文は、5章の限界の段落を読みました。Gholami ほかの論文は、1章で蒸留を説明している段落を読みました。NIST の文書は2.5節(環境への影響)を、AI事業者ガイドラインは第2部の共通の指針の該当の項を読みました。「教師」「生徒」は teacher・student のふつうの訳、「温度」は temperature のふつうの訳を添えたものです。論文の温度の式や、学習の目標の式は、数式を使わない決まりのため載せていません。Hinton らの論文の、専門のモデルを多数組み合わせる部分(5〜7章)は、蒸留の説明から外れるため載せていません。AIログのニュースでは、この言葉はまだ出てきていないため、「ニュースでの出方」の節は置いていません。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省・経済産業省「AI事業者ガイドライン(第1.2版)」を加工して作成)。