AI Log

AIの基本 / ニュースに出る言葉

量子化:モデルの数値を少ないビットで持ち、軽くする方法

出典を確かめた日 2026年10月1日(木) / 約6分で読めます

一言で

量子化は、モデルの中の数値を、より少ないビット数で表すように置き換えることです。メモリや計算、返事までの時間を減らせますが、出典は、予測の正確さが落ちることがあるとしています。

このページで分かること

先に知っておく言葉

「量子化」の意味は1つではない

Google の機械学習の用語集は、量子化を、いくつかの意味で使われる言葉だとして、3つの使い方を並べています。

このページでは、以下、モデルを軽くする3つ目の意味で書きます。

一方、量子化の手法をまとめた論文(Gholami ほか、2021年)は、もっと広く、連続した実数の値を、決まった数のとびとびの値に割り当てる問題として説明しています。そのとき、使うビット数はできるだけ少なく、計算の正確さはできるだけ高くしたい、という問題です。この論文によると、丸めや切り捨てはその典型の例で、こうした考え方はデジタルの計算機より前から長い歴史があります。

何がどれだけ減るか

やり方の分け方

Gholami ほかの論文は、量子化したあとにモデルのパラメータを整えるやり方として、主に次の2つを挙げています(学習のデータを使わない方法も、別に扱っています)。

同じ論文は、動かし方の違いも挙げています。パラメータだけを少ないビットで持ち、計算のときは元の細かい数に戻して計算する方法と、計算もすべて少ないビットの整数で行う方法です。前者では、少ないビットで速く計算できる利点を十分には生かせない、としています。

大規模言語モデルでの例

2022年8月に出た論文「LLM.int8()」(Dettmers ほか)は、大規模言語モデルは推論に多くの GPU のメモリが要る、という問題から出発しています。

蒸留との比べ方

Gholami ほかの論文は、モデルを小さくするほかの方法とも比べています。量子化やモデルの一部を取り除く方法は、8ビット以下にして4分の1以上に縮めても成績を保てるのに対し、蒸留(→ 別ページ「小さいモデルと蒸留」)だけで強く縮めると、無視できない成績の落ち込みが出やすい、としています。そのうえで、蒸留と量子化などを組み合わせると大きな成果が出ている、と書いています。

関連する言葉

出典

  1. Google for Developers「Machine Learning Glossary」の quantization の項 developers.google.com ↗
  2. Amir Gholami ほか「A Survey of Quantization Methods for Efficient Neural Network Inference」arXiv、2021年3月25日 arxiv.org ↗
  3. Tim Dettmers ほか「LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale」arXiv、2022年8月15日 arxiv.org ↗

確認メモ:2026年10月1日に、上の3つの出典の原文を開いて確かめました。Google の用語集(2026年4月10日更新の版)は quantization の項を読みました。3つの使い方のうち1つ目は、用語集の別の項(quantile bucketing)を参照する書き方になっているため、その中身を一言で言い換えています。Gholami ほかの論文は PDF(第3版)の文字を取り出し、要旨・1章・2章・3章のうち学習し直すかどうかの節・4章のうち計算の仕方の節を読みました。「16分の1」「4分の1から8分の1」は要旨の数字で、論文が挙げる用途(画像の認識・言葉の処理など)での話です。LLM.int8() の論文は PDF(第2版)の文字を取り出し、要旨と1章を読みました。「成績を落とさずに」は論文自身の主張で、このページでは確かめていません。「ビット」「浮動小数点数」「GPU」の言い換えは、ふつうの意味を一言で添えたものです。量子化の式や、値の割り当て方の細かい種類(等間隔かどうか、対称かどうかなど)は、数式を使わない決まりと長さのため載せていません。AI事業者ガイドライン(第1.2版)・文部科学省のガイドライン・NIST AI 600-1 の文字も探しましたが、量子化の説明は見つからなかったため使っていません。AIログのニュースでは、この言葉はまだ出てきていないため、「ニュースでの出方」の節は置いていません。