一言で
拡散モデルは、でたらめな雑音(ノイズ)から出発し、雑音を取り除く手順を何度もくり返して、画像などを作り出す仕組みです。米国の NIST は、近ごろの生成AI のモデルの多くがこの種類だ、としています。
このページで分かること
- 拡散モデルが「雑音を足す流れ」と「雑音を取り除く流れ」でできていること
- どの論文から始まり、画像を作る AI に広がったか(2015年・2020年・2021年の論文)
- 計算の重さの課題と、音声などほかのデータへの広がり
先に知っておく言葉
- 生成AI:文章や画像などを作り出す AI(→ 別ページ「生成AI とは」)
- プロンプト:AI に渡す指示の文(→ 別ページ「プロンプトとシステムプロンプト」)
- GPU:大量の計算を速くこなす部品(→ 別ページ「GPU と計算資源・データセンター」)
仕組み:雑音を足す流れと、取り除く流れ
論文と公的機関の説明をまとめると、拡散モデルは次の2つの流れでできています。
- 足す流れ(拡散過程):本物のデータに、少しずつ雑音を加えていく。段を重ねると、元の形は失われて雑音だけになる。2015年の論文はこれを、データの分布が持つ構造をゆっくり壊していく流れとして説明し、2020年の論文は、信号が消えるまで雑音を足していく流れとしている
- 取り除く流れ(逆の過程):足す流れを逆にたどり、雑音を1段ずつ減らしていく手順を、モデルに学習させる
- 作るとき:雑音から始めて、学習した手順を何度も当てはめる。NIST の文書(AI 100-4、2024年11月)は、ランダムな雑音でできた出力から始めて、くり返し手を加え、プロンプトに合う出力にしていく、と説明している
段の数は、2020年の論文では実験のすべてで1000にしています。
出典ごとの説明
- 2015年の論文(Sohl-Dickstein ら):非平衡の統計物理学から発想を得た、としている。文部科学省の白書は、この論文を「拡散モデル」の発表として挙げている
- 2020年の論文(Ho ら、DDPM):著者らの知る限り、それまで拡散モデルで質の高い画像を作れることは示されていなかった、としたうえで、作れることを示した
- 文部科学省「令和6年版 科学技術・イノベーション白書」:敵対的生成ネットワーク(GAN)による精巧な画像の生成に加えて、2015年の拡散モデルや2020年のノイズ除去拡散確率モデルなどで精度の高い画像生成ができるようになり、言葉で条件(プロンプト)を与えて画像を作れるようになった、としている
- 総務省「令和6年版 情報通信白書」:2022年に、画像を自動で作る「Stable Diffusion」が、文章を作る ChatGPT などと並んで登場した、と書いている
- NIST AI 100-4:近ごろの生成AI のモデルの多くが拡散モデルだ、としている
計算の重さと、その工夫
2021年12月に出た論文(Rombach ら、2022年4月に改訂)は、画素のまま扱う拡散モデルは、高性能なものほど学習に数百 GPU 日を使うことが多く、作るときも順番に何度も計算するので重い、と指摘しています。この論文は、前もって学習した別のモデル(オートエンコーダ)で画像を縮めた表現の上で拡散モデルを動かす「潜在拡散モデル」を出しました。注意(アテンション)の仕組みの層を加えて、文章などを条件に画像を作れるようにした、とも書いています(→ 別ページ「Transformer と注意(アテンション)」)。
音声への広がり
- NICT(情報通信研究機構)の研究報告(2022年):拡散モデルは画像生成で提案されたが、まもなく音声の波形を作るモデル(WaveGrad・DiffWave)が出た、としている。段の数を1,000などと大きくすると原音に並ぶ音質になる一方で、作る時間が実時間からほど遠いため、10以下などの少ない段でも音質を保てるようにするのが課題、と書いている(→ 別ページ「音声認識と音声合成」)
AI が作った画像を見分けるために
NIST AI 100-4 は、AI が作った中身に目印(電子透かし)を入れる方法の1つとして、拡散モデルが出発点にする雑音に決まった模様を埋め込み、あとでモデルを持つ人が取り出す方法を挙げています。ただし、埋め込める量が少ないこと、見分けるのにモデル(場合によっては鍵)が要るため主にモデルを持つ側の手元(公開されていない場面)で使う方法であること、試されたのは画像だけであることを、限界として書いています(この方法は、理屈のうえでは動画にも使え、音声と文章にも使える可能性がある、としています)。
関連する言葉
- 生成AI・マルチモーダル・GPU と計算資源・音声認識と音声合成・著作権と学習データ(→ この欄の別ページ)
出典
- Sohl-Dickstein ら「Deep Unsupervised Learning using Nonequilibrium Thermodynamics」arXiv、2015年 arxiv.org ↗
- Ho, Jain, Abbeel「Denoising Diffusion Probabilistic Models」arXiv、2020年 arxiv.org ↗
- Rombach ら「High-Resolution Image Synthesis with Latent Diffusion Models」arXiv、2021年(2022年改訂) arxiv.org ↗
- 文部科学省「令和6年版 科学技術・イノベーション白書」第1部第1章 mext.go.jp ↗
- 総務省「令和6年版 情報通信白書」第Ⅱ部第2章第7節「3 AI技術」 soumu.go.jp ↗
- NIST「NIST AI 100-4:Reducing Risks Posed by Synthetic Content」2024年11月 doi.org ↗
- 情報通信研究機構「ニューラル音声合成技術」情報通信研究機構研究報告 Vol.68 No.2、2022年 nict.go.jp ↗
- Google for Developers「Machine Learning Glossary」の generative AI の項 developers.google.com ↗
確認メモ:2026年10月1日に、上の出典を開いて確かめました。3本の論文は arXiv の要旨と本文(PDF から文字を取り出したもの)を読み、段の数(1000)は2020年の論文の実験の節で、「数百 GPU 日」は2021年の論文の序論で確かめました。NIST AI 100-4 は、電子透かしの方法を並べた表の「拡散モデルの最初の雑音」の行を読みました。文部科学省の白書は第1章第3節と脚注、総務省の白書は「AI技術」の節の脚注、NICT の研究報告は拡散確率モデルの節を読みました。Google の用語集には拡散モデルの項が無かったため、generative AI の項だけを使っています。Stable Diffusion と2021年の論文との関係は、確かめた出典に書かれていなかったため書いていません。動画を作る仕組みの詳しい説明も、確かめた出典に無かったため載せていません。「雑音(ノイズ)」「GPU」「電子透かし」の言い換えは、ふつうの意味を一言で添えたものです。AIログのニュースでは、2026年10月1日の ChatGPT のページの記事に「画像づくり」が出てきますが、拡散モデルという言葉や仕組みは書かれていないため、「ニュースでの出方」の節は置いていません。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:文部科学省「令和6年版 科学技術・イノベーション白書」、総務省「令和6年版 情報通信白書」を加工して作成)。拡散モデルが動画を作るのに使われていることは、確かめた出典には書かれていませんでした。題目は、はじめ台帳で「画像・動画を作る AI」としていましたが、本文を出典で確かめられた画像と音声に絞ったため、題目もそれに合わせました(動画の出典が見つかれば、題と本文を足します)。Google の用語集の生成AI の項にある、画像・動画・音声を作るモデルの例は、仕組みが拡散モデルかどうかが書かれていないため、このページには載せていません。