AI Log

AIの基本 / ニュースに出る言葉

画像や音声を作る AI(拡散モデル):雑音から少しずつ形にしていく仕組み

出典を確かめた日 2026年10月1日(木) / 約6分で読めます

一言で

拡散モデルは、でたらめな雑音(ノイズ)から出発し、雑音を取り除く手順を何度もくり返して、画像などを作り出す仕組みです。米国の NIST は、近ごろの生成AI のモデルの多くがこの種類だ、としています。

このページで分かること

先に知っておく言葉

仕組み:雑音を足す流れと、取り除く流れ

論文と公的機関の説明をまとめると、拡散モデルは次の2つの流れでできています。

段の数は、2020年の論文では実験のすべてで1000にしています。

出典ごとの説明

  1. 2015年の論文(Sohl-Dickstein ら):非平衡の統計物理学から発想を得た、としている。文部科学省の白書は、この論文を「拡散モデル」の発表として挙げている
  2. 2020年の論文(Ho ら、DDPM):著者らの知る限り、それまで拡散モデルで質の高い画像を作れることは示されていなかった、としたうえで、作れることを示した
  3. 文部科学省「令和6年版 科学技術・イノベーション白書」:敵対的生成ネットワーク(GAN)による精巧な画像の生成に加えて、2015年の拡散モデルや2020年のノイズ除去拡散確率モデルなどで精度の高い画像生成ができるようになり、言葉で条件(プロンプト)を与えて画像を作れるようになった、としている
  4. 総務省「令和6年版 情報通信白書」:2022年に、画像を自動で作る「Stable Diffusion」が、文章を作る ChatGPT などと並んで登場した、と書いている
  5. NIST AI 100-4:近ごろの生成AI のモデルの多くが拡散モデルだ、としている

計算の重さと、その工夫

2021年12月に出た論文(Rombach ら、2022年4月に改訂)は、画素のまま扱う拡散モデルは、高性能なものほど学習に数百 GPU 日を使うことが多く、作るときも順番に何度も計算するので重い、と指摘しています。この論文は、前もって学習した別のモデル(オートエンコーダ)で画像を縮めた表現の上で拡散モデルを動かす「潜在拡散モデル」を出しました。注意(アテンション)の仕組みの層を加えて、文章などを条件に画像を作れるようにした、とも書いています(→ 別ページ「Transformer と注意(アテンション)」)。

音声への広がり

AI が作った画像を見分けるために

NIST AI 100-4 は、AI が作った中身に目印(電子透かし)を入れる方法の1つとして、拡散モデルが出発点にする雑音に決まった模様を埋め込み、あとでモデルを持つ人が取り出す方法を挙げています。ただし、埋め込める量が少ないこと、見分けるのにモデル(場合によっては鍵)が要るため主にモデルを持つ側の手元(公開されていない場面)で使う方法であること、試されたのは画像だけであることを、限界として書いています(この方法は、理屈のうえでは動画にも使え、音声と文章にも使える可能性がある、としています)。

関連する言葉

出典

  1. Sohl-Dickstein ら「Deep Unsupervised Learning using Nonequilibrium Thermodynamics」arXiv、2015年 arxiv.org ↗
  2. Ho, Jain, Abbeel「Denoising Diffusion Probabilistic Models」arXiv、2020年 arxiv.org ↗
  3. Rombach ら「High-Resolution Image Synthesis with Latent Diffusion Models」arXiv、2021年(2022年改訂) arxiv.org ↗
  4. 文部科学省「令和6年版 科学技術・イノベーション白書」第1部第1章 mext.go.jp ↗
  5. 総務省「令和6年版 情報通信白書」第Ⅱ部第2章第7節「3 AI技術」 soumu.go.jp ↗
  6. NIST「NIST AI 100-4:Reducing Risks Posed by Synthetic Content」2024年11月 doi.org ↗
  7. 情報通信研究機構「ニューラル音声合成技術」情報通信研究機構研究報告 Vol.68 No.2、2022年 nict.go.jp ↗
  8. Google for Developers「Machine Learning Glossary」の generative AI の項 developers.google.com ↗

確認メモ:2026年10月1日に、上の出典を開いて確かめました。3本の論文は arXiv の要旨と本文(PDF から文字を取り出したもの)を読み、段の数(1000)は2020年の論文の実験の節で、「数百 GPU 日」は2021年の論文の序論で確かめました。NIST AI 100-4 は、電子透かしの方法を並べた表の「拡散モデルの最初の雑音」の行を読みました。文部科学省の白書は第1章第3節と脚注、総務省の白書は「AI技術」の節の脚注、NICT の研究報告は拡散確率モデルの節を読みました。Google の用語集には拡散モデルの項が無かったため、generative AI の項だけを使っています。Stable Diffusion と2021年の論文との関係は、確かめた出典に書かれていなかったため書いていません。動画を作る仕組みの詳しい説明も、確かめた出典に無かったため載せていません。「雑音(ノイズ)」「GPU」「電子透かし」の言い換えは、ふつうの意味を一言で添えたものです。AIログのニュースでは、2026年10月1日の ChatGPT のページの記事に「画像づくり」が出てきますが、拡散モデルという言葉や仕組みは書かれていないため、「ニュースでの出方」の節は置いていません。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:文部科学省「令和6年版 科学技術・イノベーション白書」、総務省「令和6年版 情報通信白書」を加工して作成)。拡散モデルが動画を作るのに使われていることは、確かめた出典には書かれていませんでした。題目は、はじめ台帳で「画像・動画を作る AI」としていましたが、本文を出典で確かめられた画像と音声に絞ったため、題目もそれに合わせました(動画の出典が見つかれば、題と本文を足します)。Google の用語集の生成AI の項にある、画像・動画・音声を作るモデルの例は、仕組みが拡散モデルかどうかが書かれていないため、このページには載せていません。