一言で
マルチモーダルは、文章・画像・音声・動画のように種類の違うデータを、1つの AI のモデルで扱うことです。データの種類のことを「モダリティ」と呼びます。
このページで分かること
- 「モダリティ」と「マルチモーダルなモデル」が何を指すか(Google の用語集の説明)
- 国の白書がマルチモーダルをどう説明しているか
- 公的な文書が挙げている、マルチモーダルな生成AI の注意点
先に知っておく言葉
- モデル:入力を受け取って予測などを出す仕組み
- 生成AI:文章や画像などを作り出す AI(→ 別ページ「生成AIとは」)
- 基盤モデル:大量のデータで学習し、いろいろな作業に使えるモデル(→ 別ページ「基盤モデルとは」)
- 大規模言語モデル:大量の文章で学習した、文章を読み書きするモデル(→ 別ページ「大規模言語モデル(LLM)とは」)
- トークン:AI がデータを区切って扱う単位(→ 別ページ「トークン」)
- 埋め込み:データを数の並びで表したもの(→ 別ページ「埋め込み(ベクトル)」)
モダリティとマルチモーダルなモデル
Google の機械学習の用語集は、次のように説明しています。
- モダリティ:データのおおまかな種類。例として、数・文章・画像・動画・音声の5つを、それぞれ別のモダリティとして挙げている
- マルチモーダルなモデル:入力か出力、またはその両方に、2つ以上のモダリティが入っているモデル。用語集の例は、画像とその説明の文を受け取り、説明が画像にどれだけ合っているかを点数で返すモデルで、この場合、入力はマルチモーダル、出力は1種類(ユニモーダル)になる
- MMIT(multimodal instruction-tuned):指示に従うよう調整したモデルのうち、文章のほかに画像・動画・音声などの入力も扱えるもの
用語集の例のとおり、入力と出力の両方が複数の種類である必要はありません。どちらか一方が2種類以上なら、マルチモーダルなモデルに当たります。
中では何が起きているか
同じ用語集は、文章などをトークンに区切る仕組み(トークナイザー)の項で、いまの基盤モデルの多くはマルチモーダルだ、と書いています。そのうえで、入力の種類ごとに合う形に変える必要があり、たとえば文章と図が一緒に入ってきたときは、文章を単語の一部に、画像を小さな区画(パッチ)に区切ることがある、と説明しています。区切ったものは最後に1つの共通の埋め込みの空間にまとめられ、これによってモデルは種類の混ざった入力を「理解」できる、としています。
国の白書の説明
総務省の情報通信白書は、年によって違う角度からこの言葉を使っています。
- 令和6年版:生成AI は、使う人の側の調整や技能が無くても、ふだんの言葉で指示するだけで使え、文章・画像・映像といった、いろいろな形式(マルチモーダル)の出力が得られるもの、としている。また、生成AI が広まった技術の理由の1つに、高い汎用性とマルチモーダルの機能を挙げている。これにより AI が1つの作業に限られず、さまざまなデータの形式や入力に対応し、多くの作業を同時にこなせるようになった、と説明している
- 令和7年版:AI エージェントの節で、文章・画像・音声・動画などのいくつものデータの形式をまとめて扱える「マルチモーダル AI」を、論理的な思考ができる推論モデルなどと並べて、大規模言語モデルの進化の例として挙げている
Google の用語集はモデルの入力と出力のデータの種類で定義しています。令和6年版の白書は生成AI の出力の形式の多さと、さまざまなデータ形式への対応を、令和7年版の白書は複数の形式をまとめて処理することを挙げています。
注意点として挙がっているもの
- AI事業者ガイドライン(第1.2版、総務省・経済産業省):第2部「共通の指針」の安全性の「適正利用」の項で、マルチモーダルな生成AI が中心のシステムは、比較的たやすく精巧な生成物を作れる、としている。その精巧さが誤解や偏見を助長しうることや、他人の知的財産権を侵害しうることに注意し、使うときに人の判断を挟むなどの対策を取る、としている
- NIST AI 600-1(米国の国立標準技術研究所、2024年7月):情報の信頼性のリスク(2.8節)の中で、いまの、また登場しつつあるマルチモーダルなモデルにより、文章による偽情報と、本物そっくりの「ディープフェイク」(作られた音声・映像や写真のような画像)の両方が作れるようになる、としている。新しい種類のデータで学習した今後のモデルが、さらに別の偽情報の脅威を生みうる、とも書いている
関連する言葉
- 生成AI・基盤モデル・大規模言語モデル・トークン・埋め込み(ベクトル)・画像や音声を作る AI(拡散モデル)・音声認識と音声合成(→ この欄の別ページ)
出典
- Google for Developers「Machine Learning Glossary」の modality・multimodal model・multimodal instruction-tuned・tokenizer の項 developers.google.com ↗
- 総務省「令和6年版 情報通信白書」第Ⅰ部第3章第1節「AI進展の経緯と生成AIのインパクト」2(1)「生成AIの急速な進化と普及」 soumu.go.jp ↗
- 総務省「令和7年版 情報通信白書」第Ⅰ部第1章第2節「AI の爆発的な進展の動向」 soumu.go.jp ↗
- 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編 2026年3月31日、第2部 C「共通の指針」2)安全性 ②適正利用 soumu.go.jp ↗
- NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月 doi.org ↗
確認メモ:2026年10月1日に、上の5つの出典の原文を開いて確かめました。Google の用語集は modality・multimodal model・multimodal instruction-tuned・tokenizer の4つの項を読みました。白書は、令和6年版の「生成AIの急速な進化と普及」のウェブのページと、令和7年版の第Ⅰ部第1章第2節の PDF の文字を読みました。白書の図(生成AI の概要・主なサービスの種類など)は画像のため使っていません。令和6年版の「国産LLMの開発」のページには、ある国産の大規模言語モデルでマルチモーダルの実装を順次進める見込み、という記述がありましたが、1社の製品の予定のため載せていません。AI事業者ガイドラインは第2部 C の安全性の項を、NIST の文書は2.8節「Information Integrity」の段落を読みました。「ユニモーダル」は用語集の unimodal をカタカナにしたもの、「ディープフェイク」の説明は NIST の文書の言い換えです。「モデル」「埋め込み」の言い換えは、ふつうの意味を一言で添えたものです。AIログのニュースでは、この言葉はまだ出てきていないため、「ニュースでの出方」の節は置いていません。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省「令和6年版 情報通信白書」「令和7年版 情報通信白書」、総務省・経済産業省「AI事業者ガイドライン(第1.2版)」を加工して作成)。