AI Log

AIの基本 / 大規模言語モデルの仕組み

マルチモーダル:文章・画像・音声など、種類の違うデータを1つのモデルで扱う

出典を確かめた日 2026年10月1日(木) / 約6分で読めます

一言で

マルチモーダルは、文章・画像・音声・動画のように種類の違うデータを、1つの AI のモデルで扱うことです。データの種類のことを「モダリティ」と呼びます。

このページで分かること

先に知っておく言葉

モダリティとマルチモーダルなモデル

Google の機械学習の用語集は、次のように説明しています。

用語集の例のとおり、入力と出力の両方が複数の種類である必要はありません。どちらか一方が2種類以上なら、マルチモーダルなモデルに当たります。

中では何が起きているか

同じ用語集は、文章などをトークンに区切る仕組み(トークナイザー)の項で、いまの基盤モデルの多くはマルチモーダルだ、と書いています。そのうえで、入力の種類ごとに合う形に変える必要があり、たとえば文章と図が一緒に入ってきたときは、文章を単語の一部に、画像を小さな区画(パッチ)に区切ることがある、と説明しています。区切ったものは最後に1つの共通の埋め込みの空間にまとめられ、これによってモデルは種類の混ざった入力を「理解」できる、としています。

国の白書の説明

総務省の情報通信白書は、年によって違う角度からこの言葉を使っています。

Google の用語集はモデルの入力と出力のデータの種類で定義しています。令和6年版の白書は生成AI の出力の形式の多さと、さまざまなデータ形式への対応を、令和7年版の白書は複数の形式をまとめて処理することを挙げています。

注意点として挙がっているもの

関連する言葉

出典

  1. Google for Developers「Machine Learning Glossary」の modality・multimodal model・multimodal instruction-tuned・tokenizer の項 developers.google.com ↗
  2. 総務省「令和6年版 情報通信白書」第Ⅰ部第3章第1節「AI進展の経緯と生成AIのインパクト」2(1)「生成AIの急速な進化と普及」 soumu.go.jp ↗
  3. 総務省「令和7年版 情報通信白書」第Ⅰ部第1章第2節「AI の爆発的な進展の動向」 soumu.go.jp ↗
  4. 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編 2026年3月31日、第2部 C「共通の指針」2)安全性 ②適正利用 soumu.go.jp ↗
  5. NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月 doi.org ↗

確認メモ:2026年10月1日に、上の5つの出典の原文を開いて確かめました。Google の用語集は modality・multimodal model・multimodal instruction-tuned・tokenizer の4つの項を読みました。白書は、令和6年版の「生成AIの急速な進化と普及」のウェブのページと、令和7年版の第Ⅰ部第1章第2節の PDF の文字を読みました。白書の図(生成AI の概要・主なサービスの種類など)は画像のため使っていません。令和6年版の「国産LLMの開発」のページには、ある国産の大規模言語モデルでマルチモーダルの実装を順次進める見込み、という記述がありましたが、1社の製品の予定のため載せていません。AI事業者ガイドラインは第2部 C の安全性の項を、NIST の文書は2.8節「Information Integrity」の段落を読みました。「ユニモーダル」は用語集の unimodal をカタカナにしたもの、「ディープフェイク」の説明は NIST の文書の言い換えです。「モデル」「埋め込み」の言い換えは、ふつうの意味を一言で添えたものです。AIログのニュースでは、この言葉はまだ出てきていないため、「ニュースでの出方」の節は置いていません。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省「令和6年版 情報通信白書」「令和7年版 情報通信白書」、総務省・経済産業省「AI事業者ガイドライン(第1.2版)」を加工して作成)。