一言で
音声認識は、人が話した声を文字(テキスト)に変える技術です。音声合成は、その逆に、文字を声にして読み上げる技術です。どちらも、ディープラーニングが入ってから大きく性能が上がった、と公的機関の文書は書いています。
このページで分かること
- 音声認識と音声合成が、それぞれ何をするか・どこで使われているか
- 音声認識の仕組みの移り変わり(統計的→ハイブリッド型→End-to-End)
- 音声合成の仕組みと、速さ・悪用への課題
先に知っておく言葉
- ディープラーニング(深層学習):層を深く重ねたニューラルネットワークで学習する方法(→ 別ページ「ディープラーニング(深層学習)とは」)
- ニューラルネットワーク:データから学習する計算の仕組み(→ 別ページ「ニューラルネットワークとは」)
- 音素:言葉の音を区別するときの、いちばん小さな単位
- 拡散モデル:雑音を少しずつ取り除いて画像などを作る仕組み(→ 別ページ「画像や音声を作る AI(拡散モデル)」)
- 生成AI:文章や画像などを作り出す AI(→ 別ページ「生成AI とは」)
音声認識:声を文字にする
情報通信研究機構(NICT。日本の国の研究機関)の研究報告(2022年)は、音声認識を、入ってきた音声を文字に変える技術と説明し、スマートフォンでの音声検索や音声翻訳、スマートスピーカーの声での操作、映像への自動の字幕などで使われている、としています。総務省・経済産業省の AI事業者ガイドライン(第1.2版、2026年3月31日)も、2000年代以降にディープラーニングなどで活用が進んだものの1つに音声認識を挙げています。
同じ研究報告によると、仕組みは次のように移ってきました。
- はじめ:単純なパターンの照らし合わせ
- 1990年代〜2000年代前半(統計的音声認識):機械学習の発展とともに現れ、さまざまな方法が出された。音声を10ミリ秒ほどの短い区切りごとに分析して特徴を取り出し、「音響モデル(特徴→音素の並び)」「発音辞書(音素→単語)」「言語モデル(単語→文)」を組み合わせて、いちばんありそうな単語の並びを探す
- 深層学習の登場のあと(ハイブリッド型):2000年代後半ごろに深層学習が現れて性能が大きく上がり、2010年代に実用が広がった。いっぺんに置き換わったのではなく、主に音響モデルと言語モデルが、少しずつ深層学習のものに換えられた
- End-to-End(E2E)音声認識:声から文字までを1つのニューラルネットワークで扱う。学習に使えるのが基本的に音声とその書き起こしだけで量が限られるため、特定の分野に合わせるのが難しく、別に用意した言語モデルを組み合わせる方法が使われる
この報告の時点(2022年)で、NICT が実際に動かしている仕組みはハイブリッド型で、NICT の E2E は基礎研究の段階(一部の言語では試作して動作を確認)でした。E2E では新しい単語の登録などの機能を組み込むのが容易でない、と書かれています。
音声合成:文字を声にする
NICT の研究報告(2022年)とプレスリリース(2024年6月25日)は、「テキスト音声合成」(文字の読み上げ)をこう説明しています。
- 使われる場面:自動の音声案内、駅などのアナウンス、スマートスピーカー、カーナビ、対話ロボットなど
- 2段階の変換:文章を音素(とアクセント)の並びにし、「音響モデル」で音を短く区切ったときの特徴(中間の特徴量)に変え、「波形生成モデル」で音声の波形にする。音響モデルが出す特徴量を通さず、1つのネットワークで文字から波形を作る End-to-end の方式もある
- 難しさの例:英語の「hello」は5文字だが、長さ1.0秒・サンプリング周波数24kHz・フレームシフト12.5msの場合、80フレーム・24,000サンプルになる
- 移り変わり:2012年ごろまでの主流は、隠れマルコフモデルを使う統計的な方式で、聞き取れても自然さに欠ける「ロボットのような声」だった。2013年に Google がニューラルネットワークを音声合成に入れ、2016年9月の WaveNet(Google DeepMind)と翌年の Tacotron 2 で、自然な声と同じ程度の品質に届いた
- 拡散モデルも使われる:画像生成で提案された拡散モデルを、音声の波形づくりに使うモデル(WaveGrad・DiffWave)も出ている
- 速さ:2024年の発表では、21言語の音声合成で、CPU のコア1つで1秒ぶんの音声を0.1秒で作れる(既存のモデルの約8倍の速さ)。波形を作る部分を少しずつ順に作る方式にすることで、ネットにつながっていない中くらいの性能のスマートフォンでも、文字を入れてから0.5秒で作れる、としている
- Google の機械学習の用語集:生成AI の例に、本物らしい話し声や音楽を作れる音声・音楽のモデルを挙げている
2つを組み合わせる:音声翻訳
NICT は、音声認識・機械翻訳・音声合成を組み合わせて、多言語の音声翻訳を作っています(アプリ VoiceTra など)。総務省の「令和2年版 情報通信白書」は、2014年の「グローバルコミュニケーション計画」のもとで、ディープラーニングの翻訳を NICT に入れるための計算機などを整え、翻訳や音声認識の精度を上げてきたこと、2025年に AI で同時通訳ができるようにすることを目指す計画を2020年3月に作ったことを書いています。
悪用の心配
- NICT の研究報告:品質がここまで上がると悪用の試みも考えられるため、本物の声と合成した声を見分ける技術の開発が重要な課題、としている
- NIST(米国の国立標準技術研究所)の AI 600-1(2024年7月):複数の種類のデータを扱うモデルで、本物そっくりの「ディープフェイク」(合成した音声・映像や写真のような画像)が作れるようになった、としている。また、人の声などを許可なくまねて使うことについて議論が行われている、と書いている
関連する言葉
- ディープラーニング・生成AI・マルチモーダル・画像や音声を作る AI(拡散モデル)(→ この欄の別ページ)
出典
- 情報通信研究機構「音声認識技術」情報通信研究機構研究報告 Vol.68 No.2、2022年 nict.go.jp ↗
- 情報通信研究機構「ニューラル音声合成技術」情報通信研究機構研究報告 Vol.68 No.2、2022年 nict.go.jp ↗
- 情報通信研究機構「スマホ上でも高速動作可能な21言語の高品質ニューラル音声合成技術を開発」2024年6月25日 nict.go.jp ↗
- 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」2026年3月31日、第1部「AIとは」 soumu.go.jp ↗
- 総務省「令和2年版 情報通信白書」「多言語翻訳技術の研究開発及び社会実装の推進」 soumu.go.jp ↗
- NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月 doi.org ↗
- Google for Developers「Machine Learning Glossary」の generative AI の項 developers.google.com ↗
確認メモ:2026年10月1日に、上の出典を開いて確かめました。NICT の2本の研究報告は PDF から文字を取り出し、音声認識は「まえがき」「統計的音声認識」「ハイブリッド型音声認識」「End-to-End 音声認識」と NICT の取組の節を、音声合成は「はじめに」、波形生成の難しさ、拡散確率モデル、「おわりに」の節を読みました。2024年の速さの数字は NICT のプレスリリースのとおりです。AI事業者ガイドラインは第1.2版の第1部「AIとは」を、NIST AI 600-1 は情報の完全性と知的財産の節を読みました。出典の間で説明が食い違う所はありませんでした。NICT の研究報告の「NICT での E2E は基礎研究の段階」は2022年の時点の記述で、その後の変化は確かめていません。会社ごとの音声の製品(話し声で使えるチャットなど)は、確かめた出典で仕組みが説明されていなかったため載せていません。「音素」の言い換えは NICT の研究報告の説明にもとづき、「ディープフェイク」の言い換えは NIST の説明にもとづいています。AIログのニュースでは、この言葉はまだ出てきていないため、「ニュースでの出方」の節は置いていません。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省・経済産業省「AI事業者ガイドライン(第1.2版)」、総務省「令和2年版 情報通信白書」を加工して作成)。