一言で
Transformer(トランスフォーマー)は、2017年に Google の研究者たちが論文で発表したニューラルネットワークの作りです。注意(アテンション)という仕組みで、文の中のトークンどうしがどれだけ関わり合うかを重みとして計算します。Google の教材は、大規模言語モデルを作るのに最も広く使われている作りとしています。
このページで分かること
- Transformer がどの論文で出てきて、それまでの作りと何が違ったか
- 注意・自己注意が何をしているか(出典ごとの説明)
- エンコーダー・デコーダーという部品と、計算の量の話
先に知っておく言葉
- ニューラルネットワーク:機械学習で使うモデルの形の1つ(→ 別ページ「ニューラルネットワークとは」)
- トークン:AI が文章を区切って扱う単位(→ 別ページ「トークン」)
- 再帰型ニューラルネットワーク(RNN):並びをトークン1つずつ順に処理していくニューラルネットワーク
- 畳み込み型ニューラルネットワーク(CNN):ニューラルネットワークの作りの種類の1つ。論文によると、Transformer の前は再帰型とともに翻訳などの主なモデルに使われていた
- 大規模言語モデル:大量の文章で学習した、文章を読み書きするモデル(→ 別ページ「大規模言語モデル(LLM)とは」)
出どころの論文(2017年)
Transformer は、論文「Attention Is All You Need」(Vaswani ほか7人。所属は Google Brain・Google Research など)で提案されました。arXiv(論文の公開サイト)に最初に出たのは2017年6月12日で、同じ年の国際会議 NIPS 2017 の論文です。
論文によると、当時の翻訳などに使われていた主なモデルは、再帰型や畳み込み型のニューラルネットワークに、エンコーダーとデコーダーを組み合わせたものでした。再帰型は文の位置の順に計算を進めるため、1つの学習例の中では計算を並べて同時に進められず、文が長いほど困る、と論文は指摘しています。
これに対して Transformer は、再帰も畳み込みも使わず、注意の仕組みだけで入力と出力の関わりをとらえる作りにしました。論文の実験(WMT 2014 の英語からドイツ語、英語からフランス語への翻訳)では、それまでの最高の成績を上回りつつ、並べて計算しやすく、学習にかかる時間もずっと短かった、としています。
注意(アテンション)とは
出典によって、説明の切り口が違います。
- 論文:問い合わせ(query)と、キー(key)と値(value)の組を受け取り、値に重みを付けて足し合わせたものを出す働きとして説明している。それぞれの値の重みは、問い合わせとキーがどれだけ合うかで決まる
- Google の機械学習の用語集:ニューラルネットワークの中で、ある単語や単語の一部の大事さを示す仕組み。次のトークンや単語を予測するのに要る情報の量を、ぎゅっと絞る働きがある、としている。よくある形は入力の重み付きの合計で、その重みはネットワークの別の部分が計算する
- Google の機械学習の教材(Machine Learning Crash Course):自己注意について、入力のトークン1つ1つに、ほかの入力のトークンがそのトークンの読み取りにどれだけ効いているかを問うもの、と言い表している
自己注意(セルフアテンション)
自己注意は、1つの並びの中で、別々の位置どうしを関係づけてその並びの表し方を計算する注意です(論文)。Google の教材は、「自己」は入力の並びのことで、翻訳の出力のような別の並びとの関わりではなく、入力の中のトークンどうしの関わりだけをはかる、と説明しています。
Google の教材と用語集は、「その動物は通りを渡らなかった。it がとても疲れていたからだ」という意味の英語の文を例にしています。代名詞の it が animal(動物)と street(通り)のどちらを指すかについて、自己注意は animal のほうを it に深く関わる言葉として重みを付けます。最後の「疲れていた」を「幅が広すぎた」に変えた文では、street のほうが関わりが深いと見ることが期待される、と教材は書いています。
Google の教材によると、自己注意の層はふつう何組かの注意を並べて作られます。論文は8組(ヘッドと呼ぶ)を同時に動かし、それぞれが違う見方で情報を拾えるようにしました。Google の教材は、ヘッドごとに、代名詞が指す名詞を探すもの、文法上の関わりを学ぶものなど、違う関係を学びうるとしています。さらに自己注意の層を何段も重ね、前の段の出力を次の段の入力にします。教材は、前のほうの段は基本的な文法に、深い段はより込み入った意味に目を向けることがある、としています。論文も、ヘッドごとにはっきり違う仕事を学んでおり、その多くは文の文法や意味の作りに関わる振る舞いを示しているように見える、と書いています。
エンコーダーとデコーダー
- 論文:エンコーダーは入力の並びを、別の数の並びに変える。デコーダーはそれをもとに、出力を1つずつ作り、作るたびにそれまでに作ったものを次の入力に加える。デコーダーの自己注意は、まだ作っていない先の位置を見ないようにしている
- Google の教材:両方を持つものを完全な Transformer と呼び、翻訳で言えば、エンコーダーが英語の文を途中の表し方に変え、デコーダーがそれをフランス語の文にする。エンコーダーだけ・デコーダーだけの作りもあり、デコーダーだけのものは並びを作るのが得意なことが多い、としている
- Google の用語集:Transformer はエンコーダー・デコーダー・その両方のどれかを含みうる、自己注意の層を積み重ねたものと見ることもできる、としている
計算の量
論文は、自己注意の層の計算量が、文の長さの2乗に比例して増えると比べています。そのうえで、文の長さが、1つのトークンを表す数の並びの長さより短いとき(当時の翻訳のモデルでは多くがそうだった)は、再帰型の層より速い、としています。Google の教材も、文脈の中のすべての単語が、ほかのすべての単語との関わりを学ぶため、トークンの数の2乗に、層の数とヘッドの数を掛けた量になる、と説明しています。
国の文書での位置づけ
総務省の情報通信白書(令和6年版)は、生成AI のブームの背景の1つとして、ディープラーニング(→ 別ページ「ディープラーニング(深層学習)とは」)と、トランスフォーマーモデルが開発され大きくなったことで、自然言語処理(人の言葉をコンピューターで扱うこと)や画像生成などでモデルの精度が大きく上がったことを挙げています。
関連する言葉
- 大規模言語モデル・トークン・埋め込み・パラメータとモデルの大きさ・ニューラルネットワーク(→ この欄の別ページ)
出典
- Ashish Vaswani ほか「Attention Is All You Need」arXiv:1706.03762、2017年6月12日(NIPS 2017) arxiv.org ↗
- Google for Developers「Machine Learning Glossary」の Transformer・attention・self-attention・multi-head self-attention・encoder・decoder の項 developers.google.com ↗
- Google for Developers「Machine Learning Crash Course」の「LLMs: What's a large language model?」 developers.google.com ↗
- 総務省「令和6年版 情報通信白書」第Ⅰ部第3章第1節「AI進展の経緯と生成AIのインパクト」の「生成AIの急速な進化と普及」 soumu.go.jp ↗
確認メモ:2026年10月1日に、上の出典を開いて確かめました。論文は arXiv の PDF(第7版、2023年8月2日)から文字を取り出し、要旨・はじめに・第2〜4節・結論を読み、最初に出た日は arXiv のページで確かめました。Google の用語集は Transformer・attention・self-attention・multi-head self-attention・encoder・decoder の項を、Google の教材は Transformer と自己注意の説明(開いて読む補足の部分を含む)を読みました。情報通信白書は、生成AI のブームの背景を書いた段落を読みました。出典ごとの違いは、注意の説明の切り口(論文は問い合わせ・キー・値の計算、Google の用語集は大事さの度合いと情報の絞り込み、Google の教材はトークンどうしの影響の問い)と、作りの説明(論文はエンコーダーとデコーダーの両方、Google の教材と用語集は片方だけの作りもあるとする)です。論文の数式、層の数や次元の細かい数字、翻訳の成績の点数(BLEU)と学習に使った GPU の数・日数、英語の文の構造の解析への応用、とても長い並びのために注意を近くの範囲に限る案は、長さの都合で載せていません。用語集にある「Google で開発された」という説明は、論文の著者の所属と合わせて一言目に使いました。「再帰型ニューラルネットワーク」「自然言語処理」の言い換えは、ふつうの意味を一言で添えたものです。AIログの記事の無料部分には、この言葉はまだ出てきていないため、「ニュースでの出方」の節は置いていません。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省「令和6年版 情報通信白書」を加工して作成)。