一言で
AI の返事の速さは、指示を送ってから返事が来るまでの時間(レイテンシ)や、最初のトークンが出てくるまでの時間(TTFT)、1秒あたりに処理するトークンの数などで表されます。どれを測っているかで、同じ「速い」でも意味が変わります。
このページで分かること
- レイテンシ・TTFT・1秒あたりのトークンが、それぞれ何を測っているか
- 速さが何で変わるのか(各社の公式の説明)
- 速さを上げる有料の段(Fast mode・Ultrafast)が、どの速さを上げるものか
先に知っておく言葉
- モデル:入力から予測などを出す仕組み。ここでは、文章を読み書きする AI の本体
- トークン:AI が文章を区切って数える単位(→ 別ページ「トークン」)
- プロンプト:AI に渡す入力(→ 別ページ「プロンプトとシステムプロンプト」)
- ストリーミング:返事を全部作り終える前から、できた分を少しずつ送り返すやり方
- API:AI のモデルをプログラムから使う窓口(→ 別ページ「API と料金の数え方」)
速さを表す言葉
- レイテンシ(latency):Anthropic(Claude の会社)の用語集は、プロンプトを送ってから、作られた返事を受け取るまでの遅れ、としている。小さいほど返事が速く、チャットのような、その場でやり取りする使い方で大事になる、と書いている
- 基準のレイテンシ(baseline latency):Anthropic のレイテンシを減らす手引きは、入力と出力の1秒あたりのトークンの数は考えに入れず、モデルがプロンプトを処理して返事を作るまでにかかる時間、と説明し、モデルの速さのおおよその目安としている
- TTFT(Time to first token):同じく Anthropic は、プロンプトを受けてから、返事の最初のトークンを作るまでの時間としている。どれだけ早く反応し始めるかの指標で、ストリーミングで使うときに特に関わる、と書いている
- 1秒(1分)あたりのトークン:OpenAI(ChatGPT の会社)のレイテンシの手引きは、モデルがトークンを処理する速さを「推論の速さ」と呼び、多くの場合、1分あたりのトークン(TPM)か1秒あたりのトークン(TPS)で測る、としている。Anthropic の Fast mode の説明は、出力の1秒あたりのトークン(OTPS)と TTFT を分けて書いている
速さが何で変わるか
- Anthropic の用語集:レイテンシに関わるものとして、モデルの大きさ、機械(ハードウェア)の力、ネットワークの状態、プロンプトと返事の複雑さを挙げている。TTFT についても、モデルの大きさ・機械の力・ネットワーク・プロンプトの複雑さを挙げている
- Anthropic の手引き:モデルが処理して作るトークンが少ないほど返事は速くなる、としている。速さが大事な用途に向くモデルとして、Claude Haiku 4.5 を挙げている
- OpenAI の手引き:推論の速さに一番関わるのはモデルの大きさで、小さいモデルはふつう速く動く(安くもある)、としている。また、言語モデルを使うときは、トークンを作り出す段階がほぼいつも一番時間のかかる所で、おおまかな目安として出力のトークンを半分にすると時間もおよそ半分になりうる一方、入力を半分にしても1〜5%しか縮まらないことがある、と書いている(とても長い資料や画像を入れる場合は別、としている)
待つ時間を短くする工夫(ストリーミング)
両社とも、ストリーミングを挙げています。Anthropic は、使う人が感じる反応の速さが大きく良くなりうる、としています。OpenAI は、待つ時間を1秒以下にできる一番効く方法としたうえで、使う人が読み終えるのが早くなるので、アプリと人を合わせて見れば全体の時間も本当に縮む、と説明しています。
速さを上げる有料の段
- Anthropic の Fast mode:同じモデルを、より速い推論の設定で動かすもので、賢さや能力は変わらない、としている。出力の1秒あたりのトークンが通常の最大2.5倍になり、速くなるのは主に出力の速さで、TTFT ではない、と書き分けている。対象は Claude Opus 5.5・Claude Opus 5・Claude Opus 4.8 で、試験提供(research preview)として、通常より高い値段が付く
- OpenAI の Ultrafast:OpenAI の API で一番速い段で、GPT-6 Astra で広く使え、GPT-5.6 Sol は先行の提供としている。速さが高い値段に見合うときに使うもの、と書いている。接続をつないだままにする方式(WebSocket)を強くすすめ、道具を続けて何度も呼ぶ使い方では特に、としている。つなぎ直しの手間で、速くなった分が目減りしうるため、としている
国の文書での扱い
デジタル庁の、政府で生成AI を調達して使うときのガイドライン(DS-920、2026年6月12日)は、生成AI の仕組みを企画する担当が、使い始める前の準備として、実際に使う仕組みの目的や使い方を、モデル上の制約なども含めて使う人に知らせることを挙げています。その例の1つに、プロンプトのトークンの上限などと並んで「応答速度」が入っています。
ニュースでの出方
- 書き出しの速さ:Anthropic の Sonnet 5.5 は、書き出しが3割以上速い、と Anthropic が説明していました
- Anthropic の新しい中位モデル「Sonnet 5.5」。値段は据え置きで、速く・少ない手数に
- 1秒あたりのトークン:OpenAI は、GPT-6 Astra の Ultrafast を、Codex で最大8倍(1秒あたり300トークン)の速さと説明していました。記事によると、速さの倍率は、まとめ記事と API の説明ページで書き方が分かれていました
- ChatGPT に月500ドルの「Pro 500」。速さを上げる「Ultrafast」は、使える量を8倍の速さで減らす
- 速さの段:GPT-6.1 Sol の Ultrafast は、発表記事では「数日のうちに Codex で、標準の最大8倍の速さ」、使い方ページでは「Sol は後日」と書かれていました
- OpenAI「GPT-6.1 Sol」。上位の Astra に近い力を、5分の1の料金で
関連する言葉
- トークン・プロンプトとシステムプロンプト・API と料金の数え方・小さいモデルと蒸留(→ この欄の別ページ)
出典
- デジタル庁「DS-920 行政の進化と革新のための生成AIの調達・利活用に係るガイドライン」6.3.3 2026年6月12日 digital.go.jp ↗
- Anthropic「Glossary」の Latency・TTFT の項 platform.claude.com ↗
- Anthropic「Reducing latency」 platform.claude.com ↗
- Anthropic「Fast mode (research preview)」 platform.claude.com ↗
- OpenAI「Latency optimization」 developers.openai.com ↗
- OpenAI「Ultrafast mode」 developers.openai.com ↗
確認メモ:2026年10月1日に、上の出典を開いて確かめました。デジタル庁のガイドラインは PDF から文字を取り出し、6.3.3 の、使う人に知らせる内容の例の部分を読みました。Anthropic は、用語集の Latency と TTFT の項、レイテンシを減らす手引き、Fast mode の説明を読みました。OpenAI は、レイテンシの手引きの前半(7つの考え方)と、Ultrafast の説明を読みました。出典ごとに測り方の言葉が違い、Anthropic の用語集は返事を受け取るまでの遅れと TTFT、手引きは基準のレイテンシと TTFT、OpenAI の手引きは1分・1秒あたりのトークンで説明しているため、それぞれ出典の名前を付けて並べました。速さの具体的な数字(どのモデルが1秒に何トークンか)は、各社の公式の説明に共通した一覧が無いため、ニュースの記事に出た数字だけを挙げています。OpenAI の手引きにある、速さを上げるほかの方法(指示をまとめる・並べて動かす・言語モデルを使わない方法を選ぶ等)は、この言葉の説明から外れるため載せていません。「ストリーミング」の言い換えは Anthropic の手引きの説明をもとに、「API」「モデル」の言い換えはふつうの意味を一言で添えたものです。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:デジタル庁「DS-920 行政の進化と革新のための生成AIの調達・利活用に係るガイドライン」を加工して作成)。