一言で
コンテキストウィンドウは、言葉を扱う AI のモデルが、返事を作るときに一度に参照できる文章の量のことです。量はトークンの数で表されます。
このページで分かること
- コンテキストウィンドウが何を指すか(出典ごとに数え方の範囲が少し違うこと)
- 学習に使ったデータとの違いと、長いほど何ができるか
- 上限を超えるとどうなるか、どんなものが量に数えられるか(各社の公式の説明)
先に知っておく言葉
- トークン:AI が文章を区切って扱う単位(→ 別ページ「トークン」)
- プロンプト:モデルに入力する文章(→ 別ページ「プロンプトとシステムプロンプト」)
- システムプロンプト:アプリを作る側がモデルに与える、ふるまいの指示(→ 別ページ「プロンプトとシステムプロンプト」)
- API:プログラムから AI を使うための窓口(→ 別ページ「API と料金の数え方」)
出典ごとの説明
どの出典も「モデルが一度に扱える量」という点では同じですが、何を数えに入れるかの書き方が違います。
- Google の機械学習の用語集:1つのプロンプトの中で、モデルが処理できるトークンの数、としている。大きいほど、モデルはより多くの情報を使って、筋の通った、ぶれの少ない返事を返せる、と説明している
- Anthropic(Claude の会社)の用語集:言語モデルが新しい文章を作るときに、さかのぼって参照できる文章の量、としている。大きければ、より込み入った長いプロンプトを扱える。小さいと、長いプロンプトや、長く続く会話でつじつまを保つことが難しくなることがある、としている
- Anthropic のコンテキストウィンドウの説明:返事を作るときに参照できるすべての文章で、作っている返事そのものも含む、と書いている(用語集の項は、返事を含むかどうかに触れていない)
- OpenAI(ChatGPT の会社)の説明:「context length(コンテキストの長さ)」という言い方で、文章を作るモデルでは、プロンプトと作った出力を合わせた量が、モデルの上限を超えてはいけない、としている
学習したデータとは別のもの
Anthropic の用語集は、コンテキストウィンドウは、モデルが学習に使った大量のデータとは別物で、モデルにとっての「作業用の記憶(working memory)」にあたる、と説明しています(Anthropic のたとえ)。
GPT-3 の論文(2020年)は、この窓の中に例を入れるだけで、モデルの重み(学習で決まる数値)を変えずに新しい仕事をさせる方法を試しています。論文の GPT-3 のモデルはどれも、コンテキストウィンドウが2048トークンでした。そのため、仕事の見本を入れる数は、窓に収まる範囲で、たいてい10〜100個にした、と書いています。
何が数えられ、超えるとどうなるか
Anthropic のコンテキストウィンドウの説明(Claude の API について)では、次のように書かれています。
- 数えられるもの:システムプロンプト、やり取りのすべてのメッセージ(道具の結果・画像・文書を含む)、道具の定義。その回にモデルが作る出力(考える過程の拡張思考を含む)も数えられる
- 会話が続くと:やり取りのたびに、前の発言と返事が窓の中にたまっていく。claude.ai のようなチャットの画面では、古いものから順に外していく扱いもできる
- 大きさ:モデルによって違い、最大で100万トークン。2026年10月1日の時点で、Claude Sonnet 5.5 などは100万トークン、Claude Sonnet 4.5 などほかのモデルは20万トークン
- 超えたとき:入力だけで上限を超えていると、どのモデルでもエラーが返る
- 長ければよいとは限らない:トークンの数が増えるにつれて、正確さや思い出す力が落ちる(context rot と呼ぶ)。そのため、どれだけ入るかと同じくらい、何を入れるかが大事、としている
- 上限に近づいたとき:会話の前のほうをサーバー側で要約して続ける仕組み(compaction)がある。Claude 4.6 以降のモデルで、ベータ版(試験提供)として使える
関連する言葉
- トークン・プロンプトとシステムプロンプト・大規模言語モデル・RAG・考えてから答えるモデル(→ この欄の別ページ)
出典
- Brown ほか「Language Models are Few-Shot Learners」arXiv:2005.14165、2020年 arxiv.org ↗
- Anthropic「Glossary」の Context window の項 platform.claude.com ↗
- Anthropic「Context windows」 platform.claude.com ↗
- OpenAI「Key concepts」の Tokens の項 developers.openai.com ↗
- Google for Developers「Machine Learning Glossary」の context window の項 developers.google.com ↗
確認メモ:2026年10月1日に、上の5つの出典の原文を開いて確かめました。Google の用語集・Anthropic の用語集・Anthropic の説明・OpenAI の説明で、窓に何を数えるか(入力だけか、返事も含むか)の書き方が違うため、出典の名前を付けて並べました。GPT-3 の論文は、2章の冒頭(few-shot の説明)・2.1節(モデルの作り)・2.4節(評価のやり方)で、2048トークンと「10〜100個」を確かめました。何が数えられるか、モデルごとの大きさ、上限を超えたとき、context rot、compaction は Anthropic の説明だけに書かれていたもので、Claude の API についての説明です。モデルごとの大きさは、確かめた日の時点の Anthropic の説明のとおりです。上限を超えたときの細かい扱い(出力の途中で上限に届いたときの止まり方など)は、モデルの世代で違い、細かくなるため載せていません。OpenAI の各モデルの上限の数字は、確かめたページに書かれていなかったため載せていません。「重み」「ベータ版」の言い換えは、ふつうの意味を一言で添えたものです。AIログのニュースの無料部分では、この言葉はまだ出てきていないため、「ニュースでの出方」の節は置いていません。