AI Log

AIの基本 / 大規模言語モデルの仕組み

RAG(検索拡張生成):外の資料を探して、それも踏まえて答えを作らせる仕組み

出典を確かめた日 2026年10月1日(木) / 約8分で読めます

一言で

RAG は、AI のモデルに答えを作らせるときに、先に外の資料やデータベースから関係のある情報を探し出し、その結果も踏まえて答えを作らせる仕組みです。

このページで分かること

先に知っておく言葉

出典ごとの説明

  1. 文部科学省の生成AI のガイドライン(Ver.2.0、2024年12月26日):脚注で、決まったデータベースを検索して、その結果も考えに入れて出力を作る仕組み、と説明している
  2. Anthropic(Claude の会社)の用語集:情報の検索と言語モデルによる生成を組み合わせ、作る文章の正確さと関わりの深さを上げ、返事を根拠に結びつける技術、としている。外の知識の集まりや文書を、コンテキストウィンドウに入れてモデルに渡す。データは問いがモデルに送られたときに取り出されるが、取り出すのがモデル自身とは限らない(ツールの使用と検索の機能を与えれば、モデルが取り出すこともできる)、と書いている
  3. Google の機械学習の用語集:モデルの学習が終わったあとに取り出した知識の出どころに出力を結びつける(根拠づける)ことで、大規模言語モデルの出力の質を上げる技術、としている。信頼できる知識の集まりや文書から取り出した情報を、学習済みのモデルが使えるようにすることで、返事の正確さを上げる、と説明している

探す・付け足す・作る

Google の用語集は、化学のアプリを例に、次の順で説明しています(1と2には、用語集が retrieves・augments の英語を添えています)。

  1. 使う人の問いに関係するデータを探す
  2. 見つけたデータを問いに付け足す
  3. 付け足したデータにもとづいて要約を作るよう、モデルに指示する

Anthropic の用語集も、入力にもとづいてまず関係する情報を知識の集まりから取り出し、もとの問いと一緒にモデルに渡し、モデルはそれを手がかりに出力を作る、という順で書いています。

RAG と名付けた2020年の論文

Facebook AI Research・University College London・ニューヨーク大学の Lewis 氏らが2020年5月に arXiv に出した論文は、自分たちの方法を「retrieval-augmented generation(RAG)」と呼んでいます。論文は NeurIPS 2020 に採択されています。

なお、論文の RAG は、探す部分と作る部分を一緒に追加で学習させる(ファインチューニングする)作り方として示されています。Google の用語集は学習を終えたモデルに探した情報を渡す仕組みとして、Anthropic の用語集は探した情報をコンテキストウィンドウに入れてモデルに渡す仕組みとして説明しています。

何のために使うのか

限りと注意点として挙がっているもの

関連する言葉

出典

  1. 文部科学省 初等中等教育局「初等中等教育段階における生成AIの利活用に関するガイドライン(Ver.2.0)」2024年12月26日 mext.go.jp ↗
  2. Anthropic「Glossary」の RAG (Retrieval augmented generation) の項 platform.claude.com ↗
  3. Google for Developers「Machine Learning Glossary」の retrieval-augmented generation (RAG) の項 developers.google.com ↗
  4. P. Lewis ほか「Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks」arXiv 2020年5月(NeurIPS 2020) arxiv.org ↗
  5. 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編 2026年3月31日、第2部 C「共通の指針」の脚注27・脚注29 soumu.go.jp ↗
  6. NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月 doi.org ↗

確認メモ:2026年10月1日に、上の6つの出典の原文を開いて確かめました。文部科学省のガイドラインは、生成AI のリスクと技術的な対策の段落とその脚注を読みました。Anthropic と Google の用語集は、RAG の項を読みました。論文は arXiv の第4版(2021年4月12日)の PDF から文字を取り出し、要旨・序論・作り・実験・知識の入れ替えの節・社会への影響の節を読みました。採択先は arXiv のページの注記で確かめました。AI事業者ガイドラインは、偽情報への対策と適正な利用の項に付いた脚注27・脚注29を、NIST の文書は、RAG に触れている対応の一覧の項を読みました。出典ごとの違いとして、論文の RAG は探す部分と作る部分を一緒に追加で学習させる作り方で、Google の用語集は学習を終えたモデルに探した情報を渡す仕組みとして、Anthropic の用語集は探した情報をコンテキストウィンドウに入れて渡す仕組みとして書いています。どれか1つを正しいとはしていません。論文の細かい計算の方法(2つの方式の違いなど)と、各課題の細かい点数は載せていません。AIログのニュースでは、この言葉はまだ出てきていないため、「ニュースでの出方」の節は置いていません。「パラメータ」の言い換えと、「収束」に添えた説明は、ふつうの意味を一言で添えたものです。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:文部科学省「初等中等教育段階における生成AIの利活用に関するガイドライン(Ver.2.0)」、総務省・経済産業省「AI事業者ガイドライン(第1.2版)」を加工して作成)。