AI Log

AIの基本 / 安全と社会

プロンプトインジェクション:AI が読む入力に指示を紛れ込ませ、本来の指示と違う動きをさせる攻撃

出典を確かめた日 2026年10月1日(木) / 約8分で読めます

一言で

プロンプトインジェクションは、AI への入力に悪意のある指示を入れ込み、作った人や使う人が決めた指示を無視させて、意図しない動きをさせる攻撃です。使う本人が仕掛ける「直接」と、AI が読むウェブページなどに第三者が仕込む「間接」に分けて説明されます。

このページで分かること

先に知っておく言葉

出典ごとの説明

  1. NIST の生成AI のリスクの文書(AI 600-1、2024年7月):生成AI そのものがこの攻撃を受けうる、と情報セキュリティのリスクに挙げている。直接は、攻撃する人が悪意のある指示を作って直接入れるもの。間接は、直接の窓口を持たない攻撃者が、AI が取り込みそうなデータに指示を仕込むもの、としている
  2. NIST の敵対的機械学習の攻撃と対策の分類(AI 100-2 E2025、2025年3月):直接は、そのシステムを使う本人が攻撃者で、アプリを作る側が書いたシステムプロンプトのような、より信頼の高い指示の後ろに、自分の指示を付け足すもの、としている。間接は、使う本人ではなく第三者が仕掛けるもので、多くの場合、害を受けるのは使う本人だ、としている。使う本人が仕掛ける直接のプロンプト攻撃の中に、直接プロンプトインジェクションとジェイルブレイク(出力にかけた制限をくぐり抜けるもの)を並べている
  3. AI事業者ガイドライン 別添(第1.2版、2026年3月31日):AI のリスクの例として、間接プロンプトインジェクションなどによって、RAG を悪用されることや、AI にかけた制御が無視されて悪意のある出力が出ることを挙げている。AI エージェントなどは入力の経路や外とのつながりが多いため、悪意のある指示を使った攻撃のリスクがいっそう高まるおそれがある、としている
  4. Anthropic の公式の説明:ジェイルブレイクとプロンプトインジェクションは、どちらも Claude に決まりや指示を無視させようとするもの、としている。直接は、アプリを使う人が攻撃者の場合。間接は、使う人は信頼できるが、Claude が読むウェブページ・メール・文書・道具の結果などに攻撃の指示が入っている場合、と分けている
  5. OpenAI の公式の説明(エージェントを作る道具の安全のページ):よくある危険な攻撃で、信頼できない文章やデータが AI のシステムに入り、その中の悪意のある内容が、AI への指示を上書きしようとするもの、としている

なぜ起きるのか

NIST AI 100-2 は、大規模言語モデルを使うアプリでは、データと指示が別々の通り道で渡されないことが多くの弱点の根にあり、データの通り道から指示を入れ込めてしまう、と説明しています。何十年も前からある「SQL インジェクション」(データベースへの攻撃)と似た欠陥だ、とたとえています(NIST AI 100-2 のたとえ)。間接プロンプトインジェクションを取り上げた Greshake ほかの論文(2023年2月)も、大規模言語モデルを組み込んだアプリは、データと指示の境目をあいまいにする、と書いています。

何が起きうるか

どう守るか

守りきれるか

NIST AI 100-2 は、今の対策はすべての攻撃を防ぎきれないため、信頼できない入力に触れるならこの攻撃は起こりうるという前提でシステムを設計する、という考え方を挙げています。OpenAI も、対策をしてもエージェントはだまされることがあり、リスクは大きく減らせても無くならない、としています。

モデルそのものの強さは、説明が分かれています。NIST AI 100-2(2025年3月)は、最近の研究から、今の世代のモデルは直接プロンプトインジェクションに対してまだとても弱い、としています。Anthropic は、Claude はもともとこうした攻撃に強く、そのうえで守りを足すもの、と説明しています。OpenAI は、GPT-5 と GPT-5-mini はジェイルブレイクや間接プロンプトインジェクションに強くなっているとして、使うことを挙げています。NIST はモデル全般、Anthropic と OpenAI は自社のモデルについての説明です。

ニュースでの出方

関連する言葉

出典

  1. NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月 doi.org ↗
  2. NIST「NIST AI 100-2 E2025:Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations」2025年3月 doi.org ↗
  3. Greshake ほか「Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection」arXiv:2302.12173、2023年2月23日 arxiv.org ↗
  4. 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」別添(付属資料)、2026年3月31日 soumu.go.jp ↗
  5. AI セーフティ・インスティテュート「AI セーフティに関する評価観点ガイド(第1.20版)」2026年7月7日 aisi.go.jp ↗
  6. Anthropic「Mitigate jailbreaks and prompt injections」 platform.claude.com ↗
  7. OpenAI「Safety in building agents」 developers.openai.com ↗

確認メモ:2026年10月1日に、上の7つの出典の原文を開いて確かめました。NIST の2つの文書・論文・国の文書・AISI のガイドは PDF から文字を取り出し、AI 600-1 は2.9節「Information Security」を、AI 100-2 は生成AI の攻撃の分類(推論のときの攻撃)・3.3節・3.4節・3.5節を、論文は要旨と導入を、AI事業者ガイドラインの別添は「AI によるリスク」の攻撃の項目を、AISI のガイドは3.6節と付録の表2を読みました。Anthropic と OpenAI のページは本文を読みました。AISI が IPA に置かれていることは、AISI の「AISIについて」のページで確かめました。モデルがこの攻撃に強いかどうかは、NIST・Anthropic・OpenAI で説明が違い、対象も違うため並べています。攻撃の手口や、指示の文の例は、このページの決まりにより載せていません(出典のページには、守り方の説明のための例が載っています)。OpenAI のページは Agent Builder についてのもので、Agent Builder は2026年11月30日に終わる予定と書かれています。AI事業者ガイドラインの別添が挙げる守りの手法(システムプロンプトの安全な設計など)は、プロンプトインジェクションと結び付けて書かれていなかったため載せていません。「SQL インジェクション」は、NIST のたとえに、ふつうの意味を一言で添えたものです。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省・経済産業省「AI事業者ガイドライン(第1.2版)」別添を加工して作成)。