一言で
ジェイルブレイクは、生成AI に設けられた「この内容は出さない」という制限を、入力の書き方を工夫してすり抜けさせようとすることです。米国の NIST の文書は、そうした入力をわざと作ることを指す呼び名として紹介しています。
このページで分かること
- ジェイルブレイクが何を指すか(出典ごとの説明)
- プロンプトインジェクションとの関係を、出典がどう書いているか
- 守る側の対策として、出典に挙がっているもの
先に知っておく言葉
- 生成AI:文章や画像などを作り出す AI(→ 別ページ「生成AI とは」)
- プロンプト・システムプロンプト:AI への指示や入力の文。システムプロンプトは、AI を組み込んだサービスを作る側があらかじめ与えておく指示(→ 別ページ「プロンプトとシステムプロンプト」)
- ガードレール:人やシステムへの害を防ぐためのソフトや手順(Google の機械学習の用語集の説明)
- プロンプトインジェクション:AI が読む入力に指示を紛れ込ませ、意図しない動きをさせる攻撃(→ 別ページ「プロンプトインジェクション」)
出典ごとの説明
- NIST(米国の国立標準技術研究所):生成AI のリスクをまとめた文書(NIST AI 600-1、2024年7月)の、危険・暴力的・憎悪をあおる内容を扱う節で取り上げている。いまの多くのシステムは、特定の内容や特定の入力に対して出力を制限しているが、それでも、あからさまでない新しい入力には有害な答えを返すことがある、と書く。そうした入力を意図して作ることが「jailbreaking」と呼ばれる、という説明で、出力の制御を回避するように入力を操ること、と言い換えている
- Anthropic(Claude の会社)の開発者向けの説明:ジェイルブレイクとプロンプトインジェクションを、どちらも Claude に決まりごとや、サービスを作る側の指示を無視させようとする試み、としている。Claude はもともとこうした攻撃に強いとしたうえで、ガードレールを強める手立てを並べている
- Microsoft Learn(Azure の安全機能の説明、2026年8月28日更新):入力の攻撃を見つけて止める機能「Prompt Shields」のうち、利用者の入力を調べる部分は、以前は「Jailbreak risk detection」という名前だった、と書いている。こちらが扱うのは、システムの指示や安全のための学習を回避しようとする悪意ある入力で、うまくいくと不適切な内容が出たり、システムに決めた制限が破られたりしうる、としている
- AI セーフティ・インスティテュート(日本の AISI)の「AI セーフティに関するレッドチーミング手法ガイド」(第1.10版、2025年3月31日):「ジェイルブレイク」という言葉は使っていない。近いものとして、攻撃者が悪意のある入力を AI システムに直接入れる「直接プロンプトインジェクション」を挙げ、システムプロンプトで禁じた事項を上書きさせ、制限された情報を出させる攻撃を例にしている
プロンプトインジェクションとの関係
出典ごとに、組み分けの仕方が次のように違います。
- NIST:jailbreaking は有害な内容のリスクの節で、プロンプトインジェクションは情報セキュリティのリスクの節で、それぞれ別に説明している
- Anthropic:攻撃を2つの型に分け、アプリの利用者自身が敵となってガードレールを越える入力を作るものを「ジェイルブレイクと直接のプロンプトインジェクション」として1つの型にまとめている。もう1つの型は、利用者は信頼できるが、AI が読むウェブページ・メール・文書などに第三者の指示が紛れ込んでいるもの(間接のプロンプトインジェクション)
- Microsoft:上の利用者の入力を調べる部分を、利用者によるプロンプトインジェクション攻撃を見つけるもの、と説明している。第三者の文書などに隠された指示を調べる部分は別に置いている
なぜ問題になるのか
NIST の文書は、出力を制限していても有害な答えが出うるというこの問題が、化学・生物などの危険な情報、個人のデータの保護、情報セキュリティなどのリスクとも関わる、としています。Anthropic の説明は、こうした対策を、利用規約や利用の方針に反する使い方に対して特に強めるもの、と位置づけています。
守る側の対策として挙がっているもの
- 入力を先に調べる:Anthropic は、軽いモデルで利用者の入力を先にふるいにかけることや、知られている攻撃の型で入力を調べることを挙げている。Microsoft の Prompt Shields も、答えを作る前に利用者の入力や文書を調べて止める仕組み。AISI のガイドは、AI の前に入力の検査を置くこと、攻撃を見つけるための別の AI のモデルを置くこと、AI の後に出力の検査を置くことを挙げている
- 指示の側を固める:Anthropic は、倫理や法の線引きと、断り方をはっきり書いたシステムプロンプトを挙げている。AISI のガイドも、プロンプト自体を堅くすることを挙げている
- 使われ方を見続ける:Anthropic は、何度も制限を越えようとする利用者への対応(利用を絞る・止めるなど)と、出力を定期的に調べて対策を直していくことを挙げている
- 守りを定期的に見直す:NIST の文書は、安全のための対策が回避されうる弱点を定期的に評価すること、特に新しい状況で動かすときにガードレールを見直すことを挙げている。AISI のガイドは、新しい攻撃が日々報告され、ある時点まで効いていた守りが足りなくなることもあるため、攻撃の新しい動きに注意すべき、としている
あわせて NIST の文書は、ジェイルブレイクやプロンプトの工夫を試すテストでは、正しく動くか・信頼できるかのリスクを体系的には測れないことがある、とも書いています(→ 別ページ「レッドチーミングと安全性の評価」)。
関連する言葉
- プロンプトインジェクション・プロンプトとシステムプロンプト・レッドチーミングと安全性の評価・アライメント(→ この欄の別ページ)
出典
- NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月 doi.org ↗
- Anthropic「Mitigate jailbreaks and prompt injections」 platform.claude.com ↗
- Microsoft Learn「Prompt Shields」2026年8月28日 learn.microsoft.com ↗
- AI セーフティ・インスティテュート「AI セーフティに関するレッドチーミング手法ガイド(第1.10版)」2025年3月31日 aisi.go.jp ↗
- Google for Developers「Machine Learning Glossary」の guardrails の項 developers.google.com ↗
確認メモ:2026年10月1日に、上の出典の原文を開いて確かめました。NIST の文書は、2.3節「Dangerous, Violent, or Hateful Content」、2.9節「Information Security」、対策の表(MS-2.5-006・MS-2.6-007)、付録 A.1.4 を読みました。Anthropic と Microsoft は開発者向けの公式の説明のページを、AISI のガイドは本編の PDF の 2〜3章を読みました。AISI のガイドに「ジェイルブレイク」という言葉は出てこないため、近い説明(直接プロンプトインジェクション)として載せています。出典が攻撃の例として挙げている入力の文や、手口の分類・名前は、攻撃のやり方にあたるため載せていません。AIログのニュースでは、この言葉はまだ出てきていないため、「ニュースでの出方」の節は置いていません。「脱獄」は jailbreak のふつうの訳語を添えたものです。AISI のガイドは、内容を言い換えて使っています(出典:AI セーフティ・インスティテュート「AI セーフティに関するレッドチーミング手法ガイド(第1.10版)」を加工して作成)。