AI Log

AIの基本 / 安全と社会

ジェイルブレイク(脱獄):AI に付けた制限を、入力の工夫で外させようとすること

出典を確かめた日 2026年10月1日(木) / 約7分で読めます

一言で

ジェイルブレイクは、生成AI に設けられた「この内容は出さない」という制限を、入力の書き方を工夫してすり抜けさせようとすることです。米国の NIST の文書は、そうした入力をわざと作ることを指す呼び名として紹介しています。

このページで分かること

先に知っておく言葉

出典ごとの説明

  1. NIST(米国の国立標準技術研究所):生成AI のリスクをまとめた文書(NIST AI 600-1、2024年7月)の、危険・暴力的・憎悪をあおる内容を扱う節で取り上げている。いまの多くのシステムは、特定の内容や特定の入力に対して出力を制限しているが、それでも、あからさまでない新しい入力には有害な答えを返すことがある、と書く。そうした入力を意図して作ることが「jailbreaking」と呼ばれる、という説明で、出力の制御を回避するように入力を操ること、と言い換えている
  2. Anthropic(Claude の会社)の開発者向けの説明:ジェイルブレイクとプロンプトインジェクションを、どちらも Claude に決まりごとや、サービスを作る側の指示を無視させようとする試み、としている。Claude はもともとこうした攻撃に強いとしたうえで、ガードレールを強める手立てを並べている
  3. Microsoft Learn(Azure の安全機能の説明、2026年8月28日更新):入力の攻撃を見つけて止める機能「Prompt Shields」のうち、利用者の入力を調べる部分は、以前は「Jailbreak risk detection」という名前だった、と書いている。こちらが扱うのは、システムの指示や安全のための学習を回避しようとする悪意ある入力で、うまくいくと不適切な内容が出たり、システムに決めた制限が破られたりしうる、としている
  4. AI セーフティ・インスティテュート(日本の AISI)の「AI セーフティに関するレッドチーミング手法ガイド」(第1.10版、2025年3月31日):「ジェイルブレイク」という言葉は使っていない。近いものとして、攻撃者が悪意のある入力を AI システムに直接入れる「直接プロンプトインジェクション」を挙げ、システムプロンプトで禁じた事項を上書きさせ、制限された情報を出させる攻撃を例にしている

プロンプトインジェクションとの関係

出典ごとに、組み分けの仕方が次のように違います。

なぜ問題になるのか

NIST の文書は、出力を制限していても有害な答えが出うるというこの問題が、化学・生物などの危険な情報、個人のデータの保護、情報セキュリティなどのリスクとも関わる、としています。Anthropic の説明は、こうした対策を、利用規約や利用の方針に反する使い方に対して特に強めるもの、と位置づけています。

守る側の対策として挙がっているもの

あわせて NIST の文書は、ジェイルブレイクやプロンプトの工夫を試すテストでは、正しく動くか・信頼できるかのリスクを体系的には測れないことがある、とも書いています(→ 別ページ「レッドチーミングと安全性の評価」)。

関連する言葉

出典

  1. NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月 doi.org ↗
  2. Anthropic「Mitigate jailbreaks and prompt injections」 platform.claude.com ↗
  3. Microsoft Learn「Prompt Shields」2026年8月28日 learn.microsoft.com ↗
  4. AI セーフティ・インスティテュート「AI セーフティに関するレッドチーミング手法ガイド(第1.10版)」2025年3月31日 aisi.go.jp ↗
  5. Google for Developers「Machine Learning Glossary」の guardrails の項 developers.google.com ↗

確認メモ:2026年10月1日に、上の出典の原文を開いて確かめました。NIST の文書は、2.3節「Dangerous, Violent, or Hateful Content」、2.9節「Information Security」、対策の表(MS-2.5-006・MS-2.6-007)、付録 A.1.4 を読みました。Anthropic と Microsoft は開発者向けの公式の説明のページを、AISI のガイドは本編の PDF の 2〜3章を読みました。AISI のガイドに「ジェイルブレイク」という言葉は出てこないため、近い説明(直接プロンプトインジェクション)として載せています。出典が攻撃の例として挙げている入力の文や、手口の分類・名前は、攻撃のやり方にあたるため載せていません。AIログのニュースでは、この言葉はまだ出てきていないため、「ニュースでの出方」の節は置いていません。「脱獄」は jailbreak のふつうの訳語を添えたものです。AISI のガイドは、内容を言い換えて使っています(出典:AI セーフティ・インスティテュート「AI セーフティに関するレッドチーミング手法ガイド(第1.10版)」を加工して作成)。