AI Log

AIの基本 / 安全と社会

レッドチーミングと安全性の評価:攻撃する側の目で AI の弱点を探して確かめる

出典を確かめた日 2026年10月1日(木) / 約7分で読めます

一言で

レッドチーミングは、AI を悪用しようとする人の目線で AI システムを試し、弱点や守りの抜けを見つける評価の方法です。日本と米国の公的な文書では、AI の安全性を確かめる評価の方法の1つとして出てきます。

このページで分かること

先に知っておく言葉

出典ごとの説明

  1. NIST(米国の国立標準技術研究所):生成AI のリスクをまとめた文書(NIST AI 600-1、2024年7月)は、AI のレッドチーミングを、不正確・有害・差別的な出力のような欠陥や弱点を見つけるために AI システムを探る、組み立てられた試験の作業、としている。多くは管理された環境で、作る側と一緒に行うもので、やり方はまだ発展の途中にある、とも書く。一般に公開する前にも後にも行える、としている
  2. AI セーフティ・インスティテュート(日本の AISI)の「AI セーフティに関するレッドチーミング手法ガイド」(第1.10版、2025年3月31日):攻撃者がどう攻めてくるかという見方で、AI セーフティへの備えの体制と対策が効いているかを確かめる評価の方法、と定めている。目的は、攻撃者の目線で弱点や対策の不備を見つけ、直して堅くすることで、AI の安全を保つ、または高めることだとしている
  3. AI事業者ガイドライン(第1.2版、2026年3月31日):高度な AI システムを開発する組織に向けた国際的な行動規範(広島 AI プロセス)を参照先として載せている。そこでは、AI のライフサイクル全体のリスクを見つけて減らすために、レッドチーミングなどの評価の方法を組み合わせ、組織の中のテストと独立した外部のテストを使うこと、見つかった弱点には緩和策をとることが挙がっている。テストは安全な環境で、世に出す前を含むいくつかの節目で行うべき、ともしている

安全性の評価の中での位置づけ

AISI の「AI セーフティに関する評価観点ガイド」(第1.20版、2026年7月7日)は、AI セーフティ評価の目的を、AI モデルや AI システムの安全が保たれている・高まっていることを確かめること、としています。評価の方法は大きく2つに分けています。

同じガイドは、何を見るかの観点として、有害な情報の出力の制御、偽の情報や誤った情報の出力・誘導の防止、公平性と包摂性、プライバシーの保護、セキュリティの確保などを並べ、AI エージェント(→ 別ページ「エージェントとツールの使用」)向けには「観測と制御」を加えています。この観点は網羅的なものではない、ともしています。

誰が・いつ行うか

出典が挙げる限界

  1. 成功しなかった=安全、ではない:AISI のレッドチーミング手法ガイドは、限られた人手と期間で行うため、試した攻撃が通らなかったことは、すべての攻撃が通らないことを保証しない、としている
  2. 同じ結果が出るとは限らない:同じガイドは、外の環境とやりとりする場合や、LLM が確率的にふるまうよう設定されている場合などには、AI システムは同じ入力に同じ出力を返すとは限らないため、試験の一度の実行で通らなかった攻撃が本番で通ることも、その逆もありうる、としている
  3. 試験と実際の使われ方のずれ:NIST の文書は、いまの公開前の試験は、実際に使われる場面と合っていなかったり、体系的でなかったりすることがあり、実験室の条件と現実の差から測れない部分が出ることがある、としている

各国の機関

AI事業者ガイドラインの注によると、2023年11月に英国が AI Safety Institute の設置計画を、米国が NIST にレッドチーミングの評価などを行う US AI Safety Institute を置くことを発表しました。英国の機関は2025年2月に AI Security Institute に名前を変えています。日本では2024年2月14日に、AI セーフティ・インスティテュート(AISI)が情報処理推進機構(IPA)に置かれました。

ニュースでの出方

関連する言葉

出典

  1. NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月 doi.org ↗
  2. 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編 2026年3月31日 soumu.go.jp ↗
  3. AI セーフティ・インスティテュート「AI セーフティに関するレッドチーミング手法ガイド(第1.10版)」2025年3月31日 aisi.go.jp ↗
  4. AI セーフティ・インスティテュート「AI セーフティに関する評価観点ガイド(第1.20版)」2026年7月7日 aisi.go.jp ↗

確認メモ:2026年10月1日に、上の出典の原文を開いて確かめました。NIST の文書は、付録 A.1.4「Pre-Deployment Testing」と A.1.5 の「AI Red-teaming」の部分を読みました。AI事業者ガイドラインは第1.2版の本編の PDF の、「はじめに」の注13(各国の AI Safety Institute)と、第3部の広島プロセス国際行動規範を載せた部分を読みました。AISI のレッドチーミング手法ガイドは本編の 1〜2章と 5章の見出しを、評価観点ガイドは 1〜2章と 4〜5章を読みました。レッドチーミング手法ガイドの 3章(攻撃の手法)と、実施の手順の細部は、攻撃のやり方にあたる部分を含むため載せていません。行動規範のうち、テストで注意すべきリスクの一覧(化学・生物などの危険やサイバーの攻撃の力など)は載せていません。「ニュースでの出方」は、AIログの記事の無料部分を読んでこのサイトがまとめたものです。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省・経済産業省「AI事業者ガイドライン(第1.2版)」を加工して作成)。AISI のガイドも、内容を言い換えて使っています(出典:AI セーフティ・インスティテュート「AI セーフティに関するレッドチーミング手法ガイド(第1.10版)」「AI セーフティに関する評価観点ガイド(第1.20版)」を加工して作成)。