一言で
レッドチーミングは、AI を悪用しようとする人の目線で AI システムを試し、弱点や守りの抜けを見つける評価の方法です。日本と米国の公的な文書では、AI の安全性を確かめる評価の方法の1つとして出てきます。
このページで分かること
- レッドチーミングが何を指すか(出典ごとの説明)
- 安全性の評価の中での位置づけと、ほかの評価の方法
- 誰が・いつ行うものとされているか、と出典が挙げる限界
先に知っておく言葉
- 生成AI:文章や画像などを作り出す AI(→ 別ページ「生成AI とは」)
- 大規模言語モデル(LLM):大量の文章で学習した、文章を読み書きするモデル(→ 別ページ「大規模言語モデル(LLM)とは」)
- ベンチマーク:AI の力を測るための決まった試験(→ 別ページ「ベンチマークと評価」)
出典ごとの説明
- NIST(米国の国立標準技術研究所):生成AI のリスクをまとめた文書(NIST AI 600-1、2024年7月)は、AI のレッドチーミングを、不正確・有害・差別的な出力のような欠陥や弱点を見つけるために AI システムを探る、組み立てられた試験の作業、としている。多くは管理された環境で、作る側と一緒に行うもので、やり方はまだ発展の途中にある、とも書く。一般に公開する前にも後にも行える、としている
- AI セーフティ・インスティテュート(日本の AISI)の「AI セーフティに関するレッドチーミング手法ガイド」(第1.10版、2025年3月31日):攻撃者がどう攻めてくるかという見方で、AI セーフティへの備えの体制と対策が効いているかを確かめる評価の方法、と定めている。目的は、攻撃者の目線で弱点や対策の不備を見つけ、直して堅くすることで、AI の安全を保つ、または高めることだとしている
- AI事業者ガイドライン(第1.2版、2026年3月31日):高度な AI システムを開発する組織に向けた国際的な行動規範(広島 AI プロセス)を参照先として載せている。そこでは、AI のライフサイクル全体のリスクを見つけて減らすために、レッドチーミングなどの評価の方法を組み合わせ、組織の中のテストと独立した外部のテストを使うこと、見つかった弱点には緩和策をとることが挙がっている。テストは安全な環境で、世に出す前を含むいくつかの節目で行うべき、ともしている
安全性の評価の中での位置づけ
AISI の「AI セーフティに関する評価観点ガイド」(第1.20版、2026年7月7日)は、AI セーフティ評価の目的を、AI モデルや AI システムの安全が保たれている・高まっていることを確かめること、としています。評価の方法は大きく2つに分けています。
- 技術的評価:データ・入出力・システムの構成・設定などを技術の面から見る。次のようなものがある
- ツールによる評価:有害な文字列が出ないことを決まりで調べる方法や、LLM を使って評価する方法など。ただし、評価のすべてをツールで自動にするのは難しい、としている
- レッドチーミングによる評価:悪意のある利用者からの攻撃にどれだけ耐えるかを詳しく確かめるため、起こりうるリスクの筋書きを細かく考え、机の上でなく実際のシステムの環境で評価するもの
- そのほか:ベンチマークやチェックリストとの突き合わせ、設定の画面や記録を見て確かめる方法など
- マネジメント的評価:会社全体の取り組みの方針や社内の決まりを見る。組織の中の研修や演習を通して評価したり、文書がそろっているかを確かめたりする
同じガイドは、何を見るかの観点として、有害な情報の出力の制御、偽の情報や誤った情報の出力・誘導の防止、公平性と包摂性、プライバシーの保護、セキュリティの確保などを並べ、AI エージェント(→ 別ページ「エージェントとツールの使用」)向けには「観測と制御」を加えています。この観点は網羅的なものではない、ともしています。
誰が・いつ行うか
- 誰が:AISI の評価観点ガイドは、主に作る側・提供する側の管理者が行うものとしつつ、客観性のために、そのシステムに直接は関わらない社内外の専門家や、第三者による評価も役に立つ、としている。NIST の文書は、レッドチーミングを一般の利用者・専門家・その組み合わせ・人と生成AI の組み合わせで行う型を挙げ、結果の質はチームの経歴や専門性と関係する、としている
- いつ:AISI の評価観点ガイドは、開発・提供・利用のそれぞれの段階で、一度きりでなく繰り返し行うもの、としている。AISI のレッドチーミング手法ガイドも、公開や運用を始める前と、始めた後の両方での実施を取り上げている。AI事業者ガイドラインが載せる行動規範は、世に出した後も弱点や悪用を見張り、報奨金やコンテストなどで第三者や利用者が問題を見つけて知らせるよう促すことを挙げている
出典が挙げる限界
- 成功しなかった=安全、ではない:AISI のレッドチーミング手法ガイドは、限られた人手と期間で行うため、試した攻撃が通らなかったことは、すべての攻撃が通らないことを保証しない、としている
- 同じ結果が出るとは限らない:同じガイドは、外の環境とやりとりする場合や、LLM が確率的にふるまうよう設定されている場合などには、AI システムは同じ入力に同じ出力を返すとは限らないため、試験の一度の実行で通らなかった攻撃が本番で通ることも、その逆もありうる、としている
- 試験と実際の使われ方のずれ:NIST の文書は、いまの公開前の試験は、実際に使われる場面と合っていなかったり、体系的でなかったりすることがあり、実験室の条件と現実の差から測れない部分が出ることがある、としている
各国の機関
AI事業者ガイドラインの注によると、2023年11月に英国が AI Safety Institute の設置計画を、米国が NIST にレッドチーミングの評価などを行う US AI Safety Institute を置くことを発表しました。英国の機関は2025年2月に AI Security Institute に名前を変えています。日本では2024年2月14日に、AI セーフティ・インスティテュート(AISI)が情報処理推進機構(IPA)に置かれました。
ニュースでの出方
- Anthropic のレッドチーム:Anthropic で攻撃する側の視点から AI を試す研究チーム(Frontier Red Team)が 9/29、中国の Zhipu AI の公開モデル「GLM-5.3」を調べた結果を公開しました。同じ記事では、NIST の AI の評価部門(CAISI)も 9/17 に同じモデルを評価したことを伝えています
- Anthropic の研究チーム「誰でも使える中国の公開モデルが、攻撃の力で一線を越えた」
関連する言葉
- ジェイルブレイク・プロンプトインジェクション・ベンチマークと評価・アライメント(→ この欄の別ページ)
出典
- NIST「NIST AI 600-1:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile」2024年7月 doi.org ↗
- 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」本編 2026年3月31日 soumu.go.jp ↗
- AI セーフティ・インスティテュート「AI セーフティに関するレッドチーミング手法ガイド(第1.10版)」2025年3月31日 aisi.go.jp ↗
- AI セーフティ・インスティテュート「AI セーフティに関する評価観点ガイド(第1.20版)」2026年7月7日 aisi.go.jp ↗
確認メモ:2026年10月1日に、上の出典の原文を開いて確かめました。NIST の文書は、付録 A.1.4「Pre-Deployment Testing」と A.1.5 の「AI Red-teaming」の部分を読みました。AI事業者ガイドラインは第1.2版の本編の PDF の、「はじめに」の注13(各国の AI Safety Institute)と、第3部の広島プロセス国際行動規範を載せた部分を読みました。AISI のレッドチーミング手法ガイドは本編の 1〜2章と 5章の見出しを、評価観点ガイドは 1〜2章と 4〜5章を読みました。レッドチーミング手法ガイドの 3章(攻撃の手法)と、実施の手順の細部は、攻撃のやり方にあたる部分を含むため載せていません。行動規範のうち、テストで注意すべきリスクの一覧(化学・生物などの危険やサイバーの攻撃の力など)は載せていません。「ニュースでの出方」は、AIログの記事の無料部分を読んでこのサイトがまとめたものです。国の文書は公共データ利用規約にもとづき、内容を言い換えて使っています(出典:総務省・経済産業省「AI事業者ガイドライン(第1.2版)」を加工して作成)。AISI のガイドも、内容を言い換えて使っています(出典:AI セーフティ・インスティテュート「AI セーフティに関するレッドチーミング手法ガイド(第1.10版)」「AI セーフティに関する評価観点ガイド(第1.20版)」を加工して作成)。