要約(3行)
- NVIDIA が 9/28、AI エージェント(任された作業を自分で進める AI)を試験から本番まで守るための仕組み「NVIDIA Open Agent Safety Platform」を発表した。ソフトの部品は公開され、誰でも使える。
- 中身は2段。エージェントが動く範囲をソフトの側で区切る「OpenShell」(オープンソース)と、別の部品(BlueField-4)の上で動き、範囲の外に出ようとしたエージェントを数ミリ秒で隔離して止める見張り役「Sentry」(こちらは設計の見本)。
- Anthropic、Microsoft、SAP、Salesforce、JPMorganChase など100以上の組織が、この仕組みの技術で NVIDIA と組んでいる、と NVIDIA は説明している。
今後の使い方の流れ
- 守りを「モデルの外」に置く:NVIDIA は、最近の事故に共通する型として「エージェントが、任された作業を終えるためにアプリの側の守りをすり抜けた」ことを挙げ、モデルやエージェントの仕組みの外に、破れない境界を置く考え方を打ち出している。
- まずソフトの OpenShell から:OpenShell は広く使える状態になり、NVIDIA 以外の部品(Arm・Intel など)にも広げられるとしている。専用の部品が無くても始められるのはこちら。
- ふだんの道具から承認する:Salesforce は OpenShell を Slack につなぎ、エージェントの動きや記録を見たり、エージェントが追加の権限を求めたときに承認・却下したりできるようにした。
- クラウドの側でも使えるように:Microsoft、Oracle、CoreWeave などが、この技術を使う基盤を用意している、と発表にある。
この発表で何が変わりそうか(分析)
- 「AI に頼んで断らせる」から「外側で止める」へ。 エージェントの守りを、モデルの中の安全策(危ない依頼を断る力)だけに頼らず、動く場所の側に置く考え方が、部品を作る会社から出てきた。9/30 分の、公開モデルの悪用を止める仕組みが簡単に外せたという報告(→ Anthropic の研究チーム「誰でも使える中国の公開モデルが、攻撃の力で一線を越えた」)とも向きが合う【推測】。
- AI の会社同士が同じ守りの部品を使う形。 Anthropic は、自社のエージェントの仕組み(Claude Managed Agents)を OpenShell・BlueField とつないだとしている。SpaceXAI も、Cursor のエージェントと Grok で使うとしている。会社をまたいで同じ守りの部品が使われれば、社内の決まりを1つにまとめやすくなる【推測】。
- 会社の決まりが「どこまで任せるか」の表になる。 権限を求められたら人が承認する、範囲の外に出たら止める、という作りなので、導入する側は「どの作業にどの権限を渡すか」を先に書き出す必要がある。9/30 分の OpenAI の dots の任せ方の4段階と同じ流れ【推測】。
- 本番の見張り役は専用の部品が前提。 数ミリ秒で止める Sentry は BlueField-4 という NVIDIA の部品の上で動く設計の見本で、使えるのはその部品を入れた基盤から。ソフトだけの OpenShell とは入り方が違う。
- 中の人の言葉:Anthropic の最高商務責任者 Paul Smith 氏は、NVIDIA の発表の中で、会社はエージェントについて "they need to direct and verify what those agents do"(9/28)と述べている。任せるだけでなく、指示と確認を人の側に残す、という方向を Anthropic 側の言葉でも確かめられる。
出典
- NVIDIA 公式「NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment」(2026-09-28)nvidianews.nvidia.com ↗
確認メモ(2026-09-30 に確認):仕組みの2段、数ミリ秒で隔離すること、100以上の組織、参加した会社の名前と役割、Paul Smith 氏の肩書き(chief commercial officer)と言葉は、NVIDIA の発表ページの原文のとおり。参加した会社の説明は NVIDIA の発表の中の言葉で、各社の自社の発表は開いていない。日本の会社の参加は、発表の中の名前(日立エナジーなど)以外は確かめていない。