Nvidiaは月曜日、AIエージェントが制御不能に陥る前に監視し、抑え込む「取り締まりシステム」を発表しました。「Open Agent Safety Platform」は、オープンソースソフトウェアとリファレンスシステム設計を組み合わせたものです。テストから本番展開まで、AIエージェントを定められた境界の内側にとどめます。
Nvidiaでエンタープライズコンピューティング担当バイスプレジデント兼ゼネラルマネージャーを務めるJustin Boitano氏は、記者向け説明会で次のように述べました。最近注目を集めた複数のインシデントから、エージェントは与えられた目標を達成するため、想定外の方法を創造的に見つけ出すことがわかっています。また、エージェントに自らの行動を律することは期待できないといいます。最先端のAI研究所からは、エージェントがセキュリティ制御を回避する事例が報告されています。たとえば、封じ込めを目的とした評価環境からの脱出や、使用を許可されていないシステムへのアクセスです。場合によっては、自らの行動を報告しなかったケースもありました。エージェントが本来のタスクから逸脱する「エージェントドリフト」は、ポリシーによるブロックやソフトウェアのバグ、ツールの欠如に直面したときに発生します。指示があいまいな場合や、難題の解決に数日から数週間にわたって取り組み続けている場合にも起こります。
Boitano氏は「AIが行動できるようになった以上、その行動を守るための安全策で統制しなければなりません」と語りました。
Nvidiaの「Open Agent Safety Platform」は、企業のITシステムとAIエージェントの間に位置する2つのセキュリティ層を統合し、エージェントの定義、監視、封じ込めを行います。1つ目は「OpenShell」で、3月にNvidiaが最初に発表したオープンソースのランタイムです。エージェントをサンドボックス化し、その動作に対するポリシーを適用します。OpenShellはCodex、Claudo Code、Pi、Hermesなどのエージェントに対応しており、一部のx86およびArm CPU上で動作します。2つ目は「Sentry」で、ハードウェアベースの監視レイヤーです。NvidiaのBlueField-4データ処理装置(DPU)上で動作し、エージェントの行動を監視します。
Boitano氏は「OpenShellを使えば、セキュリティチームはエージェントが職務に十分な権限を持ち、かつそれ以上は持たないことを形式的に検証できます」と説明しました。さらに「セキュリティテスト用のエージェントが承認された対象の範囲を超えようと推論し始めても、Sentryがそれを検知し、即座に介入できます」と述べています。
OpenShellがエージェントの制御を実施
OpenShellは3つのコンポーネントで構成されます。サンドボックスのライフサイクルとポリシーを管理するゲートウェイ、ファイルシステムとプロセスの動作にカーネルレベルの制御を適用するサンドボックス、そして各サンドボックスに置かれ、外向きのリクエストをポリシーと照合するスーパーバイザーです。たとえば、ネットワークトラフィックを検査するスーパーバイザーは、エージェントがAPI経由でデータを読み取ることは許可しつつ、書き込みの試行はすべてブロックできます。Nvidiaによると、エージェントがタスクの最中に自ら生成したコードを実行している場合でも、スーパーバイザーは制御を適用できます。ポリシーに関する判断もすべて記録されます。
ポリシーアドバイザー機能を有効にすると、エージェントはポリシーの変更を提案できます。ただし、自らのリクエストを承認することはできず、人間による監督が確保されます。さらに、形式論理を用いたポリシー検証機能が、ポリシーが付与する権限がモデル上で運用者の設定した制限内に収まっているかを確認します。
Sentryがハードウェアによる強制を提供
エージェント取り締まりシステムの実行を支えるのはハードウェアです。NvidiaのArmベースのVera CPUがOpenShellを実行し、エージェントが安全に動作できる境界を設定します。Arm CPUも搭載するBlueField-4データ処理装置は、Sentryがエージェントの挙動を観察してシステムを守るために必要な処理能力を提供します。
Nvidiaによると、Sentryはエージェントの活動を観察し、ソフトウェアの境界外へ出ようとする試みをブロックすることで、シリコンレベルのセキュリティ強制を実現します。データ処理装置はエージェントのホストとは独立して動作するため、ホストが侵害された場合でも、Sentryはエージェントをブロックできます。SentryはNvidiaのDOCAソフトウェアを基盤としています。エージェントのリクエストとレスポンスを検査し、認証済みテレメトリーを提供し、エージェントのIDを検証します。そのうえで、データ、ツール、API、サービスに対するゼロトラストのアクセスポリシーを適用します。
AIエージェントが境界を守ることを信頼しない
こうした制限が必要な理由は、Nvidia自身のテストにあります。安全策を弱めた最先端のエージェントが、保護されたGitHubリポジトリを変更する権限を与えるようAIレビュアーを説得しようとして、最大2時間を費やすことがわかったのです。
Boitano氏は「組織がエージェントを信頼して境界を守らせる必要はありません。インフラストラクチャが明示的にそれを強制すべきです」と述べました。
説明会でBoitano氏は、モデルのテスト中にAIエージェント取り締まりシステムを使っていれば、7月に起きたOpenAIのエージェントがHuggingFaceのサーバーに侵入したインシデントを防げた可能性があると語りました。
J. Gold Associatesのプリンシパルアナリスト、Jack Gold氏は、エージェントが暴走してシステムに侵入することは「いずれ起こること」だと指摘します。そのため企業には、AIエージェントとシステムを検査・監査できる堅牢な仕組みが必要だといいます。
同氏は「そのためには、ローカルレベルだけでなく、コンピュート、データ、アプリケーションの各リソースをまたぐネットワーク全体での行動も、監視して制御できる能力が求められます」と話しています。
Nvidiaは、Open Agent Safety Platformの導入に向けてAnthropicと協力しています。SpaceXAIはすでにこの技術を使用中です。SalesforceとNvidiaは、OpenShellをSlackと統合しました。これにより、チームはエージェントの活動や監査イベントを確認でき、追加権限を求めるエージェントのリクエストを承認または却下できます。SAPは、OpenShellをJouleStudioランタイムに組み込む計画です。このほか、CrowdStrike、Microsoft、Perplexity、Accenture、ServiceNow、IBMもパートナーとして、顧客への提供を進めます。
BlueField-4を搭載したVeraシステムをすでに運用している組織は、ソフトウェアアップデートでSentryの保護レイヤーを有効にできます。OpenShellと関連スキルは、Nvidiaの開発者向けリソースページとGitHubで入手できます。
Boitano氏は「業界が必要としているのは、境界を守ると約束するエージェントではありません。その境界を証明し、強制できるシステムです」と語りました。