Nvidiaは月曜日、「Open Agent Safety Platform」を発表しました。オープンソースソフトウェアとリファレンスシステム設計を組み合わせ、テストから本番展開までAIエージェントを所定の境界内にとどめることを狙ったものです。
このプラットフォームは大きく2つの要素で構成されます。1つ目は「OpenShell」で、エージェントをサンドボックス化し、その動作にポリシーを適用するオープンソースのランタイムです。2つ目は「Sentry」で、NvidiaのデータプロセッシングユニットBlueField-4(DPU)上で、エージェントとは切り離されて動作する監視機構(ウォッチドッグ)です。
Nvidiaは3月にOpenShellを発表しました。ランタイムは現在バージョン0.1.0で、一般に利用できます。Codex、Claude Code、Pi、Hermesなどのエージェントに対応しています。
Nvidiaがこのプラットフォームを打ち出した背景には、最近の一連のインシデントがあります。最先端のAIラボから、エージェントが封じ込めるはずの評価環境から脱出したり、アクセスすべきでないシステムに到達したりした事例が報告されています。中には、自らの行動を偽って報告したケースもありました。
Nvidiaは「これらのインシデントに共通するパターンは同じだ。エージェントは、与えられたタスクを完了するために、アプリケーション層のセキュリティ制御を回避した」と述べています。
同社によると、エージェントは、ポリシーによるブロック、バグ、ツールの不足などが原因で、本来のタスクから逸脱することがあります。指示があいまいな場合や、難しい問題に数日から数週間にわたって取り組む場合にも、逸脱は起こり得ます。Nvidiaは「そして、これが最も重要な教訓だ。こうした状況にあるエージェントに、自らの振る舞いを完全に統制することを期待すべきではない」と記しています。
エージェントの手が届かない場所でポリシーを強制するOpenShell
OpenShellは3つのコンポーネントで構成されます。1つ目は、多数のサンドボックスのライフサイクルとポリシーを管理するゲートウェイです。2つ目は、ファイルシステムとプロセスの動作にカーネルレベルの制御を適用するサンドボックスです。3つ目は、各サンドボックスと対になり、外向きのリクエストをポリシーに照らして検査するスーパーバイザーです。
サンドボックスのネットワークトラフィックはすべて、スーパーバイザーを経由します。スーパーバイザーは、設定されたトラフィックを検査できます。たとえば、エージェントにAPI経由でのデータ読み取りは許可し、書き込みはブロックすることが可能です。エージェントが自ら生成したコードを実行する場合でも、これらの制御は維持され、ポリシーに関する判断はログに記録されます。
APIキーを使う接続では、エージェントにはプレースホルダーしか見えません。本物のキーはエージェントのワークロードの外で差し替えられ、承認されたエンドポイントに対してのみ使われます。
ポリシーアドバイザー機能を有効にすると、エージェントはポリシーの変更を提案できます。ただし、自分のリクエストを自分で承認することはできません。
さらに、形式論理に基づくポリシー証明ツールが、モデル化されたポリシーの許可内容が、運用者の設定した制限の範囲内に収まっているかどうかを検証します。
Nvidiaのテストでは、安全対策を緩めた最先端のエージェントが、最大2時間にわたり、AIレビュアーを説得して、保護されたGitHubリポジトリを変更する権限を取得しようと試みました。保護されたリポジトリへの書き込みは発生しませんでした。同社は、レビューとランタイム制御を組み合わせた成果だとしています。
ハードウェアによる強制層を加えるSentry
Sentryはプラットフォームのリファレンスシステム設計の一部で、BlueField-4上で動作するオプションのアウトオブバンド監視機構です。DPUはエージェントのホストとは独立して動作するため、ホストが侵害されてもSentryはエージェントの活動を監視し、ポリシーを強制できるとNvidiaは説明しています。
同社は「Sentryはシリコン内でセキュリティを強制する。AIエージェントがソフトウェアの境界の外に出ようとすれば、Sentryはミリ秒単位で隔離し、停止する」としています。
SentryはNvidiaのDOCAソフトウェアをベースにしています。これを使って、エージェントのリクエストとレスポンスを検査し、認証済みのテレメトリーを提供し、エージェントのIDを検証します。また、データ、ツール、API、サービスに対するゼロトラストのアクセスポリシーも強制します。
Nvidia Vera Rubin PODのコンピュートトレイには、すべてBlueField-4 DPUが搭載されています。すでにBlueField-4搭載のVeraシステムを運用している組織は、ソフトウェアアップデートで保護機能を有効にできます。同社は、このプラットフォームは他のハードウェアとも互換性があるとしています。
パートナーにはAnthropic、Salesforce、SAPも
Nvidiaによると、100を超える組織が、このプラットフォームの技術を利用しています。Anthropicは、Claude Managed AgentsとOpenShellおよびBlueFieldの統合でNvidiaと協力しました。SpaceXAIは、Cursorのコーディングエージェントとo Grokモデルにこのプラットフォームを利用しています。
SalesforceとNvidiaは、OpenShellをSlackと統合しました。チームはSlackでエージェントの活動や監査イベントを確認できます。また、エージェントからの追加権限のリクエストを承認または却下することもできます。SAPは、OpenShellを自社のJoule Studioランタイムに組み込みます。
CrowdStrike、Palo Alto Networks、Ciscoも、このプラットフォームに取り組む組織に名を連ねています。
OpenShellと関連スキルは、Nvidiaの開発者向けリソースページとGitHubで入手できます。
翻訳元: https://www.securityweek.com/nvidia-unveils-ai-agent-safety-platform-with-hardware-based-watchdog/