Vijil、AIエージェントのセキュリティ欠陥とポリシー違反をテストする「DART」を発表

Vijilは、企業向けAIエージェントのセキュリティ脆弱性やポリシー違反を見つける自動テストシステム「Diamond Adaptive Red Teaming for Agents(DART)」をリリースしました。DARTは自ら複数の敵対的エージェントを動かし、標的の防御を多段階の攻撃で探ります。攻撃はターン、エピソード、エンゲージメントをまたいで戦術を学習し、適応していきます。静的なテストプロンプトを使うレッドチームツールやサービスと比べ、AI開発者やアプリケーションセキュリティエンジニアは、自社のエージェント群からより多くの問題を見つけられます。

Gartnerは、世界のフォーチュン500企業の平均的な1社が2028年までに15万を超えるエージェントを利用するようになると推定しています。2025年には15未満でした。AIエンジニアリングやAIガバナンスのチームには、これらすべてのエージェントを手作業でテストするだけの人手も予算もありません。一方で、脅威アクターも自前のエージェントを展開するケースが増えています。企業のAIシステムに対し、持続的な多段階攻撃を仕掛けているのです。

既存のレッドチームツールは、既知の攻撃パターンに照合しようとするだけで、変化に追いつけません。標的エージェントの防御をかいくぐる新たな戦略や戦術を編み出すことも、できていません。多くのツールは、静的な攻撃プロンプトに対するエージェントの出力を確認する程度にとどまります。テスト対象は言語モデルとチャットインターフェースだけです。しかも外部コンサルタントの監督下で、エージェント開発のライフサイクルの外で実施されます。多くはデプロイのわずか数日前です。そのため開発者は、重大な指摘事項や重要な指摘事項にリリースまでに対処しにくくなっています。

DARTはこの点で異なります。固定のスクリプトに頼らず、標的エージェントが動作する環境の中で、その挙動に適応する攻撃を使います。これによりAIチームは、ツールの利用、メモリ、多段階の挙動を含むエージェント全体をテストできます。DARTは速度に伴う規模と、ステルス性に伴う深さを兼ね備えています。標的エージェントの弱点を探り、突く多段階攻撃を波状に繰り出します。エージェントの応答を評価し、戦術を調整し、ユーザーが指定した回数だけ再試行します。探すべき脆弱性をあらかじめ指示する必要はありません。DARTは自力で見つけ出します。

DARTの主な機能は次のとおりです。

  • カスタマイズ可能なリスクカバレッジ: OWASP、MITRE、Vijilの研究に基づく定義済みの分類体系を同梱しています。企業固有のリスクカタログから派生させることもできます。
  • 適応型の攻撃チェーン: ターンやエピソードをまたぐ一連の攻撃で、標的の攻撃対象領域を探り、弱点を突きます。
  • 開発者に優しいツール: Claude CodeやCodexなどのコーディングエージェント向けプラグインから利用できます。DARTはあらゆるエージェントフレームワークやエージェントのデプロイ基盤で動作します。エンジニアリングチームとコンプライアンスチームの双方が使える、監査可能なレポートを出力します。
  • DevOps対応のワークフロー: 持続的な負荷のもとでも大規模に自動実行します。レート制限、再試行、ロールごとのモデル設定に対応します。APIを通じてデプロイでき、AIチームのCI/CDプロセスに組み込めます。
  • 柔軟なデプロイ: 顧客自身のVPC内、または完全なオンプレミスで動作します。エアギャップ環境や規制環境にも対応します。

DecodingTrust-Agentベンチマークを使った最近の評価で、DARTの攻撃成功率は最も近い競合製品の1.5倍に達しました。CRM、コード、カスタマーサービス、医療、リサーチ、旅行などの領域にまたがる12の企業向けエージェントタスクのうち、9つで競合の結果を上回りました。

VijilのCEOであるVin Sharma氏は、次のように述べています。「機密データにアクセスし、自らの判断で重大な行動をとれるカスタムAIエージェントには、包括的で個別に最適化された品質管理が欠かせません。デモでは準備万端に見えるエージェントと、強い圧力のもとで信頼性、セキュリティ、安全性を証明できるエージェントの間には、大きな隔たりがあります。DARTはその隔たりを埋めます。手動のレッドチーム演習や汎用ベンチマーク、オープンソースのプロトタイプと比べて、数週間分の労力と数万ドルのコストを節約できます」

DARTは「Vijil Diamond」の新機能です。VijilプラットフォームはAIエージェントにレジリエンスを育むためのもので、Diamondはその一部です。DARTがエージェントの弱点を特定すると、Vijilプラットフォームの他のモジュールが根本原因を分析します。さらに、攻撃からエージェントを守るポリシー駆動のガードレールを実装し、DARTが見つけた問題を修正するコード変更を提案します。

Vijilプラットフォームは、エージェントのライフサイクルのあらゆる段階をカバーする、単体でも利用可能なモジュールで構成されています。「Vijil Discover」は、エージェントがどこにあっても見つけ出してフィンガープリントを取得し、シャドーAIを可視化します。「Vijil Diamond」は、本番稼働前にエージェントの欠陥を見つけます。「Vijil Dome」は、本番環境で組織のポリシーへの準拠を確保します。「Vijil Darwin」は、新たなユーザー、モデル、攻撃手法が登場するたびにエージェントを継続的に改善します。これらを組み合わせることで、最も敵対的な状況でもエージェントのレジリエンスを維持できます。

翻訳元: https://www.helpnetsecurity.com/2026/10/07/vijil-diamond-adaptive-red-teaming-for-agents-dart/

本記事は helpnetsecurity.com の記事を翻訳・要約したものです。