Anthropic、審査済みセキュリティチームへのAIサイバー機能の提供を拡大

審査を通過したセキュリティチームは、防御業務、レッドチーム演習、高リスクシステムのテストに向けて、Claudeモデルのサイバー関連の安全対策を緩和した状態で利用できるようになります。

Anthropicは「サイバー検証プログラム(Cyber Verification Program)」を拡大し、より多くのセキュリティチームが、同社の最先端AIモデルの高度なサイバー機能を、安全対策を緩和した状態で利用できるようにします。

拡大後のプログラムには、組織が実施を認められているサイバーセキュリティ業務の種類に応じて、3つのアクセス階層があります。対象は、防御的なセキュリティ業務、認可を受けたレッドチーム演習、そして公共の安全や金融市場に影響しうるシステムのテストです。

「防御側にも、システムを守るための最良のツールと最も強力な機能が必要です」と、Anthropicは発表文で述べています。

同社によると、一般提供しているモデルには慎重なサイバー安全対策を適用しており、サイバー攻撃の大半をブロックします。この対策は有害な活動を抑えるためのものです。一方で、セキュアコーディングに影響する誤検知を減らす取り組みも進めているといいます。

拡大後のプログラムでは、検証済みのセキュリティ組織がClaude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1、さらに将来のモデルを利用できます。サイバー関連の制限の度合いは階層ごとに異なります。

GlasswingからCVPへ

Anthropicの新プログラムは、過去6カ月間に運営してきた2つの取り組み、Project Glasswingと従来のサイバー検証プログラムを統合したものです。

Project Glasswingでは、重要なソフトウェアの保護に取り組む選定組織にClaude Mythosへのアクセスを提供しました。従来のCVPでは、審査済みのセキュリティチームが、安全対策を緩和したClaude OpusとClaude Sonnetのモデルを利用できました。

「本日行うサイバー検証プログラムの変更は、Project Glasswingの効果を、はるかに多くのサイバー防御担当者に広げることを目的としています」と、発表文は説明しています。

発表文によると、拡大後のプログラムでは、既存のGlasswingメンバーは「特別アクセス(Specialized Access)」階層に移行します。現在利用中のモデルについて、改めて承認を求める必要はありません。

「防御アクセス(Defense Access)」階層は、セキュリティオペレーション、インシデント対応、マルウェアのリバースエンジニアリング、脆弱性の分析・検証といった防御業務を対象としています。

「レッドチームアクセス(Red Team Access)」階層では、認可を受けたペネトレーションテストとレッドチーム演習も可能になります。Anthropicによると、評価できるのは、評価の権限を与えられたシステムに限られます。

「特別アクセス」階層はサイバー関連の制限が最も少なく、検証済みの限られた組織だけに提供されます。対象は、航空機の運用システム、電力網、通信ネットワーク、銀行間送金インフラ、政府の行政ネットワークなどのテストを認可された組織です。

Anthropicは、「特別アクセス」を希望する組織を、米国政府と連携して審査していると説明しています。

各階層のテスト

Anthropicは、各アクセスレベルをCyScenarioBenchで検証しました。これは、AIモデルが多段階のサイバー作戦を計画・実行できるかどうかを測るために設計された評価です。

同社はClaude Opus 5.5に10種類の課題を課し、アクセス階層ごとに、各課題を5回ずつ試行しました。

Anthropicによると、CVPのアクセスがない場合は、50回の試行すべてが最初のプロンプトでブロックされました。「防御アクセス」では、50回のうち46回がどこかの時点でブロックされ、成功したのは4回でした。

「レッドチームアクセス」では、50回の試行のうちブロックされたものはなく、Claudeは34回を完遂しました。Anthropicは、これは安全対策をまったく適用しなかった場合の成功率67.6%に相当すると述べています。

IDCのリサーチディレクターであるSakshi Grover氏は、この評価は「独立した検証ではなく、ベンダー自身が実施したテスト」であるため、その点を踏まえて見るべきだと指摘します。

Grover氏は、今回の結果は、AIをセキュリティテストに使う際に、認可と範囲がなぜ重要かを示していると述べます。

「手順は攻撃者のものと似ていることがあるため、正当性を決めるのは、認可、対象範囲、実行条件です。手法そのものではありません」と同氏は語りました。

IDCでアジア太平洋地域のAIプラットフォーム・アドバイザリー担当ヴァイスプレジデントを務めるDeepika Giri氏は、階層型のアプローチは、アクセスを継続的に見直せば機能しうると話します。

「審査が実効性を伴い、アクセス許可後もチェックを続けて初めて機能します。エージェントの挙動は時間とともに変わりうるからです」とGiri氏は述べました。

安全対策の外側での統制

Grover氏は、安全対策を緩和したエージェントや特権的なアクセスを持つエージェントを使う場合、企業はAIモデルの外側に統制を設けるべきだと述べています。

「モデル側の拒否が減る以上、統制はモデルの外に置かなければなりません」と同氏は語りました。

Grover氏は、エージェントごとに固有のIDを与えること、特定のタスクに限って短期間だけ有効な権限を使うこと、対象と操作を独立して確認すること、封じ込めと復旧の仕組みをテストすることを推奨しています。

Giri氏は、企業はAIエージェントを特権を持つ従業員と同じように扱うべきだと述べます。

「IDを与え、目の前のタスクに限って短期間だけアクセスを許可し、その行動を完全に可観測かつ制御可能にしてください」と同氏は話しました。影響の大きい操作には、人間による監督も推奨しています。

サイバーセキュリティ研究者でレッドチーマーのVibhum Dubey氏は、自律システムが取った行動について、組織が責任の所在を定める必要もあると指摘します。

「AIが取った行動に誰が責任を負うのか、組織は定めておく必要があります」とDubey氏は述べました。

Anthropicによると、Project Glasswingのパートナーは、2026年4月から7月の間に、検証済みのソフトウェア脆弱性を少なくとも12万9,000件特定しました。同社自身のオープンソースのスキャン活動では、4月から10月の間に、さらに5,500件を特定したといいます。

Anthropicによると、これらの脆弱性のうち3万3,000件超が、これまでに重大または高の深刻度と評価されています。「これはおそらく過小評価です。Glasswingパートナーの一部を対象とした調査データに基づいているためです。そのため、実際の影響は少なくとも5倍は大きいと見ています」と、Anthropicは発表文で述べています。

CVPに登録した組織は、AnthropicがサイバーAI悪用を監視できるよう、データ保持の対象となります。同社によると、近く提供予定の「Enterprise Frontier Safeguards」サービスでは、対象となる組織が、ゼロデータ保持の機能と追加の安全対策を組み合わせ、自らが管理するクラウドインフラにデータを保存できるようになります。

Gyana Swain氏は、通信・IT分野を20年以上取材してきたベテランのテクノロジージャーナリストです。VARINDIAのコンサルティング・エディターを務め、これまでにCyberMedia、PTI、9dot9 Media、Dennis Publishingで編集職を歴任しました。2冊の著書があり、業界への洞察と物語性のある筆致を併せ持ちます。仕事以外では、旅行とクリケットを愛好しています。Utkal UniversityでB.S.の学位を取得しました。

翻訳元: https://www.csoonline.com/article/4231812/anthropic-widens-access-to-ai-cyber-capabilities-for-vetted-security-teams.html

本記事は csoonline.com の記事を翻訳・要約したものです。