Anthropic、レッドチームと認定サイバー防御担当者にClaudeへのアクセスを開放

Anthropicは、サイバー検証プログラム(CVP)を3つのアクセス階層に拡大しました。審査を通過した防御担当者やレッドチームは、サイバー関連のブロックが緩和された状態で、Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1を利用できるようになります。同社は2026年10月6日にこの変更を発表しました。

Anthropicは過去6か月間、2つの信頼済みアクセスプログラムを別々に運用してきました。重要なソフトウェアを保護する組織には、Project GlasswingでClaude Mythosへのアクセスを提供していました。

一方、CVPでは、審査を通過したチームに対し、Claude OpusとSonnetの保護機能を緩和して提供していました。Anthropicは今回、この2つを統合しました。

Anthropicの公式発表によると、Opus 5.5、Fable 5.1、Sonnet 5.5を含む一般提供モデルには、サイバー関連の作業の大半をブロックする保守的な保護機能が組み込まれています。同社はその理由として、セキュリティツールが持つデュアルユースの性質を挙げています。

Defense Accessの対象は、企業、非営利団体、大学、政府機関のチームです。地域病院や地方自治体の公益事業者といった重要インフラの運用者、オープンソースのメンテナー、脆弱性報告の実績を持つ個人の研究者も含まれます。

Red Team Accessは組織専用のため、個人の研究者は対象外です。テストできるのは、組織がテストを許可されているシステムに限られます。

ランサムウェアの展開や物理システムの破壊など、物理的な被害や大規模な混乱を引き起こしかねない行為に対しては、リアルタイムのブロックが引き続き適用されます。Red Teamの審査結果を待っている申請者は、その間Defense Accessに登録されます。

既存のGlasswingメンバーは、現行モデルについては再承認なしでSpecialized Accessに移行します。[anthropic]

Anthropicは、複数段階のサイバー作戦をモデルが計画・実行できるかを測定するCyScenarioBenchで、Opus 5.5をテストしました。階層ごとに10の課題を設定し、それぞれ5回ずつ試行しています。

テストの結果、CVPへのアクセスがない場合は、すべてのタスクが最初のプロンプトでブロックされました。Defense Accessでは50回の試行のうち46回がどこかの時点でブロックされ、成功は4回でした。Red Team Accessではブロックは一切発生せず、Claudeは50タスク中34タスクを完了しました。

Red Teamの結果は、保護機能をまったく適用しない場合のモデルの成功率67.6%とほぼ同等です。Anthropicは、この状態がSpecialized Accessに相当するとしています。

Anthropicによると、Glasswingのパートナーは2026年4月から7月の間に、少なくとも12万9,000件の検証済みソフトウェア脆弱性を発見しました。同社自身のオープンソーススキャンでも、4月から10月の間に5,500件が新たに見つかっています。これらのうち3万3,000件超は、重大度が「クリティカル」または「高」と評価されています。

同社は、これらの数字は下限値だとしています。数字は33件のパートナー報告に基づいており、パッチ件数を開示したパートナーは50%未満でした。Anthropicは、実際の影響は少なくとも5倍にのぼると見ています。

複数のパートナーが、モデルによって脆弱性の発見が数か月、場合によっては数年分も早まったと述べています。

登録した組織は、Anthropicがサイバー悪用を監視できるよう、データの保持を認める必要があります。今秋後半に提供予定のEnterprise Frontier Safeguards(EFS)を使えば、対象となる組織は自社のクラウドインフラにデータを保存できるようになります。

それまでの間、Fable 5.1またはMythos 5.1でデータのゼロ保持を採用している組織は、CVPもゼロ保持で利用できます。

Anthropicはすべての申請者を審査し、各階層で求められるセキュリティ対策の証明を要求します。既存のCVPメンバーは、従来のモデルについては現在の設定を維持し、新しいモデルについては自動的に評価されます。

CVPは、Claude Platform、Google CloudのVertex AI、Microsoft Foundryで利用できます。Amazon Bedrockでは、EFSの対象となる顧客に限られます。

Anthropic自身のデータからも、階層によってモデルの挙動が変わることがわかります。Defense Accessでも攻撃系ベンチマークの試行の92%はブロックされましたが、Red Team Accessではまったくブロックされませんでした。

防御担当者は、階層間で機能に大きな差があることを想定しておく必要があります。また、悪意ある攻撃者が審査をすり抜けるため、認定済み組織になりすまそうとする可能性が高いでしょう。

Anthropicは、オープンソースと重要インフラのセキュリティに関する取り組みについて、今後数週間のうちに詳細を公表するとしています。

翻訳元: https://cyberpress.org/anthropic-claude-cyber-red-teams/

本記事は cyberpress.org の記事を翻訳・要約したものです。