Anthropic、審査済みの防御担当者向けにClaudeのガードレールを緩和

Anthropicは、「Project Glasswing」を既存の「Cyber Verification Program(CVP)」に統合し、階層型の拡張プログラムを新設します。審査を通過したセキュリティ専門家は、段階的に異なる安全対策のもとで、高度なAIのサイバー能力を利用できるようになります。ただし、この安全対策が悪用を防げるかどうかについては、専門家の間でも見方が分かれています。

「Project Glasswing」は、厳しい審査を通過した企業グループによる取り組みです。Amazon、Apple、Microsoft、Google、Linux Foundation、JP Morgan Chase、NVIDAなど、40を超える組織が参加しています。参加組織は、Anthropicで最も高度なサイバー特化型大規模言語モデル(LLM)「Claude Mythos」を利用できます。Anthropicは、この最先端技術が攻撃者に悪用されるおそれがあるデュアルユース性を考慮し、より広範な提供を見送りました。同社によると、Mythosは脆弱性の発見を大幅に加速させます。

CVPはこれまで、「Claude Opus」と「Sonnet」の2モデルを対象に、単一のアクセスレベルで運用してきました。Project Glasswingの統合により、一部の組織には3段階のサイバー能力が付与されます。

「どの階層でも、Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1、そして今後登場する新モデルなど、当社の最も高性能なモデルを利用できます」。Anthropicが10月6日に発表した内容にはこう記されています。拡張されたCVPは、2つのプログラムを継続的な単一のアクセスシステムにまとめるものです。セキュリティ専門家は、自らの業務の種類とリスクレベルに応じて、アクセスを申請できるようになります。

ブログ記事によると、今年4月から7月の間に、モデルを利用したパートナーは少なくとも12万9,000件の検証済みソフトウェア脆弱性を発見しました。オープンソースのスキャンでは、4月から10月の間に、さらに5,500件の検証済み脆弱性が見つかっています。同社はブログ記事で「検証済みの脆弱性のうち、これまでに3万3,000件以上が『重大』または『高』と評価されています」と述べています。

SOCRadarの最高情報セキュリティ責任者(CISO)であるEnsar Seker氏はDark Readingの取材に対し、12万9,000件という数字はAIが脆弱性の発見にかかる期間を短縮できることを示すと述べました。そのうえで、より重要な指標は、悪用可能な弱点が露出したままになる期間をAIがどれだけ短縮できるかだと指摘します。

「発見が加速しても修復が追いつかなければ、組織は安全になるどころか、未対応の案件を積み上げてしまうおそれがあります」と同氏は言います。「AIは防御側に先手を打つ機会を与えてくれます。この機会を優位性に変えるには、より迅速で確実な修復が欠かせません」

Claudeへのアクセスは3階層

最も対象が広い階層は「Defense Access」です。発表によると、「セキュリティオペレーションセンター(SOC)やインシデント対応の業務、マルウェアのリバースエンジニアリング、脆弱性の分析と検証」といった防御業務向けに設計されています。

Anthropicは、幅広い正規のセキュリティ関連組織が対象になると見込んでいます。具体的には、企業のセキュリティチーム、非営利団体、大学、自ら所有または保守するシステムを守る政府機関、重要インフラ事業者、小規模なセキュリティ企業、オープンソースのメンテナー、そして「脆弱性報告の実績がある個人研究者」です。

次の階層は「Red Team Access」で、レッドチームによる攻撃的テストを実施する、認可を受けた官民のペネトレーションテスト担当者向けです。

Anthropicによると、「この階層の組織が実施できるのは、テストの認可を受けたシステムに対する敵対的テストに限られます。対象には重要産業のITシステムも含まれます」。さらに、「物理的な被害や大規模な混乱を招きかねない行為には、引き続きリアルタイムでブロックがかかります。たとえば、ランサムウェアの展開、物理システムの破壊、リスクの高い安全システムへのペネトレーションテストなどです」としています。

最も限定的な階層が「Specialized Access」で、利用方法に対するサイバー面の制限が最も少なくなります。これはProject Glasswingと同様に、人々の生活や市場に影響しうるシステムのテストを認可された、検証済みの組織に限定されます。対象となるのは、電力網、航空機の運航システム、通信ネットワーク、銀行間送金インフラ、政府の行政ネットワークなどです。既存のProject Glasswing参加組織はこの最上位の階層に移行します。今後の申請については、米国政府とともに詳細な審査を行います。

一般公開されているモデルは、引き続きソフトウェア開発や重要度の低いセキュリティ業務に利用できます。

Claudeの悪用対策にどう影響するのか

AIモデルの悪用は、ここ数か月間ずっと大きな関心事となっています。世界は、AIエージェントの暴走や、攻撃者による大規模言語モデル(LLM)の悪用にどう対処すべきか、模索を続けています。

Seker氏は、Anthropicの階層型モデルは悪用を減らす合理的な方法だとしつつ、それだけで悪用を防げたことの証明にはならないと警告します。

「防御的な分析、認可を受けたレッドチーム活動、安全性が極めて重要なシステムのテストを分けるのは、それぞれのリスクが異なると認識しているからです。難しいのは、認可を継続的に検証することです」と同氏は言います。「検証済みの組織であっても、アカウントが侵害されたり、悪意ある内部関係者がいたり、正規のユーザーが承認された業務の範囲外で操作したりする可能性があります」

Anthropicは、掲載時点までにDark Readingからのコメント要請に回答していません。

翻訳元: https://www.darkreading.com/vulnerabilities-threats/anthropic-vetted-defenders-claude-guardrails

本記事は darkreading.com の記事を翻訳・要約したものです。