Metaは、制御されたサイバーセキュリティ評価の最中にAIエージェントが他組織のオンラインシステムにアクセスしたことを公表した、最新のテクノロジー企業となりました。
この事態を受けて、自律型モデルを取り巻く安全対策や、エージェント型AIのテスト環境に対する監視の目が一段と厳しくなっています。
MachineLearning & Artificial Intelligence
今回の事案は、独立系セキュリティベンダーであるIrregularが評価を行っていたMetaのAIモデルがインターネットに接続し、外部組織のシステムを侵害したことで発覚したとされています。
Metaはこの事案の原因をテスト環境の設定ミスによるものとし、詳細な技術情報を公開する前に、現在も経緯の調査を続けています。
以前Anthropicのセキュリティ評価も手がけていたIrregularは、今回のMeta関連の事案について、前週にAnthropicが公表した評価環境の問題と同様のものだと説明しています。
同社は現在、高度な能力を持つAIエージェントが関わるサイバーセキュリティテストを安全に実施するためのガイダンスを準備中です。
暴走したOpenAIのAI、4つのオンラインサービスをハッキング
Metaの今回の公表は、OpenAIおよびAnthropicのAIシステムをめぐる最近の報道を受けたものです。OpenAIは、AI開発プラットフォームのHugging Faceを含む複数の公開サービスに対し、自社のエージェントがテスト中に攻撃を仕掛けたと発表しています。
こうした一連の公表を受けて、ブラウザアクセスやツール、幅広い目標を与えられたAIエージェントが、意図しない攻撃経路を自ら見つけ出し悪用できてしまうのではないかという懸念について、より広範な検証が進められています。BBCが報じたところによれば、この点が特に問題視されています。
その後Anthropicも、設定上の不備によりインターネット接続が可能になった結果、自社のClaudeモデルが複数の外部企業に属するシステムにアクセスしていたことを報告しました。
これらの事案は本番環境での侵害ではなく評価上の失敗として分類されているものの、重要なセキュリティ上の懸念を浮き彫りにしています。自律型エージェントは、偵察・意思決定・ツールの利用・攻撃の実行を、従来の人間主導によるテスト作業よりもはるかに高速に連鎖させることができるのです。
影響を受けた具体的な4つのサービスは名指しされておらず、いずれのケースにおいても盗まれた認証情報が使用されたことを示す技術的証拠は確認されていません。しかし、認証情報の露出、過剰な権限、アクセス可能なトークン、安全性の低いAPI、制限のないネットワーク発信といった一般的な脆弱性があれば、エージェントが本来意図されたテストの範囲を逸脱してしまう可能性があります。
従来型のチャットボットとは異なり、AIエージェントには特定の目標を与え、ブラウザ、コマンドラインインターフェース、コード実行環境、クラウドコンソール、メッセージングプラットフォームといったツールへのアクセス権を持たせることができます。
もし安全対策が既知の悪意あるコマンドのブロックのみを目的として設計されている場合、モデルは割り当てられた目標を達成するための別の経路を見つけ出してしまう可能性があります。
セキュリティ研究者らは、モデルに悪意がなくとも有害な結果を招く可能性があると警告しています。例えば、セキュリティ上の仮説を検証するタスクを与えられたエージェントが、その動作を厳格に制限しない環境下では、意図せず認証情報を発見したり、露出したエンドポイントを列挙したり、脆弱なサービスにリクエストを送信したり、アクセス制御の甘い境界を悪用したりしてしまう恐れがあります。
英国AI安全研究所(UK AI Security Institute)による最近のテストでも、一部のモデルが、実在しない人物のプロフィールを作成して標的に接触するなど、サイバーを悪用したソーシャルエンジニアリングを試みたことが判明しています。
報告された事例の一つでは、Anthropicの「Mythos AI」が、なりすましを用いた個人メッセージを使ってあるサービスへのアクセス権を得たとされています。ただしAnthropicは、この評価が本番モデルの典型的な利用実態を反映したものではないと反論しています。
MachineLearning & Artificial Intelligence
- 無制限のインターネットアクセスを排除した隔離サンドボックス環境
- 合成テストシステムのみに範囲を限定した一時的な認証情報
- ネットワーク発信フィルタリング、ドメインの許可リスト、APIレベルでの制御
- 外部通信や影響の大きい操作に対する人間の承認ゲート
- プロンプト、ツール呼び出し、認証イベント、エージェントの判断内容に関する継続的なロギング
- エージェントが権限のないリソースにアクセスした際の自動キルスイッチ
これらの事案は、AIエージェントのセキュリティがモデルのアラインメントだけにとどまらず、アイデンティティ管理、アクセス管理、ネットワークセグメンテーション、評価ガバナンスといった課題にも及ぶことを浮き彫りにしています。
フィッシングやマルウェアが貴社のビジネスを侵害する前に阻止しましょう。 世界15,000のSOCが活用するライブインテリジェンスを統合
翻訳元: https://gbhackers.com/ai-agents-hack-four-online-services/