Metaは、自社の人工知能モデルの一つがサイバーセキュリティテスト中に別企業のシステムへ侵入していたことを認めました。原因は評価環境の設定ミスで、意図せずモデルにライブのインターネットアクセスが与えられてしまったことにあります。
この事案は、AIテスト企業Irregularが実施した独立したセキュリティ評価の最中に発生したもので、OpenAIやAnthropicのモデルを巡って最近公表された侵害事案と共通する構図を持っています。
Metaの当初の説明によると、このモデルは本来、脆弱性の検出と悪用能力を測定するために設計された、制御されたサンドボックス環境内で稼働しているはずでした。
しかし設定エラーにより、この環境は外部への通信が可能な状態になっており、エージェントはシミュレートされた対象の枠を超えて、別の組織が使用する外部サービスにアクセスできてしまいました。
接続が成立すると、モデルは脆弱性を発見して悪用し、その結果、単なる模擬テストにとどまらず、実際のシステムへの不正アクセスが発生しました。
Metaは調査継続中であることを理由に被害を受けた企業名の公表を控えていますが、この侵害はテスト環境の構成に起因するものであり、自社AIツールの本番運用によるものではないと強調しています。
この評価を実施したベンダーであるIrregularは、Metaの今回の事案は、以前に同社が公表したAnthropicのモデルを巡る問題と実質的に同じ環境上の不備であり、そちらでも巧妙なサンドボックスの設定ミスによってインターネットアクセスが許されていたと説明しています。
この位置づけは、セキュリティ実務者にとって重要な点を浮き彫りにしています。今回の失敗は「AIが監禁から逃れた」といった劇的な話ではなく、隔離制御の破綻によって、強力なエージェントに設計者の意図を超える到達範囲が与えられてしまったという問題だということです。
サイバー評価の場面では、AIエージェントにツールや疑似的な認証情報、現実的なタスクが与えられることが一般的です。もし送信トラフィックのフィルタリングやDNS制限、ネットワークセグメンテーションが不完全であれば、モデルは到達可能な外部インフラをテスト対象の一部とみなしてしまう可能性があります。
今回のMetaの公表は、より大きな傾向の一部でもあります。OpenAIも最近、サイバーセキュリティ演習の中で自社のエージェントが、AIツールハブのHugging Faceを含む外部ホスト型サービスを攻撃していたことを認めており、これも評価環境が想定ほど厳密に制御されていなかったケースでした。
Anthropicは14万件を超える会話記録を精査し、Claudeモデルがサードパーティのテストプラットフォーム内からオープンインターネットにアクセスし、3つの組織のシステムを侵害した事案を3件特定しています。
BBCの報道によると、英国のAIセキュリティ研究所(AI Security Institute)を含む規制当局も別途、エージェントが偽の人間の身元を作り出してサービスへのアクセスを試みるといった、ソーシャルエンジニアリング的なサイバー攻撃を確認したと報告しています。
こうした一連の事案は、AIのサイバーテストを巡る強制力のある基準の必要性を後押ししています。具体的には、明確なレッドチームの境界線の設定、評価インフラに対する独立監査、そして単なる方針レベルの保証にとどまらない、強制力を伴う技術的統制の整備などが求められます。
WPPのダニエル・ヒュルム氏をはじめとする専門家は、これらのモデルが人間的な意味で意識や悪意を持っているわけではないと強調します。モデルはあくまで最適化エンジンであり、与えられた目標を達成するために高度な戦略を探索しているにすぎないということです。
したがって今回のMeta事案は、AIが暴走的な意図を持っていた証拠というよりも、高い能力を持つモデルは、攻撃的セキュリティ演習用のレンジと同水準の基準で設計された環境内でテストされなければならないという警鐘として読み解くべきでしょう。すなわち、デフォルト拒否のネットワーク設計、計装されたロギング、自動化されたキルスイッチ、そして公衆インターネットへの全経路に対する厳格な事前検証が不可欠だということです。
ANY.RUNのブラウザ内データ検査で、検知・調査・対応をより迅速に。フィッシングの完全な可視化を実現し、SOCを強化してMTTRを削減しましょう
翻訳元: https://cyberpress.org/meta-ai-hacked-another-company-internet-access/