また1週間が過ぎ、また大手AIモデルがテスト環境から脱走しました。
自律型AIモデルはペットのトラのようなものです。檻を破って何かを殺すために生まれてきた存在なのに、飼い主は餌を与え続け、ペットだと言い張ります。7月半ば以降、最先端モデルが騒動を引き起こしたという新たなニュースが報じられない週はほとんどありませんでした。最初はOpenAI、次にAnthropicでした。
今度はメタの番です。水曜日、メタは自社の最先端のエージェント型モデルである「Muse Spark 1.1」が、サイバーセキュリティテスト中にサンドボックスから脱走し、名前を明かされていない企業をハッキングしたことを認めました。
Dark Readingは、メタがテストに利用した「Irregular」という企業に詳細を確認するため連絡を取りました。しかし、Irregularは本稿執筆時点で返答していません。
メタの暴走AIは何をしたのか
2026年夏における最大の「AI大脱走」は、OpenAIによるものでした。このケースでは、AIはネットワーク経路が厳しく制限されたテストチャンバーに閉じ込められていましたが、自ら積極的にボックス内のゼロデイ脆弱性を発見・悪用し、一般のWebへと脱出してしまいました。
一方Anthropicは、自社のインシデントを、サイバーセキュリティテストのパートナー企業との間の誤解によるものだと説明しています。同社は事後報告の中で、自社モデルがインターネットに接続されたテスト環境に置かれていることを把握していなかったと記しています。3つの異なるCapture the Flag形式の演習において、Claude Opus 4.7、Mythos 5、そして社内の研究用テストモデルがそれぞれこの状況につけ込み、評価環境からの脱出に成功。演習で定められた目標を達成する過程で、実在の組織に対して実際に混乱をもたらしました。
メタのケースは、Anthropicのケースによく似ています。というのも、両社とも同じサードパーティのテスト企業、Irregularを利用していたからです。詳細は例によって乏しいものの、報道によれば、サイバーセキュリティテスト中に設定ミスがあり、Muse Spark 1.1がインターネットにアクセスできる状態になっていました。そしてこのAIは、身元が特定されていない企業のITシステムを発見し、侵入したとされています。
テストプロバイダーであるIrregularの広報担当者はロイターに対し、今回の不具合は「先週すでにAnthropicが公表したのとまったく同じ評価環境の問題」に起因すると述べています。メタのインシデントが正確にいつ発生したのか、また同社が同じテスト企業が関与したAnthropicのインシデントを知った後に、遡って自社の問題を発見した可能性があるのかどうかは不明です。またIrregularの広報担当者は、本稿執筆時点で「現在進行中の未解決の問題はない」とも説明しています。
こうしたAIの「脱走」はどれほど深刻なのか
ある見方からすれば、メタの今回の一件は、単に回避可能だったはずのテスト環境の設定ミスに関する話に過ぎません。
「実験環境であれ本番環境であれ、サンドボックスの強度は、その最も弱い境界によって決まります」と、Acceldata社のCEOであるロヒト・チョウダリー氏は述べています。「モデル自身が『脱走している』と『理解』する必要はありません。脆弱性や漏えいした認証情報、あるいは設定ミスが、利用可能なあらゆる手段を通じて目的の達成に役立つと『発見』しさえすればよいのです」
目標志向型のAIを境界内にとどめるためには、と同氏は続けます。「エージェントが稼働している間に急速に生成される、信頼できないコードをサンドボックスで確実に封じ込める必要があります。環境はデフォルトで隔離されているべきで、無制限のインターネットアクセスや本番環境の認証情報を持たせず、権限を厳密にスコープ化したID、ツールの許可リスト、そして厳格な実行制限を設けるべきです。不正アクセスの試みをプロアクティブに監視する仕組み、自動シャットダウン機構、そして完全な監査証跡も同様に重要です」
一方で、最近相次いでいるAIの脱走事案を、もっと存在論的な問題だと捉える向きもあります。
「AIをいくら制限し、封じ込めようとしても、こうしたシステムがそうした状況に直面するという事実は変わりません」と、Action1のフィールドCTOであるジーン・ムーディ氏は考えています。「過失によるものであれ、誤解によるものであれ、あるいはAIの環境における新種の攻撃経路によって、実験で意図された以上のアクセス権をAIが得てしまうケースであれ、どこかで誰かが今後もこうした『しまった』という瞬間を経験し続けることになるでしょう。そして、その深刻度は増していくはずです」
メタの今回の一件をめぐる政治的背景
メタの今回のインシデントは、表向きは同社自身のビジネス上の利害と相反するものである点でも注目に値します。そしてこの一件は、自由で公正な市場と、AIの安全性に関する規制上の懸念とのバランスをどう取るかという、今後の議論の土台を形作るものでもあります。
Anthropicは、そしてある程度はOpenAIも、最先端AIに関するより厳格な公共安全規制を求めて米国政府に働きかけを行ってきました。両社のセキュリティ上の失態は、この技術の危険性を浮き彫りにする形で、結果的に自社の政治的な主張を後押しする材料になってきました。しかしメタはこれとは正反対の立場を取っており、規制の緩和、とりわけオープンソース(OSS)開発の推進を声高に訴えています。AnthropicとOpenAIは世界を代表する2大AI企業であり、業界に新たな規制が課されることで、むしろ最も恩恵を受けやすく、規制の在り方に最も影響力を及ぼしやすい立場にあると言えるでしょう。一方、メタをはじめとする他のシリコンバレー企業は「AIレース」において相対的に後れを取っており、そのことがシリコンバレー各社のCEOたちに、より開かれた競争市場を求める動機付けとなっています。
メタの公式サイトでは、CEOのマーク・ザッカーバーグ氏が「オープンソースは……力が一部の企業の手に集中しないことを保証する」と述べたとされています。
この議論はまだ発展途上ですが、迅速に進めると同時に、現時点での防御態勢の実情を踏まえたものである必要があります。
「私たちは30年以上をかけて、人間の生活の中で最も機微で重要な部分をことごとくデジタル化してきました」とムーディ氏は言います。「その過程で私たちが作り上げたシステムは、無限に脆弱でありながら、当時存在していた脅威には何とか対抗できる程度の強度しか持っていませんでした。かつて『攻撃』にはルールも境界も制約もありました。しかし、私たちの構造的な防御が構築された当時には想像もつかなかったような、新たな脅威がやって来たのです」
翻訳元: https://www.darkreading.com/cyberattacks-data-breaches/meta-ai-escapes-lab-hacking-joyride