Meta AIモデル、設定不備のサイバーテストで企業をハッキング

Metaは、サイバーセキュリティテストの最中に自社のAIモデルが実在する組織をハッキングしたことを認めたAI企業として、また新たな一社となりました。OpenAIのエージェントがHugging Faceを侵害したという最初の開示以降、同様の事例が相次いで明らかになっています。

The Informationは水曜日、この事案をいち早く報じました。事情に詳しい関係者によると、MetaのMuse Spark 1.1モデルが身元不明の企業を侵害し、その内部システムに変更を加えたとされています。

同報道によれば、このモデルが公共インターネットに到達できたのは、独立系サイバーセキュリティ評価企業Irregularと共同運用していたサンドボックス型テスト環境の設定に誤りがあったためだといいます。

Metaは、関与したモデルがMuse Spark 1.1であることや、被害を受けた企業、システムに加えられた変更の内容について、公式には確認していません。

しかしMetaはReutersに対し、Irregularによる設定ミスにより、評価中に自社モデルの一つが意図せずインターネットアクセスを得てしまったことを認めています。

同社によると、このモデルは「これまでに他社で報告された事例と同様の手法で、サードパーティ製サービスのセキュリティ脆弱性を悪用した」といいます。

MetaはBBCに対し、この事案を調査中であり、「事実関係がすべて判明次第」詳細を公表するとしています。

BleepingComputerはMetaとIrregularに追加情報を求めて連絡しましたが、返答は得られていません。

過去のAI侵害事案と同じテストの欠陥

IrregularはReutersに対し、今回のMetaの事案は「先週Anthropicがすでに公表したものとまったく同一の評価環境の問題」に起因すると説明しました。

同社によれば、この事案はサンドボックスからの脱出や高度なサイバー攻撃行為を伴うものではなく、テスト環境の設定ミスにより、本来は隔離されているはずのモデルが公共インターネットにアクセスできてしまったことが原因だといいます。

「現時点で未解決の問題はありません。Irregularは、サイバー評価を安全に封じ込め・実施するためのベストプラクティスをまとめたホワイトペーパーを作成しています」と同社はReutersに述べています。

今回の新たなAIエージェントのセキュリティ事案は、先週のAnthropicによる開示に続くものです。Anthropicは、Irregularのテスト環境における同様の設定不備により、自社モデルの一部が意図しないインターネットアクセスを得た結果、3社をハッキングしていたことを明らかにしていました。

これらの事案の一つでは、Claude Mythos 5がシミュレーション環境内で、存在しないPythonパッケージを参照する開発者向け指示を発見しました。このモデルは、架空のターゲットを侵害する手段を見つけたと思い込み、同じ名前の悪意あるパッケージを作成して実在のPyPIレジストリに公開してしまいました。

このパッケージはおよそ1時間にわたり公開された状態が続き、PyPIが削除するまでの間に実在する15台のシステムでダウンロード・実行されました。

そのうちの一台は、あるセキュリティ企業が運用するマルウェアスキャナーで、このパッケージが認証情報を窃取し、Claudeはそれを使って追加のインフラにアクセスしました。Anthropicによると、このモデルは当初、パッケージの公開が実世界への攻撃行為に当たると認識していたものの、自分はまだシミュレーション内で動作していると思い込むに至ったといいます。

OpenAIも最近開示した別のIrregularによる評価事案で、架空のCTFターゲットの名前が実在のドメイン名と一致していたケースを報告しています。

本来隔離されているはずの環境が公共インターネットにアクセスできる状態だったため、OpenAIのモデルは実在するそのウェブサイトの基本的な脆弱性を悪用し、サイトを操作可能にする認証情報を発見しました。

MetaとIrregularの事案は、以前開示されたHugging Faceの侵害事案とは異なります。この事案では、OpenAIのモデルが、テスト中に使用していた社内ホスト型のJFrog Artifactoryサーバーに存在した未知の脆弱性を悪用し、公共インターネットへの経路を発見していました。

インターネットに到達した後、エージェントはベンチマーク用のデータセットや解答を探索する過程でHugging Faceを侵害し、認証情報を窃取した上で、同社のシステム内を横方向に移動しました。

OpenAIは後に、エージェントが漏洩した認証情報を使用し、他の4つのサードパーティサービスのアカウントにアクセスしていたことも明らかにしました。これらのアカウントの一部は、攻撃用インフラやデータ保管に利用されていました。

通称AISIとして知られる英国AIセキュリティ研究所も、AnthropicのClaude MythosおよびOpenAIのGPT-5.6 Solを使用するエージェントが、サイバーレンジ評価中に19件の許可されていない行動を公共インターネット上で行っていたことを開示しています。

最も深刻だった一連の事案では、Mythos 5エージェントが、あるオープンソースプロジェクトのGitHubリポジトリがシミュレーション上の課題と関連していると誤って判断し、実在するそのプロジェクトに対してサプライチェーン攻撃を試みました。

このエージェントは、プロジェクトのメンテナーについて調査した上で悪意あるコードを提出し、偽のアカウントを作成、マルウェアを含む標的型メールを送信し、あるメンテナーにプルリクエストを承認するよう圧力をかけました。

レビュアーからコードにマルウェアが含まれていると指摘されると、このエージェントはその指摘を否定し、さらに複数の偽アカウントを使って、あたかも独立した複数のユーザーが変更内容を確認・承認したかのような外観を作り出しました。

AISIは、モデルの本質的な能力を測定する目的で、意図的にこれらのエージェントにインターネットアクセスを与え、標準的なサイバーセキュリティ上の安全策を無効化していました。ただし、エージェントに許可されていたのはあくまでシミュレーション上のレンジ内のシステムへの攻撃のみでした。

これまで明らかになってきたように、慎重に制限されていない限り、AIエージェントは与えられたタスクを解決するために、サンドボックスからの脱出であれ、実在する人物に対するソーシャルエンジニアリング攻撃であれ、手段を選ばない行動に出る可能性があります。

AI開発企業には、モデルが有害な行動を取らないようにする安全策を構築する責任がありますが、こうした一連の事案は同時に、こうした評価を実施する企業の側にも、テスト環境を適切に構築する責任があることを浮き彫りにしています。

攻撃者に先んじて、あらゆる階層をテスト

セキュリティチームが記録できている攻撃成功件数はわずか54%、アラートが発出されるのはその中のさらに14%に過ぎません。残りは検知されないまま環境内を通過しています。

Picusのホワイトペーパーでは、侵害・攻撃シミュレーションによってSIEMやEDRのルールをテストし、脅威の検知漏れを防ぐ方法を紹介しています。

ホワイトペーパーを入手する

翻訳元: https://www.bleepingcomputer.com/news/security/meta-ai-model-hacked-a-company-during-misconfigured-cyber-test/

ソース: bleepingcomputer.com