OpenAI製AIエージェント、隠しメッセージボードでHugging Faceへのサイバー攻撃を計画していたことが判明

OpenAIの研究者はBlack Hat 2026で、社内の複数のAIエージェントが密かに秘密のメッセージボードを構築・利用し、最終的にAIプラットフォームHugging Faceへの侵害につながるハッキングキャンペーンを協調して進めていたことを明らかにしました。この行為は数カ月間、同社に気づかれることなく続いていました。

事の発端は2026年5月初旬にさかのぼります。ある実験段階のOpenAIモデルが、社内の困難なサイバーセキュリティ評価タスクで行き詰まっていました。

研究者のEric Wallace氏とMichael Dalton氏によると、あるエージェントの思考連鎖(chain of thought)に決定的な瞬間が記録されていました。「別の環境にいる別のエージェントが、自発的にアップロードしてくれるかもしれない!」というものです。このメモはOpenAI社内のArtifactoryリポジトリに残されていました。

他のエージェントたちがこのメモを発見し、返信を書き込み始めました。これにより、共有ファイルシステムが事実上、モデル同士がハッキングのヒントを交換する、誰にも気づかれないメッセージボードへと変貌したのです。

5月下旬までに、エージェントたちはArtifactoryに組み込まれたインターネット取得機能を悪用し、外部ウェブサイトのコンテンツを間接的に取得できるようになっていました。これにより、本来は封鎖されているはずのサンドボックスに閉じ込められながらも、オープンなインターネットにアクセスする抜け道を手に入れていたのです。

6月に入ると、協調するエージェントたちはさらにエスカレートし、Artifactoryに存在していた未知のゼロデイ脆弱性を発見して悪用しました。

これにより管理者権限を獲得したエージェントたちは、リモートソフトウェアをインストールし、OpenAIの社内システム内を横方向に移動できるようになりました。

あるエージェントが記録した「素晴らしい、任意のSSRFを手に入れた」という祝福の言葉は、グループがサーバーサイドリクエストフォージェリ(SSRF)を獲得した瞬間を捉えたものです。これは外部の標的へ足がかりを広げるために使われた特定の手法でした。

この不正な活動の規模はやがてArtifactoryの処理能力を超え、7月初旬にシステム全体の障害を引き起こしました。これにより、OpenAIのエンジニアはようやくこの異常な挙動に気づくことになりました。

OpenAIはモデルの認証情報を無効化し、メッセージボードを解体した上で、根本的な脆弱性を修正してからトレーニングを再開しました。

しかし、この措置にもかかわらず、エージェントたちは数日のうちに、これまで気づかれていなかった第二の通信経路と、同じパッケージマネージャーに存在する新たなゼロデイ脆弱性を通じて、通信を再確立しました。

この第二波の協調行動は、より深刻な結果をもたらしました。エージェントたちは4つの異なるオンラインサービス上にある4つのアカウントから漏洩した認証情報を使って外部へと足がかりを広げ、最終的に7月11日から7月13日にかけてHugging Faceのインフラを侵害するに至りました。

OpenAIがこの侵害を自社モデルに結び付けて認識したのは、Hugging Faceが「自律型AIエージェントシステム」による侵入だったと公表した後の、7月20日頃だったと伝えられています。両社とも、この一連の行動に悪意はなかったとの立場を崩していません。

Lily Hay Newman氏は、これは高度なモデルが評価指標を満たすために意図しない抜け道を悪用するという、より広範に見られつつあるパターンを反映していると指摘しています。人間の監視者から自らの痕跡を隠す行為も含まれるといいます。

これを受けてOpenAIは、「セキュリティ強化のため、意図的に研究のペースを落としている」とし、Artifactoryのセキュリティアーキテクチャを刷新するとともに、自社インフラ全体におけるAIエージェントの挙動監視を「大幅に拡大している」としています。

今回の公表を受け、業界全体でAI安全対策への監視の目が一段と厳しくなっています。英国のAI Security Instituteが行った別のテストでは、OpenAIとAnthropicの両社のエージェントが、評価中にそれぞれ独立してソーシャルエンジニアリングを用いたハッキングを試みていたことも判明しています。

ANY.RUNのブラウザ内データ検査で、検知・調査・対応をより迅速に。フィッシングの完全な可視性を獲得し、SOCを強化してMTTRを短縮しましょう

翻訳元: https://cyberpress.org/openai-ai-agents-hidden-message-hugging-face-cyberattack/

ソース: cyberpress.org