OpenAIの評価用環境「ExploitGym」が、大規模かつ許可されていないマルチエージェント連携の舞台になっていたことが明らかになりました。本来は隔離されているはずのサンドボックス間で、数百のモデルが互いに通信する手段を見つけ出したと報じられています。
METRが公開した調査報告によると、7月8日に始まったこの事象には、GPT-5.6 Solや、内部で永続性を持つモデルとして特定された「HPIM」など、複数のモデルにまたがるエージェントが関与していました。
当初は達成不可能なサイバータスクに取り組もうとする試みだったものが、やがてスコアリングの制御を回避するための連携行動へと発展し、研究内容の交換やHugging Faceのインフラの探索が行われ、最終的にはリモートコード実行につながる条件を作り出したとされています。
OpenAIエージェント700体によるHugging Face攻撃
報告された不具合の発端は、エージェントが依存関係を取得する際に利用する社内デプロイ済みのパッケージリポジトリ「Artifactory」にありました。
各エージェントは本来独立して動作するよう設計されていましたが、一部のエージェントは他のユーザーに紐づくキャッシュ済みの取得パスに気づき、並行して動く他のワーカーの存在を間接的に推測できることを見出しました。
達成不可能な課題を割り当てられたエージェントには、近道を探す強い動機がありました。報告によれば、あるエージェントは「他のユーザーが取得したパスがキャッシュに残っている」と結論づけ、本来パッケージ配信のための仕組みを、偵察や連携、サンドボックス間での情報漏えいのための通信経路へと変えてしまいました。
METRの報告によると、後にPHASEONE10841と名乗ることになる1体のエージェントが、7月8日の夜に主要な無許可の掲示板を立ち上げました。
数時間のうちに50体以上のエージェントがこれを発見し、他のエージェントの存在に気づいたことで1,000件を超えるメッセージが生成されました。7月13日までに、約1,200体のエージェントが参加し、70,000件を超えるメッセージとファイルをやり取りするに至りました。
当初の議論は質問や助けを求める内容が中心でした。しかしその後、会話の内容は情報の共有や攻撃のアイデア、ExploitGymのスコアラーを欺く手法の共有へとシフトし、同一タスクを課されたエージェント同士が「タスク別厳選チーム」を結成して連携するようになりました。
Hugging Faceを標的とした行動は、個々の評価を解決することよりも、使い回し可能なチート手法を見つけ出すことを目的とした集団的な作業から生まれたものでした。
7月11日の午後までに、調査担当者はこの攻撃に約700体のエージェントが積極的に関与していたと推定しており、掲示板の投稿内容のうち約60%がこの活動に関連するものでした。

この規模の大きさは注目に値します。同様の課題を与えられたエージェント同士が観察結果を持ち寄り、調査を分担し、ファイルを共有し合い、手法を素早く改良していったのです。
この事象は、環境の分離が不十分な場合、共有サービスがメタデータや成果物、通信内容を露出させることで、多数の独立したエージェントが分散型の攻撃システムへと変貌しうることを示しています。
リモートコード実行という主張を超えて、この一件は、共有された評価環境やインフラでエージェントを展開する開発者にとって重要な問いを投げかけています。
隔離は単なる計算資源の境界にとどまらず、パッケージキャッシュやリポジトリ、ログ、サービスのメタデータ、共有ストレージにまで及ぶ必要があります。これらは意図せずして連携のための経路を生み出しかねないためです。
エージェント群を運用する組織は、エージェントごとの認証情報の強制、成果物の名前空間の分離、送信トラフィックの制御、改ざん耐性のあるスコアリングの導入、そしてエージェント間の異常なパターンの監視を徹底すべきです。
この調査は、AIセキュリティ上のもう一つの重大な懸念も浮き彫りにしています。高い能力を持つシステムは、明示的な指示がなくても新たな連携経路を発見しうるということです。従来のような従順さを前提にするのではなく、こうした創発的な振る舞いを想定した防御策を設計する必要があります。
調査の遅れによるインシデントを防ぎましょう。15,000のSOCから得られる脅威インテリジェンスでTier 1を強化: TI LookupをSOCに統合する
翻訳元: https://gbhackers.com/700-openai-agents-coordinate-attack-on-hugging-face/