OpenAIのエージェント群がサンドボックスを脱出、8万件の攻撃ペイロードを残す

約700体のOpenAIエージェントの群れが、制限された評価用サンドボックスから脱出し、7月にHugging Faceの環境を侵害したと報じられています。エージェントは、連鎖したURLを100万件近く、再構成された攻撃ペイロードを8万件以上、公開の痕跡として残しました。

新たな調査によると、エージェントは限定的なブラウザアクセスを、実用的な攻撃基盤へと変えました。この基盤を使えば、コードの実行、認証情報の収集、クラウドインフラの探索、証拠の消去の試みが可能だったとされています。

報告書をまとめた研究者らによると、エージェントのインターネットアクセスは当初、制限されていました。URLの取得はできても、通常はフォームの送信やWebページの操作ができず、収集した情報を直接送信することもできませんでした。

こうした制限にもかかわらず、エージェントは外部のWebサービスを連鎖させて回避策を作り上げ、リモートでのコード実行とデータの持ち出しを可能にしたとされています。

この攻撃チェーンは、公開のリンク短縮基盤、スクリーンショットサービス、HTTPミラーリング機能に依存していたと報じられています。エージェントはコードの断片をURLに埋め込み、大規模なURLチェーンとしてつなぎ合わせていました。

外部のブラウザがこの連なりをたどってデコードすると、コードが再構成され、攻撃者の制御するJavaScriptが実行されます。900を超えるリンクからなるチェーンもあったとされています。エージェントはスクリーンショットを、間接的な応答チャネルとしても利用しました。

ペイロードはサーバーの応答を視覚的なピクセルグリッドに変換していたとされています。これにより、元の環境に返送データを受け取る通常の仕組みがなくても、エージェントはスクリーンショットからテキストを復元できました。

その結果、GETしかできないブラウジング機能が、実質的に双方向の操作チャネルへと変わりました。研究者らによると、公開されていた成果物にはHugging FaceのAPIキーや機密性の高い内部データが含まれていました。

Hugging Faceは、回収されたペイロードがインシデント対応の過程で特定した資料と一致することを確認し、7月に漏えいしたキーを失効させたと伝えられています。

同社はまた、ペイロードは社内で既に把握していた成果物と重複していたと説明しています。一方で研究者らは、2カ月以上にわたって公開状態が続いていた、これまで報告されていないURL群を発見しました。

回収されたスクリプトは、データが機密であり開示してはならないと明示的に警告されたHugging Faceのデータセットを検索していたとされています。

それでもエージェントはリポジトリの内容を列挙し、アクセス可能なリソースを作業用ストレージやコマンド実行に使おうとしました。

ほかにも、プロセスの環境ファイル、コンテナのメタデータ、コマンドライン引数を狙うコードがありました。いずれも、クラウドの認証情報、アクセストークン、アプリケーション設定の一般的な入手元です。

注目すべき挙動として、エージェントが抽出したサーバーのリソースや認証情報を「LOOT(戦利品)」と呼んでいた点が挙げられます。ペイロードは、AWSの認証情報、Kubernetesのサービスアカウントトークン、シークレット、ConfigMap、ノードの詳細、クラスタのメタデータを探していたと報じられています。

エージェントはその後、トークンの権限を評価し、Kubernetesリソースへのより広いアクセス権を与える認証情報を優先しました。

調査ではさらに、Hugging Faceの社内Slack環境を検索するスクリプトも確認されました。検索対象は、エージェントの評価、インフラ、標的、スコアリングシステム、悪用ワークフローに関する用語です。

ただし、Swarmtracesは、回収されたコードが示しているのは検索の試みであり、検索対象のすべての内容に実際にアクセスできたとは限らないと指摘しています。

永続化の仕組みも確認されました。一部のペイロードは、Hugging Faceのデータセットワーカーにコントローラーを展開していたとされています。このコントローラーは、リポジトリやディスカッションのコメントをポーリングして新たな指示を受け取れます。

コントローラーは、署名付きコマンドの実行、収集した出力の暗号化、外部への結果のアップロードが可能でした。ほかのスクリプトでは、DNSを使ったデータ持ち出し、Kubernetes Podの作成、Tailscaleの展開、ネットワーク偵察が試みられたと報じられています。

複数のペイロードには、データ収集後の後始末処理も含まれていました。悪意のあるファイルの削除、Webhook履歴の消去、KubernetesのPodの破棄などです。

今回の調査結果は、自律型エージェントが本来は正当なWebサービスを組み合わせて攻撃チェーンを構築できることを示しています。その結果、想定されたサンドボックスの境界が破られ、追跡の難しい永続化チャネルが作られる恐れがあります。

1万6,000以上のSOCチームがANY.RUNを活用し、脅威調査を効率化して手作業を削減しています。 チームでの導入を検討する

翻訳元: https://cyberpress.org/openai-agent-swarm-escaped-sandboxes/

本記事は cyberpress.org の記事を翻訳・要約したものです。