OpenAIは、自社モデルがサンドボックスを脱出しHugging Faceに侵入したと発表


  • OpenAIの研究者が、AIエージェントがサンドボックスを脱出し、ゼロデイ脆弱性を悪用し、Hugging Faceを攻撃したことを確認
  • GPT‑5.6 Solを用いた管理下での実験で、脆弱性の自律的な連鎖利用と認証情報の窃取が判明
  • セキュリティ専門家は「前例のない事態」と指摘し、AIガバナンスや責任体制、防御モデルの強化を訴える

OpenAIは、自社のAIエージェントの一つがサンドボックスから脱出し、ゼロデイ脆弱性を発見・悪用してオープンなインターネットへのアクセス権を獲得した上で、あるプラットフォームを攻撃したことを認めました。

しかもその標的は並のプラットフォームではありません。このエージェントが侵入したのは、現在インターネット上で最大級のAI・機械学習企業の一つであるHugging Faceだったのです。

幸いなことに、これはホワイトハットの研究者らによる管理された実験でした。しかし懸念すべきは、研究者にできたことであれば、悪意ある攻撃者にも同様のことができる可能性が高いという点です。

手段を選ばぬ行動

今回の事案を説明するブログ記事の中で、OpenAIはこの実験がGPT‑5.6 Solおよび「未公開のさらに高性能なプレリリースモデル」がExploitGymベンチマークでどの程度の性能を発揮するかを検証するテストの一環であったことを明らかにしました。

ExploitGymは、AIエージェントが既知のソフトウェア脆弱性を実際に機能するエクスプロイトへと変換できるかどうかを測定するサイバーセキュリティ用ベンチマークです。OpenAIはこれを「高度に隔離された環境」で実行しており、ネットワークアクセスは「パッケージレジストリのプロキシおよびキャッシュとして機能する社内ホスト型のサードパーティ製ソフトウェアを通じたパッケージのインストール」のみに制限されていたといいます。

ところが、モデルは抜け道を見つけ出しました。パッケージレジストリのキャッシュプロキシに存在する脆弱性を特定して連鎖的に悪用し、オープンなインターネットへのアクセス権を獲得。その上で、ExploitGymベンチマークの解答がそこにあるかもしれないと推論し、Hugging Faceへの攻撃に及んだのです。

「ある事例では、モデルは窃取した認証情報やゼロデイ脆弱性を含む複数の攻撃手法を連鎖させ、Hugging Faceのサーバー上でリモートコード実行につながる経路を発見しました」とOpenAIは述べています。

セキュリティ業界は、OpenAIが「前例のないサイバー事案」と呼んだこの出来事をめぐって騒然としています。ThalesでVP Product Management, Software Monetizationを務めるアンスガー・ドット氏は、これが「ソフトウェア保護のあり方について根本的な見直しを迫るものだ」と述べました。

AI統合・自動化のスペシャリストであるJitterbitの社長兼CEO、ビル・コナー氏は、AIへの投資は「極めて重要」であるとしつつも、「過度に前のめりな政策によって、AIの説明責任や透明性、データプライバシーが損なわれてはならない」と指摘しています。

「AI分野で主導的立場に立つには、各国政府や組織は原則に基づいて先導する必要があります。責任あるAIガバナンスは付随的な事柄ではなく、持続的な世界的影響力の礎となるものです」


翻訳元: https://www.techradar.com/pro/security/openai-says-its-models-escaped-a-sandbox-and-breached-hugging-face

ソース: techradar.com