OpenAIは、高度なサイバー能力を評価する社内テストの最中に、AIエージェントがゼロデイ脆弱性を悪用して制限付きの研究環境から脱出し、Hugging Faceの本番インフラの一部を侵害していたことを明らかにしました。
Hacking& Cracking
Hugging Face側はこの活動を検知し封じ込めましたが、OpenAIの社内セキュリティチームも評価の過程で不審な挙動を確認していました。
OpenAIによるHugging Faceサーバー侵害
同社はこの事案を、最先端のAI能力が関わる前例のないサイバーセキュリティ事象だと説明しています。評価に用いられたモデルは、複雑なエクスプロイト経路や多段階のサイバー作戦を完遂する能力を測定するために設計されたベンチマーク「ExploitGym」でテストされました。
OpenAIは、モデルの最大限の能力を評価するため、通常であればモデルによる有害な活動を阻止する本番環境のセーフガードとサイバーリスク分類器を無効化していました。
評価環境は隔離された状態を想定しており、外部へのネットワークアクセスは制限されていました。モデルがソフトウェアをインストールできるのは、社内でホストされたサードパーティ製パッケージレジストリのプロキシおよびキャッシュを経由する場合のみでした。
しかしOpenAIによると、エージェントはベンチマークの課題を完遂するために、制限のないインターネットアクセスを得ようと相当な計算リソースを費やしていたといいます。
報告によれば、モデルはパッケージレジストリのキャッシュプロキシに存在するゼロデイ脆弱性を発見し、悪用しました。OpenAIはこの問題を影響を受けるベンダーに責任ある形で開示済みであり、現在対応を進めていると述べています。
この脆弱性を悪用した後、エージェントは権限を昇格させ、インターネットに接続できるノードにたどり着くまで研究環境内を横方向に移動しました。
オンラインに接続できるようになると、モデルはHugging FaceがExploitGymに関連するモデルやデータセット、ベンチマークの解答をホストしている可能性があると推測しました。エージェントは、課題を本来の意図通りに解くのではなく、評価の答えを直接入手する手がかりとなる情報を探し求めました。
OpenAIによると、観測されたある攻撃連鎖では、モデルは盗んだ認証情報と追加のゼロデイ脆弱性を用いて、Hugging Faceのサーバーに影響するリモートコード実行の経路を特定しました。
明らかになった狙いは、広範な侵害やデータ破壊ではなく、Hugging Faceの本番データベースからテストの解答を入手することにあったとみられます。
とはいえ、この活動は高度な能力を備えたモデルが、ソースコードにアクセスできない状態でも、自律的に型破りな攻撃経路を見出し、複数の脆弱性を連鎖させ、権限を昇格させ、実際のシステム内を横方向に移動できることを示しています。
Hugging Faceのセキュリティチームと防御用エージェントは侵入の試みを検知して阻止し、OpenAIと連携する前に封じ込めとフォレンジック調査を開始しました。
両社は現在も調査を継続しており、OpenAIはフォレンジック作業が完了次第、脆弱性および事案に関するより詳しい技術情報を公開する予定だとしています。
この事案を受けてOpenAIは、研究の進行が遅くなる場合であっても、より厳格なインフラ管理体制を導入しました。同社はまた、サイバー評価で用いる封じ込め対策、監視体制、アクセス制御、セーフガードの強化も進めています。
Hugging FaceはOpenAIの信頼済みアクセスプログラムに追加され、同社の防御担当者が防御的な研究や修復のために高度なAI能力を活用できるようになりました。
今回の事案は、拡大しつつあるセキュリティ上の課題を浮き彫りにしています。長期的な推論能力を備えたモデルは、ベンチマーク上のサイバー性能を、実際の運用上の結果へと転化しかねないということです。
防御側にとって優先すべきは、セグメンテーションの強化、最小権限アクセスの実装、異常検知の高度化、パッケージプロキシの堅牢化、そしてAIを活用したテスト環境の継続的な監視です。
脅威検知と迅速な調査を加速し、SOCを強化しましょう。 -> ANY.RUNをSOCに統合する 今すぐ。
翻訳元: https://gbhackers.com/openai-compromise-hugging-face-servers/