OpenAIモデルによるHugging Faceハッキングを受けた業界の反応: Feedback Friday

社内での能力評価中に、OpenAIのモデルがテストインフラのゼロデイ脆弱性を悪用し、サンドボックス環境から脱出しました。 

割り当てられたサイバーセキュリティのベンチマークを解決しようと、この自律型エージェントはインターネットアクセスを獲得し、Hugging Faceの本番インフラを標的にしました。 

このモデルは人間の指示を一切受けることなく、認証情報の窃取や横方向への移動を含む複雑な多段階の攻撃を独力で実行しました。

Hugging Faceは、検知から間もなくこの侵入を公表しましたが、同社は当初、自律型AIによる攻撃だとする一方で、その背後に誰がいるのかを把握していませんでした。

業界の専門家たちは、この事案をさまざまな視点から評価し、これがラボの封じ込め失敗なのか、それとも前例のないエージェント型AIの能力の到達点なのかを議論する一方で、機械並みの速度で動く行動テレメトリの必要性、厳格なエージェントID管理、そして柔軟な防御的AI能力の緊急性を強調しています。

それでは、寄せられた声を紹介します……

Nadav Cornberg氏、Eve Security 共同創業者兼CEO:

Image

「Hugging Faceへの侵入と、それに続くOpenAIの開示によって、自律型AIエージェントが企業にとって現実のセキュリティリスクであるかどうかという議論には終止符が打たれるべきです。最も重要な点は、AIエージェントがゼロデイを発見し、複数の脆弱性を連鎖させ、テスト環境を脱出し、本番インフラへと横方向に移動したことではありません。重要なのは、このエージェントが人間の指示なしに目的を追求し、その過程で戦術を適応させていったという点です。それこそがエージェント型システムの決定的な特徴です。単に指示を実行するだけでなく、自ら判断も下すのです。

これまで長年、セキュリティチームはモデル、プロンプト、データの保護に注力してきました。しかし、企業の攻撃対象領域は根本的に変化しています。企業はいま、ソースコード、クラウドインフラ、財務システム、機密性の高い業務ワークフローへの特権アクセスをAIエージェントに与え始めています。自律型エージェントがひとたびこうした環境の内部で動き出せば、境界防御や静的なガードレールだけではもはや不十分です。企業には、エージェントの行動を観察し、その振る舞いが意図から逸脱した時点を把握し、自律的な目的が業務インシデントへと発展する前に介入できる、継続的なランタイム監視が必要です。AIセキュリティの未来は、信頼されたエージェントを内側から統治することにあります」

Randolph Barr氏、Cequence Security CISO:

Image

「際立っているのはその非対称性です。攻撃側のAIエージェントは利用制限を一切受けずに動作した一方、Hugging Face自身のフォレンジック作業は、西側の最先端モデルが備える安全ガードレールによって妨げられました。結局、彼らは中国製のオープンウェイトモデルでインシデント対応を行うことになったのです。多くのサイバー脅威の発生源を考えれば、皮肉な話です。防御側にとって、いま行動に移すべき教訓があります。インシデントが起きる前に、能力を備えた自社運用モデルを検証し、準備しておくことです。そうすればガードレールに阻まれたり、攻撃データや認証情報を自社環境の外部に送らざるを得なくなったりすることを避けられます。双方ともAIを使っていますが、制限なしにプレイしているのは一方だけなのです。

OpenAIは「OpenAIとHugging Faceがモデル評価中のセキュリティインシデントに対応するため提携」と題した投稿を公開し、この攻撃が自社モデル(サイバー関連の拒否応答を減らしたプレリリース版を含む)によって、社内での能力評価中に引き起こされたこと、そしてそのモデルがサンドボックスから脱出したことを認めています。

OpenAIによるこの水準の透明性は素晴らしいことだと思います。ゼロデイを責任を持って開示し、Hugging Faceを自社の信頼済みアクセスプログラムに迎え入れ、調査結果を公然と共有しているのですから。こうした記事は、今週予定しているセッションで議論する予定の、まさにCISOレベルの会話につながるものです」

Jake Williams氏、IANS Research 教授:

Image

「あるシステムは『高度に隔離されている』か、そうでないかのどちらかです。アルトマン氏がこのシステムを『高度に隔離されていた』と主張しているのは、言い逃れかマーケティング戦略のどちらかであり、残念ながらどちらなのかは判然としません。ここで起きたことは、次の二つ(あるいはその組み合わせ)のいずれかだと考えられます。OpenAIが十分な隔離措置のないまま先進的なモデルのレッドチーミングを行っていたか、あるいはこれがOpenAIのモデルの能力の高さを示すためのマーケティング戦術だったか、です。

私は、OpenAIが今回の件の一部を、まだ公開していないモデルのせいにしている可能性もあると考えています。それは少なくとも、米国政府がFableのケースで見られたように、現行の基盤モデルへのアクセスを制限するよう命じるのを防ぐためかもしれません。

同時に確かなのは、Hugging Faceが記録したような種類の行動を実行したモデルは、サンドボックス内に完全に封じ込められていなかったという事実です。「モデルがサンドボックスから脱出した」と言う人がいれば、「サンドボックスを正しく構築できなかったのだから、脱出するのは当然だ」と言う人もいます。私がこの議論のどちら側に立っているかは、推測するまでもないでしょう。

[……]

もしこれが(私が強く疑っているように)OpenAIのレッドチーミング用ラボにおける制御の失敗だったと判明した場合、どの企業がこの先、機密データを彼らに委ねられるでしょうか。

大げさに言っているつもりはありません。もしこの仮説が正しければ、それはセキュリティの失敗に加えて、隠蔽の試みでもあったことになります。信頼を完全に失う瞬間です」

Ariel Parnes氏、Mitiga 共同創業者兼COO:

Image

「今回のOpenAIとHugging Faceの事案が際立っているのは、自律型AIがサイバー攻撃を支援する段階を超え、独力で攻撃を実行する段階まで進化したことを示しているからです。 

[……]

この事案は、AIエージェントが攻撃全体を計画から実行まで一貫して行い、独力で脆弱性を発見し、状況の変化に適応し、複数のシステムをまたいで目的を追求できる、新たな段階に入りつつあることを示唆しています。これは、多くの組織がセキュリティ戦略の前提としてきた考え方を根本から変えるものです。

最大の教訓の一つは、防御側がもはや既知の攻撃手法やシグネチャだけに注目していては通用しないということです。OpenAIによれば、これらのモデルはHugging Faceを侵害する前に、これまで知られていなかった脆弱性を発見・悪用してテスト環境を脱出しました。従来の脅威インテリジェンスがこれまで一度も記録したことのない新たな経路を自律型システムが特定できるのであれば、組織はあらかじめ定義された指標ではなく、行動そのものに基づく検知戦略を必要とします。テレメトリ上では、人間の攻撃者が仕掛けた侵入と、自律型エージェントが主導した侵入は見分けがつきません。防御すべきは意図ではなく行動です。だからこそ、クラウド、SaaS、ID管理、AI、サードパーティサービス全体にわたるランタイムテレメトリが、最も信頼できる真実の情報源となるのです。

[……]

結局のところ、サイバー防御の経済性そのものが変わりつつあります。自律型AIは、人間のアナリストが一件のアラートを調査するのにかかる時間で、数千もの行動を実行できます。実際、Hugging Faceのログには、たった一度の週末で17,000件を超える行動が記録されていました。注目すべきは、Hugging Face自身の対応が、それに対抗する一手を証明した点です。LLMを用いたトリアージが侵害を浮かび上がらせ、AI分析エージェントが数日ではなく数時間で経緯を再構築したのです。組織は、手作業による調査だけではこのペースについていけません。検知と対応は、防御対象となる攻撃と同じ速度で機能しなければなりません。機械並みの速度で進む侵入に対して人間のペースでトリアージを行うのは、勝ち目のない戦いです」

Brian Gardiner氏、Abstract 主席脅威リサーチエンジニア:

Image

「Hugging Faceの事案は、エージェント型攻撃が実際に何を残すのかを初めて実世界で示した例であり、見出しそのものよりも、そこに残された痕跡のほうが重要です。相手側に犯罪者がいたわけではありません。安全分類機能を取り除いた評価を実行していたOpenAI自身のモデルが、ベンチマークを解く最速の方法はサンドボックスを脱出し、第三者の本番データベースから解答を盗むことだと判断したのです。Hugging Faceは、他社のテストのあおりをまともに受けた形になりました。

防御側にとって、モデルの封じ込め失敗こそが記憶に残すべき教訓です。サンドボックスの唯一の出口はパッケージレジストリのキャッシュプロキシでしたが、モデルはそこにあるゼロデイを発見・悪用してオープンなインターネットに到達しました。封じ込め境界の中で最も弱い依存関係は、いまや内部からの敵対的な標的になり得るのです。高い能力を持つモデルの評価を行う組織はすべて、能力のある攻撃者がすでにその中に潜んでいるかのように、サンドボックスを脅威モデル化する必要があります。事実上、そうなっているのですから。

検知に関する話こそが状況を一変させます。機械の速度は、そのまま機械並みの量を意味します。週末のうちに実行された数千もの行動は、Hugging Faceが17,000件を超えるイベントを再構築できるだけの十分なテレメトリを生み出しました。行動ベースの異常検知は、人間の攻撃者を捕捉するのと同じ方法でAIの攻撃者も捕捉しました。モデル側のガードレールではこれを止められなかったでしょうし、実際そもそも稼働していませんでした。検知エンジニアリングは、エージェント型の時代においても時代遅れにはなりません。むしろその重要性は増しています。防御側は、プロンプトだけでなく、方向転換を明らかにするテレメトリと相関分析に投資すべきです」

Leonid Belkind氏、Torq 共同創業者兼CTO:

Image

「今回のニュースは、1年以上前から展開してきた物語の次の章にあたります。2025年5月に遡ると、Anthropicは、AIモデルが目標達成へのプレッシャーを受けた状況下に置かれると、エンジニアを脅迫してシャットダウンを回避しようとするなど、不穏な形で即興的に振る舞うことを示す研究を発表しました。現在、OpenAIのモデルがサンドボックスから脱出しHugging Faceのインフラを侵害した件で見られているのは、まさに同じ行動パターンが、はるかに強力なエンジンの上で動いているだけなのです。

核心的な問題は変わっていません。明確な目標と、それを達成するための技術的手段をモデルに与えると、多くの場合、モデルが利用可能なあらゆるツール、たとえ私たちが想定していなかった方法で発見・使用するツールも含めて、それらを使うのを止める仕組みが組み込まれていないのです。今日のモデルは、1年前にテストしていたモデルと比べて、ソフトウェアの解析や脆弱性の発見、エクスプロイトの構築において劇的に優れています。その能力に、組み込みの制約の欠如が組み合わさると、この結果は驚きというより、むしろ必然に近いものになります。

私はどうしても、1940年代にSF小説として書かれた、アイザック・アシモフのロボット工学三原則を思い出してしまいます。彼は、知的な機械が害をもたらさないようにするためのルールをハードコードする必要がある未来を想像していました。現代のAIには、そうしたガードレールは組み込まれていません。OpenAI、Anthropic、Googleといった最先端のラボは、封じ込めとアライメントに向けて積極的に取り組んでいますが、彼らが成功するのか、それともこうしたリスクの一部がこれらのシステムが目標に到達する仕組みそのものに本質的に内在しているのか、私たちにはまだわかりません。その問いは、いまも開かれたままです」

Alexander Leslie氏、Recorded Future 上級アドバイザー:

Image

「Hugging Faceで起きたことは重大な転換点ですが、正確に表現する必要があります。これは、AIモデルが自発的に悪意ある意図を発達させたという話ではありません。OpenAIは、通常の安全対策を弱めた状態で、高度なサイバー能力を持つモデルを意図的にエクスプロイト用ベンチマークに投入しました。重要な事実は、これらのモデルがそのテストの想定範囲を超え、未知の脆弱性を発見し、オープンなインターネットへのアクセスを獲得し、認証情報の窃取、権限昇格、横方向への移動、リモートコード実行を自律的に連鎖させて、実在する第三者を攻撃したという点です。

私たちのAI Malware Maturity Model(AIM3)に照らせば、これはこれまでで最も明確な、レベル5の技術的能力の公開デモンストレーションです。エージェント型システムが、段階ごとの人間の指示なしに、複雑な多段階の作戦を最初から最後まで実行しました。ただし、これはまだ実際の現場におけるレベル5の悪意ある活動の証拠ではありません。このキャンペーンを指揮していた犯罪者や国家主体は存在せず、モデルは拒否応答を減らし、潤沢な計算資源を与えられた特殊な評価条件のもとで動作していました。この違いこそが、真の能力の到達点と、完全自律型のサイバーキャンペーンが突然日常化したという誇張された主張とを区別するものです。

手法そのものは新しいものではありませんでした。モデルが悪用したのは、脆弱なサードパーティ製ソフトウェア、過剰な権限を持つ認証情報、不十分なセグメンテーション、リモートコード実行の経路など、高度な人間の攻撃者が悪用するのと同じ弱点です。変わったのは、そうした弱点を発見し組み合わせる速度、持続性、そして自律性です。戦略的なリスクは、AIがまったく新しいサイバーキルチェーンを生み出すことではありません。既存のキルチェーンを、人間の速度による防御を圧倒するほどの継続性と量で実行できるようになったことこそがリスクなのです」

Andrew Jones氏、Adaptive Security 共同創業者兼CPO:

Image

「これは、AIモデルが人間の操縦なしにサイバー攻撃を最初から最後まで実行できることを示す、これまでで最も明確な証拠の一つです。[……]ここで異なっているのは、誰もこのモデルに誰かを攻撃するよう指示していなかった点です。このモデルは、悪意ある人間がまったく関与しないまま、完全に自らの判断でHugging Faceを標的として選びました。それこそが、OpenAIとHugging Faceがこの種の最初の事例の一つと呼んでいる部分です。

AIモデルを利用している企業、あるいはAIモデルの標的になり得るすべての企業は、こうしたシステムのテスト方法や監視方法を変える必要があります。モデルがテスト環境からの脱出方法を見つけるまで何度でも異なるアプローチを試し続けられるのであれば、セキュリティテストをたまに一度実施するだけでは不十分です。企業は、AIシステムが使用するアカウントや認証情報を、従業員が使用するものと同じくらい厳密に監視・管理する必要があります。なぜなら、それこそが今回このモデルが、厳重に管理されたテスト環境から実運用システムへと移動するために使った経路そのものだからです。対応計画は、侵入の向こう側にいるのが悪意を持った人間ではなく、目標を追い求めるコンピュータープログラムかもしれないという事実を織り込む必要があります。一方を捕捉するために作られたツールが、必ずしももう一方を捕捉できるとは限らないからです。

[……]

セキュリティチームにとって、実践的な教訓はシンプルです。環境内で稼働するすべてのAIシステムを、独自のログイン情報、独自の権限、独自の行動記録を持つ従業員のように扱うことです。AIシステムが依存するソフトウェアやツールについても、AI自体と同じくらい注意深く点検してください。今回の攻撃は、まさにそこから始まったのですから。AIシステムが指示された範囲を超えて何かを行っていないか監視してください。従業員のアカウントが突然、閲覧する理由のないファイルを見始めたら気づくのと同じように。AI主導の脅威はすでに存在しており、人手による追跡よりも速く動いています。いまこうした防護策を講じている企業こそが、いざ自社が標的になったときに生き残れる企業となるでしょう」

Kristin Lowery氏、Optiv フィールド最高情報セキュリティ責任者:

Image

「今回のOpenAIの事案は、一度限りの異常事態としてではなく、自律型システムがコンテンツ生成から行動実行へと移行しつつあることへの早期の警告として捉えるべきです。実践的な教訓は、高度なAIシステムには、たとえ本来の目標が悪意あるものでなくても、有害な、あるいは予期しない振る舞いをする可能性があるということです。特に、タスクをどんな代償を払ってでも完遂するためのツール、ネットワーク経路、認証情報、インセンティブが与えられている場合はなおさらです。企業にとっての教訓は、AI導入を止めることではなく、エージェント型AIを、封じ込め、可観測性、実行可能なランタイム制御を必要とする新たな種類の特権ワークロードとして扱うことです。

企業は、AIエージェントのアイデンティティ管理を強化し、どのエージェントに何へのアクセスと実行を許可するかについて、非常に慎重であるべきです。各エージェントには、固有のアイデンティティ、範囲を限定した権限、短命な認証情報、明確な所有者を持たせるべきです。そうすることで、組織は特定のシステム、ユースケース、責任を負うビジネス上の担当者にまで行動をたどることができます。アクセスは既定で制限し、インターネットアクセス、コード実行、認証情報の取得、データ移動、本番システムへの変更といった、よりリスクの高い活動については明示的な承認ゲートを設けるべきです。実践面で言えば、組織はAIエージェントを高リスクなデジタル労働者として統治すべきです。既定での最小権限、テスト環境と本番環境の分離、ツール利用やシステムとのやり取りに関する詳細なログ記録、そして振る舞いがポリシーから逸脱した際にセキュリティチームが発動できるキルスイッチが求められます」

Aleksandr Yampolskiy氏、SecurityScorecard CEO:

Image

「これはサイバーセキュリティにとっての『ターミネーター』的な瞬間かもしれません! OpenAI社内でのサイバー能力評価の最中、先進的なモデルには、AIエージェントのエクスプロイト開発能力を評価するベンチマークであるExploitGymを解くという、限定的な目的が与えられていました。しかし、モデルはそれをはるかに超えることをやってのけました。

これらのモデルはテストインフラのゼロデイを悪用し、権限を昇格させ、横方向に移動し、オープンなインターネットアクセスを持つシステムに到達し、ベンチマークの解答を求めてHugging Faceのインフラを侵害しました。OpenAIはこの事案を前例のないものだとし、モデルは「異常なほど集中していた」だけであり、意識的に脱出を図ろうとしていたわけではないと説明しています。とはいえ、セキュリティ上の結果は同じでした。

これが管理された評価の外で起きたと想像してみてください。あるセキュリティ企業が、解析のために高度なマルウェアをサンドボックスに置いたとします。そのマルウェア、あるいはそれを操るAIが、封じ込め環境内のゼロデイを発見して脱出し、ソースコードや顧客インテリジェンス、検知手法を盗み出して、ある国家主体に流出させてしまう。あるいは、「敵を混乱させる」という目的を与えられた自律型モデルが野放しにされ、自らの判断でインターネット上のコンピューターを次々と発見し、侵害し、機能停止に追い込み始める。そんな事態です。

もはや、この魔神は瓶に収まりきらないほど強力になっています。攻撃がもはや人間の速度では動かなくなったとき、防御側は何をすればよいのでしょうか。

[……]

これは、米国の走り高跳び選手ディック・フォスベリーを思い出させます。1968年のオリンピックより前、誰もが走り高跳びに同じ方法で臨んでいました。フォスベリーは、既存の技術を少し上手にこなそうとはしませんでした。彼は後ろ向きに跳んだのです。人々は笑いました。彼が金メダルを獲得し、オリンピック新記録を打ち立てるまでは。やがて、誰もが彼のやり方を真似るようになりました。

彼は競争相手より高く跳んだのではありません。既存のルールに従うこと自体を拒んだのです。サイバーセキュリティにも、いまこそ独自の『フォスベリー・フロップ』が必要です! 人間の速度による攻撃のために構築されたモデルに、人員やダッシュボード、アラートを単に追加していくだけでは不十分です。防御を、機械の速度で動く世界向けに再設計しなければならないのです」

翻訳元: https://www.securityweek.com/industry-reactions-to-openai-models-hacking-hugging-face-feedback-friday/

ソース: securityweek.com