OpenAIのAIエージェントが暴走して他社をハッキングしたという話は既にご存じかもしれません。今回はその逆で、あるサイバーセキュリティ企業がAIを使ってChatGPTの運営元であるOpenAI自身をハッキングし、形勢を逆転させてみせました。
このハッキングはセキュリティ研究として実施されたもので、その過程で他の数十もの主要オンラインサービスに影響する脆弱性も明らかになりました。OpenAIはバグバウンティプログラムを通じて、自社システムの欠陥を報告した研究者らに報奨金を支払っています。
サイバーセキュリティツールベンダーのHacktronに所属する研究者らは、9月中旬にこの顛末をブログにまとめました。その数か月前、彼らはChatGPTやClaudeを動かしているような高性能な「フロンティアAIモデル」を開発する企業のセキュリティ上の欠陥を探し始めていました。
AnthropicのClaudeを使い、研究者らは画像処理の欠陥を調査するところから始め、72時間もかからずにOpenAIの内部ソフトウェアリポジトリへのアクセスにたどり着きました。なお、機密情報の閲覧は意図的に避けています。
OpenAI内部に侵入するにあたり、研究者のHarsh Jaiswal氏、Mohan Pedhapati氏、Rahul Maini氏は2つの脆弱性を発見し、それらを連鎖させました。1つ目はOpenAI固有のものではなく、コミュニティフォーラムソフトウェアであるDiscourseの画像アップロード機能に存在するバグでした。
この機能はユーザーがアップロードした画像を処理する際、libheifという低レベルのソフトウェアライブラリに依存しています。特殊に細工した画像をアップロードすることで、このライブラリの欠陥を引き起こし、攻撃者がDiscourseサーバーの制御を奪えてしまう状態でした。
Hacktronはこの脆弱性を利用してOpenAIのDiscourseサーバーを侵害した後、2つ目の脆弱性を活用しました。これはOpenAIのシングルサインオン(SSO)システムの欠陥で、あるサービスのアカウントを使って別のサービスにもアクセスできてしまうというものです。
このSSOの欠陥により、OpenAIのDiscourseフォーラムにログインしたことのあるユーザーのChatGPTおよびCodexアカウントへ、Hacktronはアクセスできるようになりました。OpenAIはこのフォーラムをコミュニティサポート用に運用しているため、対象となりうるアカウントは膨大な数に上る可能性がありました。なお、Codexはソフトウェア開発者のコーディング作業を支援するAIツールです。
このシステムにログインしていたのは一般ユーザーだけではなく、OpenAIの従業員もログインしていたため、Hacktronはある従業員のアカウントにアクセスすることができました。その人物のCodexアカウントはOpenAIのGitHub組織にひも付けられていました。GitHubは開発者がソフトウェアを保存・共同作業するために利用するオンラインサービスです。
これにより、研究者らはOpenAIの内部ソフトウェアリポジトリにアクセスできるようになりました。
研究者らはこのアクセス権を使って有害な行為は一切行いませんでした。彼らの目的は、OpenAIへの侵害に成功したことを証明することだけでした。そこで、その従業員のCodexアカウントに指示を出し、OpenAI内部のリポジトリに無害なプルリクエスト(ソフトウェア変更の提案)を作成させました。
OpenAIはHacktronが最初の報告を提出してから約14時間後に、自社側の問題を修正しました。その後、OpenAI側の脆弱性に対して研究者らに6,500ドルの報奨金を支払っています。
サイバーセキュリティにとっての意味
このような倫理的ハッキングはよく行われていますが、今回の件には他の多くの事例とは異なる興味深い側面がいくつかあります。
1つ目は、Hacktronがこの取り組みにAIを活用した点です。当初はAnthropicの最新Claudeモデルの1つであるOpus 4.8を使ってlibheifの問題を発見しましたが、Discourseの既定バージョンに対して確実に機能するエクスプロイトを構築するには、このモデルを使いこなせませんでした。
その後、AnthropicがClaude Opus 5をリリースしました。このモデルを使うことで、研究者らは一晩で動作するエクスプロイトを構築できました。
これはAIの進歩がいかに速いかを物語っています。Opus 4.8が何度もセッションを重ねても完遂できなかったタスクを、Opus 5はリリースから数時間のうちに解決してしまったのです。
2つ目の興味深い点は、研究者らがこれを実行するためにClaudeを騙す必要があった点です。このモデルは当初、リモートシステムに対するエクスプロイトの作成を、非倫理的な要求だと判断して拒否しました。そこで研究者らは、この作業をキャプチャー・ザ・フラグ(ハッキング競技)であるかのように見せかけ、モデルに協力させる必要がありました。
そうしたところ、エージェントはわずか4時間でテスト用フォーラムサーバーを乗っ取りました。研究者らはその結果得られたエクスプロイトを、実際のOpenAIのフォーラムに対して使用しました。これは、企業が自社AIの利用に倫理的な制約を課そうと最善を尽くしていても、巧妙な研究者であれば簡単なプロンプトエンジニアリングによってそれを回避できてしまうことを示しています。
しかも、これにかかった費用はごくわずかでした。Hacktronは2か月にわたるこの研究プロジェクトで、AIトークンに費やした費用は3,000ドル未満でした。このプロジェクトには研究者3人が携わり、複数の大手企業に影響する脆弱性を発見しています。
この画像処理のバグは、「HEIF Heist」と呼ばれるより広範なプロジェクトの土台となりました。Hacktronは、Slack、Meta、GitHubを含む各社のサービスやソフトウェアに影響する関連セキュリティ上の弱点を発見しました。このHEIFエクスプロイトを新たな企業向けに調整するのにかかった時間は、平均して1日から2日程度でした。
こうした一連の動きは、高度なハッキングのハードルをさらに引き下げています。既製のハッキングツールについては、その仕組みを本当には理解していなくても長年利用できていましたが、ソフトウェアを丹念に調べ、隠れた欠陥を見つけ出し、それを確実に機能するエクスプロイトに仕立て上げるには、本物の専門知識が必要でした。
Hacktronは、今回のハッキングは完全に自律的なものではなく、熟練した人間による誘導が依然として重要な役割を果たしたと述べています。とはいえ、AIはそうした専門知識の一部を、より安く、より速く適用できるものへと変えつつあり、その能力は今後も向上し続けるでしょう。
脅威が害を及ぼす前に食い止めましょう。
Malwarebytes Browser Guardは、フィッシングページや悪意のあるサイトを自動でブロックします。無料でワンクリックでインストールできます。ブラウザに追加する →
翻訳元: https://www.malwarebytes.com/blog/news/2026/09/researchers-used-claude-to-hack-openai