セキュリティ研究者のOliver Fish氏は、APIキーもアカウントもないまま有料AIモデルにリクエストを到達させられるOpenAIのサンドボックス脱出の脆弱性を発見したと主張しています。事実であれば、同サービスの通常の認証や課金の制御を回避できた可能性があります。
オンラインで共有されたスクリーンショットによると、OpenAIは「Unauthenticated Sandbox Escape Enables Access to Internal OpenAI Responses API」と題された報告に対し、300ドルの報奨金を支払ったとされています。
ただし、入手できる資料からは、この攻撃の前提条件や影響範囲、報告されたアクセスが現在も可能かどうかは確認できません。
今回の指摘は、2つのセキュリティ境界に疑問を投げかけています。サンドボックス化されたワークロードの分離と、モデルへのリクエストに対する認証です。OpenAIの開発者向けクイックスタートでは、APIを利用する前にAPIキーを作成するよう案内しています。Responses APIのリクエスト例も、Bearer認証を使ったものです。
Fish氏の説明が正確であれば、この脆弱性により、公開APIで通常必要となる顧客の識別情報なしに、内部経路を通じてリクエストを送れた可能性があります。
こうした経路が存在すれば、モデルの実行が、有料リクエストに本来求められる認可や利用量の集計から切り離されるおそれがあります。具体的な仕組みは明らかにされていません。
提示された開示資料には、概念実証(PoC)コード、脆弱なエンドポイント、影響を受けるモデルの一覧、CVE識別子、露出していた期間、パッチの告知のいずれも含まれていません。したがって、この問題を「すべての有料モデルへの無制限のアクセス」と表現するのは、入手可能な根拠を超えています。
また、研究者が顧客データにアクセスしたことや、攻撃者が同氏のテスト以外でこの脆弱性を悪用したことを示す公的な証拠も、資料には見当たりません。そのため、今回の件はあくまで研究者の主張として扱うべきであり、広範な侵害が確認されたものとみなすことはできません。
Fish氏は報奨金額に不満を示し、Xに「Zero reason to report anything else I find to them.(今後、見つけたものを彼らに報告する理由はまったくない)」と投稿しました。
提示された情報によると、 OpenAIのBugcrowdでの報奨金は、重大度の低い発見の200ドルから、極めて深刻な脆弱性の2万ドルまでの幅があります。
300ドルという支払額からは、影響の評価が限定的だった可能性がうかがえます。ただし、それだけで脆弱性の深刻度が決まるわけではありません。OpenAIがこの報奨金額とした理由は明らかになっていません。
Cyber Security Newsは以前、ChatGPTの別の弱点を報じています。共有されたArtifactoryのメタデータに関するもので、研究者はこれをアカウント間の経路として悪用し、連携先のGmailデータを抜き出しました。
CSNによると、OpenAIは問題となった内部サービスを廃止しました。ただし、Fish氏の発見が同じインフラや手法を使ったものだったかどうかは確認されていません。
今回の主張について意味のある裏付けとなるのは、影響を受けたサービス、修正の日付、露出期間、そしてログから不正なモデルリクエストが特定されたかどうかといった情報です。
防御面で優先すべきは、サンドボックス発のトラフィックを信頼できるものと決めつけず、内部サービスのあらゆる境界で認証と認可を徹底することです。
プロバイダーは、リクエストを検証済みのIDに紐づけ、サンドボックスのネットワークアクセスを制限し、レート制限や支出上限を適用するとともに、帰属不明の推論アクティビティを調査する必要があります。
サーバー側の認証バイパスは、顧客側でキーをローテーションしても解決できません。今回指摘された弱点への対処では、プロバイダー側での修正が中心となります。
1万6,000以上のSOCチームがANY.RUNを活用し、脅威調査の効率化と手作業の削減を実現しています。チームで試してみる
翻訳元: https://cyberpress.org/openai-sandbox-escape-flaw/