OpenAI、保護対象のモデル推論の抽出を狙う1万5,000ユーザー規模の工作を阻止

OpenAIは、同社のAIモデルが持つ保護対象の推論(リーズニング)を抽出しようとしたとされる、1万5,000件を超えるユーザーアカウントによる組織的なキャンペーンを阻止しました。同社はこの活動を敵対的モデル蒸留と説明しています。

この工作は7月上旬に始まり、同月後半には大量の抽出試行へとエスカレートしました。これを受けてOpenAIは、アカウントの停止、インフラ面の対策、監視体制の拡充に踏み切りました。

このキャンペーンで、OpenAIのインフラ、暗号化システム、データベース、保存されたユーザーの会話が侵害されることはありませんでした。運用者らはモデルとのやり取りを操作し、本来は非公開の推論の成果物をユーザーに見える出力に表示させたとみられます。

OpenAIによると、この活動は利用規約に違反するものです。別のAIモデルの訓練、再現、改良に使われかねない推論データを収集する狙いがあったといいます。

保護対象の推論とは、モデルがタスクを処理する際に使う内部的な記録を指します。ユーザーに返される最終的な回答と異なり、この推論には中間的な分析や構造化されたタスク分解など、公開を想定していない情報が含まれることがあります。

OpenAIは、こうした情報が抽出されれば、第三者が通常のユーザー向け応答に適用される安全対策を回避しながら、モデルの能力を複製できるようになると警告しています。

同社が不審な活動を最初に確認したのは7月1日で、当時の規模は比較的小さいものでした。活動が激化したのは7月24日と7月25日です。この2日間でOpenAIは、4,000人超のユーザーから、該当する抽出パターンを用いた1万6,000件のリクエストを検出しました。

調査の結果、この活動は1万5,000件を超えるアカウントからなる、より大規模なネットワークと関連していることが判明しました。OpenAIは7月28日までにこのネットワークを完全に無力化したとしています。

手口の一つは、あるモデルとの会話から暗号化された推論データをコピーし、別の会話に送り込むものでした。その際、隠された内容を復号して書き起こすよう指示していました。

OpenAIによれば、独立した研究者らも別途、モデル間のやり取りや会話の圧縮(コンパクション)処理に関する関連の弱点を報告していました。同社は研究者らが示した攻撃経路が有効であることを確認し、この報告が緩和策の作業を加速させたと述べています。

OpenAIは、この活動の中核をなすクラスターについて、Kimi AIモデルの開発元であるMoonshot AIの関係者によるものと結論づけました。ただし、より広範な活動に関わった運用者すべてが単一の個人や組織に由来するのかどうかは、特定できなかったとしています。

OpenAIはキャンペーンを封じ込めるため、不正アカウントの停止または制限、サインアップとインフラの保護強化、関連するアカウントネットワークの検知拡充を実施しました。

さらに、他のユーザーの暗号化された推論データを既に入手している者が、その内容を復元できてしまうリプレイ経路も塞ぎました。隠された推論を露出させるおそれのあるストリーミング出力を検知して保留する制御も追加しています。

同社は、関連する活動が外部プラットフォームを経由していた場合には、サードパーティのサービスプロバイダーと連携したと説明しています。調査結果は、Frontier Model Forum、業界パートナー、政府の情報共有チャネル、公共部門の関係者にも共有しました。

OpenAIは、敵対的蒸留はAIセキュリティ上の懸念として高まりつつあるとしています。抽出された推論を使えば、モデル開発や安全性エンジニアリングに同等の投資をしなくても、高度な能力を移転できてしまうためです。

最先端モデルがサイバーセキュリティや科学研究などの機微な分野に関わるデュアルユース能力を獲得するにつれ、このリスクは高まります。

同社は今後、抽出の試みがさらに巧妙化すると見込んでいます。対策としては、より強力な技術的保護、検知と取り締まりの改善、ツール出力に対する防御の強化、分類器の対象範囲の拡大を挙げました。クラウドやパートナーがホストする環境へも保護策を展開していく方針です。

ANY.RUNを導入する1万6,000以上のSOCチームが、脅威調査を効率化し、手作業を削減しています。 チームでの導入を検討する

翻訳元: https://cyberpress.org/openai-stops-15000-user-operation-attempting/

本記事は cyberpress.org の記事を翻訳・要約したものです。