OpenAI、蒸留攻撃で使われた「新手の」暗号化回避手法を公表

OpenAIは、自社AIモデルの推論能力を蒸留して抜き出そうとする「組織的なキャンペーン」を阻止したと発表しました。同社は、中国の競合企業が関与していると名指ししています。

OpenAIは水曜日、7月1日に低水準の不審な活動を初めて確認したと明らかにしました。その後、活動は徐々に増え、7月24日と25日には4,000人のユーザーから1万6,000件のプロンプトを観測しました。これらは同様の「関連する抽出パターン」に当てはまるものでした。不審なユーザーは7月28日までに1万5,000人に達し、OpenAIは同日、この活動を「完全に遮断した」としています。

OpenAIは、攻撃者の手法を「新手のもの」と呼んでいます。攻撃者はまず、ある会話から暗号化された推論データをコピーしました。次に、別の会話でモデルにその内容を復号させ、平文で書き起こさせました。外部の研究者も、同様の脆弱性を8月にOpenAIへ報告しています。

OpenAIは署名のないブログ記事で次のように説明しています。「運営者らは、当社の暗号化を破ったわけでも、データベースに侵入したわけでも、保存されたユーザーの会話に直接アクセスしたわけでもありません。そうではなく、モデルとのやり取りを操作することで、保護された推論を、要求者が見られる形で再現させました。しかも組織的かつ大規模に行っており、当社の利用規約に違反しています」

OpenAIによると、すべての活動が関連しているかどうかは不明です。ただし、活動の「中核クラスター」の背後には、Moonshot AIのために動く個人がいたといいます。Moonshot AIは中国を拠点とする競合のAI企業で、過去に米国のモデルを蒸留したとして非難されたことがあります。

OpenAIのブログ記事には、この特定の根拠となる技術的な証拠や理由は示されていません。Moonshot AIの「Kimi」は、中国発のオープンソースAIモデルの一つです。こうしたモデルは、ユーザーや組織に対して、十分な性能を無料または低コストで提供しています。

米国のAI企業や米政府は、Moonshot AIなどの中国企業が最新モデルに対して「組織的な」蒸留攻撃を行っていると非難しています。Googleなどのセキュリティ専門家によると、中国企業はブラックマーケットやグレーマーケットを利用し、ClaudeやChatGPTといったモデルのアカウントを数千件単位で入手しています。そのうえで、数百万件のプロンプトやデータ要求をモデルに浴びせ、モデルの能力や学習データの複製に役立てているといいます。

OpenAIはCyberScoopに対し、「セキュリティ上の理由」から追加情報は公開しないと述べました。CyberScoopはMoonshot AIにも、さらなるコメントを求めています。

OpenAIによると、同じ脆弱性は他のAIモデルにも存在します。同社は今回の件について、Frontier Model Forumなどの団体に情報を共有しました。

OpenAIは、問題のあるアカウントを停止しただけでなく、サインアップやインフラの管理策を改善し、ネットワーク監視も拡充したとしています。さらに、ユーザーがある会話の暗号化データを取り出し、別の会話で復号できてしまうバグも修正しました。 

翻訳元: https://cyberscoop.com/openai-moonshot-ai-model-distillation-attack/

本記事は cyberscoop.com の記事を翻訳・要約したものです。