米国政府は、中国のAI企業が米国の最先端AIモデルとその能力を違法に蒸留する意図的かつ「組織的」な取り組みを行っていると非難しています。
国家安全保障局(NSA)、サイバーセキュリティ・インフラセキュリティ庁(CISA)、FBIによる共同サイバーセキュリティ勧告によると、2024年以降のこうした取り組みの規模の大きさは、蒸留が中国のAI産業政策における重要な位置を占めていることを示しているといいます。
「中国拠点のAI企業は、産業規模の知識蒸留キャンペーンを通じて、米国のAI企業が持つモデルの独自機能や能力を組織的に抽出しています。これはAI開発戦略における単なる補助的手段ではなく、その中核をなすものです」と両機関は記しています。
この勧告では、DeepSeek、Moonshot AI、Alibaba、MiniMax、StepFun、Z.AIといった中国企業の名前が挙げられており、これらの企業は少なくとも2024年後半以降、Anthropicの Claude、OpenAIのChatGPT、Google Gemini、xAIのGrokといった米国の最先端AIモデルに対して、数百万回に及ぶやり取りとリクエストを通じて数十億トークンを費やしてきたとされています。
米当局によると、これらの企業はこうしたやり取りから得たデータを利用して自国製モデルを強化しており、こうした慣行は北京の政治指導部から直接指示されているわけではないものの、暗黙のうちに奨励されているといいます。
DeepSeekを例に挙げると、同社は米国の最先端モデルを蒸留してR1やR3モデル向けの合成トレーニングデータを生成しており、その対象にはClaudeの4種類のバージョン、Geminiの2種類のバージョン、ChatGPTの5種類のバージョン、そしてGrok 4が含まれていました。これらのモデルは、エージェント機能、質疑応答の最適化、創作および職業関連文章の作成などの分野において、DeepSeekの能力向上に寄与したとされています。
もう一つの中国企業であるMoonshot AIは、Kimi-K2およびKimi K3モデルの訓練にあたり、Anthropicの現行最上位商用モデルであるFable 5を含む18種類の異なる米国製モデルを蒸留したとされています。同社は、エージェント型推論、コーディングとデータ分析、コンピュータビジョン、より大規模な論理的枠組み、視覚処理といった分野での能力強化を狙い、数百万件のクエリを利用したとされています。
中国のAI企業は、検出を回避するために複数の経路を通じてリクエストやプロンプトを振り分ける、高度なツール群とシステムを運用しています。
この勧告では、中国企業が用いる一般的な手口として、複数のアカウント・モデル・プラットフォームにリクエストを分散させる手法、ネイティブAPIやリモートクラウドプロバイダー、サードパーティのアグリゲーターを利用してユーザーのメタデータを難読化する手法、そして地理的制限や利用規約、最先端モデルに組み込まれた安全対策を回避するためにプロキシやグレーな技術市場を活用する手法が挙げられています。
「産業規模の蒸留に対処するには、米国政府、民間企業、同盟国を横断した効果的な情報共有を含め、AIエコシステム全体での協調的な対応が必要です」と勧告は述べています。
米国の国家安全保障当局者や西側諸国の経営幹部たちは、これまで数十年にわたり、中国がサイバー攻撃や内部脅威、その他の経済スパイ活動を利用して米企業から独自技術や機密技術を窃取していると非難してきました。
6月には、ホワイトハウス科学技術政策局(OSTP)局長のマイケル・クラチオス氏が、MoonshotAIがFable 5を蒸留して自社モデルの訓練に用いたとする同様の指摘を行っており、ガードレールや利用制限を回避する同様の「高度な」仕組みについても言及していました。
火曜日に発表された今回の警告も、米国の技術が中国に窃取されているとする点では同様の主張ですが、対象となっている最先端AI企業自体も、著作権や商標権で保護された作品を無断でモデルの訓練に利用したとして、アーティストや著作者、メディア組織などから訴訟を起こされている立場にあります。
競争の激しいAI業界内部でも、企業やオープンソース団体がAIシステムの重みや評価指標を共有したり、正当な業務や研究の一環として他のAIシステムを蒸留したりすることは一般的に行われています。
両機関もこうした実情を認めつつ、中国企業は「産業規模で、攻撃的かつ悪意を持ち、標的を定めた蒸留活動」に従事していると主張しています。
翻訳元: https://cyberscoop.com/us-accuses-chinese-ai-companies-distillation/