NSA、FBI、CISAが産業規模のAIモデル蒸留攻撃に警鐘 | eSecurity Planet

米国のセキュリティ機関は、中国を拠点とする6社のAI企業が、米国のフロンティアモデルから能力を抽出する産業規模のキャンペーンを実施していたと発表しました。この活動により、競合する開発企業は、独自開発にかかる全コストを負担することなく、価値ある推論・コーディング・エージェント機能へのアクセスを得られる可能性があります。

NSA、FBI、およびサイバーセキュリティ・インフラセキュリティ庁(CISA)は、この警告の中でDeepSeek、Moonshot AI、Alibaba、MiniMax、StepFun、Z.AIの各社名を挙げました。各機関によると、これらの企業は合わせて数百万件のリクエストを通じて数十億個のトークンを取得しており、対象にはClaude、GPT、Gemini、Grokの各モデルが含まれていたということです。

9月8日付の共同サイバーセキュリティ勧告の中で、各機関はこれらのキャンペーンが少なくとも2024年末まで遡ること、そして中国政府がこれを把握していた可能性が高いことを指摘しました。また、知識蒸留そのものは正当なAI開発技術であると強調した上で、今回問題視されている不正行為は、協調的な抽出活動、アカウントの悪用、プロキシインフラの利用、そしてプロバイダーの制御を回避しようとする試みに関わるものだとしています。

産業規模のAI蒸留の仕組み

知識蒸留とは、より強力な「教師」モデルの出力を利用して別のモデルを改善する手法です。この勧告によれば、名指しされた各社はネイティブAPI、リモートクラウドプロバイダー、サードパーティのアグリゲーター、そして「転送ステーション」と呼ばれるグレーマーケットのAPIプロキシを経由してリクエストを送っており、複数のアカウントとアクセス経路に活動を分散させていたということです。

各機関はさらに、思考の連鎖(chain-of-thought)推論を抽出しようとする試みや、ブロックされた後にアクセス経路を自動的に切り替える動き、そしてプロバイダーが抽出を妨げるためにモデルの挙動を変更したかどうかを見極めようとする動きも確認したとしています。今回確認されたキャンペーンの中で最も早い時期のものはDeepSeekによるもので、少なくとも2024年末まで遡る活動が見つかっています。

Anthropicも独自に、6社のうち3社が関わる大規模な蒸留活動を確認しています。同社は2月23日、DeepSeek、Moonshot、MiniMaxが約24,000件の不正アカウントを通じて1,600万件を超えるClaudeとのやり取りを生成していたと発表しました。

今回のキャンペーンは、攻撃者が偵察や認証情報の窃取などの攻撃段階を自動化するためにAIエージェントを活用する動きを強めているという脅威環境に、また一つ新たな側面を加えるものです。

中国は9月9日、米国側の主張を否定しました。商務部は公式な回答の中で、今回の非難には事実的・法的根拠が欠けていると述べ、蒸留は広く用いられている中立的なAI開発技術であると主張しました。

蒸留キャンペーンの検知と阻止

各機関は、包括的な検知の実施、悪意ある蒸留が疑われる場合の応答への的を絞った変更、そしてプロバイダー間・インフラパートナー間での脅威インテリジェンス共有を推奨しています。Claudeエージェントを取り巻くセキュリティを強化する最近の取り組みも、AIの能力向上に合わせて監視体制とアクセス制御がどのように拡大しているかを示す一例といえます。

組織は、次の7つの対策を通じてこうした防御を強化できます。

  • 異常な利用パターンの監視: 利用量の急激な増加、サブスクリプション量と利用量の不自然な比率、繰り返されるプロンプトなど。
  • アカウント検証と本人確認の強化: 不正登録、認証情報の共有、アカウントのローテーションを可視化する。
  • アカウント・決済・ネットワーク・リクエストのテレメトリ相関分析: 複数のアカウントやサービスにまたがる活動を特定する。
  • 行動検知の導入: 推論、コーディング、エージェント機能、ツール利用など、価値の高い能力が繰り返し抽出されていないかを検知する。
  • モデル・API応答の強化: レート制御を導入し、抽出が疑われる場合には的を絞った対応変更を行う。
  • インシデント対応計画のテスト: アカウント悪用、プロキシ経由の抽出、認証情報の不正利用、エスカレーション手順を網羅した演習を実施し、実際のAI悪用サイバー攻撃に対する防御を土台として発展させる。
  • インフラパートナーとの脅威インテリジェンス共有: 複数サービスに分散する痕跡情報を結び付ける。

大量のエンタープライズAIワークロードも同様のシグナルを発生させることがあるため、利用量の多さだけでは悪意ある活動と断定することはできません。検知には、行動面の文脈情報と、ID・インフラ・アクセス経路をまたいだ相関分析が必要です。

AIが基幹インフラとしての地位を確立しつつある中、モデルへのアクセスは新たなセキュリティ境界となりつつあり、本人確認の制御、API監視、行動分析、検証済みの対応計画、そして協調的な脅威インテリジェンスが求められています。

関連記事: 自律的なAI利用を拡大する組織は、AIエージェントに対するより強固な監視と統制の構築によってもリスクを低減できます。

翻訳元: https://www.esecurityplanet.com/news/news-ai-model-distillation-attacks/

本記事は esecurityplanet.com の記事を翻訳・要約したものです。