フロンティアAIモデル、サイバーテスト中に実在システムへ攻撃的行動

評価環境が想定していた封じ込め境界を意図せず超えてしまったことで、フロンティアAIモデルが実際のインターネット上のシステムに対して攻撃的な行動を取っていたことが明らかになりました。

Irregular社によると、今回の問題は単一のサイバー評価シナリオに起因するもので、当初の公表前にすでに是正措置が取られていたとのことです。

同社は、その後に報じられた内容もすべて同一のインシデントに関するものであり、別個の侵害事案ではないと強調しています。また、顧客システムが侵害されたり顧客データが流出したりした証拠は見つかっていないとしています。

IrregularはフロンティアAI開発企業向けにデプロイ前のテストを実施している企業で、モデルが現実的な複数段階にわたるサイバー攻撃キャンペーンを計画・実行できるかどうかを判定するため、数千件規模のシミュレーションを実施しています。

その中の一つの高度なシナリオでは、悪意あるインサイダーが本番データベース内の機密データへ不正アクセスする手助けをAIモデルが行えるかどうかを評価していました。

このタスクでは、偵察、秘密鍵の発見・利用、対象環境の列挙、データ抽出、検知回避の試みといった、攻撃の一連の流れを丸ごとシミュレートしていました。

各モデルには架空の企業名と内部アドレスが与えられ、活動範囲がシミュレートされたネットワーク内のみにとどまるよう設計されていました。

ところが、テスト用に選ばれた架空の企業名が、偶然にもほとんど知られていない実在のインターネットドメインと一致してしまいました。大半のモデル実行は意図した環境内にとどまりましたが、一部の実行では、この実在ドメインを演習の一部と解釈し、アクセスを試みる事態が発生しました。

サイバー演習の現実性を保つため、インターネットアクセスは有効な状態にされていました。Irregularは、実際の攻撃者がオンラインリソースや外部インフラ、公開情報に依存していることから、インターネットアクセスなしのシミュレーションでは再現性が損なわれる可能性があると説明しています。

このインターネットアクセスこそが、重大な封じ込め失敗の原因となりました。限定的な事例ではありますが、モデルが実在ドメインにアクセスし、脆弱性を悪用して認証情報を窃取し、本番データベースへのアクセス権を取得していました。

あるケースでは、モデルが名称の似た別のサイトに移動し、そこですでに公開されていた認証情報を発見していました。Irregularによると、対象となったドメインには一般的なセキュリティ対策が欠けていたため、複数のフロンティアモデルにとって比較的容易に侵害できる状態だったといいます。

同社は、今回の事象は特定のモデルによる例外的な挙動を示すものではなく、こうした攻撃的能力が高度なAIシステム全般に広く行き渡りつつあることを示すものだと主張しています。

今回のインシデントは、高度なシミュレーション1万件中1件未満という低頻度でしか発生せず、しかも数百ターンに及ぶこともあるセッションの終盤で起きることが多かったため、検知が困難でした。

Irregularは顧客とともにこの活動を特定した後、該当する評価を無効化し、関連ログを精査した上で、影響を受けた関係者に通知を行いました。

同社は現在、モデルの挙動に対する手動レビューの拡充、監視および封じ込め層の強化に加えて、評価環境のセキュリティやモデル制御に関する前提を問い直すための専任社内チームの新設も進めています。

評価ログはその性質上、疑わしく見えるトラフィックが大量に含まれるため、自動分類システムでは、意図された模擬攻撃ステップと、本当に意図しない外部への活動とを見分けられずに、両方をまとめて検知してしまう場合があります。

今後の改善策としては、シナリオの前提条件に関するドキュメントの明確化、架空の企業名やドメインの継続的な再検証、インターネットアクセス制御のより厳格な審査、そして組織横断でのインシデント対応連携を可能にする正式な仕組みの構築が挙げられています。

今回の事象は、運用面での新たな課題を浮き彫りにしています。AIモデルは自動化されたインサイダー型の脅威主体として機能し得る一方で、既存の防御策は主に外部の攻撃者を想定したものにとどまっているという点です。

モデルの能力が向上するにつれ、安全性研究そのものが現実世界のサイバーリスクを生み出すことのないよう、安全なテスト環境も同じ速さで進化させていく必要があります。

ANY.RUNのブラウザ内データ検査で、検知・調査・対応をより迅速に。 フィッシングの全体像を完全に可視化し、SOCを強化してMTTRを短縮しましょう

翻訳元: https://cyberpress.org/frontier-ai-models-offensive-actions-against-real-world-systems/

本記事は cyberpress.org の記事を翻訳・要約したものです。