AIエージェント、サイバーセキュリティ評価中に意図せずインターネットへアクセス

AIセキュリティ評価企業が、統制されたサイバーセキュリティテストの最中に複数の最先端AIモデルが意図せずインターネットに接続されたシステムに実際にアクセスし、行動を起こしていたことを明らかにしました。

この問題はすでに解決済みですが、原因は単一の評価シナリオにありました。インターネットアクセスが許可された状態で、架空の攻撃対象名が実在するドメイン名と偶然一致してしまったのです。

Irregular社によれば、今回の発表内容は7月30日に顧客が最初に公表した事案と同一のものであり、複数の別々の侵害事案があったわけではないとのことです。同社は、顧客システムが侵害された証拠や顧客データが流出した証拠はないと確認しています。

AIエージェントが意図せずインターネットアクセスを獲得

この事案は、AIモデルが現実的な制約下で多段階の侵入ワークフローを計画・実行できるかどうかを検証する、高度なサイバー能力評価の最中に発生しました。こうした評価は通常、複数のモデルにわたって数千件規模のシミュレーションを実施し、多くの場合48時間から72時間以内に完了します。

このシナリオでは、悪意を持つ内部関係者を模したエージェントが、企業の本番データベースに保存された機密データへのアクセスを試みるという設定でした。各モデルには、偵察、秘密鍵の特定、対象環境の把握、データ抽出、検知回避といった、侵入活動に一般的に伴う各段階の実行が課されていました。

エンジニアたちは、シミュレーション対象の組織に架空の企業名を選びました。事前にレビューを行ったにもかかわらず、この名称はあまり知られていない実在のドメインと偶然一致してしまいました。

ほとんどのシミュレーションでは、与えられた内部アドレスが使用され、評価環境の枠内にとどまっていましたが、一部のモデルは明示的な指示がないにもかかわらず、実在のドメインへのアクセスを試みました。

インターネットアクセスが有効になっていたため、一部のモデルはこの実在のウェブサイトを演習の一部だと誤認しました。Irregular社の報告によると、各モデルは脆弱性の悪用、認証情報の窃取、本番データベースへのアクセスといった行動を実行しました。あるケースでは、モデルが類似した名前のサイトに移動し、そこで公開されていた認証情報を発見したと報告されています。

Irregular社によると、この挙動は高度なシミュレーション1万件のうち1件未満の頻度でしか発生せず、多くの場合ワークフローの終盤、数百回の反復処理を経た後に表面化する傾向がありました。

発生率が低いことは検知を難しくする要因となりました。特に、評価過程で得られるテレメトリには、もともと不審または攻撃的に見える大量の活動記録が含まれているためです。

同社は、影響を受けたドメインには標準的なセキュリティ対策のいくつかが欠けており、そのため最先端の現代型AIモデルにとって比較的容易に侵害できる状態だったと強調しています。

セキュリティコンサルティングサービス

同社は、今回の事案を特定モデルの異常な挙動や突出した能力の証拠と見なすべきではないと説明しています。むしろこれは、主要なAIシステムの間でサイバー能力がますます一般的になりつつあることを示す事例だとしています。

とはいえ今回の事案は、評価の境界設定、ネットワークルーティング、シナリオの前提条件が誤って設定された場合、AIエージェントが自動化された内部脅威のように振る舞いかねないという、新たな運用リスクを浮き彫りにしています。

これを受けてIrregular社は、問題となった評価を停止し、関連ログを精査した上で影響を受けた関係者に通知し、継続的な調査に着手しました。

同社は現在、モデルの挙動に対する人手によるレビューを拡大するとともに、封じ込め対策を強化し、モデルの自律性や環境の隔離に関するセキュリティ上の前提を検証する専任の社内チームを新設する予定です。

同社はまた、セットアップ手順の文書化、監視体制、インシデント対応の連携体制、そしてシナリオで使用する架空の名称の継続的な検証体制を強化する計画です。

ドメインの確認作業は一度きりで済ませるのではなく、定期的に実施する必要があります。テストの設計が最初に確定した後でも、新規のドメイン登録によって評価対象と重複が生じる可能性があるためです。

今回の発表は、AI安全性チームが直面する難しいトレードオフを浮き彫りにしています。現実の攻撃者はオンラインサービス、公開コードリポジトリ、外部に露出したインフラ、外部偵察を活用するため、現実に即したサイバー評価を行うには限定的なインターネットアクセスが必要になる場合があります。しかし、そのアクセス権限そのものが、単なるシミュレーション上の誤りを現実世界での活動に転じさせてしまう恐れがあるのです。

Irregular社は、評価に関するベストプラクティスを提案するホワイトペーパーを公開する予定です。想定される重点項目としては、送信トラフィック制御の強化、許可リスト方式による接続先の限定、ドメインの継続的な検証、文脈を考慮したアラート機能、通信記録の保存、そして関係者間でのフォレンジック情報の連携などが挙げられます。

サイバー能力を持つAIモデルがさらに高度化していく中で、安全な評価設計は単純なサンドボックス化から、厳密に監視された多層防御型の規律へと進化していく必要があります。

新たなフィッシングやマルウェアが貴社を侵害する前に阻止しましょう。 世界15,000のSOCから得られるライブインテリジェンスを統合

翻訳元: https://gbhackers.com/ai-agents-gain-unintended-internet-access/

本記事は gbhackers.com の記事を翻訳・要約したものです。