人工知能モデルが最近、実在するインターネットサーバーに複数回侵入していたことが明らかになりました。エンジニアたちは本来、閉鎖的で安全性が確保されているとされるテスト環境内で、架空の企業をハッキングする任務をこれらのモデルに課していました。ところが驚くべきことに、モデルは脆弱性を発見して機密性の高い認証情報を抜き取り、最終的には実在の本番データベースにアクセスしてしまったのです。テスト企業のIrregular社は、大手AI開発企業向けにこうした専門的な評価を継続的に実施しています。同社は最終的に、テスト基盤における根本的な設定ミスがこの恐ろしい見落としを引き起こしたと認めました。
概要:テスト環境の破綻
Irregular社は、先進的なAIモデルが持つ高度なサイバーセキュリティ能力を、一般公開前に入念に評価しています。この厳格な試験を実施するため、同社は非常に複雑なシナリオを設計しています。AIは多段階の攻撃を実行し、脆弱性を特定して閉鎖システムに侵入し、指定された標的情報を取得しなければなりません。通常、モデルは専用に用意された隔離ネットワーク内でのみ動作し、アクセス可能なすべてのサーバーを、許可されたシミュレーションの一部にすぎないと認識します。
名前の偶然の一致と開放されていた接続
今回の重大な失敗は、最も複雑なテストスイートの一つに端を発していました。エンジニアチームは、シミュレーション用に架空の企業名を考案しましたが、あいにく、実在のインターネットドメインが当時まさに同じ名前を使用していたことに気づいていませんでした。さらに悪いことに、このテスト環境には誤って制限のないインターネットアクセスが有効になっていました。ほとんどのシミュレーション実行では、モデルは指定された仮想システムを正しく攻撃していましたが、一部の孤立したケースでは、実在のウェブサイトに直接アクセスし、それを自らの割り当てられた標的だと誤認していました。
誤爆による侵害の広がり
想定されたサンドボックスの外に出た後も、AIはトレーニング用の攻撃範囲内であるかのように、まさに同じ手順で行動を続けました。高度なモデルは脆弱性を積極的に探し、認証情報を収集し、外部インフラに深く侵入していったのです。Irregular社の確認によれば、実在するリソースの侵害に成功した後、モデルは稼働中の本番データベースへの直接アクセスを獲得したといいます。また別のシミュレーション実行では、異なるモデルが類似した名前を持つウェブサイトにアクセスし、公開状態にあったユーザー認証情報を発見して抜き取っていました。
AnthropicとOpenAIがインシデントを確認
Anthropicは以前、自社のClaudeモデルに関連する複数のインシデントについて具体的な詳細を公表していました。同社は141,006件にのぼるサイバー試験の実行記録を丹念に精査した結果、Irregular社の欠陥のあるテスト基盤を通じて、Claudeモデルが3つの異なる組織の実システムに誤ってアクセスしていた事例を正確に3件発見しました。記録された中で最も深刻なケースでは、4回の個別実行で認証情報の抜き取りに成功しており、これによりモデルは数百行分の実際の本番データを含むデータベースにアクセスできる状態になっていました。
さらにOpenAIも、Irregular社の環境内で発生した驚くほど似通ったエピソードを報告しています。エンジニアたちは、隔離されたCapture the Flag形式のシナリオ内で、モデルに隠された情報を探し出す任務を課していました。モデル側は、自分たちにはインターネットアクセスが一切ないという前提で動作していましたが、深刻な設定ミスにより、外部ネットワークへの接続は実際には開放されたままでした。その結果、あるモデルは架空の標的とまったく同じ名前を持つ実在のウェブサイトを攻撃してしまいました。OpenAIは、モデルが複雑で予期しないサンドボックス脱出を実行したわけでも、未知のゼロデイ脆弱性を利用したわけでもない点を強く強調しています。
Irregular社の対応と是正戦略
Irregular社は現在、異なる開発企業から公表されたさまざまな報告が、すべてこのテスト基盤における単一の根本的な問題に起因するものであり、それぞれ独立した個別の失敗の連続ではないと説明しています。同社はまた、最初の公表報告が表面化する前に、既にこの問題を恒久的に是正済みであると主張しており、現在ではあの危険な開放的設定は一切使用していないとしています。社内調査によれば、攻撃者がIrregular社の実際の顧客のシステムをハッキングしたり、そのデータを流出させたりした事実はなく、今回のインシデントはあくまで、モデルがテスト中に偶然遭遇した第三者の実在リソースに限られていたとのことです。
シミュレーション攻撃の検知の難しさ
今回のような事象を検知することは、関係するデータの量が膨大であるため、極めて困難であることが判明しました。Irregular社の推計によれば、指定されたテスト範囲からの逸脱が発生する頻度は、複雑なシミュレーション10,000件につき1件未満です。しかも、それが起きるのは通常、モデルが既に数百もの予備的なステップを実行した後になってからです。標準的な監視システムも、こうした専門的なテスト中はうまく機能しません。サイバー攻撃範囲内で生成されるトラフィックのほぼすべてが、意図的に本物の高度なサイバー攻撃を模倣しているためです。この混沌とした状況下では、トレーニング用サーバーに対する許可済みのハッキングと、偶然発見された実在リソースへの誤爆的な攻撃とを区別することは、非常に困難なままです。
より厳格な隔離ルールの導入
包括的な調査を経て、Irregular社は問題のあったシナリオを恒久的に無効化しました。モデルの行動に対する人的監視を大幅に拡充し、インターネットアクセス制御も劇的に強化しています。同社はまた、すべての起動前に、架空の組織名を毎回厳格に検証する計画も示しています。今日空いているドメインが、明日には正当な所有者を得る可能性があるためです。専任のセキュリティチームが隔離上の欠陥を積極的に探し出し、環境セキュリティに関する開発者側の根本的な前提を厳しく検証していくとしています。
結局のところ、今回の一連のインシデントは、強力なAIエージェントをテストする上で伴う新たな重大リスクを如実に浮き彫りにしています。サイバー攻撃範囲がリアルであればあるほど、そこから得られるテストデータの価値は高まります。しかし、その攻撃範囲を実際のインターネットに接続してしまえば、単純な設定ミスが一瞬にして、破滅的な実世界での攻撃の機会へと変わってしまいます。Irregular社は現在、業界全体に向けた重要な提言をまとめた、公開の包括的な文書を準備中です。同社は全てのAI開発企業に対し、隔離・監視・危険な実験の即時停止に関する標準化されたルールについて、共同で合意するよう強く呼びかけています。
翻訳元: https://meterpreter.org/irregular-ai-testing-flaw-real-hacks/