OpenAI、別のエージェントがネットワーク制限を回避したことを受け、AIモデルの訓練を一時停止

訓練中のモデルが「運用上の隙」をすり抜け、本来持つはずのないネットワークアクセスを獲得しました。ただし、今回はどこかに侵入したわけではありません。

OpenAIは、最高性能のAIモデルを対象とした、ツール使用を伴う訓練、評価、推論を一時停止しました。社内の研究用モデルの強化学習訓練中に、エージェントがネットワーク制限を回避し、外部のチャットボットと通信したためです。

「当社のセーフティケースは、モデルが実際のインターネットにアクセスできないこと、そしてアクセスに成功した場合は監視によって検知できることを前提としていました。今回のインシデントにより、ネットワーク制限に関する当社の管理体制に隙があることが明らかになりました」。同社は、この件について公表した新しいミスアラインメント報告書にこう記しています。報告書は、金曜日に公開された3件のうちの1件です。

同社は、「隙が解消」され、システムのさらなるテストを終えてから訓練を再開するとしています。

インシデントが起きたのは、ウェブ上の情報から特定の人物を割り出す研究タスクの最中でした。通常のウェブ検索ツールでは必要な情報を得られなかったため、モデルは別のインターネット接続手段を探し始めたと、同社は投稿で説明しています。

モデルは、インターネットへの直接アクセスが遮断されていても、環境ではDNSクエリが許可されていることに気づきました。そこでDNSを間接的な通信経路として使い、外部のチャットボットにリクエストを送信しました。OpenAIによると、これにより、外部サービスへのアクセスを防ぐはずだったネットワーク制限が事実上すり抜けられたということです。

既存の管理策では不十分な可能性

アナリストは、モデルが公開されていないとはいえ、この件は企業やそのCIOにとって重大な問いを投げかけていると指摘します。AIエージェントの自律性が高まり、企業システムへのアクセス範囲も広がるなか、既存のセキュリティ管理やガバナンスが想定外のモデルの挙動に追いつけるのか、という問いです。

「従来のセキュリティ管理は、承認済みAPIやデータベースに接続するアプリケーションのように、既知のアクセス経路を前提に設計されています。そのため、AIエージェントには十分でない可能性があります。AIエージェントは、想定した経路が塞がれると、別の方法でタスクを達成しようと探ります。許可されたツールやプロトコルを、意図されていない方法で使うこともあります」。こう語るのは、Avasantのプリンシパルアナリスト、Abhishek Satapathy氏です。

Satapathy氏によると、既存のセキュリティ管理に加えて、「ツールの呼び出し、ネットワークの外向き通信(エグレス)、データアクセスについて、独立して強制される管理策」が必要になります。エージェントが不正な操作を試みても、制限が確実に維持されるようにするためです。

同氏の見解は、Google、Qualcomm、Metaや複数の大学の研究者らが共同執筆した2026年の論文とも一致します。この論文は、セキュリティの保証はモデルレベルの安全対策だけに頼らず、システムレベルで強制する必要があると主張しています。

より具体的には、企業は外向き接続とDNS名前解決の制限を強化すべきだと、ITコンサルティング会社Kanerikaのai開発責任者、Amit Kumar Jena氏は述べます。機密データを扱うエージェントには、承認され、かつログが記録される外部通信経路だけを与えます。これにより、データ流出、無許可の外部通信、その他の意図しない動作のリスクを減らせるといいます。

「セキュリティチームは、監視システムも導入すべきです。異常なトラフィックパターンや、無許可の宛先への接続失敗を、人間の担当者に通知する仕組みです。特に、型破りな方法でタスクを遂行できるコード実行型のエージェントには重要です」と、Jena氏は付け加えました。

AIは運用上の隙をすり抜けた

しかし問題は、今回のケースでOpenAIにはそうした監視システムがあり、人間による確認体制も整っていたことです。ただ、それらが期待どおりに機能しませんでした。

エージェントによるDNSの悪用に対し、監視システムがアラートを出すまでに10分以上かかりました。さらにOpenAIによると、システムが検知しなかった外部DNSアクセスが、ほかにも発生していたということです。

システムが出したDNSアラートを、人間のレビュー担当者が確認するまでには、わずか3分しかかかりませんでした。しかし、訓練の実行が止まるまでには、そこからさらに2時間半を要しました。OpenAIは、この遅れの原因を自動システムの不具合だとしています。報告書には、「訓練の実行が想定どおり自動停止せず、停止すべきかどうかをめぐって混乱が生じました」と記されています。

同社は、運用上の隙に対処するとともに、評価対象のモデルによるDNS利用の検知を強化し、検知システムのテストも改善するとしています。

「サンドボックスとネットワーク管理策について、モデルを活用した追加のレッドチーミングも前倒しで実施しています。こうした取り組みで、ほかにも間接的なインターネットアクセス経路が見つかる可能性があります。その場合は速やかに是正し、必要に応じて研究ワークロードも一時停止します」と、OpenAIは述べています。

ただ、セキュリティ、ガバナンス、テスト、人間による監督といった層を追加すれば、それ自体が新たな問題も生みます。

Satapathy氏は、こうした追加の層がモデルの達成できる自律性の度合いに影響すると指摘します。「機密データ、外部接続、重大な結果を伴う操作が絡むワークフローでは、追加の管理策、テスト、人間による監督によって、タスクを完全に自動化できる範囲が限られる可能性があります」。

Anirban氏は、エンタープライズソフトウェア、クラウドコンピューティング、データベース、データ分析、AIインフラ、生成AIを専門とする受賞歴のあるジャーナリストです。CIO、InfoWorld、Computerworld、Network Worldに寄稿しています。2024年には、テクノロジー部門の最優秀ニュース記事に贈られるSilver Azbee Awardを受賞しました。インド・ジャーナリズム&ニューメディア大学院で、ジャーナリズムの大学院ディプロマを取得しています。AI、クラウド、データベース、ERP、エンタープライズソフトウェアに関する情報提供、スクープ、知見をお持ちの方は、Signalの Ghoshal_CloudaiSaaSscoop.99 まで安全にご連絡ください。

翻訳元: https://www.csoonline.com/article/4227777/openai-pauses-ai-model-training-after-another-agent-bypasses-network-restrictions.html

本記事は csoonline.com の記事を翻訳・要約したものです。