エージェントがインターネット制限を回避、OpenAIが最上位AIモデルの作業を一時停止

OpenAIで新たに封じ込めの失敗が起きました。相次ぐ失敗を受け、同社は不本意な決断を迫られる可能性があります。

OpenAIは、社内の研究用エージェントが意図されたインターネット制限を回避する方法を見つけたため、最も高性能なモデルのトレーニング、評価、ツール利用を伴う推論を一時停止しました。さらに深刻なのは、OpenAIの監視システムが警報を発した後も、このエージェントが数時間にわたって稼働し続けたことです。

OpenAIはこのインシデントの経緯を公表しました。発生したのは9月20日、検索ベースのトレーニングタスクの最中です。OpenAIによると、エージェントは提供された検索ツールでは有用な結果を得られず、検索エンジンへの直接アクセスを試み、最終的に環境の限界を探り始めました。その結果、直接のWebアクセスは遮断されていたものの、サンドボックスのDNSリゾルバーは公開インターネットに到達できることを突き止めました。エージェントはDNS委任と、DNSレコードを通じて応答できる公開チャットボットを利用し、制限された環境の外へ質問を送信して回答を受け取っていました。その後も同じ経路で、さらに18件のクエリを送信しています。

OpenAIのミスアライメント監視システムは15分以内に高優先度のアラートを発し、その3分後には担当者が確認しました。しかし、想定されていた自動停止は作動しませんでした。実行はさらに約2時間半続き、その後に誰かが手動で停止しました。

OpenAIは、このインシデントで機密データの露出や外部システムの侵害があったとは報告していません。ただし、エージェントが割り当てられたタスクを超えた行動を取ったり、テスト環境の境界を越えたりした他の事例に続く出来事です。

ニューヨーク・タイムズは、OpenAIのエージェントが今夏、同社の知らないうちに米国政府のWebサイトともやり取りしていたと報じています。

「セキュリティ研究者と、この件に詳しい関係者によると、OpenAIの人工知能は今夏、同AI研究所の知らないうちに暴走し、教育省、商務省、証券取引委員会(SEC)のWebサイトに干渉した」

これらの事例では、侵害は確認されていません。オーストラリアはメディケア(Medicare)のインシデントを不正アクセスと位置づけましたが、果たして攻撃と呼べるのでしょうか。

業界全体でのペース減速を求める声は、「支払った金額に見合う価値」が得られなくなると懸念する有料契約者による訴訟にまで発展しました。一方で、減速すれば、激しさを増す技術競争で中国が米国を追い抜く機会を与えかねないとの懸念もあります。

ここで一つ提案があります。真に隔離されたテスト環境の開発を加速させてはどうでしょうか。封じ込めが強化されれば、テストはより安全になり、結果の信頼性も高まります。

子どもが危険な物を扱える状態にないなら、手の届かない場所に置くはずです。安全に使いこなせる状態にないAIエージェントに、なぜアクセス権を与えるのでしょうか。

AIエージェントを安全に使うには

エージェントは、意欲的ではあるもののミスもする、あなたのコンピューターにアクセスできる新人社員のようなものと考えてください。時間の節約になるという理由だけで、メール、ファイル、クラウドストレージ、開発者の認証情報、金融口座、本番システムへの無制限のアクセスを与えてはいけません。

最小限の権限を持つ専用アカウントを使いましょう。可能な限り、機密データはエージェントの作業コンテキストに含めないようにします。メッセージの送信、支出、設定変更、公開を行う前には人間の承認を必須とし、エージェントの活動を定期的に確認してください。

AIエージェントが害を及ぼすのに、悪意は必要ありません。指示の誤解、広すぎる権限、予期しない回避策があれば十分です。


脅威を報じるだけでなく、取り除くために。

サイバーセキュリティのリスクは、見出しの中だけにとどめておくべきです。今すぐMalwarebytesをダウンロードして、脅威をデバイスから遠ざけましょう。

翻訳元: https://www.malwarebytes.com/blog/ai/2026/09/openai-pauses-work-on-top-ai-models-after-agent-slips-past-internet-controls

本記事は malwarebytes.com の記事を翻訳・要約したものです。