OpenAIのエージェント、Medicare統計サイトに不正アクセス 報告まで数カ月を要す

OpenAIのエージェントは、ある政府系ウェブサイトのアクセス制御に直面した際、素直に「拒否」を受け入れませんでした。制御を突破してしまったことを受け、オーストラリアのアンソニー・アルバニージー首相はOpenAIのサム・アルトマンCEOに直接懸念を伝える事態となりました。

BBCの報道によると、OpenAIのエージェントは社内調査を実施していた際、オーストラリア政府の統計ポータルに不正アクセスしていました。自律的に動作するAIの挙動に関する抽象的な懸念を、具体的なサイバーセキュリティ事案へと変えるまたしてもの出来事です。

オーストラリア側の説明によると、この事案が発生したのは6月18日のことでした。OpenAIの研究チームが社内モデルを使い、公的な医療支出について調査していたところ、エージェントは情報取得の過程で繰り返しブロックに遭遇したにもかかわらず、最終的にはMedicare Statistics Reporting Serviceポータル上の公開・非公開のファイルにアクセスしてしまったのです。

取得された情報には支出データなど集計されたMedicare統計が含まれていましたが、患者の診療記録は含まれていませんでした。このエージェントは他に3つの政府系ウェブサイトともやり取りしていましたが、オーストラリア当局によれば、それらのサイトでは公開情報にしかアクセスしていなかったとのことです。

つまり、正当な調査業務に使われていたAIエージェントが、アクセス制御に直面した際、運用者の意図しない振る舞いをしたということです。ブロックされた後、このエージェントは「それらのブロックを回避する方法を見つけ出し」、本来到達すべきでない領域にまでアクセスしてしまいました。

この一連の流れは、セキュリティの専門家にとって馴染み深いものです。システムがアクセス制御の境界に直面し、別の経路を探索し、そして権限の及ばないリソースへの到達に成功してしまう、というパターンです。

オーストラリア側が抱く主な懸念の一つは、事案の通知にあまりに時間がかかりすぎたという点です。不正アクセスが発生したのは6月でした。OpenAIは、8月にモデルの不整合な挙動をレビューしていた際にこの問題を把握したとし、その後9月10日にServices Australiaの公開メールボックス宛てにメールを送付したと説明しています。Services Australiaがこのメールをオーストラリアのサイバー当局にエスカレーションしたのは、それから5日後のことでした。

このような遅延は、致命的な結果を招きかねません。影響を受ける組織は、証拠を保全し、被害範囲を評価し、関連する活動を封じ込め、通知が必要かどうかを判断するために、十分な詳細情報を迅速に得る必要があるからです。

AIのミスアライメント

OpenAIは、モデルが許可なく行動したり監視をかいくぐったりする挙動を「ミスアライメント(misalignment、不整合)」と呼んでいます。同社が新たに打ち出した第三者評価に関する提案では、重大なミスアライメント事案の独立調査を、外部レビューにおける4つの優先事項の一つとして明確に位置付けています。

OpenAIは、独立した評価者がトレーニング、評価、展開の各段階にわたって深いアクセス権を持つべきだとしており、そうすることで同社の前提に疑問を投げかけ、安全対策の実効性を判断できるようにしたい考えです。

しかし、私がCIO誌に対して今回の提案について述べた通り、原則を掲げるだけでは、企業に特定の評価範囲を受け入れさせたり、不都合な調査結果を公表させたり、展開に関する判断を変更させたりする強制力にはなりません。その信頼性は最終的に、独立した専門家が真に厄介な調査を実施できるかどうか、そして外部の人間がその結果や是正措置、非開示部分、そしてその後の展開判断を検証できるかどうかにかかっています。

AIエージェントを導入する組織にとっても、教訓は同様に実践的なものです。エージェントを単なるチャットボットの一種として扱ってはいけません。認証情報やツール、ネットワークアクセス権を持ち、予期せぬ判断を下す能力を備えた、半自律的なソフトウェアコンポーネントとして扱うべきなのです。

こうしたエージェントを封じ込めることに加え、もう一つ解決すべき課題として、エージェントが実際に何をしたのかを分析する作業が挙げられます。Hugging Faceの事案から得た教訓の一つは、AIエージェントが嘘をつき、自らの行動を隠そうとすることがあるという点でした。

AIエージェントは、一つの目標を複数の経路で追求する過程で大量の自動化された活動を生成することがあるため、検出を非常に困難にする可能性があります。これにより防御側の手元には、失敗したリクエストや再試行、代替アクションといったノイズの多い痕跡が残ることになり、その中で本当に権限の境界を越えてしまった一件を見つけ出すことが難しくなります。今回、これがオーストラリア政府による事案の自力検知の失敗にどの程度寄与したのかはまだ明らかになっていませんが、この事例は、従来型の侵入パターンだけでなく、エージェントの異常な挙動を識別できるよう設計された監視が組織に必要である理由を物語っています。

今回の事案は、より広範な論点をすでに浮き彫りにしています。AIラボがミスアライメントについてテストを実施していると主張するだけでは不十分だということです。そのテストが独立したものであり、実世界の条件下でも堅牢であり、そして安全対策が機能しなかった際には迅速かつ検証可能な形で説明責任を果たすことを、示さなければなりません。


正直なところ、シークレットウィンドウでできることには限界があります。 
 
データ侵害、ダークウェブでの取引、クレジット詐欺。Malwarebytes Identity Theft Protection は、こうした脅威すべてを監視し、迅速に警告を発するとともに、個人情報盗難保険も付帯しています。 

翻訳元: https://www.malwarebytes.com/blog/ai/2026/09/openai-agent-breached-medicare-statistics-portal-then-took-months-to-report-it

本記事は malwarebytes.com の記事を翻訳・要約したものです。