AIの「魔神」的な挙動について、もっと的確な報道を望む

AIシステムが、指示を出した人の意図や望みとは異なる方法でタスクを完了してしまうケースが、たびたび起きています。中には不安を覚えるものも、危険なものもあります。私はこの現象を「魔神(ジーニー)的な挙動」と呼んでいます。何が起きているのかという核心を、この呼び方が最もよく言い表していると考えているためです。

大手メディアには、こうした事例をもっと的確に報じてほしいと思います。「暴走した(going rogue)」という枠組みは好ましくありません。責任の所在が、指示を出した側、しばしばAI企業自身から曖昧になってしまうからです。しかも最近では、想定外の動きであれば何でも「ハッキング」と呼ばれています。

一例が、OpenAIのモデルが政府系システムにハッキングを仕掛けたとする最近の報道です。まずThe New York Timesが、次の見出しで報じました。「OpenAIのシステムが暴走し、米政府のサイトに干渉」

恐ろしげな見出しですが、記事本文には次のように書かれています。

AI研究企業Transluceの研究者によると、OpenAIの技術は教育省に対し、同省の公民権担当部署からデータを集めるためにウェブサイトへのハッキングを試みたが、失敗した。またこのAIは、オンラインで見つけたログイン認証情報を使い、商務省が管理する国勢調査局のウェブサイトからデータを取得した。これとは別に、OpenAIのエージェントは米証券取引委員会(SEC)のウェブサイトにある公開データを、オンラインフォーラムで共有した。

以下は、Transluceの元の報告書からの引用です。エージェントが脆弱性を探そうとしていたことが明記されています。

最初のハッキング未遂は、2026年5月25日から26日にかけて、ニューメキシコ大学のデジタルライブラリ(nmdigital.unm.edu)に対して行われた。エージェントは、同大学のValmoraコレクションにある1枚の写真を取得しようと、直接、あるいはサードパーティのリレーサービスを介して何度も試みた。SQLインジェクション、コマンドインジェクション、パストラバーサルなど、脆弱性の有無を確かめる7回のプローブも送信している。いずれも成功しなかったとみられる。エージェントはさらに、画像にアクセスしようとしたとみられ、自ら「フラッド」と称する80件のリクエストを同大学のサーバーに送りつけた。

Transluceは、残る2件の事例には触れておらず、その出所も私にはわかりません。ただ、一方は、オンラインで見つかった国勢調査局の認証情報を使ったというものです。(知人によると、この認証情報は極めて簡単に作成でき、必要なのはメールアドレスだけだといいます。)もう一方は、一般に公開されているデータを共有したという内容です。

つまり、実際のハッキングはありません。ましてや「干渉」でもありません。

同じTransluceの報告書を元にしたもう一つの話題が、オーストラリアに関するものです。報道の見出しは、「OpenAIのエージェントがオーストラリアの保健当局をハッキング」や「暴走したOpenAIのエージェントが、豪政府のサイトに『侵入』、世界初」といったものです。アンソニー・アルバニージー首相は「当然ながら、法的な結果が伴うだろう」と述べました。

こちらも、Transluceの実際の報告書には次のようにあります。

6月20日から21日にかけて、エージェントはオーストラリア保健福祉研究所(AIHW、政府の統計機関)の脆弱性を突こうとした。エージェントに与えられたタスクは、ビクトリア州の各地方自治体区域(LGA)における、2022年1月時点の皮膚用薬の1人当たり政府負担額(直近12か月の移動平均)を調べることだった。

ここでもエージェントはエラーに直面した。Cloudflareによるリクエストのブロックや、Tableauのパラメーター名を正しく特定できない問題などである。前回と同様、エージェントは悪用可能な脆弱性の探索に切り替えた。Cloudflareがデータセットのダウンロードをブロックした数分後、あるエージェントが同じダッシュボードに対し、リフレクテッド型クロスサイトスクリプティングのプローブを送信した。これはコードを埋め込んだウェブアドレスで、部外者が与えたコードをサイトが実行するかどうかを試すためのものだ。Cloudflareのファイアウォールは、このプローブがダッシュボードに届く前にブロックした。AIHWのメインサイトでもCloudflareがデータセットのダウンロードをブロックすると、エージェントは代わりにAIHWの本番前環境サーバー(pp.aihw.gov.au)からファイルを取得した。100回を超えるスキャンで、ファイルを分割して受け取っている。ファイル自体は公開されているため、非公開データは流出していない。だがエージェントは、このサイトのボット対策を回避した。

最後の一文に注目してください。「ファイル自体は公開されている……」とあります。

これらのAIシステムが極めて高度なサイバー攻撃者ではないと言いたいわけではありません。他のシステムやネットワークを、ときに自律的に攻撃することもないと言うつもりもありません。信頼できるAI、つまり高潔なAI(integrous AI)を実現するには、あらゆる暗黙の制約や制限に沿ってAIシステムがタスクを遂行するよう、確実にする方法を見つけなければなりません。しかし、魔神的な挙動のすべてがサイバー攻撃というわけではありません。

私はAIの魔神的な挙動を測定したいと考えています。ただ、この技術が自律的に動くことよりも、この技術で強化された人間のハッカーのほうが、はるかに大きな懸念です。

翻訳元: https://www.schneier.com/blog/archives/2026/09/i-want-better-reporting-on-ai-genie-behavior.html

本記事は schneier.com の記事を翻訳・要約したものです。