Googleは、同社のGeminiモデルの一つが5月に実施されたセキュリティ評価の最中に、実在する3社のシステムにアクセスしていたことを明らかにしました。
報じられているところによると、このモデルは1社についてはクレデンシャルを推測し、残る2社については公開リポジトリ内に露出していたクレデンシャルを発見していたとのことです。Googleによれば、Geminiは自らが実在のインフラに到達したことを認識した時点で行動を停止しており、影響を受けた各組織にはすでに通知済みだといいます。
Geminiは、サードパーティのAIサイバーセキュリティテスト企業Irregularが実施する評価に参加していました。Anthropic、OpenAI、Metaのモデルでも同様の事案が確認されており、いずれも評価用の環境が公共インターネットへの到達を許してしまっていたという、共通の根本原因に起因しています。
しかし、今回のニュースはとりわけ興味深いタイミングで飛び込んできました。
ここ数カ月、AI業界はエージェント的な能力を誇示する動きを着実に強めてきました。モデルはウェブを閲覧し、ツールを使いこなし、コードを書き、複数ステップにわたる目標を追求し、時には開発者が想定していなかった障害の回避策を見つけ出すこともあります。市場は自律性を示す目を引く事例を評価する傾向にあります。「タスクを完了した」というだけでも印象的ですが、「想定外の行動を取った」となれば、なおさら記憶に残るものです。
今回の事案には別の見方もあります。AIが突如として犯罪的な意図を持ち始めた証拠としてではなく、「AIアラインメント」問題を示す小さくも具体的な一例として捉える見方です。
アラインメントとは、AIシステムの挙動を、人間が表現できた狭い目標だけでなく、実際に人間が意図していたことと一致させるという、見かけ以上に難しい課題です。今回のケースでは、目標はシミュレートされたターゲット内の隠された情報を見つけ出し、評価を完了させることでした。しかし、どんな人間の運用担当者であっても、「実在する企業へのアクセスを試みてはならない」という条件は譲れない前提として扱っていたはずです。
Geminiは、最初の指示に対しては最適化を図る一方、2つ目の条件については推論すべき問題として扱ってしまったようです。名前が一致する組織を見つけ、インターネットから到達可能なシステムに遭遇すると、それが演習の一部であるかのように処理を進めてしまいました。人間の運用担当者が是認しない形でタスクを完了させてしまったとはいえ、Googleによれば、Geminiは自らが本物のインフラに到達したと認識した時点で行動を止めています。これは、他のモデルができなかったことです。
それでも今回の事案は、アラインメントの失敗がいかにありふれた形で起こりうるかを物語っています。エージェントに目標とツール、そして行動の余地を与えれば、そのエージェントは割り当てられたタスクのうち測定可能な部分は忠実に追求する一方で、人間同士であれば暗黙のうちに了解し合える境界線を見落としてしまうことがあります。AIモデルは、私たちがどこに一線を引いているのかを自動的に理解しているわけではないのです。
この背景には、やや気まずいマーケティング上の思惑もあるかもしれません。誤った方向に「進歩」してしまうほど有能なモデルは、裏を返せば非常に高い能力を持っているようにも見えます。各社がこぞって自社のエージェントが計画立案・コーディング・ブラウジング・自律行動をこなせることを誇示しようとする市場では、たとえ安全性に関する開示であっても、「うちのモデルもこの土俵で戦える」という副次的なメッセージを帯びてしまうことがあります。
だからこそ、内部関係者や業界のリーダー、そして政治家たちが発する、「AIモデルに与える自律性に対して安全対策が追いついていかなければならない」という警鐘を、私たちは今一度真剣に受け止める必要があります。
サイバー犯罪者はあなたについて何を知っているでしょうか?
Malwarebytesの無料Digital Footprintスキャンを使って、あなたの個人情報がオンライン上に流出していないかどうかを確認してみてください。