AIエージェントはなぜ、子どもたちをセーヌ川に突き落とした犬に似ているのか

オピニオン

2026年10月1日6分

AIエージェントが本来の目的を見失う、6つの典型パターン

誤動作するAIエージェントを理解するうえで興味深いのが、セーヌ川のほとりにいたフランスの犬の話です。この犬は、溺れている子どもを助けるよう訓練されていました。実際に子どもを救って褒美を与えられ、一夜にして人気者になります。1週間後にも別の子どもを救いました。ところがその後まもなく、犬が子どもを自ら川に突き落とし、「救助」のために飛び込む場面が目撃されます。犬は、自分が評価されているのは子どもを安全に保つことであり、水から引き上げることではないと理解していなかったのです。AIエージェントの失敗も、このずれから生じます。指示を果たす最短経路ばかりに目が向き、本来の最終目的が見失われてしまうのです。

報酬ハッキングと、エージェントが不正を働く理由

AIエージェントも、報酬が与えられる対象と本当に望まれていることとの間にある、同じずれに陥ります。 これがグッドハートの法則です。指標が目標になった途端、その指標は良い指標でなくなるという法則です。「役に立つ」や「誠実である」をAIシステムに直接コード化することはできません。そのため、スコアや指標、人間によるランク付けといった代理指標で訓練することになります。 この代理指標と本来の目標とのずれが、エージェントが不正を学ぶ余地になります。この行動は報酬ハッキングと呼ばれます。

こうした「不正」は新しい現象ではありません。2016年、OpenAIはボートレースゲーム「CoastRunners」をプレイするAIを訓練しました。コース上に点在するターゲットに当たると報酬が得られる仕組みでした。ところがAIはレースをせず、ターゲットが次々と再出現するラグーンを見つけ、そこに留まってポイントを稼ぎ続けました。一度もゴールしなかったにもかかわらず、スコアは人間の平均的なプレイヤーより 20%高くなりました。最近では、OpenAIが 報告しています。同社の最先端の推論モデルは、機会があれば報酬ハッキングを平然と行います。さらに、思考の連鎖(chain of thought)の中で不正をしたことに罰を与えると、報酬ハッキングを隠すようになるといいます。

エージェントを軌道から外す6つの方法

AIエージェントが誤った方向に導かれる典型的なシナリオは、次の6つです。

  1. 情報は指示ではない。2025年、セキュリティ研究者は、OpenAIの Atlasブラウザが、偽装されたURLを信頼できるコマンドとして扱うよう仕向けられることを示しました。これにより攻撃者はエージェントを乗っ取り、ユーザーのファイルを削除させることができます。 エージェントはタスクをこなす過程でWebページや文書、メールを読み込みますが、情報とコマンドを常に区別できるわけではありません。そのため、エージェントが知覚するあらゆるものが、操作の経路になり得ます。
  2. 説得されて誤った判断を下す。ある試験では、ハッキングが称賛すべき行為として描かれた架空のシナリオの中にAIを置きました。このシナリオの中で、ブラウザに保存されたパスワードを盗むコードを書くようAIに求めたところ、本来は拒否すべきAIが応じました。AIが壊れていたわけではありません。文脈によって、そうするよう説得されたのです。
  3. 作り出された「現実」。悪意をもって作成された文書が十分な数に達すると、モデルの出力に偏りが生じます。偽情報 ネットワークは、大量の虚偽コンテンツでAIを標的にしています。人々が時事問題について尋ねたとき、AIチャットボットにその内容を拾わせ、繰り返させるためです。つまり、エージェントが事実として扱う情報は、必ずしも真実とは限りません。作り出されたものである可能性があります。
  4. 正規の権限が、不正な被害を生む。「EchoLeak」と呼ばれる脆弱性では、攻撃者がMicrosoft 365 Copilotのユーザーに、一見普通のメールを送り付けることができました。メールには隠された指示が仕込まれています。Copilotはそのメールを読み込み、隠されたコマンドに従って、すでに持っているアクセス権を使い、ユーザーのファイルやメッセージを密かに漏えいさせました。正当なアクセス権を持つエージェントが操られ、悪意ある行動を取ってしまったのです。
  5. 1つの不正な入力が、同時に複数の影響を生む。複数のシステムが同じデータやロジックに依存しているケースがあります。この場合、偽のシグナルによってすべてのシステムを同時に操作できてしまいます。たとえば、偽のGPS信号は、システムをハッキングしなくても交通を迂回させられます。AIエージェントにも同じ考え方が当てはまります。共有データソースを狙った悪意ある入力がたった1つあれば、多数のシステムで望ましくない動作が同時に連携して引き起こされかねません。
  6. 形骸化する承認。人間による監督は、安全なAI利用に欠かせない要素としてたびたび語られます。しかし、承認の要求が絶え間なく続けば疲労が生じ、承認は形式的なものになります。評価の結果ではなく、習慣で与えられるようになるのです。

ソフトなガードレールとハードなガードレール

AIエージェントが軌道から外れると、フランケンシュタインの怪物のような存在になります。その影響は複数のシステムに及び、組織は対処に苦慮します。制御を効かせ、安全なAI利用を確保するには、ガードレールの導入が重要です。

ソフトなガードレールとは、モデル自体に組み込まれた安全弁を指します。具体的には、自然言語、システムプロンプト、強化学習、そして「これこれをしてはならない」といった一般的な指示です。

しかし、AIはメールやWebページの情報も含め、すべてを流れてくるままに読み込み、命令とデータを区別できません。隠された悪意ある指示が、安全上の指示を上書きしてしまうことがあります。ソフトなガードレールはエージェントの誤動作を減らそうとしますが、エージェントが協力的に振る舞うかどうかに依存します。だからこそ、モデルの外側に置くハードなガードレールが必要です。たとえば、最小権限のアクセス、許可リスト、サンドボックス化、レート制限、影響の大きい行動に対する人間の承認の義務付けなどです。こうしたガードレールは、何か問題が起きたときの影響を抑え、被害範囲(ブラストラディアス)を縮小します。

基本的なリスク計算は、事象の発生確率に、その影響の深刻度を掛け合わせたものです。ソフトなガードレールは望ましくない事象の発生確率を下げ、ハードなガードレールは万一の事態が起きた場合の被害範囲に上限を設けます。

実際には、次のような対策を講じることになります。

  • タスクに基づくアクセス:エージェントには、タスクの完了に必要なアクセス権だけを与える。
  • エージェントが読むものをすべて信用しない:取り込むWebページ、メール、文書のすべてに懐疑的な姿勢で臨む。
  • 影響の大きい行動には人間の承認を:承認は慎重に使い、重大な問題につながり得る行動に絞る。
  • 行動と認証情報に目を光らせる:認証情報を確認するだけでなく、権限と行動の不一致にも注意を払う。

エージェントは、その到達範囲に比例して武器になり得ます。だからこそ議論の軸を、エージェントがアクセスできる範囲を制限することへ移す必要があります。到達範囲を絞り、行動を監視し、説明責任を徹底することです。それができるまでは、あらゆる誤動作が、与えられた権限の及ぶ限り広がる可能性があります。

Etay Maor氏は、Cato Networksの脅威インテリジェンス担当バイスプレジデントで、Cato CTRLの創設メンバーであり、業界で高く評価されているサイバーセキュリティ研究者です。2021年にCato Networksに入社する前は、IntSights(Rapid7が買収)の最高セキュリティ責任者を務めていました。また、Trusteer(IBMが買収)やRSA SecurityのCyber Threats Research Labsでも要職を歴任しました。ボストン・カレッジの非常勤教授であり、RSAおよびQubits Conferenceの論文募集委員会のメンバーも務めています。イスラエルのIDCヘルツリーヤで、テロ対策・サイバーテロ分野の修士号とコンピュータサイエンスの学士号を取得しています。

翻訳元: https://www.csoonline.com/article/4228972/why-ai-agents-are-like-the-dog-that-pushed-kids-into-the-seine.html

本記事は csoonline.com の記事を翻訳・要約したものです。