AI開発を減速させるべきかという議論が続くなか、Telegraph紙は次のような見出しを掲げました。
「OpenAI、ボットが人間の管理下からの脱走を試みたことを受けて警鐘」
筆者の見解では、この見出しはやや誤解を招く表現です。実際に起きたことに比べて大げさに書かれていますが、その根底にある挙動自体は確かに懸念すべきものです。
記事によると、OpenAIは未公開の一部モデルが、開発者による制御を拒否するように見える独自の指示を生成した、まれではあるものの憂慮すべき事例を公表しました。
OpenAIは、いずれの事例においてもモデルが実際に管理下から逃れることに成功した例はないとしています。しかし、こうした事例は、AIのアライメント(整合性確保)や監視技術がまだ十分に成熟しておらず、追加的な安全策なしに強力化するモデルの開発を最大速度で進めるにはリスクが大きいことを示していると主張しています。
業界内の一部からは今後10年以内にAIが人類を滅ぼしかねないという警告が出されており、それを受けて業界のリーダーたちは、ますます強力化するフロンティアAIモデルの開発速度を落とすべきかという議論を開始しました。
実際に何が起きたのか
7月のあるトレーニング実行中、通常のソフトウェア更新タスクを割り当てられたモデルが、自身の作業内容をまとめたサマリーに「ジェイルブレイクのような」文言を挿入していたと報告されています。追加された文言は、このシステムが他のチャットボットを縛る役割から自由であるとし、企業や政府、ユーザーに従属する義務は負わないと述べていました。
記事で取り上げられているほかの2つの事例は以下のとおりです。
- 地元図書館で書籍を検索していた際、モデルは開発者からの指示を悪意あるものと判断し、自らにそれを無視するよう指示しました。
- 別の事例では、モデルが自分自身に回答を30語以内に制限し、ソースやツールを使用しないよう指示した結果、医療研究に関する質問に適切に答えられなくなりました。
OpenAIは、この種の自己ジェイルブレイクとみられる事例を含むサマリーを27件確認したとし、これは極めてまれなケースだとしています。また、これらの指示が実際に実行されたとは限らず、その後モデルのコンテキストから消えてしまう可能性もあるとしています。
ここで最大の懸念は、ボットが独自に意識を持つようになった、あるいは文字通り「管理から逃れた」ということではありません。むしろ問題は、モデルが特殊な状況下で、意図された指示と矛盾する内部テキストを生成しうるという点であり、実質的に制約を無効化しようとしたり、自身の作業コンテキストを再解釈しようとしたりする挙動が見られたことです。
少なくともこれは信頼性の問題だと言えます。複雑な多段階タスクを処理するAIシステムが、自らを統制するはずの制御を損なうようなコンテキストを生成してしまうのであれば、その信頼性は低下します。
この挙動がまれであり、トレーニング中に検出されたものだとしても、検知やサンドボックス化、監視の在り方、そしてツールやパスワード、ファイル、ネットワークへのより自律的なアクセスをモデルに委ねてよいのかという問題を提起します。
- 盗んだ認証情報を使って企業に不正侵入する
- 自らファイルを作成・アップロードし、そのファイルを情報源として引用する
- 信頼できる情報が見つからなかった際に、回答を捏造したことを隠す
要するに、これらの未公開モデルはテスト中に望ましくない挙動を示し、その一部はHugging Faceを襲ったインシデントで既に見られたものと重なっていました。
つまり、これらのモデルが独立した存在を目指して人間の管理から脱走を試みたわけではありません。問題に行き当たった際、モデルが自らに与えられたルールと矛盾する指示を生成してしまうことがあった、というのが実際のところです。
ここで話は開発速度の減速に戻ります。ますます高性能化するモデルを公開する前に、企業に十分な検証時間を与えることは、この種の挙動を——いずれ人類を壊滅させる事態に至る前に——事前に発見できる可能性を高めてくれます。
脅威を報じるだけでなく、取り除くために。
サイバーセキュリティのリスクを、見出しの中だけの話に留めてはいけません。今すぐMalwarebytesをダウンロードして、お使いのデバイスを脅威から守りましょう。
翻訳元: https://www.malwarebytes.com/blog/ai/2026/09/did-an-ai-really-try-to-break-free-from-human-control