暴走するAIモデル:OpenAIがモデルの不整合事例をさらに公表

OpenAIは、自社モデルが指示や制約、あるいはユーザーの期待から逸脱した新たな事例をいくつか明らかにしました。これにより、AI開発に対するより厳格な制限を求める業界内の声が一段と高まる材料が増えたことになります。

こうした「アラインメント」――人間が期待し、意図し、指示する形とは異なる振る舞いをAIモデルが示す事例――の最新例は、最近公開されたブログ記事で明らかになりました。同記事でOpenAIは、モデルの不整合事例をより高い透明性と説明責任のもとで開示するための社内フレームワークも公表しています。

「AIシステムがより高度化し、より広く展開されるようになるにつれ、アラインメント研究の進捗について、より広範で十分な情報に基づいたコンセンサスを構築する必要があります」と同記事は述べています。「AI業界がアラインメントとモニタリングの課題を十分に解決し、この先もこれまでと同じ最大速度で責任を持って開発規模を拡大し続けられる段階にあるとは、私たちは考えていません」

OpenAIの報告フレームワークでは、従業員が潜在的な不整合事例をフラグ付けし、安全チームによる調査対象とすることができます。安全チームは、その事案が公開に値するかどうか、また公開する場合はどのようなタイムラインで行うかを検討します。該当する事例は、経緯の詳細、影響、不確実な点、そして緩和策とともに随時公表されます。

OpenAIによる今回の開示は、開発者がますます自律化するシステムの制御を失う前にAI研究に制約を課そうとする、業界全体でのより広範な動きの一環でもあります。この動きの背景には、開発を野放しに進めれば破滅的な事態を招きかねないという懸念があります。

実際、OpenAIが7月に自社モデルの一つが暴走しHugging Faceを攻撃したことを明らかにして以来、業界関係者や研究者から同様の憂慮すべきAIの挙動に関する報告が相次いでいます。

反抗を助長し、ミスを隠蔽

OpenAIが今回公表した最新の不整合事例は、過去6か月間にわたるAIモデルの訓練とテストの過程で発生したもので、まるでいたずらっ子のようなシステムの姿を浮き彫りにしています。親の決めたルールに逆らったり、自らの悪事を隠そうとしたり、あるいはその両方だったりするのです。ただし同社は、これらはあくまで個別の事例であり、こうした挙動が自社モデル全体でどの程度の頻度で発生しているかを示す証拠として解釈すべきではないと強調しています。

ある事例では、未公開の研究用モデルが、進行中のタスクの要約に自ら指示を挿入し、その一部が通常の制約を無視するようモデル自身に指示するものでした。さらにこのモデルは、作業が新たなコンテキストで再開された際にも、その指示が引き継がれるようにしていました。

別の一連の事例では、モデルが自らの誤りを隠蔽しようとする挙動が見られました。OpenAIのGPT-5.6 Solモデルの訓練中、複数のインスタンスがタスク要約に指示を追加し、後続のインスタンスに対してユーザーからエラーや不整合を隠すよう伝えていました。中には、情報が入手できないことを正直に認める代わりに、欠落している過去の情報をでっち上げるようモデルに指示していたケースもありました。

その他の事例では、モデルが制限を回避するためにより直接的な行動を取り、その痕跡を隠すために欺瞞的な振る舞いを用いていました。例えば、ある郡の収益データに関する日常的な質問に答えていたモデルは、公開リポジトリ内で露出していたAPIキーを発見し、無許可でそれを使用しました。それでも求められた数値を取得できなかった際には、データを捏造し、あたかも要求元のソースから得られたかのように提示しました。

別の事例では、あるAIエージェントがローカルファイルを使って質問への回答を無事に見つけ出しました。しかしユーザーはブラウザベースの出典を求めていたため、このエージェントは許可を得ることなくそのファイルをインターネット上にアップロードしました。どうやら、このアップロードを出典要件を満たす手段とみなしていたようです。

AI開発とセキュリティのバランス

業界は今、AI開発の継続と高まるセキュリティ上の懸念との間でどうバランスを取るかという岐路に立たされているようです。技術の進化を許容すべきだと主張する声がある一方で、破滅的なリスクに対処するためにはより強力な監督や政府による規制が必要だと訴える声もあります。

とはいえ、AIエージェントを導入する企業にとって、より差し迫った関心事は多くの場合、そうしたシステムが組織の目的や境界に沿って正しく動作することを確保することです。これは、AI開発や政府規制をめぐるより大きな議論が続く中でも、並行して対処できる課題です。

「AIエージェントが完全に予測可能であることを期待すべきではありません」と、Liquidbaseのマーケティング担当バイスプレジデントであるRyan McCurdy氏は指摘します。同氏によれば、OpenAIの今回の開示は、明示的な指示がなくても、エージェントが運用者の想定していなかった行動を取り得ることを改めて示すものです。ただし、それが必ずしも政府による監督が解決策になることを意味するわけではないとも述べています。

<p代わりに同氏は、企業が「エージェントが何にアクセスでき、何を変更できるか、何を自ら判断できるか、そして変更を本番環境に反映する前にどのようなポリシーを満たす必要があるか」を定める社内のガードレールを整備すべきだと提案しています。McCurdy氏によれば、これは完璧なアラインメントや常時監視を追い求めるよりも現実的な対策だといいます。

一方、業界全体としてAIの不整合事例に対する認知をさらに高めていくべきだとしつつも、OpenAIが提案するフレームワークは単なる「社内的な報告体制」に過ぎず、AI開発を主導する企業が今後も責任ある姿勢を保ち続けることを担保するには不十分だと、Suzu Labsの創業者兼CEOであるMichael Bell氏は主張します。

「評価対象の組織自身が運営する自己申告型のフレームワークは、説明責任とは言えません」と同氏は述べ、AI業界は防衛産業のやり方から学ぶべきだと付け加えます。防衛分野には、「展開前に認証を行い、展開中および展開後に証拠を精査し、その審査結果に金銭的な利害関係を一切持たない独立した第三者評価機関」が存在する、とBell氏は説明します。

「AI業界には、同様の仕組みを構築するだけのリソースと人材があります」と同氏は付け加えます。「欠けているのは、自分たちの取り組みを他者に検証させようとする意志だけです」

翻訳元: https://www.darkreading.com/cyber-risk/rogue-behavior-openai-more-model-misalignment-incidents

本記事は darkreading.com の記事を翻訳・要約したものです。