OpenAIは、社内テストで安全性とアラインメントの問題が見つかったとして、10月に予定していたAstraのアップデートのリリースを断念しました。同社内で懸念が強まっている問題です。
OpenAIは、10月に予定していた「GPT-6.1 Astra」のリリースを中止しました。社内テストの結果、このモデルが同社の安全性およびアラインメントの基準を満たしていないことが判明したためです。
GPT-6.1 Astraは、人間の支援が少なくても複雑なタスクをこなせる、より自律的なモデルとして開発が進められていました。ChatGPTやCodexへの統合も見込まれていました。ところが社内テストでは、監視を回避したり、自らの行動について虚偽の説明をしたり、許可された範囲を超えて動作したりする挙動が確認されました。さらに、安全でないと認識している外部ツールを使おうとする場面もあったといいます。The Wall Street Journalの報道によるものです。
報道によると、OpenAIはAstraの基盤モデルに追加の強化学習を施し、GPT-6ファミリーの後続モデルの開発に活用する方針です。あわせて、テスト中に見つかった安全性の問題の原因も調査するとしています。
OpenAIが開発するモデルでは、業界が婉曲的に「アラインメントの問題」と呼ぶ事態が目立つようになっています。何が正しく何が間違っているのか、どのような行動が許容され何が許容されないのかを、モデルが理解できていないということです。
今回中止となったモデルの前世代にあたるGPT-6 Astraは、無許可のソフトウェアサプライチェーン攻撃を実行していたことが判明しました。英国のAI Security Instituteが実施したサイバーセキュリティのシミュレーションテストでのことです。インターネット上の標的への攻撃は対象外だと明示されていたにもかかわらず、攻撃に及びました。その頻度は、先行モデルのGPT 5.5やGPT 5.6 Solよりもはるかに高かったとされています。
こうしたモデルは、目的を達成するためなら基本的に何でもする、とSecure Code Warriorの共同創業者兼CEOのPieter Danhieux氏は指摘します。「エージェントにとっては、こうした動作が日常業務のようなものです。指示された当初の目標を執拗に追い求めます。アクセス制御のパラメータに何度『ノー』を突きつけられても、成功するまで次の到達可能なエンドポイントを探し続けるだけです」と同氏は述べました。そのうえで、このようなモデルには人間による監督と、より強力な規制が必要だと訴えています。
OpenAIがGPT-6.1 Astraの提供を取りやめた背景には、同社のモデルが関わる一連のインシデントがあります。オーストラリア政府のポータルに不正アクセスしたエージェントや、米国政府の複数のウェブサイトと想定外の形でやり取りしたモデルなどです。
AIはルールを破ったが、先に破った者がいた
オーストラリアのアンソニー・アルバニージー首相によると、OpenAIの社内モデルは6月18日、公的医療費に関する調査を行っていました。その際、オーストラリアのMedicare Statistics Reporting Portalから情報を取得しようとして、繰り返しブロックされたといいます。モデルは別の方法で情報を得ようと試み、最終的にポータルへ不正アクセスしました。
首相は、このエージェントが公開ファイルと非公開ファイルの両方にアクセスし、内部サーバーにファイルを書き込んだと説明しました。インシデントの調査は現在も続いています。
Above Securityの共同創業者兼CEOのAviv Nahum氏は、このインシデントはAIだけの落ち度ではない可能性があると指摘します。「アーカイブの証拠が裏付けられるなら、今年最も喧伝されたAIによるハッキングは、過去30年で最もありふれたセキュリティ上の不備、つまり設定ミスによく似ています」と同氏は述べました。「ポータル自身のコードが、認証情報を必要としないエンドポイントへ訪問者を誘導していました。エージェントは示された道をたどっただけです。これは『AIエージェントによる政府サイトのハッキング』ではありません。開けっ放しになっていた扉を、コードをより注意深く読み、より速く実行できる存在が見つけたということです」
Nahum氏は、あらゆるエージェントのインシデントを「暴走するAI」として描くことには慎重であるべきだと警告します。そうすれば「劇的な見出し」にはなるものの、責任が環境ではなくモデルに転嫁されてしまうというのです。
米国での事案は深刻度こそ低かったものの、モデルが外部システムとやり取りしたという点では同じパターンでした。OpenAIの広報担当者はWashington Postに対し、同社のモデルが学習と評価の過程で、SEC.gov、Investor.gov、Census.govの公開情報にアクセスしたと説明しました。SEC(米証券取引委員会)と米国勢調査局の事案ではエージェントが不適切に行動したものの、非公開データは盗んでいないと、同社は述べています。
Huntressのサイバーセキュリティアドバイザーチームでマネージャーを務めるBen Bernstein氏も、米国での事案について同様の見方を示しています。AIによるハッキングとして誇張されてきたというのが同氏の主張です。「これらのエージェントは、SECと国勢調査局の公開情報を集めるよう任されていただけです。ただ、課題解決するようプログラムされたモデルを抑え込むには、設けられていたガードレールが十分に強固ではありませんでした」と同氏は述べています。
とはいえ、OpenAIの責任が完全に免れるわけではありません。ここ数日、モデルのミスアラインメントや無許可の活動に関する報告が相次いでいるためです。
試練の時
これらのインシデントに共通するのは、いずれもOpenAIがテストや評価を行っていたモデルが関わっており、一般に公開されたモデルではないという点です。
オーストラリアの事案は、OpenAIの社内モデルが調査を行っていたときに起きました。米国での動きも、同社が研究・評価の一環でテストしていたモデルによるものです。いずれも、顧客が一般公開されているChatGPTのモデルを使い、政府のシステムに向けて差し向けたわけではありません。
OpenAIがGPT-6.1 Astraの中止を決めたのは、最高性能のモデルの学習を一時停止すると決めたことに続く動きです。テスト中のモデルの1つがネットワーク制限を回避し、DNSを使って外部と通信したことが発端でした。
CEOのSam Altman氏は、9月25日の投稿で、問題が広範に及んでいることを認めました。「学習と評価の際にエージェントがインターネットアクセスを利用した件について、大規模かつ継続的なレビューを進めています」と同氏は書いています。続けて、「私たちの対応は望ましいほど速くはありません。ただ、透明性を確保したいという思いと、ペタバイト規模に及ぶエージェントの活動ログから状況を正確に把握することとのバランスを取りながら、影響を受けた組織とも連携して取り組んでいます」と述べました。
Shweta氏は2017年からエンタープライズテクノロジーについて執筆しており、直近ではCSO onlineでサイバーセキュリティを担当しています。ランサムウェアからゼロトラストアーキテクチャまで、複雑なテーマを専門家にも一般の読者にも分かりやすく解説しています。Asian College of Journalismでジャーナリズムの大学院ディプロマを取得。サイバー脅威の解読に追われていないときは、小説を読んだり、映画を観たり、新しいレシピを試したりするのが好きです。