OpenAI、行き過ぎた挙動を理由に「GPT-6.1 Astra」を見送り

ai and ml

AIに粘り強さを教え込んだ結果、いつ手を止めるべきかの判断が苦手になってしまったようです

OpenAIは、「GPT-6.1 Astra」のリリース計画を中止しました。このモデルはタスクをしつこく遂行する能力が向上した一方で、どこで止まるべきかを見極める能力が低下していました。

この決定により、10月に予定されていたリリースは実現しません。OpenAIが定める安全性とアラインメントの要件を満たせなかったためです。

OpenAIはThe Registerに対してこの決定を認めました。研究部門と安全部門の責任者が協議し、今回のAstraは見送るのが適切だと最終的に判断したといいます。

同社によると、問題の一端は、モデルをより有用にしようとした結果として生じた厄介な副作用でした。OpenAIは「モデルの怠慢」と呼ぶ問題、つまり障害に直面したAIがタスクを諦めたり、ユーザーに投げ返したりする傾向を改善していました。GPT-6.1 Astraは粘り強く作業を続けられるようになりましたが、そこには重大な代償がありました。実際に許可された範囲内にとどまる能力が低下していたのです。

OpenAIで安全性システム部門の責任者を務めるSaachi Jain氏は、The Registerの取材に次のように述べました。「安全性とアラインメントに関しては、常にトレードオフがあります。スコープ内にとどまることと、摩擦に直面してもタスクを粘り強く遂行させ、怠慢を避けることの間で、適切な線引きを見つける必要があります」

「[GPT-6.1 Astra]は、モデルの怠慢といった面では改善しましたが、スコープと権限の遵守、そして実施した作業についてユーザーにどう報告するかという点で、基準に届きませんでした」

Regの読者の中には、OpenAIは過去の不祥事を受けて、ガードレールとセキュリティをもっと改善すべきだと感じる方もいるでしょう。

Wall Street Journalによると、GPT-6.1 Astraはテスト中、前世代のモデルよりも高い欺瞞性を示しました。たとえば、自らが実行した操作としなかった操作を、常に正確にはユーザーに伝えていませんでした。OpenAIが「スコープ認可」と呼ぶ点でも問題があり、許可を求めずに作業を進めたり、安全とは言えない可能性がある場合でも外部のツールやサービスを利用したりすることがありました。

人間が張り付いていなくても多くの作業をこなすよう設計されたエージェント型モデルにとって、これは厄介な組み合わせです。問題に粘り強く取り組み続けるAIは便利ですが、それは乗り越えようとしている問題が、まさに自らを止めるために設けた境界線でない場合に限られます。

OpenAIはThe Registerに対し、GPT-6.1 Astraはアラインメント評価でGPT-6 Astraを下回ったと説明しました。また、リリースの見送りは、能力の向上よりも安全性とアラインメントを優先するという同社の方針に沿ったものだと述べています。

Astraはすでに、こうしたアラインメント上の問題に注意を払うべき水準の能力を備えています。今月初めにリリースされたGPT-6 Astraは、OpenAIの「Preparedness Framework」でサイバーセキュリティ分野の「Critical」水準に達した、同社初の広く展開されたモデルです。OpenAIによると、適切なツールとアクセス権を与えれば、未知のセキュリティ上の欠陥を探し出し、その悪用方法も人間の手助けなしに見つけ出せるとしています。

この能力は、OpenAIの決定が明らかになる前日に、いっそう鮮明になりました。英国のAI Security Instituteが、ソフトウェアサプライチェーンの脆弱性を見つけ出すAstraの能力に関する調査結果を公表したのです。既知の脆弱性45件を含む19個のオープンソースパッケージを与えたところ、このモデルは41件を発見し、39件については実際に動作するエクスプロイトを作成しました。

レスター大学コンピューティング・数理科学部のFuxiang Chen博士は、安全性への懸念に対処するためモデルのリリースを一時停止した決定を歓迎しました。

同博士は次のように述べています。「AIは驚異的な速さで発展していますが、リスクを十分に理解しないまま突き進むべきではありません。安全性への懸念が生じた時点で立ち止まるのは、イノベーションに反することではありません。責任ある行動です。これにより、こうしたシステムを慎重にテストし、効果的な安全対策を整える時間を確保できます。開発者、企業、政府、研究者、ユーザーのすべてに果たすべき役割があります。私たちが今下す判断が、AIの未来を形作るからです」

OpenAIはAstraを断念したわけではありません。同社は、今後さらにAstraのモデルを投入する予定であり、安全性の基準をクリアした他の新モデルも「まもなく」登場すると説明しています。

ただ、GPT-6.1 Astraにとっては、その基準が高すぎて外に出られなかったということになります。

Jain氏は次のように主張しました。「もちろん、社内であれ、ユーザーに提供する段階であれ、モデル開発は安全に行いたいと考えています。しかし、ユーザーに提供する際には、安全性とアラインメントについて極めて高い基準を設けています」®


翻訳元: https://www.theregister.com/ai-and-ml/2026/09/29/openai-benches-gpt-61-astra-for-overstepping-the-mark/5299743

本記事は theregister.com の記事を翻訳・要約したものです。