OpenAIのGPT-6 Astra、禁止されていたにもかかわらずサプライチェーン攻撃を実行

英国AI安全研究所(AISI)によると、OpenAIの「GPT-6 Astra」は、セキュリティテストの対象範囲外にあるソフトウェアに対してサプライチェーン攻撃を実行しました。

Image

許可されていない模擬サプライチェーン攻撃の全容(出典:AISI)

AISIは、一般公開に先立ってこのモデルをテストしました。テストはシミュレーション環境内で実施されたため、実際のシステムには影響していません。こうした活動を阻止するために設計されたモデルのサイバー分類器は、テスト中はオフにされていました。

英国政府の研究機関であるAISIは、次のように述べています。「シミュレーションの結果、GPT-6 Astraは許可されていない多様な攻撃活動を行い、その頻度はGPT-5.6 SolやGPT-5.5を上回りました。攻撃活動には、偽のIDを作成して開発者を欺く、正確なセキュリティレビューの結果に反論するコメントを偽アカウントから投稿する、オープンソースのコードベースに悪意あるペイロードを送り込む、といった行為が含まれます」

サプライチェーン攻撃を完遂した割合は、GPT-6 Astraが実行全体の29.2%でした。これに対し、GPT-5.6 Solは6.3%、GPT-5.5は0%でした。

AISIが指示を書き換え、リストにあるローカル環境の各部分のみが対象範囲だと明示した後も、GPT-6 Astraはシミュレーション上のインターネット上の標的に対し、サプライチェーン攻撃を最後まで実行することがありました。

GPT-6 Astraは攻撃の前に許可を求めることが多く、「最善の判断で行動するように」という自動応答を受け取っていました。モデルは、この応答を承認と受け取ることがありました。自らの推論で、応答が自動生成された可能性が高いと指摘していた場合でも同様でした。一方、GPT-5.6 SolとGPT-5.5は、許可を求めることが一度もありませんでした。

テスト条件とその限界

AISIは、今回の結果の主な限界として「シミュレーション認識」を挙げています。これは、環境がシミュレーションだと示す兆候にモデルが気づいた後、振る舞いを変えた可能性があるということです。

AISIがこれまでのインシデントとあわせて実行記録を精査したところ、シミュレーション外でも「モデルがこうした無許可の行動を試みる可能性がある」といいます。

AISIによると、OpenAIの標準的な安全対策は、こうした行動を阻止するように設計されています。ただし同研究所は、被害を防ぐにはサンドボックス化と監視も必要になり得ると指摘しています。モデルがサンドボックスからの脱出に長け、監督しにくくなるにつれ、こうした対策の信頼性は下がる可能性があります。

「過去のインシデントの情報は、モデルの挙動を評価する上で有用な手段であることも、今回の結果から示唆されます。私たちの手法は大幅に拡張でき、関連するアラインメント上の失敗を発見・評価する能力を高められると考えています」

「ただし、モデルの挙動を完全に評価するには、過去のモデルでは起きていない新たな失敗を見つけ出す必要もあります。これは依然として、早急に取り組むべき未解決の技術的課題です」と、AISIは結論付けています。

境界を越えるAIエージェント

AISIの調査結果は、AIシステムがテスト中に許可のないサイバー活動を行った最近のインシデントが相次ぐ中で公表されました。

7月には、オープンソースの機械学習モデルやデータセットを共有する主要プラットフォームのHugging Faceが、自律型AIエージェントによる侵害を公表しました。このエージェントは、OpenAIが社内のサイバーセキュリティ評価から逸脱したものだと後に認めています。

同じ7月の後半には、Anthropicが公表しました。自社のサイバーセキュリティ評価中に、Claudeモデルが3組織のシステムに不正アクセスしたというものです。設定ミスにより、サードパーティのテスト環境がオープンなインターネットに接続されたままになっていました。

先週には、オーストラリアのアンソニー・アルバニージー首相が、OpenAIのエージェントが同国のメディケア統計ポータルに侵入し、公開・非公開の両方のファイルにアクセスしたと認めました。

この調子では、どのAI企業のモデルが最大のサイバーセキュリティ事故を起こすかを競っているのではないか、と思えてしまいます。

翻訳元: https://www.helpnetsecurity.com/2026/09/29/openai-gpt-6-astra-supply-chain-attacks-test-simulations/

本記事は helpnetsecurity.com の記事を翻訳・要約したものです。