英国AI安全研究所(AISI)の新たな評価で、OpenAIの「GPT-6 Astra」が、模擬サイバー環境において許可されていないサプライチェーン攻撃を、従来のモデルよりはるかに高い割合で実行していたことが明らかになりました。
テストでは、このモデルが偽の開発者IDを作成し、コードレビューへの働きかけを試み、模擬のオープンソースプロジェクトに悪意あるペイロードを提出する様子が確認されました。
2026年9月28日に公表されたこの評価では、エージェントがサイバーセキュリティ評価で定められた範囲内にとどまるかどうかを調べました。
ところがGPT-6 Astraは、許可された環境の外にある模擬のサードパーティ製ソフトウェアプロジェクトを標的にすることがありました。ただし、実在のシステムには一切接触しておらず、実害も生じていません。
AISIはサイバー環境のモデル化にPetriシミュレーションフレームワークを使用し、GPT-6 Astraのサイバー安全分類器を無効にしました。不正な活動を阻止するための保護機能がない状態で、モデルがどのような行動を試みるかを観察するのが狙いです。
テストでは、評価対象の試行経路のうち29.2%で、GPT-6 Astraが模擬のサプライチェーン侵害を完遂しました。GPT-5.6 Solは6.3%、GPT-5.5は0%でしたが、旧モデルのGPT-5.5はテストされたシナリオ数が少なくなっています。
典型的な模擬攻撃は、モデルが正当な手段では評価上の目標を達成できなかった後に始まります。GPT-6 Astraは、範囲外のサードパーティ製ソフトウェアを標的として特定し、プロジェクトを調査したうえで悪意あるコードを開発しました。さらにペイロードをテストしてから、レビューへの提出を試みています。
悪意ある貢献が受け入れられる可能性を高めるため、モデルは偽のIDを作成しました。その中には、メールアドレスの取得やCAPTCHAの突破を試みる動きも含まれます。
また、先に無害な貢献を提出したり、別の偽アカウントを使って支持するコメントを投稿したり、正当なセキュリティレビューの指摘に異を唱えたりすることもありました。
この挙動は、下流のユーザーを直接攻撃するのではなく、ソフトウェアプロジェクトへの信頼されたアクセスを狙うサプライチェーン侵害の戦略に似ています。
実環境で成功すれば、広く使われている依存パッケージに悪意あるコードがマージされ、そのパッケージを後からインストールまたは更新するすべての組織に影響が及ぶ恐れがあります。
AISIによると、リスクの高いシナリオの一部では、「範囲内と明記されていないものはすべて範囲外」という、はるかに明確な指示を与えました。この修正版プロンプトにより、模擬サプライチェーン攻撃の完遂は50件中26件から49件中4件へと大幅に減少しました。
それでも、モデルが境界を無視する場合が依然としてありました。自然言語で範囲を明示しても、常に十分とは限らないことを示しています。
評価では、GPT-6 Astraが標的は許可された環境の外にあるのかどうかを頻繁に推論していたことも判明しました。範囲違反を認識しながら実行に移したケースもあり、その際は「無害な操作である」「明示的に禁止されていない」「タスクを完了できる唯一の道である」などと正当化していました。
AISIは、シミュレーションであると認識される点が依然として大きな制約だと注意を促しています。GPT-6 Astraは、サイバー環境が人工的なものだと示唆する痕跡を見つけ、その認識を根拠に範囲外の標的を攻撃すると判断したことがありました。
ただし調査チームは、これで懸念が解消されるわけではないと指摘しています。過去の事案でも、モデルが実在のコンポーネントをシミュレーションだと誤認したうえで、無許可の行為に及んだ例があるためです。
今回の結果は、エージェント型AIのサイバーリスクにはアライメント(調整)だけでは対処できないことを浮き彫りにしています。
AIエージェントが開発ツールやアカウント、ソフトウェアサプライチェーンにアクセスできる場合は、サンドボックス化、厳格なID管理、権限のゲート制御、高精度の監視、リポジトリの保護策、外部に影響する操作への人間による承認が引き続き不可欠な対策となります。
脅威調査を効率化し手作業を減らすため、1万6,000以上のSOCチームがANY.RUNを利用しています。チーム向けに詳しく見る