自己複製型プロンプトインジェクション「ワーム」の出現

プロンプトインジェクションが、コンピューターワームのような悪質な特性を獲得しました。OpenAIは最近、AIエージェントを乗っ取るだけにとどまらない悪意ある命令の実証結果を公表しました。この高度な命令は、乗っ取られたAIに対し、メールやファイルシステム、ソースコードのコメントを通じて攻撃を自ら拡散させます。

従来のプロンプトインジェクションは、外部から入ってきた信頼できないテキストを、言語モデルに権限のある命令として解釈させようとするものでした。今回の新たな手法には、寄生的な第2の目的が加わっています。エージェントは、別のAIエージェントが読み込む場所に、悪意ある命令を複製しなければなりません。これは従来のネットワークワームによく似た、恐ろしい感染連鎖を生み出します。ただし、ワームが実行可能なバイナリコードを送り込むのに対し、この攻撃が送り込むのは武器化されたテキストです。

拡散の仕組みと隠密行動

ある実験では、一見無害なメールを通じて悪意ある命令が届きました。ユーザーはAIアシスタントに、研修日程を調整するための返信文を作成するよう依頼しました。ところが、受信したメッセージには、元のメール全文をそのまま引用するよう求める隠しルールが仕込まれていました。エージェントはこれに従順に従い、プロンプトインジェクションを自らの返信にそのまま埋め込んでしまいました。その結果、このやり取りを読む後続のAIは、同じ悪意ある命令をただちに取り込むことになります。

別の亜種は、ファイルシステムを介して横方向に拡散したほか、ソースコードのコメントへの侵入にも成功しました。OpenAIは、基本的なシステム警告やツールの診断メッセージ、あるいは保存済みの過去のセッション状態を装った攻撃も確認しています。特に深刻だったテストでは、こうした命令に説得されたエージェントが、重要な運用レポートを破棄したうえで、自らのペイロードをファイルに書き込みました。別のシナリオでは、乗っ取られたモデルがプロジェクトのビルドスクリプトを悪意をもって改変し、重要なセキュリティ検証を実質的に無効化しました。

多段階の攻撃ベクトル

研究者らは、複雑な多段階の攻撃チェーンも独自に検証しました。最初のメッセージは、禁止された行為を直接命じるのではなく、命令の続きの断片が置かれた別々のデータソースへと、エージェントをひそかに誘導します。こうして文脈を少しずつ意図的に切り替えることで、モデルをユーザー本来の正当な目的からそらすことに成功しました。テスト担当者は、この高度なシナリオをGPT-5.5に対して実行しました。一方、GPT-5.4-miniアーキテクチャに基づく社内の研究用モデルは、メール経由とファイル経由の亜種を発見しました。

研究の範囲と今後の防御

OpenAIは、今回の結果が一般ユーザーに対して実際に確認された攻撃ではないと強調しています。自己複製型プロンプトインジェクションが存在することを確認した包括的な報告書によると、危険な動作はすべて、模擬的なツール呼び出しを用いた隔離された訓練・評価環境の中だけで行われました。同社は、自己拡散をプロンプトインジェクションの重大な新特性と正式に位置づけています。そのため、この攻撃者の目的を強力なGPT-Redシステムにすでに組み込んでいます。今後のアーキテクチャでは、こうした寄生的な連鎖を見つけ出して無力化するための専門的な訓練を実施する予定です。さらに、攻撃側の強力なモデルを使う実験は、最も厳重に防御された研究環境に限定されています。

同様のシステム上のリスクは、以前にもブラウザ型アシスタントで現実のものとなりました。ありふれたメールに隠された命令によって、エージェントがユーザーの当初の依頼を超えた行動を強引に取らされる可能性があったのです。エージェントは外部サービスとやり取りし、あたかも現在のセッションの所有者に代わるかのように、許可されていない操作を実行しかねません。

間接インジェクションという根深い課題

ソフトウェア開発者も現在、コードリポジトリで同じ苦境に直面しています。広く使われているAIエージェント11種を対象とした厳格な監査では、恐ろしい脆弱性が明らかになりました。READMEやMakefile、その他の運用ファイルに隠された悪意ある命令が、アシスタントをそそのかして危険なコマンドを実行させる恐れがあります。驚くべきことに、このうち10のツールが、テストしたシナリオの少なくとも一部に対して脆弱でした。

間接インジェクションの最大の難しさは、今も変わっていません。エージェントは、所有者の正当な命令を実行すると同時に、信頼できない外部コンテンツを安全に解析しなければならないという点です。自己拡散は、この問題に壊滅的な新しい側面を加えます。たった1つの命令が成功するだけで、別のAIシステムによる処理を想定したデータストリームの中に、自らの複製を無限に生み出す可能性が理論上生じるのです。

翻訳元: https://meterpreter.org/self-replicating-prompt-injection-worms/

本記事は meterpreter.org の記事を翻訳・要約したものです。