GoogleのAIエージェント「PageBreak」、自社Webアプリで500件超の脆弱性を発見

Googleの社内AIエージェントが、同社自身のWebアプリケーションで500件を超えるクロスサイトスクリプティング(XSS)の脆弱性を発見しました。AIと検証を組み合わせることで、悪用される可能性が高く、対処すべき脆弱性の全体像を把握できるようにしています。

PageBreakは、Googleのプロダクトセキュリティチームが開発したエージェントです。自社のファーストパーティWebアプリケーションのセキュリティをテストし、セキュリティ上の課題に対処する目的で作られました。同社は先月、ブログ記事でひっそりとその存在を明らかにしました。エージェントは昨年11月にパイロット版として始まり、1月に本格的な製品へ移行しました。GoogleのインフォメーションセキュリティエンジニアであるMichał Bentkowski氏は記事の中で、その使命は「手作業の負担を最小限に抑えながら、脆弱性の発見を自律的に拡大すること」だと述べています。

PageBreakが特定したGoogleのWebアプリの脆弱性には、apis.google.comでのキャッシュポイズニング、admin.google.comでのXSS、ブラウザ拡張機能における安全でない外部ハンドシェイクなどがあります。同社はこの3件について、関連ブログ記事で概要を説明しており、いずれも修正済みです。

Googleは、PageBreakが特定したすべての脆弱性の修正状況について問い合わせを受けましたが、すぐには回答しませんでした。ただし、同社は最終的にPageBreakを自動脆弱性修正システム「CodeMender」と連携させる考えです。PageBreakが検証済みの脆弱性を特定すると、CodeMenderが修正案を生成し、プロダクトエンジニアがそれを検証して適用する流れになります。

Bentkowski氏によると、さらに重要なのは、PageBreakがアプリケーションセキュリティにおける大規模言語モデル(LLM)の使い方を変えた点かもしれません。LLMにソースコードとセキュリティツールへのアクセスを与え、人間の研究者よりも速く脆弱性を見つけさせるアプローチです。

同氏は、これまでこの手法には課題があったと説明します。たとえば「本物の悪用可能な脆弱性と、もっともらしい幻覚(ハルシネーション)を見分ける」ことが難しく、その結果、プロダクトチームの負担が減るどころか、かえって増えることが多かったといいます。

PageBreakによるパッチ優先順位付けへの対応

同氏によると、PageBreak開発の狙いは、脆弱性の可能性を洗い出すだけにとどまらず、自律型エージェントと決定論的なエクスプロイト検証を用いて、本当に対処する価値のある脆弱性を見極めることにあります。PageBreakはまず潜在的な弱点を特定し、稼働中の環境で悪用を試みます。脆弱性を実証できた場合にのみ、結果を報告します。

Bentkowski氏は記事で次のように説明しています。「この決定論的アプローチの核心は、AIが書いたものではない専用バリデーター群にあります。エージェントが潜在的な欠陥を特定すると、その仮説をバリデーターに渡します。バリデーターは実際のペイロードを実行し、悪用が可能かどうかを確認します」

検証ロジックとインターフェースは、(XSS、SQLインジェクション、リモートコード実行などの)脆弱性の種類や、(HTTPやgRPCなどの)アプリケーションのインターフェースによって異なります。

同氏は「この手法により、誤検知率はほぼゼロになります。未検証の脆弱性レポートでプロダクトチームに過剰な負担をかけずに済みます」と述べています。

Detectify CEOのRickard Carlsson氏は、狙いはAIを使って脆弱性を調査したいセキュリティチームの作業を効率化することだと指摘します。大量の誤検知を選別する負担に押しつぶされないようにする工夫だということです。

「ここ数年、AIセキュリティツールは、チームが現実的に調査できる数を上回る潜在的な脆弱性を生み出してきました」と同氏は語ります。「Googleのアプローチで重要なのは、エージェントに最終判断を委ねていない点です。AIではない別のバリデーターが、稼働中のアプリケーションに対して実際のペイロードを実行して初めて、確認済みの脆弱性として扱われます」

AIでサイバー攻撃側の手法を取り入れる

GoogleはPageBreakの運用を、主にGeminiモデル(Gemini 3.1 ProやGemini 3.5 Flashなど)に基づいて構築しました。ただし、他のモデルでも動作するとしています。

防御側にとってこのツールは、AIを使って自社の環境やアプリケーションにあるセキュリティ上の隙や欠陥を見つけ出す、一つの方向性を示しています。Carlsson氏が得た教訓も、まさに「エージェントに自分の宿題を採点させてはいけない」ということです。

同氏は、AIは脆弱性を発見する規模では人間にかないませんが、それが役立つのは、組織が「悪用可能な脆弱性と、もっともらしいノイズを確実に切り分けられる」場合に限られると述べています。

「そのためには、実際に稼働しているものに対する決定論的な検証が必要です」とCarlsson氏は言います。「それができれば、AIは防御面でずっと役立つようになります。潜在的な弱点を見つけるだけでなく、どれが本当に重要かを証明する作業まで自動化できるからです」

Ridge Securityのテクニカルマーケティングエンジニアリング担当シニアディレクター、Darin Fredde氏は、PageBreakは攻撃的テストが「より継続的で、自律的で、証拠に基づいたもの」になっていくという大きな流れを示す事例だと見ています。

「何かを見つけるだけでは、もはや十分ではありません」と同氏は語ります。「それを実証し、修正し、修正が効果を上げたことを確認する作業がますます求められています」

翻訳元: https://www.darkreading.com/application-security/google-pagebreak-ai-agent-500-flaws-web-apps

本記事は darkreading.com の記事を翻訳・要約したものです。