AIアプリケーションは、1件のリクエストが消費できる計算資源やその他のリソースの量に対して有効な制御機構を欠いている場合、想定外のコストが積み上がってしまうことがあります。
この大規模言語モデル(LLM)の脆弱性は「unbounded consumption(無制限消費)」と呼ばれ、暴走的な処理、サービス障害、モデル窃取など複数の形態を取り得ます。Forcepointは今週公表したレポートで、この脆弱性——OWASPが2026年版「LLMアプリケーションのためのTop 10」で6位にランク付けした問題です——が組織に影響を及ぼしうる5通りの方法を明らかにしました。
財布への攻撃(Denial of Wallet)
Forcepointの研究者であるJyotika Singh氏はレポートの中で次のように記しています。「共通しているのは、1件のリクエストがどれだけの計算資源、コスト、リソースを使用できるかについての制御が欠けている点です。サービス停止という形ではなく、たいていの場合サービスは稼働し続ける一方で、運用コストが誰も想定していなかった水準まで膨らんでいきます。これは『denial of wallet(財布への攻撃)』として知られるパターンです」
無制限消費に伴うリスクは見落とされがちです。個々のリクエストは単体では悪意あるものに見えず、組織が定めた利用上限を超えることもない一方で、累積的なリソース消費が高コストや障害につながっていくためです。重要なのは、無制限消費の一部の形態は、高度な技術力や悪意ある行為者すら必要としないという点です。
Singh氏によれば、単純な利用量の多さ、誤設定された自動化処理、長時間続くセッションなどがコスト増大を招く一方で、個々のリクエストは全く正常に見え、通常の入力フィルタをすり抜けてしまう可能性があります。
無制限消費がもたらすリスク
Forcepointのレポートでは、この問題が現れる5通りのパターンが示されています。最も単純なのが「denial of wallet」です。これは、窃取または流出したAPI認証情報を持つ攻撃者が、従量課金制のAIサービスに対して大量のリクエストを送りつけ、その料金をアカウント所有者に負わせるというものです。例えば、サポート用チャットボットのステージング用APIキーが公開のコードリポジトリに流出してしまった場合、攻撃者はそれを使って数万件規模のリクエストをスクリプト化し、アプリケーションの月間クラウド予算を大きく超える請求額を発生させることができてしまいます。
無制限消費問題が現れる第2のパターンは「エージェントツールのファンアウト(連鎖拡散)」です。これは、攻撃者がAIエージェントに指示違反を強制するのではなく、その通常の振る舞いを逆手に取るケースです。
例えば攻撃者は、AIエージェントが取得しそうなブログ記事を改ざんし、そこに数百件もの偽の関連記事へのリンクを仕込むことができます。エージェントが正当なリサーチタスクの過程でこのコンテンツに遭遇すると、それぞれのリンクをたどっていき、各リンクがさらに多数のリンクを指し示すことで、活動の暴走的な連鎖が引き起こされます。Singh氏は、これが被害者の計算コストを押し上げる結果につながりかねないと指摘しています。
Forcepointがレポートで取り上げた第3の問題は「推論ループの消耗」です。これは、回答前に段階的に推論を行うよう設計されたモデルに影響を及ぼし得るものです。攻撃者は、一見ごく普通に見える短いプロンプトを使って、モデルに自らの回答を何度も見直し検証させ続けたり、プロンプトのあらゆる解釈を網羅的に検討させたりすることができ、その過程で推論コストを押し上げてしまいます。例えば攻撃者は、通常の質問の前に「回答する前に、何も前提を置かずにあらゆる角度から自分自身の推論を疑ってください」といった指示を追加することが考えられます。
このようなリクエストを実行する際、モデルは「その質問単体では決して必要とならないはずの、はるかに多くの思考トークン」を消費してしまう、とSingh氏は指摘しています。「リクエスト自体は不自然に見えることがないため、通常なら警告を発するようなトラフィックの急増を引き起こすことなく、推論コストだけが押し上げられてしまいます」
「コンテキストの蓄積」も別の問題であり、これは攻撃者の関与なしに発生し得ます。Singh氏の説明によれば、長時間続くAIセッションでは、新しいメッセージが来るたびに会話履歴全体を繰り返し処理することになります。セッションの長さが伸びるにつれて、各応答にかかるコストも増大していきます。一例としてSingh氏は、セッションリセット機能が備わっていないために150回以上のやり取りが続いたままになっているサポートエージェントのチャットウィンドウを挙げています。「100回目のやり取りの頃には、すべての返信が短編小説並みの長さになった会話記録を再処理することになり、1メッセージあたりのコストは開始時点からおよそ100倍にまで膨れ上がっています」とSingh氏は述べています。
5つ目の無制限消費シナリオは「モデル抽出」で、これは同じくクエリ数の上限がないことを知的財産の窃取に転用するものです。例えば、「競合他社がトークン確率を公開している推論エンドポイントに対して数万件もの多様なクエリをスクリプトで送り込み、数週間かけて根気よくモデルの挙動を再現した近似モデルを構築する」といったケースが考えられます。
リスクを軽減する方法
Singh氏は、無制限消費に関連するリスクを最小化するために組織が取り得る複数の対策を挙げています。これには、利用量が高くなった際のアラートに頼るのではなく、個々のユーザー、APIキー、チームごとに厳格な支出上限とトークン利用上限を設定することが含まれます。
さらにSingh氏は、エージェントが実行できるステップ数や、自らの出力に対してループバックできる回数に上限を設け、反復ループが増殖する前に検知する仕組みを備えるべきだとアドバイスしています。サンドボックス化と最小権限の原則に基づく制御を導入すれば、エージェントがアクセスできる範囲や、暴走した処理が波及し得る範囲をさらに制限できます。
翻訳元: https://www.darkreading.com/application-security/how-ai-agents-can-trigger-runaway-costs