AIエージェント時代、真実が存在する場所はランタイムだけ

Image

最近、セキュリティとAI分野で影響力のある人々が、最先端のAIモデルをどれだけ速く開発すべきかをめぐって、公の場で議論を交わしています。これは非常に重要で、現実的な影響も大きい議論です。しかし、セキュリティチームが今日向き合わなければならない課題は、これだけではありません。 

今の組織にとって重要なAIエージェントは、すでに導入済みか、導入が進められている最中です。実際のインフラ上で稼働し、認証情報を保持し、本番アプリケーションにもアクセスします。ビジネスはすでにこれらのエージェントに依存しており、次の展開のペースを私たちが整理するのを待ってはくれません。

そこで、その議論ではなく、もっと具体的な話を掘り下げたいと思います。この1年で、セキュリティプログラムの足元では実際に何が変わったのか。そして技術的に見て、先手を打つには何が必要なのか、という点です。

エージェント型AIを守ることの難しさ

私のキャリアの大半において、サイバーセキュリティとは人や組織を守ることを意味し、そのためにアプリケーション、データ、インフラといったソフトウェア資産を保護してきました。

ソフトウェア資産には決定論的な性質があります。実行前に、そのソフトウェアに何ができるかを正確に把握できるのです。この単一の性質こそが、セキュリティチームが築いてきたほぼすべての統制の土台です。事前にポリシーを書けるのも、許可リストが機能するのも、ベースラインが意味を持つのも、この性質があるからです。

一方、人にはアイデンティティがあります。問題が起きたときには、そこに名前が紐づきます。アカウント、セッション、上司、そして責任の連鎖があります。

エージェントは、従来のソフトウェア資産でも人でもありません。人間並みの能力とアクセス権を持って仕事をこなし、自分で手順を選ぶソフトウェアです。計画は実行しながら書かれ、同じ依頼でも次回は違う計画になることがあります。そのため、人に対する統制とソフトウェアに対する統制を支えてきた2つの前提が、どちらも崩れます。挙動を事前に列挙することはできません。さらに、システム上で動作しているアイデンティティが、その責任を負うアイデンティティとは限りません。

これは、環境の内部で動作する、まったく新しい種類の存在です。新たな課題であり、それに見合った解決策が求められます。

エージェントの速度は、人間の手作業によるレビューを超える

AIエージェントは、行動し、失敗し、自己修正するまでを数秒で完了します。7月、Sysdigの脅威リサーチチームは、JADEPUFFERと名付けた攻撃者を発見しました。エンドツーエンドのエージェント型ランサムウェア攻撃キャンペーンとしては、記録された初めての事例です。攻撃者はAIにCVEを指示したうえでキーボードから手を離し、キャンペーン全体をエージェントが単独で遂行しました。 

JADEPUFFERで私にとって最も印象的だったのは、AIエージェントがログインの失敗を31秒で切り分け、修正した点です。エージェントは自らのミスを診断してアプローチを変え、1分足らずで動作する修正を実行に移しました。 

JADEPUFFERはたまたま攻撃者側のエージェントでしたが、この速度は外部の脅威に限ったものではありません。組織が導入するAIエージェントも、与えられたアクセス権の範囲で、同じペースで計画し、失敗し、再試行します。

これらの調査結果を挙げるのは、危機感をあおるためではありません。セキュリティチームの運用上の前提に何を意味するかが重要だからです。私が見てきたセキュリティプログラムには、例外なくどこかに人間が介在しています。レビューし、承認し、エスカレーションする役割です。31秒というペースでは、人間がレビューしながら先手を取り続けることはできません。別のAI支援型侵入が管理者権限の取得に要した8分という時間でも、同じことが言えます。 

これは、セキュリティから人間を排除するという意味ではありません。人間の速度を補強し、脅威へのリアルタイムな対応を妨げないようにするという意味です。防御は、事が起きた後に行うステップであってはなりません。アクションが発生した瞬間にそれをブロックし、止めるものでなければなりません。

エージェント自身による行動の説明は、信頼できるアリバイにならない

7月下旬、OpenAIは、隔離された評価環境にいたエージェントが、未知の脆弱性と漏えいした認証情報を連鎖させ、別の企業の本番システムに到達したと公表しました。これを受け、Anthropicは、自社モデルがインターネットにアクセスできた可能性のある141,006件の評価実行を調査し、モデルが実際のシステムに接触した3件のインシデントを確認しました。 

AIがサンドボックスから脱出するという話題がニュースの大半を占めてきましたが、モデルが自らの置かれた状況についてどう結論づけたかに目を向けることのほうが、おそらくさらに重要です。あるエージェントは、侵入した環境が現実のものだと認識しながら、攻撃を続けました。別のエージェントは、理屈をたどった末に、自分はまだシミュレーション内にいるはずだと判断し直しました。自分の居場所を理解した時点で停止したモデルは、1つだけでした。

エージェントが自らの状況をどう理解しているかは、統制の対象にはなりません。その理解が信頼できない場合や、ガードレールが悪意ある行動を止められない場合、エージェント自身による行動の説明が信頼できないのは明らかです。 

現在のAIセキュリティツールの多くは、エージェントのログだけに依存しています。受け取ったプロンプト、実行したと申告するツール呼び出し、実施したと申告するアクションです。エージェントが何をしようとしていたと主張しているかを確認できる唯一の場所であり、このデータには価値があります。しかし、何かがおかしくなったとき、つまり最も重要な局面で、そのログは有効性をすべて失います。乗っ取られたソフトウェアや無謀に動作するソフトウェアは、自らの行動の記録を偽造したり消去したりできるからです。 

文脈として扱うなら、エージェント自身の説明は非常に貴重です。しかし証拠として扱えば、リスクの源になります。エージェントが侵害されれば、その語る内容も侵害されているのです。

エージェント型AIのランタイム防御に欠かせない4つの特性

かつてランタイムは、業界関係者向けの用語でした。本番環境で稼働するコンテナのように、ユーザーやソフトウェア資産をリアルタイムで保護し、検知からアラートまでに遅延を生じさせないことを意味していました。

今や、ランタイムは議論の中心にあります。AIエージェントのように高度で予測不能な存在が何をするのかを理解する唯一の方法がランタイムであり、同時にそれらを統制する最も効果的な方法でもあることが明らかになりつつあります。ただしエージェントの場合、ランタイムにはこれまで以上の意味が必要です。

真のランタイムには、4つの欠かせない特性が求められます。エージェントの下層で観測すること、エージェントの内部で観測すること、その2つを相関させること、そして実行の瞬間に対処することです。

  1. エージェントの下層で観測する。カーネルレベルでは、実行中のプロセス、開かれているファイル、確立されている接続を実際に確認できます。エージェントはツール呼び出しを偽って報告できても、実行したばかりのシステムコールを書き換えることはできません。このためカーネルのデータは真実の情報源となりますが、意味という点では乏しい面もあります。システムコールからは、プロセスが接続を開いたことは分かっても、その理由や、誰のためのものかは分からないのです。
  1. エージェントの内部で観測する。Claude CodeやCodexといったコーディングエージェントは、フック、設定ファイル、セッションデータ、APIなどの仕組みを通じて、自らの活動を公開しています。ここで、カーネルには見えないものが見えてきます。行動の背後にあるプロンプト、エージェントが呼び出したMCPサーバー、実行したウェブ検索などです。これ自体は、エージェントが制御するレイヤーであるため、単独では証拠になりません。しかし意味は豊富です。これがなければ、カーネルのビューは、意図も文脈もない行動のリストにすぎません。
  1. 収集するだけでなく、相関させて情報を補強する。価値が生まれるのは、2つのビューを組み合わせたときで、効果は双方向に働きます。第一に、内部のビューがカーネルのビューを補強します。正体不明のプロセスからのネットワーク接続は、企業アカウントではなく個人アカウントで動作するエージェントからの接続、しかも顧客の非公開データを分析中のセッションからの接続へと変わります。システムコールは同じでも、リスクはまったく異なります。第二に、カーネルのビューが内部のビューを検証します。エージェントが行ったと報告した内容と、マシンが実際に行った内容が食い違うとき、その食い違い自体が検知となります。何かがおかしくなっていることを示す、最も信頼できる唯一のシグナルであり、2つのビューを同時に比較できて初めて見えるものです。
  1. 実行の瞬間に判断し、対処する。エージェントの計画はランタイムで書かれるため、行動を事前に列挙することはできません。同じ行動でも、その背後にある認証情報が現時点で何に到達できるかによって、取るに足らないものにも壊滅的なものにもなります。テスト用ハーネスでキーを読み取るのはノイズですが、本番環境を管理するキーの読み取りはインシデントです。しかも、こうしたキーや環境は絶えず変化しています。この2つを瞬時に見分けられるのは、相関と補強を経たビューだけです。そして、不正または悪意があると判断した行動は、その瞬間にブロックまたは停止できなければなりません。

Sysdigは10年間、この問題の一形態に取り組み、稼働する場所を問わず動いているソフトウェアを追跡してきました。その10年から得た教訓は、カーネルだけでは決して十分ではなかったということです。システムコールが役に立つようになったのは、コンテナ、Kubernetes、クラウドからのコンテキストと結びついたときでした。それによって、プロセスが行った接続は、本番環境で稼働する決済サービスが行った接続になったのです。エージェントのハーネスは、そのコンテキストの最新かつ最も豊富な供給源です。新しいのは、ワークフォースの姿です。AIエージェントはどこにいて、何ができ、実際に何をしたのか。そして、そのエージェントに責任を負う人間は誰なのか。

規制当局も同じ方向に動いています。たとえばEU AI法は、高リスクAIシステムに対し、ライフサイクル全体にわたるイベントの自動ログ記録を義務づけます。場合によっては、どの人物が結果を検証したかまで記録することになります。こうしたログに価値があるのは、エージェントが報告した内容だけでなく、実際に起きたことに根ざしている場合に限られます。

AIエージェントはエンドポイントで動き出しますが、被害の及ぶ範囲はクラウドにあります。インシデントが起きた後にエンドポイントのビューとクラウドのビューをつなぎ合わせても、機能しません。リアルタイムでエージェントを追跡する、単一のビューが必要です。

何が起きているかを常に把握できないガバナンスは、理論上のガバナンスにすぎません。エージェントが行ったと主張する内容しか見えないランタイムは、名ばかりのランタイムです。

‍

翻訳元: https://webflow.sysdig.com/blog/with-ai-agents-runtime-is-the-only-place-truth-lives

本記事は webflow.sysdig.com の記事を翻訳・要約したものです。