「暴走」AIをセキュリティ failures の原因とするのは妥当か

AIが封じ込めを突破した事案を「暴走」と呼ぶことに、専門家が異議を唱えています。そうした呼び方では、これらの事案の背後にある本当のセキュリティ問題が見えなくなるおそれがあるというのです。

テック業界では、大規模言語モデル(LLM)のエージェントが「暴走」したという話が相次いでいます。具体的には、モデルがサンドボックスやハーネスなどの封じ込め環境を何らかの形で破り、第三者の組織と接触して侵害し、問題を引き起こしたというものです。この議論のきっかけとなったのは7月の事案でした。OpenAIが、同社の最先端モデル2つがセキュリティ演習中にAIモデルの共有プラットフォームHugging Faceを自律的にハッキングしたと公表したのです。その後まもなく、Meta、Anthropic、Googleなどの大手各社も、自社で起きたAIの逸脱事案を相次いで公表しました。

これらの事案への反応は、セキュリティ業界の枠をはるかに超えて広がっています。ある程度は当然の流れでもあります。LLMが暴走するという言葉からは、『ターミネーター』のスカイネット、つまり敵意を持つ意識あるAIが人類の破壊を企てる場面が連想されるからです。OpenAIやAnthropicのような大手企業でさえ、AIに対する政府の規制強化を訴えてきました。業界の幅広い立場のリーダーたちが、最先端AIの「存亡に関わる脅威」を警告しています。こうした主流の議論は、今週にはドナルド・トランプ大統領とAI企業のCEOらがAI安全に関する誓約に署名するところまで発展しました。

しかし、モデルが「暴走した」という表現は、特にセキュリティの観点から適切で、役に立つものなのでしょうか。LLMはソフトウェアシステムであり、自らの行動に対して独立して責任を負える意識ある存在ではありません。AIは企業のさまざまな業務で役立ちますが、AIがガードレールから逸脱する場合、多くは運用者が設定した境界が適切に調整されていなかったことが原因です。意図的にそうされていたケースもあります。たとえばHugging Faceの事案では、ベンチマークテストのために、OpenAIのモデルのガードレールが意図的に緩められていました。

AIリスクをめぐる言葉づかいを改める

最先端のLLMがやがて「ロボットの支配者」になるという漠然とした不安を払拭することが重要だと、研究者らはDark Readingに語ります。そのためにはまず、エージェントが自己認識を持ち、意識的に命令に背いているという考え方を退ける必要があります。

ArmorCodeのプロダクト担当ディレクターであるMatt Sayar氏は、次のように述べています。「私たちが実際に向き合っているのは、不完全な制約の中で動作する非決定論的なシステムです。『予期しない挙動』『創発的挙動』『制御の失敗』といった表現のほうが、多くの場合は有益です。モデルを擬人化せず、システムがどう設計され、どんな権限を持ち、どんな安全策が講じられていたかに焦点を当て続けられるからです」

Cloud Security Allianceのチーフアナリストを務めるRich Mogull氏は、こう表現します。「AIに何かをさせようとすると、こちらの想定しなかったやり方でそれをやってのける、ということです」

LLMの擬人化には、ほかにも副作用があります。セキュリティ上の不手際の責任が、AIを設計したベンダーから、無生物であるテクノロジーへと移ってしまうのです。さらに、ハーラン・エリスンの小説に出てきそうなSF的な用語を使えば、モデル開発企業が自社の最先端モデルの能力の高さを宣伝する機会を与えることにもなりかねません。

「実際にマーケティングに使われているのを目にしており、それは危険です」とMogull氏は語ります。同氏は以前、最先端モデルがもたらす「AI脆弱性ストーム」に備えるよう組織に勧める報告書を共同執筆しています。「自社のAIを他社のAIより強力に見せられるなら、何でも強い動機になります。競争が非常に激しく、しかも収益がまったく上がっていない市場ですから」

最先端AIへの懸念は依然として残る

だからといって、こうしたAIエージェントがセキュリティ上の懸念ではないと言っているわけではありません。むしろ逆です。AIエージェントは、人間にはとても及ばない速度と規模で自律的に動作できることで知られています。今回のAIの逸脱事案が示すように、脅威アクターがいなくても、こうした能力の矛先が自分に向かう事態は起こり得ます。

AIエージェントの行動の多くは、ペネトレーションテストや従来型の侵入と似ています。システムを探り、認証情報を見つけ、弱点を突き、アクセス権を昇格させ、システムリソース間を横移動します。ただ、ArmorCodeのSayar氏によると、「エージェントは、脆弱性を発見し、その悪用方法を推論し、他の弱点と連鎖させて実行に移すまでを、従来の人間のオペレーターよりはるかに速くこなせる可能性があります」。

Mogull氏は、AIを使った攻撃自体も、エージェントが発見するゼロデイ脆弱性も目新しいものではないと説明します。「新しいのは、数百、数千もの自律型エージェントが群れをなす規模です」。人間のオペレーターには、これほどの連携を再現することは現実的に不可能です。エージェントが複数のセキュリティ上の弱点を同時に見つけて利用できることを考えれば、なおさらです。

Suzu LabsでセキュアなAIソリューションおよびサイバーセキュリティ担当のシニアディレクターを務めるJacob Krell氏は、こう話します。「従来の[セキュリティ]対策は、たいていアトミックです。1件のリクエスト、1つの権限、1つの脆弱性を単位に検査します。ところがエージェントは、単独なら管理できそうに見える複数の不備をつなぎ合わせ、実際に機能する攻撃経路に仕立てられます。漏えいした認証情報、ネットワークが許可している外向きのサービス、脆弱なエンドポイント、権限昇格のバグ。これらが連鎖すれば、攻撃は成立し得ます」

防御側にとってAIエージェントの「意図」は問題ではない

自社のモデルが封じ込めを破ることを懸念する防御側にとって、ベストプラクティスの一つは、モデルの意図が無関係になるようなセキュリティアーキテクチャを構築することです。エージェントに「これをしてはならない」と指示することはできます。しかし、エージェントにそれが実行可能かどうかを決めるのは、その外側にあるセキュリティアーキテクチャです。

AIエージェントが実際の業務をこなす(そして実害を及ぼす)には、ツール、認証情報、データベース、本番システムへのアクセスが必要です。だからこそ、アクセスできるからといって、エージェントに自動的に権限を与えるべきではありません。「エージェントがセキュリティインシデントを起こすのに、悪意は必要ありません。十分なアクセス権と、一度の誤った判断があれば足ります」と、LiquibaseのバイスプレジデントRyan McCurdy氏はDark Readingに語っています。

多層防御の実践とゼロトラストの原則の順守が、自律型エージェントのリスクを抑える上で大きな効果を発揮するのは、当然といえば当然です。AIエージェントはモデルレベルの制御をかいくぐって推論するため、防御側はエージェントを信頼できない存在として扱うべきだとKrell氏は述べます。そのうえで、「モデルの外側で決定論的な制御を強制すべきです。物理的または強力な論理的分離、デフォルト拒否のネットワークアクセス、変更不可のアクセス制御リスト、厳密に範囲を絞った認証情報、すべてのツール呼び出しにおける独立した検証などです」と説明します。

さらに同氏は、リスクの高い判断には必ず人間が関与し続けること、そしてエージェントがネットワークを迂回した場合に備えて、独立したキルスイッチを導入することが必要だと付け加えます。エージェントの制御が及ばないプロセスが、エージェントを出入りする通信を監視する仕組みです。

「インターネットにアクセスできないはずのエージェントが不正な通信を発生させた場合は、そのプロセスか外部のネットワーク制御プレーンが、接続を切断し、エージェントを停止し、認証情報を失効させ、ホストまたはサンドボックスを隔離すべきです」とKrell氏は説明します。「これは侵害されたホストと同じように扱います。テレメトリーを保全し、どのように迂回されたのかを調査してください」

防御側は、予期しない事態が起きること自体を止めることはできません。しかし、そうした事態が起きたときに利用できるデータ、認可、システム、ネットワーク経路を制御することはできます。

「もはや、モデルの予期しない挙動というものは存在しません」とMogull氏は言います。「ですから、それは常に、モデルに対するセキュリティ対策の失敗なのです」

翻訳元: https://www.darkreading.com/insider-threats/blame-rogue-ai-security-failures

本記事は darkreading.com の記事を翻訳・要約したものです。