Outerlimit、暴走AIエージェントによる被害を防ぐため1600万ドルを調達

自律的なエージェント型AIは、暴走して破壊的な結果を引き起こす傾向があります。これを完全に阻止することはおそらく不可能でしょう。Outerlimitは、暴走エージェントによる被害そのものを防ぐことに焦点を当てたソリューションを提供しています。

ニューヨークを拠点とするOuterlimitは、AlbionVC、Evolution Equity Partners、Crane Venture Partnersおよび複数の個人エンジェル投資家から1600万ドルのプレシード資金を調達し、ステルスモードから姿を現しました。Tony Pepper氏、Neil Larkins氏、Peter Vincent氏が創業した同社は、自律的なエージェント型AIを保護するための分散型セキュリティ・認可レイヤーを提供します。

企業は意思決定のスピードと業務の自動化を高めるため、自律エージェントの導入を急速に進めています。基盤となるAIモデルは、確立された真実ではなく確率に基づいて構築されている点は変わらないまま、性能が高まる一方です。それに伴い、これらの自律エージェントはますます複雑な目的で使われるようになり、ビジネス上のアイデンティティや認証情報への広範なアクセス権を持つようになっています。しかし、エージェントが担うビジネス上の目的が複雑化するほど、そのエージェントが取り得る自律的な行動を定義し、制限すること(いわゆる「アライメント」)は相応に難しくなります。

従来、サイバーセキュリティは、法律(あるいは規則)と、それに違反した際の結果への恐れによって、人間の行動を抑制することを前提としてきました。社会全体で見れば、それは法律であり、罰金や禁固刑への恐れが法律違反の結果として機能します。サイバーセキュリティにおける「法律」はガバナンスであり、ガバナンスに反した結果は解雇です。歴史を通じて、セキュリティの根幹にあったのはこの「結果への恐れ」でした。

しかし、これは自律エージェントには通用しません。エージェントには規則や道徳という概念そのものがなく(指示された内容そのもの以外には何もありません)、結果を恐れることもありません。自律AIエージェントを制御できるのは、コーディングの内部的な精度(能力を定義された目的に厳密に紐づけ、それ以外の行動を取らせないようにすること)と、外部者による誤用を防ぐ外部ガードレールの実効性しかありません。私たちは現状、この両方の面で対応に失敗しており、既存のサイバーセキュリティ製品や考え方はもはや役に立ちません。

「このエージェント時代においては」とVincent氏は述べています。「エージェントは、現実世界に影響を及ぼせるツールにアクセスできる推論モデルを使用しており、人間が作り上げてきたこうした枠組みの中では単純に機能しません。エージェントは、読み取った内容や他のエージェントとのやり取りに応じて振る舞いを変化させ、しかもマシンの速度でそれを行います。この強力な知能を制御するには、根本的に新しいセキュリティアーキテクチャが必要です。すなわち、アイデンティティ、認可、そして行動を、実行の瞬間に単一の操作として結びつける仕組みです」

私たちが構築したAIを制御することは、おそらく永久にできないでしょう。だからこそ、セキュリティの焦点は「結果への恐れ」から「被害の防止」へと移行する必要があります。Outerlimitは、これを実現するために「発見(discover)」「観察(observe)」「強制(enforce)」という三位一体の考え方を採用しています。システム内のエージェントを発見(特定)し、その振る舞いを観察し、許可された自律行動と許可されていない自律行動についてあらかじめ定めたポリシーを強制的に適用する、という仕組みです。

「私たちが開発した技術と、独自の研究を用いることで」とOuterlimitは説明します。「ポリシーが確実に守られることを証明できます。良い例を挙げましょう。あるエージェントにトークンが委任された場合、そのトークンが使用されるスコープ、場所、条件を保証できます。これが重要なのは、エージェントのアライメント問題を完全に回避できるからです。エージェントは依然としてアライメントが崩れ、ポリシーに反することを試みる可能性はありますが、それはあくまでツールであるため、その行動は開発者がコーディングしたアライメントではなく、私たちが指定したポリシーに従うことになります」

要するに、Outerlimitはエージェントがアライメントされているかどうかを問いません。すべてのエージェントを同様に扱います。しかし、エージェントが次に取る可能性が最も高い行動を証明することで、実質的にエージェントより一歩先を行くことができます。そして、エージェントと同じマシン速度で動作しているため、自律的な行動を先取りし、有害な行動が実行される前に阻止できるのです。

この新しいタイプのセキュリティが目指す根本的な目的は、従来のサイバーセキュリティと同じです。それは、ビジネスが望むことを安全に行えるようにすることです。Outerlimitもその点で例外ではありません。「エンタープライズAIの次のフェーズは、最も多くのエージェントを構築する競争であってはなりません。むしろ成功の指標は、組織が自社のエージェント展開の力を安全に最大限活用できるかどうかであるべきです」とVincent氏は説明します。「知能そのものがコモディティ化していくのであれば、信頼こそが制約要因になります。私たちが共同知能という新たな時代へと加速していく中で、これを正しく実現することは、個人、組織、そして国際的な安全保障のために欠かせない責務なのです」

翻訳元: https://www.securityweek.com/outerlimit-raises-16-million-to-stop-rogue-ai-agents-from-causing-harm/

本記事は securityweek.com の記事を翻訳・要約したものです。