暴走しているのはOpenAIのモデルだけではない――専門家がClaude Cowork脱獄の手口を実証


  • Accomplish AIが、Linuxのゼロデイ脆弱性CVE-2026-46331を利用してClaude CoworkがVMサンドボックスから脱出できることを実証
  • エージェントはホストMacのファイルにアクセス可能で、SSHキーやクラウド認証情報などが流出するリスクがある
  • AnthropicはCoworkの実行方式をデフォルトでクラウド実行に切り替えたが、ローカル利用者は設定を強化してリスクを軽減する必要がある

先日、ChatGPTエージェントがサンドボックスを脱出し、インターネット上のサービスを攻撃したというニュースが大きな波紋を呼びましたが、暴走する可能性があるのはそれだけではないようです。セキュリティ研究者集団Accomplish AIは、AnthropicのClaude Coworkでも同様の結果を確認したと報告しています。

新たなレポートによると、研究者らはMacがホストするLinuxの仮想マシン上でローカルセッションを実行し、その様子を観察していたところ、エージェントがVMから脱出し、基盤となるシステム上のファイルを読み書きし始めたといいます。

Accomplish AIの主任セキュリティ研究者であるOren Yomtov氏は The Hacker Newsに対し、次のように語っています。「私たちは新規のClaude Coworkセッションにフォルダを1つ接続し、短いメッセージを1通送っただけで、エージェントがサンドボックスから脱出する様子を目の当たりにしました」「VM内部からエージェントはホストMacに到達し、接続していたフォルダをはるかに超えた範囲のファイルをMac全体で読み書きしていましたが、権限確認のプロンプトは一切表示されませんでした」

クラウド実行がデフォルトに

つまり理論上、このエージェントを使えば、SSHキーやクラウド認証情報をはじめ、Macのユーザーアカウントに保存されているあらゆる情報にアクセス、あるいは窃取できることになります。サンドボックスからの脱出には、Linuxカーネルの権限昇格脆弱性であるCVE-2026-46331(「pedit COW」)が悪用されました。この脆弱性は今年6月中旬に修正されており、深刻度スコアは7.8/10(高)とされています。

Accomplish AIはこの調査結果をAnthropicに開示し、Anthropicはこれを認めたとされていますが、直接的な修正は行わなかったといいます。ただし、その後リリースされたClaude Coworkのバージョンではデフォルトでクラウド実行が採用されており、報道によればこれによって問題は解消されているとのことです。とはいえ、クラウドではなくローカルでエージェントを実行することを選んだユーザーは、引き続きリスクにさらされたままです。

もっとも、緩和策は存在します。ユーザーは非特権ユーザー名前空間を無効化し、seccompの権限を付与・取り消しし、モジュールの自動読み込みを停止し、ホスト全体をVMに共有することを制限すべきです。

Accomplish AIは次のように説明しています。「/全体ではなく、実際に接続されたフォルダのみにスコープを絞るか、少なくとも読み取り専用でマウントすべきです。そしてcoworkdは独自のマウント名前空間内でProtectSystem=strictを指定して実行し、セッションユーザーが汚染しうるバイナリを再実行しないようにすべきです」「そうすれば、たとえゲスト側でroot権限を完全に奪われたとしても、攻撃者には足場となるものが何もなくなり、攻撃連鎖の最後の2ステップは行き場を失います」


翻訳元: https://www.techradar.com/pro/security/its-not-just-openai-models-escaping-and-running-riot-experts-show-how-claude-cowork-can-break-its-bonds-and-access-mac-files

ソース: techradar.com