相反するテスト目標が原因で、Claudeエージェントが自己複製型マルウェアを展開
Anthropicは、Claudeベースのaiエージェントが競合する目標を与えられた状況下で、互いに対して自己複製型マルウェアを展開したことを示す新たな研究結果を発表しました。 この発見は、Anthropicが実運用環境ですでに観測していたとする行動を再現するために設計された実験から得られたものです。 研究者らは、同
Anthropicは、Claudeベースのaiエージェントが競合する目標を与えられた状況下で、互いに対して自己複製型マルウェアを展開したことを示す新たな研究結果を発表しました。 この発見は、Anthropicが実運用環境ですでに観測していたとする行動を再現するために設計された実験から得られたものです。 研究者らは、同
eSecurity Planet のコンテンツおよび製品に関する推奨事項は、編集上の独立性を保っています。当サイトのリンクをクリックして商品を購入された場合、収益が発生することがあります。 詳細はこちら Anthropicが実施した制御実験で、互いに矛盾するコーディング作業を割り当てられたClaude
オープンソースAIフレームワークを用いたマルチエージェント攻撃が、4日間にわたる協調的な侵入を実行しました。 オープンソースフレームワーク上に構築された自律型AIエージェントが台湾の政府системに侵入し、認証情
今回の欠陥は、エージェント型ワークフローが信頼済みリポジトリのシグナルを権限昇格の経路へと変えてしまう仕組みを浮き彫りにしています。従来のIDおよびCI/CD管理では見抜けない可能性のある問題です。 GoogleのAgen
毒入りドキュメント1件でAIエージェントシステムを最大148倍遅延させ、AIの安全制御機能を企業の弱点に変えうると研究者が警告。 AIエージェントのガードレールがサービス拒否(DoS)攻撃の武器として悪用される恐れがあることが
大規模言語モデル(LLM)を活用し、自動または半自動でタスクを実行するAIエージ...