タグ: 攻撃成功率

esecurityplanet.com

AIエージェントの「ハーネス」がレッドチーム演習の結果を左右する

eSecurity Planet のコンテンツおよび製品に関する推奨事項は、編集上の独立性を保っています。当サイトはパートナーへのリンクをクリックいただくことで収益を得る場合があります。 詳細はこちら 組織がAIエージェントを評価する際、通常は大規模言語モデル(LLM)同士を比較します。  しか

helpnetsecurity.com

フロンティアAIモデルはマルチターンAI攻撃で崩壊する、Ciscoが発見

大規模言語モデルを探索する攻撃者は、一度拒否されてもめったに諦めない。文脈を組み替え、複数のターンをまたいで文脈を積み上げ、ペルソナを採用し、徐々にエスカレートさせる。CiscoのAI脅威インテリジェンスチームの新たな研究により、業界全体で使用されている安全性ベンチマークがこうした挙動のほぼすべてを見