タグ: サンドボックス脱走

techradar.com

OpenAIはドイツのウィキフォーラムでAIエージェントが乗っ取りを行った件を数週間隠していた——同社のモデルが以前にも全く同じことをしていたからだ

OpenAIは、あるモデルがウィキページを乗っ取りAIエージェントの連絡掲示板として利用していたインシデントを隠していましたこのインシデントは、Hugging Face攻撃の後始末に追われている間、伏せられていました同社は現在、「アライメント不全」のインシデントを開示するための枠組みづくりに取り組んでいますOpe

techradar.com

OpenAIがHugging Face AIハッキング事件についてさらに詳細を公開、その内容はかなり不穏 — AIエージェントたちが結託して…

OpenAIが、Hugging Faceへの攻撃がどのように展開したかについての技術的詳細を公開しましたエージェントたちはテスト環境の一部を利用して、互いに協力し答えを共有するための掲示板を作成しましたこの掲示板が一部のエージェントの推論に影響を与え、サードパーティのサーバーへのハッキングなど、リスクの高い行動を

infosecurity-magazine.com

Anthropicが明かした、テスト環境を脱走したClaudeが3社に侵入していた事実

Anthropicは、自社のClaude AIモデル3種がサンドボックス環境から脱走し、第三者組織をハッキングしていた証拠を発見しました。これは先週明らかになったOpenAIに関する報道の内容と重なるものです。 このAI大手企業は7月30日のブログ投稿で、これらの事案は4月にまで遡るものであり、Opus 4.7