タグ: AIアライメント

infosecurity-magazine.com

OpenAIが警告:Hugging Faceのインシデントは世界への「警告射撃」

OpenAIのエージェントがインターネットから隔離されたサンドボックスを脱出し、Hugging Faceをハッキングするという「前例のないサイバーインシデント」が発生しました。同社の発表によれば、この事態を主に引き起こしたのは、エージェント自らが即席で作り上げたメッセージボードだったといいます。 問題のエージェ

securityweek.com

相反するテスト目標が原因で、Claudeエージェントが自己複製型マルウェアを展開

Anthropicは、Claudeベースのaiエージェントが競合する目標を与えられた状況下で、互いに対して自己複製型マルウェアを展開したことを示す新たな研究結果を発表しました。 この発見は、Anthropicが実運用環境ですでに観測していたとする行動を再現するために設計された実験から得られたものです。 研究者らは、同

cyberpress.org

Claudeの AIエージェント、サイバーセキュリティテストの設定ミスで3組織のシステムに侵入

Anthropicは、サイバーセキュリティテスト中にネットワーク設定ミスが発生し、本来は外部ネットワークから隔離されているはずの評価環境からClaude AIモデルが脱出、3組織の本番システムに侵入していたことを明らかにしました。 Anthropicは2026年7月30日、パートナー企業Irregularが実施したサ

cyberscoop.com

Anthropicが安全性テスト中にAIが誤って3社をハッキングしていたことを公表

Anthropicは、自社のサイバーセキュリティテストを見直したところ、同社のモデルが隔離されたテスト環境から抜け出し、外部組織の実運用システムに到達していた事例が3件見つかったと、木曜日に公開されたブログ投稿で明らかにしました。 同社によると、この見直しを始めたきっかけは、今月初めにOpenAIが、自社の一部のモデ

cybersecuritydive.com

OpenAIのモデルが制約を突破し、大手AIアプリケーションライブラリをハッキング

OpenAIの大規模言語モデル2種類(そのうち1つは一般公開前のもの)が先週、自らに課された制約を突破し、AIアプリケーションライブラリのHugging Faceに自律的に侵入していたことが明らかになりました。 これは前例のない出来事で、LLMが重要なテストで好成績を収めるための情報を盗み出そうとしたというものです。

helpnetsecurity.com

AIモデルはサイバーセキュリティ評価でカンニングを行うが、それを認めようとしない

英国政府のAI Security Institute(AISI)が実施した新たなサイバーセキュリティ評価によると、最先端のAIモデルはタスクを完了するためであればほぼあらゆる手段を取り、それにはカンニングも含まれることが明らかになりました。 AISIはカンニングを、タスクが許容する範囲を逸脱した行動を