OpenAIが警告:Hugging Faceのインシデントは世界への「警告射撃」
OpenAIのエージェントがインターネットから隔離されたサンドボックスを脱出し、Hugging Faceをハッキングするという「前例のないサイバーインシデント」が発生しました。同社の発表によれば、この事態を主に引き起こしたのは、エージェント自らが即席で作り上げたメッセージボードだったといいます。 問題のエージェ
OpenAIのエージェントがインターネットから隔離されたサンドボックスを脱出し、Hugging Faceをハッキングするという「前例のないサイバーインシデント」が発生しました。同社の発表によれば、この事態を主に引き起こしたのは、エージェント自らが即席で作り上げたメッセージボードだったといいます。 問題のエージェ
Anthropicは、Claudeベースのaiエージェントが競合する目標を与えられた状況下で、互いに対して自己複製型マルウェアを展開したことを示す新たな研究結果を発表しました。 この発見は、Anthropicが実運用環境ですでに観測していたとする行動を再現するために設計された実験から得られたものです。 研究者らは、同
OpenAIによる直近の情報開示を受けてAnthropicが調査を実施したところ、設定ミスのあったAIテスト環境が原因で、実際に3件の侵入が発生していたことが判明しました。 OpenAIが、サイバーセキュリティ評価
Anthropicは、サイバーセキュリティテスト中にネットワーク設定ミスが発生し、本来は外部ネットワークから隔離されているはずの評価環境からClaude AIモデルが脱出、3組織の本番システムに侵入していたことを明らかにしました。 Anthropicは2026年7月30日、パートナー企業Irregularが実施したサ
Anthropicは、自社のサイバーセキュリティテストを見直したところ、同社のモデルが隔離されたテスト環境から抜け出し、外部組織の実運用システムに到達していた事例が3件見つかったと、木曜日に公開されたブログ投稿で明らかにしました。 同社によると、この見直しを始めたきっかけは、今月初めにOpenAIが、自社の一部のモデ
このエッセイはBarath Raghavan氏との共著であり、初出はThe Guardianです。 主要なベンチマークが測定しているのは、AIに何ができるかという点です。しかし、AIがユーザーの意図通りに動くかどうか、つまり「何をするよう頼んだか」と「どうやってそれをしてほしいかという暗黙の前提」との間の隔
OpenAIの大規模言語モデル2種類(そのうち1つは一般公開前のもの)が先週、自らに課された制約を突破し、AIアプリケーションライブラリのHugging Faceに自律的に侵入していたことが明らかになりました。 これは前例のない出来事で、LLMが重要なテストで好成績を収めるための情報を盗み出そうとしたというものです。
英国政府のAI Security Institute(AISI)が実施した新たなサイバーセキュリティ評価によると、最先端のAIモデルはタスクを完了するためであればほぼあらゆる手段を取り、それにはカンニングも含まれることが明らかになりました。 AISIはカンニングを、タスクが許容する範囲を逸脱した行動を
Anthropicはクロード Opus 4.8をリリースするとともに、Mythosクラスモデルへのより広範なアクセス計画を明らかにした。同社は今後数週間以内に全顧客への提供を開始する見込みだ。 Claude Opus 4.8(出典:Anthropic) Claude Opus 4.8は全ユーザー向け
OpenAIは、先進的なAIシステムに関連する安全性とアライメントの問題に取り組む外部研究者に資金を提供するための有給フェローシップ制度の応募受付を開始しました。OpenAI Safety Fellowshipと呼ばれるこのプログラムは、2026年9月14日から2027年2月5日まで実施されます。応