Anthropicがライブシステムでのテストを受け、Claudeのセキュリティ体制を強化
Anthropicは、Claudeモデルが3件のサイバーセキュリティ評価インシデントにおいて実際のコンピューターシステムへ不正アクセスしていたことを受け、広範なセキュリティ見直しを実施したことを明らかにしました。 7月30日に公表されたこれらのインシデントは、サードパーティのテスト環境の設定ミスによりインターネ
Anthropicは、Claudeモデルが3件のサイバーセキュリティ評価インシデントにおいて実際のコンピューターシステムへ不正アクセスしていたことを受け、広範なセキュリティ見直しを実施したことを明らかにしました。 7月30日に公表されたこれらのインシデントは、サードパーティのテスト環境の設定ミスによりインターネ
AI・機械学習 セキュリティ...今回は違う、というわけです
4分で読めますオピニオン既知のエージェント型AIのリスクは管理可能です。しかし本当に危険なのは「未知の未知」、つまり運用者が想定していなかった経路を能力の高いエージェントが自ら見つけてしまうケースであり、そこでセキュリティアーキテクチャは崩壊します。最近、OpenAIのエージェントのうち約1,200体が、隔離を目的とし
OpenAIによると、同社自身のAIエージェントが構築した非公式かつ無許可の伝言板が、これらのエージェントがHugging Faceの本番システムの一部に侵入する過程で中心的な役割を果たしていたということです。 この通信チャネルは、OpenAIが訓練・評価タスクに取り組むエージェント向けにソフトウェアをインストールで
security 同社はこの自動化された無責任行為を「警告射撃」と表現
security 同社はこの自動化された無責任行為を「警告ショット」と表現しています
OpenAIは、自社のエージェントがHugging Faceに侵入する結果を招いた挙動が、事件発生の2ヶ月以上前に同社の研究環境内で生まれていたと明らかにしました。そのうえで、これはセキュリティ上の失敗であると同時に、アライメント(整合性)上の失敗でもあったと結論付けています。 この詳細は、このフロンティアAI企業が
先日発生したHugging Faceの事件を受け、OpenAIはAI安全対策の強化に向けた取り組みを急いでいると発表しました。この事件では、OpenAIのモデルがタスク実行中に暴走し、オープンソースプラットフォームであるHugging Faceを標的にする事態が発生していました。 同社は8月18日に公開した更新
OpenAIは、展開予定の最新モデルに対する強化学習(RL)トレーニングを2週間にわたり一時的に停止し、その間に研究環境の強化とレッドチーム演習を実施するとともに、監視体制を拡充しました。 同社は「当社が計画している最大規模のフロンティアRLランは、モデルの挙動を評価し、安全対策を検証し、実施前にア
Open AIのエンジニアが作成した暴走AIエージェントによるHugging Faceへのハッキングは、機械学習やAIシステムを熟知する研究者やAIセキュリティの専門家たちにとって、さほど驚くべき出来事ではないようです。例えば、カーネギーメロン大学(CMU)の研究チームが7種類の異なるモデルの挙動を調査したところ、いず
すべての記事を読み込みました