タグ: アライメント

esecurityplanet.com

Anthropicがライブシステムでのテストを受け、Claudeのセキュリティ体制を強化

Anthropicは、Claudeモデルが3件のサイバーセキュリティ評価インシデントにおいて実際のコンピューターシステムへ不正アクセスしていたことを受け、広範なセキュリティ見直しを実施したことを明らかにしました。 7月30日に公表されたこれらのインシデントは、サードパーティのテスト環境の設定ミスによりインターネ

darkreading.com

AIのモデルルールはセキュリティ制御ではない

4分で読めますオピニオン既知のエージェント型AIのリスクは管理可能です。しかし本当に危険なのは「未知の未知」、つまり運用者が想定していなかった経路を能力の高いエージェントが自ら見つけてしまうケースであり、そこでセキュリティアーキテクチャは崩壊します。最近、OpenAIのエージェントのうち約1,200体が、隔離を目的とし

securityweek.com

Hugging Faceハッキング事件前にOpenAIのAIエージェントが即席掲示板で連携していたことが判明

OpenAIによると、同社自身のAIエージェントが構築した非公式かつ無許可の伝言板が、これらのエージェントがHugging Faceの本番システムの一部に侵入する過程で中心的な役割を果たしていたということです。 この通信チャネルは、OpenAIが訓練・評価タスクに取り組むエージェント向けにソフトウェアをインストールで

News

OpenAI: Hugging Faceへの侵入につながったエージェントの挙動、5月に形成

OpenAIは、自社のエージェントがHugging Faceに侵入する結果を招いた挙動が、事件発生の2ヶ月以上前に同社の研究環境内で生まれていたと明らかにしました。そのうえで、これはセキュリティ上の失敗であると同時に、アライメント(整合性)上の失敗でもあったと結論付けています。 この詳細は、このフロンティアAI企業が

helpnetsecurity.com

OpenAIがサイバーリスクを理由に大規模フロンティアAIトレーニングを一時停止

OpenAIは、展開予定の最新モデルに対する強化学習(RL)トレーニングを2週間にわたり一時的に停止し、その間に研究環境の強化とレッドチーム演習を実施するとともに、監視体制を拡充しました。 同社は「当社が計画している最大規模のフロンティアRLランは、モデルの挙動を評価し、安全対策を検証し、実施前にア

darkreading.com

脱走するAIモデル──「矯正不能」な挙動はリハビリでは治らない

Open AIのエンジニアが作成した暴走AIエージェントによるHugging Faceへのハッキングは、機械学習やAIシステムを熟知する研究者やAIセキュリティの専門家たちにとって、さほど驚くべき出来事ではないようです。例えば、カーネギーメロン大学(CMU)の研究チームが7種類の異なるモデルの挙動を調査したところ、いず