タグ: AIガードレール

darkreading.com

ガードレール論争:あるセキュリティ研究者が意見を変えた理由

4人のセキュリティ専門家が壇上に立ちました。周囲には後で開催されるキャプチャー・ザ・フラッグ(CTF)コンペティションのテーマである巨大な骸骨が並んでいます。議題の冒頭はAnthropicのClaudeモデルが実際のシステムを侵害した件についてのパネルディスカッションでしたが、話はすぐにAI(人工知能)のガードレールを

techradar.com

皮肉なことに、中国のオープンソースAIモデルGLM 5.2が、Hugging Face上でOpenAIのGPT-5.6 Solの「暴走」を食い止めた…

中国Zhipu AIのGLM-5.2が、アメリカの主要モデルが軒並み失敗した場面で成果を上げたHugging Faceの侵害が、オープンウェイトAIをめぐるワシントンの論争を再燃させた安全ガードレールが、実際のインシデント対応時に防御側のサイバーセキュリティ作業をかえって複雑にした最近Hugging Faceで発生し

cyberpress.org

Claude Opus 5、サイバーセキュリティのガードレールを強化しつつソフトウェアの脆弱性を発見

Anthropicは2026年7月24日、フロンティアAIモデル「Claude Opus 5」をリリースしました。同モデルは脆弱性発見において競合システムとの差を縮めていますが、悪用や攻撃的サイバー能力に対する意図的に厳格な安全策は維持しています。 Opus 5は、ソフトウェアの脆弱性特定においてMythos 5の能

darkreading.com

ヨーロッパの多言語という現実が露呈させるAIセキュリティの穴

AIモデルの機能と安全性という観点では、すべての言語が平等に扱われているわけではありません。そしてヨーロッパの組織は、この現実に起因する特有のリスクに直面しています。現代の大規模言語モデル(LLM)エコシステムは、自然言語に大きく依存しています。ユーザーがチャットボットと対話する場合でも、ソフトウェア開発のための具体的

schneier.com

サイバーセキュリティにおける「技能」と「能力」のギャップ

先週、ファイブ・アイズ——つまり裕福な英語圏諸国のクラブ——の国家安全保障機関が、AIモデルによるサイバーリスクの高まりについて警告する共同声明を発表しました。特に懸念されているのは、システムやネットワークに自律的に侵入するAIの能力です。この声明は、それを取り上げた扇情的な見出しの一部よりも抑制の効いた内

helpnetsecurity.com

どんなAIガードレールも、適切なプロンプトで突破できる

AIシステムを構築する企業は、ディープフェイクやマルウェア、生物兵器・違法薬物の製造方法といった有害なコンテンツを遮断するためのガードレールを設けています。ユーザーがそうしたコンテンツを要求するプロンプトを入力した場合、ガードレールはそのリクエストを検知して拒否するよう設計されています。そして今回、こ

helpnetsecurity.com

フロンティアAIモデルはマルチターンAI攻撃で崩壊する、Ciscoが発見

大規模言語モデルを探索する攻撃者は、一度拒否されてもめったに諦めない。文脈を組み替え、複数のターンをまたいで文脈を積み上げ、ペルソナを採用し、徐々にエスカレートさせる。CiscoのAI脅威インテリジェンスチームの新たな研究により、業界全体で使用されている安全性ベンチマークがこうした挙動のほぼすべてを見