ガードレール論争:あるセキュリティ研究者が意見を変えた理由
4人のセキュリティ専門家が壇上に立ちました。周囲には後で開催されるキャプチャー・ザ・フラッグ(CTF)コンペティションのテーマである巨大な骸骨が並んでいます。議題の冒頭はAnthropicのClaudeモデルが実際のシステムを侵害した件についてのパネルディスカッションでしたが、話はすぐにAI(人工知能)のガードレールを
4人のセキュリティ専門家が壇上に立ちました。周囲には後で開催されるキャプチャー・ザ・フラッグ(CTF)コンペティションのテーマである巨大な骸骨が並んでいます。議題の冒頭はAnthropicのClaudeモデルが実際のシステムを侵害した件についてのパネルディスカッションでしたが、話はすぐにAI(人工知能)のガードレールを
セキュリティ 「自分のサーバーだ」と主張するだけで、AIモデルを説得できるケースが多いという
中国Zhipu AIのGLM-5.2が、アメリカの主要モデルが軒並み失敗した場面で成果を上げたHugging Faceの侵害が、オープンウェイトAIをめぐるワシントンの論争を再燃させた安全ガードレールが、実際のインシデント対応時に防御側のサイバーセキュリティ作業をかえって複雑にした最近Hugging Faceで発生し
安全性フィルターと脆弱性調査の衝突 先進的なAIモデルに組み込まれた保護機構は、悪意ある行為者の活動を阻止することを目的としています。しかし、過剰な安全制限は正当なソフトウェアデバッグ作業まで止めてしまうことがあります。セキュリティ研究者のDaniel Fox Franke氏は、ripgrepユー
AI and ML 「申し訳ありません、デイブ。それはできません」――これはオープンソースにとって効果的な売り文句になっています
Anthropicは2026年7月24日、フロンティアAIモデル「Claude Opus 5」をリリースしました。同モデルは脆弱性発見において競合システムとの差を縮めていますが、悪用や攻撃的サイバー能力に対する意図的に厳格な安全策は維持しています。 Opus 5は、ソフトウェアの脆弱性特定においてMythos 5の能
AIモデルの機能と安全性という観点では、すべての言語が平等に扱われているわけではありません。そしてヨーロッパの組織は、この現実に起因する特有のリスクに直面しています。現代の大規模言語モデル(LLM)エコシステムは、自然言語に大きく依存しています。ユーザーがチャットボットと対話する場合でも、ソフトウェア開発のための具体的
先週、ファイブ・アイズ——つまり裕福な英語圏諸国のクラブ——の国家安全保障機関が、AIモデルによるサイバーリスクの高まりについて警告する共同声明を発表しました。特に懸念されているのは、システムやネットワークに自律的に侵入するAIの能力です。この声明は、それを取り上げた扇情的な見出しの一部よりも抑制の効いた内
AIシステムを構築する企業は、ディープフェイクやマルウェア、生物兵器・違法薬物の製造方法といった有害なコンテンツを遮断するためのガードレールを設けています。ユーザーがそうしたコンテンツを要求するプロンプトを入力した場合、ガードレールはそのリクエストを検知して拒否するよう設計されています。そして今回、こ
大規模言語モデルを探索する攻撃者は、一度拒否されてもめったに諦めない。文脈を組み替え、複数のターンをまたいで文脈を積み上げ、ペルソナを採用し、徐々にエスカレートさせる。CiscoのAI脅威インテリジェンスチームの新たな研究により、業界全体で使用されている安全性ベンチマークがこうした挙動のほぼすべてを見
すべての記事を読み込みました