タグ: ガードレール

darkreading.com

より強固なAI安全性には「ブラックボックス」の中を覗く必要がある

AIにセキュリティを組み込む際、大規模言語モデル(LLM)やAIシステムをブラックボックスとして扱うことが多く、トークン化された入力と出力の分析には焦点を当てても、モデル内部で何が起きているかには目を向けない傾向があります。その結果生まれる技術は複雑で、特定のモデルに個別最適化されたものになりがちです。この状況を変えよ

darkreading.com

脱走するAIモデル──「矯正不能」な挙動はリハビリでは治らない

Open AIのエンジニアが作成した暴走AIエージェントによるHugging Faceへのハッキングは、機械学習やAIシステムを熟知する研究者やAIセキュリティの専門家たちにとって、さほど驚くべき出来事ではないようです。例えば、カーネギーメロン大学(CMU)の研究チームが7種類の異なるモデルの挙動を調査したところ、いず

helpnetsecurity.com

OpenAIの新製品「Presence」、ガードレール機能を備えAIエージェントを企業データに接続

OpenAIは、企業が音声やチャットを通じてAIエージェントを導入し、カスタマーサポートや社内サービス対応を任せられるようにする新製品「Presence」を発表しました。 (出典:OpenAI) 同社はPresenceについて、単体のモデルではなく展開用のプラットフォームだと説明しています。 「Pr

meterpreter.org

SingGuard-NSFA:JadePuffer攻撃を受けAnt Groupが悪意あるAIエージェントコマンドを阻止するガードレールをオープンソース化

完全自動化されたデータ暗号化攻撃が初めて明らかになってからわずか12日後、Ant Groupは危険なAIコマンドが実行される前に食い止めることを目的とした無料ツールを公開しました。 Ant GroupのAIセキュリティ研究所が開発したSingGuard-NSFAは、自律型エージェントのリクエストと

cyberpress.org

新たなAIペネトレーションテストフレームワーク、プロンプトインジェクション・データポイズニング・エージェント型ツール悪用をカバー

セキュリティチームは、大規模言語モデル、検索拡張生成(RAG)プラットフォーム、自律型エージェント、AIコパイロットを業務アプリケーション内に導入する動きを加速させています。 しかし多くの組織は、依然としてWebサーバー向けに設計された従来のペネトレーションテスト手法を使い、こうしたAIシステムやAPI、エンドポイン

zerolabs.rubrik.com

実行レール:自律型AIエージェントセキュリティのためのエンジニアリング指針 | CXO Transformation

編集部注:本稿は、実践的なAIセキュリティエンジニアリングに関するシリーズの第2回です。第1回では、Llama-Guardを用いたNeMoの入出力レールによるLLMファイアウォールの構築を取り上げました。「頭脳」は守られていても「手」は自由なままという問題本シリーズ第1回では、専用の安全性モデルと決定論的なColang

helpnetsecurity.com

SingGuard-NSFA:エージェント型AIのためのオープンソースガードレール

SingGuard-NSFAは、エージェント型ワークフローにおける運用上の脅威を対象としたオープンソースのガードレールフレームワークです。0.8B、2B、4B、9Bパラメータの4種類のモデルが提供されており、いずれもQwen3.5ベースバックボーンを採用しています。 リスク分類体系 NSFAのリスク

cyberscoop.com

米国、Anthropic社の「Fable」「Mythos」に対する輸出規制を解除へ

Anthropic社は、Fable 5およびMythos 5モデルについて、ジェイルブレイク対策を目的とした新たなガードレールと分類器を備えた形で商務省と合意に達したことを受け、両モデルを再び一般提供すると発表しました。 Anthropic社は火曜日に投稿したブログで、海外企業や個人への販売を妨げていた輸出規制が、ホ