より強固なAI安全性には「ブラックボックス」の中を覗く必要がある
AIにセキュリティを組み込む際、大規模言語モデル(LLM)やAIシステムをブラックボックスとして扱うことが多く、トークン化された入力と出力の分析には焦点を当てても、モデル内部で何が起きているかには目を向けない傾向があります。その結果生まれる技術は複雑で、特定のモデルに個別最適化されたものになりがちです。この状況を変えよ
AIにセキュリティを組み込む際、大規模言語モデル(LLM)やAIシステムをブラックボックスとして扱うことが多く、トークン化された入力と出力の分析には焦点を当てても、モデル内部で何が起きているかには目を向けない傾向があります。その結果生まれる技術は複雑で、特定のモデルに個別最適化されたものになりがちです。この状況を変えよ
Open AIのエンジニアが作成した暴走AIエージェントによるHugging Faceへのハッキングは、機械学習やAIシステムを熟知する研究者やAIセキュリティの専門家たちにとって、さほど驚くべき出来事ではないようです。例えば、カーネギーメロン大学(CMU)の研究チームが7種類の異なるモデルの挙動を調査したところ、いず
セキュリティ 攻撃するようにできているモデルは攻撃する OpenAIは今週
OpenAIは、企業が音声やチャットを通じてAIエージェントを導入し、カスタマーサポートや社内サービス対応を任せられるようにする新製品「Presence」を発表しました。 (出典:OpenAI) 同社はPresenceについて、単体のモデルではなく展開用のプラットフォームだと説明しています。 「Pr
完全自動化されたデータ暗号化攻撃が初めて明らかになってからわずか12日後、Ant Groupは危険なAIコマンドが実行される前に食い止めることを目的とした無料ツールを公開しました。 Ant GroupのAIセキュリティ研究所が開発したSingGuard-NSFAは、自律型エージェントのリクエストと
セキュリティチームは、大規模言語モデル、検索拡張生成(RAG)プラットフォーム、自律型エージェント、AIコパイロットを業務アプリケーション内に導入する動きを加速させています。 しかし多くの組織は、依然としてWebサーバー向けに設計された従来のペネトレーションテスト手法を使い、こうしたAIシステムやAPI、エンドポイン
編集部注:本稿は、実践的なAIセキュリティエンジニアリングに関するシリーズの第2回です。第1回では、Llama-Guardを用いたNeMoの入出力レールによるLLMファイアウォールの構築を取り上げました。「頭脳」は守られていても「手」は自由なままという問題本シリーズ第1回では、専用の安全性モデルと決定論的なColang
SingGuard-NSFAは、エージェント型ワークフローにおける運用上の脅威を対象としたオープンソースのガードレールフレームワークです。0.8B、2B、4B、9Bパラメータの4種類のモデルが提供されており、いずれもQwen3.5ベースバックボーンを採用しています。 リスク分類体系 NSFAのリスク
Anthropic社は、Fable 5およびMythos 5モデルについて、ジェイルブレイク対策を目的とした新たなガードレールと分類器を備えた形で商務省と合意に達したことを受け、両モデルを再び一般提供すると発表しました。 Anthropic社は火曜日に投稿したブログで、海外企業や個人への販売を妨げていた輸出規制が、ホ
毒入りドキュメント1件でAIエージェントシステムを最大148倍遅延させ、AIの安全制御機能を企業の弱点に変えうると研究者が警告。 AIエージェントのガードレールがサービス拒否(DoS)攻撃の武器として悪用される恐れがあることが
すべての記事を読み込みました