OpenAI、プロンプトインジェクション脆弱性を自動検出するAIモデル「GPT-Red」を発表
OpenAIは、AIエージェントにおけるプロンプトインジェクションの弱点を特定・悪用するよう訓練された自動安全性レッドチーミングモデル「GPT-Red」を発表しました。Hacking& Cracking プロンプトインジェクションとは、Webページ、メール、ローカルファイル、コードリポジトリ、ツールの出力など
OpenAIは、AIエージェントにおけるプロンプトインジェクションの弱点を特定・悪用するよう訓練された自動安全性レッドチーミングモデル「GPT-Red」を発表しました。Hacking& Cracking プロンプトインジェクションとは、Webページ、メール、ローカルファイル、コードリポジトリ、ツールの出力など
OpenAIは、プロンプトインジェクションの脆弱性を大規模に発見・悪用するために構築された社内向けの自動レッドチーミングモデル「GPT-Red」を発表しました。得られた知見は、そのまま本番モデルの堅牢化に活用されます。 同社は、GPT-RedをGPT-5.6のトレーニングパイプラインに直接組み込んだことを明らかにして
GPT-Redは、OpenAIがプロンプトインジェクションの脆弱性を発見するために訓練している自動レッドチーミングモデルです。人間のレッドチーマーと同じように動作し、プロンプトを送信してGPTモデルの応答を観察し、データ流出の成功といった目標に向けて試行を繰り返します。 トレーニングは自己対戦型の強