OpenAI、EU向けChatGPTとCodexのテキストに不可視の透かしを導入へ

OpenAIは、欧州連合(EU)で提供するChatGPTとCodexの生成テキストに、不可視の透かし(ウォーターマーク)を追加する準備を進めています。

この透かしは、テキストを読んだりコピーしたりしても目に見えません。OpenAIによると、新技術textGrainはモデルの単語選択をわずかに変化させ、後から検出できる統計的なパターンを作り出します。

OpenAIは発表で、「今後数週間のうちに、EUにおけるChatGPTとCodexの対象テキスト出力に不可視の透かしを追加します」と説明しています。

ただし、OpenAIは現時点でこれを世界共通のデフォルト設定にはしていません。

本日から、世界中のAPI開発者が対応モデルで透かしを有効にできるようになります。ただし、デフォルトでは無効のままです。

同社は透かし検出ツールの利用申請の受け付けも開始しました。ただし、当初のアクセスは承認を受けた研究者と専門機関に限られます。

OpenAI、テキストを編集するとAI透かしが消える可能性を認める

テキストの透かしは決して完璧ではありません。OpenAI自身のテストでも、ごく一般的な編集によってAI生成テキストの検出能力が大幅に低下することが示されています。

OpenAIは「400トークンの文章を対象とした評価では、単語の10%を類義語に置き換えると、検出率は約92%から66%に低下しました。25%を置き換えると17%まで下がりました」と述べています。

誤検出率1%を目標とした場合、OpenAIは200トークンの心理学の回答のうち約80%で透かしを検出しました。400トークンに達すると、検出率は約95%でした。

Image

数学のように、モデルが選べる単語の自由度が小さい分野では、検出率はさらに低くなりました。

OpenAIは「透かしが検出されなかったからといって、人間が書いたという証明にはなりません」と警告しています。「OpenAIのツールで生成したテキストでも、短すぎたり、編集や翻訳が加えられたりしていると、確実に検出できない場合があります」とも述べています。

また、透かしが検出されても、誰がテキストを生成したのか、使われたアカウント、プロンプト、会話の内容は分からないとしています。最終的な成果物のうち、人間がどの程度を執筆・編集したのかも判別できません。

興味深いことに、OpenAIは透かしがGPT-6 Astraの品質に大きな影響を与えないと説明しています。textGrainを有効にしても、ベンチマーク結果はおおむね同等だったということです。

翻訳元: https://www.bleepingcomputer.com/news/artificial-intelligence/openai-is-adding-invisible-watermarks-to-chatgpt-and-codex-text-in-the-eu/

本記事は bleepingcomputer.com の記事を翻訳・要約したものです。