Anthropicの計画:Claude生成テキストに電子透かしを導入

AI生成コンテンツを見分けることが、今後さらに容易になるかもしれません。LinkedInなどのSNSでよく見かける「これはXではなくYだ」的な投稿ではなく、より技術的な仕組みによってです。

ご存知の方もいるかもしれませんが、EUは現在、同市場向けにサービスを提供するAI企業に対し、AI生成コンテンツに識別しやすいマークを付けることを義務付けています。

Anthropicをはじめとする主要AIプロバイダー各社は、EUの行動規範(Code of Practice)を遵守することに合意しており、Anthropicはその中でも、Claude全体に電子透かしをどのように実装するかについて詳細を公表した最初の企業の一つとなりました。

Anthropicはまた、一般ユーザーがこの電子透かしを目視で確認することはできないとも説明しています。

同社によれば、この仕組みはClaudeの出力の品質や内容に実質的な影響を与えず、創造性や読みやすさにも影響しないとのことです。

ご存じの方もいると思いますが、一部のAI生成画像にはすでに不可視の電子透かしとプロベナンス(来歴)システムが導入されています。テキスト出力についても、基盤となる実装方式は異なるものの、同様の考え方が採用されることになります。

今回の変更はEUのAI法(AI Act)への準拠を目的としたものですが、Anthropicによれば、電子透かしは当初から世界中のClaude生成テキストに適用されるとのことです。

「地域ごとに適用範囲を限定する確実な方法がまだ存在しないため、当社はローンチ時点からグローバルに電子透かしを適用しています」と、Anthropicはブログ投稿で説明しています。

Anthropicによれば、今後のClaudeモデルはすべて電子透かし付きのテキストを生成するようになります。2026年8月2日より前にリリースされたモデルはEUの移行期間の対象となっており、Anthropicはこれらのモデルにも今後数か月かけて電子透かしを追加する作業を進めているとしています。

Claudeの電子透かしは隠し文字を追加しない

Anthropicによれば、今回の実装はGoogle DeepMindのSynthID-Text方式をベースにしており、一部の例外を除き、テキスト生成の過程で機能する仕組みになっているとのことです。

ご存じのとおり、AIモデルはテキストを生成する際、次に続く可能性が高いトークンを繰り返し選択していきます。Claudeの電子透かしは、生成後の完成した回答に文字を追加したり内容を書き換えたりするのではなく、こうした選択の一部で使用される乱数の生成源そのものを変化させます。

「電子透かしは、こうした重要度の低い選択――生成されるテキスト一つにつき何度も発生します――を利用して、Claudeの応答にパターンを残します。このパターンは読み手には検出できませんが、それを符号化する鍵(キー)を持つ者であれば検出可能です」とAnthropicは説明しています。

「電子透かしが使用される場合でも、選択自体はやはりランダムに行われますが、その乱数の生成源が異なります。次の単語を選ぶ際に任意の乱数生成器を使う代わりに、電子透かしは鍵とそれ以前の数語を用いて、モデルがどの単語を選ぶべきかを決定します。」

「つまり、Claudeが選ぶ単語自体は依然としてランダムですが、今度はその単語の並びを検証し、Claudeがその鍵を使用していた場合に選んだであろう選択と整合しているかどうかを確認できるようになります。整合していれば、そのテキストがClaudeによって生成された確率を算出できます。」

筆者も同テーマに関する研究論文を読みましたが、そこには生成的電子透かし(generative watermarking)の仕組みについて、次のような説明がありました。

生成的電子透かしは、次のトークンをサンプリングする手順を巧妙に調整し、生成されるテキストの分布に文脈固有の微妙な変化を注入することで機能します。こうした変化は生成テキストに統計的な特徴(シグネチャ)を組み込みます。この特徴は電子透かしの検出段階で測定でき、そのテキストが実際に電子透かし付きのLLMによって生成されたものかどうかを判定するために使用できます。この手法の重要な利点は、検出処理に計算コストの高い処理を必要とせず、多くの場合プロプライエタリである基盤LLMへのアクセスすら不要な点です。

論文ではさらに詳しい説明や例が挙げられていますが、重要なのは、Anthropicが目に見えるマークや隠し文字をClaudeの応答に追加しているわけではないという点です。

Image

その代わり、Claudeが次に生成する内容について複数の妥当な選択肢を持つ場合、電子透かしシステムは秘密鍵と直前の単語の一部を、その選択に使用する乱数の一部として利用します。

読み手にとっては、個々の選択はいずれも至って自然に見えますが、十分な長さのテキスト全体を通じて見ると、統計的なパターンが残ることになります。

Anthropicの鍵を持つ検出器は、単語の並びを調べ、それがClaudeが電子透かしを使用していた場合に選んだであろう選択とどの程度整合しているかを判定することで、そのテキストの作成にClaudeが関与していた可能性を推定できます。

Anthropicによると、社内テストでは創造性や読みやすさ、Claudeの応答内容への影響は確認されなかったとのことです。

同社はまた、電子透かしの導入に追加のトークンは不要であり、生成速度への影響も無視できる程度だとしています。

「テキストには何も追加されず、隠し文字も存在しません」とAnthropicは述べています。「電子透かしに追加のトークンは不要であり、コストが増加することもありません。」

コードや事実に基づく回答は電子透かしが弱くなる場合がある

先述のとおり、電子透かしにはいくつかの例外があり、それには相応の理由があります。

正解が一つしかない事実に基づく記述については、電子透かしはその選択に干渉しないとAnthropicは説明しています。

同様の原則は、ある用語を別の用語に置き換えると出力が壊れてしまうコードにも当てはまります。

厳密な出力が求められる場合――つまり選択の余地がなく、別の語を選ぶと事実として誤りになったりコードが壊れたりする場合――には電子透かしは適用されません。」

「例えば、モデルが『2 + 2 =』まで書いた時点で、次のトークンには明確に最適な選択肢が存在します(モデルが計算式を完成させようとしているのであれば『4』と同等に妥当な答えは他になく、ジョージ・オーウェルの『1984年』について語っているのであれば『5』と同等に妥当な答えは他にありません)」と同社は述べています。

「この場合、電子透かしによる『後押し』は適用されません。同じ理由から、コード――多くの場合、厳密さが求められます――は、他の形式のテキストに比べて全般的に電子透かしが弱くなります。」

Anthropicは、コメントなど任意の選択が可能なコード部分では引き続き電子透かしを利用できるとしつつ、実際に生成されるコード自体への影響は無視できる程度になるはずだとしています。

これは、GoogleのSynthID-Textに関する論文の以下の記述とも一致しています。

スコアリング関数の検出性能に影響を与える主な要因は2つあります。1つ目はテキストxの長さです。テキストが長いほど電子透かしの証拠となる要素が多く含まれるため、判定における統計的な確実性が高まります。2つ目は、電子透かし付きテキストxを生成する際のLLM分布におけるエントロピー量です。例えば、LLM分布のエントロピーが非常に低い場合、つまり与えられたプロンプトに対してほぼ常に全く同じ応答を返す場合、Tournamentサンプリングはg関数の下でより高いスコアを持つトークンを選ぶことができません。要するに、他の生成的電子透かしと同様、Tournamentサンプリングは、LLM分布のエントロピーが大きいほど高い性能を発揮し、エントロピーが小さいほど効果が低下します。

また、人間が書いたテキストを軽く校正しただけの場合、信頼できる検出を行うにはClaudeが生成した部分の量が少なすぎる可能性がある点にも注意が必要です。

Anthropicによれば、電子透かしはClaudeが実際に選択した単語にのみ適用されるため、文法や句読点をわずかに変更しただけでは、十分な検出根拠が得られない場合があるとのことです。

Anthropicは、Claudeによる翻訳結果には電子透かしが付与されると述べています。翻訳された出力の単語はすべてClaudeが選択したものだからです。

Anthropic、Claudeの電子透かしを検出するAPIを開発中

実は、この電子透かしをより簡単に検出する方法も用意される見込みです。Anthropicは電子透かし検出APIの提供を計画しています。

このAPIは、あるテキストの作成にClaudeが関与していた可能性を推定できるようになりますが、Anthropicはこれが「誰が書いたかを証明すること」と同じではない点を強調しています。

また、Claudeの電子透かしでは、そのテキストが別のAIモデルによって書かれたものかどうかを識別することはできません。他のプロバイダーは異なる電子透かし方式や異なる鍵を使用している可能性があるためです。

「電子透かしによって判定できるのは、あるコンテンツにClaudeが何らかの形で関与していた可能性が高いということだけです。『Claudeがこれを書いた』のか『Claudeがこれを大幅に編集した』のかを区別することはできません。」

「軽微な編集であれば電子透かしが完全に失われることはおそらくありませんが、すべての単語を置き換えるような全面的な書き直しを行えば、電子透かしは失われます。」

また、サンプルが小さいほど検出器が分析できる単語選択の数が少なくなるため、検出の信頼性も低下します。

生成されたPNG、JPG、SVGファイルについては、Anthropicは異なるアプローチを採用しています。

Claudeは、ファイル自体に埋め込み型の電子透かしを施す代わりに、そのファイルがClaudeによって作成または処理されたことを示す、暗号署名付きのC2PAプロベナンス(来歴)メタデータを付与します。

攻撃者が有効な認証情報を入手した後、その行動のうちブロックされるのはわずか37%

全体的な防御スコアだけでは、初期侵入後に何が起きているかが見えなくなる場合があります。攻撃者が有効な認証情報を使用し始めると、防御の成功率は急激に低下します。

「The Blue Report 2026」は、顧客の実運用環境で実施された3億3,800万回のシミュレーションをもとに、防御手法ごとの効果を測定しています。

レポートを入手する

翻訳元: https://www.bleepingcomputer.com/news/artificial-intelligence/how-anthropic-plans-to-watermark-claudes-ai-generated-text/

本記事は bleepingcomputer.com の記事を翻訳・要約したものです。