Anthropicは、Claudeモデルが生成したコンテンツを対象に、機械可読なコンテンツマーキングの取り組みを開始しました。この取り組みでは、テキストに埋め込む不可視の透かしと、対応ファイルに付与するデジタル署名済みの来歴メタデータを組み合わせています。
今回の対応は、欧州連合(EU)のAI法第50条2項が定める透明性ガイドラインへのAnthropicのコミットメントを受けたものです。
ClaudeにAnthropicが不可視透かしを追加
この計画によれば、2026年8月2日以降にEU域内でリリースされるClaudeモデルは、当初からコンテンツマーキングに対応します。
Anthropicの発表によれば、これらの対策は欧州のユーザーに限らず全世界で適用され、Claude Platform API、Claude、Claude Code、Claude Cowork、Claude Tagなど、さまざまなClaudeサービス全般に及びます。
さらに同社は、2026年8月の期限より前にリリースされたモデルについても、EU法の移行期間の対象としてマーキング機能を有効化できるよう取り組んでいます。
Anthropicの手法は2つの異なる仕組みで構成されています。AI生成テキスト向けの埋め込み型透かしと、対応ファイル向けの署名済み来歴レコードです。
テキストについては、Claudeがモデルレベルで生成出力に不可視の透かしを直接埋め込みます。Anthropicは、このマーキングによって回答の可視部分の文言、意味、可読性、品質が変化することはないとしています。
透かしはテキスト自体に埋め込まれているため、コンテンツが他のプラットフォームにコピー&ペーストされても持続する場合があり、一部の編集を経ても残存する可能性があります。
このモデルレベルの設計は、エンタープライズのセキュリティチームやコンテンツモデレーションチームにとって重要です。エンドユーザー向けアプリケーション、開発者向けAPI、パートナーがホストするインフラのいずれを通じてClaudeにアクセスした場合でも、透かしが確実に適用されることを担保するためです。
Cloudsecurity certification
さらに、対応するClaudeモデルにAWS、Google Cloud、Microsoft Foundryなどのサービス経由でアクセスした場合も、同じテキスト透かしが有効になります。ただし、ファイルベースのメタデータへの対応状況は、各クラウドプラットフォームの機能によって異なる場合があります。
SVG、PNG、JPGを含む対応ファイル形式については、Claudeは「コンテンツの来歴と真正性に関する連合(Coalition for Content Provenance and Authenticity、C2PA)」のオープン標準に準拠した署名済み来歴メタデータを付与します。
このC2PAメタデータにより、Claudeがそのファイルを処理したことを確認できるほか、ファイルが改ざんされたかどうかを示すシグナルも得られます。署名済みメタデータが無傷のまま残っていれば、下流のツールは来歴レコードが追加された後にファイルが変更されたかどうかを判定できます。
この仕組みは、セキュリティチームや出版社、調査担当者が、検証可能なClaude処理シグナルを持つコンテンツと、信頼できる来歴情報を欠くファイルとを区別する際に役立ちます。
Anthropicは、マークが検出されたからといって、その基盤となるコンテンツすべてをClaudeが作成したことを決定的に証明するものではないと注意を促しています。
例えば、モデルが人間の書いた素材を校正、翻訳、要約、再フォーマット、あるいはその他の処理をした後でも、文書にはClaudeの透かしが残っている場合があります。また、透かしが存在しないからといって、そのコンテンツを人間が作成したと確認できるわけではありません。
テキストが大幅に編集されたり、言い換えられたり、翻訳されたり、他の文章と混在していたり、あるいは信頼できるシグナルを得るには短すぎたりする場合、検出に失敗することもあります。ファイルのメタデータについても、変換、再保存、スクリーンショットの取得、非対応のワークフローといったプロセスによって除去される可能性があります。
Claudeを活用した製品を開発する開発者に対して、AnthropicはEU AI法の下での自社の透明性に関する義務を独自に評価する必要性を強調しました。同社は、マーキングおよび検出手法についてさらに技術的に踏み込んだガイダンスを今後提供する予定です。
新たなフィッシングやマルウェアがビジネスを侵害する前に食い止めましょう。 世界15,000のSOCからのライブインテリジェンスを統合できます
翻訳元: https://gbhackers.com/anthropic-adds-invisible-watermarks-to-claude-ai-generated-text/