AIの安全性と統治を象徴する青い保護構造の抽象ビジュアル
NAW / GOVERNANCE 07

IMAGE: AI生成ビジュアル

GOVERNANCE / POLICY & SAFETY

Anthropic、Claudeテキスト透かしの仕組みを技術解説 — SynthID-Text方式・検出API提供へ・コードへの影響も言及

8月14日付ブログで透かしの実装詳細を公開。Google DeepMindのSynthID-Text(Nature 2024)ベースで、出力品質・速度・コストに実質影響なし、追加トークンや隠し文字もなし。個人・組織・チャットへの追跡は不可能と明記。コードには正確性が求められる箇所には適用されず、コメントなど任意選択の語に限定的に作用。まもなく透かし検出APIを提供予定。

Anthropicは2026年8月14日、ブログ記事「How Claude’s text watermark works」を公開し、Claudeが生成するテキストに埋め込む電子透かしの技術詳細を明らかにした。8月13日に発表された導入の概要(本サイト既報)に続く形で、EU AI Actへの対応として8月2日以降に公開されたClaudeモデルが対象となる透かしについて、「どのような仕組みか」「出力やコードにどう影響するか」「検出はどう行うか」を具体的に解説している。

透かしの仕組み — SynthID-Text方式

Anthropicによると、Claudeのテキスト透かしはGoogle DeepMindが2024年にNature誌で発表した「SynthID-Text」の実装版だ。この手法は2022年にScott Aaronson氏が提案したアイデアに遡る手法ファミリーに属し、次に来る単語の選択肢が複数あり、どれを選んでも文意がほぼ変わらない「低リスクの選択」を利用する。

  • モデルは次単語を選ぶ際、文意がほぼ同じ複数の候補(例:「overcast」と「grey」)からランダムに選択している。透かしはこの選択を、通常の乱数ではなく「キーと直前の単語列」から決まる乱数で置き換える
  • キーを持つ検出者は、生成された単語列の選択パターンがキーに整合するかを確認し、「Claudeが生成に関与した可能性」を確率として判定できる
  • テキストに隠し文字は追加されず、追加トークンも発生しない。出力の品質・創造性・可読性への影響は内部テストで確認されなかったと説明している
  • SynthID-Text論文では、Geminiトラフィックの一部に透かし入りモデルを配信して評価した結果、品質評価(サムズアップ/ダウン)に統計的に有意な差は見られなかったとAnthropicは引用している
  • 透かしは個人・組織・チャットを特定する情報を持たず、誰にでも遡れるものではないと明記されている

コードと編集への影響

透かしは「どちらの単語を選んでも同等に正しい」選択肢がある場面にのみ作用するため、正確さが求められる出力には原則適用されない。コード生成はこの典型例だとAnthropicは説明している。

  • 「2 + 2 =」の後に続く答えのように唯一の正解がある箇所には透かしの「微調整」は適用されない
  • コードは多くの場合正確さが要求されるため、他のテキストより透かしが薄くなる。透かしが入るのはコメントなど任意の語選択がある箇所に限られ、実際のコードへの影響は無視できる程度だとしている
  • 校正・軽微な編集では、変更された語が少ないため透かしが十分に残らない可能性がある。逆に完全な書き換え(全単語の置換)なら透かしは除去されるが、それは「もはやAI生成とは呼べない」とAnthropicは指摘する
  • 翻訳はすべての単語をClaudeが選ぶため、透かしが付与される

検出APIと今後の展開

Anthropicは透かしの検出手段として、まもなく専用の検出APIを提供する予定だと述べている。実装の詳細は現在検討中で、画像などのファイルについてはテキスト透かしとは別に、C2PA形式のコンテンツクレデンシャル(来歴情報)をファイルのメタデータに付与する方針をあらためて説明した。

  • 検出API: 「まもなく提供予定」とされ、詳細は実装中。検出は「Claudeが生成した可能性」を示すもので、人間が書いたかどうかを断定するものではない
  • C2PA: .png・.jpg・.svgなど対応形式のファイルに、暗号署名された小さな来歴情報をメタデータとして付与。ファイルの中身は変更されず、透かし(テキストに埋め込む信号)とは異なる仕組みと説明されている
  • 既存モデル: 8月2日以前に公開されたモデルにはEU法の移行期間が適用され、今後数ヶ月かけて段階的に透かし対応を追加する
  • 適用範囲: 地域ごとに限定する恒久的な方法がまだないため、開始時点では全世界に適用。EU Code of PracticeにはAnthropicを含む約190者が2026年7月に署名している
  • 透かしの限界: 短い文章では判定材料が少なく検出が効きにくい。事実記述が中心の文章では透かしが入る余地が小さくなる。既存のAI検出ソフト(Pangramなど)が文章の言い回しのパターンを見るのとは原理が異なる

出典