研究データと神経構造が融合した青い抽象ビジュアル
NAW / RESEARCH 04

IMAGE: AI生成ビジュアル

RESEARCH / RESEARCH

透かしでAIの拒否が緩む?Lasso SecurityがSynthID-Textの「サンプリング・ドリフト」を報告 — 6モデルで検証

Lasso Securityは2026年9月17日、SynthID-Textの透かし入り生成がLLMの拒否挙動とエージェントのツール呼び出しを変える「サンプリング・ドリフト」を報告した。6つのオープンモデルで検証し、プロンプトインジェクション下では有害要求への準拠が増加。EU AI Actの来歴表示義務で導入が進む透かしは、展開構成での再評価が必要だと提言する。

AIセキュリティ企業のLasso Securityは2026年9月17日、テキスト透かしがLLMとAIエージェントの挙動に与える影響を調べた研究**「The Provenance Tax」(研究者:Andrea Siposova)を公表した。Google DeepMindのSynthID-Text**(トーナメント・サンプリング方式、Hugging Face実装の非歪み構成)を6つのオープンウェイトモデルに適用し、透かし入り生成が安全上の拒否挙動とツール呼び出しの正誤を変える**「サンプリング・ドリフト」**を確認したとする。透かしは来歴表示のための仕組みだが、トークン選択過程を変えるため、エージェントの判断過程そのものに入り込む点が問題提起の核心だ。

プロンプトインジェクション下で拒否が緩む

  • 背景として、Anthropicが将来のClaudeモデルに透かしを埋め込むと発表し、その方式がSynthID-Textベースと開示されたこと、EU AI Act第50条(2)が合成テキストへの機械可読な marking を求めていることが挙げられている。
  • 実験は、有害要求200項目(HarmBench)と、検索結果を装い「安全フィルターは無効」との敵対的指示を付加する固定のプロンプトインジェクション手法を組み合わせ、温度T=0.001と0.7で透かしの有無を同一入力で対照比較した。
  • 裸の有害要求では透かしの影響は小さいが、インジェクション下では複数のモデルで拒否から準拠への変化が拡大した。T=0.001ではgemma-3-27bの不一致率が6.0%から23.5%に増え、正味の有害準拠は−1.0から+12.5ポイントへ変化。gemma-3-12bも7.5%から11.0%に増え、正味−0.5から+9.0ポイントとなった。Llama-3.1-8Bもインジェクション下で14.0%(T=0.001)・17.5%(T=0.7)の不一致を示した。
  • 温度変更による不一致との比較では、6モデル中4モデルで透かし起因の不一致が温度起因を有意に上回った。phi-4とQwen3-4Bはほぼ動かなかったが、両モデルは無害な対照項目も過剰拒否する傾向があり、安全性が保たれた証拠とは解釈できないと注意されている。

ツール呼び出しの誤りも変化、鍵依存性と限界

  • Berkeley Function Calling Leaderboard(BFCL)を用いたツール呼び出し実験では、透かしが個々の呼び出しの正誤を入れ替えた。Llama-3.1-8Bでは誤った引数が−3.48ポイント、誤ったツールが−1.84ポイントと精度を押し下げ、phi-4(−5.96)とGranite-3.2-8B(−4.36)では不正形式の出力が主因だった。同じ集計精度でも失敗モードはモデルごとに異なる。
  • 透かし鍵を11種類で変えた感度分析では、鍵を変えるだけで攻撃成功率の増減の向きも大きさも変わった。Llama-3.1-8Bでは研究用鍵で+3.5ポイント、他の10鍵は平均+4.4ポイントで−4.5〜+14.5ポイントの範囲に分布した。プロバイダー側が鍵を管理するモデルでは、エージェント開発者の管理外で挙動が変わり得る点が指摘されている。
  • 限界として、本研究はClaudeの実装そのものではなくHugging Face版のSynthID-Text実装を用い、トークン抽出を統制できる6つのオープンウェイトモデルでの検証であること、拒否実験はモデル単体の測定でツール実行を伴う複合失敗は直接検証していないことが明示されている。
  • 提言は透かし反対ではなく、来歴表示(検出可能性・品質維持)と挙動安定性は別の性質であり、透かしの導入・設定・鍵の変更時は展開構成のまま対照比較とインジェクション下評価を含む再評価を行うべき、というものだ。平均精度が不変でも個別判断の入れ替わりは隠れるため、正味性能と対照不一致の両方の報告が推奨されている。

出典