論文の概要: Invisible Ink, Visible Lies: How Production Watermarking Causes LLMs to Hallucinate
- arxiv url: http://arxiv.org/abs/2610.04860v1
- Date: Sun, 04 Oct 2026 02:02:08 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:46:02.630886
- Title: Invisible Ink, Visible Lies: How Production Watermarking Causes LLMs to Hallucinate
- Title(参考訳): 目に見えないインクと可視な嘘:LLMはどのようにして幻覚を引き起こすのか
- Abstract要約: We study watermarking hallucination: factual error induced or amplified by watermarking。
実ミスを発生させながら、透かしの出力が流動的であることを示す。
本稿では,既存の透かし手法と一体化して現実性を向上させるための2つのプラグイン介入を提案する。
- 参考スコア(独自算出の注目度): 9.274123613571515
- License:
- Abstract: Text watermarking helps identify AI-generated content, but its effect on factual reliability remains underexplored. In this paper, we study watermarking hallucination: factual errors induced or amplified by watermarking even when the required evidence is present in the context and the unwatermarked model can answer correctly. Using a controlled retrieval-augmented generation setting, we compare unwatermarked and watermarked generations under the same context, query, and decoding configuration, and quantify their factual accuracy decrease. Across six representative watermarking methods, including KGW, SWEET, DiPmark, GumbelSoft, Gumbel-Max, and SynthID watermarking, we consistently observe watermark-induced hallucination. Watermarked outputs can remain fluent while introducing factual errors. We attribute this failure mode to two mechanisms: (1) token perturbations in the current-step arising from method-specific reweighting or keyed sampling, and (2) prefix-induced attention drift, which accumulates through autoregressive decoding and weakens later attention to the factual context. Motivated by this analysis, we propose two plug-in interventions at the token and attention levels that can be integrated into existing watermarking methods to improve factuality. At a matched TPR of 0.90 at 1% FPR, combining the two interventions reduces factual errors by approximately 90% relative to watermark-only decoding while preserving fluency and comparable decoding efficiency. Overall, this work highlights factuality as a first-class criterion in watermark evaluation, alongside detectability and robustness, and calls for careful factuality validation before deploying watermarks in fact-critical applications.
- Abstract(参考訳): テキスト透かしはAIが生成したコンテンツを識別するのに役立つが、実際の信頼性に対する影響は未解明のままである。
本稿では,この文脈において必要な証拠が存在する場合や,非透かしモデルが正しく答えられる場合であっても,透かしによって引き起こされた,あるいは増幅された事実的誤りについて検討する。
制御された検索拡張生成設定を用いて、同じコンテキスト、クエリ、デコード構成の下で、透かしのない世代と透かしのある世代を比較し、実際の精度の低下を定量化する。
KGW, SWEET, DiPmark, GumbelSoft, Gumbel-Max, SynthID の計6つの代表的な透かし法について, 常に透かしによる幻覚を観察する。
ウォーターマークされたアウトプットは、事実的エラーを導入しながらも、流動性を維持することができる。
この障害モードは,(1)メソッド固有の再重み付けやキー付きサンプリングから生じる現在のステップにおけるトークンの摂動と,(2)自己回帰復号化によって蓄積されるプレフィックス誘起の注意ドリフトの2つのメカニズムに起因する。
この分析により,既存の透かし手法に統合し,事実性を改善するために,トークンと注意レベルに2つのプラグイン介入を提案する。
一致したTPRは1%のFPRで0.90であり、この2つの介入を組み合わせることで、流速と同等の復号効率を保ちながら、透かしのみの復号と比較して、事実エラーを約90%削減できる。
全体として、本研究は、透かし評価の第一級基準として、検出性と堅牢性とともに事実性を強調し、事実クリティカルなアプリケーションに透かしを配置する前に、注意深い事実性検証を要求する。
関連論文リスト
- Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio [58.612001688217056]
自己回帰モデルに対する推論時透かしは、離散化の不整合による連続的なモダリティには適さない。
合成音声の強力で堅牢な透かしのためのエレガントな解法を提案する。
論文 参考訳(メタデータ) (2026-05-25T15:43:20Z) - Learning Generalizable and Efficient Image Watermarking via Hierarchical Two-Stage Optimization [90.13049455759358]
ウォーターマーキングモデルが同時に3つの基準を達成できる2段階最適化を提案する。
HiWLは、広い適用性を維持しながら、一般化可能な潜在空間の透かし表現を効果的に学習する。
従来の方法よりも7.6%高い精度で透かし抽出が可能で、非常に低レイテンシ(8秒で処理された100K画像)を維持している。
論文 参考訳(メタデータ) (2025-08-12T06:21:27Z) - Multi-use LLM Watermarking and the False Detection Problem [12.954387412283973]
デジタル透かしは、自動生成されたテキストの誤用に起因するリスクを軽減できる有望な解決策である。
しかし,検出とユーザ識別の両方に同じ埋め込みを同時に使用すると,誤検出の問題が発生する。
本稿では,検出と識別を共同で生成したテキストに符号化するDual Watermarkingを提案する。
論文 参考訳(メタデータ) (2025-06-19T02:37:02Z) - Revealing Weaknesses in Text Watermarking Through Self-Information Rewrite Attacks [36.01146548147208]
テキスト透かしアルゴリズムは、テキストの品質を保証するために、ハイエントロピートークンに透かしを埋め込む。
本稿では,この外観上の不明瞭な設計が攻撃者によって悪用され,透かしの堅牢性に重大なリスクを及ぼすことを明らかにする。
本稿では,トークンの自己情報を計算することで,その脆弱性を利用する汎用的なパラフレーズ攻撃を提案する。
論文 参考訳(メタデータ) (2025-05-08T12:39:00Z) - Towards Dataset Copyright Evasion Attack against Personalized Text-to-Image Diffusion Models [52.877452505561706]
データセットのオーナシップ検証(DOV)を損なうよう特別に設計された最初の著作権回避攻撃を提案する。
CEAT2Iは, 試料検出, トリガー同定, 効率的な透かし除去の3段階からなる。
実験の結果,CEAT2I はモデル性能を保ちながら DOV 機構を効果的に回避できることがわかった。
論文 参考訳(メタデータ) (2025-05-05T17:51:55Z) - Duwak: Dual Watermarks in Large Language Models [49.00264962860555]
トークン確率分布とサンプリングスキームの両方に二重秘密パターンを埋め込むことにより、透かしの効率と品質を向上させるために、Duwakを提案する。
Llama2でDuwakを4つの最先端透かし技術と組み合わせて評価した。
論文 参考訳(メタデータ) (2024-03-12T16:25:38Z) - Unbiased Watermark for Large Language Models [67.43415395591221]
本研究では, モデル生成出力の品質に及ぼす透かしの影響について検討した。
出力確率分布に影響を与えることなく、透かしを統合することができる。
ウォーターマークの存在は、下流タスクにおけるモデルの性能を損なうものではない。
論文 参考訳(メタデータ) (2023-09-22T12:46:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。