論文の概要: Chainwash: Multi-Step Rewriting Attacks on Diffusion Language Model Watermarks
- arxiv url: http://arxiv.org/abs/2605.05503v1
- Date: Wed, 06 May 2026 23:00:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.440908
- Title: Chainwash: Multi-Step Rewriting Attacks on Diffusion Language Model Watermarks
- Title(参考訳): Chainwash: 拡散言語モデルによるマルチステップリライト攻撃
- Abstract要約: 本稿では,透かしを施したテキストが1回ではなく数回書き直された場合に何が起こるかを考察する。
透かしは、基準値閾値で元の出力の87.9%で検出される。
5つの連鎖書き直しの後、検出は4.86%に低下し、もともと検出されたテキストの94.76%は、もはやフラグ付けされない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Statistical watermarking is a common approach for verifying whether text was written by a language model. Most existing schemes assume autoregressive generation, where tokens are produced left to right and contextual hashing is well defined. Diffusion language models generate text by denoising tokens in arbitrary order, so these schemes cannot be applied directly. A recent watermark by Gloaguen et al. addresses this gap for LLaDA 8B Instruct and reports true positive detection above 99%. This paper studies what happens when watermarked text is rewritten not once but several times. Using the same watermark configuration, 1,605 watermarked completions of about 300 tokens each are produced across five WaterBench domains. Each completion is rewritten by four open weight language models, from 1.5B to 8B parameters, none of which know the watermark key. Five rewrite styles are tested: paraphrase, humanize, simplify, academic, and summarize expand. Each style is chained for up to five hops, producing 160,500 rewritten texts in total. The watermark is detected on 87.9% of the original outputs at the standard significance threshold. After a single rewrite, detection falls to between 14% and 41% depending on the rewriter and style. After five chained rewrites, detection falls to 4.86%, meaning 94.76% of the originally detected texts are no longer flagged. After three rewrites, the detector score has dropped 86% of the way from its watermarked baseline toward the null distribution. Repeated rewriting is therefore a much stronger attack than a single rewrite, and the result holds across all four rewriters tested.
- Abstract(参考訳): 統計的透かしは、テキストが言語モデルによって書かれたかどうかを検証するための一般的なアプローチである。
ほとんどの既存のスキームは自己回帰生成を前提としており、トークンは左右に生成され、コンテキストハッシュは適切に定義されている。
拡散言語モデルは任意の順序でトークンを識別することでテキストを生成するため、これらのスキームを直接適用することはできない。
Gloaguenらによる最近の透かしは、LLaDA 8Bインストラクションのこのギャップに対処し、99%以上の正の検出を報告している。
本稿では,透かしを施したテキストが1回ではなく数回書き直された場合に何が起こるかを考察する。
同じ透かし構成を用いて、5つのWaterBenchドメインで1,605個の透かし付きトークンがそれぞれ約300個の透かしで作成される。
それぞれの完了は、1.5Bから8Bパラメータの4つのオープンウェイト言語モデルによって書き換えられ、いずれもウォーターマークキーを知らない。
5つの書き直しスタイルがテストされている: パラフレーズ、人間化、単純化、学術、要約。
それぞれのスタイルは最大5つのホップでチェーンされ、合計で160,500点の書き直しがなされている。
透かしは、基準値閾値で元の出力の87.9%で検出される。
1回の書き直しの後、リライタとスタイルによって検出は14%から41%に低下する。
5つの連鎖書き直しの後、検出は4.86%に低下し、もともと検出されたテキストの94.76%は、もはやフラグ付けされない。
3回のリライトの後、検出器のスコアは、透かしのあるベースラインからヌル分布への道の86%を落とした。
したがって、繰り返し書き直しは単一の書き直しよりもはるかに強力な攻撃であり、その結果はテストされた4つの書き直しにまたがる。
関連論文リスト
- Signature filtering: a lightweight enhancement for statistical watermark detection in large language models [0.754900594011865]
Signature filteringは、透かしの埋め込みやテキスト生成を変更することなく、透かし検出を強化する検出時モジュールである。
繰り返し透かしテストの信頼性を損なう小さなトークンセットを学び、検出前にこれらのトークンを削除する。
2グラムと3グラムのシグネチャは、弱信号および低エントロピー設定における検出率を、フィルタリングなしで831%からフィルタリングで7899%に引き上げた。
論文 参考訳(メタデータ) (2026-06-16T19:24:32Z) - Revealing Weaknesses in Text Watermarking Through Self-Information Rewrite Attacks [36.01146548147208]
テキスト透かしアルゴリズムは、テキストの品質を保証するために、ハイエントロピートークンに透かしを埋め込む。
本稿では,この外観上の不明瞭な設計が攻撃者によって悪用され,透かしの堅牢性に重大なリスクを及ぼすことを明らかにする。
本稿では,トークンの自己情報を計算することで,その脆弱性を利用する汎用的なパラフレーズ攻撃を提案する。
論文 参考訳(メタデータ) (2025-05-08T12:39:00Z) - Watermarking Language Models for Many Adaptive Users [47.90822587139056]
証明可能な保証付き言語モデルの透かし方式について検討する。
モデル生成テキストを個々のユーザに対してトレース可能なマルチユーザ透かしを導入する。
検出不能なChrist, Gunn, Zamir (2024) のゼロビットスキームが適応的に堅牢であることを証明する。
論文 参考訳(メタデータ) (2024-05-17T22:15:30Z) - Mark My Words: Analyzing and Evaluating Language Model Watermarks [8.025719866615333]
この研究は、画像やモデル透かしとは対照的に、出力透かし技術に焦点を当てている。
品質、サイズ(透かしを検出するのに必要となるトークンの数)、抵抗の改ざんという3つの主要な指標に注目します。
論文 参考訳(メタデータ) (2023-12-01T01:22:46Z) - Robust Distortion-free Watermarks for Language Models [85.55407177530746]
本稿では,自動回帰言語モデルからテキストに透かしを植え付ける手法を提案する。
言語モデルから乱数列をサンプルにマッピングすることで、透かし付きテキストを生成する。
論文 参考訳(メタデータ) (2023-07-28T14:52:08Z) - On the Reliability of Watermarks for Large Language Models [95.87476978352659]
本研究では,人間による書き直し後の透かしテキストの堅牢性,非透かしLDMによる言い換え,あるいはより長い手書き文書への混在性について検討する。
人や機械の言い回しをしても、透かしは検出可能である。
また、大きな文書に埋め込まれた透かし付きテキストの短いスパンに敏感な新しい検出手法についても検討する。
論文 参考訳(メタデータ) (2023-06-07T17:58:48Z) - Watermarking Text Generated by Black-Box Language Models [103.52541557216766]
テキスト生成中に透かしを埋め込むことのできるホワイトボックスLCMに対して,透かしに基づく手法が提案されている。
リストを認識した検出アルゴリズムは、透かし付きテキストを識別することができる。
我々はブラックボックス言語モデル利用シナリオのための透かしフレームワークを開発する。
論文 参考訳(メタデータ) (2023-05-14T07:37:33Z) - Paraphrasing evades detectors of AI-generated text, but retrieval is an
effective defense [56.077252790310176]
本稿では,パラフレーズ生成モデル(DIPPER)を提案する。
DIPPERを使って3つの大きな言語モデル(GPT3.5-davinci-003)で生成されたテキストを言い換えると、透かしを含むいくつかの検出器を回避できた。
我々は,言語モデルAPIプロバイダによって維持されなければならない,意味論的に類似した世代を検索するシンプルなディフェンスを導入する。
論文 参考訳(メタデータ) (2023-03-23T16:29:27Z) - A Watermark for Large Language Models [84.95327142027183]
本稿では,プロプライエタリな言語モデルのための透かしフレームワークを提案する。
透かしはテキストの品質に無視できない影響で埋め込むことができる。
言語モデルAPIやパラメータにアクセスすることなく、効率的なオープンソースアルゴリズムを使って検出することができる。
論文 参考訳(メタデータ) (2023-01-24T18:52:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。