論文の概要: Watermark Forensics for Generative Models: An Information-Theoretic Perspective
- arxiv url: http://arxiv.org/abs/2607.13003v1
- Date: Tue, 14 Jul 2026 17:49:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.24128
- Title: Watermark Forensics for Generative Models: An Information-Theoretic Perspective
- Title(参考訳): 生成モデルのための透かし法則:情報理論の視点から
- Abstract要約: 生成モデルの出力の透かしは通常、テキストが機械化されているかどうかのみ尋ねられる。
同じマークは、作成したユーザに属性付けしたり、隠されたペイロードを抽出したり、編集を生き残る部分をローカライズしたりできる。
S$ をマークが持つ秘密(ユーザのIDまたはペイロード)とし、情報プロファイル $(t)=I(S;X_tmid X_t)$レコードに、以前のものからすると、$t$-thトークンが約$S$を示すかを記録する。
- 参考スコア(独自算出の注目度): 21.787038393697056
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A watermark in a generative model's output is usually asked only whether a text is machine-made. The same mark can do more: attribute it to the user who produced it, extract a hidden payload, or localize the part that survives editing. These form a forensic ladder, and we ask what each rung costs in the sample length $n$. One object organizes the answers. Let $S$ be the secret the mark carries (a user's identity or payload), and let the information profile $ν(t)=I(S;X_t\mid X_{<t})$ record how much the $t$-th token reveals about $S$ given the earlier ones. Its total mass pays for attribution and extraction; how that mass is spread pays for localization; and detection alone is paid for not by information but by presence, the distance from the marked to the unmarked distribution. The literature's two quality models, a mark subtle on every token and one that stamps a few tokens loudly, are two incomparable ways of capping this profile. Our main theorem settles the ladder's entropy column. For statistically distortion-free schemes, attributing a text to one of $N$ users costs $Θ(\log N/h)$ tokens over every stationary-ergodic source of entropy rate $h$, sharp to a $(1+o(1))$ factor: to our knowledge the first tight entropy-rate law for multi-user attribution (via exact alignment). The natural collision-counting analysis overcharges without bound; only a decoder thresholding each candidate by its own realized surprisal attains the rate while almost never implicating an innocent user. A matching converse makes the law two-sided, and extraction of an $\ell$-bit payload costs $Θ(\ell/h)$. Two gaps are real, not modeling artifacts: a $Θ(\log N)$-token window in which a text is provably machine-made yet unattributable, and a footprint-resolution uncertainty principle. Experiments on GPT-2, Pythia-410M, and Qwen2.5 recover the predicted constants.
- Abstract(参考訳): 生成モデルの出力の透かしは通常、テキストが機械化されているかどうかのみ尋ねられる。
同じマークは、作成したユーザに属性付けしたり、隠されたペイロードを抽出したり、編集を生き残る部分をローカライズしたりできる。
これらは法医学的なはしごを形成し、各ラングがサンプル長さ$n$のコストを問う。
1つのオブジェクトが回答を整理します。
S$ をマークが持つ秘密(ユーザのIDまたはペイロード)とし、情報プロファイル $ν(t)=I(S;X_t\mid X_{<t})$レコードに、以前のトークンからすると、$t$-thトークンが約$S$を示すかを記録する。
その総質量は帰属と抽出の代償であり、その質量の拡散は局所化の代償であり、検出は情報ではなく存在によってのみ支払われる。
論文の2つの品質モデル、各トークンに微妙なマークと、いくつかのトークンを大声でスタンプする2つのモデルは、このプロファイルをカプセル化する2つの相反する方法である。
我々の主定理は、はしごのエントロピー列を定めている。
統計的に歪みのないスキームでは、テキストを$N$ユーザの1つに割り当てるには、すべての固定エルゴディックなエントロピーレートの源である$h$, sharp to a $(1+o(1))$ factor: 私たちの知る限り、マルチユーザー属性に対する最初の厳密エントロピーレートの法則(正確なアライメントによる)が費やされる。
自然衝突計数分析は制限なくオーバーチャージされ、それぞれの候補をそれ自身で閾値付けするデコーダのみが、無実のユーザをほとんど含まないまま、そのレートを達成します。
一致する逆は、法則を二辺にし、$$\ell$-bitペイロードの抽出は、$(\ell/h)$である。
テキストが証明可能な機械で作成されるが帰属できない$(\log N)$-tokenウィンドウとフットプリント分解能の不確実性原理の2つのギャップは、アーティファクトをモデル化するものではない。
GPT-2、Pythia-410M、Qwen2.5の実験では予測定数が回復した。
関連論文リスト
- Sharp Minimax Regret for Infinite-Memory Logistic Prediction [55.29259818039367]
Lag $j$はスケール$r_j$の予測に影響を与え、$n_T,j=T-j+1$の予測ラウンドに入る。
すべての要約可能なエンベロープに対して、局所化された混合は$cR_T(r)leq C_T(r)$を証明する。
指数関数やエンベロープの場合、有限サンプル条件の下では、トープリッツ・デサインの逆は$cR_T(r)geq c_T(r)$である。
論文 参考訳(メタデータ) (2026-08-27T01:31:46Z) - Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings [0.5076419064097734]
シリアル検証ゲートはLLMハーネスのコア信頼性プリミティブである。
候補の答えが返されるのは、$k$検証者が全てそれを受け入れた場合に限られる。
このノートはそのような理論を最小限にしている。
論文 参考訳(メタデータ) (2026-07-15T14:58:37Z) - Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes [70.61868608402723]
我々は$textbfSelf-Correcting Coupled Markov Jump Processes (SC-CMJP)を紹介する。
SC-CMJPと組み合わせて、共同マルチモーダルジェネレーションのための新しいトレーニングフリーシングルパスサンプリングであるtextttCO_texttt2textttJump$を紹介する。
トレーニングと評価のために,我々は3つの大規模ジョイントマルチモーダル生成コーパスを作成し,リリースする。
論文 参考訳(メタデータ) (2026-07-14T18:39:29Z) - Before and After Temperature: A Distributional View of Creative LLM Generation [0.6927055673104934]
パイプラインでは、より強力なシグナルが1歩早く存在することが示されています。
Llama-3.1-8B-Instruct generations of 500 open-ended creative prompts at 0.3, 0.8, 1.5$, a single-token feature predicts the within-prompt creative rank。
機械的には、勝利はインコヒーレンス体制の鋭い分布的な署名から生まれる。
論文 参考訳(メタデータ) (2026-05-31T21:13:47Z) - Instance-optimal high-precision shadow tomography with few-copy measurements: A metrological approach [2.956729394666618]
シャドウトモグラフィーの高精度化過程における試料の複雑さについて検討した。
我々は、$O(mathrmpolylog(d))$$のコピー数に一度に作用するアダプティブな測定値を使用する。
論文 参考訳(メタデータ) (2026-02-04T19:00:00Z) - Superposed Decoding: Multiple Generations from a Single Autoregressive Inference Pass [72.07642648108849]
Superposed Decodingは、1つの自己回帰推論パスのコストで$k$のドラフトを生成する新しい復号アルゴリズムである。
Superposed Decodingは、他のデコード戦略と組み合わせることで、推論時間計算のスケーリング時に普遍的なカバレッジが向上する。
論文 参考訳(メタデータ) (2024-05-28T17:40:48Z) - Mechanics of Next Token Prediction with Self-Attention [41.82477691012942]
トランスフォーマーベースの言語モデルは、入力シーケンスが与えられた次のトークンを予測するために、大きなデータセットでトレーニングされる。
勾配降下による自己注意の訓練は,次のトークンを2つの異なるステップで生成するオートマトンを学習することを示す。
これらの発見が、どのように自己認識がシーケンシャルなデータをどのように処理し、より複雑なアーキテクチャをデミステライズする道を開くか、光を当てることを願っています。
論文 参考訳(メタデータ) (2024-03-12T21:15:38Z) - Towards Optimal Statistical Watermarking [95.46650092476372]
仮説テスト問題として定式化して統計的透かしを研究する。
我々の定式化の鍵は、出力トークンと拒絶領域の結合である。
一般仮説テスト設定において,UMP(Uniformly Most Powerful)の透かしを特徴付ける。
論文 参考訳(メタデータ) (2023-12-13T06:57:00Z) - Robust Distortion-free Watermarks for Language Models [85.55407177530746]
本稿では,自動回帰言語モデルからテキストに透かしを植え付ける手法を提案する。
言語モデルから乱数列をサンプルにマッピングすることで、透かし付きテキストを生成する。
論文 参考訳(メタデータ) (2023-07-28T14:52:08Z) - Online Learning with Adversaries: A Differential-Inclusion Analysis [52.43460995467893]
我々は,完全に非同期なオンラインフェデレート学習のための観察行列ベースのフレームワークを提案する。
我々の主な結果は、提案アルゴリズムがほぼ確実に所望の平均$mu.$に収束することである。
新たな差分包摂型2時間スケール解析を用いて,この収束を導出する。
論文 参考訳(メタデータ) (2023-04-04T04:32:29Z) - Near-Optimal Regret Bounds for Multi-batch Reinforcement Learning [54.806166861456035]
本研究では,有限水平マルコフ決定過程(MDP)によってモデル化されたエピソディック強化学習(RL)問題をバッチ数に制約を加えて検討する。
我々は,$tildeO(sqrtSAH3Kln (1/delta))$tildeO(cdot)をほぼ最適に後悔するアルゴリズムを設計し,$(S,A,H,K)$の対数項を$K$で隠蔽する。
技術的貢献は2つある: 1) 探索のためのほぼ最適設計スキーム
論文 参考訳(メタデータ) (2022-10-15T09:22:22Z) - Reward-Mixing MDPs with a Few Latent Contexts are Learnable [75.17357040707347]
報酬混合マルコフ決定過程(RMMDP)におけるエピソード強化学習の検討
我々のゴールは、そのようなモデルにおける時間段階の累積報酬をほぼ最大化する、ほぼ最適に近いポリシーを学ぶことである。
論文 参考訳(メタデータ) (2022-10-05T22:52:00Z) - Mean Estimation in High-Dimensional Binary Markov Gaussian Mixture
Models [12.746888269949407]
2進隠れマルコフモデルに対する高次元平均推定問題を考える。
ほぼ最小限の誤差率(対数係数まで)を $|theta_*|,delta,d,n$ の関数として確立する。
論文 参考訳(メタデータ) (2022-06-06T09:34:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。