論文の概要: Sample Complexities of Estimating Gumbel--Max Watermark Proportions with and without Reduction to Pivotal Statistics
- arxiv url: http://arxiv.org/abs/2607.00224v2
- Date: Thu, 02 Jul 2026 02:56:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.506446
- Title: Sample Complexities of Estimating Gumbel--Max Watermark Proportions with and without Reduction to Pivotal Statistics
- Title(参考訳): ガムベル推定の特異な複雑さ--フラクタル統計量の減少と非減少を伴う最大透かし
- Abstract要約: 透かしは、大きな言語モデル(LLM)が使用する統計的トレーサビリティを約束するが、実際の文書は、純粋に人間書きか純粋にLLM生成として現れることは滅多にない。
我々は,この透かし比推定問題をGumbel-max透かし機構を用いて検討した。
我々はLaguerre-polynomial estimatorを開発し、サンプルの複雑さに一致する情報理論の下限を確立する。
- 参考スコア(独自算出の注目度): 4.346179456029564
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Watermarking promises statistical traceability of large language model (LLM) uses, but real documents rarely arrive as purely human-written or purely LLM-generated. This motivates a quantitative question beyond detection: what proportion of a document is generated from a pre-specified watermarked LLM? We study this watermark proportion estimation problem under the Gumbel--max watermarking mechanism, treating the next-token prediction distributions as unknown and arbitrary nuisance parameters subject to a non-degeneracy condition. We compare two observation regimes: in the full observation regime, the estimator observes the pseudorandom vector and the selected token at each position; in the more prevalent setting of pivotal reduction, it observes only a scalar pivot, which follows a one-dimensional Uniform--Beta mixture distribution. Under pivotal reduction, we develop a Laguerre-polynomial estimator and establish a matching information-theoretic lower bound for the sample complexity. For full observation, we introduce an event-counting estimator and show a matching lower bound, yielding a substantially smaller sample complexity. As our results imply, although reducing to pivotal statistics is an elegant and prevalent choice, it is not always sample-efficient for estimating the proportion of watermarks.
- Abstract(参考訳): 透かしは、大きな言語モデル(LLM)が使用する統計的トレーサビリティを約束するが、実際の文書は、純粋に人間書きか純粋にLLM生成として現れることは滅多にない。
このことは、検出以上の定量的な疑問を動機付けている。文書のどの割合が、事前に特定された透かし付きLLMから生成されるのか?
我々は,この透かし比推定問題をGumbel-max透かし機構を用いて検討し,非退化条件下での未知および任意のニュアンスパラメータとして次点の予測分布を扱い,検討した。
完全な観測系では、推定器は擬似ランダムベクトルと選択されたトークンをそれぞれの位置で観測し、より一般的には1次元の均一-ベタ混合分布に従うスカラーピボットのみを観測する。
そこで我々は,Lguerre-polynomial estimatorを開発した。
完全な観測のために、イベントカウント推定器を導入し、一致した下界を示し、サンプルの複雑さを大幅に小さくする。
以上の結果から, 偏極統計量の削減はエレガントかつ一般的な選択であるが, 透かしの比率を推定する上では, 必ずしもサンプリング効率が良いとは限らない。
関連論文リスト
- Minimax bounds for watermarked and masked recursive discrete distribution estimation [15.724207170366846]
識別機構が欠如していることから, 合成試料の添加により, 新しい実試料の限界効果が著しく低下することが示されている。
検出の偽陰性率も消えない限り,透かしを追加することで性能を向上させることは不可能であることを示す。
本稿では,残りの状態のギャップをジェンセンギャップに狭めるランダム化手法であるマスキングを提案する。
論文 参考訳(メタデータ) (2026-08-31T17:00:09Z) - Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics [49.443264461057645]
拡散および連続フローベースの言語モデルは、言語モデリングに対する非自己回帰的な主要な代替手段として現れている。
両方のパラダイムの進歩は、生成的複雑度(gen-PPL)によって圧倒的に追跡される。
我々は、この指標は正しくないと主張している。構築により、gen-PPLは、文法性やセマンティックコヒーレンスではなく、スコアARの下でのみ予測可能性を測定する。
論文 参考訳(メタデータ) (2026-06-07T02:35:56Z) - Mind the Unseen Mass: Unmasking LLM Hallucinations via Soft-Hybrid Alphabet Estimation [1.1230191950153754]
ブラックボックスアクセス下の大規模言語モデルの不確実性定量化について検討する。
効果的な意味的アルファベットサイズ - すなわち、サンプルされた応答で表される異なる意味の数 - を推定すると、下流のリスクに有用なプロキシを提供する。
そこで我々は,Good-Turingカバレッジと正規化ラプラシアンの熱カーネルトレースを組み合わせた簡易かつ解釈可能な推定器SHADEを提案する。
論文 参考訳(メタデータ) (2026-04-21T07:16:05Z) - CLT and Edgeworth Expansion for m-out-of-n Bootstrap Estimators of The Studentized Median [5.267184810624153]
m-out-of-nブートストラップはmサブサンプルをnサイズの元のサンプルから置き換えることなく繰り返し描画することで統計量の分布を近似する。
エコノメトリ、バイオ統計学、機械学習にまたがる幅広い適用性にもかかわらず、ブートストラップの音質に対する厳密なパラメータなし保証はいまだに解明されていない。
本稿では,n 個のデータセットの m-of-n 再サンプリングから得られたサンプル定量値の推定器を解析することにより,そのような保証を確立する。
論文 参考訳(メタデータ) (2025-05-16T22:14:49Z) - Nearly Optimal Sample Complexity for Learning with Label Proportions [54.67830198790247]
トレーニングセットの例をバッグにグループ化する部分情報設定であるLLP(Learning from Label Proportions)について検討する。
部分的な可観測性にもかかわらず、ゴールは個々の例のレベルで小さな後悔を達成することである。
我々は, LLPの2乗損失下でのサンプル複雑性について, 標本複雑性が本質的に最適であることを示す。
論文 参考訳(メタデータ) (2025-05-08T15:45:23Z) - Adaptive Sampled Softmax with Inverted Multi-Index: Methods, Theory and Applications [79.53938312089308]
MIDX-Samplerは、逆多重インデックスアプローチに基づく新しい適応型サンプリング戦略である。
本手法は, サンプリングバイアス, 勾配バイアス, 収束速度, 一般化誤差境界などの重要な問題に対処するため, 厳密な理論的解析によって裏付けられている。
論文 参考訳(メタデータ) (2025-01-15T04:09:21Z) - Statistically Optimal Generative Modeling with Maximum Deviation from the Empirical Distribution [2.1146241717926664]
本稿では, 左非可逆なプッシュフォワード写像に制約されたワッサーシュタインGANが, 複製を回避し, 経験的分布から著しく逸脱する分布を生成することを示す。
我々の最も重要な寄与は、生成分布と経験的分布の間のワッサーシュタイン-1距離の有限サンプル下界を与える。
また、生成分布と真のデータ生成との距離に有限サンプル上限を確立する。
論文 参考訳(メタデータ) (2023-07-31T06:11:57Z) - Detecting Adversarial Data by Probing Multiple Perturbations Using
Expected Perturbation Score [62.54911162109439]
逆方向検出は、自然分布と逆方向分布の差に基づいて、与えられたサンプルが逆方向であるかどうかを判定することを目的としている。
本研究では,様々な摂動後の標本の予測スコアであるEPS(pre expected perturbation score)を提案する。
EPSに基づく最大平均誤差(MMD)を,試験試料と自然試料との差を測定する指標として開発する。
論文 参考訳(メタデータ) (2023-05-25T13:14:58Z) - Statistical Efficiency of Score Matching: The View from Isoperimetry [96.65637602827942]
本研究では, スコアマッチングの統計的効率と推定される分布の等尺性との間に, 密接な関係を示す。
これらの結果はサンプル状態と有限状態の両方で定式化する。
論文 参考訳(メタデータ) (2022-10-03T06:09:01Z) - Rethinking Collaborative Metric Learning: Toward an Efficient
Alternative without Negative Sampling [156.7248383178991]
コラボレーティブ・メトリック・ラーニング(CML)パラダイムはレコメンデーション・システム(RS)分野に広く関心を集めている。
負のサンプリングが一般化誤差のバイアス付き推定に繋がることがわかった。
そこで我々は,SFCML (textitSampling-Free Collaborative Metric Learning) という名前のCMLに対して,負のサンプリングを伴わない効率的な手法を提案する。
論文 参考訳(メタデータ) (2022-06-23T08:50:22Z) - On Variance Estimation of Random Forests [0.0]
本稿では,不完全U-統計量に基づく不偏分散推定器を開発する。
我々は,計算コストを増大させることなく,より低いバイアスとより正確な信頼区間のカバレッジを評価できることを示した。
論文 参考訳(メタデータ) (2022-02-18T03:35:47Z) - Unrolling Particles: Unsupervised Learning of Sampling Distributions [102.72972137287728]
粒子フィルタリングは複素系の優れた非線形推定を計算するために用いられる。
粒子フィルタは様々なシナリオにおいて良好な推定値が得られることを示す。
論文 参考訳(メタデータ) (2021-10-06T16:58:34Z) - Estimating Gradients for Discrete Random Variables by Sampling without
Replacement [93.09326095997336]
我々は、置換のないサンプリングに基づいて、離散確率変数に対する期待値の偏りのない推定器を導出する。
推定器は3つの異なる推定器のラオ・ブラックウェル化として導出可能であることを示す。
論文 参考訳(メタデータ) (2020-02-14T14:15:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。