論文の概要: VOW: Verifiable and Oblivious Watermark Detection for Large Language Models
- arxiv url: http://arxiv.org/abs/2604.27666v1
- Date: Thu, 30 Apr 2026 10:02:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:54.03308
- Title: VOW: Verifiable and Oblivious Watermark Detection for Large Language Models
- Title(参考訳): VOW: 大規模言語モデルに対する検証可能な透かし検出
- Authors: Xiaokun Luan, Yihao Zhang, Pengcheng Su, Feiran Lei, Meng Sun,
- Abstract要約: プライバシー保護と暗号的に検証可能な透かし検出の両方を実現する新しいプロトコルを提案する。
VOWは短いテキストに対して実用的であり、現代のパラフレーズ攻撃に対する透かしの堅牢性の重要な再評価を提供する。
- 参考スコア(独自算出の注目度): 4.920744236528847
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Model (LLM) watermarking is crucial for establishing the provenance of machine-generated text, but most existing methods rely on a centralized trust model. This model forces users to reveal potentially sensitive text to a provider for detection and offers no way to verify the integrity of the result. While asymmetric schemes have been proposed to address these issues, they are either impractical for short texts or lack formal guarantees linking watermark insertion and detection. We propose VOW, a new protocol that achieves both privacy-preserving and cryptographically verifiable watermark detection with high efficiency. Our approach formulates detection as a secure two-party computation problem, instantiating the watermark's core logic with a Verifiable Oblivious Pseudorandom Function (VOPRF). This allows the user and provider to perform detection without the user's text being revealed, while the provider's result is verifiable. Our comprehensive evaluation shows that VOW is practical for short texts and provides a crucial reassessment of watermark robustness against modern paraphrasing attacks.
- Abstract(参考訳): 大規模言語モデル(LLM)による透かしは、機械生成テキストの確立に不可欠であるが、既存のほとんどの手法は中央集権的信頼モデルに依存している。
このモデルでは、ユーザに対して、検出のために機密性の高いテキストをプロバイダに公開させ、結果の完全性を検証する手段を提供しない。
これらの問題に対処するために非対称なスキームが提案されているが、短いテキストでは実用的でないか、ウォーターマークの挿入と検出をリンクする正式な保証がないかのいずれかである。
プライバシー保護と暗号的に検証可能な透かし検出の両方を高効率で実現する新しいプロトコルであるVOWを提案する。
提案手法は,検出をセキュアな2要素計算問題として定式化し,検証可能な擬似擬似擬似関数 (VOPRF) を用いて透かしのコアロジックをインスタンス化する。
これにより、ユーザとプロバイダは、ユーザのテキストを公開せずに検出を実行でき、プロバイダの結果が検証可能である。
我々の総合的な評価は、VOWは短いテキストに実用的であり、現代のパラフレーズ攻撃に対する透かしの堅牢性の重要な再評価を提供することを示している。
関連論文リスト
- Unforgeable Watermarks for Language Models via Robust Signatures [12.643204293013007]
非鍛造性と回復性という2つの新しい保証を導入する。
我々は、堅牢で、鍛造不可能で、回収可能な最初の検出不能な透かし方式を構築した。
論文 参考訳(メタデータ) (2026-02-17T03:09:06Z) - A Nested Watermark for Large Language Models [6.702383792532788]
大型言語モデル(LLM)は偽ニュースや誤情報を生成するために誤用されることがある。
本稿では、2つの異なる透かしを生成されたテキストに埋め込む新しいネスト付き透かし方式を提案する。
提案手法は,テキストの流速と全体的な品質を維持しつつ,両透かしの高精度な検出を実現する。
論文 参考訳(メタデータ) (2025-06-18T05:49:05Z) - An Unforgeable Publicly Verifiable Watermark for Large Language Models [84.2805275589553]
現在の透かし検出アルゴリズムは、透かし生成プロセスで使用される秘密鍵を必要としており、公開検出中にセキュリティ違反や偽造の影響を受ける。
両段階で同じキーを使用するのではなく、2つの異なるニューラルネットワークを用いて透かしの生成と検出を行う。
論文 参考訳(メタデータ) (2023-07-30T13:43:27Z) - On the Reliability of Watermarks for Large Language Models [95.87476978352659]
本研究では,人間による書き直し後の透かしテキストの堅牢性,非透かしLDMによる言い換え,あるいはより長い手書き文書への混在性について検討する。
人や機械の言い回しをしても、透かしは検出可能である。
また、大きな文書に埋め込まれた透かし付きテキストの短いスパンに敏感な新しい検出手法についても検討する。
論文 参考訳(メタデータ) (2023-06-07T17:58:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。