論文の概要: Selective Disclosure Watermarking for Large Language Models
- arxiv url: http://arxiv.org/abs/2607.05353v1
- Date: Mon, 06 Jul 2026 17:32:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.265699
- Title: Selective Disclosure Watermarking for Large Language Models
- Title(参考訳): 大規模言語モデルのための選択的開示透かし
- Abstract要約: 埋め込みメタデータの選択的開示を可能にする透かしフレームワークである階層語彙ルーティング(HeRo)を提案する。
提案手法は, サンプリングプロセスの非偏りを保ち, テキストの品質を維持できることを示す。
- 参考スコア(独自算出の注目度): 16.579884795891754
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Watermarking methods embed imperceptible and verifiable signals into text generated by large language models (LLMs). Existing approaches include zero-bit schemes for distinguishing synthetic text from human writing and multi-bit schemes for embedding metadata. However, current multi-bit watermarking methods do not allow selective disclosure: verifying any part of the watermark requires revealing the entire embedded message. This lack of control leads to unnecessary information exposure and raises privacy concerns. We propose Hierarchical Vocabulary Routing (HeRo), a watermarking framework that enables selective disclosure of embedded metadata. The method recursively partitions the vocabulary and distributes watermark information across hierarchical layers, so that different verifiers can decode only the portions of the payload corresponding to their access level. We show that the proposed scheme preserves the unbiasedness of the underlying sampling process and thus maintains text quality. Experiments demonstrate that our framework supports fine-grained access control while achieving high detection accuracy and low latency. Code is available at https://github.com/xuyangc03/hero-watermark.
- Abstract(参考訳): ウォーターマーキング手法は、大きな言語モデル(LLM)によって生成されたテキストに、認識不能で検証不能な信号を埋め込む。
既存のアプローチには、人間の文章と合成テキストを区別するゼロビットスキームと、メタデータを埋め込むマルチビットスキームが含まれる。
しかし、現在のマルチビット透かし方式は選択的な開示を許さない: 透かしのどの部分も検証するには、埋め込みメッセージ全体を明らかにする必要がある。
この制御の欠如は、不要な情報露出を引き起こし、プライバシー上の懸念を引き起こす。
埋め込みメタデータの選択的開示を可能にする透かしフレームワークである階層語彙ルーティング(HeRo)を提案する。
この方法は語彙を再帰的に分割し、階層層に透かし情報を分散することにより、異なる検証者がアクセスレベルに対応するペイロードの部分のみを復号することができる。
提案手法は, サンプリングプロセスの非偏りを保ち, テキストの品質を維持できることを示す。
実験により,本フレームワークは高い検出精度と低レイテンシを実現しつつ,きめ細かなアクセス制御をサポートしていることが示された。
コードはhttps://github.com/xuyangc03/hero-watermarkで入手できる。
関連論文リスト
- OpenStamp: A Watermark for Open-Source Language Models [11.840656454832478]
我々は,透かしロジックをモデル重みに直接エンコードする透かし技術であるOpenStampを紹介する。
また,OpenStampは,従来の手法に比べてモデル能力の低下を最小限に抑えながら,優れた検出性能を実現していることを示す。
開発者がモデルをウォーターマークできるように、私たちは4つの人気のあるオープンソースモデルのウォーターマークバージョンと一緒にコードをリリースしています。
論文 参考訳(メタデータ) (2026-08-28T04:08:01Z) - StealthInk: A Multi-bit and Stealthy Watermark for Large Language Models [4.76514657698929]
StealthInkは、大規模言語モデル(LLM)のためのステルスなマルチビット透かし方式である
元のテキスト配布を保存し、証明データの埋め込みを可能にする。
固定等誤り率で透かし検出に必要なトークン数に対する低い境界を導出する。
論文 参考訳(メタデータ) (2025-06-05T18:37:38Z) - In-Context Watermarks for Large Language Models [71.29952527565749]
In-Context Watermarking (ICW)は、インシデントエンジニアリングのみで生成されたテキストに透かしを埋め込む。
粒度の異なる4つのICW戦略について検討した。
本実験は,モデルに依存しない実用的な透かし手法としてのICWの実現可能性を検証するものである。
論文 参考訳(メタデータ) (2025-05-22T17:24:51Z) - Speech Watermarking with Discrete Intermediate Representations [45.892635912641836]
本稿では,音声の中間表現に透かしを注入する新しい音声透かしフレームワークを提案する。
DiscreteWMは、堅牢性と非受容性を同時に実現します。
我々のフレキシブルなフレームワイドアプローチは、音声のクローン検出と情報隠蔽の両面において効率的な解決策となる。
論文 参考訳(メタデータ) (2024-12-18T14:57:06Z) - Token-Specific Watermarking with Enhanced Detectability and Semantic Coherence for Large Language Models [31.062753031312006]
大規模言語モデルは、潜在的な誤報を伴う高品質な応答を生成する。
ウォーターマーキングは、テキストに隠れたマーカーを埋め込むことによって、この文脈において重要な意味を持つ。
ウォーターマーキングのための新しい多目的最適化(MOO)手法を提案する。
本手法は,検出性と意味的整合性を同時に達成する。
論文 参考訳(メタデータ) (2024-02-28T05:43:22Z) - Multi-Bit Distortion-Free Watermarking for Large Language Models [4.7381853007029475]
透かしの一部としてメタ情報の複数ビットを埋め込むことにより,既存のゼロビット歪みのない透かし法を拡張した。
また,少ないビット誤り率で透かしから埋め込み情報を抽出する計算効率の良い復号器を開発した。
論文 参考訳(メタデータ) (2024-02-26T14:01:34Z) - Advancing Beyond Identification: Multi-bit Watermark for Large Language Models [31.066140913513035]
機械生成テキストの識別を超えて,大規模言語モデルの誤用に対処する可能性を示す。
言語モデル生成中にトレーサブルなマルチビット情報を埋め込んだ位置アロケーションによるマルチビット透かしを提案する。
論文 参考訳(メタデータ) (2023-08-01T01:27:40Z) - An Unforgeable Publicly Verifiable Watermark for Large Language Models [84.2805275589553]
現在の透かし検出アルゴリズムは、透かし生成プロセスで使用される秘密鍵を必要としており、公開検出中にセキュリティ違反や偽造の影響を受ける。
両段階で同じキーを使用するのではなく、2つの異なるニューラルネットワークを用いて透かしの生成と検出を行う。
論文 参考訳(メタデータ) (2023-07-30T13:43:27Z) - Who Wrote this Code? Watermarking for Code Generation [53.24895162874416]
本稿では,機械生成テキストを検出するために,Entropy Thresholding (SWEET) を用いたSelective WatErmarkingを提案する。
実験の結果,SWEETはコード品質を著しく向上し,すべてのベースラインを上回ります。
論文 参考訳(メタデータ) (2023-05-24T11:49:52Z) - Watermarking Text Generated by Black-Box Language Models [103.52541557216766]
テキスト生成中に透かしを埋め込むことのできるホワイトボックスLCMに対して,透かしに基づく手法が提案されている。
リストを認識した検出アルゴリズムは、透かし付きテキストを識別することができる。
我々はブラックボックス言語モデル利用シナリオのための透かしフレームワークを開発する。
論文 参考訳(メタデータ) (2023-05-14T07:37:33Z) - A Watermark for Large Language Models [84.95327142027183]
本稿では,プロプライエタリな言語モデルのための透かしフレームワークを提案する。
透かしはテキストの品質に無視できない影響で埋め込むことができる。
言語モデルAPIやパラメータにアクセスすることなく、効率的なオープンソースアルゴリズムを使って検出することができる。
論文 参考訳(メタデータ) (2023-01-24T18:52:59Z) - Tracing Text Provenance via Context-Aware Lexical Substitution [81.49359106648735]
文脈を考慮した語彙置換に基づく自然言語透かし方式を提案する。
主観的および主観的尺度の両面において,我々の透かし方式は原文の意味的整合性を十分に維持することができる。
論文 参考訳(メタデータ) (2021-12-15T04:27:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。