論文の概要: WaterMoE: Expert-Routing-based Watermarking for High Fidelity and Efficiency
- arxiv url: http://arxiv.org/abs/2607.13099v1
- Date: Tue, 14 Jul 2026 06:18:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.531816
- Title: WaterMoE: Expert-Routing-based Watermarking for High Fidelity and Efficiency
- Title(参考訳): WaterMoE: 高忠実性と効率のためのエキスパートルーティングに基づく透かし
- Authors: Z Sun, Q Jiang, S Sheng, L Xiang,
- Abstract要約: 大規模言語モデル(LLM)は目覚ましい成功を収めているが、コンテンツの出所や誤用に対する懸念が高まっている。
WaterMoEは制御された摂動を通して透かし信号を各ルータのエキスパートセレクションに埋め込む。
WaterMoEは、ベンチマークで最先端の透かしメソッドを一貫して上回る。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large language models (LLMs) have achieved remarkable success but raise growing concerns about content provenance and misuse, motivating the need for reliable watermarking techniques. However, these techniques have rarely been adopted in practice mainly for two reasons: i) severely degraded model performance, and ii) additional inference overhead. To confirm the problem, we construct a comprehensive benchmark spanning different generation tasks to systematically evaluate 9 representative watermarking methods. We found almost all existing methods are designed for text fluency, but not for restricted and complicated tasks, and their overhead prevents them from deployment in latency-critical systems. To address i) and ii), we propose an LLM watermarking scheme \textit{WaterMoE} for the growingly popular Mixture-of-Experts (MoE) LLMs. WaterMoE embeds watermarking signals through controlled perturbation into the expert selection at each router, which accumulates to token selection shift at the final output. In contrast to watermarking as a post-processing token-sampling approach, WaterMoE embeds watermark within the inference loop incurring negligible quality degradation and computational overhead. Extensive experiments demonstrate that our method achieves a fidelity performance close to the unwatermarked and consistently outperforms state-of-the-art watermarking methods on the benchmark, with up to $4\times$ speedup, incurring merely 1\% additional inference latency compared to native generation. The results demonstrate the capability of WaterMoE to be deployed in real-world tasks.
- Abstract(参考訳): 大規模言語モデル(LLM)は目覚ましい成功を収めているが、コンテンツの出所や誤用に対する懸念が高まり、信頼できる透かし技術の必要性が高まっている。
しかし、主に2つの理由から採用されることは稀である。
一 モデル性能が著しく劣化し、
二 追加の推測オーバーヘッド
そこで我々は,9つの代表的な透かし手法を体系的に評価するために,異なる生成タスクにまたがる包括的なベンチマークを構築した。
既存のほとんどのメソッドはテキストの流用のために設計されていますが、制限された複雑なタスクには向いていません。
宛て
i (複数形 is)
i><i>Mixture-of-Experts (MoE) LLM に対する LLM 透かし方式 \textit{WaterMoE} を提案する。
WaterMoEは制御された摂動を通して、各ルータのエキスパート選択に透かし信号を埋め込み、最終出力時にトークン選択シフトに蓄積する。
後処理のトークンサンプリングアプローチとしての透かしとは対照的に、WaterMoEは推論ループ内に透かしを埋め込み、無視できる品質劣化と計算オーバーヘッドをもたらす。
大規模な実験により,本手法は非透かしに近い忠実度を達成でき,しかもベンチマークの最先端透かし手法よりも常に優れており,最大4/times$の高速化を実現し,ネイティブ生成と比較して1/%追加の推論遅延を発生させる。
その結果、WaterMoEが現実世界のタスクにデプロイできることが実証された。
関連論文リスト
- WaterSearch: A Quality-Aware Search-based Watermarking Framework for Large Language Models [17.137667672391725]
WaterSearchは文レベルの検索ベースの透かしフレームワークである。
WaterSearchは,1)分布の忠実度と2)透かし信号特性の2つの重要な側面を共同最適化することにより,テキスト品質を向上させる。
本手法は,最先端のベースラインに対して平均51.01%の性能向上を実現する。
論文 参考訳(メタデータ) (2025-11-30T11:11:21Z) - Character-Level Perturbations Disrupt LLM Watermarks [64.60090923837701]
我々は,Large Language Model (LLM)ウォーターマーキングのためのシステムモデルを定式化する。
我々は、透かし検出器への限られたアクセスに制約された2つの現実的な脅威モデルの特徴付けを行う。
我々は,最も制限的な脅威モデルの下で,キャラクタレベルの摂動が透かし除去に著しく有効であることを実証した。
現実的な制約下での透かし除去における文字レベルの摂動の優位性と遺伝的アルゴリズム(GA)の有効性を実験的に検証した。
論文 参考訳(メタデータ) (2025-09-11T02:50:07Z) - Inevitable Trade-off between Watermark Strength and Speculative Sampling Efficiency for Language Models [63.450843788680196]
最大透かし強度と最高サンプリング効率を同時に維持することは不可能である。
本研究では,サンプリング効率と透かし強度を両立させる2つの手法を提案する。
我々の研究は、透かし強度とサンプリング効率の本質的にのトレードオフを理解するための厳密な理論基盤を提供する。
論文 参考訳(メタデータ) (2024-10-27T12:00:19Z) - Theoretically Grounded Framework for LLM Watermarking: A Distribution-Adaptive Approach [53.32564762183639]
大規模言語モデル(LLM)の透かしのための新しい統一的理論フレームワークを導入する。
本研究の目的は,最悪の偽陽性率(FPR)の制御とテキスト品質の歪みを維持しつつ,検出性能を最大化することである。
モデル非依存と効率性に代えて代理モデルを利用する歪みのない分散適応型透かしアルゴリズム(DAWA)を提案する。
論文 参考訳(メタデータ) (2024-10-03T18:28:10Z) - WaterPool: A Watermark Mitigating Trade-offs among Imperceptibility, Efficacy and Robustness [45.27908390001244]
本稿では、キー中心方式を用いて、透かしを2つの異なるモジュールに分解することで既存の透かし技術を統一する。
WaterPoolはシンプルだが効果的なキーモジュールで、インセプティビティによって要求される完全なキーサンプリングスペースを保存し、セマンティクスベースの検索を利用してキー復元プロセスを改善する。
論文 参考訳(メタデータ) (2024-05-22T10:22:20Z) - WaterMax: breaking the LLM watermark detectability-robustness-quality trade-off [10.926616117284983]
ウォーターマーキング(英: Watermarking)は、大規模言語モデルの誤用を解消する技術的手段である。
本稿では,生成したテキストの品質を維持しつつ,高い検出性を享受する新しい透かし方式であるWaterMaxを提案する。
論文 参考訳(メタデータ) (2024-03-06T10:55:30Z) - WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models [48.19623266082828]
WaterBenchは、大規模言語モデル(LLM)における透かしの最初の包括的なベンチマークである。
LLM透かしの最初の総合的なベンチマークであるWaterBenchを紹介し、3つの重要な要素を設計する。
オープンソースの透かしを2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/2ドル/3ドル/3ドル/3ドル/3ドル/3ドル/3ドル/3ドル/3ドル/3ドル/3ドル/3ドル/
論文 参考訳(メタデータ) (2023-11-13T08:09:01Z) - Unbiased Watermark for Large Language Models [67.43415395591221]
本研究では, モデル生成出力の品質に及ぼす透かしの影響について検討した。
出力確率分布に影響を与えることなく、透かしを統合することができる。
ウォーターマークの存在は、下流タスクにおけるモデルの性能を損なうものではない。
論文 参考訳(メタデータ) (2023-09-22T12:46:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。