論文の概要: Learning to Watermark Speech Synthesis Against Model-Driven Reconstruction
- arxiv url: http://arxiv.org/abs/2610.04235v1
- Date: Sat, 03 Oct 2026 02:57:00 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:55:54.406668
- Title: Learning to Watermark Speech Synthesis Against Model-Driven Reconstruction
- Title(参考訳): モデル駆動型再構成に対する透かし音声合成の学習
- Abstract要約: 本稿では,現代の自己回帰型TSのためのマルチビット生成音声透かしフレームワークであるThriveを提案する。
Thriveは合成の忠実さを保ち、再建攻撃による平均回復精度87.6%を達成し、最大10,000のアイデンティティの候補セットに対するソース属性をサポートする。
- 参考スコア(独自算出の注目度): 13.226873931361135
- License:
- Abstract: Modern TTS systems increasingly generate synthetic speech at scale for diverse users. This setting calls for content-level provenance that can verify the origin of released speech and attribute it to the requesting user, which generative watermarking can support by embedding multi-bit identifiers directly into synthesized speech. Once released, however, speech may undergo heterogeneous learned transformations during distribution and editing, with reconstruction objectives that can preserve speech utility while affecting watermark recoverability differently. We find that no single watermark carrier remains consistently reliable across reconstruction models, as its survival depends jointly on the embedded structure, reconstruction mechanism, and observation representation. To this end, we propose Thrive, a multi-bit generative speech watermarking framework for modern autoregressive TTS, covering both discrete-token and continuous-representation generation under reconstruction attacks. Specifically, Rise synchronizes watermark injection into intermediate representations with its continued integration into subsequent generation, while Care combines waveform and spectral experts using bit-wise reliability selection. Experiments on both autoregressive paradigms show that Thrive preserves synthesis fidelity, achieves 87.6% average recovery accuracy under reconstruction attacks, and supports source attribution over candidate sets of up to 10,000 identities.
- Abstract(参考訳): 現代のTSシステムは、多様なユーザのために、大規模に合成音声を生成する傾向にある。
この設定は、複数のビット識別子を直接合成音声に埋め込むことで、リリースされた音声の起源を検証し、それを要求されたユーザに帰属させるコンテンツレベルの証明を要求する。
しかし、一旦解放されると、音声は分布と編集の間に異質な学習的な変換を受け、復元目的は、透かしの復元性に異なる影響を与えながら、音声の効用を維持できる。
埋設構造, 復元機構, 観察表現に左右されるため, 一つの透かしキャリアは, 復元モデル全体で一貫して信頼性が保たれていないことが判明した。
そこで本稿では,現代自己回帰性TTSのためのマルチビット生成音声透かしフレームワークであるThriveを提案する。
具体的には、Riseはウォーターマーク注入を中間表現に同期させ、その後世代への継続的な統合を継続し、Careは波形とスペクトルの専門家をビット単位の信頼性選択で組み合わせている。
両方の自己回帰パラダイムの実験では、Thriveは合成の忠実さを保ち、再構築攻撃による平均回復精度87.6%を達成し、最大1万個のアイデンティティの候補セットに対するソース属性をサポートする。
関連論文リスト
- From Feed-Forward to Flow: Unifying Reconstruction and Generation Is Easier Than You Think [27.54578871186126]
再構成と生成のためのフローベース統一型定式化を提案する。
共有されたクリーンターゲット予測器は、その単一ステップのエンドポイントで直接再構成を行い、マルチステップフローを介して条件生成を展開する。
再構成と生成は定式化とバックボーンの両方を共有できることを示す。
論文 参考訳(メタデータ) (2026-09-26T16:28:52Z) - One Prompt Is Enough: Watermark Laundering Through Foundation Image Models [25.347499950462524]
攻撃者は、単一の再構成プロンプトで透かし画像を送信し、見えない透かしを確実に復号できない、視覚的に忠実な出力を得ることができる。
我々は、この障害モードをウォーターマーク洗浄として形式化し、ビット誤り率(BER)と視覚的および意味的保存を組み合わせた共同ペイロード忠実度プロファイルを用いて評価する。
一方、Nano Banana 2は、DwtDctが高忠実度再構成の下で脆弱であることを示しています。
論文 参考訳(メタデータ) (2026-09-01T13:46:31Z) - BiSLW: Bi-Spectral Latent Watermarking for Generative Diffusion Models [0.0]
BiSLWはトレーニング可能な双スペクトル遅延透かしフレームワークで、相補的なスペクトル帯域に整列した識別信号を埋め込む。
低周波成分はグローバルセマンティクスを符号化し、高周波成分は微妙なテクスチャをキャプチャする。
BiSLWは,従来の拡散透かし法と比較して,PSNRを3dB以上改善する。
論文 参考訳(メタデータ) (2026-07-02T17:48:54Z) - Closed-Loop Triplet Synergistic Generation for Long-Form Video [61.88597038104749]
CoSyTriGenは、クローズドループビジュアル-テキスト-メモリのシナジープロセスとしてマルチショット長ビデオ生成を定式化するエージェントフレームワークである。
この三重項に対して視覚言語モデルに基づくアナライザが原因となり、2つの経路に沿ってプロンプトとメモリの両方を更新する。
StoryBenchベンチマークの実験では、代表法よりもクロスショット一貫性、即効性、撮影連続性を大幅に改善した。
論文 参考訳(メタデータ) (2026-06-15T03:56:43Z) - Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio [58.612001688217056]
自己回帰モデルに対する推論時透かしは、離散化の不整合による連続的なモダリティには適さない。
合成音声の強力で堅牢な透かしのためのエレガントな解法を提案する。
論文 参考訳(メタデータ) (2026-05-25T15:43:20Z) - Latent-Mark: An Audio Watermark Robust to Neural Resynthesis [62.09761127079914]
Latent-Markはセマンティック圧縮に耐えられるように設計された最初のゼロビットオーディオ透かしフレームワークである。
私たちの重要な洞察は、エンコード-デコードプロセスに対する堅牢性は、不変の潜在空間に透かしを埋め込む必要があるということです。
我々の研究は、ますます複雑で多様な生成歪みをまたいで整合性を維持することができる普遍的な透かしフレームワークに、将来の研究をインスピレーションを与えます。
論文 参考訳(メタデータ) (2026-03-05T15:51:09Z) - StableGuard: Towards Unified Copyright Protection and Tamper Localization in Latent Diffusion Models [55.05404953041403]
拡散生成プロセスにバイナリ透かしをシームレスに統合する新しいフレームワークを提案する。
画像の忠実さ、透かしの検証、ローカライゼーションの改ざんにおいて、StableGuardは一貫して最先端の手法より優れていることを示す。
論文 参考訳(メタデータ) (2025-09-22T16:35:19Z) - A Watermark for Auto-Regressive Image Generation Models [50.599325258178254]
画像生成モデル用に明示的に設計された歪みのない透かし法であるC-reweightを提案する。
C-reweightは画像の忠実性を維持しながら再起動ミスマッチを緩和する。
論文 参考訳(メタデータ) (2025-06-13T00:15:54Z) - TriniMark: A Robust Generative Speech Watermarking Method for Trinity-Level Attribution [3.1682080884953736]
本稿では,生成したコンテンツを認証するための生成的textbfspeech wattextbfermarking法(TriniMark)を提案する。
まず、音声の時間領域特徴に透かしを埋め込む構造軽量透かしエンコーダを設計する。
ビットワイドウォーターマーク回復のためのウォーターマーク復号器において、時間対応ゲート畳み込みネットワークを巧みに設計する。
論文 参考訳(メタデータ) (2025-04-29T08:23:28Z) - Discretization and Re-synthesis: an alternative method to solve the
Cocktail Party Problem [65.25725367771075]
この研究は、初めて合成に基づくアプローチがこの問題にうまく対応できることを示した。
具体的には,離散シンボルの認識に基づく音声分離/強調モデルを提案する。
離散シンボルの入力による合成モデルを利用することで、離散シンボル列の予測後、各ターゲット音声を再合成することができる。
論文 参考訳(メタデータ) (2021-12-17T08:35:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。