論文の概要: MelShield: Robust Mel-Domain Audio Watermarking for Provenance Attribution of AI Generated Synthesized Speech
- arxiv url: http://arxiv.org/abs/2605.01515v1
- Date: Sat, 02 May 2026 16:07:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:49.813246
- Title: MelShield: Robust Mel-Domain Audio Watermarking for Provenance Attribution of AI Generated Synthesized Speech
- Title(参考訳): MelShield: AI生成合成音声のプロヴァンス属性に対するロバストなメルドメインオーディオ透かし
- Authors: Yutong Jin, Qi Li, Lingshuang Liu, Jianbing Ni,
- Abstract要約: MelShieldは、著作権保護と信頼できる属性のために、識別可能な信号をAI生成オーディオに埋め込む。
MelShieldは生成プロセス中にMel-spectrogramドメインで動作する。
DiffWaveとHiFi-GANの実験では、MelShieldは信頼性の高い透かし抽出を実現し、100%ビット精度に近づいた。
- 参考スコア(独自算出の注目度): 11.952228555970883
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this paper, we propose MelShield, a robust, in-generation, keyed audio watermarking framework that embeds identifiable signals into AI-generated audio for copyright protection and reliable attribution. Specifically, MelShield operates in the Mel-spectrogram domain during the generation process, targeting intermediate acoustic representations in Mel-conditioned pipelines for text-to-speech (TTS) generation. The core idea is to treat the intermediate Mel-spectrogram as the host signal and embed a short binary payload via low-energy, keyed spread-spectrum perturbations distributed across carefully selected time-frequency regions prior to waveform synthesis. By performing watermarking before vocoder inference, MelShield remains plug-and-play for Mel-conditioned TTS architectures and does not require modification or retraining of the underlying TTS generation vocoder, such as DiffWave and HiFi-GAN. Moreover, the multi-user keyed construction enables scalable user-specific attribution, while the keyed verification mechanism limits unauthorized decoding, thereby reducing the risk of large-scale extractor probing and adversarial analysis. Extensive experiments on DiffWave and HiFi-GAN demonstrate that MelShield achieves reliable watermark extraction, approaching 100\% bit accuracy, even under signal distortions, e.g., compression and additive noise, while preserving high perceptual audio quality.
- Abstract(参考訳): 本稿では,著作権保護と信頼できる帰属のために,識別可能な信号をAI生成オーディオに埋め込む,堅牢で次世代なキー付き音声透かしフレームワークであるMelShieldを提案する。
具体的には、MelShieldは生成プロセス中にMel-spectrogramドメインで動作し、テキスト音声(TTS)生成のためのMel-conditioned Pipelinesの中間音響表現をターゲットにしている。
中心となる考え方は、Mel-spectrogramをホスト信号として扱い、波形合成の前に慎重に選択された時間周波数領域に分散した低エネルギー、キー付き拡散スペクトル摂動を介して短いバイナリペイロードを埋め込むことである。
ボコーダ推論の前にウォーターマーキングを行うことで、メルコンディショニングされたTSアーキテクチャのプラグアンドプレイを継続し、DiffWaveやHiFi-GANのような基礎となるTS生成ボコーダの修正や再トレーニングを必要としない。
さらに、マルチユーザキード構成により、スケーラブルなユーザ固有属性を実現するとともに、キー付き検証機構は、不正な復号化を制限し、大規模な抽出器探索と逆解析のリスクを低減する。
DiffWaveとHiFi-GANの大規模な実験により、MelShieldは信頼性の高い透かし抽出を実現し、信号歪み、例えば圧縮音や付加音の下でも100\%の精度で接近し、高い知覚音質を保っていることが示された。
関連論文リスト
- Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models [56.91801348360746]
大規模な音声言語モデル(LALM)は、音声、音声、音楽にまたがって一般化される。
統一デコーダは 時空間のスムーズなバイアスを示します
LALMの学習自由復号法であるemphTemporal Contrastive Decoding (TCD)を提案する。
論文 参考訳(メタデータ) (2026-04-16T02:30:41Z) - Latent-Mark: An Audio Watermark Robust to Neural Resynthesis [62.09761127079914]
Latent-Markはセマンティック圧縮に耐えられるように設計された最初のゼロビットオーディオ透かしフレームワークである。
私たちの重要な洞察は、エンコード-デコードプロセスに対する堅牢性は、不変の潜在空間に透かしを埋め込む必要があるということです。
我々の研究は、ますます複雑で多様な生成歪みをまたいで整合性を維持することができる普遍的な透かしフレームワークに、将来の研究をインスピレーションを与えます。
論文 参考訳(メタデータ) (2026-03-05T15:51:09Z) - CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR [36.77663840488492]
提案するネットワークは、ノイズと残響のマイクロホン記録を入力として、対応するMel-spectrogramを予測する。
拡張Mel-spectrogramは、ニューラルボコーダで音声波形に変換するか、ASRに直接使用することができる。
論文 参考訳(メタデータ) (2025-02-27T12:28:29Z) - XAttnMark: Learning Robust Audio Watermarking with Cross-Attention [15.216472445154064]
クロスアテンションロバスト音響透かし(XAttnMark)
本稿では,ジェネレータと検出器間の部分パラメータ共有を利用してギャップを埋めるクロスアテンションロバスト音響透かし(XAttnMark)を提案する。
本研究では, 聴覚マスキング効果の微粒化を捉え, 透かしの受容性を向上する心理音響整列型時間周波数マスキング障害を提案する。
論文 参考訳(メタデータ) (2025-02-06T17:15:08Z) - High-Fidelity Speech Synthesis with Minimal Supervision: All Using
Diffusion Models [56.00939852727501]
最小教師付き音声合成は、2種類の離散音声表現を組み合わせることでTSを分離する。
非自己回帰フレームワークは、制御可能性を高め、持続拡散モデルは、多様化された韻律表現を可能にする。
論文 参考訳(メタデータ) (2023-09-27T09:27:03Z) - From Discrete Tokens to High-Fidelity Audio Using Multi-Band Diffusion [84.138804145918]
深層生成モデルは、様々な種類の表現で条件付けられた高忠実度オーディオを生成することができる。
これらのモデルは、条件付けに欠陥がある場合や不完全な場合、可聴アーチファクトを生成する傾向がある。
低ビットレート離散表現から任意の種類のオーディオモダリティを生成する高忠実度マルチバンド拡散ベースフレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-02T22:14:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。