論文の概要: The Vulnerability of Neural Audio Watermarks under Speech Enhancement
- arxiv url: http://arxiv.org/abs/2609.29040v1
- Date: Thu, 24 Sep 2026 05:17:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.733938
- Title: The Vulnerability of Neural Audio Watermarks under Speech Enhancement
- Title(参考訳): 音声強調によるニューラルオーディオ透かしの脆弱性
- Abstract要約: 6つのニューラルオーディオ透かしに対するブラックボックス・透かし除去攻撃を提案する。
音声の高調波領域を復調しながら復調する生成SEは,透かしに対して非常に破壊的であることがわかった。
- 参考スコア(独自算出の注目度): 8.79084048193175
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Neural audio watermarks are increasingly deployed in commercial speech generation systems to make AI-generated speech traceable, yet their robustness has been studied mainly under conventional signal distortions. Since a watermark can be regarded as imperceptible noise added to the speech signal, a natural question is whether speech enhancement (SE), as a denoising model, can remove it. In this paper, we cascade Gaussian noise with SE models as a black-box watermark removal attack, covering both discriminative and generative SE paradigms, against six neural watermarks: AudioSeal, WavMark, SilentCipher, Timbre, Perth, and AlignMark. Experimental results show that the proposed attack significantly outperforms existing neural re-synthesis methods in watermark removal. In particular, we find that generative SE, which reconstructs the harmonic regions of speech while denoising, is highly destructive to watermarks. These findings show that SE poses a serious threat to current audio watermarking methods, and we call for SE-aware robustness evaluation in watermark design.
- Abstract(参考訳): ニューラル音声透かしは、AI生成音声をトレース可能にするために、商用音声生成システムにますます導入されているが、その堅牢性は、主に従来の信号歪みの下で研究されている。
透かしは、音声信号に付加される知覚不能ノイズとみなすことができるため、自然な疑問は、音声強調(SE)を聴覚モデルとして除去できるかどうかである。
本稿では,AudioSeal,WavMark,SilentCipher,Timbre,Perth,AlignMarkの6つのニューラルウォーターマークに対して,識別的および生成的SEパラダイムの両方をカバーするブラックボックスウォーターマーク除去攻撃として,SEモデルを用いたガウスノイズをカスケードする。
実験の結果,この攻撃は透かし除去において既存の神経再生法よりも有意に優れていた。
特に,音声の高調波領域を復調しながら復調する生成SEは,透かしに対して非常に破壊的であることがわかった。
これらの結果から,SEは現在の音響透かし手法に深刻な脅威をもたらすことが示唆され,透かし設計におけるSE認識の堅牢性評価が求められている。
関連論文リスト
- Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio [58.612001688217056]
自己回帰モデルに対する推論時透かしは、離散化の不整合による連続的なモダリティには適さない。
合成音声の強力で堅牢な透かしのためのエレガントな解法を提案する。
論文 参考訳(メタデータ) (2026-05-25T15:43:20Z) - Latent-Mark: An Audio Watermark Robust to Neural Resynthesis [62.09761127079914]
Latent-Markはセマンティック圧縮に耐えられるように設計された最初のゼロビットオーディオ透かしフレームワークである。
私たちの重要な洞察は、エンコード-デコードプロセスに対する堅牢性は、不変の潜在空間に透かしを埋め込む必要があるということです。
我々の研究は、ますます複雑で多様な生成歪みをまたいで整合性を維持することができる普遍的な透かしフレームワークに、将来の研究をインスピレーションを与えます。
論文 参考訳(メタデータ) (2026-03-05T15:51:09Z) - MarkSweep: A No-box Removal Attack on AI-Generated Image Watermarking via Noise Intensification and Frequency-aware Denoising [15.570983503312227]
MarkSweepは、視覚的品質を劣化させることなく、AI生成画像から埋め込まれた透かしを消去する新しい透かし除去攻撃である。
エッジ対応ガウス摂動により高周波領域の透かしノイズを増幅し、清潔な画像に注入する。
学習可能な周波数分解モジュールと周波数認識融合モジュールの2つのモジュールを統合し、増幅ノイズを抑制し、透かし跡を除去する。
論文 参考訳(メタデータ) (2026-02-17T05:19:00Z) - Self Voice Conversion as an Attack against Neural Audio Watermarking [34.948149764638806]
音声透かしシステムに対するユニバーサル・コンテンツ保存攻撃としての自己音声変換について検討する。
この攻撃は最先端の透かし手法の信頼性を著しく低下させることを示した。
論文 参考訳(メタデータ) (2026-01-28T09:41:18Z) - HarmonicAttack: An Adaptive Cross-Domain Audio Watermark Removal [12.931496380963802]
AI生成オーディオの誤用に対する重要な防御は、それを透かし、本物のオーディオと容易に区別できるようにすることである。
従来の透かし除去方式は、取り外すために設計された透かしの非現実的な知識を前提とするか、計算的に高価である。
本稿では,ハイモニックアタック(HarmonicAttack)について紹介する。
論文 参考訳(メタデータ) (2025-11-26T16:51:20Z) - IDEAW: Robust Neural Audio Watermarking with Invertible Dual-Embedding [29.89341878606415]
本稿では,効率的な位置決めのための二重埋め込み型透かしモデルの設計を行う。
実験により、提案モデルであるIDEAWは、既存の手法と比較して、高いキャパシティとより効率的な位置決め能力を持つ様々な攻撃に耐えられることが示された。
論文 参考訳(メタデータ) (2024-09-29T09:32:54Z) - AudioMarkBench: Benchmarking Robustness of Audio Watermarking [38.25450275151647]
本稿では,透かし除去と透かし偽造に対する音響透かしの堅牢性を評価するための最初の体系的ベンチマークであるAudioMarkBenchを紹介する。
以上の結果から,従来の透かし手法の脆弱性を強調し,より堅牢で公正な透かしソリューションの必要性を強調した。
論文 参考訳(メタデータ) (2024-06-11T06:18:29Z) - WavMark: Watermarking for Audio Generation [70.65175179548208]
本稿では,わずか1秒の音声スニペット内に最大32ビットの透かしを符号化する,革新的な音声透かしフレームワークを提案する。
透かしは人間の感覚に影響されず、様々な攻撃に対して強い弾力性を示す。
合成音声の効果的な識別子として機能し、オーディオ著作権保護の幅広い応用の可能性を秘めている。
論文 参考訳(メタデータ) (2023-08-24T13:17:35Z) - Speech Pattern based Black-box Model Watermarking for Automatic Speech
Recognition [83.2274907780273]
音声認識モデルのためのブラックボックス透かし方式を設計する方法はまだ未解決の問題である。
ASRモデルのIPを保護するための最初のブラックボックスモデル透かしフレームワークを提案する。
最先端のオープンソースASRシステムであるDeepSpeechの実験は、提案された透かし方式の有効性を実証している。
論文 参考訳(メタデータ) (2021-10-19T09:01:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。