論文の概要: MusicMark: A Robust Generative Watermarking Framework for Music Generation
- arxiv url: http://arxiv.org/abs/2607.11117v1
- Date: Mon, 13 Jul 2026 05:48:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.341585
- Title: MusicMark: A Robust Generative Watermarking Framework for Music Generation
- Title(参考訳): MusicMark: 音楽生成のためのロバストな生成型透かしフレームワーク
- Abstract要約: 音楽は複雑な構造と豊かな音響テクスチャを持っている。
既存のほとんどのメソッドはポストホックであり、コンテンツの一部として透かしを埋め込むのではなく、生成後に知覚できないものを追加する。
MusicMarkは、音楽コンテンツの一部として透かしを組み込んで、世代間セマンティック潜在空間に透かしメッセージを埋め込む。
- 参考スコア(独自算出の注目度): 6.480352639697023
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI music generation has rapidly advanced alongside commercial platforms, raising the need for reliable watermarking for provenance and attribution. However, existing audio watermarking research has largely focused on speech, and applying speech-oriented methods to music is challenging due to music's complex structure and rich acoustic texture. Most existing methods are post-hoc, adding imperceptible perturbations after generation rather than embedding watermarks as part of the content. This makes them fragile under transformations and especially vulnerable to neural codec re-synthesis, which can discard imperceptible residual signals. Moreover, since generation and watermarking are decoupled, the watermarking step can be bypassed or omitted, weakening provenance guarantees. To address these issues, we propose MusicMark, which, to the best of our knowledge, is the first generative watermarking framework for music. Specifically, MusicMark embeds watermark messages into the semantic latent space during generation, incorporating the watermark as part of the musical content and ensuring robustness against diverse attacks, particularly neural codec re-synthesis. To this end, we introduce a watermark adapter into a diffusion-based generation model to embed watermark messages across denoising steps. The adapter and detector are trained with a joint objective that preserves fidelity by constraining watermarked latents close to their unwatermarked reference latents, while improving robustness through attack augmentations. Experiments demonstrate that MusicMark substantially outperforms post-hoc baselines across diverse attacks including neural codec re-synthesis, while maintaining comparable generation quality. We further introduce a cover-song attack, converting the singing voice while preserving musical content, and show that MusicMark remains more robust than post-hoc methods.
- Abstract(参考訳): AI音楽生成は、商業プラットフォームとともに急速に進歩し、証明と帰属のための信頼できる透かしの必要性が高まっている。
しかし、既存の音声透かし研究は、主に音声に焦点を当てており、音楽の複雑な構造と豊かな音響テクスチャのために、音声指向の手法を音楽に適用することは困難である。
既存の方法の多くはポストホックであり、コンテンツの一部として透かしを埋め込むのではなく、生成後に知覚不能な摂動を追加する。
これにより、トランスフォーメーションの下で脆弱になり、特に神経コーデック再合成に弱いため、知覚不能な残留シグナルを排除できる。
また、生成と透かしが分離されるので、透かし工程をバイパスしたり省略したりすることができ、証明保証が弱くなる。
これらの問題に対処するため,我々はMusicMarkを提案し,これは音楽のための最初の生成的な透かしフレームワークである。
具体的には、MusicMarkは世代間における意味的潜伏空間に透かしメッセージを埋め込み、その透かしを音楽コンテンツの一部として取り入れ、様々な攻撃、特にニューラルコーデックの再合成に対する堅牢性を確保する。
この目的のために、拡散に基づく生成モデルに透かしアダプタを導入し、復調ステップに透かしメッセージを埋め込む。
アダプタと検出器は、透かしのない基準潜水剤に近く、透かしのある潜水剤を拘束し、攻撃増強による堅牢性を向上させることで、忠実性を維持する共同目標で訓練される。
実験によると、MusicMarkは、ニューラルコーデックの再合成を含むさまざまな攻撃に対して、同等の生成品質を維持しながら、ポストホックベースラインを大幅に上回っている。
さらに,音楽コンテンツを保存しながら歌声を変換するカバー・ソング・アタックを導入し,音楽Markがポストホック法よりもロバストであることを示す。
関連論文リスト
- Audio Pirates: Black-box Audio Watermark Removal via Diffusion Priors [44.562700127905295]
対象の透かし方式の知識を前提としないブラックボックス型透かし除去攻撃であるDiffEraseを提案する。
DiffEraseは複数のオーディオ領域にまたがる知覚品質を維持しながら、常に透かしを除去する。
これらの知見は,拡散型脅威を考慮した将来の音声透かし設計の必要性を浮き彫りにした。
論文 参考訳(メタデータ) (2026-05-28T22:07:32Z) - Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio [58.612001688217056]
自己回帰モデルに対する推論時透かしは、離散化の不整合による連続的なモダリティには適さない。
合成音声の強力で堅牢な透かしのためのエレガントな解法を提案する。
論文 参考訳(メタデータ) (2026-05-25T15:43:20Z) - Latent-Mark: An Audio Watermark Robust to Neural Resynthesis [62.09761127079914]
Latent-Markはセマンティック圧縮に耐えられるように設計された最初のゼロビットオーディオ透かしフレームワークである。
私たちの重要な洞察は、エンコード-デコードプロセスに対する堅牢性は、不変の潜在空間に透かしを埋め込む必要があるということです。
我々の研究は、ますます複雑で多様な生成歪みをまたいで整合性を維持することができる普遍的な透かしフレームワークに、将来の研究をインスピレーションを与えます。
論文 参考訳(メタデータ) (2026-03-05T15:51:09Z) - Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking [88.89887962002207]
目に見えない生成的な透かしは ビデオ生成において ほとんど未発見のままです
ビデオ生成プロセスに直接グラフィカルな透かしを埋め込む最初のフレームワークであるSafe-Soraを提案する。
Safe-Soraは,映像品質,透かしの忠実度,ロバスト性の観点から,最先端のパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2025-05-19T03:31:31Z) - XAttnMark: Learning Robust Audio Watermarking with Cross-Attention [15.216472445154064]
クロスアテンションロバスト音響透かし(XAttnMark)
本稿では,ジェネレータと検出器間の部分パラメータ共有を利用してギャップを埋めるクロスアテンションロバスト音響透かし(XAttnMark)を提案する。
本研究では, 聴覚マスキング効果の微粒化を捉え, 透かしの受容性を向上する心理音響整列型時間周波数マスキング障害を提案する。
論文 参考訳(メタデータ) (2025-02-06T17:15:08Z) - Certifiably Robust Image Watermark [57.546016845801134]
ジェネレーティブAIは、偽情報やプロパガンダキャンペーンの促進など、多くの社会的懸念を提起する。
ウォーターマークAI生成コンテンツは、これらの懸念に対処するための重要な技術である。
本報告では, 除去・偽造攻撃に対するロバスト性保証を保証した最初の画像透かしを提案する。
論文 参考訳(メタデータ) (2024-07-04T17:56:04Z) - AudioMarkBench: Benchmarking Robustness of Audio Watermarking [38.25450275151647]
本稿では,透かし除去と透かし偽造に対する音響透かしの堅牢性を評価するための最初の体系的ベンチマークであるAudioMarkBenchを紹介する。
以上の結果から,従来の透かし手法の脆弱性を強調し,より堅牢で公正な透かしソリューションの必要性を強調した。
論文 参考訳(メタデータ) (2024-06-11T06:18:29Z) - WavMark: Watermarking for Audio Generation [70.65175179548208]
本稿では,わずか1秒の音声スニペット内に最大32ビットの透かしを符号化する,革新的な音声透かしフレームワークを提案する。
透かしは人間の感覚に影響されず、様々な攻撃に対して強い弾力性を示す。
合成音声の効果的な識別子として機能し、オーディオ著作権保護の幅広い応用の可能性を秘めている。
論文 参考訳(メタデータ) (2023-08-24T13:17:35Z) - Tree-Ring Watermarks: Fingerprints for Diffusion Images that are
Invisible and Robust [55.91987293510401]
生成モデルのアウトプットを透かしは、著作権をトレースし、AI生成コンテンツによる潜在的な害を防ぐ重要なテクニックである。
本稿では,拡散モデル出力を頑健にフィンガープリントするTree-Ring Watermarkingという新しい手法を提案する。
私たちの透かしは画像空間に意味的に隠れており、現在デプロイされている透かしよりもはるかに堅牢です。
論文 参考訳(メタデータ) (2023-05-31T17:00:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。