論文の概要: BiSLW: Bi-Spectral Latent Watermarking for Generative Diffusion Models
- arxiv url: http://arxiv.org/abs/2607.02643v1
- Date: Thu, 02 Jul 2026 17:48:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.380802
- Title: BiSLW: Bi-Spectral Latent Watermarking for Generative Diffusion Models
- Title(参考訳): BiSLW: 生成拡散モデルのための双スペクトル潜在透かし
- Authors: Aryan Pandit,
- Abstract要約: BiSLWはトレーニング可能な双スペクトル遅延透かしフレームワークで、相補的なスペクトル帯域に整列した識別信号を埋め込む。
低周波成分はグローバルセマンティクスを符号化し、高周波成分は微妙なテクスチャをキャプチャする。
BiSLWは,従来の拡散透かし法と比較して,PSNRを3dB以上改善する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion-based generative models have transformed visual content synthesis, yet they remain vulnerable to unauthorized usage and lack reliable attribution methods. Existing watermarking techniques often treat latent tensors as static spatial feature maps or depend on pixel-domain modification, and most do not explicitly leverage the internal frequency structure of the latent space for dual-band redundant embedding, leaving them susceptible to the stochastic nature of diffusion and regeneration attacks. We introduce BiSLW, a trainable bi-spectral latent watermarking framework that jointly embeds aligned identity signals across complementary spectral bands of the decoded diffusion latent using learned encoders and decoders, going beyond fixed-pattern frequency approaches. We leverage the inherent frequency structure of diffusion latents to design a dual-band watermarking framework. Low-frequency components encode global semantics, while high-frequency components capture fine texture. We exploit this structure to embed watermarks across complementary spectral bands. The watermark is independently injected into both bands via learned encoders and recombined before decoding, ensuring it becomes intrinsic to the generative trajectory. Dual spectral decoders recover the watermark from each band, while a cross-band consistency constraint enforces alignment between semantic and textural embeddings. Experiments show that BiSLW achieves a strong balance between perceptual fidelity and robustness, improving PSNR by over 3 dB compared to prior latent diffusion watermarking methods while preserving near-perfect bit accuracy under aggressive regeneration and common distortions, all with negligible computational overhead.
- Abstract(参考訳): 拡散に基づく生成モデルは、視覚コンテンツ合成を変容させたが、未承認の使用に弱いままであり、信頼できる帰属法が欠如している。
既存の透かし技術は、潜時テンソルを静的な空間的特徴写像として扱う場合や、ピクセル領域の修正に依存する場合が多いが、ほとんどの場合、潜時空間の内部周波数構造をデュアルバンド冗長な埋め込みに明示的に利用せず、拡散と再生攻撃の確率的性質に影響を受けないままである。
BiSLWは、学習エンコーダとデコーダを用いて、デコードされた拡散ラテントの相補的なスペクトル帯域間で整列した識別信号を共同で埋め込み、固定パターン周波数のアプローチを超える訓練可能な双スペクトル潜在透かしフレームワークである。
拡散潜水剤の固有周波数構造を利用して、デュアルバンド透かしの枠組みを設計する。
低周波成分はグローバルセマンティクスを符号化し、高周波成分は微妙なテクスチャをキャプチャする。
この構造を利用して、補完スペクトル帯に透かしを埋め込む。
透かしは、学習エンコーダを介して両方のバンドに独立に注入され、復号前に再結合され、生成軌道に固有のものとなる。
デュアルスペクトルデコーダは各バンドから透かしを復元する一方、クロスバンド整合性制約はセマンティックとテクスチャ埋め込みのアライメントを強制する。
実験により、BiSLWは知覚の忠実度と頑健性の間に強いバランスを保ち、PSNRを3dB以上改善し、アグレッシブ・リジェネレーションと一般的な歪みの下でほぼ完璧なビット精度を保ちながら、全て無視可能な計算オーバーヘッドを持つことを示した。
関連論文リスト
- Dual-Guard: Dual-Channel Latent Watermarking for Provenance and Tamper Localization in Diffusion Images [19.688873186557483]
提案するDual-Guardは,プロファイナンス検証,フレーミング抵抗,および領域レベルのタンパーローカライゼーションのための2チャネル遅延透かしフレームワークである。
フルモードでは、Dual-Guardは、クリーンイメージ認証の偽の拒絶と改ざんの誤報を1%以下に抑えつつ、再プロンプト、拡散編集、および8つのローカルな改ざん攻撃によるほぼ完全な検出を維持している。
論文 参考訳(メタデータ) (2026-04-21T05:03:42Z) - BiGain: Unified Token Compression for Joint Generation and Classification [47.040577759493004]
BiGainは、高速拡散モデルにおける分類を改善しながら、生成品質を保ちながら、トレーニング不要でプラグアンドプレイのフレームワークである。
我々の重要な洞察は周波数分離であり、これは大域的な意味論から細部を解き、生成的忠実さと識別的有用性の両方を尊重する圧縮を可能にする。
本分析は,拡散モデルにおけるトークン圧縮のための信頼性の高い設計規則として,高頻度の細部と低周波数のセマンティクスを保存したスペクトル保持が重要であることを示す。
論文 参考訳(メタデータ) (2026-03-12T17:55:53Z) - Latent-Mark: An Audio Watermark Robust to Neural Resynthesis [62.09761127079914]
Latent-Markはセマンティック圧縮に耐えられるように設計された最初のゼロビットオーディオ透かしフレームワークである。
私たちの重要な洞察は、エンコード-デコードプロセスに対する堅牢性は、不変の潜在空間に透かしを埋め込む必要があるということです。
我々の研究は、ますます複雑で多様な生成歪みをまたいで整合性を維持することができる普遍的な透かしフレームワークに、将来の研究をインスピレーションを与えます。
論文 参考訳(メタデータ) (2026-03-05T15:51:09Z) - SKeDA: A Generative Watermarking Framework for Text-to-video Diffusion Models [40.540302276054376]
テキスト・ビデオ拡散モデルに適した生成型透かしフレームワークを提案する。
SKeDAは2つのコンポーネントから構成される: 1) シャッフルキーベースの分散保存サンプリング(SKe)は、透かし暗号化のために単一のベース擬似ランダムバイナリシーケンスを使用し、置換によってフレームレベルの暗号化シーケンスを導出する。
大規模な実験により、SKeDAは高い映像生成品質と透かしの堅牢性を保っていることが示された。
論文 参考訳(メタデータ) (2026-02-27T06:18:03Z) - T2SMark: Balancing Robustness and Diversity in Noise-as-Watermark for Diffusion Models [89.29541056113442]
T2SMarkはTail-Truncated Smpling(TTS)に基づく2段階の透かし方式である
U-NetとDiTのバックボーンを用いた拡散モデル上でのT2SMarkの評価を行った。
論文 参考訳(メタデータ) (2025-10-25T16:55:55Z) - An Ensemble Framework for Unbiased Language Model Watermarking [60.99969104552168]
本研究では,アンサンブル・フレームワークであるENSを提案する。
ENSは複数の独立した透かしインスタンスを順次構成し、それぞれ異なるキーによって管理され、透かし信号を増幅する。
実験的な評価では、ENSは信頼できる検出に必要なトークンの数を大幅に減らし、平滑化やパラフレージング攻撃に対する耐性を高めている。
論文 参考訳(メタデータ) (2025-09-28T19:37:44Z) - StableGuard: Towards Unified Copyright Protection and Tamper Localization in Latent Diffusion Models [55.05404953041403]
拡散生成プロセスにバイナリ透かしをシームレスに統合する新しいフレームワークを提案する。
画像の忠実さ、透かしの検証、ローカライゼーションの改ざんにおいて、StableGuardは一貫して最先端の手法より優れていることを示す。
論文 参考訳(メタデータ) (2025-09-22T16:35:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。