論文の概要: Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor
- arxiv url: http://arxiv.org/abs/2608.00543v1
- Date: Sat, 01 Aug 2026 08:58:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.765974
- Title: Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor
- Title(参考訳): ロバストな透かしとバックドアモデル:静かなバックドアを通した拡散セマンティックな透かし
- Authors: Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang,
- Abstract要約: GhostVAEは、変分オートエンコーダ(VAE)のエンコーダのステルスバックドア
GhostVAEは良性画像上での透かし検出性能を保っていることを示す。
また、GhostVAEは入力空間、パラメータ空間、潜伏空間にわたってステルス性を維持していることを示す。
- 参考スコア(独自算出の注目度): 24.332611409003878
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although semantic watermarking is considered a promising safeguard for images generated by Latent Diffusion Models (LDMs), the reliance of the watermark detection pipeline on neural networks introduces a critical yet underexplored backdoor attack surface. To systematically study this vulnerability, we propose GhostVAE to plant a stealthy backdoor into the encoder of Variational Autoencoder (VAE), enabling reliable evasion of watermark detection. GhostVAE operates in two stages: it first constructs a universal trigger via power spectrum regularization to improve the trigger robustness, and then trains a backdoored VAE encoder with a parameter-aligned objective. Through extensive evaluations across three state-of-the-art semantic watermarking schemes and three widely adopted LDMs, we show that GhostVAE preserves watermark detection performance on benign images (achieving an average true positive rate of 94.4%), while simultaneously enabling highly effective evasion under trigger activation (achieving an average attack success rate of 94.6%). Moreover, we comprehensively analyze seventeen representative defenses and demonstrate that GhostVAE remains stealthy across the input space, parameter space, and latent space. Our work fundamentally undermines the trustworthiness of semantic watermarking systems and highlights that secure deployment of semantic watermarks requires end-to-end security considerations, particularly for neural network components.
- Abstract(参考訳): セマンティックな透かしは、潜在拡散モデル(LDMs)によって生成された画像に対する有望な保護と見なされているが、ニューラルネットワークに対する透かし検出パイプラインの信頼性は、重要で過小評価されていないバックドア攻撃面を導入している。
この脆弱性を体系的に研究するために,我々はGhostVAEを提案し,ステルスなバックドアを可変オートエンコーダ(VAE)エンコーダに植え付けることにより,透かし検出の確実な回避を可能にする。
GhostVAEは2つの段階で動作し、最初はパワースペクトルの正則化によってトリガーのロバスト性を改善するために普遍的なトリガーを構築し、次にパラメータに整合した目的を持ったバックドア付きVAEエンコーダを訓練する。
3つの最先端セマンティックな透かし方式と3つの広く採用されているLCDの広範な評価を通じて、GhostVAEは良性画像上での透かし検出性能(平均真正率94.4%)を保ち、同時にトリガアクティベーション時の高い有効回避(平均攻撃成功率94.6%)を可能にした。
さらに, GhostVAEが入力空間, パラメータ空間, 潜伏空間にわたってステルス性を維持していることを示す。
我々の研究は、セマンティックな透かしシステムの信頼性を根本的に損なうものであり、セマンティックな透かしの安全な展開にはエンドツーエンドのセキュリティ、特にニューラルネットワークコンポーネントの考慮が必要であることを強調しています。
関連論文リスト
- PGID: Progressive Guided Inversion and Denoising for Robust Watermark Detection [2.9276293999058898]
意味的透かしの拡散反転への依存は、透かしの検出に重大な脆弱性を生み出す。
本稿では,2つの攻撃戦略を防御する最初のプラグ・アンド・プレイ・トレーニングフリーノイズ抽出フレームワークであるプログレッシブガイド・インバージョン・デノイング(PGID)を提案する。
論文 参考訳(メタデータ) (2026-05-10T04:32:57Z) - DeMark: A Query-Free Black-Box Attack on Deepfake Watermarking Defenses [25.492274324587058]
DeMarkは、ディープフェイクの防御的なイメージ透かしスキームをターゲットにした、クエリフリーのブラックボックスアタックフレームワークである。
エンコーダ・デコーダ・ウォーターマーキングモデルにおける潜時空間の脆弱性を圧縮センシングに基づくスペーシフィケーションプロセスにより活用する。
DeMarkは、透かし検出の精度を、自然の視覚的品質を維持しながら、平均で100%から32.9%に下げる。
論文 参考訳(メタデータ) (2026-01-23T06:04:43Z) - StableGuard: Towards Unified Copyright Protection and Tamper Localization in Latent Diffusion Models [55.05404953041403]
拡散生成プロセスにバイナリ透かしをシームレスに統合する新しいフレームワークを提案する。
画像の忠実さ、透かしの検証、ローカライゼーションの改ざんにおいて、StableGuardは一貫して最先端の手法より優れていることを示す。
論文 参考訳(メタデータ) (2025-09-22T16:35:19Z) - Semantic Watermarking Reinvented: Enhancing Robustness and Generation Quality with Fourier Integrity [31.666430190864947]
我々はHermitian Symmetric Fourier Watermarking (SFW)と呼ばれる新しい埋め込み手法を提案する。
SFWはエルミート対称性を強制することによって周波数整合性を維持する。
我々は,収穫攻撃による意味的透かしの脆弱性を低減する中心認識型埋め込み戦略を導入する。
論文 参考訳(メタデータ) (2025-09-09T12:15:16Z) - Robust Watermarks Leak: Channel-Aware Feature Extraction Enables Adversarial Watermark Manipulation [21.41643665626451]
本稿では,事前学習された視覚モデルを用いて,透かしパターンの漏洩を抽出する攻撃フレームワークを提案する。
大量のデータや検出器のアクセスを必要とする従来の作業とは異なり,本手法は1つの透かし画像による偽造と検出の両方を達成している。
現在の"ロバスト"な透かしは、歪み抵抗に対するセキュリティを犠牲にして、将来の透かし設計の洞察を与えます。
論文 参考訳(メタデータ) (2025-02-10T12:55:08Z) - WaterMAS: Sharpness-Aware Maximization for Neural Network Watermarking [11.717546811674884]
WaterMASは、堅牢性、非受容性、計算複雑性の間のトレードオフを改善する、置換型、ホワイトボックスニューラルネットワーク透かし方式である。
強靭性は攻撃の強さを制限することで確保される。
トレーニングプロセス中に透かしを挿入することで、認識不能を確保できる。
論文 参考訳(メタデータ) (2024-09-05T20:22:01Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z) - Safe and Robust Watermark Injection with a Single OoD Image [90.71804273115585]
高性能なディープニューラルネットワークをトレーニングするには、大量のデータと計算リソースが必要である。
安全で堅牢なバックドア型透かし注入法を提案する。
我々は,透かし注入時のモデルパラメータのランダムな摂動を誘導し,一般的な透かし除去攻撃に対する防御を行う。
論文 参考訳(メタデータ) (2023-09-04T19:58:35Z) - Exploring Structure Consistency for Deep Model Watermarking [122.38456787761497]
Deep Neural Network(DNN)の知的財産権(IP)は、代理モデルアタックによって簡単に盗まれる。
本稿では,新しい構造整合モデルウォーターマーキングアルゴリズムを設計した新しい透かし手法,すなわち構造整合性'を提案する。
論文 参考訳(メタデータ) (2021-08-05T04:27:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。