論文の概要: Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation
- arxiv url: http://arxiv.org/abs/2607.01499v2
- Date: Mon, 06 Jul 2026 22:42:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:42.972135
- Title: Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation
- Title(参考訳): アンチプロンプト:テキスト誘導画像生成に対する画像保護
- Abstract要約: I2V生成の最近の進歩により、単一の画像をテキストガイダンスの下で説得力のあるビデオにアニメーションすることができる。
画像に知覚不能な摂動を注入する画像保護手法であるアンチプロンプトを提案する。
- 参考スコア(独自算出の注目度): 10.54860936583801
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in Image-to-Video generation allow a single image to be animated into a convincing video under text guidance, raising serious copyright and privacy risks. We propose Anti-Prompt, an image protection approach that injects imperceptible perturbations into an image, inducing visible inconsistencies and structural failures in text-guided I2V generation. Our method is motivated by a simple empirical observation. When text guidance is removed from modern I2V models, generation quality degrades markedly, not only in motion realism but also in subject preservation, structural coherence, and temporal consistency. Building on this insight, Anti-Prompt exploits the model reliance on textual guidance by attenuating text-conditioned interactions during denoising while strengthening visual-only pathways. To further systematically evaluate protection effectiveness, we introduce a Video-LLM-assisted evaluation protocol that provides interpretable, frame-grounded analyses of generation artifacts and inconsistencies. Experiments on two representative I2V architectures demonstrate that our method achieves strong protection performance while improving efficiency and cross-model transferability.
- Abstract(参考訳): Image-to-Video生成の最近の進歩により、単一の画像をテキストガイダンスの下で説得力のあるビデオにアニメーションできるようになり、深刻な著作権とプライバシーのリスクが高まる。
画像に知覚不能な摂動を注入し,テキスト誘導I2V生成における不整合や構造的欠陥を誘発する画像保護手法であるアンチプロンプトを提案する。
我々の手法は単純な経験的観察によって動機づけられる。
現代のI2Vモデルからテキストガイダンスを除去した場合、生成品質は、運動リアリズムだけでなく、主題保存、構造的コヒーレンス、時間的一貫性においても著しく低下する。
この洞察に基づいて、アンチ・プロンプトは、視覚のみの経路を強化しながら、認知中にテキスト条件付き相互作用を減衰させることにより、テキストガイダンスに依存するモデルを利用する。
さらに保護の有効性を体系的に評価するために,生成物や不整合の解釈可能なフレームグラウンド解析を提供するビデオLLM支援評価プロトコルを導入する。
2つの代表的I2Vアーキテクチャの実験により,本手法は高い保護性能を実現し,効率とクロスモデル転送性の向上を図っている。
関連論文リスト
- Immune2V: Image Immunization Against Dual-Stream Image-to-Video Generation [39.751363871863134]
I2V(Image-to-Video)生成は、静的画像の無許可アニメーションによって現実的なディープフェイクを作成できるため、社会的な害をもたらす可能性がある。
我々は,現代のI2Vモデルがイメージレベルの敵対的攻撃に対して極めて堅牢である理由を分析する。
本稿では,エンコーダレベルで時間的バランスの取れた潜伏分散を強制し,信号の希釈を防止するImmune2Vフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-12T22:13:02Z) - IP-Bench: Benchmark for Image Protection Methods in Image-to-Video Generation Scenarios [13.66248113146474]
IP-Benchは、I2V生成シナリオにおける画像保護手法を評価するために設計された最初のシステマティックベンチマークである。
本ベンチマークでは,6つの代表的保護手法と5つの最先端I2Vモデルについて検討する。
全体として、IP-BenchはI2V生成シナリオにおける画像保護手法の体系的、再現可能、評価のフレームワークを確立している。
論文 参考訳(メタデータ) (2026-03-27T08:11:33Z) - TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models [92.56562999211809]
テキスト中心のパラダイムは、消去とテキスト・ツー・イメージマッピングの厳密さを同一視し、望ましくない概念に関する基礎となる視覚的知識が今も続いていることを無視する。
我々は、この視覚のみのプローブをNull-text条件下で動作させることで、新しいテキストフリーのインバージョンアタックであるTinaを紹介する。
我々の実験では、Tinaは最先端の未学習モデルから消去された概念を再生することを示した。
論文 参考訳(メタデータ) (2026-03-18T15:25:03Z) - T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models [67.13397169618624]
本稿では,テキスト・トゥ・ビデオ(T2V)モデルに対するセマンティックおよび時間的観点からの敵対的攻撃に関する研究であるT2VAttackを紹介する。
提案手法は, 意味的, 時間的クリティカルな単語をプロンプトで識別し, アドレディ検索による同義語に置き換えるT2VAttack-Sと, 最適化された単語を最小の摂動で反復的に挿入するT2VAttack-Iである。
論文 参考訳(メタデータ) (2025-12-30T03:00:46Z) - Towards Transferable Defense Against Malicious Image Edits [70.17363183107604]
Transferable Defense Against Malicious Image Edits (TDAE)は、悪意のある編集に対するイメージ免疫を強化する新しいバイモーダルフレームワークである。
本稿では,FlatGrad Defense Mechanism (FDM) を紹介した。
テキストエンハンスメント保護のための動的プロンプトディフェンス (DPD) を提案し, テキスト埋め込みを周期的に洗練し, 免疫画像の編集結果を元の画像と整合させる。
論文 参考訳(メタデータ) (2025-12-16T12:10:16Z) - Vid-Freeze: Protecting Images from Malicious Image-to-Video Generation via Temporal Freezing [2.48490797934472]
Vid-Freezeは、新しい注意を抑える敵攻撃であり、画像に慎重に敵の摂動を追加する。
本手法は, 動作合成を完全に破壊するI2Vモデルの注意機構を目標とした。
その結果、免疫された画像は、スタンスチールまたはニアスタティックなビデオを生成し、悪意のあるコンテンツ生成を効果的にブロックする。
論文 参考訳(メタデータ) (2025-09-27T12:26:34Z) - Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement [58.85593321752693]
アイデンティティ保存型テキスト・ツー・ビデオ(IPT2V)生成は、参照対象画像とテキストプロンプトの両方に忠実なビデオを生成する。
本稿では,映像記述と参照画像のセマンティックギャップを橋渡しする,トレーニングフリープロンプト,イメージ,ガイダンス拡張フレームワークを提案する。
ACM Multimedia 2025 Identity-Preserving Video Generation Challengeで優勝した。
論文 参考訳(メタデータ) (2025-09-01T11:03:13Z) - Zero-Shot Video Editing through Adaptive Sliding Score Distillation [51.57440923362033]
本研究は,オリジナルビデオコンテンツの直接操作を容易にする,ビデオベースのスコア蒸留の新たなパラダイムを提案する。
本稿では,グローバルとローカルの両方の動画ガイダンスを取り入れた適応スライディングスコア蒸留方式を提案する。
論文 参考訳(メタデータ) (2024-06-07T12:33:59Z) - Adversarial Prompt Tuning for Vision-Language Models [86.5543597406173]
AdvPT(Adversarial Prompt Tuning)は、視覚言語モデル(VLM)における画像エンコーダの対向ロバスト性を高める技術である。
我々は,AdvPTが白箱攻撃や黒箱攻撃に対する抵抗性を向上し,既存の画像処理による防御技術と組み合わせることで相乗効果を示すことを示した。
論文 参考訳(メタデータ) (2023-11-19T07:47:43Z) - Towards Prompt-robust Face Privacy Protection via Adversarial Decoupling
Augmentation Framework [20.652130361862053]
顔認識保護アルゴリズムの防御性能を高めるために,Adversarial Decoupling Augmentation Framework (ADAF)を提案する。
ADAFは、様々な攻撃プロンプトに対する防御安定のために、多レベルテキスト関連の拡張を導入している。
論文 参考訳(メタデータ) (2023-05-06T09:00:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。