論文の概要: ChronoLock: Protecting Videos from Unauthorized Text-to-Video Personalization
- arxiv url: http://arxiv.org/abs/2606.21146v1
- Date: Fri, 19 Jun 2026 06:37:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 08:00:02.957483
- Title: ChronoLock: Protecting Videos from Unauthorized Text-to-Video Personalization
- Title(参考訳): ChronoLock: 不正なテキスト対ビデオのパーソナライゼーションからビデオを保護する
- Authors: Jiaming He, Jiashu Zhang, Guanyu Hou, Shuhan Ye, Hanwei Zhu, Yi Yu, Xudong Jiang,
- Abstract要約: テキスト・ツー・ビデオ(T2V)拡散モデルにより、現実的で時間的に整合したビデオの合成がますます容易になっている。
最近のパーソナライズ技術は、いくつかの参照クリップから特定の主題、スタイル、動きパターンを模倣することができる。
オンラインで共有されたビデオは、無許可のT2V微調整のために収集および使用することができる。
既存の保護的摂動は主に画像認識やテキスト・ツー・イメージのパーソナライゼーションのために設計されており、したがって静的な外観を損なうことに重点を置いている。
- 参考スコア(独自算出の注目度): 27.79968637806027
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-video (T2V) diffusion models have made it increasingly easy to synthesize realistic and temporally coherent videos, while recent personalization techniques allow such models to imitate a specific subject, style, or motion pattern from only a few reference clips. This capability creates a new data-misuse risk: videos shared online can be collected and used for unauthorized T2V fine-tuning. Existing protective perturbations are mainly designed for image recognition or text-to-image personalization, and therefore focus on corrupting static appearance cues rather than the temporal denoising dynamics that make video personalization possible. To address this gap, we introduce ChronoLock, the first proactive protection framework that makes released videos difficult to exploit for unauthorized T2V personalization. ChronoLock targets the motion-learning process directly by optimizing bounded perturbations over temporal denoising trajectories. It first disrupts intra-chunk temporal adaptation with a diffusion objective that combines fitting error, frame-relative denoising relations, and adjacent-frame variation, and then enlarges inter-chunk boundary mismatch to weaken long-range motion continuity. Transformation-sampled updates further improve robustness to common preprocessing operations.Experiments on UCF Sports and HMDB51 with popular T2V backbones and personalization scheme show that ChronoLock effectively reduces motion imitation under automatic metrics and human evaluation.
- Abstract(参考訳): テキスト・ツー・ビデオ(T2V)拡散モデルは、現実的で時間的に整合したビデオの合成をますます容易にし、一方で、最近のパーソナライズ技術により、いくつかの参照クリップから特定の主題、スタイル、動きパターンを模倣することができる。
オンラインで共有されたビデオは、無許可のT2V微調整のために収集および使用することができる。
既存の保護摂動は、主に画像認識やテキスト・ツー・イメージのパーソナライゼーションのために設計されており、ビデオのパーソナライゼーションを可能にする時間的認知力学よりも、静的な外見の手がかりの破損に焦点を当てている。
このギャップに対処するため、我々はChronoLockを紹介した。ChronoLockは、未承認のT2Vパーソナライゼーションのために、リリースビデオの悪用を困難にする最初のプロアクティブプロテクションフレームワークである。
ChronoLockは、時間的認知軌道上の有界摂動を最適化することで、モーションラーニングプロセスを直接ターゲットとする。
これはまず、フィッティングエラー、フレーム相対的デノゲーション関係、および隣接フレーム変動を組み合わせた拡散目標によるチャンク内時間適応を妨害し、その後、チャンク間境界ミスマッチを拡大し、長距離運動連続性を弱める。
UCF SportsとHMDB51のT2Vバックボーンとパーソナライズスキームによる実験により,ChronoLockは自動測定および人体評価において,動作模倣を効果的に軽減することが示された。
関連論文リスト
- Streaming Autoregressive Video Generation via Diagonal Distillation [50.13573884115673]
自己回帰モデルは、シーケンシャルフレーム合成のための自然なフレームワークを提供するが、高い忠実性を達成するためには重い計算を必要とする。
ビデオチャンクとデノイングステップの時間的情報を活用するために,ダイアゴナル蒸留を提案する。
本手法は,2.61秒(最大31FPS)で5秒ビデオを生成し,未蒸留モデル上で277.3倍のスピードアップを実現する。
論文 参考訳(メタデータ) (2026-03-10T10:45:24Z) - InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing [66.48064661467781]
我々は、アイデンティティ、象徴的なジェスチャー、カメラ軌跡を維持するために参照を戦略的に保存する新しいパラダイムであるスパースフレームビデオダビングを導入する。
無限長長列ダビング用に設計されたストリーミングオーディオ駆動型ジェネレータであるInfiniteTalkを提案する。
HDTF、CelebV-HQ、EMTDデータセットの総合評価は、最先端の性能を示している。
論文 参考訳(メタデータ) (2025-08-19T17:55:23Z) - Subject-driven Video Generation via Disentangled Identity and Motion [52.54835936914813]
本稿では,ゼロショットにおける時間的ダイナミクスから被験者固有の学習を分離し,追加のチューニングを伴わずに,主題駆動のカスタマイズビデオ生成モデルを訓練することを提案する。
提案手法は、ゼロショット設定で既存のビデオカスタマイズモデルよりも優れた、強力な被写体整合性とスケーラビリティを実現する。
論文 参考訳(メタデータ) (2025-04-23T06:48:31Z) - VideoDirector: Precise Video Editing via Text-to-Video Models [45.53826541639349]
現在のビデオ編集法は、時間的コヒーレンス生成能力を欠くテキスト・ツー・ビデオ(T2V)モデルに依存している。
本稿では、より正確なピボットインバージョンを実現するために、時空間デカップリングガイダンス(STDG)と複数フレームのヌルテキスト最適化戦略を提案する。
実験結果から,本手法はT2Vモデルの強力な時間生成能力を効果的に活用できることが示唆された。
論文 参考訳(メタデータ) (2024-11-26T16:56:53Z) - Live2Diff: Live Stream Translation via Uni-directional Attention in Video Diffusion Models [64.2445487645478]
大規模言語モデルは、テキストやオーディオなどのストリーミングデータの生成において顕著な効果を示している。
本稿では,一方向の時間的注意を向けたビデオ拡散モデルを設計するための最初の試みであるLive2Diffを紹介する。
論文 参考訳(メタデータ) (2024-07-11T17:34:51Z) - CoNo: Consistency Noise Injection for Tuning-free Long Video Diffusion [15.013908857230966]
ルークバック機構は、異なるビデオクリップ間の微粒なシーン遷移を促進する。
長期の整合性正規化は、拡張ビデオクリップの予測ノイズと元のノイズとの画素幅距離を明示的に最小化することに焦点を当てる。
単文および複数文のプロンプト条件下で長ビデオ生成を行うことによる戦略の有効性を示す実験を行った。
論文 参考訳(メタデータ) (2024-06-07T16:56:42Z) - Customize-A-Video: One-Shot Motion Customization of Text-to-Video Diffusion Models [48.56724784226513]
本研究では,単一参照ビデオからの動作をモデル化し,空間的・時間的変化のある新しい主題やシーンに適応するCustomize-A-Videoを提案する。
提案するモジュールは、ステージ化されたパイプラインでトレーニングされ、プラグイン・アンド・プレイ方式で推論され、様々な下流タスクへの容易に拡張できる。
論文 参考訳(メタデータ) (2024-02-22T18:38:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。