論文の概要: From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting
- arxiv url: http://arxiv.org/abs/2607.14976v1
- Date: Thu, 16 Jul 2026 13:29:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.122623
- Title: From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting
- Title(参考訳): ドラフトからドラフトフリーへ:予備蒸留と高速植林によるワンステップビデオオブジェクト除去
- Abstract要約: From-Draft-to-Draft-Free (D2DF)は、粗いドラフトを複数のステップで洗練されたビデオに変換するフレームワークである。
単一のビデオのデノベーション処理には1秒程度しかかからない。
ドラフト条件付きおよびドラフトフリーバージョンは、複数のメトリクスで最先端のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 52.368954064430945
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video object removal is a fundamental yet challenging task in video editing. Despite recent progress, existing methods typically fall into two categories. Traditional approaches based on optical flow or attention mechanisms often introduce noticeable artifacts and yield unnatural results. In contrast, diffusion-based methods improve visual realism but demand multiple denoising steps, limiting their practicality. To address these issues, we propose From-Draft-to-Draft-Free (D2DF), a framework that distills the ability of transforming coarse drafts into refined videos into a one-step video generation model. Within D2DF, a teacher model is trained to refine low-quality removal results ("drafts") into high-fidelity videos by multiple steps. Then, through Prior-Privileged Consistency Distillation (PPCD), we distill this capability into a student model that performs one-step removal conditioned on the draft. To eliminate draft dependency, we introduce a Self-Guided Fast Planting (SGFP) module based on our Temporal Masked Transformer that autonomously generates scene-consistent pseudo-drafts in latent space, enabling a fully draft-free one-step model. Extensive experiments show that both draft-conditioned and draft-free versions achieve state-of-the-art performance on multiple metrics, surpassing traditional and multi-step generative methods in both quality and efficiency. The denoising process for a single video takes only about 1 second.
- Abstract(参考訳): ビデオオブジェクトの削除は、ビデオ編集の基本的な課題である。
最近の進歩にもかかわらず、既存の方法は通常2つのカテゴリに分類される。
光の流れや注意機構に基づく伝統的なアプローチは、しばしば顕著な人工物を導入し、不自然な結果をもたらす。
対照的に、拡散に基づく手法は視覚リアリズムを改善するが、複数の認知ステップを必要とし、実用性を制限する。
これらの問題に対処するために、粗いドラフトを改良されたビデオに変換する能力を1ステップのビデオ生成モデルに変換するフレームワークであるFrom-Draft-to-Draft-Free (D2DF)を提案する。
D2DF内では、教師モデルは、低品質の除去結果("ドラフト")を複数のステップで高忠実度ビデオに洗練するよう訓練される。
次に,Privileged Consistency Distillation (PPCD) を用いて,この機能を学生モデルに蒸留し,ドラフトのワンステップ除去を行う。
原稿依存をなくすため,時間的マスク付きトランスフォーマをベースとしたセルフガイド高速プランティング(SGFP)モジュールを導入し,シーン一貫性のある擬似ドラフトを潜在空間で自動生成し,完全なドラフトフリーワンステップモデルを実現する。
大規模な実験により、ドラフト条件付きバージョンとドラフトフリーバージョンの両方が、複数のメトリクスで最先端のパフォーマンスを実現し、品質と効率の両面で伝統的および多段階の生成方法を上回ることが示されている。
単一のビデオのデノベーション処理には1秒程度しかかからない。
関連論文リスト
- SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer [4.205766319033597]
一段階拡散変換器を用いた一段ビデオ字幕消去手法SEDiTを提案する。
ターゲット字幕の直接消去を可能にするマスクフリー推論手法を提案する。
提案手法は,ワンステップ,チャンクワイドのストリーミング推論により,ネイティブな1440p動画を無限長で効率的に処理できる。
論文 参考訳(メタデータ) (2026-05-14T14:37:54Z) - Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation [43.89162138967428]
本稿では,ビデオ拡散モデルに適した新しい蒸留フレームワークを提案する。
その中核となる革新は,(1)空間監督重量を動的に調整し,過度な分布シフトに起因するアーティファクトを防止する適応回帰損失,(2)スムーズで物理的に妥当なサンプリング軌道を促進する時間正規化損失,(3)知覚的品質を維持しながらサンプリングオーバーヘッドを低減する推論時間枠戦略である。
VBench と VBench2 ベンチマークの実験およびアブレーション実験により,本手法は安定した数段階のビデオ合成を実現し,知覚的忠実度と運動リアリズムを著しく向上させることを示した。
論文 参考訳(メタデータ) (2026-03-23T11:54:33Z) - Transition Matching Distillation for Fast Video Generation [63.1049790376783]
本稿では,ビデオ拡散モデルを効率の良い数ステップ生成器に蒸留するための新しいフレームワークであるTransition Matching Distillation (TMD)を提案する。
TMDは拡散モデルの多段階認知軌道と数段階の確率遷移過程とを一致させる。
TMDは、生成速度と視覚的品質の間の柔軟性と強力なトレードオフを提供する。
論文 参考訳(メタデータ) (2026-01-14T21:30:03Z) - VDOT: Efficient Unified Video Creation via Optimal Transport Distillation [70.02065520468726]
本稿では,VDOT という名前の効率的な統合ビデオ生成モデルを提案する。
我々は,実測値分布と偽測値分布の差分を最適化するために,新しい計算最適輸送(OT)技術を用いる。
統合ビデオ生成モデルの訓練を支援するため,ビデオデータアノテーションとフィルタリングのための完全自動パイプラインを提案する。
論文 参考訳(メタデータ) (2025-12-07T11:31:00Z) - Towards One-step Causal Video Generation via Adversarial Self-Distillation [71.30373662465648]
最近のハイブリッドビデオ生成モデルは、自己回帰時間力学と拡散に基づく空間認知を組み合わせている。
我々のフレームワークは、複数の推論ステップ設定を柔軟にサポートする単一の蒸留モデルを生成する。
論文 参考訳(メタデータ) (2025-11-03T10:12:47Z) - Real-time One-Step Diffusion-based Expressive Portrait Videos Generation [85.07446744308247]
我々は,OSA-LCM (One-Step Avatar Latent Consistency Model)を導入し,リアルタイム拡散に基づくアバターを実現する。
提案手法は,既存の手法に匹敵する映像品質を実現するが,サンプリングステップは1回しか必要とせず,処理速度は10倍以上に向上する。
論文 参考訳(メタデータ) (2024-12-18T03:42:42Z) - Zero-Shot Video Editing through Adaptive Sliding Score Distillation [51.57440923362033]
本研究は,オリジナルビデオコンテンツの直接操作を容易にする,ビデオベースのスコア蒸留の新たなパラダイムを提案する。
本稿では,グローバルとローカルの両方の動画ガイダンスを取り入れた適応スライディングスコア蒸留方式を提案する。
論文 参考訳(メタデータ) (2024-06-07T12:33:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。