論文の概要: Consistent and Editable: A Balanced Framework for Text-Guided Video Editing
- arxiv url: http://arxiv.org/abs/2607.05056v1
- Date: Mon, 06 Jul 2026 13:29:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.161876
- Title: Consistent and Editable: A Balanced Framework for Text-Guided Video Editing
- Title(参考訳): Consistent and Editable: テキストガイドによるビデオ編集のためのバランスのとれたフレームワーク
- Authors: Tao Jin, Li Xiao,
- Abstract要約: 一貫性と編集性が向上した高品質なビデオ編集フレームワークであるEquiEditを提案する。
時間的一貫性の面では、時間的スキャンを調整した時間的マンバモジュールが、4つの設計方向に従って融合したビデオシーケンスをスキャンする。
編集性向上のために、スペクトル変換に基づくノイズ注入方式を設計し、編集の柔軟性を高め、編集ビデオのフレーム間一貫性と入力ビデオへの忠実性を確保する。
- 参考スコア(独自算出の注目度): 11.907018651555475
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, diffusion models have achieved considerable success in the text-guided video editing domain. However, existing works often struggle to balance the trade-off between temporal consistency and editability in video editing, with consistency and editability typically being inversely related. To address this, we propose a high-quality video editing framework enhanced for consistency and editability, named EquiEdit, which improves coordinatively the temporal consistency and editability of the edited videos while achieving a balance between the two. In terms of temporal consistency, the proposed temporal Mamba module with a tailored temporal-aware scanning scans fused video sequences following four designed directions, effectively enhancing the inter-frame consistency of edited videos. For editability, we design a noise injection strategy based on the spectral transformation to increase editing flexibility, where the Fourier transform is used to preserve the hidden structure in the initial latent noise used for editing, ensuring inter-frame consistency of the edited video and fidelity to the input video. Extensive qualitative and quantitative experiments demonstrate the effectiveness of our method in terms of temporal consistency and editability, as well as its great fidelity to the input video itself.
- Abstract(参考訳): 近年、拡散モデルはテキスト誘導ビデオ編集領域において大きな成功を収めている。
しかし、既存の作品は、ビデオ編集における時間的一貫性と編集可能性の間のトレードオフのバランスに苦しむことが多く、通常、一貫性と編集性は逆関係である。
そこで本稿では,一貫性と編集性が向上した高品質なビデオ編集フレームワークであるEquiEditを提案する。
時間的整合性の観点からは、時間的スキャンを調整した時間的マンバモジュールは、4つの設計された方向に従って融合したビデオシーケンスをスキャンし、編集されたビデオのフレーム間の整合性を効果的に向上させる。
編集性向上のために,スペクトル変換に基づくノイズ注入方式を設計し,編集に使用する初期潜時ノイズの隠蔽構造をフーリエ変換で保持し,編集ビデオのフレーム間一貫性と入力ビデオへの忠実性を確保する。
広汎な質的・定量的な実験により,時間的一貫性と編集性,入力ビデオ自体への忠実さの両面から,本手法の有効性が示された。
関連論文リスト
- Re-Attentional Controllable Video Diffusion Editing [48.052781838711994]
本稿では,Re-Attentional Controllable Video Diffusion Editing (ReAtCo)法を提案する。
対象物体の空間配置と編集されたテキストプロンプトを無訓練で整合させるために,再注意拡散(RAD)を提案する。
RADは、編集されたテキストプロンプトとデノナイジング段階のターゲットビデオとの間の相互注意活性化反応を再焦点化し、空間的に位置整列し、意味的に高忠実に操作されたビデオを生成する。
論文 参考訳(メタデータ) (2024-12-16T12:32:21Z) - VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing [91.60658973688996]
我々は,グローバルなローカルビデオ編集のための統合ビデオ適応フレームワークであるVIAを導入し,一貫したビデオ編集の限界を推し進める。
本研究では,各フレーム内の局所的な一貫性を確保するため,事前学習した画像編集モデルに適応するテスト時間編集適応を設計した。
また,VIAは長時間の映像編集を一貫した時間で行うことができ,ビデオ編集作業が長続きする可能性を秘めていることを示す。
論文 参考訳(メタデータ) (2024-06-18T17:51:37Z) - I2VEdit: First-Frame-Guided Video Editing via Image-to-Video Diffusion Models [18.36472998650704]
本稿では,1フレームからビデオ全体への編集を事前学習した画像対ビデオモデルを用いてプロパガンダすることで,画像編集ツールをビデオに適用可能にする,新しい汎用的ソリューションを提案する。
I2VEditと呼ばれる本手法は,編集範囲に応じて映像の視覚的・運動的整合性を適応的に保持する。
論文 参考訳(メタデータ) (2024-05-26T11:47:40Z) - FastVideoEdit: Leveraging Consistency Models for Efficient Text-to-Video Editing [8.907836546058086]
既存のビデオ編集における画像生成モデルへのアプローチは、ワンショットの微調整、追加条件抽出、DDIMの逆変換といった時間を要する。
我々は、一貫性モデル(CM)にインスパイアされた効率的なゼロショットビデオ編集手法であるFastVideoEditを提案する。
本手法は,特別な分散スケジュールを用いて,ソース映像からターゲット映像への直接マッピングを可能にする。
論文 参考訳(メタデータ) (2024-03-10T17:12:01Z) - MotionEditor: Editing Video Motion via Content-Aware Diffusion [96.825431998349]
MotionEditorはビデオモーション編集のための拡散モデルである。
新たなコンテンツ対応モーションアダプタをControlNetに組み込んで、時間的モーション対応をキャプチャする。
論文 参考訳(メタデータ) (2023-11-30T18:59:33Z) - Edit-A-Video: Single Video Editing with Object-Aware Consistency [49.43316939996227]
本稿では,事前訓練されたTTIモデルと単一のテキスト,ビデオ>ペアのみを付与したビデオ編集フレームワークを提案する。
本フレームワークは,(1)時間モジュールチューニングを付加して2Dモデルを3Dモデルに膨らませること,(2)原動画をノイズに反転させ,対象のテキストプロンプトとアテンションマップインジェクションで編集すること,の2段階からなる。
各種のテキスト・ビデオに対して広範な実験結果を示し,背景整合性,テキストアライメント,ビデオ編集品質の点で,ベースラインに比べて提案手法の優位性を示す。
論文 参考訳(メタデータ) (2023-03-14T14:35:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。