論文の概要: ChordVideo: One-Step, Training-Free, Temporally Consistent Video Editing via Low-Energy Transport
- arxiv url: http://arxiv.org/abs/2608.00769v1
- Date: Sat, 01 Aug 2026 17:03:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.904539
- Title: ChordVideo: One-Step, Training-Free, Temporally Consistent Video Editing via Low-Energy Transport
- Title(参考訳): ChordVideo:低エネルギー輸送によるワンステップ、トレーニング不要、一時的に一貫性のあるビデオ編集
- Abstract要約: ChordEditは、サンプリング時間に沿って低エネルギースムースにすることで、このような編集を安定化させるが、時間的なフリッカと編集強度のドリフトを生成する。
我々は、同じ低エネルギーの原理を共有ノイズ、フレーム単位のコードフィールドの運動整合因果集約、オプションの時間的スムーズな補正を通じてビデオ時間に拡張するtextbfChordVideoを紹介した。
ワンステップバックボーンが2つあるTGVE/DAVISでは、CordVideoがtextbf78%でワープエラーを減らし、textbf49%でflickerを減らし、テキストによるCLIPフレームの整合性を改善する
- 参考スコア(独自算出の注目度): 0.8460698440162889
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: One-step text-to-image models enable training-free, inversion-free editing with only 1--2 network function evaluations (NFE), while ChordEdit stabilizes such edits through low-energy smoothing along sampling time. Applied independently to video frames, however, it produces temporal flicker and edit-strength drift. We introduce \textbf{ChordVideo}, which extends the same low-energy principle to video time through shared noise, motion-aligned causal aggregation of per-frame Chord fields, and an optional temporally smoothed proximal correction. We derive a warping-error bound that separates motion bias from stochastic flicker and predicts diminishing returns with larger temporal windows. On TGVE/DAVIS with two one-step backbones, ChordVideo reduces warping error by \textbf{78\%} and flicker by \textbf{49\%}, improves CLIP frame consistency by \textbf{9--10 points}, and increases background PSNR by about \textbf{1.5,dB}, while retaining \textbf{2 NFE/frame}. Compared with seven multi-step editors, it achieves competitive temporal consistency and source preservation using \textbf{10--60$\times$ fewer model steps per clip
- Abstract(参考訳): ワンステップのテキスト・ツー・イメージモデルでは、トレーニング不要でインバージョンフリーな編集が可能で、1--2ネットワーク機能評価(NFE)のみであり、ChordEditはサンプリング時間に沿って低エネルギースムースにすることで、そのような編集を安定化する。
しかし、ビデオフレームとは独立して、テンポラリフリックと編集強度ドリフトを生成する。
我々は、共有ノイズ、フレーム単位のコードフィールドの運動整列因果アグリゲーション、オプションの時間的スムーズな近位補正を通じて、同じ低エネルギー原理をビデオ時間に拡張する「textbf{ChordVideo}」を紹介した。
我々は、確率的フリックから動きバイアスを分離し、時間的ウィンドウを大きくして減少するリターンを予測するワーピングエラーを導出する。
2つの1ステップのバックボーンを持つTGVE/DAVISでは、ChordVideoはワープエラーを \textbf{78\%} と flicker を \textbf{49\%} で削減し、CLIP フレームの一貫性を \textbf{9--10 points} で改善し、バックグラウンド PSNR を約 \textbf{1.5,dB} で改善し、しかも \textbf{2 NFE/frame} を維持している。
7つのマルチステップエディタと比較すると,‘textbf{10-60$\times$ less model steps per clip を使って,競合する時間的一貫性とソース保存を実現している。
関連論文リスト
- OSVE: One Step Video Editing with One Step Diffusion Models [17.564785522861477]
我々は,高品質なビデオ編集のためのワンステップテキスト・ツー・イメージ(T2I)モデルを成功させる最初のフレームワークであるOSVEを提案する。
インバージョン、編集可能性、時間的一貫性といった課題に対処する。
このブレークスルーは、実用的なリアルタイムビデオ編集アプリケーションへの道を開くものだ。
論文 参考訳(メタデータ) (2026-07-22T08:29:30Z) - ChronoLock: Protecting Videos from Unauthorized Text-to-Video Personalization [27.79968637806027]
テキスト・ツー・ビデオ(T2V)拡散モデルにより、現実的で時間的に整合したビデオの合成がますます容易になっている。
最近のパーソナライズ技術は、いくつかの参照クリップから特定の主題、スタイル、動きパターンを模倣することができる。
オンラインで共有されたビデオは、無許可のT2V微調整のために収集および使用することができる。
既存の保護的摂動は主に画像認識やテキスト・ツー・イメージのパーソナライゼーションのために設計されており、したがって静的な外観を損なうことに重点を置いている。
論文 参考訳(メタデータ) (2026-06-19T06:37:13Z) - Beyond Consistency: Preserving Temporal Structure in Zero-Shot Video Editing [48.768011768488584]
既存のゼロショットビデオ編集手法では、ビデオの本来の時間構造を保存できない。
本稿では,映像の時間的構造を保存することに焦点を当てた新しいゼロショット編集手法を提案する。
提案手法は,従来の時間構造保存と計算効率のバランスをとることによって,最先端の計算結果を実現する。
論文 参考訳(メタデータ) (2026-06-07T18:53:57Z) - PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs [57.790910044227935]
ビデオLLMは時間的不整合に悩まされ、フレームタイミングの小さなシフトは注意をそらすことができ、関連するフレームを抑えることができる。
本稿では, 位相アグリゲード平滑化(PAS)について述べる。これは, 頭部に小さな反対位相オフセットを適用して, 出力を集約する学習自由機構である。
解析の結果,RoPE回転ロジットは,時間核でスケールしたコンテントドット積として近似でき,このカーネルを滑らかにすることで,小さな時間シフトに対する注意のリプシッツ安定性が得られ,マルチフェーズ平均化は,Nyquist-valid サンプリング下での頭当たりスペクトルを保ちながら高周波リップルを減衰させることがわかった。
論文 参考訳(メタデータ) (2025-11-14T05:56:47Z) - VideoDirector: Precise Video Editing via Text-to-Video Models [45.53826541639349]
現在のビデオ編集法は、時間的コヒーレンス生成能力を欠くテキスト・ツー・ビデオ(T2V)モデルに依存している。
本稿では、より正確なピボットインバージョンを実現するために、時空間デカップリングガイダンス(STDG)と複数フレームのヌルテキスト最適化戦略を提案する。
実験結果から,本手法はT2Vモデルの強力な時間生成能力を効果的に活用できることが示唆された。
論文 参考訳(メタデータ) (2024-11-26T16:56:53Z) - RIGID: Recurrent GAN Inversion and Editing of Real Face Videos [73.97520691413006]
GANのインバージョンは、実画像に強力な編集可能性を適用するのに不可欠である。
既存のビデオフレームを個別に反転させる手法は、時間の経過とともに望ましくない一貫性のない結果をもたらすことが多い。
我々は、textbfRecurrent vtextbfIdeo textbfGAN textbfInversion and etextbfDiting (RIGID) という統合されたリカレントフレームワークを提案する。
本フレームワークは,入力フレーム間の固有コヒーレンスをエンドツーエンドで学習する。
論文 参考訳(メタデータ) (2023-08-11T12:17:24Z) - Rerender A Video: Zero-Shot Text-Guided Video-to-Video Translation [93.18163456287164]
本稿では,動画に画像モデルを適用するための新しいテキスト誘導型動画翻訳フレームワークを提案する。
我々のフレームワークは,グローバルなスタイルと局所的なテクスチャの時間的一貫性を低コストで実現している。
論文 参考訳(メタデータ) (2023-06-13T17:52:23Z) - ControlVideo: Training-free Controllable Text-to-Video Generation [117.06302461557044]
ControlVideoは、自然で効率的なテキスト・ビデオ生成を可能にするフレームワークである。
NVIDIA 2080Tiを使って、ショートビデオとロングビデオの両方を数分で生成する。
論文 参考訳(メタデータ) (2023-05-22T14:48:53Z) - Transform-Equivariant Consistency Learning for Temporal Sentence
Grounding [66.10949751429781]
ビデオ毎により差別的な表現を学習するために,新しい同変一貫性規則学習フレームワークを導入する。
私たちのモチベーションは、クエリ誘導アクティビティの時間的境界を一貫して予測することにある。
特に,ビデオの完全性と滑らか性を高めるために,自己教師付き一貫性損失モジュールを考案した。
論文 参考訳(メタデータ) (2023-05-06T19:29:28Z) - Edit-A-Video: Single Video Editing with Object-Aware Consistency [49.43316939996227]
本稿では,事前訓練されたTTIモデルと単一のテキスト,ビデオ>ペアのみを付与したビデオ編集フレームワークを提案する。
本フレームワークは,(1)時間モジュールチューニングを付加して2Dモデルを3Dモデルに膨らませること,(2)原動画をノイズに反転させ,対象のテキストプロンプトとアテンションマップインジェクションで編集すること,の2段階からなる。
各種のテキスト・ビデオに対して広範な実験結果を示し,背景整合性,テキストアライメント,ビデオ編集品質の点で,ベースラインに比べて提案手法の優位性を示す。
論文 参考訳(メタデータ) (2023-03-14T14:35:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。