論文の概要: SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer
- arxiv url: http://arxiv.org/abs/2605.14894v1
- Date: Thu, 14 May 2026 14:37:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.880019
- Title: SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer
- Title(参考訳): SEDiT: 1段階拡散変換器によるマスクフリービデオ字幕消去
- Authors: Zheng Hui, Yunlong Bai,
- Abstract要約: 一段階拡散変換器を用いた一段ビデオ字幕消去手法SEDiTを提案する。
ターゲット字幕の直接消去を可能にするマスクフリー推論手法を提案する。
提案手法は,ワンステップ,チャンクワイドのストリーミング推論により,ネイティブな1440p動画を無限長で効率的に処理できる。
- 参考スコア(独自算出の注目度): 4.205766319033597
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent breakthroughs in video diffusion models have significantly accelerated the development of video editing techniques. However, existing methods often rely on inpainting video frames based on masked input, which requires extracting the target video mask in advance, and the precision of the segmentation directly affects the quality of the completion. In this paper, we present SEDiT, a novel one-stage video Subtitle Erasure approach via One-step Diffusion Transformer. We introduce a mask-free inference approach that enables direct erasure of the targeted subtitle. The proposed one-stage framework mitigates the sub-optimality inherent in the two-stage processing of prior models. Since subtitle removal is a localized editing task in which most pixels remain unchanged, the underlying distribution shift is minimal, making it well-suited to one-step generation under rectified flow. We empirically validate the reliability of one-step denoising and further provide a formal theoretical justification. Under the localized-editing structure of subtitle removal, the conditional optimal transport (OT) map and its induced rectified flow velocity field are Lipschitz continuous with respect to the latent variable, which underpins the theoretical feasibility of one-step sampling. To address the challenge of long-term temporal consistency, we adopt a hybrid training strategy by occasionally conditioning the model with a clean first-frame latent. This facilitates temporal continuity, allowing each segment during inference to leverage the output of its predecessor. To avoid visible seams caused by cropping and reinserting processed targets, particularly in scenarios involving substantial motion, we feed the original video directly into SEDiT. Thanks to one-step and chunk-wise streaming inference, our method can efficiently handle native 1440p video with infinite length.
- Abstract(参考訳): 近年,映像拡散モデルの進歩により,映像編集技術の発達が著しく加速している。
しかし、既存の手法では、予め対象の映像マスクを抽出する必要があるマスク入力に基づく映像フレームの塗布に依存しており、セグメント化の精度は、その完成度に直接影響することが多い。
本稿では,1段階拡散変換器を用いた新しいビデオ字幕消去手法SEDiTを提案する。
ターゲット字幕の直接消去を可能にするマスクフリー推論手法を提案する。
提案したワンステージフレームワークは、先行モデルの2段階処理に固有の準最適性を緩和する。
字幕削除は、ほとんどのピクセルが変化しない局所的な編集タスクであるため、基礎となる分布シフトは最小限であり、整流下での一段階生成に適している。
我々は、一段階の認知の信頼性を実証的に検証し、さらに公式な理論的正当化を提供する。
副字幕除去の局所化編集構造の下では、条件付き最適輸送(OT)写像とその誘導整流速度場は、潜時変数に関してリプシッツ連続であり、一段階サンプリングの理論的実現可能性を支える。
長期的時間的整合性の課題に対処するため、クリーンなファーストフレームラテントでモデルを時折条件付けすることで、ハイブリッドなトレーニング戦略を採用する。
これにより時間的連続性が促進され、推論中の各セグメントがその前者の出力を活用することができる。
本研究は,特に実質的な動きを伴うシナリオにおいて,加工対象の刈り取りと再選によって生じる目に見える縫い目を避けるため,オリジナル映像を直接SEDiTに供給する。
提案手法は,ワンステップ,チャンクワイドのストリーミング推論により,ネイティブな1440p動画を無限長で効率的に処理できる。
関連論文リスト
- Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep [37.62908191585867]
HetCacheは、ビデオ・ツー・ビデオ(MV2V)の生成と編集のためのトレーニング不要な拡散加速フレームワークである。
編集の一貫性と忠実さを維持しながら、冗長な注意操作を低減する。
実験によると、HetCacheは2.67$times$レイテンシのスピードアップやFLOPの削減など、目立った加速を実現している。
論文 参考訳(メタデータ) (2026-03-25T12:53:31Z) - Streaming Autoregressive Video Generation via Diagonal Distillation [50.13573884115673]
自己回帰モデルは、シーケンシャルフレーム合成のための自然なフレームワークを提供するが、高い忠実性を達成するためには重い計算を必要とする。
ビデオチャンクとデノイングステップの時間的情報を活用するために,ダイアゴナル蒸留を提案する。
本手法は,2.61秒(最大31FPS)で5秒ビデオを生成し,未蒸留モデル上で277.3倍のスピードアップを実現する。
論文 参考訳(メタデータ) (2026-03-10T10:45:24Z) - Unified Video Editing with Temporal Reasoner [20.19759768002609]
本稿では,Chain-of-Framesアプローチとして,Chain-of-Thought推論にヒントを得たVideoCoFを提案する。
VideoCoFは、ビデオ拡散モデルを説得して、最初に推論トークンを予測することによって、シー、シー、シー、エディット"手順を強制する。
我々は,50kビデオペアの最小データコストで,VideoCoF-Benchの最先端性能を実現することを実証した。
論文 参考訳(メタデータ) (2025-12-08T11:50:18Z) - Mobius: Text to Seamless Looping Video Generation via Latent Shift [50.04534295458244]
ユーザアノテーションを使わずにテキスト記述から直接シームレスにループするビデオを生成する新しい方法であるMobiusを提案する。
本手法では,事前学習したビデオ遅延拡散モデルを用いて,テキストプロンプトからループ映像を生成する。
論文 参考訳(メタデータ) (2025-02-27T17:33:51Z) - COVE: Unleashing the Diffusion Feature Correspondence for Consistent Video Editing [57.76170824395532]
ビデオ編集は新たな課題であり、現在のほとんどの手法では、ソースビデオを編集するために、事前訓練されたテキスト・トゥ・イメージ(T2I)拡散モデルを採用している。
我々は,高品質で一貫したビデオ編集を実現するために,COVE(Cor correspondingence-guided Video Editing)を提案する。
COVEは、追加のトレーニングや最適化を必要とせずに、事前訓練されたT2I拡散モデルにシームレスに統合することができる。
論文 参考訳(メタデータ) (2024-06-13T06:27:13Z) - MAVIN: Multi-Action Video Generation with Diffusion Models via Transition Video Infilling [19.004339956475498]
MAVINは、2つの動画をシームレスに接続し、結合的な統合シーケンスを形成するトランジションビデオを生成するように設計されている。
従来の品質基準を補完し,時間的コヒーレンスと滑らかさを評価するための新しい指標CLIP-RS(CLIP Relative Smoothness)を導入する。
馬とトラのシナリオに関する実験結果は、滑らかでコヒーレントなビデオ遷移を生成するMAVINの優れた性能を示す。
論文 参考訳(メタデータ) (2024-05-28T09:46:09Z) - Edit-A-Video: Single Video Editing with Object-Aware Consistency [49.43316939996227]
本稿では,事前訓練されたTTIモデルと単一のテキスト,ビデオ>ペアのみを付与したビデオ編集フレームワークを提案する。
本フレームワークは,(1)時間モジュールチューニングを付加して2Dモデルを3Dモデルに膨らませること,(2)原動画をノイズに反転させ,対象のテキストプロンプトとアテンションマップインジェクションで編集すること,の2段階からなる。
各種のテキスト・ビデオに対して広範な実験結果を示し,背景整合性,テキストアライメント,ビデオ編集品質の点で,ベースラインに比べて提案手法の優位性を示す。
論文 参考訳(メタデータ) (2023-03-14T14:35:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。