論文の概要: Enhanced Video Text Editing with Trajectory-Aligned Glyph Rendering
- arxiv url: http://arxiv.org/abs/2609.34178v1
- Date: Mon, 28 Sep 2026 02:57:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-04 06:10:21.895141
- Title: Enhanced Video Text Editing with Trajectory-Aligned Glyph Rendering
- Title(参考訳): 軌跡対応グリフレンダリングによるビデオテキスト編集の強化
- Abstract要約: ビデオテキスト編集は、ビデオの残りの部分をそのままにしながら、ビデオにテキストを置き換えたり追加することを目的としている。
テキストの位置と視点に従って,フレーム単位のグリフガイダンスを明示的に提供するトラジェクトリ整列グリフ描画参照を提案する。
VTEditは、テキスト置換とテキスト追加を含む440の注釈付きテキストトラジェクトリを備えた、288のリアルタイムクリップのベンチマークである。
- 参考スコア(独自算出の注目度): 19.845160562827473
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video text editing aims to replace or add text in a video while keeping the rest of the video unchanged, which requires the edited text to be correct in every frame and to move coherently with the scene. Despite the remarkable progress of video diffusion models, they struggle to reproduce exact stroke structures and often produce garbled or wrong characters, especially for characters with complex strokes. To address this, we propose a trajectory-aligned glyph rendering reference that provides explicit per-frame glyph guidance following the position and perspective of the text, and a depth-normalized recognizer feature supervision that supervises the generated text on multi-depth features of a frozen text recognizer with per-depth normalized errors, targeting stroke errors overlooked by the diffusion loss. We further build VTEdit, a benchmark of 288 real-scene clips with 440 annotated text trajectories covering text replacement and text addition, which will be publicly released to facilitate future research. Experiments on VTEdit show that our method outperforms image text editing methods, video editing methods, and commercial models in text accuracy and background preservation, achieving a sentence accuracy of 0.9408, and receives the highest preference in a user study.
- Abstract(参考訳): ビデオテキスト編集は、ビデオ内のテキストを置き換えたり、追加したりすることを目的としており、ビデオの残りの部分を変更することなく、編集されたテキストをすべてのフレームで修正し、シーンと一貫性を持って移動させる必要がある。
ビデオ拡散モデルの顕著な進歩にもかかわらず、彼らは正確なストローク構造を再現するのに苦労し、特に複雑なストロークを持つキャラクターに対して、しばしばニンブルまたは間違った文字を生成する。
そこで本研究では,テキストの位置と視点に従って,フレーム毎のグリフガイダンスを明示的に提供する軌跡整列グリフレンダリング参照と,拡散損失によって見落とされたストロークエラーをターゲットとした,凍結テキスト認識器のマルチディープ特徴に対するテキスト生成を監督する深度正規化機能監視を提案する。
さらに、テキスト置換とテキスト追加を含む440の注釈付きテキストトラジェクトリを備えた、288のリアルタイムクリップのベンチマークであるVTEditを、今後の研究を促進するために公開する予定である。
VTEditの実験では,画像テキスト編集法,映像編集法,コマーシャルモデルをテキストの精度と背景保存で上回り,文章の精度0.9408を達成し,ユーザの好みを最も高く評価している。
関連論文リスト
- SteerVTE: Seamless Video Text Editing with Style and Glyph Control [37.44272702473038]
ビデオテキスト編集は、小さなテキスト領域内でストロークレベルの精度を要求するローカライズされたタスクである。
本稿では,フリーズビデオ拡散モデルに基づく統合フレームワークであるSteerVTEを紹介する。
SteerVTEはテキストの精度、スタイルの整合性、時間的コヒーレンスなど、既存のビデオ編集のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2026-06-22T12:37:15Z) - Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning [30.48868859205432]
シーンテキスト編集は、周囲の背景やテクスチャを保ちながら、画像のターゲット領域のテキストを変更することを目的としている。
既存の手法は、対象領域の視覚的詳細を無視しながら、画像背景情報のみに依存している。
本稿では,スタイルとグリフのプロンプトを原画像から直接作成する自己プロンプトシーンテキスト編集手法を提案する。
論文 参考訳(メタデータ) (2026-05-15T01:44:17Z) - TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment [68.91073792449201]
そこで本研究では,テキストの正確かつ完全な出現を促すトレーニング不要な方法であるTextGuiderを提案する。
具体的には,多モード拡散変換器(MM-DiT)モデルにおける注意パターンを解析し,特に画像に描画することを意図したテキスト関連トークンについて検討する。
テスト時間テキストレンダリングでは,OCR精度とCLIPスコアが大幅に向上し,高い結果が得られた。
論文 参考訳(メタデータ) (2025-12-10T06:18:30Z) - Text-Animator: Controllable Visual Text Video Generation [149.940821790235]
ビジュアルテキストビデオ生成のための革新的アプローチであるText-Animatorを提案する。
Text-Animatorには、生成されたビデオの視覚的テキスト構造を正確に描写するテキスト埋め込みインジェクションモジュールが含まれている。
また、生成した視覚テキストの安定性を向上させるために、カメラ制御モジュールとテキストリファインメントモジュールを開発する。
論文 参考訳(メタデータ) (2024-06-25T17:59:41Z) - FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video
editing [65.60744699017202]
拡散モデルのU-Netにおける注目モジュールに光フローを導入し,テキスト対ビデオ編集の不整合問題に対処する。
提案手法であるFLATTENでは,異なるフレームにまたがる同一フローパス上のパッチを適用して,アテンションモジュール内の相互にアテンションする。
既存のテキスト・ビデオ編集ベンチマークの結果から,提案手法が新たな最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2023-10-09T17:59:53Z) - FateZero: Fusing Attentions for Zero-shot Text-based Video Editing [104.27329655124299]
本研究では,FateZeroを提案する。FateZeroは,実世界のビデオに対して,プロンプトごとのトレーニングや使用専用のマスクを使わずに,ゼロショットのテキストベースの編集手法である。
本手法は、ゼロショットテキスト駆動型ビデオスタイルと、訓練されたテキスト・ツー・イメージモデルからローカル属性を編集する機能を示す最初の方法である。
論文 参考訳(メタデータ) (2023-03-16T17:51:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。