論文の概要: CoT-Edit: Let CoT Guide Instruction Video Editing
- arxiv url: http://arxiv.org/abs/2608.01113v1
- Date: Sun, 02 Aug 2026 09:20:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.086839
- Title: CoT-Edit: Let CoT Guide Instruction Video Editing
- Title(参考訳): CoT-Edit:CoTガイドの動画編集が可能に
- Abstract要約: 本稿では,意味的意図と空間的実行を橋渡しする計画ガイド-編集フレームワークを提案する。
我々のフレームワークでは、Chain-of-Thought(CoT)強化マルチモーダル言語モデル(MLLM)がプランナーとして機能する。
これらの空間的先行は、ボックス条件のマスクジェネレータを誘導し、不明瞭なグローバル検索を局所的でコンテキスト対応の洗練に変換する。
- 参考スコア(独自算出の注目度): 13.600094788792633
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-driven instruction-based video editing in complex scenes remains challenging: purely textual prompts often fail to capture precise spatial relationships and physical constraints, resulting in target ambiguity and physically implausible outcomes. To address this, we propose a plan--guide--edit framework that explicitly bridges semantic intent and spatial execution. In our framework, a Chain-of-Thought (CoT)-enhanced multimodal large language model (MLLM) serves as a planner, performing structured reasoning over the video and instructions to derive a precise sequence of bounding boxes and attribute-enriched editing directives. These spatial priors then guide a box-conditioned mask generator, transforming ambiguous global retrieval into localized, context-aware refinement and producing masks that more accurately capture object scale, contact relationships, and placement. Building on these spatial and semantic signals, a diffusion-based editor integrates the masks, enriched instructions, and frame features to render high-fidelity edits that remain temporally coherent and spatially well aligned. Trained first in a modular manner and then jointly, our framework achieves superior performance with reduced data requirements, delivering precise localization in scenes with multiple similar objects and physically consistent object additions, and extensive experiments demonstrate state-of-the-art performance over multiple strong baseline methods. More details are available at: https://github.com/flying-sky999/CoT-Edit
- Abstract(参考訳): テキストによる指示に基づく複雑なシーンの映像編集は依然として困難であり、純粋にテキストによるプロンプトは、しばしば正確な空間的関係や物理的制約を捉えることができず、目的の曖昧さと物理的に不可解な結果をもたらす。
そこで本研究では,意味的意図と空間的実行を明確に橋渡しする計画ガイド・編集フレームワークを提案する。
本稿では,CoT(Chain-of-Thought)に強化されたマルチモーダル言語モデル(MLLM)をプランナとして,ビデオと命令に関する構造化推論を行い,境界ボックスと属性強化編集ディレクティブの正確なシーケンスを導出する。
これらの空間的先行は、ボックス条件のマスクジェネレータを誘導し、不明瞭なグローバル検索を局所的でコンテキスト対応の洗練に変換し、オブジェクトのスケール、接触関係、配置をより正確にキャプチャするマスクを生成する。
これらの空間的および意味的な信号に基づいて、拡散ベースのエディタは、マスク、豊富な指示、フレーム特徴を統合して、時間的に整合的で空間的に整合した高忠実な編集を行う。
まず,複数の類似したオブジェクトと物理的に一貫したオブジェクトの追加によるシーンの正確なローカライゼーションを実現するとともに,複数の強力なベースラインメソッド上での最先端のパフォーマンスを実証した。
詳細は、https://github.com/flying-sky999/CoT-Editを参照してください。
関連論文リスト
- Text-Vision Co-Instructed Image Editing [11.968553566506626]
本稿では,テキスト・ビジョン・コインストラクテッド・イメージ編集について紹介する。
意味的意図と空間的制約を統合することで、TV-Editはより正確な空間制御、命令のあいまいさの低減、テキストのみやドラッグベースの代替よりも構造的一貫性の強化につながる。
論文 参考訳(メタデータ) (2026-06-15T14:16:05Z) - KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing [24.315720861063397]
KGEditは、テキスト・トゥ・ビデオ(T2V)拡散モデルのための構造化セマンティック・コントロール・フレームワークである。
まず、入力プロンプトのアンビグニティ対応知識グラフ(AAKG)を構築し、入力プロンプトのアンビグニティ化とアンビグニティ化を行う。
次に,拡散変換器の鍵層に意味信号を注入する構造的意味注入モジュール(SSIM)を設計する。
論文 参考訳(メタデータ) (2026-05-28T07:31:22Z) - Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing [55.211537893248675]
本稿では,2つの補完コンポーネントを中心に構築された暗黙の推論ビデオ編集用DiTフレームワークであるRVEDiTを提案する。
RVEDiTは最先端のベースラインを一貫して上回り、特にローカライズされた編集や構成的な編集において大きな利益を得ている。
論文 参考訳(メタデータ) (2026-05-23T17:22:14Z) - CEI-3D: Collaborative Explicit-Implicit 3D Reconstruction for Realistic and Fine-Grained Object Editing [51.73433734209541]
既存の3D編集手法は、再構成ネットワークの深い統合性のために、非現実的で未精細な結果をもたらすことが多い。
本稿では,現実的できめ細かな編集を容易にするための,編集指向の再構築パイプラインであるCEI-3Dを紹介する。
提案手法は,最新技術(SOTA)手法よりも,よりリアルできめ細かな編集結果を実現すると同時に,編集時間を短縮する。
論文 参考訳(メタデータ) (2026-03-12T11:15:11Z) - WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing [103.68419705566146]
WeEditは、スケーラブルなデータ構築パイプラインと2つのベンチマーク、2段階のトレーニング戦略を含む、システマティックなソリューションである。
具体的には、多様な編集操作と15言語をカバーする330Kのトレーニングペアを生成するHTMLベースの新しい自動編集パイプラインを提案する。
アルゴリズム面では、グリフ誘導による微調整を用いて、空間的および内容的事前の明示を注入し、次いで、命令の順守、テキストの明瞭さ、背景の保存と、生成を整合させる多目的強化学習ステージを用いる。
論文 参考訳(メタデータ) (2026-03-12T06:25:09Z) - InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning [60.799998743918955]
複雑な現実世界のシーンにおける微細な画像編集のためのテキストビジョンインターリーブド・チェーン・オブ・グラウンド推論フレームワークを提案する。
InterCoGの重要な洞察は、まずテキスト内でのみオブジェクト位置推論を実行することである。
また,マルチモーダル・グラウンド・ライティング・アライメント・アライメントとマルチモーダル・グラウンド・ライティング・アライメント・アライメントの2つの補助的トレーニング・モジュールを提案する。
論文 参考訳(メタデータ) (2026-03-02T08:13:16Z) - LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents [61.91651123290512]
LangDriveCTRLは、様々な交通シナリオを合成するために現実世界の運転ビデオを編集するフレームワークである。
オブジェクトノードの編集(削除、挿入、置換)と1つの自然言語命令からの複数オブジェクトの振る舞いの編集の両方をサポートする。
論文 参考訳(メタデータ) (2025-12-19T10:57:03Z) - ContextFlow: Training-Free Video Object Editing via Adaptive Context Enrichment [13.125899660835813]
トレーニング不要のビデオオブジェクト編集は、オブジェクト挿入、スワップ、削除を含む、正確なオブジェクトレベルの操作を実現することを目的としている。
既存の方法は、一階解法による不正確な逆転と、粗い「堅い」特徴置換によって引き起こされる文脈的衝突の2つの主要な制限に悩まされている。
本稿では,DiTベースのビデオオブジェクト編集のための新しいトレーニングフリーフレームワークであるContextFlowを紹介する。
論文 参考訳(メタデータ) (2025-09-22T14:13:31Z) - FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation [55.01077993490845]
最近のLVLM(Large Vision Language Models)は、視覚的理解と生成的モデリングを統一する有望な能力を示している。
本稿では,分割認識と制御可能なオブジェクト中心生成をエンドツーエンドフレームワークに統合した統合LVLMであるFOCUSを紹介する。
論文 参考訳(メタデータ) (2025-06-20T07:46:40Z) - SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding [46.767486063775266]
SmartFreeEditは、マルチモーダルな大規模言語モデル(MLLM)とハイパーグラフ強化のインペイントアーキテクチャを統合するエンドツーエンドフレームワークである。
SmartFreeEditの主なイノベーションは、リージョン認識トークンとマスク埋め込みパラダイムである。
Reason-Editベンチマークの実験では、SmartFreeEditが現在の最先端メソッドを上回ることが示されている。
論文 参考訳(メタデータ) (2025-04-17T07:17:49Z) - Task-Oriented Diffusion Inversion for High-Fidelity Text-based Editing [60.730661748555214]
textbfTask-textbfOriented textbfDiffusion textbfInversion (textbfTODInv) は、特定の編集タスクに適した実際の画像を反転して編集する新しいフレームワークである。
ToDInvは相互最適化によってインバージョンと編集をシームレスに統合し、高い忠実さと正確な編集性を保証する。
論文 参考訳(メタデータ) (2024-08-23T22:16:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。