論文の概要: From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation
- arxiv url: http://arxiv.org/abs/2608.14740v1
- Date: Thu, 13 Aug 2026 18:11:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.058578
- Title: From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation
- Title(参考訳): ディエンス予測からビジュアル編集へ:統一画像とビデオ作成のための構造化スーパービジョン
- Authors: Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen,
- Abstract要約: 統一された画像とビデオの作成には、視覚的コンテキストからアイデンティティ、幾何学、時間的構造を保ちながら、多様な指示に従うモデルが必要である。
我々は、これらの密なタスクを同じ生成インタフェース内で構造化された視覚的監視として利用し、深度と表面正規化予測を画像形式認知ターゲットとして定式化する。
- 参考スコア(独自算出の注目度): 47.1844759979843
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Unified image and video creation requires a model to follow diverse instructions while preserving identity, geometry, and temporal structure from visual context. However, semantic-only conditioning and creation-only training do not explicitly supervise the local structure needed for precise, temporally consistent editing. We therefore formulate depth and surface-normal prediction as image-form denoising targets, using these dense tasks as structured visual supervision within the same creation interface. Our framework decouples semantic interpretation from spatially aligned visual injection while sharing one multimodal diffusion transformer (MMDiT) backbone across all tasks. Mutual Context Attention (MCA), a paired-video data-construction procedure, and a progressive training curriculum then connect the learned structural cues to temporally localized editing and reference-conditioned creation. A single checkpoint obtains the highest overall score in the reported comparison of unified systems (4.15); adding dense supervision improves OpenVE Overall from 3.98 to 4.06 and Local Add from 3.92 to 4.18. These results support a deliberately bounded conclusion: perception-oriented dense supervision transfers useful structural knowledge to downstream creation, especially editing locality and preservation; we do not claim superiority as a standalone dense predictor.
- Abstract(参考訳): 統一された画像とビデオの作成には、視覚的コンテキストからアイデンティティ、幾何学、時間的構造を保ちながら、多様な指示に従うモデルが必要である。
しかし、意味のみの条件付けと生成のみのトレーニングは、正確で時間的に一貫した編集に必要な局所構造を明示的に監督するわけではない。
そこで我々は,これらの高密度なタスクを同一生成インタフェース内で構造化された視覚的監視として利用して,深度と表面正規分布の予測を画像形成目標として定式化する。
本フレームワークは,全タスクでMMDiT(Multimodal diffusion transformer)のバックボーンを共有しながら,空間的に整列した視覚注入から意味解釈を分離する。
相互コンテキスト注意(Mutual Context Attention、MCA)、ペアビデオデータ構築手順、プログレッシブトレーニングカリキュラムは、学習された構造的手がかりを時間的局所的な編集と参照条件の作成に結びつける。
単一のチェックポイントは、報告された統一システムの比較で最高スコア(4.15)を取得し、密集した監督を3.98から4.06に、局所的な追加を3.92から4.18に改善する。
認識指向の高密度監督は、有用な構造知識を下流の創造、特に局所性や保存の編集に伝達する。
関連論文リスト
- CoT-Edit: Let CoT Guide Instruction Video Editing [13.600094788792633]
本稿では,意味的意図と空間的実行を橋渡しする計画ガイド-編集フレームワークを提案する。
我々のフレームワークでは、Chain-of-Thought(CoT)強化マルチモーダル言語モデル(MLLM)がプランナーとして機能する。
これらの空間的先行は、ボックス条件のマスクジェネレータを誘導し、不明瞭なグローバル検索を局所的でコンテキスト対応の洗練に変換する。
論文 参考訳(メタデータ) (2026-08-02T09:20:15Z) - IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation [45.4088603828487]
Implicit Visual Chain-of-conditioned (IV-CoT) は、クエリ・ソート画像生成のための潜在的な視覚的推論フレームワークである。
IV-CoTは、ビジュアルコンディショニングクエリを構造からセマンティックカスケードに分解する。
可視化と解析は、学習された構造的および意味的クエリが構造認識生成において相補的な役割を果たすことを示す。
論文 参考訳(メタデータ) (2026-06-23T17:28:00Z) - SceneForge: Structured World Supervision from 3D Interventions [5.973748478214713]
マルチモーダル学習タスクは、編集、視点、シーンレベルの介入に対して一貫性のある監督を必要とする。
編集可能な3D世界状態から構造化された監視を生成する、介入駆動型フレームワークであるSceneForgeを提案する。
論文 参考訳(メタデータ) (2026-05-14T05:38:00Z) - 3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing [57.785328880266775]
本研究では,シーングラフ推論によるテキスト条件付き空間レイアウト編集を行う構造化推論フレームワークを提案する。
構造化された関係表現を通して推論過程を明示的に導くことにより,空間的関係の解釈可能性と制御性を向上する。
論文 参考訳(メタデータ) (2026-03-23T17:59:14Z) - InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning [60.799998743918955]
複雑な現実世界のシーンにおける微細な画像編集のためのテキストビジョンインターリーブド・チェーン・オブ・グラウンド推論フレームワークを提案する。
InterCoGの重要な洞察は、まずテキスト内でのみオブジェクト位置推論を実行することである。
また,マルチモーダル・グラウンド・ライティング・アライメント・アライメントとマルチモーダル・グラウンド・ライティング・アライメント・アライメントの2つの補助的トレーニング・モジュールを提案する。
論文 参考訳(メタデータ) (2026-03-02T08:13:16Z) - RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness [2.9979091009694088]
現実世界のデプロイメントは、しばしば、最新のオブジェクト認識モデルをドメインシフトに公開し、精度を著しく低下させる。
この劣化を軽減するため、我々はRT-VLM(Re-Thinking Vision Language Model)フレームワークを導入する。
論文 参考訳(メタデータ) (2025-09-01T02:13:00Z) - FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation [55.01077993490845]
最近のLVLM(Large Vision Language Models)は、視覚的理解と生成的モデリングを統一する有望な能力を示している。
本稿では,分割認識と制御可能なオブジェクト中心生成をエンドツーエンドフレームワークに統合した統合LVLMであるFOCUSを紹介する。
論文 参考訳(メタデータ) (2025-06-20T07:46:40Z) - Collaborative Temporal Consistency Learning for Point-supervised Natural Language Video Localization [129.43937834515688]
我々は,ビデオ言語アライメントを強化するために,新しいコラボラティブ・テンポラル・コンポジション・ラーニング(COTEL)フレームワークを提案する。
具体的には、まずフレームとセグメントレベルの時間一貫性学習(TCL)モジュールを設計し、フレームサリエンシと文-モーメントペア間のセマンティックアライメントをモデル化する。
論文 参考訳(メタデータ) (2025-03-22T05:04:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。