論文の概要: FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control
- arxiv url: http://arxiv.org/abs/2607.29627v1
- Date: Fri, 31 Jul 2026 16:59:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 16:35:22.250023
- Title: FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control
- Title(参考訳): FlexComposer: フレキシブルな軌道制御による画像から動的フットプリントへの統一ビデオ合成
- Authors: Songchun Zhang, Sitong Guo, Xianghao Kong, Pengwei Liu, Yuwei Guo, Lvmin Zhang, Anyi Rao,
- Abstract要約: トラジェクティブ誘導条件生成タスクとしてビデオ合成を標準化する統合フレームワークを提案する。
提案手法では,(1)大域的変位から物体の内在的な動きを分離し,不均一な入力を安定,中心となる潜在空間に標準化する統一的フォアグラウンド表現,(2)VAE潜在空間の変換等価性を利用したパラメータフリー機構による目標軌道への変換を行う空間認識潜在射出法,(3)手続き的シミュレーション,実世界の映像映像の相乗化を行うハイブリッドデータセットと合成-Real Curriculum,の3つの重要な設計を紹介する。
- 参考スコア(独自算出の注目度): 26.208912960696622
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generative video compositing, which involves inserting external assets seamlessly into existing video sequences, is essential for content creation and visual effects. However, existing approaches suffer from a control-fidelity trade-off: they either hallucinate motion from static images, failing to preserve the dynamics of pre-animated assets, or lack fine-grained spatial control for precise asset placement along user-defined trajectories. We propose FlexComposer, a unified framework that standardizes video compositing as a trajectory-guided conditional generation task, enabling the seamless integration of both static images and dynamic footage. Our approach introduces three key designs: (1) a Unified Canonical Foreground Representation that decouples an object's intrinsic motion from its global displacement, standardizing heterogeneous inputs into a stabilized, centered latent space; (2) a Spatial-Aware Latent Injection strategy that exploits the translation equivariance of VAE latent spaces to transport canonical features onto target trajectories via a parameter-free mechanism; and (3) a Hybrid Dataset and Synthetic-to-Real Curriculum that synergizes procedural simulation, real-world cinematic footage, and generative data to implicitly learn physically plausible illumination and shadow harmonization. This unified design handles diverse inputs from product photos to dynamic subjects achieving high-fidelity motion control and environmental integration without the need for explicit 3D reconstruction or auxiliary learnable adapters. Extensive experiments demonstrate that FlexComposer outperforms state-of-the-art methods in visual quality, temporal consistency, and trajectory adherence.
- Abstract(参考訳): 既存のビデオシーケンスに外部アセットをシームレスに挿入する生成ビデオ合成は、コンテンツ作成と視覚効果に不可欠である。
しかし、既存のアプローチでは、静的イメージからの動作を幻覚させるか、事前アニメーションされた資産のダイナミクスを保たないか、あるいはユーザ定義の軌道に沿った正確な資産配置のためのきめ細かい空間制御が欠如している。
我々は,映像合成を軌跡誘導条件生成タスクとして標準化する統合フレームワークFlexComposerを提案し,静的画像と動的映像のシームレスな統合を実現する。
提案手法では, 物体の固有運動を大域的変位から切り離し, 不均質な入力を安定, 集中型潜在空間に標準化する統一正準前景表現法, パラメータフリー機構により, VAE潜在空間の変換同値を利用して目標軌道に標準特徴を伝達する空間認識潜在射出法, および, 手続き的シミュレーション, 実世界の映像映像を合成するハイブリッド・データセットと合成-リアル・カリキュラム, および物理的に可視な照明と影調和を暗黙的に学習する生成データを提案する。
この統一されたデザインは、明示的な3D再構成や補助的な学習可能なアダプタを必要とせず、高忠実度モーションコントロールと環境統合を実現するために、製品写真から動的対象への多様な入力を処理する。
大規模な実験では、FlexComposerが視覚的品質、時間的一貫性、軌跡の定着において最先端の手法より優れていることが示されている。
関連論文リスト
- WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory [106.28234880163723]
WorldDirectorは、高度に制御可能なビデオワールドモデルフレームワークである。
我々のフレームワークは、視覚生成から意味的な動きのオーケストレーションを明示的に分離する。
長時間の視界外から再突入しても,動的実体の正確な視覚的アイデンティティを保たせることができた。
論文 参考訳(メタデータ) (2026-07-02T17:59:59Z) - ManiSplat: Manipulation Trajectory Synthesis from Monocular Video via Decoupled 3D Gaussian Splatting [28.256286705954846]
現実の観察から動的でインタラクティブな3Dシーンを再構築することは、コンピュータビジョンとロボティクスの基本的な課題である。
ロボットビデオから直接ガウスのデジタル双生児を制御可能で分離する統合フレームワークであるManiSplatを紹介した。
提案手法は,対話駆動型動的シーンを高忠実度かつ制御性で再構築し,下流ロボットタスクとポリシー学習を効果的に支援する。
論文 参考訳(メタデータ) (2026-06-09T09:55:58Z) - MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data [125.43597497646444]
MetaWorldは、マルチエージェントビデオワールドモデルをシングルビュービデオから直接オープンドメイン環境にスケールする新しいフレームワークである。
クロスビューの一貫性とアイデンティティの整合性を向上し、マルチエージェントビデオワールドモデリングのための高度にスケーラブルで物理駆動のパラダイムを確立する。
論文 参考訳(メタデータ) (2026-06-01T18:20:20Z) - Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation [57.28703268044067]
ロボット操作のための新しいデュアルストリームビュー変換器であるCortical Policyを提案する。
われわれのフレームワークは、ロボット操作の新しい視点を提供し、視覚に基づくロボット制御の幅広い応用の可能性を秘めている。
論文 参考訳(メタデータ) (2026-03-22T04:18:54Z) - IDSplat: Instance-Decomposed 3D Gaussian Splatting for Driving Scenes [25.939318593012484]
動的駆動シーンの再構築は、センサ・リアリスティック・シミュレーションによる自律システム開発に不可欠である。
我々は,動的シーンを明示的なインスタンス分解と学習可能なモーショントラジェクトリで再構成する,自己教師型3次元ガウススティングフレームワークIDSplatを提案する。
本手法は, インスタンスレベルの分解を維持しつつ, 競合する再構成品質を実現し, 再トレーニングを伴わずに, 多様なシーケンスやビュー密度を一般化する。
論文 参考訳(メタデータ) (2025-11-24T15:48:08Z) - SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios [48.09735396455107]
ハンドオブジェクトインタラクション(HOI)生成には、大きな応用可能性がある。
現在の3D HOIモーション生成アプローチは、事前に定義された3Dオブジェクトモデルとラボでキャプチャされたモーションデータに大きく依存している。
本稿では,同期拡散プロセス内での視覚的事前制約と動的制約を組み合わせることで,HOIビデオと動きを同時に生成するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-03T05:04:29Z) - TrackDiffusion: Tracklet-Conditioned Video Generation via Diffusion Models [75.20168902300166]
微粒な軌跡条件の運動制御が可能な新しい映像生成フレームワークであるTrackDiffusionを提案する。
TrackDiffusionの重要なコンポーネントは、複数のオブジェクトのフレーム間の一貫性を明確に保証するインスタンスエンハンサーである。
TrackDiffusionによって生成されたビデオシーケンスは、視覚知覚モデルのトレーニングデータとして使用できる。
論文 参考訳(メタデータ) (2023-12-01T15:24:38Z) - Alignment-free HDR Deghosting with Semantics Consistent Transformer [76.91669741684173]
高ダイナミックレンジイメージングは、複数の低ダイナミックレンジ入力から情報を取得し、リアルな出力を生成することを目的としている。
既存の手法では、前景やカメラの動きによって引き起こされる入力フレーム間の空間的ずれに焦点を当てることが多い。
本研究では,SCTNet(Semantics Consistent Transformer)を用いたアライメントフリーネットワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T15:03:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。