論文の概要: Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models
- arxiv url: http://arxiv.org/abs/2606.20233v1
- Date: Wed, 17 Jun 2026 17:56:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.886833
- Title: Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models
- Title(参考訳): キャラクタ環境調和映像生成モデルを用いた映像合成
- Authors: Tianyi Xiang, Mingming He, Li Ma, Jing Liao,
- Abstract要約: シネマティック・コンポジションは、物理的および光メトリックリアリズムを維持しながら、グリーンスクリーンのキャラクターを新しい環境に統合することを目的としている。
従来の手法では、文字とその周辺の間の複雑な双方向の相互作用を捉えることができないことが多い。
本稿では,C2EとE2Cの相互作用を協調的にモデル化するエンドツーエンドビデオ拡散フレームワークを提案する。
- 参考スコア(独自算出の注目度): 18.132403462982335
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cinematic compositing aims to integrate green-screen characters into novel environments while maintaining physical and photometric realism. Previous methods often fail to capture the complex bidirectional interactions between characters and their surroundings, which we characterize as Character-to-Environment (C2E) physical interaction and Environment-to-Character (E2C) lighting harmonization. To address this, we propose an end-to-end video diffusion framework that jointly models C2E and E2C interactions, specifically handling the challenges of interactive props. Our approach introduces a tri-mask-guided architecture with RGB-D joint denoising to ensure physically consistent interactions among the character, props, and environment. We further develop an efficient prior-driven data curation pipeline to construct high-quality relighting pairs without expensive rendering. Finally, a reference-conditioned mechanism enables controllable environment synthesis and precise prop replacement. Extensive experiments demonstrate that our framework significantly outperforms existing methods in cinematic-quality dynamic video compositing.
- Abstract(参考訳): シネマティック・コンポジションは、物理的および光メトリックリアリズムを維持しながら、グリーンスクリーンのキャラクターを新しい環境に統合することを目的としている。
従来の手法では、文字と環境の間の複雑な双方向の相互作用を捉えることができず、文字と環境との相互作用(C2E)と環境と文字の調和(E2C)を特徴付ける。
そこで本研究では,C2EとE2Cの相互作用を協調的にモデル化し,対話型プロップの課題に対処するエンドツーエンドビデオ拡散フレームワークを提案する。
提案手法では,RGB-D結合によるトリマスク誘導型アーキテクチャを導入し,キャラクタ,プロップ,環境間の物理的に一貫した相互作用を保証する。
さらに、高コストレンダリングなしで高品質なリライトペアを構築するために、効率的な事前駆動型データキュレーションパイプラインを開発する。
最後に、基準条件付き機構は、制御可能な環境合成と正確なプロップ置換を可能にする。
大規模な実験により,我々のフレームワークは,映像品質のダイナミックビデオ合成において,既存の手法を著しく上回っていることが示された。
関連論文リスト
- CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation [23.278316670516897]
本稿では,人物参照画像,製品参照画像,テキストプロンプト,音声に条件付きHOIビデオ合成のためのエンドツーエンドフレームワークであるCoInteractを提案する。
本稿では,トークンを空間的に制御されたルーティングを通じて,軽量な地域の専門家にルーティングするヒューマン・アウェア・ミックス・オブ・エクササイズ(MoE)を提案する。
第2に、RGBの外観ストリームと補助的なHOI構造ストリームを併用して、相互作用幾何学の先行を注入するデュアルストリームトレーニングパラダイムである空間構造共生成を提案する。
論文 参考訳(メタデータ) (2026-04-21T16:25:43Z) - ONE-SHOT: Compositional Human-Environment Video Synthesis via Spatial-Decoupled Motion Injection and Hybrid Context Integration [49.72976665549397]
人環境ビデオ生成のためのパラメータ効率のよいフレームワークであるONE-SHOTを提案する。
我々の重要な洞察は、生成過程を不整合信号に分解することであり、特に、人間を環境条件から切り離す標準的な空間注入機構を導入する。
提案手法は最先端の手法よりも優れており,ビデオ合成における優れた構造制御と創造的多様性を提供する。
論文 参考訳(メタデータ) (2026-04-01T15:52:00Z) - AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation [45.753757870577196]
本稿では,対話学習のためのエージェント生成にパラダイムを転換する,堅牢なフレームワークAGILEを紹介する。
我々はAGILEがグローバルな幾何学的精度でベースラインを上回り、先行技術が頻繁に崩壊する挑戦的なシーケンスに対して、例外的な堅牢性を証明していることを示す。
論文 参考訳(メタデータ) (2026-02-04T15:42:58Z) - EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer [64.69014756863331]
本研究では,外見と人間の動作の同時分布をモデル化するフレームワークであるEchoMotionを紹介する。
また,ビデオトークンとモーショントークンの両方に3次元位置符号化を統一したMVS-RoPEを提案する。
以上の結果から,人間の動きを明示的に表現することは出現することであり,人間中心のビデオ生成のコヒーレンスと妥当性を著しく向上させることが判明した。
論文 参考訳(メタデータ) (2025-12-21T17:08:14Z) - Dynamic Avatar-Scene Rendering from Human-centric Context [75.95641456716373]
分離されたモデルと最適化されたモデルをブリッジするbf分離マップ(StM)戦略を提案する。
StMは、視覚的品質とレンダリングの精度の両方において、既存の最先端の手法を著しく上回っている。
論文 参考訳(メタデータ) (2025-11-13T17:39:06Z) - SpikeGen: Decoupled "Rods and Cones" Visual Representation Processing with Latent Generative Framework [53.27177454390712]
本研究では,現代の潜在空間生成フレームワークとマルチモーダル視覚入力を統合することで,人間の視覚システムをエミュレートすることを目的とする。
我々はSpikeGenと命名し、条件付き画像やビデオの劣化、スパイクストリームからの高密度フレーム再構成、高速シーンノベルビュー合成など、様々なスパイクRGBタスクのパフォーマンスを評価する。
論文 参考訳(メタデータ) (2025-05-23T15:54:11Z) - AsynFusion: Towards Asynchronous Latent Consistency Models for Decoupled Whole-Body Audio-Driven Avatars [71.90109867684025]
全体オーディオ駆動型アバターポーズと表現生成は、生命に似たデジタル人間を作るための重要なタスクである。
本稿では,拡散変換器を応用し,結合表現とジェスチャ合成を実現する新しいフレームワークAsynFusionを提案する。
AsynFusionは、リアルタイムで同期された全身アニメーションを生成する際に最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-05-21T03:28:53Z) - JointTuner: Appearance-Motion Adaptive Joint Training for Customized Video Generation [13.168628936598367]
JointTunerは、外観とモーションコンポーネントのジョイント最適化を可能にするフレームワークである。
AiT Lossは外見に関連するコンポーネントの流れを乱し、モデルがモーション学習のみに集中するように誘導する。
JointTunerは、UNetベースのモデルとDiffusion Transformerベースのモデルの両方と互換性がある。
論文 参考訳(メタデータ) (2025-03-31T11:04:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。