論文の概要: ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics
- arxiv url: http://arxiv.org/abs/2607.03732v1
- Date: Sat, 04 Jul 2026 06:39:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.700506
- Title: ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics
- Title(参考訳): ProxyUp: 制御可能なダイナミクスのためのトレーニング不要なプロキシーコンディションビデオ生成
- Abstract要約: 本稿では,フォアグラウンドオブジェクトの動きを制御するために,粗いプロキシビデオが動的キャリアとして機能するプロキシ条件のビデオ生成について紹介する。
プロキシビデオとテキストプロンプトが与えられたら、新しいコンテンツを生成し、プロンプトに整合したプラウシブルなインタラクションを生成しながら、プロキシのダイナミクスを保存する新しいビデオを合成する。
シミュレーションと実世界のプロキシの両方の実験では、ProxyUpはダイナミックな忠実さとテキストアライメントにおいて、強力なビデオ編集とモーション転送ベースラインを上回っている。
- 参考スコア(独自算出の注目度): 47.29298618190995
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Precise control over complex dynamics remains challenging for modern video generative models, as text prompts alone often cannot specify physically plausible, fine-grained motion and interactions. We introduce $\textit{proxy-conditioned video generation}$, where a coarse proxy video from physics-based simulation or real-world recording serves as a dynamics carrier to control foreground object motion. Given a proxy video and a text prompt, the goal is to synthesize a new video that preserves the proxy dynamics while generating novel content and plausible interactions aligned with the prompt. Since paired proxy-target videos are difficult to obtain, we propose $\textbf{ProxyUp}$, a training-free framework built on pretrained video generative models. ProxyUp first inverts the proxy video into an intermediate latent representation and applies $\textbf{region-wise latent noising}$, preserving motion-critical proxy latents while injecting noise into regions intended for text-driven regeneration. To mitigate the distribution mismatch and weak foreground-background coupling introduced by this heuristic latent composition, we further propose $\textbf{Stochastic Flow Relaxation (SFR)}$, which progressively relaxes the composed latent toward the model's learned distribution before ODE sampling. Experiments on both simulation and real-world proxies show that ProxyUp outperforms strong video editing and motion transfer baselines in dynamic fidelity and text alignment.
- Abstract(参考訳): 複雑なダイナミクスの精密制御は、テキストプロンプトだけでは物理的に妥当できめ細かな動きや相互作用を特定できないため、現代のビデオ生成モデルでは依然として困難である。
物理に基づくシミュレーションや実世界記録による粗いプロキシビデオが,フォアグラウンドの物体の動きを制御するためのダイナミックスキャリアとして機能する,というような,$\textit{proxy-conditioned video generation}$を紹介した。
プロキシビデオとテキストプロンプトが与えられたら、新しいコンテンツを生成し、プロンプトに整合したプラウシブルなインタラクションを生成しながら、プロキシのダイナミクスを保存する新しいビデオを合成する。
ペア化されたプロキシターゲットビデオは入手が難しいため、事前学習されたビデオ生成モデルに基づいて構築されたトレーニング不要のフレームワークである$\textbf{ProxyUp}$を提案する。
ProxyUpは、まずプロキシビデオを中間の潜在表現に反転させ、$\textbf{ region-wise latent noising}$を適用し、テキスト駆動の再生を意図した領域にノイズを注入しながら、モーションクリティカルなプロキシラテントを保存する。
このヒューリスティックな潜伏成分によって生じる分布ミスマッチと弱フォアグラウンド-バックグラウンド結合を緩和するために、さらに$\textbf{Stochastic Flow Relaxation (SFR)$を提案する。
シミュレーションと実世界のプロキシの両方の実験では、ProxyUpはダイナミックな忠実さとテキストアライメントにおいて、強力なビデオ編集とモーション転送ベースラインを上回っている。
関連論文リスト
- CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling [111.28808966759613]
我々は、参照制御可能なマルチショット長ビデオ生成を実現するために、CineWeaverという統合フレームワークを提案する。
実験により、CineWeaverは、連続したアイデンティティ、安定したグローバルな外観、鮮明なショット遷移を持つ長時間の高品質なシネマティックビデオを生成することを示した。
論文 参考訳(メタデータ) (2026-07-29T06:48:11Z) - UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation [23.675212404889805]
世界行動モデル(WAM)は、自律運転における行動一般化を改善する強力な可能性を示している。
既存のカスケードまたはデュアルDiTは、アクション予測からビデオイマジネーションを分離する。
マスク変調トランス上に構築された統合ビデオアクションモデルであるUNIVERSEを提案する。
論文 参考訳(メタデータ) (2026-07-06T14:18:18Z) - Unified Video-Action Joint Denoising for Dexterous Action and Data Generation [13.23337683310307]
我々は,デクスタラスハンドのための統合ビデオアクション認知モデルであるDonkを提案する。
Donkは、アクションポリシーとして、将来のビデオと双方向のMANO軌道をサンプリングする。
画像条件がなければ、同じDenoisingアーキテクチャは、テキスト条件のディストリビューションからビデオアクションのロールアウトをサンプリングする。
論文 参考訳(メタデータ) (2026-06-02T16:39:23Z) - RealCam: Real-Time Novel-View Video Generation with Interactive Camera Control [30.825728569025525]
リアルタイムカメラ制御ビデオ・ツー・ビデオ(V2V)生成はインタラクティブな映画製作やライブ放送において大きな可能性を秘めている。
既存の暗黙合成法は、非因果的、フルシーケンス処理と厳密なプレフィックススタイルの時間的結合に依存している。
我々は、インタラクティブでリアルタイムなカメラ制御V2V生成のための新しい自動回帰フレームワーク、texttRealCamを紹介した。
論文 参考訳(メタデータ) (2026-05-07T11:36:29Z) - Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation [41.993197533574126]
Inferixは、最適化された半自己回帰復号プロセスを通じて没入型世界合成を可能にする推論エンジンである。
Inferixはさらに、インタラクティブなビデオストリーミングとプロファイリングによる提供を強化し、リアルタイムのインタラクションと現実的なシミュレーションを可能にしている。
論文 参考訳(メタデータ) (2025-11-25T01:45:04Z) - MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models [50.162882483045045]
本研究では、予め訓練されたビデオエンコーダから非交叉運動部分空間を学習する動き中心アライメントフレームワークを提案する。
この部分空間は、地表面の光学的流れを予測し、真の運動力学を捉えるよう最適化されている。
次に,テキスト間拡散モデルの潜在的特徴をこの新たなサブスペースに整合させ,生成モデルが動きの知識を内部化し,より高機能なビデオを生成することを可能にする。
論文 参考訳(メタデータ) (2025-10-21T19:05:23Z) - Learning to Generate Object Interactions with Physics-Guided Video Diffusion [28.191514920144456]
我々は,現実的な剛体制御,インタラクション,エフェクトを可能にする物理誘導型ビデオ生成のアプローチであるKineMaskを紹介する。
本研究では,物体マスクによる将来の運動監視を段階的に除去する2段階のトレーニング戦略を提案する。
実験により、KineMaskは、同等の大きさの最近のモデルよりも強力な改善を達成している。
論文 参考訳(メタデータ) (2025-10-02T17:56:46Z) - EasyGenNet: An Efficient Framework for Audio-Driven Gesture Video Generation Based on Diffusion Model [22.286624353800377]
本研究では,2次元人間の骨格を中間動作表現として用い,音声合成のための新しいパイプラインを提案する。
実験の結果,本手法は既存のGAN法および拡散法よりも優れていることがわかった。
論文 参考訳(メタデータ) (2025-04-11T08:19:18Z) - Video Creation by Demonstration [59.389591010842636]
我々は、条件付き将来のフレーム予測によってラベルなしビデオから学習する自己教師型トレーニングアプローチである$delta$-Diffusionを提案する。
映像基盤モデルと外観ボトルネック設計を併用して,実演映像から動作遅延を抽出し,生成プロセスの条件付けを行う。
実証的に、$delta$-Diffusionは人間の好みと大規模マシン評価の両方の観点から、関連するベースラインを上回っている。
論文 参考訳(メタデータ) (2024-12-12T18:41:20Z) - EGVD: Event-Guided Video Deraining [57.59935209162314]
本稿では,ビデオデライニングのためのイベントカメラの可能性を解放するエンド・ツー・エンドの学習ネットワークを提案する。
雨の多いビデオと時間的に同期されたイベントストリームからなる現実世界のデータセットを構築します。
論文 参考訳(メタデータ) (2023-09-29T13:47:53Z) - Free-Bloom: Zero-Shot Text-to-Video Generator with LLM Director and LDM
Animator [59.589919015669274]
本研究では,データ・コスト効率を考慮したゼロショットテキスト・ビデオ生成に焦点を当てた。
本稿では,大規模言語モデル (LLM) をディレクタとして活用し,セマンティック・コヒーレンス・プロンプト・シーケンスを生成する新しいフリーブルームパイプラインを提案する。
また,共同ノイズサンプリング,ステップ・アウェア・アテンション・シフト,デュアルパスなど,逆処理におけるLCMの適応に対する注釈修正も提案する。
論文 参考訳(メタデータ) (2023-09-25T19:42:16Z) - Transform-Equivariant Consistency Learning for Temporal Sentence
Grounding [66.10949751429781]
ビデオ毎により差別的な表現を学習するために,新しい同変一貫性規則学習フレームワークを導入する。
私たちのモチベーションは、クエリ誘導アクティビティの時間的境界を一貫して予測することにある。
特に,ビデオの完全性と滑らか性を高めるために,自己教師付き一貫性損失モジュールを考案した。
論文 参考訳(メタデータ) (2023-05-06T19:29:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。