論文の概要: Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising
- arxiv url: http://arxiv.org/abs/2607.04653v1
- Date: Mon, 06 Jul 2026 04:18:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.035341
- Title: Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising
- Title(参考訳): ロール・アウェア共同訓練とモダリティ・デカップリングによる映像の物理的整合性向上
- Authors: Guangting Zheng, Haojing Chen, Hao Li, Jingtao Zhang, Zhen Yang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang,
- Abstract要約: ビデオ拡散モデルにおける物理的整合性を改善するための微調整フレームワークである textbfVPT を提案する。
VPTは、エージェント、制御されたオブジェクト、受動的オブジェクト、バックグラウンドにエンティティをグループ化するロール認識シグナルを導入し、異なる物理ロールをより明確にモデル化することができる。
実験の結果、VPTは視覚的品質を維持しながら物理的な一貫性を改善し、Wan2.1-T2V-1.3BよりもSAが39.4%、PCが17.9%向上し、VideoPhy-2ベンチマークは一貫して改善されている。
- 参考スコア(独自算出の注目度): 34.53788048190625
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While modern video diffusion models excel in visual fidelity, maintaining long-range physical consistency remains a formidable challenge. Conventional pixel-reconstruction objectives mainly focus on appearance details and often fail to capture the underlying dynamics of a scene. To mitigate this, recent efforts have integrated auxiliary modalities (e.g., optical flow) to introduce physics priors via joint training with video appearance. However, these methods have three main limitations: (1) they do not distinguish the different motion patterns of different entity types; (2) joint modeling of visual and auxiliary modalities can cause capacity conflicts and weaken the pretrained visual prior; and (3) auxiliary modalities may accumulate errors during inference. To address these issues, we propose \textbf{VPT}, a fine-tuning framework for improving physical consistency in video diffusion models. VPT introduces a role-aware signal that groups entities into agents, controlled objects, passive objects, and background, so that different physical roles can be modeled more clearly. We further propose a modality-decoupled denoising strategy, where the visual and auxiliary channels are assigned independent noise levels. Together with a loss-weight decay strategy, this design makes auxiliary modalities serve as soft constraints rather than strong dependencies, mitigating recursive prediction errors during inference. We also introduce cross-step auto-guidance to further strengthen physical dynamics. Experiments show that VPT improves physical consistency while preserving visual quality, achieving relative gains of 39.4\% in SA and 17.9\% in PC on VideoPhy benchmark over Wan2.1-T2V-1.3B, and consistent improvements on VideoPhy-2 benchmark. The project page is available at https://tom-zgt.github.io/VPT.
- Abstract(参考訳): 現代のビデオ拡散モデルは、視覚的忠実さに優れていますが、長距離の物理的一貫性を維持することは、非常に難しい課題です。
従来の画素再構成の目的は主に外観の詳細に焦点を当てており、しばしばシーンの基盤となるダイナミクスを捉えることに失敗する。
これを緩和するために、近年の取り組みは、映像の外観を伴う共同トレーニングを通じて物理の先入観を導入するための補助的なモーダルティ(例えば、光の流れ)を統合している。
しかし,これらの手法には,(1)異なる実体の異なる動作パターンを区別しない,(2)視覚的・補助的モダリティの結合モデリングがキャパシティ・コンフリクトを引き起こし,事前訓練された視覚的事前を弱める,(3)補助的モダリティが推論中にエラーを蓄積する,という3つの主な制限がある。
これらの問題に対処するため,ビデオ拡散モデルの物理的整合性を改善するための微調整フレームワークである \textbf{VPT} を提案する。
VPTは、エージェント、制御されたオブジェクト、受動的オブジェクト、バックグラウンドにエンティティをグループ化するロール認識シグナルを導入し、異なる物理ロールをより明確にモデル化することができる。
さらに、視覚的および補助的なチャネルに独立したノイズレベルを割り当てるモーダリティ分離型デノナイジング戦略を提案する。
損失重み付けの崩壊戦略とともに、この設計は、補助的なモダリティを強い依存よりもソフトな制約として機能させ、推論中に再帰的な予測誤差を緩和する。
また、物理力学をさらに強化するために、クロスステップ自動誘導を導入する。
実験の結果、VPTは視覚的品質を維持しながら物理的な一貫性を改善し、Wan2.1-T2V-1.3B上のビデオPhyベンチマークでSAが39.4\%、PCが17.9\%、ビデオPhy-2ベンチマークが一貫して改善されている。
プロジェクトページはhttps://tom-zgt.github.io/VPT.comで公開されている。
関連論文リスト
- CausalGS: Learning Physical Causality of 3D Dynamic Scenes with Gaussian Representations [0.3580891736370874]
CausalGSは、複雑なダイナミックな3Dシーンの因果ダイナミクスをマルチビュービデオから学習するフレームワークである。
我々の研究は、人間のアノテーションがなければ、モデルは複数の物理的性質の間の複雑な相互作用を学習できることを示している。
論文 参考訳(メタデータ) (2026-05-11T13:59:01Z) - PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling [55.72785604682579]
MMPhysVideoは、共同マルチモーダルモデリングにおけるビデオ生成における物理的可視性を拡大するフレームワークである。
MMPhysVideoは、様々なベンチマークで高度なモデルよりも、物理的な可視性と視覚的品質を一貫して改善している。
論文 参考訳(メタデータ) (2026-04-03T07:32:24Z) - SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation [50.792027578906804]
本稿では,高調波とコヒーレントなアニメーションを実現するR2V(Image-to-Video)パラダイムベースのフレームワークであるSteadyDancerを紹介する。
実験により,SteadyDancerは外観の忠実さとモーションコントロールの両方において最先端の性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-11-24T17:15:55Z) - PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection [10.498184571108995]
本稿では,ビデオ生成における物理一貫性をモデリング,評価,最適化するための統合フレームワークであるPhysCorrを提案する。
具体的には、物体内安定性と物体間相互作用の両方を定量化する最初の2次元報酬モデルである物理RMを紹介する。
我々のアプローチは、モデルに依存しないスケーラブルで、幅広いビデオ拡散とトランスフォーマーベースのバックボーンへのシームレスな統合を可能にする。
論文 参考訳(メタデータ) (2025-11-06T02:40:57Z) - StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing [63.72095377128904]
視覚的ダビングタスクは、運転音声と同期した口の動きを生成することを目的としている。
音声のみの運転パラダイムは、話者固有の唇習慣を不十分に捉えている。
Blind-inpaintingアプローチは、障害を処理する際に視覚的なアーティファクトを生成する。
論文 参考訳(メタデータ) (2025-09-26T05:23:31Z) - MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings [75.0617088717528]
MoCaは、トレーニング済みのVLMバックボーンを効果的な双方向埋め込みモデルに変換するためのフレームワークである。
MoCaは、MMEBとViDoRe-v2ベンチマークのパフォーマンスを継続的に改善し、新しい最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-06-29T06:41:00Z) - Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning [53.33388279933842]
本稿では,映像生成における物理的一貫性を実現するために,記号的推論と強化学習を統合することを提案する。
そこで我々は,Phys-ARフレームワークを提案する。第1段階は教師付き微調整を用いて記号的知識を伝達し,第2段階はモデルの推論能力の最適化に強化学習を適用する。
提案手法により,生成したビデオの物理的特性を動的に調整し,改善し,物理法則の遵守を確保することができる。
論文 参考訳(メタデータ) (2025-04-22T14:20:59Z) - Boosting Visual Recognition in Real-world Degradations via Unsupervised Feature Enhancement Module with Deep Channel Prior [22.323789227447755]
霧、低照度、動きのぼかしは画像の品質を低下させ、自動運転の安全性を脅かす。
本研究は、劣化した視覚認識のための新しいDeep Channel Prior (DCP)を提案する。
これに基づいて、教師なし特徴補正を実現するために、新しいプラグアンドプレイunsupervised Feature Enhancement Module (UFEM)を提案する。
論文 参考訳(メタデータ) (2024-04-02T07:16:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。