論文の概要: DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking
- arxiv url: http://arxiv.org/abs/2607.18664v1
- Date: Tue, 21 Jul 2026 03:23:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.30152
- Title: DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking
- Title(参考訳): DeforM:時空間マスキングによる物理誘導型ビデオ生成
- Abstract要約: ビデオ生成モデルは高画質を実現するが、物理を意識したビデオを生成するのに苦労することが多い。
本稿では,物理臨界領域に焦点をあてる推論誘導映像生成フレームワークDeforMを提案する。
トレーニング不要なメカニズム解析のためのDeforM-Freeと、強力なトレーニングベースジェネレータとしてのDeforM-Injectionの2つの方法を開発した。
- 参考スコア(独自算出の注目度): 46.68389408723078
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video generation models achieve high visual quality but often struggle to generate physics-aware videos. Unlike rigid-body motion, which can be described by explicit trajectories or formulas, complex deformation dynamics remain challenging to synthesize. We observe that a lack of physical reasoning for localizing dynamic areas allows irrelevant regions to dilute the model's attention, leading to generation failure. In this paper, we propose DeforM, a reasoning-guided image-to-video generation framework that directs the model's focus toward physics-critical regions. To reason about and localize these critical regions, we introduce a VLM-guided physical reasoning module, DeforM-Reason, to identify target objects and generate spatial-temporal masks. For physical guidance, we develop two alternative strategies: DeforM-Free for training-free mechanism analysis and DeforM-Injection as a powerful training-based generator. Experimental results demonstrate that DeforM improves the realism of generated deformation scenarios, outperforming baseline models in both visual quality and physical consistency.
- Abstract(参考訳): ビデオ生成モデルは高画質を実現するが、物理を意識したビデオを生成するのに苦労することが多い。
明示的な軌跡や公式によって記述できる剛体運動とは異なり、複雑な変形力学は合成が困難である。
動的領域の局所化のための物理的推論の欠如は、関係のない領域がモデルの注意を減らし、生成障害を引き起こすことを観察する。
本稿では,物理クリティカル領域に着目した推論誘導映像生成フレームワークDeforMを提案する。
これらの臨界領域の推論とローカライズのために,VLM誘導物理推論モジュールであるDeforM-Reasonを導入し,対象対象を識別し,時空間マスクを生成する。
トレーニング不要なメカニズム解析のためのDeforM-Freeと、強力なトレーニングベースジェネレータとしてのDeforM-Injectionの2つの方法を開発した。
実験により,DeforMは生成した変形シナリオの現実性を改善し,視覚的品質と物理的整合性の両方においてベースラインモデルより優れていることが示された。
関連論文リスト
- PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models [100.65199317765608]
物理原理は現実的な視覚シミュレーションには基本的だが、トランスフォーマーベースのビデオ生成において重要な監視対象である。
本研究では,物理衝突ルールを高次元空間に直接適用した映像生成モデルのための物理認識強化学習パラダイムを提案する。
このパラダイムを、MDcycle(Mimicry-Discovery Cycle)と呼ばれる統合フレームワークに拡張することで、大幅な微調整を可能にします。
論文 参考訳(メタデータ) (2026-01-16T08:40:10Z) - ProPhy: Progressive Physical Alignment for Dynamic World Simulation [55.456455952212416]
ProPhyは、明示的な物理認識条件付けと異方性生成を可能にするプログレッシブ物理アライメントフレームワークである。
ProPhyは既存の最先端手法よりもリアルでダイナミックで物理的に一貫性のある結果が得られることを示す。
論文 参考訳(メタデータ) (2025-12-05T09:39:26Z) - PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement [45.990473754456104]
ビデオ大言語モデル (Video Large Language Models, ビデオLLM) は、幅広いビデオ言語タスクにおいて印象的なパフォーマンスを示している。
本稿では,物理動作をビデオLLMに明示的に組み込む物理誘導型ビデオ言語フレームワークであるPhyVLLMを提案する。
本稿では,PhyVLLMが物理推論と一般的なビデオ理解の両タスクにおいて,最先端のビデオLLMを著しく上回っていることを示す。
論文 参考訳(メタデータ) (2025-12-04T07:28:56Z) - PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection [10.498184571108995]
本稿では,ビデオ生成における物理一貫性をモデリング,評価,最適化するための統合フレームワークであるPhysCorrを提案する。
具体的には、物体内安定性と物体間相互作用の両方を定量化する最初の2次元報酬モデルである物理RMを紹介する。
我々のアプローチは、モデルに依存しないスケーラブルで、幅広いビデオ拡散とトランスフォーマーベースのバックボーンへのシームレスな統合を可能にする。
論文 参考訳(メタデータ) (2025-11-06T02:40:57Z) - Physics-Grounded Motion Forecasting via Equation Discovery for Trajectory-Guided Image-to-Video Generation [54.42523027597904]
物理グラウンド映像予測のためのシンボル回帰と軌跡誘導映像(I2V)モデルを統合する新しいフレームワークを提案する。
提案手法は,入力ビデオから運動軌跡を抽出し,検索に基づく事前学習機構を用いて記号回帰を向上し,運動方程式を発見し,物理的に正確な将来の軌跡を予測する。
論文 参考訳(メタデータ) (2025-07-09T13:28:42Z) - PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM [17.554471769834453]
一つの画像から物理的に一貫した動きを生成するトレーニング不要のフレームワークであるPhyMAGICを提案する。
PhyMAGICは、事前訓練された画像間拡散モデル、LDMによる信頼誘導推論、微分可能な物理シミュレータを統合する。
総合的な実験により、PhyMAGICは最先端のビデオジェネレータや物理対応のベースラインより優れていることが示された。
論文 参考訳(メタデータ) (2025-05-22T09:40:34Z) - VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical Prior [88.51778468222766]
近年,映像拡散モデル (VDM) が大幅に進歩し,映像のリアル化が進んでいる。
VDMは物理の理解の欠如のため、物理的にもっともらしいビデオを作ることができないことが多い。
本稿では,物理を視覚と言語に明示的に組み込んだ新しい2段階画像・映像生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-30T09:03:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。