論文の概要: Learning Explicit Physical Parameter Control and Benchmarking for Video Generation
- arxiv url: http://arxiv.org/abs/2607.18924v1
- Date: Tue, 21 Jul 2026 10:06:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.389764
- Title: Learning Explicit Physical Parameter Control and Benchmarking for Video Generation
- Title(参考訳): 映像生成のための物理パラメータ制御とベンチマークの学習
- Authors: Yanxun Li, Hao Wen, Bingze Song, Jiashu Zhu, Aiming Hao, Chubin Chen, Jintao Chen, Jiahong Wu, Xiangxiang Chu, Miao Wang,
- Abstract要約: 本稿では,物体レベルの力,質量,摩擦,再生,シーンレベルの重力を条件とした物理誘導映像拡散モデルPhyParamを提案する。
また、PhyParam-Benchは、画像とビデオの生成における物理法則の整合性を示すベンチマークである。
- 参考スコア(独自算出の注目度): 21.331326205371628
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in image-to-video generation have improved visual realism, making physically grounded and controllable dynamics an important step toward future world simulation. Current models often generate plausible motion, but it is not reliably governed by explicit physical causes, and instance-level constraints can leak or become entangled in multi-object interactions. We attribute this gap to two missing pieces: large-scale, fine-grained physical parameterization, and model designs that correctly bind physical attributes to instances and emphasize dynamics over appearance. To bridge this gap, we introduce PhyParam-Dataset, an interaction-centric collection of 130K physically simulated videos with dense physical parameterization, including force vectors, object material properties, and environmental constants across five representative rigid-body motion types. Built on this data, we present PhyParam, a physics-guided image-to-video diffusion model that conditions on object-level forces, masses, friction, restitution, and scene-level gravity via a lightweight physical-attention routing mechanism, and further improves motion learning with semantic-structural feature-space supervision. We also establish PhyParam-Bench, a benchmark for physical-law consistency in image-to-video generation, with a multi-level protocol evaluating temporal dynamics, spatial stability, and semantic--physical alignment. Experiments show that PhyParam improves physical consistency while maintaining high visual fidelity, advancing explicit rigid-body physical-parameter control for image-to-video generation. We will publicly release the dataset, benchmark, and code to support future research.
- Abstract(参考訳): 近年の映像・映像生成の進歩により視覚リアリズムが向上し、物理的基盤と制御可能なダイナミクスが将来の世界シミュレーションへの重要な一歩となった。
現在のモデルは、しばしば可塑性運動を生成するが、それは明示的な物理的原因によって確実に支配されておらず、インスタンスレベルの制約は、多目的相互作用において漏れたり絡み合うことがある。
このギャップは、大規模できめ細かな物理パラメータ化と、物理的属性をインスタンスに正しく結合し、外観上のダイナミクスを強調するモデル設計という2つの欠落点に起因している。
このギャップを埋めるために、PhyParam-Datasetは、力ベクトル、物体材料特性、環境定数を含む高密度な物理パラメータ化を備えた130Kの物理シミュレーションビデオのインタラクション中心のコレクションである。
このデータに基づいてPhyParamを提案する。PhyParamは、物体レベルの力、質量、摩擦、再生、シーンレベルの重力の条件を軽量な物理的アテンションルーティング機構を通じて記述する物理誘導画像拡散モデルであり、意味構造的特徴空間の監視による運動学習をさらに改善する。
また、時間的ダイナミクス、空間的安定性、意味的物理的アライメントを評価するマルチレベルプロトコルを用いて、画像とビデオ生成における物理法則一貫性のベンチマークであるPhyParam-Benchを構築した。
実験により、PhyParamは高視力を維持しながら物理的整合性を向上し、画像対ビデオ生成のための明示的な剛体物理パラメータ制御を推し進めた。
将来の研究をサポートするために、データセット、ベンチマーク、コードを公開します。
関連論文リスト
- PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation [68.13035350819901]
PhysAgentは物理プログラム生成、物理シミュレーション、ステージ固有の検証、ターゲットプログラム修復のループを閉じるフレームワークである。
我々のフレームワークは、より物理的に妥当なビデオを生成し、より優れたプロンプトアライメントを実現し、多様な物理的シナリオにわたってより効果的に一般化する。
論文 参考訳(メタデータ) (2026-07-17T08:55:09Z) - MPMWorlds: Material-Point-Method Simulations for Inferring and Extrapolating Physical Dynamics [16.350165647919464]
変形可能な物体,流体,運動物体,エミッタなどのリッチな物理現象をカバーする2次元材料ポイント法 (MPM) の物理シミュレーションデータセットを組み立てる。
このデータセット上でのコード生成とビデオ拡散のアプローチについて検討し、物理的に関係する側情報の量を変化させることで、その強みと弱みを識別する。
コード生成モデルは、MPMシミュレーションの自動合成の動作デモ以上のもので、このようなアプローチは視覚的入力から物理パラメータを推測するのに苦労するが、ビデオ拡散とは対照的に、時間とともに物理的および時間的に安定した外挿を生成する。
論文 参考訳(メタデータ) (2026-06-01T01:36:44Z) - PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics [12.143531149918674]
本稿では,視覚的内容と潜伏する物理力学を共同でモデル化する物理拡散ビデオ生成モデルを提案する。
観測されたビデオフレームと推論された物理状態に基づいて、Phantomは遅延物理的ダイナミクスを共同で予測し、将来のビデオフレームを生成する。
物理認識ビデオ表現の推論を直接ビデオ生成プロセスに統合することにより、Phantomは視覚的にリアルかつ物理的に一貫性のあるビデオシーケンスを生成する。
論文 参考訳(メタデータ) (2026-04-09T17:48:46Z) - MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling [55.72785604682579]
MMPhysVideoは、共同マルチモーダルモデリングにおけるビデオ生成における物理的可視性を拡大するフレームワークである。
MMPhysVideoは、様々なベンチマークで高度なモデルよりも、物理的な可視性と視覚的品質を一貫して改善している。
論文 参考訳(メタデータ) (2026-04-03T07:32:24Z) - PhysAlign: Physics-Coherent Image-to-Video Generation through Feature and 3D Representation Alignment [23.066204478030627]
ビデオモデル(VDM)は、動的なシーンや環境をシミュレートするための有望なアプローチを提供する。
既存のモデルは、しばしば基本的な物理的直観に反する時間的に一貫性のないコンテンツを生成する。
物理コヒーレントな画像対ビデオI(2V)生成のための効率的なフレームワークであるPhysAlignを提案する。
論文 参考訳(メタデータ) (2026-03-14T05:44:18Z) - PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models [100.65199317765608]
物理原理は現実的な視覚シミュレーションには基本的だが、トランスフォーマーベースのビデオ生成において重要な監視対象である。
本研究では,物理衝突ルールを高次元空間に直接適用した映像生成モデルのための物理認識強化学習パラダイムを提案する。
このパラダイムを、MDcycle(Mimicry-Discovery Cycle)と呼ばれる統合フレームワークに拡張することで、大幅な微調整を可能にします。
論文 参考訳(メタデータ) (2026-01-16T08:40:10Z) - ProPhy: Progressive Physical Alignment for Dynamic World Simulation [55.456455952212416]
ProPhyは、明示的な物理認識条件付けと異方性生成を可能にするプログレッシブ物理アライメントフレームワークである。
ProPhyは既存の最先端手法よりもリアルでダイナミックで物理的に一貫性のある結果が得られることを示す。
論文 参考訳(メタデータ) (2025-12-05T09:39:26Z) - PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding [50.454084539837005]
PhysChoreoは、単一の画像から多様な制御性と物理的なリアリズムを持つビデオを生成する新しいフレームワークである。
本手法は2つの段階から構成される: まず, 画像中の全ての物体の静的初期特性を, 部分認識の物理的特性再構成により推定する。
そして、時間的に指示され、物理的に編集可能なシミュレーションを通じて、リッチな動的な振る舞いと物理的なリアリズムで高品質な動画を合成する。
論文 参考訳(メタデータ) (2025-11-25T17:59:04Z) - PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection [10.498184571108995]
本稿では,ビデオ生成における物理一貫性をモデリング,評価,最適化するための統合フレームワークであるPhysCorrを提案する。
具体的には、物体内安定性と物体間相互作用の両方を定量化する最初の2次元報酬モデルである物理RMを紹介する。
我々のアプローチは、モデルに依存しないスケーラブルで、幅広いビデオ拡散とトランスフォーマーベースのバックボーンへのシームレスな統合を可能にする。
論文 参考訳(メタデータ) (2025-11-06T02:40:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。