論文の概要: Physically Plausible Video Generation via Visual-Semantic Chain-of-Events Conditioning
- arxiv url: http://arxiv.org/abs/2609.00656v1
- Date: Tue, 01 Sep 2026 03:35:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.270629
- Title: Physically Plausible Video Generation via Visual-Semantic Chain-of-Events Conditioning
- Title(参考訳): 視覚的セマンティック・チェーン・オブ・イベント・コンディショニングによる物理的にプラズブルな映像生成
- Authors: Zixuan Wang, Yixin Hu, Wen Li, Feng Chen, Yan Liu, Duo Peng, Yinjie Lei,
- Abstract要約: 我々はPPVGを事象中心生成として再構成し、物理的進化を因果的に連結され、物理的に制約された事象の連鎖として表現する。
我々のフレームワークは、多様なドメインにまたがって優れた物理的妥当性を持つビデオを生成する。
- 参考スコア(独自算出の注目度): 48.21630532401797
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Physically Plausible Video Generation (PPVG) seeks to synthesize videos consistent with physical principles, yet remains challenging due to underspecified natural language conditioning. Advanced chain-of-thought (CoT) frameworks augment prompts with physical knowledge. However, such prompts describe physical phenomena holistically, overlooking intermediate states and transition dynamics. In this paper, we reformulate PPVG as event-centric generation by representing physical evolution as a chain of causally connected and physically constrained events. Our framework comprises three key modules: (1) Physics-driven Event Chain Reasoning. This module decomposes physical phenomena into causally connected events represented by evolving scene graphs. Formula-derived physical quantities are bound to relevant objects and interactions, characterizing the direction and magnitude of each event transition. (2) Transition-aware Routed Keyframe Conditioning. This module routes each event to a specialized keyframe synthesis operator for appearance variation or object transformation. Consecutive keyframes are injected as residual guidance during denoising, enabling smooth visual transitions between event-boundary states. (3) Physics-injected Contrastive Semantic Guidance. This module constructs physics-informed positive and counterfactual negative prompts for classifier-free guidance, steering generation toward plausible dynamics and away from physics-violating counterparts. Experiments on PhyGenBench, VideoPhy, PhyWorldBench, and Physics-IQ demonstrate that our framework generates videos with superior physical plausibility across diverse domains.
- Abstract(参考訳): 物理的にプラウシブルなビデオ生成(PPVG)は、物理原理に整合したビデオの合成を目指しているが、未特定の自然言語条件のため、依然として困難である。
高度なチェーン・オブ・シント(CoT)フレームワークは、物理的な知識によって促進される。
しかし、そのようなプロンプトは、中間状態と遷移ダイナミクスを見渡して、物理的現象をホモロジー的に記述する。
本稿では,PPVGを事象中心生成として,物理的進化を因果的に連結された,物理的に制約された事象の連鎖として表現する。
本フレームワークは,(1)物理駆動型イベント連鎖推論の3つの重要なモジュールから構成される。
このモジュールは物理現象を、進化するシーングラフで表される因果的に連結されたイベントに分解する。
フォーミュラ由来の物理的量は、関連するオブジェクトと相互作用に結びついており、各イベント遷移の方向と大きさを特徴づけている。
(2)トランジション対応ルータ型キーフレームコンディショニング
このモジュールは、各イベントを特殊キーフレーム合成演算子にルーティングし、外観の変化やオブジェクト変換を行う。
圧縮キーフレームは、デノナイズ中の残留誘導として注入され、イベント境界状態間のスムーズな視覚的遷移を可能にする。
(3)物理注入コントラスト・セマンティック・ガイダンス
このモジュールは、物理インフォームドな正および反ファクトな負のプロンプトを構築し、分類子なしのガイダンス、プラウシブルダイナミクスに対する操舵生成、物理に違反する反応から遠ざかる。
PhyGenBench、VideoPhy、PhyWorldBench、Phy-IQの実験は、我々のフレームワークが様々なドメインにまたがって優れた物理確率でビデオを生成することを示した。
関連論文リスト
- Learning Explicit Physical Parameter Control and Benchmarking for Video Generation [21.331326205371628]
本稿では,物体レベルの力,質量,摩擦,再生,シーンレベルの重力を条件とした物理誘導映像拡散モデルPhyParamを提案する。
また、PhyParam-Benchは、画像とビデオの生成における物理法則の整合性を示すベンチマークである。
論文 参考訳(メタデータ) (2026-07-21T10:06:55Z) - PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation [68.13035350819901]
PhysAgentは物理プログラム生成、物理シミュレーション、ステージ固有の検証、ターゲットプログラム修復のループを閉じるフレームワークである。
我々のフレームワークは、より物理的に妥当なビデオを生成し、より優れたプロンプトアライメントを実現し、多様な物理的シナリオにわたってより効果的に一般化する。
論文 参考訳(メタデータ) (2026-07-17T08:55:09Z) - PhysiFormer: Learning to Simulate Mechanics in World Space [56.16644631495]
物理的に表現可能な3次元物体運動のための拡散変換器であるPhysorFormerを提案する。
世界座標で表される3Dメッシュとしてオブジェクトを表す。
これは、軌道精度、剛性保存、運動量に基づく物理的一貫性において、自己回帰ベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2026-06-25T17:59:00Z) - CausalGS: Learning Physical Causality of 3D Dynamic Scenes with Gaussian Representations [0.3580891736370874]
CausalGSは、複雑なダイナミックな3Dシーンの因果ダイナミクスをマルチビュービデオから学習するフレームワークである。
我々の研究は、人間のアノテーションがなければ、モデルは複数の物理的性質の間の複雑な相互作用を学習できることを示している。
論文 参考訳(メタデータ) (2026-05-11T13:59:01Z) - PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling [55.72785604682579]
MMPhysVideoは、共同マルチモーダルモデリングにおけるビデオ生成における物理的可視性を拡大するフレームワークである。
MMPhysVideoは、様々なベンチマークで高度なモデルよりも、物理的な可視性と視覚的品質を一貫して改善している。
論文 参考訳(メタデータ) (2026-04-03T07:32:24Z) - Chain of Event-Centric Causal Thought for Physically Plausible Video Generation [41.53933387975629]
物理的に可塑性のビデオ生成(PPVG)は、現実世界の物理現象をモデル化するための有望な道として登場した。
現在のアプローチでは、物理概念をプロンプトに埋め込むために、大きな言語モデルの常識推論能力を活用している。
本稿では,PPVGが因果的に連結され,動的に進化する事象の系列を生成するとみなす。
論文 参考訳(メタデータ) (2026-03-10T02:13:51Z) - ProPhy: Progressive Physical Alignment for Dynamic World Simulation [55.456455952212416]
ProPhyは、明示的な物理認識条件付けと異方性生成を可能にするプログレッシブ物理アライメントフレームワークである。
ProPhyは既存の最先端手法よりもリアルでダイナミックで物理的に一貫性のある結果が得られることを示す。
論文 参考訳(メタデータ) (2025-12-05T09:39:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。