論文の概要: PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation
- arxiv url: http://arxiv.org/abs/2607.16355v1
- Date: Fri, 17 Jul 2026 08:55:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.129449
- Title: PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation
- Title(参考訳): PhysAgent:物理可塑性ビデオ生成のための反射型エージェント物理制御
- Authors: Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai,
- Abstract要約: PhysAgentは物理プログラム生成、物理シミュレーション、ステージ固有の検証、ターゲットプログラム修復のループを閉じるフレームワークである。
我々のフレームワークは、より物理的に妥当なビデオを生成し、より優れたプロンプトアライメントを実現し、多様な物理的シナリオにわたってより効果的に一般化する。
- 参考スコア(独自算出の注目度): 68.13035350819901
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in physics-grounded video generation leverage physics simulation as a physical prior to guide video synthesis toward physically plausible outcomes. The simulation process is controlled by physical specifications, which are typically generated by a vision-language model in a single pass. Such one-shot prediction often fails to accurately translate user intent into executable simulations, particularly for fine-grained object dynamics, complex motion trajectories, and temporally structured interactions. In this paper, we propose PhysAgent, a reflective agentic framework that closes the loop among physical program generation, physics simulation, stage-specific verification, and targeted program repair. Beyond improving the control of coupled physical parameters, our framework enables the agent to progressively realize complex trajectories, multi-stage interactions, and precise event outcomes by treating each physical program as an executable hypothesis. In addition, we design a set of physics-control APIs to support more stable and complex motion behaviors. Extensive experiments demonstrate that PhysAgent produces more physically plausible videos, achieves better prompt alignment, and generalizes more effectively across diverse physical scenarios.
- Abstract(参考訳): 物理地上ビデオ生成の最近の進歩は、物理シミュレーションを物理シミュレーションとして活用し、物理的に妥当な結果に向けてビデオ合成を誘導している。
シミュレーションプロセスは物理的仕様によって制御され、通常は視覚言語モデルによって単一のパスで生成される。
このようなワンショット予測は、ユーザー意図を正確に実行可能シミュレーションに変換することに失敗することが多く、特に細粒度オブジェクトのダイナミクス、複雑な運動軌跡、時間的に構造化された相互作用についてである。
本稿では,物理プログラム生成,物理シミュレーション,ステージ固有検証,ターゲットプログラム修復のループを閉じる反射型エージェントフレームワークであるPhysAgentを提案する。
本フレームワークは,結合された物理パラメータの制御の改善に加えて,各物理プログラムを実行可能な仮説として扱うことにより,複雑な軌跡,多段階相互作用,正確な事象結果の段階的実現を可能にする。
さらに,より安定かつ複雑な動作動作をサポートする物理制御APIを設計する。
大規模な実験により、PhysAgentはより物理的にプラウティブルなビデオを生成し、より優れたプロンプトアライメントを実現し、多様な物理的シナリオにわたってより効果的に一般化することを示した。
関連論文リスト
- Coding Agent Is Good As World Simulator [5.161736405778465]
本稿では,物理に基づく世界モデル構築のためのエージェントフレームワークを提案する。
このフレームワークは、計画、コード生成、ビジュアルレビュー、物理分析エージェントを調整する。
実験の結果,本フレームワークは,物理精度,命令忠実度,視覚的品質において,高度な映像ベースモデルよりも優れていた。
論文 参考訳(メタデータ) (2026-05-14T05:33:41Z) - PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models [100.65199317765608]
物理原理は現実的な視覚シミュレーションには基本的だが、トランスフォーマーベースのビデオ生成において重要な監視対象である。
本研究では,物理衝突ルールを高次元空間に直接適用した映像生成モデルのための物理認識強化学習パラダイムを提案する。
このパラダイムを、MDcycle(Mimicry-Discovery Cycle)と呼ばれる統合フレームワークに拡張することで、大幅な微調整を可能にします。
論文 参考訳(メタデータ) (2026-01-16T08:40:10Z) - ProPhy: Progressive Physical Alignment for Dynamic World Simulation [55.456455952212416]
ProPhyは、明示的な物理認識条件付けと異方性生成を可能にするプログレッシブ物理アライメントフレームワークである。
ProPhyは既存の最先端手法よりもリアルでダイナミックで物理的に一貫性のある結果が得られることを示す。
論文 参考訳(メタデータ) (2025-12-05T09:39:26Z) - PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding [50.454084539837005]
PhysChoreoは、単一の画像から多様な制御性と物理的なリアリズムを持つビデオを生成する新しいフレームワークである。
本手法は2つの段階から構成される: まず, 画像中の全ての物体の静的初期特性を, 部分認識の物理的特性再構成により推定する。
そして、時間的に指示され、物理的に編集可能なシミュレーションを通じて、リッチな動的な振る舞いと物理的なリアリズムで高品質な動画を合成する。
論文 参考訳(メタデータ) (2025-11-25T17:59:04Z) - PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection [10.498184571108995]
本稿では,ビデオ生成における物理一貫性をモデリング,評価,最適化するための統合フレームワークであるPhysCorrを提案する。
具体的には、物体内安定性と物体間相互作用の両方を定量化する最初の2次元報酬モデルである物理RMを紹介する。
我々のアプローチは、モデルに依存しないスケーラブルで、幅広いビデオ拡散とトランスフォーマーベースのバックボーンへのシームレスな統合を可能にする。
論文 参考訳(メタデータ) (2025-11-06T02:40:57Z) - PhysWorld: From Real Videos to World Models of Deformable Objects via Physics-Aware Demonstration Synthesis [52.905353023326306]
物理的に妥当で多様な実演を合成し、効率的な世界モデルを学ぶためのフレームワークであるPhysWorldを提案する。
実験により、PhysWorldは、最新の最先端手法、すなわちPhysTwinよりも47倍高速な推論速度を実現しつつ、競争性能を持つことが示された。
論文 参考訳(メタデータ) (2025-10-24T13:25:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。