論文の概要: PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning
- arxiv url: http://arxiv.org/abs/2608.04575v1
- Date: Wed, 05 Aug 2026 08:05:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.784416
- Title: PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning
- Title(参考訳): PhysMind: トレーニング不要な物理推論のためのビデオから実行可能な世界へ
- Authors: Chen Yang, Shenxiang Zeng, Haoyang Zhao, Zhouyuan Xu, Youquan He, Haoyu Li, Mingyi Deng, Jiansheng Fan, Chen Wang,
- Abstract要約: PhysMindは、ビデオごとに再利用可能な1つの問題に依存しない実行可能世界を構築する、トレーニング不要なエージェントフレームワークである。
質問が与えられたら、世界と結果の軌跡と相互作用から答えを検査、継続、または編集する。
同じVLMによる直接連鎖(CoT)推論とは対照的に、PhysMindはCLEVRERの38.23ポイント、PhysMindの8.08ポイントの精度を向上させる。
- 参考スコア(独自算出の注目度): 13.157016597881006
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable physical reasoning from video requires understanding how objects move, interact, and respond to interventions. Existing vision-language models (VLMs) often struggle to interpret these dynamics and reason reliably about future and counterfactual outcomes. We introduce PhysMind, a training-free agentic framework that constructs one reusable, question-agnostic executable world per video. PhysMind recovers a temporally consistent dynamic scene through object segmentation, mesh reconstruction, and 6D pose tracking, then fits analytic continuous-time dynamics and latent physical parameters without unrolling a time-stepped simulator. Given a question, it inspects, continues, or edits the world and answers from the resulting trajectories and interactions. Relative to direct chain-of-thought (CoT) reasoning with the same VLM, PhysMind improves accuracy by 38.23 points on CLEVRER and 8.08 points on Physion++. On counterfactual questions, it exceeds the strongest evaluated VLM baseline, GPT-5.5, by 19.25 points.
- Abstract(参考訳): ビデオからの信頼性の高い物理的推論は、オブジェクトの動作、相互作用、介入への対応を理解する必要がある。
既存の視覚言語モデル(VLM)は、しばしばこれらのダイナミクスを解釈し、将来と反現実的な結果について確実に推論するのに苦労する。
PhysMindは、ビデオごとに再利用可能な1つの問題に依存しない実行可能世界を構築する、トレーニング不要なエージェントフレームワークである。
PhysMindはオブジェクトセグメンテーション、メッシュ再構成、および6Dポーズトラッキングを通じて時間的に一貫した動的シーンを復元し、時間ステップシミュレータをアンロールすることなく解析的連続時間ダイナミクスと遅延物理パラメータに適合する。
質問が与えられたら、世界と結果の軌跡と相互作用から答えを検査、継続、または編集する。
同じVLMによる直接連鎖(CoT)推論とは対照的に、PhysMindはCLEVRERの38.23ポイント、PhysMindの8.08ポイントの精度を向上させる。
逆問題では、最強評価のVLMベースラインであるGPT-5.5を19.25ポイント上回る。
関連論文リスト
- PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation [68.13035350819901]
PhysAgentは物理プログラム生成、物理シミュレーション、ステージ固有の検証、ターゲットプログラム修復のループを閉じるフレームワークである。
我々のフレームワークは、より物理的に妥当なビデオを生成し、より優れたプロンプトアライメントを実現し、多様な物理的シナリオにわたってより効果的に一般化する。
論文 参考訳(メタデータ) (2026-07-17T08:55:09Z) - PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning [10.8081248403127]
ビデオ言語モデル(VLM)は,映像理解と視覚的質問応答において優れた性能を発揮している。
トレーニング不要な物理メモリと検証フレームワークであるPhysMRVを提案する。
論文 参考訳(メタデータ) (2026-07-11T08:06:04Z) - PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - PhysAlign: Physics-Coherent Image-to-Video Generation through Feature and 3D Representation Alignment [23.066204478030627]
ビデオモデル(VDM)は、動的なシーンや環境をシミュレートするための有望なアプローチを提供する。
既存のモデルは、しばしば基本的な物理的直観に反する時間的に一貫性のないコンテンツを生成する。
物理コヒーレントな画像対ビデオI(2V)生成のための効率的なフレームワークであるPhysAlignを提案する。
論文 参考訳(メタデータ) (2026-03-14T05:44:18Z) - Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video Diffusion [43.09536633299663]
ビデオ拡散モデルから物理に一貫性のある4次元世界表現を学習するためのパイプラインである textbfPhys4D を提案する。
まず、大規模擬似教師付き事前学習により、ロバストな幾何学と動きの表現を行う。
次に、シミュレーションブートストラップ生成データを用いて物理地上教師あり微調整を行い、時間的に一貫した4次元ダイナミクスを強制する。
論文 参考訳(メタデータ) (2026-03-03T20:01:43Z) - PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models [40.16417939211015]
MLLM(Multimodal Large Language Models)やビデオワールドモデルは、数学的、常識的、視覚的推論において大きく進歩している。
この問題を計測しようとする既存のベンチマークは、合成された視覚的質問応答テンプレート、あるいは物理的な法則によってビデオがどれだけうまく機能するかを測定するための知覚的ビデオ品質に焦点を当てている。
我々は,3つの標準原理(Center of Mass, Lever Equilibrium, Newton's First Law)について,法に一貫性のある推論と生成を評価する統一ベンチマークであるPhysicalMindを紹介する。
論文 参考訳(メタデータ) (2026-01-22T14:33:01Z) - PhysWorld: From Real Videos to World Models of Deformable Objects via Physics-Aware Demonstration Synthesis [52.905353023326306]
物理的に妥当で多様な実演を合成し、効率的な世界モデルを学ぶためのフレームワークであるPhysWorldを提案する。
実験により、PhysWorldは、最新の最先端手法、すなわちPhysTwinよりも47倍高速な推論速度を実現しつつ、競争性能を持つことが示された。
論文 参考訳(メタデータ) (2025-10-24T13:25:39Z) - LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference [57.086932851733145]
ビデオ拡散モデルにおける直感的な物理を評価するトレーニング不要な方法であるLikePhysを紹介した。
現在のビデオ拡散モデルにおける直観的物理理解のベンチマークを行う。
経験的結果は、現在のモデルが複雑でカオス的な力学に苦しむにもかかわらず、モデルキャパシティと推論設定スケールとしての物理理解の改善傾向が明らかであることを示している。
論文 参考訳(メタデータ) (2025-10-13T15:19:07Z) - DreamPhysics: Learning Physics-Based 3D Dynamics with Video Diffusion Priors [75.83647027123119]
本稿では,映像拡散前の物体の物理的特性を学習することを提案する。
次に,物理に基づくMaterial-Point-Methodシミュレータを用いて,現実的な動きを伴う4Dコンテンツを生成する。
論文 参考訳(メタデータ) (2024-06-03T16:05:25Z) - Dynamic Visual Reasoning by Learning Differentiable Physics Models from
Video and Language [92.7638697243969]
視覚概念を協調的に学習し,映像や言語から物体の物理モデルを推定する統合フレームワークを提案する。
これは視覚認識モジュール、概念学習モジュール、微分可能な物理エンジンの3つのコンポーネントをシームレスに統合することで実現される。
論文 参考訳(メタデータ) (2021-10-28T17:59:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。