論文の概要: $Δ$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos
- arxiv url: http://arxiv.org/abs/2605.20576v1
- Date: Wed, 20 May 2026 00:23:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.416529
- Title: $Δ$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos
- Title(参考訳): Δ$ynamics:ビデオから剛体ダイナミクスを推論するための言語ベース表現
- Authors: Chia-Hsiang Kao, Cong Phuoc Huynh, Chien-Yi Wang, Noranart Vesdapunt, Stefan Stojanov, Bharath Hariharan, Oleksandr Obiednikov, Ning Zhou,
- Abstract要約: 剛体力学の統一表現として言語を用いる視覚言語フレームワークである$YNAMICSを紹介した。
CLEVRERデータセットでは、$YNAMICS a segmentation IoUが0.30で、トップのVLMよりも7倍改善されている。
実世界235の剛体ビデオの新しいデータセットへの強力な転送を実証する。
- 参考スコア(独自算出の注目度): 46.834782054607125
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Inferring rigid-body physical states and properties from monocular videos is a fundamental step toward physics-based perception and simulation. Existing approaches assume specific underlying physical systems, object types, and camera poses, making them unable to generalize to complex real-world settings. We introduce $Δ$YNAMICS, a vision-language framework that uses language as a unified representation of rigid-body dynamics. Instead of directly predicting parameters, $Δ$YNAMICS generates scene configurations in a structured text format for physics simulation. We enhance the model's generalization by integrating natural language motion reasoning and leveraging optical flow as a semantic-agnostic input. On the CLEVRER dataset, $Δ$YNAMICS achieves a segmentation IoU of 0.30, a 7x improvement over leading VLMs (InternVL3-8B, Qwen2.5-VL-7B and Claude-4-Sonnet). Additionally, test-time sampling and evolutionary search further boost performance by 27% and 120% in segmentation IoU, respectively. Finally, we demonstrate strong transfer to a new dataset of 235 real-world rigid-body videos, highlighting the potential of language-driven physics inference for bridging perception and simulation.
- Abstract(参考訳): 単眼ビデオから剛体物理状態と特性を推定することは、物理に基づく知覚とシミュレーションに向けた基本的なステップである。
既存のアプローチでは、特定の物理システム、オブジェクトタイプ、カメラのポーズを前提としており、複雑な現実世界の設定に一般化できない。
剛体力学の統一表現として言語を用いる視覚言語フレームワークである$Δ$YNAMICSを紹介する。
パラメータを直接予測する代わりに、$Δ$YNAMICSは物理シミュレーションのための構造化テキスト形式でシーン構成を生成する。
我々は、自然言語の動作推論を統合し、光学フローを意味論的入力として活用することにより、モデルの一般化を強化する。
CLEVRERデータセットでは、$Δ$YNAMICSが0.30のセグメンテーションIoUを実現し、主要なVLM(InternVL3-8B、Qwen2.5-VL-7B、Claude-4-Sonnet)よりも7倍改善されている。
さらに、試験時間サンプリングと進化探索により、それぞれセグメンテーションIoUの27%と120%の性能が向上した。
最後に、235個の実世界の剛体ビデオのデータセットに強く移行し、ブリッジング知覚とシミュレーションのための言語駆動の物理推論の可能性を強調した。
関連論文リスト
- PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling [55.72785604682579]
MMPhysVideoは、共同マルチモーダルモデリングにおけるビデオ生成における物理的可視性を拡大するフレームワークである。
MMPhysVideoは、様々なベンチマークで高度なモデルよりも、物理的な可視性と視覚的品質を一貫して改善している。
論文 参考訳(メタデータ) (2026-04-03T07:32:24Z) - PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection [10.498184571108995]
本稿では,ビデオ生成における物理一貫性をモデリング,評価,最適化するための統合フレームワークであるPhysCorrを提案する。
具体的には、物体内安定性と物体間相互作用の両方を定量化する最初の2次元報酬モデルである物理RMを紹介する。
我々のアプローチは、モデルに依存しないスケーラブルで、幅広いビデオ拡散とトランスフォーマーベースのバックボーンへのシームレスな統合を可能にする。
論文 参考訳(メタデータ) (2025-11-06T02:40:57Z) - Think Before You Diffuse: Infusing Physical Rules into Video Diffusion [55.046699347579455]
実世界の動き、相互作用、ダイナミクスの複雑さは、データから物理を学ぶ際に大きな困難をもたらす。
DiffPhyは、トレーニング済みの動画拡散モデルを微調整することで、物理的に正確でリアルな映像生成を可能にする汎用的なフレームワークである。
論文 参考訳(メタデータ) (2025-05-27T18:26:43Z) - Dynamic Visual Reasoning by Learning Differentiable Physics Models from
Video and Language [92.7638697243969]
視覚概念を協調的に学習し,映像や言語から物体の物理モデルを推定する統合フレームワークを提案する。
これは視覚認識モジュール、概念学習モジュール、微分可能な物理エンジンの3つのコンポーネントをシームレスに統合することで実現される。
論文 参考訳(メタデータ) (2021-10-28T17:59:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。