論文の概要: PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation
- arxiv url: http://arxiv.org/abs/2607.01938v1
- Date: Thu, 02 Jul 2026 09:32:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.771537
- Title: PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation
- Title(参考訳): PhysMani: 動的オブジェクト操作のための物理原理的3次元世界モデル
- Abstract要約: 本稿では,物理原理に基づく3次元ガウス世界モデルと将来のアクションポリシーモデルとを結合するフレームワークであるPhysManiを提案する。
16のタスクを持つ動的操作ベンチマークであるPhysMani-Benchを導入し、シミュレーションと実世界のロボット実験の両方において、強いベースラインよりも優れた成功率を示す。
- 参考スコア(独自算出の注目度): 21.625914828006856
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Manipulating fast and dynamically moving targets in unstructured 3D environments remains challenging for embodied AI. Existing visual-language-action models and world models struggle with accurate 3D geometry and physically meaningful forecasting. We propose PhysMani, a framework that couples a physics-principled 3D Gaussian world model with a future-aware action policy model. The world model learns a divergence-free Gaussian velocity field via online optimization for fast and physically grounded future dynamics prediction. The policy model integrates the predicted 3D scene future dynamics through a learnable token based cross-attention module. We introduce PhysMani-Bench, a dynamic manipulation benchmark with 16 tasks, and demonstrate a superior success rate over strong baselines in both simulation and real-world robot experiments.
- Abstract(参考訳): 構造化されていない3D環境で高速かつ動的に動くターゲットを操作することは、AIを具現化する上で依然として困難である。
既存の視覚言語アクションモデルと世界モデルは、正確な3D幾何学と物理的に意味のある予測に苦しむ。
本稿では,物理原理に基づく3次元ガウス世界モデルと将来のアクションポリシーモデルとを結合するフレームワークであるPhysManiを提案する。
世界モデルは、高速かつ物理的に基礎付けられた将来の力学予測のためのオンライン最適化を通じて、分散のないガウス速度場を学習する。
ポリシモデルは、学習可能なトークンベースのクロスアテンションモジュールを通じて、予測された3Dシーンの将来のダイナミクスを統合する。
16のタスクを持つ動的操作ベンチマークであるPhysMani-Benchを導入し、シミュレーションと実世界のロボット実験の両方において、強いベースラインよりも優れた成功率を示す。
関連論文リスト
- PhysiFormer: Learning to Simulate Mechanics in World Space [56.16644631495]
物理的に表現可能な3次元物体運動のための拡散変換器であるPhysorFormerを提案する。
世界座標で表される3Dメッシュとしてオブジェクトを表す。
これは、軌道精度、剛性保存、運動量に基づく物理的一貫性において、自己回帰ベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2026-06-25T17:59:00Z) - Neural Voxel Dynamics: Learning Implicit 3D Physics via Volumetric Feature Advection [0.14323566945483496]
本稿では,映像由来の監視信号から直接,暗黙的な3次元物理力学を学習するための自己次元フレームワークを提案する。
予測ボトルネックを2次元画像空間から3次元容積潜在空間にシフトすることで、この問題に対処する。
トレーニングや推論のための明示的な古典的シミュレータに依存する最先端のハイブリッドモデルとは異なり、当社のアーキテクチャは、高教師付きV-JEPA機能内の物質状態を暗黙的に追跡する。
論文 参考訳(メタデータ) (2026-06-24T22:06:35Z) - Future Dynamic 3D Reconstruction: A 3D World Model with Disentangled Ego-Motion [69.61280478695205]
本研究では,将来の動的3次元再構成のための3次元潜在表現を予測する世界モデルFR3Dを提案する。
実験では、FR3Dが将来的な動的3D再構成において、複数のデータセットにまたがるモノラルな観察から2秒後まで、強力なパフォーマンスを示す。
論文 参考訳(メタデータ) (2026-06-16T17:59:46Z) - PhyCo: Learning Controllable Physical Priors for Generative Motion [55.59209981836171]
本稿では,ビデオ生成に連続的,解釈可能,物理的に接地された制御を導入するフレームワークであるPhyCoを紹介する。
i) 摩擦, 再構成, 変形, 力が様々なシナリオで体系的に変化する100K以上のフォトリアリスティック・シミュレーション・ビデオの大規模データセット, (ii) 物理制御された拡散モデルの微調整, (iii) VLM誘導報酬最適化, 微調整された視覚言語モデルにより、対象とする物理クエリを用いて生成されたビデオを評価し、異なるフィードバックを提供する。
論文 参考訳(メタデータ) (2026-04-30T17:53:03Z) - MotionPhysics: Learnable Motion Distillation for Text-Guided Simulation [25.78198969054392]
MotionPhysicsは、ユーザが提供する自然言語プロンプトから妥当な物理パラメータを推論するエンドツーエンドの微分可能なフレームワークである。
我々は30以上のシナリオでMotionPhysicsを評価し、実世界、人間設計、AIによって生成された3Dオブジェクトを含む。
論文 参考訳(メタデータ) (2026-01-01T22:56:37Z) - PhysWorld: From Real Videos to World Models of Deformable Objects via Physics-Aware Demonstration Synthesis [52.905353023326306]
物理的に妥当で多様な実演を合成し、効率的な世界モデルを学ぶためのフレームワークであるPhysWorldを提案する。
実験により、PhysWorldは、最新の最先端手法、すなわちPhysTwinよりも47倍高速な推論速度を実現しつつ、競争性能を持つことが示された。
論文 参考訳(メタデータ) (2025-10-24T13:25:39Z) - GWM: Towards Scalable Gaussian World Models for Robotic Manipulation [53.51622803589185]
本稿では,ロボット操作のための世界モデルGawssian World Model (GWM)を提案する。
中心となるのは、潜伏拡散変換器(DiT)と3次元変分オートエンコーダを組み合わせることで、微粒なシーンレベルの将来の状態復元を可能にする。
シミュレーションと実世界の実験の両方で、GWMは多様なロボットのアクションに照らされた未来のシーンを正確に予測できる。
論文 参考訳(メタデータ) (2025-08-25T02:01:09Z) - PhysX-3D: Physical-Grounded 3D Asset Generation [48.78065667043986]
既存の3D生成は、物理グラウンドモデリングを無視しながら、ジオメトリーとテクスチャに重点を置いている。
PhysXNet - 5つの基本次元に体系的にアノテートされた最初の物理地上3Dデータセット。
また,物理基底画像から3次元のアセット生成のためのフィードフォワードフレームワークである textbfPhysXGen も提案する。
論文 参考訳(メタデータ) (2025-07-16T17:59:35Z) - FinePhys: Fine-grained Human Action Generation by Explicitly Incorporating Physical Laws for Effective Skeletal Guidance [6.0892117964531955]
FinePhysは、物理を組み込んだ人間のアクション生成フレームワークで、効果的な骨格指導を得る。
FinePhysはまず、オンラインのやり方で2Dのポーズを推定し、2Dから3Dへのリフトを、コンテキスト内学習で行う。
純粋にデータ駆動型3次元ポーズの不安定性と限定的な解釈性を軽減するため,物理に基づく動き再推定モジュールを導入する。
論文 参考訳(メタデータ) (2025-05-19T17:58:11Z) - DreamPhysics: Learning Physics-Based 3D Dynamics with Video Diffusion Priors [75.83647027123119]
本稿では,映像拡散前の物体の物理的特性を学習することを提案する。
次に,物理に基づくMaterial-Point-Methodシミュレータを用いて,現実的な動きを伴う4Dコンテンツを生成する。
論文 参考訳(メタデータ) (2024-06-03T16:05:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。