論文の概要: ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models
- arxiv url: http://arxiv.org/abs/2606.28804v1
- Date: Sat, 27 Jun 2026 08:18:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.694979
- Title: ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models
- Title(参考訳): ViPSim: 連続長軸型世界モデルのための視覚空間とパラメータ空間の協調
- Authors: Longyu Chen, Heng Li, Wei Yang, Manqi Zhao, Dongsheng Jiang,
- Abstract要約: エンボディード・ワールド・モデル(EWM)は、エンボディード・インテリジェンスを促進するためのスケーラブルでリスクのないパラダイムとして登場した。
EWMは、低次元アクションと高次元ビデオ合成の間の表現ギャップによってしばしば妨げられる。
本稿では,一貫した長軸生成を実現するフレームワークであるViPSimを提案する。
- 参考スコア(独自算出の注目度): 11.15585863355844
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Embodied World Models (EWMs) have emerged as a scalable and risk-free paradigm for advancing embodied intelligence, enabling the safety-critical evaluation of Vision-Language-Action systems. However, their reliability as evaluation benchmarks and foundational simulators is often hindered by the representation gap between low-dimensional actions and high-dimensional video synthesis. This gap results in a lack of geometric correspondence, manifesting as accumulated trajectory drift and inconsistent robot-object interactions during long-horizon rollouts. To bridge this gap, we propose ViPSim, a framework that achieves consistent long-horizon generation through the synergistic collaboration of Visual and Parameter Spaces. We define the Visual Space as a domain of explicit spatial priors, integrating pixel-aligned projections of end-effector pose, camera perspectives, depth-informed scene geometry, and robotic morphological masks to provide dense structural grounding. Concurrently, the Parameter Space serves as a domain of numerical drivers, injecting raw action sequences and camera matrices to provide precise motion guidance. By unifying these two spaces, ViPSim ensures that the generated states are simultaneously anchored by geometric boundaries and steered by numerical commands. Extensive experiments demonstrate that ViPSim is backbone-agnostic and significantly enhances trajectory consistency. Notably, our approach exhibits emergent capabilities in generating complex interactions with deformable objects (e.g., cloth folding) and maintains robust performance in out-of-distribution and cross-embodiment scenarios, providing a high-fidelity foundation for the automated evaluation and predictive control of embodied agents.
- Abstract(参考訳): エンボディード・ワールド・モデル(EWM)は、エンボディード・インテリジェンスを進化させるためのスケーラブルでリスクのないパラダイムとして登場し、ビジョン・ランゲージ・アクションシステムの安全性・クリティカルな評価を可能にしている。
しかし、評価ベンチマークや基礎シミュレータとしての信頼性は、低次元アクションと高次元ビデオ合成との表現ギャップによって妨げられることが多い。
このギャップは、長い水平ロールアウト中に蓄積された軌道のドリフトと不整合なロボットと物体の相互作用として現れる幾何学的対応の欠如をもたらす。
このギャップを埋めるため,視覚空間とパラメータ空間の相乗的協調により一貫した長軸生成を実現するフレームワークであるViPSimを提案する。
我々は,視覚空間を空間的先行領域として定義し,エンドエフェクタポーズ,カメラ視点,奥行きインフォームドシーン幾何学,ロボット形態マスクといった画素配列の投影を統合して,密集した構造的グラウンドを提供する。
同時にパラメータ空間は数値ドライバの領域として機能し、正確なモーションガイダンスを提供するために、生のアクションシーケンスとカメラ行列を注入する。
これら2つの空間を統一することにより、ViPSimは生成した状態が幾何学的境界によって同時に固定され、数値的なコマンドによって制御されることを保証する。
広範囲な実験により、ViPSimは背骨非依存であり、軌道の整合性を大幅に向上させることが示された。
提案手法は, 変形可能なオブジェクト(例えば布の折り畳み)との複雑な相互作用を創発的に生成する能力を示し, 分布外およびクロスボデーメントシナリオにおける堅牢な性能を維持し, エンボデードエージェントの自動評価および予測制御のための高忠実性基盤を提供する。
関連論文リスト
- ManiSplat: Manipulation Trajectory Synthesis from Monocular Video via Decoupled 3D Gaussian Splatting [28.256286705954846]
現実の観察から動的でインタラクティブな3Dシーンを再構築することは、コンピュータビジョンとロボティクスの基本的な課題である。
ロボットビデオから直接ガウスのデジタル双生児を制御可能で分離する統合フレームワークであるManiSplatを紹介した。
提案手法は,対話駆動型動的シーンを高忠実度かつ制御性で再構築し,下流ロボットタスクとポリシー学習を効果的に支援する。
論文 参考訳(メタデータ) (2026-06-09T09:55:58Z) - Hypergraph-State Collaborative Reasoning for Multi-Object Tracking [63.32950991964095]
複数の相関オブジェクト間の共同推論による動き推定を向上する協調推論フレームワークを提案する。
類似の運動状態を持つ物体同士を互いに拘束し、互いに洗練させることで、我々のフレームワークはノイズの軌道を安定させ、目標を遮蔽しても可塑性運動の連続性を推測する。
論文 参考訳(メタデータ) (2026-04-14T12:37:39Z) - INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling [44.09983529522167]
INSPATIO-WORLDは、単一のビデオから高忠実なインタラクティブなシーンを復元し、生成できる新しいリアルタイムフレームワークである。
Implicit Spatiotemporal Cacheは参照と過去の観測結果を潜在世界表現に集約する。
Explicit Space Constraint Moduleは幾何学的構造を強制し、ユーザのインタラクションを正確かつ物理的に可視なカメラ軌道に変換する。
論文 参考訳(メタデータ) (2026-04-08T15:31:22Z) - HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model [56.4392302336014]
本稿では,外部状態推定を伴わない多種多様なオブジェクトダイナミクス間のロバストな相互作用のためのフレームワークであるHAICを提案する。
我々の重要な貢献は、主観的歴史のみから高次対象状態(速度、加速度)を推定するダイナミクス予測器である。
ヒューマノイドロボットの実験では、HAICはアジャイルタスクで高い成功率を達成する。
論文 参考訳(メタデータ) (2026-02-12T09:34:35Z) - TRACER: Texture-Robust Affordance Chain-of-Thought for Deformable-Object Refinement [37.77903164878976]
TRACER は Texture-Robust Affordance Chain-of- Thought with dEformable-object Refinement framework である。
セマンティック推論から外見が損なわれ、物理的に一貫した機能領域の洗練まで、階層横断的なマッピングを提供する。
Fine-AGDDO15データセットと実世界のロボットプラットフォームで実施された実験は、TRACERが精度を著しく向上することを示した。
論文 参考訳(メタデータ) (2026-01-28T03:12:18Z) - ObjSplat: Geometry-Aware Gaussian Surfels for Active Object Reconstruction [2.8012387812933035]
Splatは、外観と正確な幾何学の両方でオブジェクトを再構築する活発な再構築フレームワークである。
Splatは、物理的に一貫した完全性を数分で生成し、最先端のアプローチと比較して、再現精度と表面完全性に優れる。
論文 参考訳(メタデータ) (2026-01-11T17:14:33Z) - EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation [55.26713167507132]
本稿では,エンボディ空間の構築と解釈を行う生成ロボティクス基礎モデルを提案する。
EnerVerseは、自己回帰的ビデオ拡散フレームワークを使用して、命令から将来のエンボディドスペースを予測する。
本稿では,生成モデルと4次元ガウススプラッティングを組み合わせたデータエンジンパイプラインであるEnerVerse-Dについて述べる。
論文 参考訳(メタデータ) (2025-01-03T17:00:33Z) - Bench2Drive-R: Turning Real World Data into Reactive Closed-Loop Autonomous Driving Benchmark by Generative Model [63.336123527432136]
我々は,リアクティブ閉ループ評価を可能にする生成フレームワークであるBench2Drive-Rを紹介する。
既存の自動運転用ビデオ生成モデルとは異なり、提案された設計はインタラクティブなシミュレーションに適したものである。
我々は、Bench2Drive-Rの生成品質を既存の生成モデルと比較し、最先端の性能を達成する。
論文 参考訳(メタデータ) (2024-12-11T06:35:18Z) - Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation [60.80423207808076]
高解像度の視覚表現を維持しながら長距離依存関係をキャプチャすることは、人間のポーズ推定のような密集した予測タスクに不可欠である。
マルチスケールの畳み込み操作で視覚状態空間モデルを拡張する動的ビジュアル状態空間(DVSS)ブロックを提案する。
HRVMambaは効率的な高分解能表現学習のための新しいモデルである。
論文 参考訳(メタデータ) (2024-10-04T06:19:29Z) - Nonprehensile Riemannian Motion Predictive Control [57.295751294224765]
本稿では,リアル・ツー・シムの報酬分析手法を導入し,リアルなロボット・プラットフォームに対する行動の可能性を確実に予測する。
連続的なアクション空間でオブジェクトを反応的にプッシュするクローズドループコントローラを作成します。
我々は,RMPCが乱雑な環境だけでなく,乱雑な環境においても頑健であり,ベースラインよりも優れていることを観察した。
論文 参考訳(メタデータ) (2021-11-15T18:50:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。