論文の概要: KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding
- arxiv url: http://arxiv.org/abs/2607.19876v1
- Date: Wed, 22 Jul 2026 08:04:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.024368
- Title: KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding
- Title(参考訳): KineBench: IDMフリーキネマティックグラウンドによる身体的世界モデルのベンチマーク
- Abstract要約: エンボディド・ワールド・モデルの 物理的整合性を評価することは 重要なオープン・チャレンジです
既存のフレームワークはほとんどがアクション抽出に逆ダイナミクスモデル(IDM)に依存している。
IDMのないEWMのためのクローズドループベンチマークであるKineBenchを紹介する。
- 参考スコア(独自算出の注目度): 58.541098216700796
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evaluating the physical consistency of embodied world models(EWMs) is a critical open challenge. While closed-loop evaluation via simulator rollouts offers a more faithful assessment of physical plausibility than open-loop alternatives, existing frameworks almost exclusively rely on Inverse Dynamics Models(IDMs) for action extraction. Due to the intricate mapping from 2D pixel space to 3D kinematic space, the learned IDMs can be brittle to data outside their training distribution, resulting in unreliable action extraction from the generated videos with novel objects and scenarios. This creates an unavoidable attribution ambiguity between world model inaccuracies and extractor errors. To reduce this ambiguity, we present KineBench, an IDM-free closed-loop benchmark for EWMs, built upon an explicit kinematic grounding pipeline. Given a generated video, KineBench employs cascaded visual foundation models to directly extract 6D end-effector poses from individual frames, which are then executed in a physics simulator for closed-loop validation. Beyond execution-based task success, KineBench incorporates two classical 3D kinematic metrics--Spectral Arc Length (SPARC) and the Maruyama Manipulability Index--to characterize trajectory smoothness and kinematic feasibility from a robot-centric perspective. Built on 20 diverse manipulation tasks in ManiSkill3, KineBench evaluates EWMs across four progressive suites: basic execution, task transfer, visual out-of-distribution generalization, and complexity-conditioned scaling. Evaluation across frontier models reveals task-complexity-bounded nonlinear scaling in embodied video generation, providing empirical guidance for future data-scaling strategies.
- Abstract(参考訳): エンボディド・ワールド・モデル(EWM)の物理的整合性を評価することは、重要なオープン・チャレンジである。
シミュレータロールアウトによるクローズドループ評価は、オープンループの代替品よりも物理的な妥当性を忠実に評価するが、既存のフレームワークはアクション抽出に逆ダイナミクスモデル(IDM)をほとんど依存している。
2Dピクセル空間から3Dキネマティック空間への複雑なマッピングにより、学習されたIMMはトレーニング分布外のデータに脆くなり、新しいオブジェクトやシナリオで生成されたビデオから信頼性の低いアクション抽出を行うことができる。
これにより、世界モデルの不正確さと抽出器の誤りの間に、避けられない帰属の曖昧さが生じる。
この曖昧さを軽減するために、明示的なキネマティックグラウンドティングパイプライン上に構築された、EDMのないEWMのためのクローズドループベンチマークであるKineBenchを紹介する。
生成されたビデオに対して、KineBenchはカスケードされた視覚基礎モデルを使用して、個々のフレームから6Dエンドエフェクターのポーズを直接抽出し、クローズドループバリデーションのための物理シミュレータで実行される。
実行ベースのタスクの成功以外にも、KineBenchは2つの古典的な3Dキネマティックなメトリクス、SPARC(Spectral Arc Length)とMaruyama Manipulability Index(マルヤママニピュラビリティ指数)を取り入れている。
ManiSkill3で20の多様な操作タスクに基づいて構築されたKineBenchは、基本的な実行、タスク転送、視覚的アウト・オブ・ディストリビューションの一般化、複雑性条件のスケーリングという4つのプログレッシブスイートでEWMを評価している。
フロンティアモデルによる評価では、エンボディ映像生成におけるタスク複雑性に縛られた非線形スケーリングが示され、将来のデータスケーリング戦略の実証的なガイダンスを提供する。
関連論文リスト
- Stream3Dv2: Geometric-Semantic Fusion Enhanced Streaming Zero-Shot 3D Scene Understanding [7.823301846592561]
Stream3Dv2は、堅牢なストリーミング3D知覚のために設計されたトレーニング不要のフレームワークである。
幾何学的ノイズと意味的あいまいさを解消する包括的幾何学的意味融合機構を導入する。
公開データセットの実験では、Stream3Dv2が、基礎となるオープン語彙のストリーミング3Dセグメンテーションと検出において、既存のベースラインを一貫して上回っていることが示されている。
論文 参考訳(メタデータ) (2026-08-21T14:13:02Z) - Real-World Cooperative Bimanual Dexterous Grasp of Large Objects from Single-View Observations [18.70687400045831]
ロボット操作における大きな物体の両面的な握りは重要な課題である。
本稿では,関節角度,視覚的観察,力信号の収集を行うマルチモーダル・データセットを含む実世界のバイマングルーピング・フレームワークを提案する。
本手法により, 単視点入力から実行可能なバイマングリップの合成が可能となり, 完全な3次元オブジェクトモデルへの依存を低減できる。
論文 参考訳(メタデータ) (2026-08-11T02:24:27Z) - Instruct-Particulate: Scaling Feed-Forward 3D Object Articulation with Kinematic Control [86.64250947574749]
合成された3Dオブジェクトの再構成は、アニメーション、ゲーム、ロボットシミュレーションにおいて重要である。
最近のニューラルネットワークは、3Dオブジェクトの明瞭な構造を推定できるが、その一般化は注釈付きデータの不足によって制限されている。
Instruct-Particulateは、3Dメッシュとターゲットキネマティック仕様を併用するモデルである。
論文 参考訳(メタデータ) (2026-06-12T17:59:36Z) - $μ_0$: A Scalable 3D Interaction-Trace World Model [54.38434730157622]
3次元トレースに基づくスケーラブルな世界モデルを提案する。
我々のTraceExtractシステムは自動的に3Dの監視を抽出する。
これらの結果から,3次元トレーサを拡張性および移動性のあるクロスボデーメント操作の表現として確立した。
論文 参考訳(メタデータ) (2026-06-11T17:59:56Z) - Ada3Drift: Adaptive Training-Time Drifting for One-Step 3D Visuomotor Robotic Manipulation [53.750389076941396]
拡散に基づくビジュモータポリシーは反復的認知を通じて多モーダルな動作分布をキャプチャするが、その高い推論遅延はリアルタイムロボット制御を制限する。
Ada3Driftは,専門家のデモモードに対して予測された行動を引き付ける訓練時間ドリフト場を学習する。
Ada3Driftは、拡散ベースの代替よりも10倍の関数評価を必要としながら、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-12T14:36:53Z) - DragMesh: Interactive 3D Generation Made Easy [12.832539752284466]
DragMeshはリアルタイムインタラクティブな3Dコーディネーションのための堅牢なフレームワークである。
私たちのコアコントリビューションは、新しい分離されたキネマティック推論とモーションジェネレーションフレームワークです。
論文 参考訳(メタデータ) (2025-12-06T13:10:44Z) - UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework [54.337290937468175]
統合された枠組み内での2次元映像と3次元映像の協調モデリングのための自己回帰モデルUniMoを提案する。
本手法は,正確なモーションキャプチャを行いながら,対応する映像と動きを同時に生成することを示す。
論文 参考訳(メタデータ) (2025-12-03T16:03:18Z) - IDSplat: Instance-Decomposed 3D Gaussian Splatting for Driving Scenes [25.939318593012484]
動的駆動シーンの再構築は、センサ・リアリスティック・シミュレーションによる自律システム開発に不可欠である。
我々は,動的シーンを明示的なインスタンス分解と学習可能なモーショントラジェクトリで再構成する,自己教師型3次元ガウススティングフレームワークIDSplatを提案する。
本手法は, インスタンスレベルの分解を維持しつつ, 競合する再構成品質を実現し, 再トレーニングを伴わずに, 多様なシーケンスやビュー密度を一般化する。
論文 参考訳(メタデータ) (2025-11-24T15:48:08Z) - Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos [24.111891848073288]
身体的世界モデルは、視覚的な観察と行動を通じて物理的世界と予測し、相互作用することを目的としている。
MTV-Worldは正確なビジュモータ予測のためのマルチビュートラジェクトリ・ビデオ制御を導入した。
MTV-Worldは、複雑なデュアルアームシナリオにおける正確な制御実行と正確な物理的相互作用モデリングを実現する。
論文 参考訳(メタデータ) (2025-11-17T02:17:04Z) - URDF-Anything: Constructing Articulated Objects with 3D Multimodal Language Model [76.08429266631823]
3次元マルチモーダル大言語モデル(MLLM)に基づくエンドツーエンドの自動再構築フレームワークを提案する。
URDF-Anythingは、ポイントクラウドとテキストマルチモーダル入力に基づく自己回帰予測フレームワークを使用して、幾何学的セグメンテーションと運動論的パラメータ予測を協調的に最適化する。
シミュレーションと実世界の両方のデータセットの実験は、我々の手法が既存の手法よりも大幅に優れていることを示した。
論文 参考訳(メタデータ) (2025-11-02T13:45:51Z) - Joint Flow Trajectory Optimization For Feasible Robot Motion Generation from Video Demonstrations [8.133207162076877]
本稿では,LfD(Learning-from-Demonstration)パラダイムに基づくポーズ生成とオブジェクトの軌道模倣を把握するためのフレームワークを提案する。
人間の手の動きを直接模倣するのではなく,実演を対象中心のガイドとして扱う。
我々は,様々な実世界の操作タスクにおけるシミュレーションと実世界の実験の両方において,我々のアプローチを検証する。
論文 参考訳(メタデータ) (2025-09-25T03:11:07Z) - Mixed Diffusion for 3D Indoor Scene Synthesis [55.94569112629208]
提案するMiDiffusionは,可塑性3次元屋内シーンを合成するための混合離散連続拡散モデルである。
床条件の3次元シーン合成において,最先端の自己回帰モデルおよび拡散モデルより優れることを示す。
論文 参考訳(メタデータ) (2024-05-31T17:54:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。