論文の概要: GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
- arxiv url: http://arxiv.org/abs/2607.02642v1
- Date: Thu, 02 Jul 2026 17:02:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 13:36:31.285129
- Title: GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
- Title(参考訳): GigaWorld-1:ロボット政策評価のための世界モデル構築のロードマップ
- Abstract要約: WMBenchは、実際のロボット遠隔操作データとポリシーのロールアウトから構築されたベンチマークである。
7つのビデオワールドモデル,4つのアクション表現スキーム,および実際のロボット実行と組み合わせた324,000以上のシミュレートされたポリシーロールアウトを分析した。
評価者の品質は、短期的な視覚的リアリズムよりも、長期的な、行動に忠実なロールアウト一貫性に支配されている。
- 参考スコア(独自算出の注目度): 73.02743604295246
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating embodied robot foundation models remains a critical bottleneck; unlike large language models efficiently assessed via digital benchmarks, robotic policies require slow, costly real-world rollouts limited by hardware and human supervision, which has driven interest in world models as surrogate policy evaluators, yet the key properties that make a world model reliable for policy assessment remain poorly understood. This work presents a systematic study of world models for robotic policy evaluation and introduces WMBench, a benchmark constructed from real-robot teleoperation data and matched policy rollouts covering diverse manipulation tasks to enable controlled comparisons across model families, action encodings, rollout horizons, and evaluation metrics. Using WMBench, we analyze 7 video world models, 4 action representation schemes, and over 324,000 simulated policy rollouts paired with real robot executions, further enriching our analysis with large-scale community submissions from the CVPR 2026 GigaBrain Challenge, curated synthetic trajectories, and a training videos spanning more than 12,000 hours. Our experiments deliver three core insights: evaluator quality is dominated by long-horizon, action-faithful rollout consistency rather than short-term visual realism; pretraining gains stem not only from data scale but from balancing general world knowledge with robot-specific controllability; and architectural choices including action encoding, memory design, and evaluator-focused post-training strongly determine alignment with real-world robot behavior. Drawing on these results, we derive a practical design roadmap and realize it in \textit{GigaWorld-1}, a world model specially optimized for policy evaluation, and we fully release our code, models, datasets, and toolkits to advance scalable evaluation research for embodied foundation models.
- Abstract(参考訳): デジタルベンチマークによって効率的に評価される大きな言語モデルとは異なり、ロボットポリシーは、ハードウェアと人間の監督によって制限された遅くてコストのかかる現実世界のロールアウトを必要とする。
本研究は,ロボット政策評価のための世界モデルを体系的に研究し,実ロボット遠隔操作データから構築したベンチマークであるWMBenchを紹介する。
WMBenchを用いて、7つのビデオワールドモデル、4つのアクション表現スキーム、および実際のロボット実行と組み合わせた324,000以上のシミュレートされたポリシーロールアウトを分析し、CVPR 2026 GigaBrain Challengeからの大規模なコミュニティ投稿、合成軌道のキュレート、および12,000時間以上のトレーニングビデオによる分析をさらに強化する。
評価対象の品質は,短期的な視覚的リアリズムというよりも,長期的かつ行動に忠実なロールアウト一貫性に支配される。事前学習の成果は,データスケールだけでなく,ロボット固有の制御性と一般世界の知識のバランスからもたらされる。
これらの結果をもとに,政策評価に特化して最適化された世界モデルである「textit{GigaWorld-1}」で実用的な設計ロードマップを導出し,実装基盤モデルのためのスケーラブルな評価研究を進めるためのコード,モデル,データセット,ツールキットを完全リリースする。
関連論文リスト
- RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation [52.855830378221775]
一般的なロボットポリシーを評価するためのスケーラブルな代替手段として、ビデオワールドモデルが登場しつつある。
タスクプログレス対応の視覚言語モデルスコアリングと,高速なビデオワールドモデルを組み合わせた自動評価パイプラインであるRoboWorldを紹介する。
論文 参考訳(メタデータ) (2026-07-01T15:22:41Z) - World Model for Robot Learning: A Comprehensive Survey [168.5691568303064]
この調査は、ロボット学習の世界モデルに関する急速に成長している文献を体系的にレビューする。
本研究では,世界モデルがロボット政策とどのように結合されているか,強化学習と評価のための学習シミュレータとしてどのように機能するか,ロボットビデオワールドモデルが想像力に基づく生成から,制御可能で構造化された,基礎的規模の定式化までどのように進展してきたかを検討する。
本調査は,ロボット学習の世界モデルに関する文献を体系的にレビューし,主要なパラダイムと応用を明らかにするとともに,具体的エージェントにおける予測モデリングの大きな課題と今後の方向性を明らかにする。
論文 参考訳(メタデータ) (2026-04-30T14:35:31Z) - Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training [54.896907620476675]
本稿では,学習世界モデルを用いた学習後学習フレームワークを提案する。
Hi-WMは中間状態をキャッシュし、ロールバックとブランチをサポートする。
我々は、剛性と変形性のあるオブジェクト相互作用と2つのポリシーバックボーンにまたがる3つの実世界の操作タスクについて、Hi-WMを評価する。
論文 参考訳(メタデータ) (2026-04-23T14:42:54Z) - Interactive World Simulator for Robot Policy Training and Evaluation [21.481187472784047]
ロボットインタラクションデータセットからインタラクティブな世界モデルを構築するためのフレームワークであるInteractive World Simulatorを提案する。
我々の実験では、学習された世界モデルが相互作用に一貫性のあるピクセルレベルの予測を生成する。
我々は,世界モデル生成データに基づいてトレーニングされたポリシーが,同じ量の実世界のデータでトレーニングされたポリシーと相容れないことを発見した。
論文 参考訳(メタデータ) (2026-03-09T16:13:32Z) - RobotArena $\infty$: Scalable Robot Benchmarking via Real-to-Sim Translation [47.79800816696372]
操作ポリシーの現実的なテストは、大規模に労働集約的で、再現が難しい。
既存のシミュレーションベンチマークも同様に制限されており、同じ合成ドメイン内でポリシーをトレーニングおよびテストしている。
本稿では,VLA評価を大規模にシミュレーションした拡張環境に移行することで,これらの課題を克服する新しいベンチマークフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-27T17:41:38Z) - Ctrl-World: A Controllable Generative World Model for Robot Manipulation [53.71061464925014]
汎用ロボットポリシーは、幅広い操作スキルを実行することができる。
未知の物体や命令で 彼らの能力を評価し 改善することは 重要な課題です
世界モデルは、イマジネーション空間内でポリシーの展開を可能にすることで、有望でスケーラブルな代替手段を提供する。
論文 参考訳(メタデータ) (2025-10-11T09:13:10Z) - WorldGym: World Model as An Environment for Policy Evaluation [41.204900701616914]
WorldGymは、実環境のプロキシとして機能する自動回帰、アクション条件付きビデオ生成モデルである。
ポリシーはモンテカルロの世界モデルによるロールアウトを通じて評価され、視覚言語モデルが報酬を提供する。
We show that WorldGym can maintain relative policy rankings across different policy version, sizes, and training checkpoints。
論文 参考訳(メタデータ) (2025-05-31T15:51:56Z) - Robotic World Model: A Neural Network Simulator for Robust Policy Optimization in Robotics [50.191655141020505]
この研究は、長期水平予測、エラー蓄積、およびsim-to-real転送の課題に対処することで、モデルに基づく強化学習を前進させる。
スケーラブルでロバストなフレームワークを提供することで、現実のアプリケーションにおいて適応的で効率的なロボットシステムを実現することができる。
論文 参考訳(メタデータ) (2025-01-17T10:39:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。