論文の概要: RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies
- arxiv url: http://arxiv.org/abs/2607.04434v2
- Date: Tue, 07 Jul 2026 17:58:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.257367
- Title: RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies
- Title(参考訳): RoboDojo: 汎用ロボット操作ポリシーの総合評価のための統一型シミュレートベンチマーク
- Authors: Tianxing Chen, Yue Chen, Zixuan Li, Junyuan Tang, Kailun Su, Haoran Lu, Weijie Wan, Baijun Chen, Songling Liu, Haowen Yan, Honghao Su, Zhiyang Dou, Kaixuan Wang, Dandan Zhang, Yunze Liu, Yan Qin, Qiwei Liang, Qiwei Wu, Zijian Lin, Wenwei Lin, Yuran Wang, Minghua He, Tianshu Wu, Ruihai Wu, Jingquan Zhou, Kai-Chong Lei, Haibao Yu, Yuanfeng Ji, Weiyang Jin, Guanyu Lin, Xiaofan Li, Qi Xiong, Renjing Xu, Zhongyu Li, Wenhao Chai, Enze Xie, Ziwei Wang, Yao Mu, Hao Dong, Wojciech Matusik, Mingyu Ding, Wenbo Ding, Ping Luo, Masayoshi Tomizuka,
- Abstract要約: 汎用的なロボット操作ポリシーは急速に進歩しているが、既存のベンチマークは、その能力を体系的に評価することに制限されている。
本稿では,汎用ロボット操作ポリシーの総合的な評価のための統一型sim-and-realベンチマークであるRoboDojoを紹介する。
RoboDojoには42のシミュレーションタスクと18の現実世界タスクが含まれており、多様な補完的な操作機能を備えている。
- 参考スコア(独自算出の注目度): 121.35821705538768
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generalist robot manipulation policies have advanced rapidly, yet existing benchmarks remain limited in systematically evaluating their capabilities. Many rely on simple, short-horizon, or skill-narrow tasks with limited capability coverage, and are often conducted only in simulation or only in the real world. Simulation enables scalable feedback but misses physical deployment challenges, while real-world evaluation is costly, time-consuming, and difficult to reproduce. We introduce RoboDojo, a unified sim-and-real benchmark for comprehensive evaluation of generalist robot manipulation policies. RoboDojo includes 42 simulation tasks and 18 real-world tasks covering diverse and complementary manipulation capabilities. The simulation benchmark evaluates five dimensions: generalization, memory, precision, long-horizon execution, and open-vocabulary instruction following, while the real-world benchmark exposes policies to challenging physical-world deployment conditions. RoboDojo supports scalable evaluation through heterogeneous parallel simulation in Isaac Sim and provides RoboDojo-RealEval, a reproducible real-world evaluation system with remote cloud access, standardized hardware, scene reset, evaluation protocol, and deployment interface. Together with XPolicyLab, policies can be integrated once and evaluated across simulation and real-world settings with minimal adaptation. We integrate 30 policies into XPolicyLab and evaluate them on RoboDojo, establishing a public leaderboard and systematic analysis of current policy performance. The website is available at http://robodojo-benchmark.com/.
- Abstract(参考訳): 汎用的なロボット操作ポリシーは急速に進歩しているが、既存のベンチマークは、その能力を体系的に評価することに制限されている。
多くの場合、単純な、短期的、あるいは限られた能力範囲のスキルナローなタスクに依存しており、しばしばシミュレーションや実世界でのみ実行される。
シミュレーションはスケーラブルなフィードバックを可能にするが、実際の評価はコストがかかり、時間がかかり、再現が難しい。
本稿では,汎用ロボット操作ポリシーの総合的な評価のための統一型sim-and-realベンチマークであるRoboDojoを紹介する。
RoboDojoには42のシミュレーションタスクと18の現実世界タスクが含まれており、多様な補完的な操作機能を備えている。
シミュレーションベンチマークは、一般化、メモリ、精度、長期実行、そしてそれに続くオープン語彙命令の5つの次元を評価する。
RoboDojoはIsaac Sim氏による異種並列シミュレーションによるスケーラブルな評価をサポートし、リモートクラウドアクセス、標準化されたハードウェア、シーンリセット、評価プロトコル、デプロイメントインターフェースを備えた再現可能な現実世界評価システムであるRoboDojo-RealEvalを提供する。
XPolicyLabとともに、ポリシーを一度統合して、最小限の適応でシミュレーションや実世界の設定で評価することができる。
30のポリシーをXPolicyLabに統合し、RoboDojo上で評価します。
ウェブサイトはhttp://robodojo-benchmark.com/.comで公開されている。
関連論文リスト
- PolaRiS: Scalable Real-to-Sim Evaluations for Generalist Robot Policies [88.78188489161028]
シミュレーションにおける政策評価と環境復元(PolaRiS)の導入
PolaRiSは、高忠実度シミュレーションロボット評価のためのスケーラブルなリアルタイム・シミュレート・フレームワークである。
PolaRiSの評価は,既存のシミュレーションベンチマークよりも,現実のジェネラリストのポリシー性能に強い相関関係があることが示されている。
論文 参考訳(メタデータ) (2025-12-18T18:49:41Z) - Evaluating Gemini Robotics Policies in a Veo World Simulator [69.23071832313246]
我々はフロンティアビデオ基盤モデル(Veo)に基づく生成的評価システムを導入する。
このシステムは、ロボットアクションコンディショニングとマルチビュー一貫性をサポートするよう最適化されている。
我々は、Gemini Roboticsのポリシーチェックポイント8つと、バイマニュアルマニピュレータのための5つのタスクの1600以上の実世界の評価を通じて、これらの能力を検証した。
論文 参考訳(メタデータ) (2025-12-11T14:22:14Z) - RobotArena $\infty$: Scalable Robot Benchmarking via Real-to-Sim Translation [47.79800816696372]
操作ポリシーの現実的なテストは、大規模に労働集約的で、再現が難しい。
既存のシミュレーションベンチマークも同様に制限されており、同じ合成ドメイン内でポリシーをトレーニングおよびテストしている。
本稿では,VLA評価を大規模にシミュレーションした拡張環境に移行することで,これらの課題を克服する新しいベンチマークフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-27T17:41:38Z) - Reliable and Scalable Robot Policy Evaluation with Imperfect Simulators [9.868826622074899]
SureSimは、比較的小さな実世界のテストで大規模なシミュレーションを強化するためのフレームワークである。
我々は,非漸近平均推定アルゴリズムを利用して,平均政策性能に対する信頼区間を提供する。
当社のアプローチは,同様のポリシ性能の限界を達成するため,ハードウェア評価作業の20~25%以上を節約する。
論文 参考訳(メタデータ) (2025-10-05T20:37:53Z) - WorldGym: World Model as An Environment for Policy Evaluation [41.204900701616914]
WorldGymは、実環境のプロキシとして機能する自動回帰、アクション条件付きビデオ生成モデルである。
ポリシーはモンテカルロの世界モデルによるロールアウトを通じて評価され、視覚言語モデルが報酬を提供する。
We show that WorldGym can maintain relative policy rankings across different policy version, sizes, and training checkpoints。
論文 参考訳(メタデータ) (2025-05-31T15:51:56Z) - Real-is-Sim: Bridging the Sim-to-Real Gap with a Dynamic Digital Twin [8.498460043101499]
我々は、シミュレーションを行動クローニングパイプラインに統合するための新しいアプローチである、Real-is-simを導入する。
デプロイ前にポリシーを安全にテストする機能がない実際のメソッドや、sim-to-realメソッドとは対照的に、sim-to-realギャップを横断するために複雑な適応を必要とするsim-to-realメソッドがある。
当社のフレームワークでは,実際のハードウェア上での動作と,並列化された仮想環境での動作とをシームレスに切り替えることが可能です。
論文 参考訳(メタデータ) (2025-04-04T17:05:56Z) - Evaluating Real-World Robot Manipulation Policies in Simulation [91.55267186958892]
実環境と模擬環境の制御と視覚的格差は、信頼性のある模擬評価の鍵となる課題である。
実環境に完全忠実なデジタル双生児を作らなくても、これらのギャップを軽減できる手法を提案する。
シミュレーション環境の集合体であるSIMPLERを作成した。
論文 参考訳(メタデータ) (2024-05-09T17:30:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。