論文の概要: X2Real: an eXtensive simulation benchmark for real-world generalist policies
- arxiv url: http://arxiv.org/abs/2609.27449v1
- Date: Wed, 23 Sep 2026 07:13:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.927634
- Title: X2Real: an eXtensive simulation benchmark for real-world generalist policies
- Title(参考訳): X2Real: 現実のジェネラリスト政策のためのeXtensiveシュミレーションベンチマーク
- Abstract要約: 本稿では,ロボット操作ポリシーの実際の性能を忠実に評価するための,進化可能なシミュレーションベンチマークであるX2Realを紹介する。
X2Realは、実ハードウェアと整合する視覚特性と物理的特性をシミュレーションし、シミュレーション結果と実ロボット評価結果の線形相関を0.84とする。
10の能力ディメンションと44の階層的なロングホライゾンタスクを備えた包括的分類を特徴とし、基本的な操作スキルと視覚的接地、言語理解、バイマンコントロールといった高度な能力を含んでいる。
- 参考スコア(独自算出の注目度): 10.221909037825975
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generalist robot manipulation policies have developed rapidly, yet their reliable evaluation remains challenging due to fundamental flaws in existing simulation benchmarks: prominent sim-to-real gaps, narrow task coverage, and unfair evaluation caused by ambiguous training-test pipelines. Prior works only partially resolve these issues and lack simultaneous faithfulness, diversity, and fairness, while static benchmark designs fail to sustain long-term policy development. We present X2Real, an evolvable simulation benchmark for faithfully evaluating the real-world performance of robotic manipulation policies based on Nvidia Isaac Lab-Arena. Following three core principles (faithfulness, diversity, and fairness), X2Real calibrates simulation visual and physical properties to align with real hardware, achieving a 0.84 linear correlation between simulated and real-robot evaluation results. It features a comprehensive taxonomy with 10 capability dimensions and 44 hierarchical long-horizon tasks, covering basic manipulation skills and advanced capacities such as visual grounding, language understanding, and bimanual control. We further adopt multi-axis domain randomization and strictly disjoint training-evaluation pipelines to mitigate benchmark exploitation and ensure credible evaluation. Powered by a custom physical domain-specific language, the Mana simulation ecosystem supports modular task design and iterative performance analysis, alongside a nearly 300-hour annotated simulation trajectory dataset. X2Real offers a faithful, diverse, and fair evolving evaluation infrastructure, effectively bridging the sim-to-real evaluation gap and supporting the advancement of generalist robotic manipulation policies.
- Abstract(参考訳): 一般的なロボット操作ポリシーは急速に発展してきたが、既存のシミュレーションベンチマークの根本的な欠陥、顕著なsim-to-realギャップ、狭いタスクカバレッジ、曖昧なトレーニング-テストパイプラインによる不公平な評価など、信頼性の高い評価は依然として難しい。
以前の作業では、これらの問題を部分的に解決し、同時に忠実さ、多様性、公平性を欠いていたが、静的なベンチマーク設計は長期的な政策開発を維持できなかった。
我々は、Nvidia Isaac Lab-Arenaに基づくロボット操作ポリシーの実際の性能を忠実に評価するための、進化可能なシミュレーションベンチマークであるX2Realを紹介する。
3つの基本原理(忠実さ、多様性、公正さ)に従って、X2Real は実ハードウェアと整合する視覚的および物理的特性をシミュレーションし、シミュレーションと実ロボット評価の結果の間に 0.84 の線形相関を達成している。
10の能力ディメンションと44の階層的なロングホライゾンタスクを備えた包括的分類を特徴とし、基本的な操作スキルと視覚的接地、言語理解、バイマンコントロールといった高度な能力を含んでいる。
さらに、マルチ軸領域のランダム化と厳密な非結合なトレーニング評価パイプラインを採用し、ベンチマークの活用を軽減し、信頼性の高い評価を確実にする。
カスタムの物理ドメイン固有言語をベースとして、Manaシミュレーションエコシステムは、約300時間のアノテートされたシミュレーショントラジェクトリデータセットとともに、モジュラータスク設計と反復的なパフォーマンス分析をサポートする。
X2Realは忠実で多様性があり、公正に進化する評価基盤を提供し、シモン・トゥ・リアルな評価ギャップを効果的に埋め、ジェネラリストのロボット操作ポリシーの進歩をサポートする。
関連論文リスト
- RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies [121.35821705538768]
汎用的なロボット操作ポリシーは急速に進歩しているが、既存のベンチマークは、その能力を体系的に評価することに制限されている。
本稿では,汎用ロボット操作ポリシーの総合的な評価のための統一型sim-and-realベンチマークであるRoboDojoを紹介する。
RoboDojoには42のシミュレーションタスクと18の現実世界タスクが含まれており、多様な補完的な操作機能を備えている。
論文 参考訳(メタデータ) (2026-07-05T17:58:02Z) - Toward Visually Realistic Simulation: A Benchmark for Evaluating Robot Manipulation in Simulation [62.51953630639423]
既存のベンチマークには視覚的リアリズムがなく、シミュレーションと現実の間に大きな領域ギャップが生じる。
シミュレーションにおけるロボット操作評価のための,視覚的にリアルなベンチマークであるVISERを提案する。
VISERは、物理ベースのレンダリング(PBR)素材を備えた1000以上の3Dアセットの高忠実度データセットと、それらのアセットから作成される3Dシーンを、レイアウトや生成によって構成する。
論文 参考訳(メタデータ) (2026-05-07T14:13:05Z) - RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies [20.899640428403377]
既存のベンチマークでは、トレーニングと評価の間に大きなドメインオーバーラップが見られる。
これらの課題に対処するために設計されたシミュレーションベンチマークフレームワークであるRoboLabを紹介します。
詳細なメトリクスとスケーラブルなツールセットを提供することで、RoboLabはタスクジェネリストロボットポリシーの真の一般化能力を評価するためのスケーラブルなフレームワークを提供する。
論文 参考訳(メタデータ) (2026-04-10T19:42:21Z) - PolaRiS: Scalable Real-to-Sim Evaluations for Generalist Robot Policies [88.78188489161028]
シミュレーションにおける政策評価と環境復元(PolaRiS)の導入
PolaRiSは、高忠実度シミュレーションロボット評価のためのスケーラブルなリアルタイム・シミュレート・フレームワークである。
PolaRiSの評価は,既存のシミュレーションベンチマークよりも,現実のジェネラリストのポリシー性能に強い相関関係があることが示されている。
論文 参考訳(メタデータ) (2025-12-18T18:49:41Z) - Reliable and Scalable Robot Policy Evaluation with Imperfect Simulators [9.868826622074899]
SureSimは、比較的小さな実世界のテストで大規模なシミュレーションを強化するためのフレームワークである。
我々は,非漸近平均推定アルゴリズムを利用して,平均政策性能に対する信頼区間を提供する。
当社のアプローチは,同様のポリシ性能の限界を達成するため,ハードウェア評価作業の20~25%以上を節約する。
論文 参考訳(メタデータ) (2025-10-05T20:37:53Z) - Reactive Long Horizon Task Execution via Visual Skill and Precondition
Models [59.76233967614774]
シミュレーションで学習したモデルを用いて、単純なタスクプランナの構成要素をグラウンド化することで、見知らぬロボットタスクを達成できるシミュレート・トゥ・リアル・トレーニングのアプローチについて述べる。
シミュレーションでは91.6%から98%,実世界の成功率は10%から80%に増加した。
論文 参考訳(メタデータ) (2020-11-17T15:24:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。