論文の概要: Active Real-World Factor-Based Evaluation for Generalist Robot Policies
- arxiv url: http://arxiv.org/abs/2607.14439v1
- Date: Thu, 16 Jul 2026 00:21:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.937611
- Title: Active Real-World Factor-Based Evaluation for Generalist Robot Policies
- Title(参考訳): 汎用ロボット政策のための実世界の能動的要因に基づく評価
- Authors: Andrew Liao, Hanchen Cui, Karthik Desingh, Aryan Deshwal,
- Abstract要約: 汎用的なロボット操作ポリシーは、幅広いタスクで顕著な可能性を示してきた。
本稿では,政策評価を逐次実験設計問題として扱う能動的評価フレームワークを提案する。
3つの要因の異なる3つのタスクにまたがって2331の現実的評価を行い、我々のアプローチは一般的に少なくとも20~40%の試行を省く。
- 参考スコア(独自算出の注目度): 13.386170952445868
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generalist robot manipulation policies trained on large, diverse datasets have shown remarkable promise across a wide range of tasks. However, rigorously evaluating these policies remains a fundamental challenge. Real-world performance depends on a large combinatorial space of task factors including object poses and camera viewpoints, making full, exhaustive evaluation intractable. Additionally, real hardware evaluation is slow and resource-intensive, so current practice is to use narrow test suites that can miss critical failure modes and misrepresent true deployment readiness. We propose an active evaluation framework that addresses this challenge by treating policy evaluation as a sequential experimental design problem. Our approach fits a probabilistic surrogate model over a structured space of task factors and adaptively selects evaluation configurations to maximize information gain over the policy's performance distribution, allowing for sample-efficient characterization of policy behavior across unseen conditions and a systematic identification of failure-prone regions. We conduct 2331 real-world evaluations across 3 tasks with 3 factor variations and find that our approach typically saves the evaluator at least 20-40% of trials compared to typical random testing.
- Abstract(参考訳): 大規模で多様なデータセットでトレーニングされた汎用的なロボット操作ポリシーは、幅広いタスクにおいて顕著な約束を示している。
しかし、これらの政策を厳格に評価することは根本的な課題である。
実世界のパフォーマンスは、オブジェクトポーズやカメラ視点を含むタスクファクタの大規模な組合せ空間に依存しており、完全な、徹底的な評価が難解である。
さらに、実際のハードウェア評価は遅く、リソース集約的であるため、現在のプラクティスは、重大な障害モードを見逃し、真のデプロイメント準備を誤って表現することのできる、狭いテストスイートを使用することです。
本稿では,政策評価を逐次実験設計問題として扱うことにより,この問題に対処する能動的評価フレームワークを提案する。
提案手法は,タスクファクタの構造空間上の確率的サロゲートモデルに適合し,評価構成を適応的に選択して,ポリシの性能分布に対する情報ゲインを最大化し,未確認条件をまたいだポリシー行動のサンプル効率評価と,障害発生領域の体系的同定を可能にする。
我々は3つの要因の異なる3つのタスクに対して2331の現実世界評価を行い、我々の手法は典型的には通常のランダムテストと比較して少なくとも20~40%の試行を省く。
関連論文リスト
- Reliable and Scalable Robot Policy Evaluation with Imperfect Simulators [9.868826622074899]
SureSimは、比較的小さな実世界のテストで大規模なシミュレーションを強化するためのフレームワークである。
我々は,非漸近平均推定アルゴリズムを利用して,平均政策性能に対する信頼区間を提供する。
当社のアプローチは,同様のポリシ性能の限界を達成するため,ハードウェア評価作業の20~25%以上を節約する。
論文 参考訳(メタデータ) (2025-10-05T20:37:53Z) - Stochastic Encodings for Active Feature Acquisition [100.47043816019888]
Active Feature Acquisitionは、インスタンスワイドでシーケンシャルな意思決定問題である。
目的は、テストインスタンスごとに独立して、現在の観測に基づいて計測する機能を動的に選択することである。
一般的なアプローチは強化学習(Reinforcement Learning)であり、トレーニングの困難を経験する。
我々は、教師付きで訓練された潜在変数モデルを導入し、潜在空間における観測不能な実現の可能性の多くにまたがる特徴を推論することで獲得する。
論文 参考訳(メタデータ) (2025-08-03T23:48:46Z) - RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies [125.35572632340602]
本稿では,実世界における汎用ロボットポリシーのスケーラブルな評価手法であるRoboArenaを提案する。
固定タスク,環境,場所に関する評価を標準化する代わりに,評価者の分散ネットワークにまたがるクラウドソース評価を提案する。
我々は、DROIDロボットプラットフォームを用いて、7つの学術機関における評価者のネットワークにアプローチをインスタンス化する。
論文 参考訳(メタデータ) (2025-06-22T18:13:31Z) - PolicySimEval: A Benchmark for Evaluating Policy Outcomes through Agent-Based Simulation [2.826457831133425]
政策評価タスクにおけるエージェント・ベース・シミュレーションの能力を評価するための最初のベンチマークであるPolicySimEvalを紹介する。
PolicySimEvalは、社会科学者や政策立案者が直面する現実世界の複雑さを反映することを目的としている。
論文 参考訳(メタデータ) (2025-02-11T12:36:00Z) - On the Evaluation of Generative Robotic Simulations [35.8253733339539]
生成シミュレーションに適した総合評価フレームワークを提案する。
単一タスクの品質では、生成されたタスクのリアリズムと生成されたトラジェクトリの完全性を評価する。
タスクレベルの一般化のために、複数の生成されたタスクで訓練されたポリシーの目に見えないタスクに対してゼロショットの一般化能力を評価する。
論文 参考訳(メタデータ) (2024-10-10T17:49:25Z) - Evaluating Real-World Robot Manipulation Policies in Simulation [91.55267186958892]
実環境と模擬環境の制御と視覚的格差は、信頼性のある模擬評価の鍵となる課題である。
実環境に完全忠実なデジタル双生児を作らなくても、これらのギャップを軽減できる手法を提案する。
シミュレーション環境の集合体であるSIMPLERを作成した。
論文 参考訳(メタデータ) (2024-05-09T17:30:16Z) - How Generalizable Is My Behavior Cloning Policy? A Statistical Approach to Trustworthy Performance Evaluation [17.638831964639834]
行動クローニングポリシーは、人間のデモンストレーションから学ぶことで複雑なタスクを解決することに成功している。
本稿では,任意の環境下でのロボット性能について,より低バウンドなフレームワークを提案する。
実験では,シミュレーションとハードウェアの両方におけるビジュモータ操作のポリシーを評価する。
論文 参考訳(メタデータ) (2024-05-08T22:00:35Z) - Position: AI Evaluation Should Learn from How We Test Humans [65.36614996495983]
人間の評価のための20世紀起源の理論である心理測定は、今日のAI評価における課題に対する強力な解決策になり得る、と我々は主張する。
論文 参考訳(メタデータ) (2023-06-18T09:54:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。