論文の概要: RoboRecover: Benchmarking Robot Policy Recovery under Execution Deviations
- arxiv url: http://arxiv.org/abs/2609.28952v1
- Date: Thu, 24 Sep 2026 03:05:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.682992
- Title: RoboRecover: Benchmarking Robot Policy Recovery under Execution Deviations
- Title(参考訳): RoboRecover: 実行逸脱下でのロボットポリシー回復のベンチマーク
- Abstract要約: 本稿では,ロボットポリシー回復のためのベンチマークであるRoboRecoverを紹介する。
RoboRecoverは、軌跡から逸脱状態を選択し、アクションプレフィックスを再生することでそれらを再構築し、元のタスクに関するポリシーを評価する。
その結果、初期状態の性能は回復性能を判断せず、ポリシーはシナリオ間で異なる回復強度を示すことがわかった。
- 参考スコア(独自算出の注目度): 16.378982552907278
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Robot-policy benchmarks increasingly cover diverse tasks and preset out-of-distribution conditions, but typically evaluate complete trajectories from predefined initial states. These evaluations often focus on the initialized scene and the final outcome, while paying less attention to the dynamic interaction process. During closed-loop execution, actions and contacts can alter object relations and task progress, producing off-nominal intermediate states that need recovery. Recovery requires a policy to infer how task progress has changed, correct the relevant relations, and continue the original goal. We introduce RoboRecover, a benchmark for robot policy recovery under execution deviations. RoboRecover selects deviation states from trajectories, reconstructs them by replaying action prefixes, and evaluates policies on the original task. RoboRecover contains 2,000 scenarios across RoboTwin and LIBERO, with 1,000 scenarios and a fixed 800/200 train/test split on each platform. Results show that initial-state performance does not determine recovery performance and policies exhibit different recovery strengths across scenarios. Using its training split, RoboRecover further supports study on recovery interventions. RoboRecover establishes recovery from execution-induced intermediate states as a distinct dimension of robot policy evaluation.
- Abstract(参考訳): ロボット政治ベンチマークは、様々なタスクをカバーし、分配条件を予め設定するが、通常は事前に定義された初期状態から完全な軌道を評価する。
これらの評価は、しばしば、動的な相互作用プロセスに注意を払わずに、初期化されたシーンと最終的な結果に焦点を当てる。
クローズドループ実行中、アクションとコンタクトはオブジェクトの関係やタスクの進行を変更でき、リカバリが必要な外部の中間状態を生成する。
回復には、タスクの進捗がどのように変化したかを推測し、関連する関係を修正し、元の目標を継続するポリシーが必要である。
本稿では,ロボットポリシー回復のためのベンチマークであるRoboRecoverを紹介する。
RoboRecoverは、軌跡から逸脱状態を選択し、アクションプレフィックスを再生することでそれらを再構築し、元のタスクに関するポリシーを評価する。
RoboRecoverにはRoboTwinとLIBEROの2,000のシナリオが含まれており、1000のシナリオと各プラットフォームで800/200の列車/テストが分割されている。
その結果、初期状態の性能は回復性能を判断せず、ポリシーはシナリオ間で異なる回復強度を示すことがわかった。
トレーニングの分割を利用して、RoboRecoverはリカバリ介入の研究をさらに支援している。
RoboRecoverは、ロボットポリシー評価の異なる次元として、実行誘起中間状態からのリカバリを確立する。
関連論文リスト
- Rollback the World, Keep the Reflection: Rollback-Induced Reflection for Long-Horizon LLM Agents [56.434418859203085]
大規模言語モデル(LLM)エージェントは、多段階の環境相互作用を通じて、長い水平タスクに対処する。
単一の誤動作は、その後の状態や観測を変更でき、時間とともにエラーが複雑になる。
信頼性回復はロールバック境界制御問題として扱われるべきである。
論文 参考訳(メタデータ) (2026-09-16T08:26:14Z) - LIBERO-RECOVER: Beyond Task Success Towards Failure Recovery in Robotic Manipulation Models [48.57715789642472]
本稿では,ロボット操作における障害回復のための大規模ベンチマークであるLIBERO-Recover Benchmarkを紹介する。
我々は、SOTAを具体化したモデルから実際の実行失敗を収集し、4つのリカバリレベルにわたって1000以上のシナリオを構築します。
空間的理解,オブジェクト構造推論,相互作用理解,トポロジカル推論の4つのコア機能を評価する。
論文 参考訳(メタデータ) (2026-09-04T14:15:27Z) - Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models [10.832654624297135]
視覚言語アクション(VLA)モデルは、オンラインのディスラプションに対して脆弱である。
我々は,凍結したVLAを故障データなしで推論時に復元する,トレーニング不要なフレームワークであるCoReを提案する。
論文 参考訳(メタデータ) (2026-08-14T18:49:46Z) - EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration [75.13534797264485]
我々は,ロボット遠隔操作に代わるスケーラブルな代替手段として,自己中心型ヒューマンデータキャプチャー障害回復プロセスが提供されることを示した。
タスクレベルの障害設定を効率的にアレンジし、短いリカバリセグメントを記録することで、人間のオペレータは1時間あたりの有効なリカバリデータの10倍以上のデータを生成できる。
論文 参考訳(メタデータ) (2026-07-22T04:44:26Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - RecoveryChaining: Learning Local Recovery Policies for Robust Manipulation [41.38308130776887]
本稿では,階層的強化学習を用いて回復政策を学習することを提案する。
感覚観察に基づいて故障を検出すると、回復ポリシーが起動される。
我々はシミュレーションで学んだ回復ポリシーを物理ロボットに転送し、シム・トゥ・リアル・トランスファーの実現可能性を示す。
論文 参考訳(メタデータ) (2024-10-17T19:14:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。