論文の概要: F4R: Failure-Driven Recognition, Reconstruction, Refinement, and Redeployment for Continual Robot Self-Improvement
- arxiv url: http://arxiv.org/abs/2609.35575v1
- Date: Mon, 28 Sep 2026 16:34:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.82748
- Title: F4R: Failure-Driven Recognition, Reconstruction, Refinement, and Redeployment for Continual Robot Self-Improvement
- Title(参考訳): F4R:連続ロボットの自己改善のための障害駆動認識、再構築、再構築、再デプロイ
- Abstract要約: F4R(Failure for Rising)は、F4R(Failure-driven real-to-sim-to-real closed-loop learning framework)である。
現実の失敗を目標とする政策改善に変換する。
F4Rは93.75%のアウト・オブ・ディストリビューション、90.0%のアウト・オブ・ディストリビューションを達成している。
- 参考スコア(独自算出の注目度): 36.58815385660095
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The real-world performance of current vision-language-action models is fundamentally constrained by the limited coverage of expert demonstrations and their insufficient understanding of physical interactions. A common remedy is to collect additional real-world demonstrations of newly encountered failures. However, this process is costly, inefficient, potentially unsafe, and difficult to scale. To address this challenge, we propose Failure for Rising (F4R), a failure-driven real-to-sim-to-real closed-loop learning framework that converts real-world failures into targeted policy improvement. F4R first uses an agent to automatically identify and diagnose failures from rollouts. It reconstructs each failure as an interactive, object-centric table-top environment that preserves the task-relevant spatial and physical conditions. The policy is then refined through failure-conditioned sim-real co-training followed by targeted reinforcement learning in the reconstructed environments. The improved policy is subsequently redeployed, while newly observed failures are continuously fed back into the next reconstruction and learning cycle. Real-world evaluations on four manipulation tasks show that F4R achieves 93.75% In-Distribution and 90.0% Out-of-Distribution (OOD) success, outperforming the budget-matched Targeted BC baseline by 18.75 percentage points under OOD conditions without collecting additional real-world corrective demonstrations.
- Abstract(参考訳): 現在の視覚-言語-アクションモデルの現実世界のパフォーマンスは、専門家によるデモンストレーションの限られた範囲と、物理的な相互作用に対する理解の不十分さによって、基本的に制限されている。
一般的な治療法は、新しく発生した障害に関する実世界のデモを集めることである。
しかし、このプロセスはコストが高く、非効率で、潜在的に安全ではなく、スケールが難しい。
この課題に対処するため,現実の失敗を目標とした政策改善に変換する,失敗駆動型実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実-実
F4Rはまずエージェントを使用して、ロールアウトから障害を自動的に識別し、診断する。
それぞれの障害を対話型でオブジェクト中心のテーブルトップ環境として再構築し、タスクに関連する空間的および物理的条件を保存する。
この方針は、障害条件付きsim-realコトレーニングと、再建された環境での強化学習によって洗練される。
改良されたポリシーはその後再デプロイされ、新しく観察された障害は次の再構築と学習サイクルに継続的に送り返される。
4つの操作タスクにおける実世界評価は、F4Rが93.75%のIn-Distributionと90.0%のout-of-Distribution(OOD)成功を達成し、OOD条件下で予算設定のTargeted BCベースラインを18.75ポイント上回ったことを示している。
関連論文リスト
- CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies [52.32735203969873]
VLA(Vision-Language-Action)ポリシーは、ロボット操作において強力なパフォーマンスを達成するが、実行が名目上の軌道から逸脱した後も不安定なままである。
本稿では,実行時に発生する障害から学習することで回復を改善するフレームワークであるCARE(Corrective Atomic Robotic Execution)を提案する。
論文 参考訳(メタデータ) (2026-09-21T05:14:34Z) - REVOLVE: An Automated Closed-Loop Framework for Evolving Robot Manipulation with Minimal Human Intervention [17.399763167916195]
人間の介入を最小限に抑えてロボット操作を進化させるための自動クローズドループフレームワークであるREVOLVEを提案する。
統一されたソフトウェアプラットフォーム上に構築されたREVOLVEは、データ収集、ポリシトレーニングとデプロイメント、障害回復、継続的な学習を単一のクローズドループワークフローに統合する。
論文 参考訳(メタデータ) (2026-09-13T16:08:03Z) - LIBERO-RECOVER: Beyond Task Success Towards Failure Recovery in Robotic Manipulation Models [48.57715789642472]
本稿では,ロボット操作における障害回復のための大規模ベンチマークであるLIBERO-Recover Benchmarkを紹介する。
我々は、SOTAを具体化したモデルから実際の実行失敗を収集し、4つのリカバリレベルにわたって1000以上のシナリオを構築します。
空間的理解,オブジェクト構造推論,相互作用理解,トポロジカル推論の4つのコア機能を評価する。
論文 参考訳(メタデータ) (2026-09-04T14:15:27Z) - Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models [10.832654624297135]
視覚言語アクション(VLA)モデルは、オンラインのディスラプションに対して脆弱である。
我々は,凍結したVLAを故障データなしで推論時に復元する,トレーニング不要なフレームワークであるCoReを提案する。
論文 参考訳(メタデータ) (2026-08-14T18:49:46Z) - FAR: Failure-Aware Retry for Test-Time Recovery and Continual Policy Improvement [10.94594187411586]
フェール・アウェア・リトライ(FAR)は、ロボットがテスト時に以前の失敗から学び、その振る舞いを順応し、最終的にタスクを自律的に完了させることを可能にするフレームワークである。
FARは成功率とロバスト性を大幅に改善し、シミュレーションにおける標準拡散政策よりも平均17.6%、現実世界では11.7%向上した。
論文 参考訳(メタデータ) (2026-07-01T16:01:54Z) - Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement [52.93267443851685]
VLA(Vision-Language-Action)モデルは様々な操作タスクにまたがって一般化することができる。
シミュレーションで純粋に訓練された強化学習政策は、実世界のVLAのゼロショットの堅牢性を改善することができるか?
本稿では,オブジェクトポーズを用いてVLA動作を洗練するオブジェクト中心残差RLフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-17T11:36:54Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation [48.26705293834693]
FARL(Failure-Aware Offline-to-Online Reinforcement Learning)は、実世界の強化学習における障害を最小限にする新しいパラダイムである。
本研究では,オンライン探索における障害防止のために,世界モデルに基づく安全評論家とオフラインで訓練された回復ポリシーを統合するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-01-12T18:53:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。