論文の概要: FAR: Failure-Aware Retry for Test-Time Recovery and Continual Policy Improvement
- arxiv url: http://arxiv.org/abs/2607.01111v1
- Date: Wed, 01 Jul 2026 16:01:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.97824
- Title: FAR: Failure-Aware Retry for Test-Time Recovery and Continual Policy Improvement
- Title(参考訳): FAR:テストタイムリカバリと継続的な政策改善のためのフェールアウェアリトライ
- Abstract要約: フェール・アウェア・リトライ(FAR)は、ロボットがテスト時に以前の失敗から学び、その振る舞いを順応し、最終的にタスクを自律的に完了させることを可能にするフレームワークである。
FARは成功率とロバスト性を大幅に改善し、シミュレーションにおける標準拡散政策よりも平均17.6%、現実世界では11.7%向上した。
- 参考スコア(独自算出の注目度): 10.94594187411586
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robot policies inevitably encounter failures when deployed in real environments. Naive retries often repeat the same mistakes, while many existing recovery methods rely on human intervention. In this paper, we propose Failure-Aware Retry (FAR), a framework that enables robots to learn from previous failures at test time, adapt their behavior accordingly, and eventually complete the task autonomously. FAR combines Failure-Contrastive Preference Adaptation, which constructs preference learning data from failures to steer the policy away from previously unsuccessful behaviors, with lightweight action perturbations during retries to encourage local exploration. We further incorporate successful recovery trajectories into a training loop for continual policy improvement. Experiments in both simulation and real-world manipulation tasks show that FAR substantially improves success rates and robustness, with average gains of 17.6% over the standard diffusion policy in simulation and 11.7% in the real world. In addition, FAR significantly improves data efficiency under both reset and timestep budgets during continual policy improvement by exploiting informative failure cases.
- Abstract(参考訳): ロボットポリシーは、実際の環境にデプロイした場合、必然的に障害に遭遇する。
ナイーブリトライはしばしば同じ間違いを繰り返すが、既存のリカバリ手法の多くは人間の介入に依存している。
本稿では,ロボットがテスト時に過去の失敗から学習し,それに応じて動作を適応し,最終的に自律的にタスクを完了させるフレームワークであるFARを提案する。
FARはフェールコントラスト優先適応(Fureure-Contrastive Preference Adaptation)という,失敗から優先学習データを構築して,それまで失敗していた行動から方針を逸脱させる。
さらに、継続的な政策改善のためのトレーニングループに、回復軌道をうまく組み込む。
シミュレーションと実世界操作の両方の実験により、FARは成功率と堅牢性を大幅に改善し、シミュレーションにおける標準拡散政策よりも平均17.6%、現実世界では11.7%向上した。
さらに、FARは、情報的障害事例を利用して、継続的な政策改善中のリセットとタイムステップの両方の予算の下で、データ効率を著しく改善する。
関連論文リスト
- REVOLVE: An Automated Closed-Loop Framework for Evolving Robot Manipulation with Minimal Human Intervention [17.399763167916195]
人間の介入を最小限に抑えてロボット操作を進化させるための自動クローズドループフレームワークであるREVOLVEを提案する。
統一されたソフトウェアプラットフォーム上に構築されたREVOLVEは、データ収集、ポリシトレーニングとデプロイメント、障害回復、継続的な学習を単一のクローズドループワークフローに統合する。
論文 参考訳(メタデータ) (2026-09-13T16:08:03Z) - Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models [10.832654624297135]
視覚言語アクション(VLA)モデルは、オンラインのディスラプションに対して脆弱である。
我々は,凍結したVLAを故障データなしで推論時に復元する,トレーニング不要なフレームワークであるCoReを提案する。
論文 参考訳(メタデータ) (2026-08-14T18:49:46Z) - RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - Learning from Mistakes: Rollout-Retrieval Lifelong Policy Learning for Autonomous Driving [18.991437941136876]
本稿では,生涯学習の観点から自律運転政策の改善について考察する。
本稿では,リカバリ可能な政策誘導ミスから是正対象を抽出する政策学習フレームワークであるロールアウト・リトリーバル・ライフロング・ポリシー・ラーニング(R$2$LPL)を提案する。
R$2$LPL を大規模閉ループ nuPlan ベンチマークで評価する。
論文 参考訳(メタデータ) (2026-06-29T16:37:50Z) - Improving Robotic Generalist Policies via Flow Reversal Steering [92.97477771370428]
汎用ポリシーは多様なロボットデータセットから幅広いスキルを学ぶことができる。
新しい課題を解決し、改善するためには、ポリシーのリッチな振る舞いから適切なアクションを推論し、呼び出す方法が必要です。
本稿では,フローリバーサルステアリング (FRS) を提案し,フローポリシーを逆に通すことで,最適だが合理的な動作をとる手法を提案し,それらを一般の動作モードにマッピングする。
論文 参考訳(メタデータ) (2026-06-11T17:59:45Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - SPARR: Simulation-based Policies with Asymmetric Real-world Residuals for Assembly [13.3674466451862]
シミュレーション学習された基本方針と実世界の残留政策を組み合わせたハイブリッドアプローチを提案する。
本手法は,多種多様な組立作業におけるほぼ完全な成功率を実現する。
論文 参考訳(メタデータ) (2026-02-26T17:26:13Z) - FlowCorrect: Efficient Interactive Correction of Generative Flow Policies for Robotic Manipulation [0.7666240799116112]
FlowCorrectはモジュール型のインタラクティブな模倣学習アプローチで、フローマッチング操作ポリシのデプロイメント時適応を可能にする。
実際のロボットを4つのテーブルトップタスク(ピック・アンド・プレイス、注ぐ、カップアップライト、挿入)で評価した。
修正予算の低いFlowCorrectは、以前に失敗したケースで80%の成功率を達成した。
論文 参考訳(メタデータ) (2026-02-25T16:06:49Z) - Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation [48.26705293834693]
FARL(Failure-Aware Offline-to-Online Reinforcement Learning)は、実世界の強化学習における障害を最小限にする新しいパラダイムである。
本研究では,オンライン探索における障害防止のために,世界モデルに基づく安全評論家とオフラインで訓練された回復ポリシーを統合するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-01-12T18:53:11Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Fast Adaptation with Behavioral Foundation Models [82.34700481726951]
教師なしゼロショット強化学習は、行動基礎モデルの事前学習のための強力なパラダイムとして登場した。
有望な結果にもかかわらず、ゼロショットポリシーは、教師なしのトレーニングプロセスによって引き起こされるエラーにより、しばしば準最適である。
本稿では,事前訓練されたBFMの低次元タスク埋め込み空間を探索し,ゼロショットポリシーの性能を急速に向上させる高速適応手法を提案する。
論文 参考訳(メタデータ) (2025-04-10T16:14:17Z) - Back to the Manifold: Recovering from Out-of-Distribution States [20.36024602311382]
本稿では,エージェントをトレーニング多様体に戻すための回復策を提案する。
実際のロボットプラットフォーム上での操作実験により提案手法の有効性を実証する。
論文 参考訳(メタデータ) (2022-07-18T15:10:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。