論文の概要: Recursive Self-Improvement of Visuomotor Policies through Local Recovery Supervision
- arxiv url: http://arxiv.org/abs/2610.05151v1
- Date: Sun, 04 Oct 2026 11:54:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 23:00:27.753111
- Title: Recursive Self-Improvement of Visuomotor Policies through Local Recovery Supervision
- Title(参考訳): 再帰的自己改善をめざして
- Abstract要約: 本稿では,地域復興管理による自己改善の枠組みを提案する。
各ラウンドは現在のポリシを監査し、サポート対象の障害状態の修正デモを生成し、ポリシ更新に使用する。
固定マルチモーダルエージェントは、ツールを使用する教師として機能し、観察、計算、実行、フィードバックを通じて回復アクションを生成する。
- 参考スコア(独自算出の注目度): 7.3283102771115685
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visuomotor policies can execute familiar tasks yet lack the corrective behavior needed after their own mistakes. We present a framework for recursive self-improvement through local recovery supervision. Each round audits the current policy, generates corrective demonstrations at supported failure states, and uses them to update the policy that drives the next round of collection. An offline auditor locates unresolved failures using coarse and dense temporal evidence and specifies observable repair goals. A fixed multimodal agent acts as a tool-using teacher, generating recovery actions through observation, computation, execution, and feedback. The frozen student tests whether each teacher endpoint supports further progress. If continuation fails, the system restores that endpoint and extends the demonstration. Action-level quality assessment then defines continuous training windows with aligned observations, quality weights, and validity masks. Only the student is deployed. In a preliminary LIBERO-Goal study, recovery-augmented post-training achieves 88 successful episodes out of 100 validation scenes, compared with 78 for original-data continuation from the same $π_0$ checkpoint. An earlier BC-RNN study on robomimic Can improves success from 102/130 to 112/130 using 26 local recovery segments. Both comparisons match 2,000 additional optimization steps.
- Abstract(参考訳): Visuomotorのポリシーは、慣れ親しんだタスクを実行することができるが、自分自身のミスの後に必要な修正動作が欠如している。
本稿では,再帰的自己改善のための枠組みを,局所的回復管理を通じて提示する。
各ラウンドは現在のポリシを監査し、サポート対象の障害状態の修正デモを生成し、次のラウンドを駆動するポリシ更新に使用する。
オフライン監査者は、粗い時間的証拠と密集した時間的証拠を用いて未解決の障害を特定し、観測可能な修理目標を指定する。
固定マルチモーダルエージェントは、ツールを使用する教師として機能し、観察、計算、実行、フィードバックを通じて回復アクションを生成する。
凍結した生徒は、各教師のエンドポイントがさらなる進歩をサポートするかどうかをテストする。
継続が失敗した場合、システムはエンドポイントを復元し、デモを拡張する。
アクションレベルの品質評価は、一致した観察、品質の重み、妥当性のマスクを備えた継続的なトレーニングウィンドウを定義する。
生徒のみが配置される。
予備的なLIBERO-Goal研究では,100の検証シーンのうち,リカバリ強化後トレーニングが88回成功し,同じ$π_0$チェックポイントのオリジナルデータ継続率は78であった。
BC-RNNによるロボミミックカンの研究は、26の局所回復セグメントを使用して102/130から112/130に改善した。
どちらの比較も2000の最適化ステップと一致している。
関連論文リスト
- Future Anchored Verification and Online Recovery for World Action Models [50.72957480806238]
世界アクションモデル(WAM)は、ロボット操作のための有望なパラダイムとして登場した。
我々は、WAMが行動する前に予測した未来が、通過する意図のある状態を正確に表現しているのを観察する。
予測フレームをアンカーとして保持し,検証とリカバリに使用する軽量フレームワークであるFAVORを紹介する。
論文 参考訳(メタデータ) (2026-10-05T13:08:58Z) - Mulligan: Performance-Guided Data Collection for Efficient On-Robot Learning [49.96968347002295]
人間のデモから学ぶことは、ロボットに新しいタスクを教えるための信頼できる方法だが、ポリシーが改善するにつれて、追加のデモから得られる利益は減少する。
我々は、高精度な操作タスクにおいて、監督エピソードの固定予算から改善を最大化する方法を問う。
フェールが初期状態の小さなサブセットに集中できることを観察するため、均一なコレクションは、ポリシーがすでに処理している状態にオペレータの時間の大部分を費やします。
論文 参考訳(メタデータ) (2026-10-05T06:56:13Z) - Learning from Evolving Errors: Adaptive Iterative Repair for On-Policy Distillation [34.25144986131144]
オンラインの自己蒸留は、学生自身の方針からサンプリングされた軌跡に対する密集したトークンレベルのフィードバックを提供する。
本稿では, オンライン蒸留における適応的反復補修フレームワークであるAIR-OPDを紹介する。
DAPO-Math-17Kデータセット上でAIR-OPDをトレーニングし, AIME24, AIME25, HMMT25, MMLU-Pro, GPQAのアウト・オブ・ディストリビューションテストと並行して評価する。
論文 参考訳(メタデータ) (2026-10-02T02:34:57Z) - Shockingly Simple Self-retrospection Improves Agentic Models Without RL [56.88703385147974]
本研究は,説明のみの訓練がその後の行動に与える影響を分離するために,レトロスペクティブ・オンリー・ファインチューニングについて検討する。
Qwen3.5-4B を用いたソフトウェア工学実験では、ROFT は成功と失敗の混合したベースモデルの試行に関する問題で訓練されている。
また、64のサンプルベースモデル試みが失敗する個々のタスクの解決も学べる。
論文 参考訳(メタデータ) (2026-09-28T17:54:24Z) - Self-Confirming Superposition Traps in Reinforcement Learning [62.71685993550818]
強化学習はエージェントのポリシーによって選択されたデータに基づいて表現し、その結果のリターンを使って次の選択を導く。
これらのデータに対して表現フィッティングがグローバルに最適である場合でも,このループは低リターンポリシーを維持可能であることを示す。
論文 参考訳(メタデータ) (2026-09-26T21:56:26Z) - Guardrailed Meta-Agent Loops: Stress-Testing Policy Pinning, Budget Bounds, and Crash Recovery [7.414694666903067]
GuardrailLoopはシミュレーションベースのテストベッドで、3つの運用契約を共同でテスト可能にする。
ハッシュピン付ポリシーは、目標、スコープ、評価アイデンティティ、予算、リリース条件を修正します。
有用な適応、状態回復、反復実行を分離する。
論文 参考訳(メタデータ) (2026-09-10T21:22:08Z) - RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - Speculative Rollback Correction for Quality-Diverse Web Agent Imitation [43.603850569331975]
専門家の軌道から模倣学習を通じて対話型Webエージェントを訓練することは、非常に効果的なアプローチとして現れている。
リセット可能なエージェント環境のためのブランチレベルの模倣フレームワークであるSRC(Speculative Rollback Correction)を提案する。
論文 参考訳(メタデータ) (2026-06-10T08:56:27Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - Self-Healing Agentic Orchestrators for Reliable Tool-Augmented Large Language Model Systems [0.10210859604701106]
セルフヒーリングエージェントオーケストレータは、信頼性をランタイム境界制御問題として扱う。
セルフヒーリングは98.8%のタスク成功を達成し、リトライオンリーでは94.5%、フルリプランでは93.8%を達成している。
論文 参考訳(メタデータ) (2026-05-31T19:27:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。