論文の概要: UniIntervene++: An Adaptive Intervention Agent for Efficient Real-World Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.03620v1
- Date: Fri, 02 Oct 2026 17:18:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.510714
- Title: UniIntervene++: An Adaptive Intervention Agent for Efficient Real-World Reinforcement Learning
- Title(参考訳): UniIntervene++: 効率的な実世界の強化学習のための適応的インターベンションエージェント
- Abstract要約: オンライン強化学習のための適応的介入エージェントUniIntervene++を提案する。
自律実行と異種支援行動の制御を割り当てることを学ぶ。
UniIntervene++ の平均成功率は89.67%であり、すべてのベースラインを少なくとも6ポイント上回っている。
- 参考スコア(独自算出の注目度): 5.446249974582703
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Online reinforcement learning (RL) enables robot policies to improve through physical interaction, but the assistance they require changes as their competence evolves. Existing intervention strategies based on offline estimates or fixed decision rules can therefore become mismatched to the current policy. To address this, we propose UniIntervene++, an adaptive intervention agent that learns to allocate control between autonomous execution and heterogeneous assisted behaviors during online RL. Specifically, UniIntervene++ first formulates the evolving RL policy, trajectory correction, and a task-structured CodePolicy as Options in a unified semi-Markov decision process and learns their relative values online. Building on this, competence-adaptive intervention periodically probes the RL policy through unassisted execution, keeping control allocation responsive to its evolving capability. Finally, coupled experience learning allows assisted behaviors to improve the RL policy, whose evolving outcomes in turn reshape future intervention decisions. In this way, UniIntervene++ jointly determines when to intervene, how to intervene, and when to return control as the RL policy improves. Across five real-world manipulation tasks, UniIntervene++ achieves an average success rate of 89.67%, outperforming all baselines by at least 6 percentage points, while reducing human intervention to 0.77%, a relative reduction of at least 94.6% from the best baseline. Code is available in our \href{https://github.com/dannyyudong/An-Adaptive-Intervention-Agent-for-Efficient-Real-World-Reinforcement -Learning}{GitHub repository}.
- Abstract(参考訳): オンライン強化学習(RL)は、物理的な相互作用を通じてロボットポリシーを改善することができるが、能力が進化するにつれて変化を必要とする助けとなる。
したがって、既存の介入戦略は、オフラインの見積もりや固定された決定ルールに基づいており、現在の方針と一致しない可能性がある。
そこで我々は,オンラインRLにおける自律実行と異種支援行動の制御を学習する適応的介入エージェントUniIntervene++を提案する。
具体的には、UniIntervene++はまず、進化するRLポリシー、軌道修正、およびタスク構造化されたCodePolicy as Optionsを半マルコフ決定プロセスで定式化し、それらの相対値をオンラインで学習する。
これに基づいて、能力適応的介入は、非アシスト実行を通じて定期的にRLポリシーを探索し、その進化する能力に応答する制御割り当てを維持する。
最後に、複合経験学習により、支援行動はRLポリシーを改善することができ、その進化した結果が将来の介入決定を形作る。
これにより、UniIntervene++は、いつ介入するか、どのように介入するか、RLポリシーが改善するにつれて制御を返すのかを共同で決定する。
5つの実世界の操作タスクの中で、UniIntervene++は89.67%の平均的な成功率を達成し、すべてのベースラインを少なくとも6ポイント上回り、人間の介入を0.77%に減らし、最高のベースラインから少なくとも94.6%を減らした。
コードはわれわれの \href{https://github.com/dannyyudong/An-Adaptive-Intervention-Agent-for-Efficient-Real-World-Reinforcement -Learning}{GitHub repository} で入手できる。
関連論文リスト
- UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning [10.315300563393782]
非生産的探索を検知し、高価値状態に対する政策を自律的に回復するエージェント介入モデルUniInterveneを提案する。
様々な実世界の操作タスクの実験では、UniInterveneは平均成功率を8.6%改善し、最先端のHiL-RLベースラインと比較して人間の介入を57%削減した。
論文 参考訳(メタデータ) (2026-06-10T17:38:24Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - OHP-RL: Online Human Preference as Guidance in Reinforcement Learning for Robot Manipulation [16.28822074948203]
Online Human Preference as Guidance in Reinforcement Learning (OHP-RL) は、政策学習の指針となる選好情報として人間の介入を利用するフレームワークである。
OHP-RLは、強い成功率、より高速な収束、そして従来のアプローチよりもはるかに低い人間の介入努力を一貫して達成する。
論文 参考訳(メタデータ) (2026-05-15T14:02:34Z) - Double Check My Desired Return: Transformer with Target Alignment for Offline Reinforcement Learning [64.6334337560557]
教師付き学習(RvS)による強化学習は、シーケンスモデリングタスクとしてオフラインRLをフレーム化する。
決定変換器(DT)は、実際の完了したリターンを特定のターゲットリターンと確実に整合させるのに苦労する。
そこで我々は,Offline RLの目標アライメントによる変換器の二重チェックを行う新しいアプローチであるDoctorを提案する。
論文 参考訳(メタデータ) (2025-08-22T14:30:53Z) - Evaluation-Time Policy Switching for Offline Reinforcement Learning [5.052293146674794]
オフライン強化学習(RL)では、環境からのインタラクションのデータセットを固定してタスクを最適に解決する方法を学ぶ。
オンライン学習のための多くの非政治アルゴリズムは、オフライン環境において、行動の分布の振る舞いを過大評価する傾向にある。
既存のオフラインRLアルゴリズムは、ポリシの制約やバリュー関数の変更といったテクニックを採用して、個々のデータセットのパフォーマンス向上を実現している。
我々は、行動改善のための純粋な非政治的RLエージェントの挙動を動的に結合するポリシー切替技術と、近くにとどまる行動的クローニング(BC)エージェントを導入する。
論文 参考訳(メタデータ) (2025-03-15T18:12:16Z) - Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone [72.17534881026995]
ポリシーに依存しないRL(PA-RL)と呼ばれるオフラインおよびオンラインの微調整手法を開発する。
オンラインRLファインチューニングアルゴリズムであるCal-QLを用いて、7BジェネラリストロボットポリシーであるOpenVLAのファインチューニングに成功した最初の結果を示す。
論文 参考訳(メタデータ) (2024-12-09T17:28:03Z) - Boosting Offline Reinforcement Learning with Action Preference Query [32.94932149345299]
実践的エージェントの訓練は通常、政策のパフォーマンスと相互作用コストのバランスをとるために、オフラインおよびオンライン強化学習(RL)を含む。
オンラインファインチューニングは、オフライントレーニングフェーズで学習したアウト・オブ・ディストリビューションデータの誤った推定を補正するために一般的に用いられている方法となっている。
本研究では,Offline-with-Action-Preferences (OAP) と呼ばれるインタラクションフリーのトレーニング手法を提案する。
論文 参考訳(メタデータ) (2023-06-06T02:29:40Z) - Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning [93.99377042564919]
本稿では,潜在的利点の探索を妨げることなく,より柔軟な値推定制約を構築することを試みる。
鍵となるアイデアは、オフラインポリシの"テストベッド"として、オンライン形式で簡単に操作可能な、市販のRLシミュレータを活用することだ。
我々は、状態と報酬空間におけるドメイン間の差異を軽減するモデルベースのRLアプローチであるCoWorldを紹介する。
論文 参考訳(メタデータ) (2023-05-24T15:45:35Z) - Offline Reinforcement Learning with Adaptive Behavior Regularization [1.491109220586182]
オフライン強化学習(RL)は、静的で以前に収集されたデータセットからポリシーを学習する、サンプル効率のよい学習パラダイムを定義する。
適応行動正規化(Adaptive Behavior regularization, ABR)と呼ばれる新しい手法を提案する。
ABRは、データセットの生成に使用するポリシーのクローン化と改善の間に、ポリシーの最適化目標を適応的に調整することを可能にする。
論文 参考訳(メタデータ) (2022-11-15T15:59:11Z) - Mutual Information Regularized Offline Reinforcement Learning [76.05299071490913]
我々は、データセットにおける状態と行動間の相互情報の観点から、オフラインRLにアプローチする新しいMISAフレームワークを提案する。
この下位境界の最適化は、オフラインデータセット上での一段階改善されたポリシーの可能性の最大化と等価であることを示す。
MISAの3つの異なる変種を導入し、より厳密な相互情報によりオフラインのRL性能が向上することを示した。
論文 参考訳(メタデータ) (2022-10-14T03:22:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。