論文の概要: Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition
- arxiv url: http://arxiv.org/abs/2608.09762v1
- Date: Mon, 10 Aug 2026 15:54:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.354119
- Title: Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition
- Title(参考訳): 集中学習と批判的分解によるロボットマニピュレーションのための実世界のオンライン強化学習
- Abstract要約: 集中型トレーニングと分散実行(CTDE)とハイブリッドリワードアーキテクチャ(HRA)を組み合わせた統合フレームワークを導入する。
実験の結果,提案フレームワークはサンプル効率と政策性能の両方を大幅に改善することがわかった。
本手法は,最先端のベースラインと比較して,テニスボールのピック・アンド・プレイスにおける成功率を60%から80%に向上させる。
- 参考スコア(独自算出の注目度): 16.480150894507908
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-world online reinforcement learning (RL) provides a promising approach for training robotic manipulation policies directly in the physical world, avoiding the sim-to-real gap and enabling continuous policy refinement through human-in-the-loop interaction. Recent methods have demonstrated sample-efficient learning through human intervention but remain limited to small randomization ranges and encounter challenges with the non-stationarity induced by concurrently training multiple agents. To address these limitations, we introduce a unified framework that combines centralized training with decentralized execution (CTDE) and a Hybrid Reward Architecture (HRA). This enables multiple actors to share a centralized multi-head critic. The critic is decomposed into task and grasp heads, corresponding to the sparse task reward and a potential-based grasping reward, respectively. We accordingly reformulate the critic and actor objectives to exploit the decomposed Q-values while explicitly accounting for the categorical action distribution of the discrete gripper policy. Experimental results demonstrate that the proposed framework substantially improves both sample efficiency and policy performance. We validate our approach on two robotic arms and a simulated humanoid robot across tennis ball and banana pick-and-place, pot reset, and simulated block relocation tasks under dimension-wise domain randomization, approximately 5-25x larger than those considered in prior work. Compared with a state-of-the-art baseline, our method improves the success rate from 60% to 80% on tennis ball pick-and-place, from 60% to 90% on banana pick-and-place, and from 25% to 95% on simulated block relocation, while also successfully accomplishing a task where the baseline consistently fails. Videos and more details are available at our project website: https://hil-harc.github.io/.
- Abstract(参考訳): 実世界のオンライン強化学習(RL)は、ロボット操作ポリシーを物理的な世界で直接訓練するための有望なアプローチを提供する。
近年の手法では、人間の介入によるサンプル効率の学習が実証されているが、小さなランダム化範囲に限られており、同時に複数のエージェントを訓練することによって引き起こされる非定常性の問題に直面している。
これらの制約に対処するために,集中型トレーニングと分散実行(CTDE)とハイブリッドリワードアーキテクチャ(HRA)を組み合わせた統合フレームワークを導入する。
これにより、複数のアクターが集中型マルチヘッド批評家を共有することができる。
批評家は、それぞれ、スパースタスク報酬と電位ベースグリップ報酬に対応する、タスクとグリップヘッドに分解される。
そこで我々は, 個別グリップポリシーのカテゴリー的行動分布を明示的に考慮しつつ, 分解したQ値を活用するために, 批評家と俳優の目的を見直した。
実験の結果,提案フレームワークはサンプル効率と政策性能の両方を大幅に改善することがわかった。
我々は,2つのロボットアームと,テニスボールとバナナのピック・アンド・プレイス,ポット・リセット,シミュレートされたブロック・リロケーションタスクに対するアプローチを,従来考えられていた約5~25倍の領域ランダム化の下で検証した。
現状のベースラインと比較すると,ボールピック・アンド・プレイスでは60%から80%,バナナピック・アンド・プレイスでは60%から90%,シミュレートされたブロックリロケーションでは25%から95%,ベースラインが一貫して失敗するタスクでは25%から95%に向上する。
ビデオや詳細は、プロジェクトのWebサイト(https://hil-harc.github.io/)で確認できます。
関連論文リスト
- Max-Q Selective Imitation for Human-in-the-Loop Online Robot Learning [1.96243636752331]
実際のロボットのためのHIL(Human-in-the-loop)オンライン強化学習は、人間の介入を素早く吸収し、人間の先行性を超えて改善し続けなければならない。
本稿では,この2つのコンポーネントをベースとしたトレーニング手法を提案する。
emphMC Q-chunk 批判者は、モンテカルロへのチャンクレベルのアクション値をリプレイバッファから返します。
emphmax-Qの選択的な模倣は、各状態において、現在のポリシーアクションとバッファサンプルの間の高額なQ$アクションを模倣することでアクターを更新する。
論文 参考訳(メタデータ) (2026-08-15T07:13:59Z) - A Rubric-Supervised Critic from Sparse Real-World Outcomes [87.11204512676193]
現実のコーディングエージェントは、成功信号がノイズが多く、遅延し、スパースであるループで人間と動作します。
本稿では,RLに基づくトレーニングや推論時間スケーリングの報奨モデルとして,スパースとノイズの相互作用データから"批判的"モデルを学習するプロセスを提案する。
論文 参考訳(メタデータ) (2026-03-04T07:23:54Z) - Actor-Critic Pretraining for Proximal Policy Optimization [2.7575165233051693]
本稿では,PPO(Proximal Policy Optimization)のようなアクター批判アルゴリズムに対する事前学習手法を提案する。
アクターは行動クローンにより事前訓練され、批評家は事前訓練されたポリシーのロールアウトから得られるリターンを用いて事前訓練される。
実験結果から, アクタークリティカルプレトレーニングは, プレトレーニングを行わない平均86.1%, アクター専用プレトレーニングでは30.9%, サンプル効率は86.1%向上した。
論文 参考訳(メタデータ) (2026-02-27T08:43:56Z) - Flow Policy Gradients for Robot Control [67.61978635211048]
フローマッチングポリシ勾配は、より表現力のあるポリシのトレーニングと微調整に有効である。
我々は、スクラッチからトレーニングを行う際に、フロー表現をどのように活用するかを示し、ベースラインよりもきめ細やかな堅牢性を改善する。
論文 参考訳(メタデータ) (2026-02-02T18:56:49Z) - Residual Off-Policy RL for Finetuning Behavior Cloning Policies [41.99435186991878]
本稿では,行動クローニング(BC)と強化学習(RL)の利点を組み合わせたレシピを提案する。
提案手法は疎二元報酬信号のみを必要とするため,高次自由度(DoF)システムの操作ポリシーを効果的に改善することができる。
特に、私たちの知る限りでは、人型ロボットによる実世界初のRLトレーニングが成功しました。
論文 参考訳(メタデータ) (2025-09-23T17:59:46Z) - FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning [74.25049012472502]
FLaReは、堅牢な事前訓練された表現、大規模なトレーニング、勾配安定化技術を統合する大規模な強化学習フレームワークである。
提案手法は,タスク完了に向けた事前訓練されたポリシーを整列し,これまで実証され,全く新しいタスクや実施状況において,最先端(SoTA)のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-09-25T03:15:17Z) - REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback [61.54791065013767]
報酬関数と人間の嗜好の相違は、現実世界で破滅的な結果をもたらす可能性がある。
近年の手法は、人間の嗜好から報酬関数を学習することで、不適応を緩和することを目的としている。
本稿では,ロボットRLHFフレームワークにおける報酬正規化の新たな概念を提案する。
論文 参考訳(メタデータ) (2023-12-22T04:56:37Z) - Robot Fine-Tuning Made Easy: Pre-Training Rewards and Policies for
Autonomous Real-World Reinforcement Learning [58.3994826169858]
ロボット強化学習のためのリセット不要な微調整システムであるRoboFuMEを紹介する。
我々の洞察は、オフラインの強化学習技術を利用して、事前訓練されたポリシーの効率的なオンライン微調整を確保することである。
提案手法では,既存のロボットデータセットからのデータを組み込んで,目標タスクを3時間以内の自律現実体験で改善することができる。
論文 参考訳(メタデータ) (2023-10-23T17:50:08Z) - Reinforcement Learning with Foundation Priors: Let the Embodied Agent Efficiently Learn on Its Own [59.11934130045106]
我々は、政策、価値、成功-回帰基盤モデルからのガイダンスとフィードバックを活用するために、RLFP(Reinforcement Learning with Foundation Priors)を提案する。
本フレームワークでは,自動報酬関数を用いてより効率的にエージェントを探索できるファウンデーション誘導型アクター・クリティカル(FAC)アルゴリズムを導入する。
本手法は,実ロボットとシミュレーションの両方において,様々な操作タスクにおいて顕著な性能を実現する。
論文 参考訳(メタデータ) (2023-10-04T07:56:42Z) - Obstacle Avoidance for Robotic Manipulator in Joint Space via Improved
Proximal Policy Optimization [6.067589886362815]
本稿では,6-DoFマニピュレータのタスク空間から関節空間にマップするために,改良されたPPOアルゴリズムを用いて深層ニューラルネットワークを訓練する。
実ロボットでそのようなタスクを訓練するのは時間を要するので、モデルを訓練するためのシミュレーション環境を開発する。
実験結果から,ロボットは非構造環境下で1つの目標をトラッキングしたり,複数の目標に到達することができた。
論文 参考訳(メタデータ) (2022-10-03T10:21:57Z) - Robot Learning of Mobile Manipulation with Reachability Behavior Priors [38.49783454634775]
モバイルマニピュレーション(MM)システムは、非構造化現実環境におけるパーソナルアシスタントの役割を引き継ぐ上で理想的な候補である。
その他の課題として、MMは移動性と操作性の両方を必要とするタスクを実行するために、ロボットの実施形態を効果的に調整する必要がある。
本研究では,アクタ批判的RL手法におけるロボットの到達可能性の先行性の統合について検討した。
論文 参考訳(メタデータ) (2022-03-08T12:44:42Z) - Reactive Long Horizon Task Execution via Visual Skill and Precondition
Models [59.76233967614774]
シミュレーションで学習したモデルを用いて、単純なタスクプランナの構成要素をグラウンド化することで、見知らぬロボットタスクを達成できるシミュレート・トゥ・リアル・トレーニングのアプローチについて述べる。
シミュレーションでは91.6%から98%,実世界の成功率は10%から80%に増加した。
論文 参考訳(メタデータ) (2020-11-17T15:24:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。