論文の概要: Real-World Reinforcement Learning with MPC Scaffolding for Dexterous Manipulation
- arxiv url: http://arxiv.org/abs/2609.14878v2
- Date: Wed, 16 Sep 2026 02:45:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.40617
- Title: Real-World Reinforcement Learning with MPC Scaffolding for Dexterous Manipulation
- Title(参考訳): ディクサラスマニピュレーションのためのMPCスキャフォールディングを用いた実世界の強化学習
- Abstract要約: 実世界のデクスタス強化学習のための足場として,サンプリングベース予測制御(MPC)を用いたフレームワークを提案する。
MPCトラジェクトリの小さなセットは、まずオフラインのリプレイバッファをポップアップさせ、アクターと批評家を事前訓練するために使用される。
オンライン学習中、MPCはデータ収集を断続的にガイドし、非政治のSoft Actor-Criticは、MPC以前の経験と新しく収集された物理的相互作用の両方から列車を運行する。
- 参考スコア(独自算出の注目度): 3.693403461852542
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Real-world reinforcement learning (RL) offers a promising route to dexterous manipulation policies that can adapt directly from physical interaction, but learning is hindered by inefficient early exploration and costly failures. We propose a framework that uses sampling-based model predictive control (MPC) as scaffolding for real-world dexterous RL, providing structured prior experience and task-directed guidance during learning without human demonstrations or corrective actions. A small set of MPC trajectories is first used to populate an offline replay buffer and to pretrain the actor and critic. During online learning, MPC intermittently guides data collection while an off-policy Soft Actor-Critic learner trains from both prior MPC experience and newly collected physical interaction, with control gradually transitioning to the learned policy. On continuous in-hand rotation with a 16-DoF Allegro hand, initialized from 20 MPC trajectories collected in 12 minutes on hardware, the policy reaches 100\% success after 7 minutes of online RL, with about three object drops on average during training. After 20 minutes of online learning, the policy achieves more than five times the rotation speed of the MPC controller and completes 1000 consecutive rotations without a drop. Ablations show complementary benefits from MPC-based pretraining, retained MPC experience, and online MPC guidance, while additional experiments demonstrate rapid adaptation to new object geometries and successful goal-conditioned reorientation.
- Abstract(参考訳): 実世界の強化学習(RL)は、物理的相互作用から直接適応できる巧妙な操作ポリシーへの有望な経路を提供するが、学習は非効率な早期探索とコストのかかる失敗によって妨げられる。
本稿では,サンプルベースモデル予測制御(MPC)を実世界のデクスタラスRLの足場として利用し,人間の実演や修正行動なしに学習中に構造化された事前経験とタスク指向指導を提供するフレームワークを提案する。
MPCトラジェクトリの小さなセットは、まずオフラインのリプレイバッファをポップアップさせ、アクターと批評家を事前訓練するために使用される。
オンライン学習中、MPCはデータ収集を断続的にガイドし、外部のSoft Actor-Critic学習者は、事前のMPC経験と新たに収集された物理的相互作用の両方からトレーニングを行い、制御は徐々に学習方針に移行する。
ハードウェア上で12分間に収集された20のMPCトラジェクトリから初期化した16-DoF Allegroハンドによる連続的手動回転では、オンラインRLの7分後に100\%の成功に達し、トレーニング中に平均3つのオブジェクトがドロップされる。
20分間のオンライン学習の後、このポリシーはMPCコントローラの5倍以上の回転速度を達成し、ドロップなしで1000回の連続回転を完了する。
アブレーションは、MPCベースの事前トレーニング、MPC経験の維持、オンラインMPCガイダンスの補完的な利点を示し、追加実験は、新しいオブジェクトジオメトリへの迅速な適応と、目標条件の再調整の成功を示す。
関連論文リスト
- Accelerating and Scaling MPC-Guided Reinforcement Learning for Humanoid Locomotion and Manipulation [18.311232755848888]
ヒューマノイドモーションコントロールでは、モデル予測制御(MPC)は物理的に基底的な予測と制約処理を提供する。
強化学習(RL)は、大規模なシミュレーションを通じて、堅牢な全身スキルを実現する。
本研究は,MPC-RLと呼ばれるヒューマノイド移動・操作のための訓練時間MPC指導の効率化に関する研究である。
論文 参考訳(メタデータ) (2026-06-04T04:12:47Z) - Beyond Conservative Automated Driving in Multi-Agent Scenarios via Coupled Model Predictive Control and Deep Reinforcement Learning [7.804905867413516]
モデル予測制御(MPC)は、最適化による構造化制約処理を提供する。
深層強化学習(Deep Reinforcement Learning, RL)は、経験から適応的な行動を学ぶが、安全保証に苦慮することが多い。
マルチエージェントシナリオにおけるナビゲーション性能を改善するための統合MPC-RLフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-15T13:58:38Z) - MePo: Meta Post-Refinement for Rehearsal-Free General Continual Learning [47.195830952416294]
PTMs-based General Continual Learning (GCL) のためのMeta Post-Refinement (MePo) という革新的なアプローチを導入する。
MePoは、事前学習データから擬似タスクシーケンスを構築し、事前訓練されたバックボーンを洗練するための双方向メタラーニングパラダイムを開発する。
MePoはプラグイン戦略として機能し、さまざまなGCLベンチマークや事前訓練されたチェックポイントで大幅なパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-02-08T12:15:35Z) - Fine-Tuning of Neural Network Approximate MPC without Retraining via Bayesian Optimization [81.35990332700389]
近似モデル予測制御(AMPC)は、MPCの動作をニューラルネットワークで模倣することを目的としている。
デプロイメント中、基盤となるMPCのパラメータは通常、微調整されなければならない。
最近の研究は、MPC最適化問題の近似感度を用いてAMPCを調整することなく適用することでこの問題に対処している。
論文 参考訳(メタデータ) (2025-12-16T12:24:08Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - UI-S1: Advancing GUI Automation via Semi-online Reinforcement Learning [78.86567400365392]
オフライン軌道上でオンラインRLをシミュレートする新しいパラダイムであるセミオンライン強化学習を提案する。
長期トレーニング信号をキャプチャするために、Semi-online RLは報酬計算に割引先を返す。
実験の結果,Semi-online RLは4つの動的ベンチマークで7Bモデル間でSOTA性能を実現することがわかった。
論文 参考訳(メタデータ) (2025-09-15T03:24:08Z) - Fast Adaptation with Behavioral Foundation Models [82.34700481726951]
教師なしゼロショット強化学習は、行動基礎モデルの事前学習のための強力なパラダイムとして登場した。
有望な結果にもかかわらず、ゼロショットポリシーは、教師なしのトレーニングプロセスによって引き起こされるエラーにより、しばしば準最適である。
本稿では,事前訓練されたBFMの低次元タスク埋め込み空間を探索し,ゼロショットポリシーの性能を急速に向上させる高速適応手法を提案する。
論文 参考訳(メタデータ) (2025-04-10T16:14:17Z) - Toward Scalable Multirobot Control: Fast Policy Learning in Distributed MPC [22.644778818620185]
本稿では,スケーラブルなマルチロボット制御のための分散学習ベース予測制御(DLPC)フレームワークを提案する。
オープンループ制御列を計算する従来のDMPC法とは異なり,本手法は数値解法を使わずに,MSSに対して明示的なクローズループDMPCポリシーを生成する。
学習したコントロールポリシーは、さまざまなロボットスケールでMSSにオンラインにデプロイでき、大規模MSSのスケーラビリティと転送性を向上させることができる。
論文 参考訳(メタデータ) (2024-12-27T14:31:52Z) - FastRLAP: A System for Learning High-Speed Driving via Deep RL and
Autonomous Practicing [71.76084256567599]
本稿では、自律型小型RCカーを強化学習(RL)を用いた視覚的観察から積極的に駆動するシステムを提案する。
我々のシステムであるFastRLAP (faster lap)は、人間の介入なしに、シミュレーションや専門家によるデモンストレーションを必要とせず、現実世界で自律的に訓練する。
結果として得られたポリシーは、タイミングブレーキや回転の加速度などの突発的な運転スキルを示し、ロボットの動きを妨げる領域を避け、トレーニングの途中で同様の1対1のインタフェースを使用して人間のドライバーのパフォーマンスにアプローチする。
論文 参考訳(メタデータ) (2023-04-19T17:33:47Z) - Model Predictive Control via On-Policy Imitation Learning [28.96122879515294]
我々は,データ駆動型モデル予測制御のための新しいサンプル複雑性結果と性能保証を開発する。
我々のアルゴリズムは制約付き線形MPCの構造を用いており、解析は明示的なMPC解の特性を用いて、最適性能を達成するのに必要なオンラインMPCトラジェクトリの数を理論的に制限する。
論文 参考訳(メタデータ) (2022-10-17T16:06:06Z) - AWAC: Accelerating Online Reinforcement Learning with Offline Datasets [84.94748183816547]
提案手法は,従来の実演データとオンライン体験を組み合わせることで,スキルの素早い学習を可能にする。
以上の結果から,事前データを組み込むことで,ロボット工学を実践的な時間スケールまで学習するのに要する時間を短縮できることが示唆された。
論文 参考訳(メタデータ) (2020-06-16T17:54:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。