論文の概要: One Demonstration Is Enough for Real-World Robotic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.01651v1
- Date: Thu, 02 Jul 2026 03:23:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.650045
- Title: One Demonstration Is Enough for Real-World Robotic Reinforcement Learning
- Title(参考訳): 実世界におけるロボット強化学習のデモ
- Authors: Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang,
- Abstract要約: 本稿では,実世界のロボットRLにおける介入プロセスを完全に自動化するために,ひとつのデモンストレーションを利用するAutoSERLを提案する。
2つのロボットプラットフォームにまたがる6つの接触集中操作タスク(挿入、吊り下げ、ヒンジベースタスク)についてAutoSERLを評価した。
- 参考スコア(独自算出の注目度): 34.23164234669014
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning effective robot control policies on physical hardware is challenging due to costly data collection and the difficulty of reward specification. Prior work has incorporated demonstrations into reinforcement learning (RL), yet existing approaches either require large numbers of demonstrations or depend on continuous human intervention during training. To address these limitations, we present AutoSERL, a framework that leverages a single demonstration to fully automate the intervention process in real-world robot RL. The framework includes three complementary mechanisms to accomplish certain tasks: a sliding window intervention mechanism that continuously guides exploration to prevent local optima and unsafe deviations, a safety recovery mechanism that detects and corrects failure states via predefined trajectory recovery points, and an intervention termination criterion that automatically disables guidance once the policy can independently complete the task, preserving its exploration advantage. We evaluate AutoSERL on six contact-intensive manipulation tasks across two robot platforms, spanning insertion, hanging, and hinge-based tasks. AutoSERL consistently outperforms SERL initialized with 20 demonstrations, behavior cloning, and MILES -- a dedicated one-shot imitation learning baseline -- across all tasks while matching HIL-SERL, achieves 100% success rate on insertion tasks, and demonstrates improved robustness to positional variations, all from a single demonstration. Code and videos are available on our project website: https://autoserl.github.io/.
- Abstract(参考訳): 物理ハードウェア上で効果的なロボット制御ポリシーを学習することは、高価なデータ収集と報酬仕様の難しさのために困難である。
従来の研究は強化学習(RL)にデモを組み込んでいるが、既存のアプローチでは多数のデモを必要とするか、トレーニング中の継続的な人間の介入に依存している。
これらの制約に対処するため,実世界のロボットRLにおける介入プロセスを完全に自動化する,単一のデモンストレーションを活用するフレームワークであるAutoSERLを提案する。
このフレームワークは、特定のタスクを達成するための3つの補完的なメカニズムを含む: 局所的な最適かつ安全でない逸脱を防止するために探索を継続的にガイドするスライディングウインドウ介入機構、予め定義された軌道回復ポイントを介して障害状態を検出し修正する安全回復機構、そして、ポリシーが独立してタスクを完了し、その探索優位性を保ちながらガイダンスを自動的に無効にする介入終了基準。
2つのロボットプラットフォームにまたがる6つの接触集中操作タスク(挿入、吊り下げ、ヒンジベースタスク)についてAutoSERLを評価した。
AutoSERLは、HIL-SERLにマッチしながら、全タスクにわたって、20のデモ、ビヘイビアクローン、専用の1ショットの模倣学習ベースラインであるMILESで初期化されたSERLを一貫して上回り、挿入タスクで100%の成功率を獲得し、すべてのデモから、位置変化に対する堅牢性の改善を実証している。
コードとビデオは、プロジェクトのWebサイト(https://autoserl.github.io/)で公開されている。
関連論文リスト
- WM-DAgger: Enabling Efficient Data Aggregation for Imitation Learning with World Models [22.67666648771421]
効率的なデータ集約フレームワークであるWM-DAggerを提案する。
我々は、目の届くロボットアームと数発のデモでタスクを操作することに重点を置いている。
我々は、WM-DAggerを複数の実世界のロボットタスクで広範囲に検証する。
論文 参考訳(メタデータ) (2026-04-13T11:49:11Z) - CARE: Multi-Task Pretraining for Latent Continuous Action Representation in Robot Control [39.17038025776311]
CAREは、ロボットタスク実行のためのVLAモデルをトレーニングするために設計されたフレームワークである。
CAREはビデオテキストペアのみを活用することで、明示的なアクションラベルの必要性を排除している。
結果は, ロボット制御におけるCAREのスケーラビリティ, 解釈可能性, 有効性を示す。
論文 参考訳(メタデータ) (2026-01-30T02:28:32Z) - Dynamic Non-Prehensile Object Transport via Model-Predictive Reinforcement Learning [24.079032278280447]
バッチ強化学習(RL)とモデル予測制御(MPC)を組み合わせたアプローチを提案する。
提案手法は,ロボットウェイタータスクを実行するFranka Pandaロボットのシミュレーションおよび実世界実験により検証される。
論文 参考訳(メタデータ) (2024-11-27T03:33:42Z) - Affordance-Guided Reinforcement Learning via Visual Prompting [51.361977466993345]
Keypoint-based Affordance Guidance for Improvements (KAGI) は、視覚言語モデル(VLM)によって形成される報酬を自律的なRLに活用する手法である。
自然言語記述によって指定された多様な実世界の操作タスクにおいて、KAGIは自律的なRLのサンプル効率を改善し、30Kのオンライン微調整ステップでタスク完了を成功させる。
論文 参考訳(メタデータ) (2024-07-14T21:41:29Z) - Leveraging Sequentiality in Reinforcement Learning from a Single
Demonstration [68.94506047556412]
本稿では,複雑なロボットタスクの制御ポリシーを1つの実演で学習するために,シーケンシャルなバイアスを活用することを提案する。
本研究は, ヒューマノイド移動やスタンドアップなど, 模擬課題のいくつかを, 前例のないサンプル効率で解くことができることを示す。
論文 参考訳(メタデータ) (2022-11-09T10:28:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。