論文の概要: A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer
- arxiv url: http://arxiv.org/abs/2607.10892v1
- Date: Sun, 12 Jul 2026 19:48:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.561067
- Title: A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer
- Title(参考訳): Zero-Shot Sim-to-Real Transferを用いたマルチタスクブロックプッシュのための単一拡散ポリティ制御
- Authors: Haitong Ma, Haldun Balim, Yang Hu, Bo Dai, Na Li,
- Abstract要約: マルチタスクロボット操作のための強化学習(RL)を用いて,スクラッチからトレーニング拡散ポリシーを検討する。
我々は,複数形状のブロック処理タスクに対して,単一の拡散ポリシをトレーニングすることを目指している。
学習した拡散政策が環境条件の異なる実世界のタスクにゼロショットで移行するかどうかを評価する。
- 参考スコア(独自算出の注目度): 15.906272895307664
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion policies have shown promising empirical performance in representing and learning complex maneuvers for robots using behavior cloning (BC). In this paper, we explore training diffusion policies from scratch using reinforcement learning (RL) for multi-task robotic manipulation. Specifically, we aim to train a single diffusion policy for block-pushing tasks with multiple shapes. The proposed framework features a simple policy loss function, which is a reweighted evidence lower bound used in BC-based diffusion policy training and can seamlessly serve as the policy learning module in RL algorithms. To address the exploration challenges arising from the absence of demonstrations, we incorporate reverse curriculum generation and objective-centric representations. Combined with the expressiveness of diffusion policies, our design supports learning of multi-task block-pushing policies in our sparse-reward simulation setting. We further evaluate whether the trained diffusion policy transfers in zero-shot to real-world tasks under varying environmental conditions including goal positions, block shapes, block weights and surface friction, providing evidence that this pipeline can transfer to our real-world block-pushing setup under the tested variations.
- Abstract(参考訳): 拡散政策は、行動クローニング(BC)を用いたロボットの複雑な操作の表現と学習において有望な経験的性能を示した。
本稿では,マルチタスクロボット操作のための強化学習(RL)を用いたスクラッチからのトレーニング拡散ポリシーについて検討する。
具体的には,複数形状のブロック処理タスクに対して,単一の拡散ポリシをトレーニングすることを目的としている。
提案するフレームワークは,BC ベースの拡散政策トレーニングで使用される下限の重み付きエビデンスであり,RL アルゴリズムのポリシー学習モジュールとしてシームレスに機能する,シンプルなポリシ損失関数を特徴とする。
実演の欠如から生じる探索課題に対処するために,逆カリキュラム生成と客観中心表現を取り入れた。
拡散政策の表現性と相まって,スパース・リワードシミュレーション環境におけるマルチタスク・ブロック・プッシング・ポリシーの学習を支援する。
さらに, 目標位置, ブロック形状, ブロックウェイト, 表面摩擦など, 様々な環境条件下で, 訓練された拡散政策が実世界のタスクに移行するか否かを検証し, このパイプラインが実世界のブロックパッシング装置に移行可能であることを示す。
関連論文リスト
- Diffusion Policy through Conditional Proximal Policy Optimization [6.836651088754774]
拡散政策は、マルチモーダルな振る舞いをモデル化する強力な可能性を示している。
重要な課題は、拡散モデルの下でのアクションログのような計算の難しさである。
そこで本稿では,オンライン環境下での拡散政策を学習するための,新しい,効率的な手法を提案する。
論文 参考訳(メタデータ) (2026-03-05T04:12:13Z) - Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces [57.466101098183884]
強化学習(Reinforcement Learning, RL)は、現実の多くの問題に共通する大規模なアクション空間にスケールするために苦労する。
本稿では、複雑な環境下での高効率なポリシーとして、離散拡散モデルを訓練するための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-26T21:53:36Z) - From Imitation to Refinement -- Residual RL for Precise Assembly [19.9786629249219]
近年のビヘイビア・クローン(BC)の進歩により、ロボットに新しいタスクを教えるのが容易になった。
しかし、教育の容易さは信頼性の低いパフォーマンスを犠牲にしている。
我々は,BCの教えやすさと長期的能力を維持しながら信頼性を克服する,シンプルで効果的な方法であるResiPを考案した。
論文 参考訳(メタデータ) (2024-07-23T17:44:54Z) - Learning Multimodal Behaviors from Scratch with Diffusion Policy Gradient [26.675822002049372]
Deep Diffusion Policy Gradient (DDiffPG)は、マルチモーダルポリシーから学習する新しいアクター批判アルゴリズムである。
DDiffPGはマルチモーダルトレーニングバッチを形成し、モード固有のQ-ラーニングを使用して、RL目的の固有の欲求を緩和する。
さらに,本手法では,学習モードを明示的に制御するために,モード固有の埋め込みにポリシーを条件付けることができる。
論文 参考訳(メタデータ) (2024-06-02T09:32:28Z) - Decentralized Learning Strategies for Estimation Error Minimization with Graph Neural Networks [86.99017195607077]
統計的に同一性を持つ無線ネットワークにおける自己回帰的マルコフ過程のサンプリングとリモート推定の課題に対処する。
我々のゴールは、分散化されたスケーラブルサンプリングおよび送信ポリシーを用いて、時間平均推定誤差と/または情報の年齢を最小化することである。
論文 参考訳(メタデータ) (2024-04-04T06:24:11Z) - Distilling Reinforcement Learning Policies for Interpretable Robot Locomotion: Gradient Boosting Machines and Symbolic Regression [53.33734159983431]
本稿では, ニューラルRLポリシをより解釈可能な形式に蒸留する新しい手法を提案する。
我々は、RLを用いて専門家のニューラルネットワークポリシーを訓練し、(i)GBM、(ii)EBM、(iii)シンボリックポリシーに蒸留する。
論文 参考訳(メタデータ) (2024-03-21T11:54:45Z) - Co-learning Planning and Control Policies Constrained by Differentiable
Logic Specifications [4.12484724941528]
本稿では,高次元ロボットナビゲーションタスクを解くための新しい強化学習手法を提案する。
既存の強化学習アルゴリズムと比較して、より少ないサンプルで高品質なポリシーを訓練する。
提案手法は,高次元制御と政策アライメントによる準最適政策の回避にも有効である。
論文 参考訳(メタデータ) (2023-03-02T15:24:24Z) - Diffusion Policies as an Expressive Policy Class for Offline
Reinforcement Learning [70.20191211010847]
オフライン強化学習(RL)は、以前に収集した静的データセットを使って最適なポリシーを学ぶことを目的としている。
本稿では,条件付き拡散モデルを用いたディフュージョンQ-ラーニング(Diffusion-QL)を提案する。
本手法はD4RLベンチマークタスクの大部分において最先端の性能を実現することができることを示す。
論文 参考訳(メタデータ) (2022-08-12T09:54:11Z) - A Decentralized Policy Gradient Approach to Multi-task Reinforcement
Learning [13.733491423871383]
マルチタスク強化学習問題を解決するためのフレームワークを開発する。
目標は、異なる環境で効果的に機能する共通ポリシーを学ぶことである。
MTRLの2つの基本的な課題に注目する。
論文 参考訳(メタデータ) (2020-06-08T03:28:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。