論文の概要: WorldSample: Closed-loop Real-robot RL with World Modelling
- arxiv url: http://arxiv.org/abs/2607.02431v1
- Date: Thu, 02 Jul 2026 17:00:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.937228
- Title: WorldSample: Closed-loop Real-robot RL with World Modelling
- Title(参考訳): WorldSample:World Modellingを搭載したクローズドループリアルロボットRL
- Authors: Yuquan Xue, Le Xu, Zeyi Liu, Zhenyu Wu, Zhengyi Gu, Xinyang Song, Bofang Jia, Ziwei Wang,
- Abstract要約: 強化学習(RL)は模倣学習(IL)の実証・被覆限界を克服することができる
本稿では,物理ロールアウト,ワールドモデル生成,ポリシー改善間の実合成ループを閉じる実ロボットRLのためのフレームワークであるWorldSampleを提案する。
WorldSampleは、訓練後の世界モデルを通じて高忠実な合成遷移を生成し、視覚幻覚を大幅に低下させる。
- 参考スコア(独自算出の注目度): 15.018458913680774
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) can overcome the demonstration-coverage limitation of imitation learning (IL) by allowing robots to improve through trial-and-error interaction beyond the states observed in demonstrations. However, deploying RL on real robots remains constrained by high interaction costs, since each physical rollout is costly and reflects only one realized action-outcome path. To address this challenge, we propose WorldSample, a physically grounded data augmentation framework for real-robot RL that closes a real-synthetic loop between physical rollouts, world-model generation, and policy improvement. Grounded on real rollouts, WorldSample generates high-fidelity synthetic transitions through a post-trained world model, which greatly lowers the visual hallucination. Specifically, rather than simply using these transitions as real-world experience, WorldSample introduces Policy-Paced Learning (PPL) to regulate the training process through sample selection and scheduling, balancing useful augmentation against value overestimation and mitigating the hallucination-induced noise. Experiments on robot manipulation tasks involving contact-rich and precise tasks show that WorldSample improves policy success rate by 28% while reducing training steps by 59% compared with baselines. Furthermore, WorldSample improves world model visual fidelity by 19.4dB in PSNR and 0.47 in SSIM over demonstration-only post-training, validating the effectiveness of the real-synthetic loop for both policy and world model performance.
- Abstract(参考訳): 強化学習(RL)は、模擬学習(IL)の実証・被覆制限を克服し、実証で観察された状態を超えた試行錯誤の相互作用を通じてロボットを改良することができる。
しかし、実際のロボットへのRLの展開は、各物理ロールアウトが高価であり、1つのアクションアウトカムパスのみを反映しているため、高コストで制約されている。
この課題に対処するため,本研究では,物理ロールアウト,ワールドモデル生成,ポリシー改善間の実合成ループを閉じる実ロボットRLのための物理基盤データ拡張フレームワークであるWorldSampleを提案する。
実際のロールアウトに基づいて、WorldSampleは訓練後の世界モデルを通じて高忠実な合成遷移を生成し、視覚幻覚を大幅に低下させる。
具体的には、これらの遷移を現実世界の経験として単に使うのではなく、WorldSampleは、サンプルの選択とスケジューリング、価値過大評価に対する有用な拡張のバランス、幻覚誘発ノイズの緩和を通じてトレーニングプロセスを制御するために、Policy-Paced Learning (PPL)を導入している。
接触が豊富で正確なタスクを含むロボット操作タスクの実験は、WorldSampleが方針成功率を28%改善し、トレーニングステップをベースラインと比較して59%削減したことを示している。
さらに、WorldSampleは、PSNRで19.4dB、SSIMで0.47の精度向上を実現し、実合成ループの有効性を検証する。
関連論文リスト
- Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training [54.896907620476675]
本稿では,学習世界モデルを用いた学習後学習フレームワークを提案する。
Hi-WMは中間状態をキャッシュし、ロールバックとブランチをサポートする。
我々は、剛性と変形性のあるオブジェクト相互作用と2つのポリシーバックボーンにまたがる3つの実世界の操作タスクについて、Hi-WMを評価する。
論文 参考訳(メタデータ) (2026-04-23T14:42:54Z) - ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation [90.4702774169675]
本稿では,古典シミュレーションとニューラルシミュレーションを組み合わせた合成シミュレーションというハイブリッド手法を提案する。
提案手法では,少数の実世界のデータを活用するクローズドループ・リアル・シモン・リアル・データ拡張パイプラインを利用する。
我々はニューラルシミュレーターをトレーニングし、古典的なシミュレーションビデオを現実世界の表現に変換し、現実の環境で訓練されたポリシーモデルの精度を向上させる。
論文 参考訳(メタデータ) (2026-04-13T12:25:45Z) - SPARR: Simulation-based Policies with Asymmetric Real-world Residuals for Assembly [13.3674466451862]
シミュレーション学習された基本方針と実世界の残留政策を組み合わせたハイブリッドアプローチを提案する。
本手法は,多種多様な組立作業におけるほぼ完全な成功率を実現する。
論文 参考訳(メタデータ) (2026-02-26T17:26:13Z) - VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model [87.75549463328836]
本研究の目的は、反復的なオンラインインタラクションにより、視覚言語アクション(VLA)モデルの性能と信頼性を向上させることである。
本稿では,実世界のロールアウトデータを用いて,世界モデルの忠実度を向上する簡易な反復改善アルゴリズムを提案する。
基本方針よりも39.2%の絶対成功率向上と、生成した合成ロールアウトによるトレーニングによる11.6%の改善を実現している。
論文 参考訳(メタデータ) (2026-02-12T15:21:47Z) - Coupled Local and Global World Models for Efficient First Order RL [10.305209288475817]
本稿では,シミュレータを完全に回避し,実環境とロボットのインタラクションから学習した世界モデル内のRLポリシーをトレーニングする手法を提案する。
提案手法は,FoG法を用いて,大規模拡散モデルを用いた政策訓練を可能にする。
提案手法の有効性をPush-T操作タスクで示し, 試料効率においてPPOを著しく上回る結果を得た。
論文 参考訳(メタデータ) (2026-02-05T21:57:41Z) - World4RL: Diffusion World Models for Policy Refinement with Reinforcement Learning for Robotic Manipulation [23.270985761700203]
我々は,ロボット操作のための事前学習ポリシーを洗練させるために,拡散型世界モデルを高忠実度シミュレータとして利用するフレームワーク World4RL を提案する。
World4RLは、高忠実な環境モデリングを提供し、一貫したポリシー改善を可能にし、模倣学習に比べて成功率を大幅に向上させる。
論文 参考訳(メタデータ) (2025-09-23T14:38:15Z) - WorldGym: World Model as An Environment for Policy Evaluation [41.204900701616914]
WorldGymは、実環境のプロキシとして機能する自動回帰、アクション条件付きビデオ生成モデルである。
ポリシーはモンテカルロの世界モデルによるロールアウトを通じて評価され、視覚言語モデルが報酬を提供する。
We show that WorldGym can maintain relative policy rankings across different policy version, sizes, and training checkpoints。
論文 参考訳(メタデータ) (2025-05-31T15:51:56Z) - Offline Robotic World Model: Learning Robotic Policies without a Physics Simulator [50.191655141020505]
強化学習(Reinforcement Learning, RL)は、ロボット制御において目覚ましい能力を示してきたが、高いサンプルの複雑さ、安全性の懸念、そしてシム・トゥ・リアルのギャップのため、依然として困難である。
物理シミュレータに頼らずに政策学習を改善するために不確実性を明示的に推定するモデルベースアプローチであるオフラインロボット世界モデル(RWM-O)を導入する。
論文 参考訳(メタデータ) (2025-04-23T12:58:15Z) - Robotic World Model: A Neural Network Simulator for Robust Policy Optimization in Robotics [50.191655141020505]
この研究は、長期水平予測、エラー蓄積、およびsim-to-real転送の課題に対処することで、モデルに基づく強化学習を前進させる。
スケーラブルでロバストなフレームワークを提供することで、現実のアプリケーションにおいて適応的で効率的なロボットシステムを実現することができる。
論文 参考訳(メタデータ) (2025-01-17T10:39:09Z) - Sim-to-Real Transfer with Incremental Environment Complexity for
Reinforcement Learning of Depth-Based Robot Navigation [1.290382979353427]
段階的環境複雑性を用いたソフト・アクター・クリティカル(SAC)トレーニング戦略を提案し,実世界における追加トレーニングの必要性を大幅に低減した。
アプリケーションは深度に基づくマップレスナビゲーションで、移動ロボットは、事前のマッピング情報なしで、散らかった環境で所定の経路点に到達すべきである。
論文 参考訳(メタデータ) (2020-04-30T10:47:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。