論文の概要: RoboFFT: Finetuning generative robot policy via online reinforcement learning with forward process
- arxiv url: http://arxiv.org/abs/2609.32236v1
- Date: Sat, 26 Sep 2026 04:52:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 18:35:30.308897
- Title: RoboFFT: Finetuning generative robot policy via online reinforcement learning with forward process
- Title(参考訳): RoboFFT: 前処理によるオンライン強化学習による生成ロボットポリシーの微調整
- Abstract要約: 生成ロボットポリシーを微調整するための前処理強化学習フレームワークであるRoboFFTを提案する。
本研究では,代表シミュレーションベンチマークを用いて,RoboFFTを一般的な生成ロボットポリシーで評価する。
さらに,RoboFFTを実世界のRLフレームワークに統合し,実世界のタスクにおいて有効性を示す。
- 参考スコア(独自算出の注目度): 22.898652220603026
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generative models, such as diffusion and flow-based models, have shown strong promise for robot policy learning by capturing complex and multimodal action distributions from demonstrations. However, policies trained solely with imitation learning often suffer from imperfect demonstrations and distributional shifts, while further improvement typically requires additional expert data. Reinforcement learning offers a natural solution through environment interaction, but effectively finetuning generative robot policies remains challenging due to the intractability of likelihood estimation. In this work, we propose RoboFFT, a forward-process reinforcement learning framework for finetuning generative robot policies, which applies forward noising to sampled actions and uses the weighted score / flow matching loss to construct a surrogate policy ratio for PPO-style updates. We evaluate RoboFFT with popular generative robot policies on representative simulation benchmarks, including long-horizon planning and sparse reward settings. Extensive experiments and analysis demonstrate that RoboFFT consistently improves performance while achieving better stability and training efficiency. We further integrate RoboFFT into a real world RL framework and demonstrate its effectiveness in real world tasks. Project website: https://student-of-holmes.github.io/RoboFFT/.
- Abstract(参考訳): 拡散モデルやフローベースモデルのような生成モデルは、デモから複雑でマルチモーダルな行動分布をキャプチャすることで、ロボットのポリシー学習に強く期待されている。
しかしながら、模倣学習にのみ訓練されたポリシーは、しばしば不完全な実証と分散シフトに悩まされるが、さらなる改善は通常、追加の専門家データを必要とする。
強化学習は環境相互作用を通じて自然な解を提供するが、推定の難易度のため、効果的に生成ロボットポリシーを微調整することは困難である。
そこで本研究では,PPO方式の更新のためのサロゲートポリシ比を構築するために,サンプル動作にフォワードノイズを付与し,重み付けスコア/フローマッチング損失を用いて,生成ロボットポリシーを微調整するプロセス強化学習フレームワークであるRoboFFTを提案する。
我々は,長期計画やスパース報酬設定を含む代表シミュレーションベンチマークに基づいて,RoboFFTを一般的な生成ロボットポリシーで評価する。
大規模な実験と分析により、RoboFFTは安定性とトレーニング効率を向上しつつ、一貫して性能を改善していることが示された。
さらに,RoboFFTを実世界のRLフレームワークに統合し,実世界のタスクにおいて有効性を示す。
プロジェクトウェブサイト: https://student-of-holmes.github.io/RoboFFT/.com
関連論文リスト
- Reinforcement Learning for Real-Time Vision-Language-Action Policies [71.61893237919794]
Real-Time EXPO-FTはリアルタイムVLAポリシーを微調整するためのRLフレームワークである。
Kinetixベンチマークでは、Real-Time EXPO-FTにより、遅延ポリシーが最高のパフォーマンスを達成することができる。
4つの動的な実世界のタスクにおいて、Real-Time EXPO-FTは平均的なポリシー性能を42%から97%に改善する。
論文 参考訳(メタデータ) (2026-09-16T06:38:36Z) - Large Reward Models: Generalizable Online Robot Reward Generation with Vision-Language Models [19.819472980239826]
我々は最先端のVLMに基づく堅牢でスケーラブルな報酬モデルを開発する。
我々は、これらのVLM報酬を用いて、閉ループ方式で準最適動作を補正するモデルを導出する。
論文 参考訳(メタデータ) (2026-03-17T02:22:16Z) - Scalable Dexterous Robot Learning with AR-based Remote Human-Robot Interactions [8.111267700755986]
本稿では,手軽なロボットアームハンドシステムにおける操作のためのスケーラブルなロボット学習に焦点を当てた。
本稿では,汎用的な操作タスク問題に対処するための統一的なフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-07T03:47:21Z) - WorldGym: World Model as An Environment for Policy Evaluation [41.204900701616914]
WorldGymは、実環境のプロキシとして機能する自動回帰、アクション条件付きビデオ生成モデルである。
ポリシーはモンテカルロの世界モデルによるロールアウトを通じて評価され、視覚言語モデルが報酬を提供する。
We show that WorldGym can maintain relative policy rankings across different policy version, sizes, and training checkpoints。
論文 参考訳(メタデータ) (2025-05-31T15:51:56Z) - Robotic World Model: A Neural Network Simulator for Robust Policy Optimization in Robotics [50.191655141020505]
この研究は、長期水平予測、エラー蓄積、およびsim-to-real転送の課題に対処することで、モデルに基づく強化学習を前進させる。
スケーラブルでロバストなフレームワークを提供することで、現実のアプリケーションにおいて適応的で効率的なロボットシステムを実現することができる。
論文 参考訳(メタデータ) (2025-01-17T10:39:09Z) - Robot Fine-Tuning Made Easy: Pre-Training Rewards and Policies for
Autonomous Real-World Reinforcement Learning [58.3994826169858]
ロボット強化学習のためのリセット不要な微調整システムであるRoboFuMEを紹介する。
我々の洞察は、オフラインの強化学習技術を利用して、事前訓練されたポリシーの効率的なオンライン微調整を確保することである。
提案手法では,既存のロボットデータセットからのデータを組み込んで,目標タスクを3時間以内の自律現実体験で改善することができる。
論文 参考訳(メタデータ) (2023-10-23T17:50:08Z) - Fast Lifelong Adaptive Inverse Reinforcement Learning from Demonstrations [2.1858709012908903]
我々は,新しいLfDフレームワークであるFast Lifelong Adaptive Inverse Reinforcement Learning (FLAIR)を提案する。
FLAIRが適応性(ロボットが不均一でユーザ固有のタスク嗜好に適応する)、効率(ロボットがサンプル効率のよい適応を達成する)、スケーラビリティを実証的に検証する。
FLAIRは3つのコントロールタスクでベンチマークを上回り、ポリシーリターンが平均57%改善し、デモモデリングに必要なエピソードが平均78%減少した。
論文 参考訳(メタデータ) (2022-09-24T02:48:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。