論文の概要: Learning More from Less: Reinforcement Learning from Hindsight
- arxiv url: http://arxiv.org/abs/2607.09042v1
- Date: Fri, 10 Jul 2026 02:17:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.765292
- Title: Learning More from Less: Reinforcement Learning from Hindsight
- Title(参考訳): 少人数で学ぶ - Hindsightによる強化学習
- Authors: Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong,
- Abstract要約: 強化学習(Reinforcement Learning, RL)は、視覚-言語-行動モデル(VLA)の訓練後モデルに使用される。
我々は、実際に達成したタスクに対するロールアウトの失敗を評価して、後向きの学習をVLAの訓練後のRLにもたらすLearning from Hindsight(LfH)を紹介する。
- 参考スコア(独自算出の注目度): 19.802783289526598
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) is increasingly used to post-train vision-language-action (VLA) models, but every update consumes robot rollouts that are slow and costly to collect, making sample efficiency a central concern. Manipulation tasks typically provide only sparse rewards, so a weak policy fails almost every rollout early in training and has little to learn from, even when those failures execute coherent behavior. Such a failure, however, is a success at a different task. We present Learning from Hindsight (LfH), which brings hindsight relabeling to RL post-training of VLAs by scoring failed rollouts against the tasks they actually achieved. A single vision-language model relabels both the instruction and the reward, proposing a hindsight instruction for a group of failed rollouts and scoring how well each satisfies it, and the policy trains on the relabeled and original rollouts jointly. Because VLAs generalize across language, relabeling in language lets the policy learn more from the same trajectories. On out-of-distribution LIBERO-PRO tasks, where standard RL improves only slowly, LfH achieves $5\times$ improvement in sample efficiency, and outperforms a dense progress-reward baseline. The gains hold across VLA backbones and on a physical Franka robot.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は、訓練後の視覚-言語-アクション(VLA)モデルに使用されることが多いが、更新毎に、収集に遅くてコストのかかるロボットロールアウトが消費されるため、サンプル効率が中心的な関心事となっている。
操作タスクは、通常スパース報酬のみを提供するため、弱いポリシーはトレーニングの初期段階のほとんどすべてのロールアウトに失敗し、一貫性のある動作を実行しても、そこから学ぶことがほとんどない。
しかし、このような失敗は別のタスクで成功します。
我々は、実際に達成したタスクに対して、失敗に終わったロールアウトを得点することで、後向きの学習をVLAの訓練後RLにもたらすLearning from Hindsight (LfH)を提案する。
単一の視覚言語モデルでは、命令と報酬の両方をラベル付けし、失敗するロールアウトのグループに対する後見的な命令を提案し、それぞれがどれだけうまく満足するかをスコア付けし、ポリシーは緩和されたロールアウトとオリジナルのロールアウトで共同でトレーニングする。
VLAは言語にまたがって一般化されるため、言語で拡張することで、ポリシーは同じ軌跡からより多くを学ぶことができる。
標準RLが緩やかに改善される LIBERO-PRO タスクでは、LfH はサンプル効率を 5 倍改善し、高密度な進行逆ベースラインを上回ります。
ゲインはVLAのバックボーンとFrankaの物理的なロボットにまたがる。
関連論文リスト
- EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models [84.73890225707264]
提案するEXPO-FTは,事前学習したVLAポリシーの安定かつサンプル効率の良いRL微調整システムである。
本システムは,オンラインロボットデータの平均19.1分以内の全ての評価課題に対して,完全なタスク性能(30/30の成功)を実現する。
我々は、ロボット工学におけるVLAモデルのより広範なRLファインタニング導入を促進することを目的とした、オープンソースのロバスト性をリリースする。
論文 参考訳(メタデータ) (2026-05-25T06:31:03Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - Jump-Start Reinforcement Learning with Vision-Language-Action Regularization [1.2599533416395767]
強化学習(RL)は、ロボット操作のための高周波閉ループ制御を可能にする。
現在の制限は、高速かつ正確な操作において直接の使用を妨げる。
探索と学習効率を向上させるために,VLAJS(Vision-Language-Action Jump-Starting)を提案する。
論文 参考訳(メタデータ) (2026-04-15T11:17:54Z) - Generalizable Dense Reward for Long-Horizon Robotic Tasks [10.301325532021218]
VLM(Vision-Language Models)は、タスクを検証可能なサブタスクに分解する。
自己確実性は、PPOファインタニング全体を通じてステップごとの本質的なガイダンスを提供する。
CHORESベンチマークでは、VLLRは事前訓練されたポリシーよりも最大56%の絶対的な成功率を達成する。
論文 参考訳(メタデータ) (2026-03-31T02:05:07Z) - $\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving [75.29519604607111]
検証可能な報奨(RLVR)による強化学習は、大規模言語モデル(LLM)の推論性能を高めることを約束している。
チェーン・オブ・シークレット(CoT)の初期方向や品質が最適以下である場合、モデルが正しい答えに到達できないことがよく示される。
再解決による強化学習 (Reinforcement Learning with Re-solving, Re$2$) を導入し, LLM が非生産的推論経路を柔軟に放棄し,必要ならば解法を再開することを学ぶ。
論文 参考訳(メタデータ) (2026-03-07T13:17:46Z) - Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning [30.941068379610794]
我々は,スクラッチからトレーニングした大規模事前学習型視覚言語行動(VLA)モデルの挙動について検討した。
トレーニング済みのVLAは、スクラッチからトレーニングした小さなポリシーモデルと比較して、忘れることに対して極めて抵抗的であることが分かりました。
本分析により,下流の連続学習性能において,事前学習が重要な役割を担っていることが明らかとなった。
論文 参考訳(メタデータ) (2026-03-04T08:03:13Z) - Learning Affordances at Inference-Time for Vision-Language-Action Models [50.93181349331096]
ロボット工学において、VLA(Vision-Language-Action Model)は複雑な制御タスクを解くための有望な道を提供する。
本稿では,VLAの低レベルポリシーを過去の経験を条件とした高レベルVLMに接続するLITEN(Learning from Inference-Time Execution)を紹介する。
提案手法は,低レベルVLAの計画の生成と実行を行う推論フェーズと,その結果を反映した評価フェーズとを反復する。
論文 参考訳(メタデータ) (2025-10-22T16:43:29Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning [81.7764584515496]
VLA(Vision-Language-Action)モデルは、ロボット操作の強力なパラダイムとして登場した。
これらのモデルは2つの根本的な課題に直面している。
VLAモデルに適した効率的な強化学習フレームワークであるSimpleVLA-RLを紹介する。
論文 参考訳(メタデータ) (2025-09-11T17:59:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。