論文の概要: Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2607.16506v1
- Date: Fri, 17 Jul 2026 21:00:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.170429
- Title: Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models
- Title(参考訳): ビジョン・ランゲージ・アクションモデルを用いた長距離ロボットマニピュレーションの予測残差RL
- Authors: Yuhan Liu, Xinyu Zhang, Litao Liu, Abdeslam Boularias,
- Abstract要約: VLA(Vision-Language-Action)ポリシーは、強力な汎用的な操作先を提供するが、厳密で接触に富んだアセンブリでは失敗することが多い。
凍結VLA基本方針に対する残留強化学習において,この障害モードを示す。
本稿では,各サブタスクのスパース成功報酬をオフライン推定フォレスト値で加算することにより,ハンドオフ品質を最適化するResidual RLを提案する。
- 参考スコア(独自算出の注目度): 32.14222486099161
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) policies offer strong general-purpose manipulation priors, but often fail on tight-tolerance, contact-rich assembly due to long-horizon credit assignment and subtask coupling: a state that is geometrically successful for the current skill can be brittle for downstream skills. We show this failure mode in residual reinforcement learning (RL) over a frozen VLA base policy: constant sparse success rewards improve each subtask in isolation yet yield little or no gain when skills are chained, because terminal state quality is uncontrolled. We propose Foresight Residual RL, which optimizes handoff quality by augmenting each subtask's sparse success reward with an offline-estimated foresight value -- the probability of future subtask success conditioned on the terminal state of the current subtask. Concretely, we (i) train a visual foresight predictor from images of terminal states of the base policy, labeled using downstream rollout statistics, and (ii) train residual policies via backward foresight induction, using the predictor output as a reward multiplier. On a three-phase wrench-based nut-tightening assembly task in Isaac Gym (grasp, move-insert, rotate), our method achieves 85.6% full-task success, outperforming standard subtask residual RL (54.5%) and VLA baselines, while leaving per-subtask success unchanged. These results highlight that improving long-horizon performance requires shaping which successful states are produced at each sub-task, not only whether success occurs.
- Abstract(参考訳): VLA(Vision-Language-Action)ポリシーは、強力な汎用的な操作先を提供するが、長い水平のクレジット割り当てとサブタスクの結合による厳密な耐性、コンタクトリッチなアセンブリでは失敗することが多い。
凍結したVLA基本方針よりも後続強化学習(RL)において、この障害モードが示される: 定常スパース成功報酬は、各サブタスクを単独で改善するが、終端状態の品質が制御されないため、スキルが連鎖された場合、ほとんど、あるいは全く利得を得られない。
本稿では,各サブタスクのスパース成功報酬を,現在サブタスクの端末状態に条件付けされている将来のサブタスク成功確率であるオフライン推定フォレスト値で加算することにより,ハンドオフ品質を最適化するフォレスト残差RLを提案する。
具体的には
一 下流のロールアウト統計を用いてラベル付けされた基本方針の端末状態の画像から視覚的監視予測器を訓練すること。
二 報酬乗算器として予測器出力を用いて、後方視差誘導による残留ポリシーを訓練すること。
アイザック・ギム(草地, 移動インサート, 回転)の3段階のナッツ密閉組立作業において, 本手法は85.6%のフルタスク成功を達成し, 標準サブタスク残差RL(54.5%)とVLAベースラインを上回り, サブタスク当たりの成功は変わらない。
これらの結果は,成功の度合いだけでなく,各サブタスクで成功状態が生成されるような形成を必要とすることを強調した。
関連論文リスト
- RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models [60.17417174639865]
VLA(Vision-Language-Action)モデルは、大規模な事前訓練を通じて幅広い身体的能力を取得する。
一般的な治療法であるポストトレーニングは、タスク固有のパフォーマンスを改善するが、事前トレーニングに価値をもたらすジェネラリスト能力は制限される。
SVAは凍結したVLAポリシーを長期的結果の認識と組み合わせたフレームワークである。
論文 参考訳(メタデータ) (2026-07-04T07:53:10Z) - Learning Process Rewards via Success Visitation Matching for Efficient RL [54.67547527674048]
本稿では,スパース結果報酬を高密度プロセス報酬に変換するための簡単な手法を提案する。
我々のアプローチは、以前の成功と失敗のエピソードを区別するために差別者を訓練することに依存しています。
この報酬は、タスクの成功に対応するものだけでなく、すべての州への訪問に対応するポリシーをインセンティブにすることで、タスク完了に向けた進捗が進められているかどうかについての深いフィードバックを提供する。
論文 参考訳(メタデータ) (2026-06-22T17:30:24Z) - Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes [40.20394793623452]
事前トレーニングされたVLAポリシーがオンラインRLを介して微調整されると、各ロールアウトエピソードは単一のバイナリ結果のみを生成する。
階層的アドバンテージ・重み付き行動クローン (HABC) を提案する。
HABCは教師付き微調整(SFT)ベースラインを36%、44%、12%から92%、88%、38%で成功している。
論文 参考訳(メタデータ) (2026-06-15T17:57:14Z) - EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models [84.73890225707264]
提案するEXPO-FTは,事前学習したVLAポリシーの安定かつサンプル効率の良いRL微調整システムである。
本システムは,オンラインロボットデータの平均19.1分以内の全ての評価課題に対して,完全なタスク性能(30/30の成功)を実現する。
我々は、ロボット工学におけるVLAモデルのより広範なRLファインタニング導入を促進することを目的とした、オープンソースのロバスト性をリリースする。
論文 参考訳(メタデータ) (2026-05-25T06:31:03Z) - Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States [4.1864205728857256]
Vision-Language-Action(VLA)モデルは、WebスケールのVision-Language Model(VLM)事前トレーニングから、強力な知覚的事前学習を活用する。
これを軽減するために、コントラスト概念活性化ステアリング(COAST)を提案する。
COASTは、目標となるロボットタスクに対して成功クリティカルなサブスペースを特定するために概念を使用する。
論文 参考訳(メタデータ) (2026-05-16T20:28:21Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - Generalizable Dense Reward for Long-Horizon Robotic Tasks [10.301325532021218]
VLM(Vision-Language Models)は、タスクを検証可能なサブタスクに分解する。
自己確実性は、PPOファインタニング全体を通じてステップごとの本質的なガイダンスを提供する。
CHORESベンチマークでは、VLLRは事前訓練されたポリシーよりも最大56%の絶対的な成功率を達成する。
論文 参考訳(メタデータ) (2026-03-31T02:05:07Z) - PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation [27.791908160098625]
PALMは、インタラクション中心のアベイランス推論とサブタスクプログレスキューに関するポリシー学習を構築する。
Palmはシミュレーションや実世界の実験において、一貫してベースラインを上回っている。
論文 参考訳(メタデータ) (2026-01-11T21:00:58Z) - Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-Critic [42.57662196581823]
高品質な$Q$値関数の学習は、多くの現代のオフポリシーディープ強化学習(RL)アルゴリズムの成功に重要な役割を果たしている。
一般的な視点から考えると、RLトレーニングプロセスの後半段階では、$Q$-valueが過小評価されることが多い。
本稿では,Blended Exploitation and Exploration (BEE)演算子を提案する。
論文 参考訳(メタデータ) (2023-06-05T13:38:14Z) - Offline Reinforcement Learning with Implicit Q-Learning [85.62618088890787]
現行のオフライン強化学習手法では、トレーニング中に見つからない行動の価値を問い合わせて、ポリシーを改善する必要がある。
本稿では,データセット外の動作を評価する必要のないオフラインRL手法を提案する。
この方法により、学習したポリシーは、一般化によってデータの最良の振る舞いを大幅に改善することができる。
論文 参考訳(メタデータ) (2021-10-12T17:05:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。