論文の概要: RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2607.26991v2
- Date: Thu, 30 Jul 2026 04:10:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.273542
- Title: RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models
- Title(参考訳): RL$^2$-VLA:視覚・言語・アクションモデルのためのテスト時間スケーリング付き適応RL潜在構成ステアリング
- Authors: Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer, William Wei Jie Teo, Yuanliang Ju, Qiao Gu, Guillaume Sartoretti,
- Abstract要約: RL2$はVision-Language-Action(VLA)モデルの適応型推論時ステアリングフレームワークである。
VLAアクションエキスパートから抽出した表現的潜伏者に基づく軽量オフラインRLポリシーを訓練する。
この構成的ステアリング戦略は、大規模な模倣学習の行動先行と、オフラインRLによって誘導される行動多様性を結合する。
- 参考スコア(独自算出の注目度): 8.012549967082832
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite the impressive visuomotor capabilities enabled by Vision-Language-Action (VLA) models, their performance often degrades on challenging and out-of-domain tasks. Recent test-time steering and scaling methods improve performance without extensive data collection and retraining, but action samples often remain concentrated around similar behaviors and therefore inherit correlated failure modes. Moreover, existing methods apply the same intervention strategy at every timestep, regardless of whether the base policy is already likely to succeed. To address these limitations, we introduce $RL^2$, an adaptive inference-time steering framework that leverages Reinforcement Learning on VLA Latents. First, we train a lightweight offline RL policy conditioned on expressive latents extracted from the VLA action expert and compose its flow velocity with that of the frozen VLA during inference. This compositional steering strategy combines the behavioral priors of large-scale imitation learning with the action diversity induced by offline RL beyond dominant demonstration modes. We further discover that inference-time steering follows fundamentally different scaling laws under success and failure states, revealing that action diversity is most beneficial when the base VLA is likely to fail, but can unnecessarily perturb already-accurate actions when success is likely. Building on this insight, $RL^2$ activates compositional steering only when failure is predicted. Across the SIMPLER and PolaRiS benchmarks, $RL^2$ improves success rates by up to +17.3% in out-of-domain settings, while ablations and scaling studies demonstrate the importance of latent representations and RL training. Finally, real-world experiments demonstrate that these gains transfer beyond simulation, establishing $RL^2$ as a practical and modular steering framework for VLA deployment.
- Abstract(参考訳): Vision-Language-Action(VLA)モデルによって実現された印象的なビジュモータ機能にもかかわらず、そのパフォーマンスは困難でドメイン外タスクで劣化することが多い。
最近のテストタイムステアリングとスケーリング手法は、広範囲なデータ収集と再トレーニングなしにパフォーマンスを向上させるが、アクションサンプルは、しばしば同様の振る舞いに集中し、従って相関する障害モードを継承する。
さらに、基本方針がすでに成功しているかどうかにかかわらず、既存の手法では、各時点に同じ介入戦略を適用している。
これらの制約に対処するために、VLAレイトラントにおける強化学習を活用する適応型推論時ステアリングフレームワークである$RL^2$を導入する。
まず、VLAアクションエキスパートから抽出された表現的潜伏剤を条件とした軽量オフラインRLポリシーをトレーニングし、推論中に凍結したVLAのそれと流れ速度を構成する。
この構成的ステアリング戦略は、大規模な模倣学習の行動先行と、オフラインRLによって誘導される行動多様性を、支配的なデモモードを超えて組み合わせる。
さらに、推論時ステアリングは、成功と失敗状態の下で、基本的に異なるスケーリング法則に従っており、基本VLAが失敗する可能性がある場合にアクションの多様性が最も有益であるが、成功の可能性が高い場合には、不必要に既に正確なアクションを妨害する可能性があることを明らかにする。
この洞察に基づいて、$RL^2$は、失敗が予測された場合にのみ構成ステアリングを活性化する。
SIMPLERとPolaRiSベンチマーク全体で、$RL^2$はドメイン外の設定で最大+17.3%の成功率を改善する。
最後に、実世界の実験では、これらの成果がシミュレーションを超えて、VLAデプロイメントのための実用的でモジュラーなステアリングフレームワークとして$RL^2$を確立することを実証している。
関連論文リスト
- ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning [53.17987412112712]
強化学習(Reinforcement Learning, RL)は、複雑な操作タスクにおけるビジョン・ランゲージ・アクション(VLA)モデルを改善する重要な可能性を示している。
本稿では,現在のVLA-RLフレームワークにおける探索の停滞ボトルネックについて検討する。
本稿では,VLA ポリシーを個別の行動事前に規定する簡易かつ汎用的なフレームワークである RL Exploration Token (ExToken) を紹介する。
論文 参考訳(メタデータ) (2026-07-14T16:04:41Z) - dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models [49.497309561043004]
我々は,学習目標を限界行動確率からサンプル生成経路の結合確率にシフトするtextbfdVLA-RLを提案する。
本手法は, LIBEROにおける textbf99.7% の成功率を達成する。
また、SFTベースラインに対してtextbf30.6%の改善を提供することで、RoboTwin 2.0上でのVLAベースの強力な結果も確立している。
論文 参考訳(メタデータ) (2026-06-22T17:19:03Z) - Jump-Start Reinforcement Learning with Vision-Language-Action Regularization [1.2599533416395767]
強化学習(RL)は、ロボット操作のための高周波閉ループ制御を可能にする。
現在の制限は、高速かつ正確な操作において直接の使用を妨げる。
探索と学習効率を向上させるために,VLAJS(Vision-Language-Action Jump-Starting)を提案する。
論文 参考訳(メタデータ) (2026-04-15T11:17:54Z) - Unleashing VLA Potentials in Autonomous Driving via Explicit Learning from Failures [14.313346858887286]
自律走行のためのVLA(Vision-Language-Action)モデルは、強化学習(Reinforcement Learning、RL)最適化時にしばしばパフォーマンス高原に到達する。
この停滞は、以前のスーパービジョン・ファインチューニング(SFT)によって制約された探査能力から生じる。
構造化された診断フィードバックでRLを増強するフレームワークであるELF-VLA(Explicit Learning from Failures)を提案する。
論文 参考訳(メタデータ) (2026-03-01T11:41:22Z) - Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning [88.42566960813438]
CalibRLは、制御可能な探索と専門家のガイダンスをサポートするハイブリッド政治RLVRフレームワークである。
CalibRLは政策エントロピーを誘導的に増加させ、目標分布を明らかにする。
ドメイン内設定とドメイン外設定の両方を含む8つのベンチマークの実験は、一貫した改善を示している。
論文 参考訳(メタデータ) (2026-02-22T07:23:36Z) - Found-RL: foundation model-enhanced reinforcement learning for autonomous driving [15.275134927543611]
エンドツーエンド自動運転(AD)の主流パラダイムとして強化学習(RL)が登場している。
Found-RLは、基礎モデルを使用してADのためのRLを効率的に拡張するプラットフォームである。
コアとなるイノベーションは非同期バッチ推論フレームワークで、シミュレーションループから重いVLM推論を分離する。
論文 参考訳(メタデータ) (2026-02-11T02:56:04Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model [62.889356203346985]
本稿では,モダリティ競合を処理する世界モデル拡張VLAフレームワークである Dual-STream diffusion (DUST) を提案する。
DUSTは標準のVLAベースラインと暗黙のワールドモデリングメソッドよりも最大6%向上する。
Franka Research 3による実世界のタスクでは、DUSTは成功率のベースラインを13%上回っている。
論文 参考訳(メタデータ) (2025-10-31T16:32:12Z) - SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning [81.7764584515496]
VLA(Vision-Language-Action)モデルは、ロボット操作の強力なパラダイムとして登場した。
これらのモデルは2つの根本的な課題に直面している。
VLAモデルに適した効率的な強化学習フレームワークであるSimpleVLA-RLを紹介する。
論文 参考訳(メタデータ) (2025-09-11T17:59:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。