論文の概要: VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2609.04355v2
- Date: Wed, 09 Sep 2026 09:42:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 15:10:00.970072
- Title: VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models
- Title(参考訳): VLA精度:ビジョン・ランゲージ・アクションモデルの効率的なリアルタイムオンラインRLのための非対称コブートストラップ
- Authors: Chenyu Su, Zhaolong Shen, Yuan Qian, Chen Qian, Rui Zhang, Feng Yan, Weixing Chen, Fei Zhang, Jiamin Wang, Shuang Cong, Weiwei Shang,
- Abstract要約: 事前訓練された視覚言語アクション(VLA)モデルは広い操作を可能にするが、精度と再現性を必要とするタスクでは信頼性が保たれる。
実世界のオンライン強化学習(RL)をVLAポストトレーニングに適用することで、デモだけでなく、自律的な試行錯誤の改善が可能になる。
Asymmetric Co-BootstrappingアルゴリズムとACoB-Streamアーキテクチャを特徴とする,効率的な実世界のオンラインRLフレームワークであるVLA-Precisionを提案する。
- 参考スコア(独自算出の注目度): 18.46719160646894
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pretrained vision-language-action (VLA) models enable broad manipulation but remain unreliable in tasks demanding precision and repeatability. Applying real-world online reinforcement learning (RL) to VLA post-training enables autonomous trial-and-error improvement beyond demonstrations alone, but exposes two bottlenecks: 1) unreliable value signals can induce policy drift; 2) large-VLA overhead constrains throughput and sample efficiency. To address these challenges, we present VLA-Precision, an efficient real-world online RL framework featuring the Asymmetric Co-Bootstrapping (ACoB) algorithm and the ACoB-Stream architecture. Specifically, ACoB establishes asymmetric co-bootstrapping across timescales: early intervention-guided behavioral learning rapidly improves policy performance while enhancing online experience quality. As autonomous experience accumulates, global return propagation and local preference ranking progressively calibrate value estimates, yielding relative action advantages for reference-regularized policy improvement while suppressing drift. To enable ACoB on large VLAs, we develop ACoB-Stream, a closed-loop experience--policy architecture that establishes invariant-state decoupling and on-demand streaming as design principles, delivering up to 10.9$\times$ improvements in throughput and computational efficiency. Extensive evaluations on nine high-precision chemistry tasks across four categories and four robot embodiments show that VLA-Precision achieves 98.3\% mean success rate in 45.8 min/task, with 27.6 s episodes running at 1.2$\times$ and 1.8$\times$ the speeds of VLA and RL baselines. Resources are available at https://vla-precision.github.io.
- Abstract(参考訳): 事前訓練された視覚言語アクション(VLA)モデルは広い操作を可能にするが、精度と再現性を必要とするタスクでは信頼性が保たれる。
実世界のオンライン強化学習(RL)をVLAポストトレーニングに適用することで、デモだけでなく、自律的な試行錯誤の改善が可能になるが、2つのボトルネックを露呈する。
1) 信頼できない値信号は,政策ドリフトを誘導することができる。
2大VLAオーバーヘッドはスループットとサンプル効率を制約する。
これらの課題に対処するために,Asymmetric Co-Bootstrapping (ACoB)アルゴリズムとACoB-Streamアーキテクチャを備えた,効率的な実世界のオンラインRLフレームワークであるVLA-Precisionを提案する。
早期介入指導型行動学習は、オンライン体験の質を高めながら、政策パフォーマンスを急速に向上させる。
自律的な経験が蓄積するにつれて、グローバルリターンの伝播と局所的嗜好のランク付けが徐々に値の推定を調整し、ドリフトを抑えながら基準規則化された政策改善に対する相対的な行動優位性が得られる。
大規模VLA上でのACoBを実現するために,ACoB-Streamを開発した。ACoB-Streamは非変動状態分離とオンデマンドストリーミングを設計原則として確立し,スループットと計算効率を最大10.9$\timesで改善する。
VLA-Precisionは45.8 min/taskで平均成功率98.3 %、1.2$\times$と1.8$\times$で27.6 sのエピソードが走る。
リソースはhttps://vla-precision.github.ioで公開されている。
関連論文リスト
- EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models [84.73890225707264]
提案するEXPO-FTは,事前学習したVLAポリシーの安定かつサンプル効率の良いRL微調整システムである。
本システムは,オンラインロボットデータの平均19.1分以内の全ての評価課題に対して,完全なタスク性能(30/30の成功)を実現する。
我々は、ロボット工学におけるVLAモデルのより広範なRLファインタニング導入を促進することを目的とした、オープンソースのロバスト性をリリースする。
論文 参考訳(メタデータ) (2026-05-25T06:31:03Z) - LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models [13.30873593845724]
LoopVLAは、表現の洗練、アクション予測、十分性推定を学習する、リカレントなVision-Language-Actionアーキテクチャである。
この結果から,LoopVLAはVLAポリシーの効率性向上のフロンティアを推し進め,パラメータを45%削減し,推論スループットを最大1.7倍向上させることを示した。
論文 参考訳(メタデータ) (2026-05-11T03:51:22Z) - A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model [112.9420001646428]
VLA(Vision-Language-Action)モデルは、オープンワールドロボット操作の強力なパラダイムとして登場したが、実際の展開はコストに制約されることが多い。
我々は、低コストで高スループットな推論のために設計された、完全にオープンソースで透明なVLAフレームワークであるA1を提示する。
A1は最先端の成功率を達成すると同時に、推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-04-07T10:18:40Z) - VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning [14.099306230721245]
VLA-RLは、オンライン収集データをテスト時に改善する探索ベースのフレームワークである。
自動抽出タスクセグメントにアノテートされた擬似報酬ラベルに基づいてトレーニングされたロボットプロセス報酬モデルとして、事前学習された視覚言語モデルを微調整する。
VLA-RLにより、OpenVLA-7BはLIBEROの40の挑戦的なロボット操作タスクにおいて、最強の微調整ベースラインを4.5%超えることができる。
論文 参考訳(メタデータ) (2025-05-24T14:42:51Z) - Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success [100.226572152954]
視覚言語アクションモデル(VLA)のための最適化された微調整レシピを提案する。
われわれのレシピはOpenVLAの4つのタスクスイートの平均成功率を76.5%から97.1%に引き上げ、アクション生成のスループットを26$times$に向上させた。
実世界の評価において、我々の微調整のレシピにより、OpenVLAはバイマガルALOHAロボット上でデクスタラスで高周波な制御タスクをうまく実行することができる。
論文 参考訳(メタデータ) (2025-02-27T00:30:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。