論文の概要: FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation
- arxiv url: http://arxiv.org/abs/2606.26006v1
- Date: Wed, 24 Jun 2026 16:23:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.394563
- Title: FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation
- Title(参考訳): FORCE:バリューキャリブレーション・ウォームアップと自己蒸留による高効率VLA補強微細調整
- Abstract要約: FORCEは、両方の問題に取り組むことで微調整を安定化する3段階のフレームワークである。
FORCEは成功率を79%向上させ、RL法を10%向上させ、トレーニングを32.5%加速させた。
- 参考スコア(独自算出の注目度): 40.53898394579726
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models are often constrained by the imitation ceiling imposed by sub-optimal data. While Reinforcement Learning (RL) fine-tuning can surpass this limit, it is notoriously sample inefficient. This challenge arises from two core issues: (1) catastrophic initial unlearning due to an unstable Q-function and (2) inefficient policy updates caused by low-quality exploration data, often forcing a reliance on costly human interventions. We introduce FORCE, a 3-stage framework that stabilizes fine-tuning by tackling both issues. FORCE first incorporates a Value-Calibrated Warm-Up phase, utilizing on-policy rollouts to mitigate the distributional shift of the Q-function. Subsequently, during the online stage, this calibrated Q-function acts as a filter for both the policy's own action proposals and expert data, ensuring only high-value actions are used for the policy update. We evaluate FORCE on various simulation and real-world tasks, and the result shows that FORCE achieves a 79% absolute improvement in success rates and outperform prior RL methods by 10%, while accelerating training by 32.5%. Critically, it mitigates the common success rate drop and achieves this robust performance without human intervention, marking a significant step towards deploying capable and autonomous robotic agents.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、しばしば準最適データによって課される模倣天井によって制約される。
強化学習(Reinforcement Learning, RL)の微調整は、この限界を超える可能性があるが、非効率なサンプルとして悪名高い。
この課題は,(1)不安定なQ-関数による破滅的な初等学習と(2)低品質な探索データによる非効率な政策更新の2つから生じる。
両問題に対処することで微調整を安定化する3段階フレームワークであるFOCEを紹介する。
FORCEはまず、Q関数の分散シフトを軽減するために、政治上のロールアウトを利用するバリューキャリブレーション・ウォームアップフェーズを組み込む。
その後、オンライン段階では、この校正されたQ関数は、ポリシー独自のアクション提案と専門家データの両方のフィルタとして機能し、ポリシー更新に高価値なアクションのみが使用されることを保証する。
シミュレーションや実世界のタスクにおいてForceを評価した結果,Forceは成功率を79%向上させ,従来のRL法を10%向上させ,トレーニングを32.5%加速させた。
批判的に言えば、これは一般的な成功率の低下を軽減し、人間の介入なしにこの堅牢なパフォーマンスを実現し、有能で自律的なロボットエージェントの展開に向けた重要なステップとなる。
関連論文リスト
- PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models [50.232333672172395]
VLA(Vision-Language-Action)モデルは、ロボット操作の統一パラダイムを提供するが、実際のデプロイメントは実行効率によってボトルネックになることが多い。
強化学習に基づくポストトレーニングフレームワークである textbfPolicyTrim を提案する。
私たちのフレームワークは、タスクの成功率を損なうことなく、最大5.83$times$エンドツーエンドのデプロイメントスピードアップを提供します。
論文 参考訳(メタデータ) (2026-06-21T14:54:07Z) - Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes [40.20394793623452]
事前トレーニングされたVLAポリシーがオンラインRLを介して微調整されると、各ロールアウトエピソードは単一のバイナリ結果のみを生成する。
階層的アドバンテージ・重み付き行動クローン (HABC) を提案する。
HABCは教師付き微調整(SFT)ベースラインを36%、44%、12%から92%、88%、38%で成功している。
論文 参考訳(メタデータ) (2026-06-15T17:57:14Z) - Q-VGM: Q-Guided Value-Gradient Matching for Flow-Matching VLA Policies [14.519898493996891]
本稿では,Q-Guided Value-Gradient Matching (Q-VGM) を法外強化学習(RL)法として提案する。
Q-VGMは、生成モデルにおけるフローアライメントの値勾配ビューであるVGG-Flowを活用することで問題を回避している。
LIBEROでは、Q-VGMが75.0%から92.5%に、RoboTwin 2.0では76.4%から87.2%に、実際の2つのテーブルトップタスクでは40.0%から67.5%に上昇している。
論文 参考訳(メタデータ) (2026-06-06T07:10:25Z) - CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies [26.36935074374452]
フローベースの視覚言語アクション(VLA)ポリシーは、アクション生成に対して強い表現力を提供するが、基本的な非効率性に悩まされる。
本稿では, アクション生成を粗大なステップに再構成する粗大な2段階の定式化であるCF-VLAを提案する。
提案手法は,低NFE(Number of Function Evaluations)体制下で高い効率性能のフロンティアを確立する。
論文 参考訳(メタデータ) (2026-04-27T15:51:40Z) - Verified Critical Step Optimization for LLM Agents [67.05296684575445]
クリティカルステップ最適化は、検証されたクリティカルステップに優先学習を集中する。
メソッドは、専門家のデモンストレーションではなく、失敗するポリシーの軌道から始まります。
GAIA-Text-103とXBench-DeepSearchの実験では、CSOはSFTベースラインよりも37%、相対的に26%改善している。
論文 参考訳(メタデータ) (2026-02-03T11:41:02Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Continual Action Quality Assessment via Adaptive Manifold-Aligned Graph Regularization [53.82400605816587]
アクション品質アセスメント(AQA)は、ビデオにおける人間の行動を定量化し、スポーツスコアリング、リハビリテーション、スキル評価の応用を支援する。
大きな課題は、現実世界のシナリオにおける品質分布の非定常的な性質にある。
本稿では,進化する分布を扱うための連続学習機能を備えた連続AQA(Continuous AQA)を紹介する。
論文 参考訳(メタデータ) (2025-10-08T10:09:47Z) - A Perspective of Q-value Estimation on Offline-to-Online Reinforcement
Learning [54.48409201256968]
オフラインからオンラインへの強化学習(O2O RL)は、少数のオンラインサンプルを使用して、オフライン事前訓練ポリシーのパフォーマンスを改善することを目的としている。
ほとんどのO2O手法は、RLの目的と悲観のバランス、オフラインとオンラインのサンプルの利用に焦点を当てている。
論文 参考訳(メタデータ) (2023-12-12T19:24:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。