論文の概要: Dissecting Advantage-Guided Post-Training for Vision-Language-Action Policies
- arxiv url: http://arxiv.org/abs/2609.28161v1
- Date: Wed, 23 Sep 2026 14:10:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.057958
- Title: Dissecting Advantage-Guided Post-Training for Vision-Language-Action Policies
- Title(参考訳): ヴィジュアル・ランゲージ・アクション・ポリシーのためのアドバンテージ・ガイド付きポストトライニング
- Abstract要約: アドバンテージ誘導型強化学習は、限られたロボットデータを用いて、訓練後の視覚言語行動(VLA)ポリシーの実践的な方法を提供する。
既存のレシピはしばしばこれらの選択を単一のエンドツーエンドの手順に組み合わせ、個々の効果を特定するのが難しくなる。
我々は,大規模な実ロボットポリシー評価を必要とせず,ステージ固有のオフライン評価手法を開発し,選択肢の選択を効率的にスクリーニングする。
- 参考スコア(独自算出の注目度): 44.24966371336608
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Advantage-guided reinforcement learning provides a practical way to post-train vision-language-action (VLA) policies using limited robot data. However, its performance depends on several coupled choices, including how critic-derived advantages are constructed, calibrated, and used for policy training. Existing recipes often combine these choices into a single end-to-end procedure, making their individual effects difficult to identify. In this work, we dissect advantage-guided VLA post-training through a controlled empirical study that separates these design choices while accounting for their distinct estimands. We develop stage-specific offline evaluation methods to screen alternative choices efficiently, without requiring extensive real-robot policy evaluations for every possible combination. The staged evaluation identifies a modular recipe that combines temporal-difference advantage construction, group-wise calibration, and continuous advantage weighting. Across four real-world bimanual tasks, the resulting recipe improves mean task progress and success over the SFT initialization by 0.42 and 0.63, respectively. Moreover, the proposed evaluation diagnostics show an overall alignment with downstream real-world performance, supporting their use for interpreting empirical outcomes and selecting advantage-guided post-training designs in practice.
- Abstract(参考訳): アドバンテージ誘導型強化学習は、限られたロボットデータを用いて、訓練後の視覚言語行動(VLA)ポリシーの実践的な方法を提供する。
しかし、そのパフォーマンスは、批判に由来する利点がどのように構築され、校正され、政策訓練に使用されるかなど、いくつかの複合的な選択に依存する。
既存のレシピはしばしばこれらの選択を単一のエンドツーエンドの手順に組み合わせ、個々の効果を特定するのが難しくなる。
本研究では,これらの設計選択を分離し,異なる評価基準を考慮に入れた制御実験を通じて,優位誘導VLAのポストトレーニングを判別する。
提案手法は,任意の組み合わせに対して,大規模な実ロボットポリシー評価を必要とせず,選択肢を効率的に選別するためのステージ固有のオフライン評価手法を開発する。
段階評価では、時間差優位構築、グループワイドキャリブレーション、連続優位重み付けを組み合わせたモジュラーレシピを識別する。
4つの実世界のバイマン的タスクの中で、結果として得られたレシピは、SFTの初期化に対する平均タスクの進捗と成功をそれぞれ0.42と0.63で改善する。
さらに,提案した評価診断は,実証結果の解釈や,実際は有利な訓練後設計を選択するために,下流の現実世界のパフォーマンスと総合的に一致していることを示す。
関連論文リスト
- Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents [15.278397068400205]
強化学習のポストトレーニングはすでに、効果的なステップレベルのスコアリングの材料を提供しています。
我々は、一般的なマルコフ決定プロセスの下で暗黙の優位性を得る。
3つの異なるアプリケーション間で進捗優位性の有効性を検証する。
論文 参考訳(メタデータ) (2026-06-24T17:54:08Z) - PAWS: Preference Learning with Advantage-Weighted Segments [61.590521943273]
本稿では,セグメントレベルの優位関数を用いて,ポリシー更新を直接行うセグメントベース優先学習手法を提案する。
シミュレーションされたロボット操作と移動タスクの実験は、PAWSが既存のPbRLアプローチを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-06-10T12:00:17Z) - CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs [53.749193998004166]
カリキュラム学習は,大規模言語モデルの学習効率を高める上で重要な役割を担っている。
収束を加速し,計算オーバーヘッドを最小限に抑えるためにベイズ後続推定を用いた効率的な学習法であるCurESを提案する。
論文 参考訳(メタデータ) (2025-10-01T15:41:27Z) - PVPO: Pre-Estimated Value-Based Policy Optimization for Agentic Reasoning [6.050409262589219]
本稿では,アドバンスト参照アンカーとデータ事前サンプリングによって強化された効率的な強化学習手法であるPVPOを提案する。
本手法は,グループ内比較によって生じる累積バイアスを効果的に補正し,トレーニング中のロールアウト数への依存を著しく低減する。
このアプローチは,複数のタスクにまたがる堅牢な一般化を示すだけでなく,さまざまなスケールのモデルにまたがるスケーラブルなパフォーマンスを示す。
論文 参考訳(メタデータ) (2025-08-28T09:18:26Z) - Bridging Offline and Online Reinforcement Learning for LLMs [71.48552761763158]
オフラインから半オンラインに移行する際の大規模言語モデルの微調整における強化学習手法の有効性について検討する。
実験では、検証可能な数学のトレーニングに加えて、検証不可能な教育のトレーニングと、両方のベンチマーク評価のセットについて取り上げている。
論文 参考訳(メタデータ) (2025-06-26T17:25:49Z) - Teaching LLMs to Refine with Tools [68.23479664749271]
大規模言語モデル(LLM)はフィードバックに基づいて応答を洗練し、反復的なトレーニングやテスト時間の改良を通じて自己改善を可能にする。
外部ツールを用いて同一または他のLLMによって生成されたチェーン・オブ・シント(CoT)応答を洗練するための新しいアプローチであるCaPを提案する。
論文 参考訳(メタデータ) (2024-12-22T05:43:50Z) - A Systematic Examination of Preference Learning through the Lens of Instruction-Following [83.71180850955679]
新たな合成データ生成パイプラインを用いて48,000の命令追従プロンプトを生成する。
合成プロンプトでは、リジェクションサンプリング(RS)とモンテカルロ木探索(MCTS)の2つの選好データセットキュレーション手法を用いる。
実験により、MCTSが生成した選好ペアにおける共有プレフィックスは、限界はあるが一貫した改善をもたらすことが明らかになった。
高コントラストの選好ペアは一般的に低コントラストのペアよりも優れているが、両者を組み合わせることで最高のパフォーマンスが得られることが多い。
論文 参考訳(メタデータ) (2024-12-18T15:38:39Z) - BaFTA: Backprop-Free Test-Time Adaptation For Zero-Shot Vision-Language Models [20.88680592729709]
本稿では,視覚言語モデルの試験時間適応のためのバックプロパゲーションフリーアルゴリズムBaFTAを提案する。
BaFTAは、投影された埋め込み空間内のオンラインクラスタリングを使用して、クラスセントロイドを直接推定する。
我々は,BaFTAが最先端の試験時間適応手法を効率と効率の両方で一貫して上回っていることを実証した。
論文 参考訳(メタデータ) (2024-06-17T08:16:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。