論文の概要: Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models
- arxiv url: http://arxiv.org/abs/2607.03751v1
- Date: Sat, 04 Jul 2026 07:53:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.705309
- Title: Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models
- Title(参考訳): 凍ったVLAモデルに対する木探索の動作評価
- Authors: Xinyi Xie, Zican Hu, Zhanyu Liu, Yicheng Dong, Wenhao Wu, Zhenhong Sun, Haoran Li, Chunlin Chen, Zhi Wang, Pichao Wang,
- Abstract要約: VLA(Vision-Language-Action)モデルは、大規模な事前訓練を通じて幅広い身体的能力を取得する。
一般的な治療法であるポストトレーニングは、タスク固有のパフォーマンスを改善するが、事前トレーニングに価値をもたらすジェネラリスト能力は制限される。
SVAは凍結したVLAポリシーを長期的結果の認識と組み合わせたフレームワークである。
- 参考スコア(独自算出の注目度): 60.17417174639865
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models acquire broad embodied capabilities through large-scale pretraining, yet their generalization remains far more fragile than that of LLMs and VLMs. The prevailing remedy, post-training via supervised fine-tuning or reinforcement learning, improves task-specific performance but narrows the generalist capability that makes pretraining valuable. We identify a key bottleneck: VLA failures stem not only from action generation but also from action evaluation. A diagnostic pass@k study confirms that frozen VLAs already contain competent behaviors in their output distribution, with overall success rates rising from 33% at pass@1 to 92% at pass@32. Inspired by this, we propose SVA (Search, Value, and Act), a simple framework that equips frozen VLA policies with long-term consequence awareness. SVA first uses Monte-Carlo tree search in simulation to fully explore the VLA's output distribution and collect diverse trajectories annotated with empirical returns; this knowledge is then distilled into a lightweight Q-value model that predicts the expected consequence of candidate actions; at deployment, the frozen VLA proposes multiple candidates and the evaluator selects the one with the highest uncertainty-regularized Q-value, requiring no simulator access. By decoupling action proposal from consequence evaluation, SVA preserves the generalization capacity of the VLA backbone while substantially improving task success rates. Experiments across embodied benchmarks show that SVA consistently improves generalization on unseen tasks and exhibits strong test-time scaling behavior. Strikingly, SVA enables a 9B VLA to outperform a 27B VLA by 7 points at 27% lower inference latency, suggesting that scaling test-time evaluation is more cost-effective than scaling model size.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは大規模な事前訓練によって幅広い具体化能力を得るが、その一般化はLLMやVLMよりもはるかに脆弱である。
教師付き微調整や強化学習によるポストトレーニングの一般的な治療法は、タスク固有のパフォーマンスを改善するが、事前トレーニングに価値をもたらすジェネラリスト能力は制限される。
VLAの障害は、アクション生成だけでなく、アクション評価からも発生します。
診断パス@kによる研究によると、凍結したVLAは出力分布にすでに有能な振る舞いが含まれており、総成功率は33%から92%に上昇している。
そこで我々は,凍結したVLAポリシーを長期的帰結意識と組み合わせたシンプルなフレームワークであるSVA(Search, Value, and Act)を提案する。
SVAはまずモンテカルロ木探索をシミュレーションに使用し、VLAの出力分布を完全に探索し、経験的リターンを付加した様々な軌跡を収集し、その知識を軽量なQ値モデルに蒸留して候補行動の結果を予測する。
結果評価からアクション提案を分離することにより、SVAはVLAバックボーンの一般化能力を維持しつつ、タスク成功率を大幅に向上させる。
組込みベンチマークによる実験では、SVAは目に見えないタスクの一般化を一貫して改善し、テスト時間スケーリングの強い振る舞いを示す。
興味深いことに、SVAは9B VLAが27B VLAの7ポイントを27%低い推論レイテンシで上回り、テスト時間のスケーリングがモデルサイズのスケーリングよりもコスト効率が高いことを示唆している。
関連論文リスト
- Unleashing VLA Potentials in Autonomous Driving via Explicit Learning from Failures [14.313346858887286]
自律走行のためのVLA(Vision-Language-Action)モデルは、強化学習(Reinforcement Learning、RL)最適化時にしばしばパフォーマンス高原に到達する。
この停滞は、以前のスーパービジョン・ファインチューニング(SFT)によって制約された探査能力から生じる。
構造化された診断フィードバックでRLを増強するフレームワークであるELF-VLA(Explicit Learning from Failures)を提案する。
論文 参考訳(メタデータ) (2026-03-01T11:41:22Z) - When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs [31.92520697946991]
VLA(Vision-Language-Action Model)は、ロボット制御における言語命令の基盤となることを約束するが、実際には言語に忠実に従わないことが多い。
反ファクトの失敗は、最先端のVLAで発見されていないことが示される。
本稿では,単純な2分岐推論方式であるCAGを提案する。
論文 参考訳(メタデータ) (2026-02-19T18:59:20Z) - Value Vision-Language-Action Planning & Search [1.631000263754549]
VLA(Vision-Language-Action)モデルは、ロボット操作のための強力なジェネラリストポリシーとして登場した。
本稿では,モンテカルロ木探索を軽量で学習可能な値関数で拡張するフレームワークであるValue Vision-Language-Action Planning and Search(V-VLAPS)を紹介する。
LIBEROロボット操作スイート上でのV-VLAPSを評価し、価値誘導探索が成功率を5%以上向上することを示した。
論文 参考訳(メタデータ) (2026-01-02T19:40:34Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action [62.70893433854428]
推論能力を維持しつつ、慎重に設計した後処理により動作性能を向上させるDualVLAを提案する。
実験の結果、DualVLAはSimplerEnvの平均成功率は61.0であり、8つの競合するマルチモーダルベンチマークの平均スコアは65.4であることがわかった。
論文 参考訳(メタデータ) (2025-11-27T06:03:53Z) - RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models [28.422082187079166]
我々は、Vision-Language-Action(VLA)モデルのテスト時間スケーリングフレームワークであるRoboMonkeyを紹介した。
RoboMonkeyは、VLAから小さなアクションの集合をサンプリングし、ガウス摂動と過半数投票を適用してアクション提案分布を構築し、次に視覚言語モデル(VLM)ベースの検証器を使用して最適なアクションを選択する。
既存のVLAとRoboMonkeyのペアリングは大きなパフォーマンス向上をもたらし、アウト・オブ・ディストリビューションタスクでは25%、イン・ディストリビューションタスクでは9%の絶対的な改善を実現している。
論文 参考訳(メタデータ) (2025-06-21T20:56:17Z) - Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success [100.226572152954]
視覚言語アクションモデル(VLA)のための最適化された微調整レシピを提案する。
われわれのレシピはOpenVLAの4つのタスクスイートの平均成功率を76.5%から97.1%に引き上げ、アクション生成のスループットを26$times$に向上させた。
実世界の評価において、我々の微調整のレシピにより、OpenVLAはバイマガルALOHAロボット上でデクスタラスで高周波な制御タスクをうまく実行することができる。
論文 参考訳(メタデータ) (2025-02-27T00:30:29Z) - VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models [66.56298924208319]
視覚言語生成報酬モデル(VL-GenRM)は、マルチモーダルAIシステムの調整と評価において重要な役割を果たす。
現在の評価方法は、主に従来のタスクからのAIアノテーション付き好みラベルに依存している。
VL-RewardBenchは、一般的なマルチモーダルクエリ、視覚幻覚検出、複雑な推論タスクにまたがる包括的なベンチマークである。
論文 参考訳(メタデータ) (2024-11-26T14:08:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。