論文の概要: VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models
- arxiv url: http://arxiv.org/abs/2607.04517v1
- Date: Sun, 05 Jul 2026 21:41:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.966672
- Title: VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models
- Title(参考訳): VLA Grounder: Black-Box VLAモデルのための言語定義空間最適化
- Authors: Damir Shodiev, Aleksei Staroverov, Nikita Kachaev, Alexey K. Kovalev, Aleksandr I. Panov,
- Abstract要約: VLA(Vision-Language-Action)モデルは、自然言語によるタスク記述を前提としたエンドツーエンドのアクションポリシーとして一般的に扱われる。
動作重みを更新するよりも、言語空間を最適化することで、凍結VLAポリシーを改善することができるかどうかを検討する。
提案手法では,人間の指示を短いVLA命令に変換する言語条件空間ポリシーを導入する。
- 参考スコア(独自算出の注目度): 42.41263928527529
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models are commonly treated as end-to-end action policies conditioned on natural-language task descriptions. In practice, however, their behavior often depends sharply on how the instruction is phrased, suggesting that language is not merely a task label but an optimizable conditioning input. We study whether frozen VLA policies can be improved by optimizing language space rather than updating action weights. Our method introduces a language-conditioning space policy that translates a human instruction into a short VLA-grounded command using object appearance, spatial relations, and target-grounding cues. The language-conditioning space policy is initialized with a failure-derived command-space prior and optimized with reinforcement learning from sparse task-completion rewards, while the downstream VLA remains fully frozen. This yields language-conditioning space optimization: RL discovers which VLA-grounded commands best elicit successful behavior from the frozen action policy. Experiments on RL4VLA and VL-Think show that language-conditioning space optimization improves success on instruction-sensitive, symbolic, and multi-object manipulation tasks, demonstrating that language can serve as an optimizable variable for a robot foundation models. Website: https://tttonyalpha.github.io/vla_grounder
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、自然言語によるタスク記述を前提としたエンドツーエンドのアクションポリシーとして一般的に扱われる。
しかし実際には、それらの振る舞いは命令がどのようにフレーズ化されるかに大きく依存することが多く、言語は単なるタスクラベルではなく、最適化可能な条件入力であることを示唆している。
動作重みを更新するよりも、言語空間を最適化することで、凍結VLAポリシーを改善することができるかどうかを検討する。
本手法では,人間の指示をオブジェクトの外観,空間関係,ターゲットの接地手段を用いて,短いVLA命令に変換する言語条件空間ポリシーを提案する。
言語条件空間ポリシーは、失敗から派生したコマンド空間で初期化され、疎タスク補完報酬からの強化学習に最適化され、下流のVLAは完全に凍結されている。
RLは、凍結されたアクションポリシーから、どのVLA基底コマンドが最も成功した振る舞いを導き出すかを発見する。
RL4VLAとVL-Thinkの実験では、言語条件空間の最適化が命令に敏感でシンボリックで多目的な操作タスクの成功を改善し、言語がロボット基礎モデルの最適化可能な変数として機能できることが示されている。
ウェブサイト:https://tttonyalpha.github.io/vla_grounder
関連論文リスト
- Learning What to Say to Your VLA: Mostly Harmless Vision Language Action Model Steering [19.25748772628753]
VLA(Vision-Language-Action)モデルは、ロボット制御のための自然言語インタフェースを提供する。
クローズループVLAタスク性能を改善するための言語シーケンスを対話的に検索するフレームワークを提案する。
私たちは、いつ言語ステアリングがパフォーマンスを改善するかを予測する改善ヘッドを学びます。
論文 参考訳(メタデータ) (2026-06-10T16:34:49Z) - LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries [30.732526921367835]
LangForceは、ベイズ分解による命令を強制する新しいフレームワークである。
我々は,新しいデータを必要としないLangForceの一般化を著しく改善することを示す。
論文 参考訳(メタデータ) (2026-01-21T17:15:22Z) - Do What? Teaching Vision-Language-Action Models to Reject the Impossible [53.40183895299108]
VLA(Vision-Language-Action)モデルは、さまざまなロボットタスクにおいて強力なパフォーマンスを示している。
Instruct-Verify-and-Act(IVA)を提案する。
実験の結果,IVAはベースラインよりも97.56%の精度で虚偽の前提検出精度を向上させることがわかった。
論文 参考訳(メタデータ) (2025-08-22T10:54:33Z) - Efficient Alignment of Unconditioned Action Prior for Language-conditioned Pick and Place in Clutter [59.69563889773648]
本研究では,ロボットが対象物を開き散らかし,特定の場所に移動させるという,言語条件のピック・アンド・プレイス作業について検討する。
いくつかのアプローチは、ビジョンファウンデーションモデルから機能を使ってエンドツーエンドのポリシーを学び、大きなデータセットを必要とする。
本研究では,無条件動作先行と3次元視覚言語先行とを1つの注意層から学習することで協調する行動先行アライメント手法を提案する。
論文 参考訳(メタデータ) (2025-03-12T14:20:33Z) - Large Language Models as Generalizable Policies for Embodied Tasks [50.870491905776305]
大規模言語モデル(LLM)は,視覚的タスクを具現化するための一般化可能なポリシーであることを示す。
我々のアプローチはLarge LAnguage Model Reinforcement Learning Policy (LLaRP)と呼ばれ、学習済みの凍結LDMに適応し、入力テキスト命令と視覚的自我中心の観察と出力動作を環境内で直接行う。
論文 参考訳(メタデータ) (2023-10-26T18:32:05Z) - Pre-Trained Language Models for Interactive Decision-Making [72.77825666035203]
目的と観測を埋め込みのシーケンスとして表現する模倣学習の枠組みを述べる。
このフレームワークは様々な環境にまたがって効果的な一般化を可能にすることを実証する。
新たなゴールや新しいシーンを含むテストタスクでは、言語モデルによる初期化ポリシーはタスク完了率を43.6%改善する。
論文 参考訳(メタデータ) (2022-02-03T18:55:52Z) - Language Models as Zero-Shot Planners: Extracting Actionable Knowledge
for Embodied Agents [111.33545170562337]
自然言語で表現された高レベルなタスクを、選択された実行可能なステップのセットに基底付ける可能性について検討する。
事前学習したLMが十分に大きく、適切に誘導された場合、ハイレベルなタスクを効果的に低レベルな計画に分解できることがわかった。
本稿では,既存の実演の条件を規定し,計画が許容可能な行動に意味的に変換される手順を提案する。
論文 参考訳(メタデータ) (2022-01-18T18:59:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。