論文の概要: How Should Vision-Language-Action Models Use Proprioceptive State?
- arxiv url: http://arxiv.org/abs/2608.03052v1
- Date: Tue, 04 Aug 2026 03:05:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 07:04:20.69137
- Title: How Should Vision-Language-Action Models Use Proprioceptive State?
- Title(参考訳): 視覚・言語・行動モデルではどのようにプロプリオセプティヴな状態を使うべきか?
- Authors: Yiren Zhao, Ziyang Chen, Ziyang Rao, Pengteng Li, He Zhang, Weiyu Guo, Yandong Guo, Rushi Dai,
- Abstract要約: 最近のVision-Language-Actionモデルは、ほとんど普遍的にロボットの受容状態を入力として取り込むが、互換性のない方法で結ぶ。
1)現在の状態がクローズドループ制御を実際に改善するかどうか、(2)状態履歴がどの程度役立つか、そしてその利点が条件付け能力の追加よりも真の時間的変動を反映しているか、という3つの疑問が残る。
フローマッチングVLAの制御実験,バックボーンの修正,トレーニングデータ,アクション表現,評価プロトコルなどを通じて,これらの疑問に答える。
- 参考スコア(独自算出の注目度): 35.40626817552107
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent Vision-Language-Action (VLA) models almost universally take robot proprioceptive state as input, yet wire it in incompatible ways -- serialized into text prompts, projected into the vision-language prefix, or fed directly to the action expert -- and almost always as a single current frame. Three questions remain open: (1) whether, and on which tasks, current state actually improves closed-loop control; (2) how much state history helps, and whether its benefit reflects genuine temporal variation rather than added conditioning capacity; and (3) where state should enter the model -- the vision-language backbone or the action-generation module. We answer these questions through controlled experiments on a flow-matching VLA, fixing the backbone, training data, action representation, and evaluation protocol throughout. We implement five representative interfaces -- discrete state prompt, VLM prefix, action prefix, state expert, and feature modulation -- under matched implementation details, and evaluate them on 45 atomic tasks spanning three task families plus 20 composite tasks; we then sweep the state-history length from 1 to 96 frames to examine how historical state information affects model performance. The experiments yield systematic answers to all three questions, distilled into testable design principles for state-aware VLAs.
- Abstract(参考訳): 最近のVision-Language-Action(VLA)モデルは、ほとんど普遍的にロボットの受容状態を入力として取るが、テキストプロンプトにシリアライズされたり、視覚言語プレフィックスに投影されたり、アクションエキスパートに直接供給されたり、ほぼ常に単一の現在のフレームとして、互換性のない方法で接続する。
1)現在の状態がクローズドループ制御を実際に改善するかどうか、(2)状態履歴がどれだけ役立つか、そしてその利点が条件付け能力の追加よりも真の時間的変動を反映しているか、(3)状態がモデルに入るべき場所、(3)視覚言語バックボーンまたはアクションジェネレーションモジュール。
フローマッチングVLAの制御実験,バックボーンの修正,トレーニングデータ,アクション表現,評価プロトコルなどを通じて,これらの疑問に答える。
5つの代表インタフェース – 離散状態プロンプト, VLMプレフィックス, アクションプレフィックス, 状態エキスパート, 特徴変調 – を実装し, 3つのタスクファミリにまたがる45のアトミックタスクと20の複合タスクで評価する。
これらの実験は、3つの質問すべてに対して体系的な答えを与え、状態認識VLAのための検証可能な設計原則に蒸留した。
関連論文リスト
- QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation [78.80536515102305]
VLN(Vision-and-Language Navigation)は、エージェントが視覚環境内の自身の動きに言語命令を接地する必要がある。
本稿では,ナビゲーションモデルに自己認識推論機構を備えた新しいフレームワークであるAwareVLNを提案する。
提案手法は,(1)空間的およびタスク指向の自己認識を促進する構造的推論モジュール,(2)効果的な学習のための進歩分担付き自動データエンジンの2つの重要な革新を特徴とする。
論文 参考訳(メタデータ) (2026-05-21T17:58:26Z) - Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy [59.44168425139687]
BayesVLA(ベイズVLA)は、前もってポリシーを視覚的アクションに分解し、ルック・トゥ・アクティベーションと言語条件付き可能性をサポートし、即時特定を可能にするベイズ因子化である。
実験は、既存の方法と比較して、目に見えない命令、オブジェクト、環境に対して優れた一般化を示す。
論文 参考訳(メタデータ) (2025-12-12T01:59:23Z) - STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models [28.438936778310865]
対象状態の微妙な変化を理解するための視覚言語モデルの有効性を厳格に評価する最初のベンチマークであるSTATUS Benchを紹介する。
STATUS Benchは、オブジェクト状態識別(OSI)、画像検索(IR)、状態変化識別(SCI)の3つのタスクを同時に実行するためにVLMを必要とする。
さらに,1300万の半自動記述からなる大規模トレーニングデータセットSTATUS Trainを導入する。
論文 参考訳(メタデータ) (2025-10-26T08:04:28Z) - VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents [130.70999337445468]
言語モデル(LLM)エージェントと比較して、視覚言語モデル(VLM)エージェントを訓練する際の重要な課題は、テキスト状態から複雑な視覚観察に移行することである。
VLMエージェントは、明示的な視覚状態推論によって内部世界モデルを構築することができるか?
我々は、強化学習(RL)を通して、エージェントの推論プロセスを建築的に実施し、報奨する。
エージェントの状態推定と遷移モデリングへの推論が成功に不可欠であることが分かりました。
論文 参考訳(メタデータ) (2025-10-19T16:05:07Z) - Do What? Teaching Vision-Language-Action Models to Reject the Impossible [53.40183895299108]
VLA(Vision-Language-Action)モデルは、さまざまなロボットタスクにおいて強力なパフォーマンスを示している。
Instruct-Verify-and-Act(IVA)を提案する。
実験の結果,IVAはベースラインよりも97.56%の精度で虚偽の前提検出精度を向上させることがわかった。
論文 参考訳(メタデータ) (2025-08-22T10:54:33Z) - From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models [5.660635614478238]
VLA(Vision-Language-Action)モデルは、汎用的で汎用的なロボットポリシーを作成することを約束する。
従来の模倣学習ベンチマークは言語命令の欠如のため不適当である。
言語命令,視覚,オブジェクトにまたがる10のサブカテゴリにまたがる50のシミュレーションベースのタスクの統合スイートを導入する。
論文 参考訳(メタデータ) (2025-06-11T16:52:18Z) - Probing a Vision-Language-Action Model for Symbolic States and Integration into a Cognitive Architecture [6.319871822298699]
我々はOpenVLAの隠された層を探索し、オブジェクトの特性、関係、動作状態の象徴的表現を明らかにする。
実時間状態監視にこれらのシンボル表現を利用する統合DIARC-OpenVLAシステムについて述べる。
論文 参考訳(メタデータ) (2025-02-06T23:11:11Z) - MoNET: Tackle State Momentum via Noise-Enhanced Training for Dialogue
State Tracking [42.70799541159301]
対話状態追跡(DST)は、対話履歴をスロット値ペアからなる対話状態に変換することを目的としている。
最後のターンの対話状態は、通常、DSTモデルによって現在の状態を予測するための入力として採用される。
ノイズ強化トレーニングにより状態運動量に対処するためのMoNETを提案する。
論文 参考訳(メタデータ) (2022-11-10T11:55:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。