論文の概要: Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning
- arxiv url: http://arxiv.org/abs/2606.30686v1
- Date: Sun, 28 Jun 2026 14:03:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:18.951288
- Title: Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning
- Title(参考訳): 位置:物理推論の性能検証が不可能な視覚・言語・行動モデル
- Authors: Taozhao Chen, Ian Manchester, Huaming Chen,
- Abstract要約: VLA(Vision-Language-Action)システムでは,ロボット操作ベンチマークの性能が急速に向上している。
これらの利得は、インターネットスケールのデータ転送から物理的実行一般化に至るまでのセマンティック表現が学習された証拠として一般的に解釈されている。
本稿では,この解釈の前提となる仮定が独立に検証されておらず,現在の評価プロトコルでは検証できないことを論じる。
- 参考スコア(独自算出の注目度): 5.860417297318896
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) systems, built on pretrained vision-language models (VLMs), have shown rapidly improving performance on robot manipulation benchmarks. These gains are commonly interpreted as evidence that semantic representations learned from internet-scale data transfer to physical execution generalization. This position paper argues that the assumption underlying this interpretation -- that semantic generalization is sufficient to support physical action decisions -- has not been independently verified and cannot be tested under current evaluation protocols. We support this claim by decomposing VLA policies into semantic mapping and physical action decision, and showing that task success rate -- the dominant evaluation metric -- cannot distinguish between these two sources of capability. As a result, improvements in benchmark performance are consistent with multiple competing explanations, including semantic matching, distributional overlap, and genuine physical generalization. We further argue that this identifiability gap has been reinforced through narrative drift, whereby successive systems inherit and strengthen prior interpretations of performance gains without isolating the underlying causal mechanism. To address this limitation, we propose a research direction based on evaluation designs that introduce controlled variation to separately measure semantic and physical generalization. Such designs make it possible to causally attribute performance without requiring access to model internals, and to empirically assess the role of VLM backbones as semantic interfaces rather than implicit sources of physical competence. Our goal is not to refute the role of VLMs in robotics, but to clarify the conditions under which claims of physical generalization can be meaningfully evaluated.
- Abstract(参考訳): 事前訓練された視覚言語モデル(VLM)に基づいて構築されたVLAシステムでは,ロボット操作ベンチマークの性能が急速に向上している。
これらの利得は、インターネットスケールのデータ転送から物理的実行一般化に至るまでのセマンティック表現が学習された証拠として一般的に解釈されている。
このポジションペーパーは、この解釈の根底にある前提として、意味的一般化は物理的な行動決定をサポートするのに十分である、という仮定は独立に検証されておらず、現在の評価プロトコルではテストできない、と論じている。
我々は、VLAポリシーをセマンティックマッピングと物理行動決定に分解し、タスク成功率(主要な評価基準)がこれらの2つの能力源を区別できないことを示すことにより、この主張を支持している。
その結果、ベンチマーク性能の改善は、セマンティックマッチング、分散オーバーラップ、真の物理一般化など、競合する複数の説明と一致している。
さらに、この識別可能性のギャップは物語のドリフトによって強化され、連続したシステムは、根底にある因果メカニズムを分離することなく、性能向上の事前解釈を継承し、強化する。
この制限に対処するために、制御された変動を導入した評価設計に基づく研究方向を提案し、セマンティックと物理の一般化を別々に測定する。
このような設計により、モデル内部へのアクセスを必要とせずに性能を因果的に評価することができ、物理能力の暗黙的な情報源ではなく、セマンティックインターフェースとしてのVLMバックボーンの役割を実証的に評価することができる。
我々の目標は、ロボット工学におけるVLMの役割を否定することではなく、物理的一般化の主張が有意義に評価できる条件を明らかにすることである。
関連論文リスト
- ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation [71.69632267962993]
我々は、操作計画が自然に予測に分解され、次の視覚状態が予測され、逆ダイナミクスとなることを論じる。
我々は、この分解を実現する生成モデルである textbfThinkingVLA を提案する。
シミュレーションと実世界のベンチマークの実験では、ThinkingVLAは最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-16T13:45:17Z) - From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape [79.30826980815927]
ルーブリックは、複雑な品質判断を構造化され、実行可能な標準に変換する明示的な基準セットです。
我々は,既存のルーリックデザインを体系的に整理し,その構築と最適化を検証し,評価と訓練をまたいだ役割を解析する。
論文 参考訳(メタデータ) (2026-06-07T13:34:55Z) - QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs [68.58207076756237]
本稿では,結果評価からメカニズム診断へ移行する摂動に基づく評価プロトコルProCauEvalを紹介する。
因果推論において,ビデオコンテンツは体系的に過小評価されている。
教師のネガティブなアライメントに基づく強化学習フレームワークであるADPOを提案する。
論文 参考訳(メタデータ) (2026-05-10T08:48:58Z) - Decomposing and Steering Functional Metacognition in Large Language Models [7.62618887128252]
大規模言語モデルは機能的メタ認知状態の分解可能な空間を維持していることを示す。
これらの状態は、内部の活性化から線形に退避可能であり、異なる層回りのプロファイルを示す。
この結果から,ベンチマーク性能はタスク能力だけでなく,特定の機能的メタ認知状態の活性化を反映していることが示唆された。
論文 参考訳(メタデータ) (2026-05-09T13:22:47Z) - Benchmarked Yet Not Measured -- Generative AI Should be Evaluated Against Real-World Utility [9.928824688627037]
我々は、生成AI評価は、静的なベンチマーク中心の透明性から、人間の成果軌跡に根ざしたステークホルダー、ゴール、コンテキスト条件付きユーティリティ透明性へのパラダイムシフトを必要とすると論じる。
SCU-GenEvalは,利害関係者と利害関係者のゴールマッピング,構成指標仕様,メカニズムモデリング,長手効用測定からなる4段階評価フレームワークである。
論文 参考訳(メタデータ) (2026-05-07T18:56:07Z) - Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models [28.981226513192535]
最近のVision-Language-Action(VLA)モデルでは、標準的なロボットベンチマークで顕著な成功率が報告されている。
最近の証拠は、標準ベンチマークの成功と真の具体的推論の体系的な不一致を示唆している。
本稿では,ロボットポリシーにおける真の身体的推論の診断ベンチマークであるBeTTERを紹介する。
論文 参考訳(メタデータ) (2026-04-20T09:25:30Z) - Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models [7.802379200026965]
認識状態の複雑さに基づいてVLA実行を動的にルーティングする適応型フレームワークを提案する。
我々のアプローチは、VLAの視覚言語バックボーンを、パラメトリックおよび非パラメトリック推定器のアンサンブルに潜伏埋め込みを投影することにより、アクティブな検出ツールに変換する。
論文 参考訳(メタデータ) (2026-03-05T13:14:41Z) - IntentionVLA: Generalizable and Efficient Embodied Intention Reasoning for Human-Robot Interaction [51.130510883952546]
Vision-Language-Action(VLA)モデルは、事前訓練された視覚言語モデル(VLM)を活用して、ロボット制御との認識を両立させる。
カリキュラム学習パラダイムと効率的な推論機構を備えたVLAフレームワークである textbfIntentionVLA を提案する。
提案手法はまず,意図推論,空間的接地,コンパクトな具体的推論を組み合わせ,慎重に設計した推論データを活用する。
論文 参考訳(メタデータ) (2025-10-09T04:49:46Z) - Do What? Teaching Vision-Language-Action Models to Reject the Impossible [53.40183895299108]
VLA(Vision-Language-Action)モデルは、さまざまなロボットタスクにおいて強力なパフォーマンスを示している。
Instruct-Verify-and-Act(IVA)を提案する。
実験の結果,IVAはベースラインよりも97.56%の精度で虚偽の前提検出精度を向上させることがわかった。
論文 参考訳(メタデータ) (2025-08-22T10:54:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。