論文の概要: Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?
- arxiv url: http://arxiv.org/abs/2605.31041v1
- Date: Fri, 29 May 2026 09:18:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.498133
- Title: Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?
- Title(参考訳): 視覚情報は視覚・言語・行動モデル駆動行動における決定的な役割を担っているか?
- Abstract要約: VLA(Vision-Language-Action)モデルは、自動運転において有望な能力を示す。
現在のVLAベースの運転行動は、視覚情報に根ざしている。
本稿では,VLAに基づく運転モデルにおける視覚的ビヘイビア依存性を系統的に解析する,構造化されたマルチレベル視覚フレームワークを提案する。
- 参考スコア(独自算出の注目度): 6.847591547447323
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models have demonstrated promising capability in autonomous driving, highlighting the potential of unified multimodal architectures for jointly modeling perception and planning. However, how current VLA-based driving behavior is grounded in visual information remains poorly understood. Existing evaluation protocols mainly focus on aggregate performance metrics, lacking structured and practical diagnostics to quantify visual-behavior dependency. In this work, we introduce a structured multi-level visual perturbation framework to analyze visual-behavior dependency in VLA-based driving models systematically. The framework organizes controlled visual perturbations along three complementary dimensions: channellevel degradation, information-level disruption, and structurelevel modification. We apply it to VLA-based driving systems and evaluate behavioral responses under both open-loop trajectory prediction and interactive closed-loop safety evaluation. Experimental results reveal evaluation-dependent dependency patterns and uneven visual grounding across abstraction levels. These findings call for more structured analyses and principled design of VLA driving models to better understand how visual information shapes behavior and develop safer, more robust systems.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、自律走行において有望な能力を示し、認識と計画の共同モデリングのための統合マルチモーダルアーキテクチャの可能性を強調している。
しかし、現在のVLAベースの運転行動が視覚情報にどのように根ざされているかは、まだよく分かっていない。
既存の評価プロトコルは主に、視覚的ビヘイビア依存を定量化するための構造的および実践的な診断を欠いた、パフォーマンスメトリクスの集約に重点を置いている。
本稿では,VLAに基づく運転モデルにおける視覚行動依存性を系統的に解析する,構造化された多段階視覚摂動フレームワークを提案する。
このフレームワークは、チャネルレベルの劣化、情報レベルの破壊、構造レベルの修正という3つの相補的な次元に沿って制御された視覚摂動を編成する。
本稿では,VLAに基づく運転システムに適用し,オープンループ軌道予測と対話型クローズループ安全評価の両方に基づく行動応答の評価を行う。
実験結果から、評価依存の依存性パターンと、抽象レベルの不均一な視覚的接地を明らかにした。
これらの知見は、視覚情報がどのように振舞うかをよりよく理解し、より安全で堅牢なシステムを開発するために、より構造化された分析とVLA駆動モデルの原則設計を求めている。
関連論文リスト
- Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models [67.98329043920803]
現在のヴィジュアル・ランゲージ・アクション(VLA)モデルは、主に2次元入力に依存し、リッチなオブジェクト構造情報や3次元物理世界固有のコモンセンス知識を無視している。
この欠損は、複雑な高精度な操作に対する空間的認識と適応性を制限する。
VLAのためのConcept Expertモジュールを構築し、オブジェクトを明示的でプログラム的な青写真として表現する実行可能なAnalytic Conceptを構築する。
論文 参考訳(メタデータ) (2026-07-29T06:24:25Z) - A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models [16.665710235622214]
Infer-diagnose-refine (IDR) フレームワークを提案する。
IDRはまず、視覚観察の事実的シナリオと反事実的シナリオの下でのアクションを推論し、視覚観察の因果効果を推定された動的重要性として診断する。
シミュレーションベンチマークと実世界のタスクの両方の実験では、複数のVLAバックボーン全体のパフォーマンスが改善されている。
論文 参考訳(メタデータ) (2026-07-28T09:56:42Z) - VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing [12.088525050678713]
VLA(Vision-Language-Action)モデルは、マルチモーダル知識を具体化制御に変換する。
本稿では,VLAモデルを統一的なエビデンスチェーンを通じて解析する,進歩的診断フレームワークであるVLA-Traceを紹介する。
論文 参考訳(メタデータ) (2026-05-28T15:50:56Z) - Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance [108.46436073194546]
効果的なプランニングは、ローカルで、視覚的に基礎があり、内部で生成され、アクションと直接整合するべきである、と私たちは主張する。
本稿では,タスク条件付きアベイランスをVLAモデル内で明示的な視覚的計画インターフェースとして内包する統合フレームワークであるAfford-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-22T20:43:47Z) - Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models [66.96421290733126]
VLA(Vision-Language-Action)モデルは、ロボット操作のための有望なパラダイムとして登場した。
我々はtextbfVision-Language Mixture-of-Transformers (VL-MoT) フレームワーク上に構築した textbfDeepVision-VLA を提案する。
DeepVision-VLAは、シミュレーションされたタスクと実世界のタスクで、それぞれ9.0%と7.5%の先行の最先端メソッドより優れている。
論文 参考訳(メタデータ) (2026-03-16T17:59:54Z) - From Perception to Action: An Interactive Benchmark for Vision Reasoning [51.11355591375073]
Causal Hierarchy of Actions and Interactions (CHAIN)ベンチマークは、モデルが物理的制約に基づいて構造化されたアクションシーケンスを理解し、計画し、実行できるかを評価するために設計された。
CHAINは、受動的知覚からアクティブな問題解決、機械パズルのインターロックや3D積み重ね、パッキングといったタスクへと評価をシフトする。
以上の結果から,トップパフォーマンスモデルでは,物理構造や因果制約の内在化に苦慮し,信頼性の高い長期計画の作成に失敗することが多く,認識された構造を効果的に翻訳することができないことが示唆された。
論文 参考訳(メタデータ) (2026-02-24T15:33:02Z) - Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future [125.92052530850425]
VLA(Vision-Language-Action)フレームワークは、認識と言語に基づく意思決定を統合する。
VLAフレームワークは、より解釈可能で、一般化可能で、人間に準拠した運転ポリシーへの道筋を提供する。
この研究は、人間と互換性のある自動運転システムを構築するための一貫性のある基盤を確立することを目的としている。
論文 参考訳(メタデータ) (2025-12-18T16:57:44Z) - RAD: Retrieval-Augmented Decision-Making of Meta-Actions with Vision-Language Models in Autonomous Driving [10.984203470464687]
視覚言語モデル(VLM)は、空間認識の不十分さや幻覚といった限界に悩まされることが多い。
本稿では,自律走行シーンにおけるメタアクションを確実に生成するVLMの能力を高めるための,検索強化意思決定(RAD)フレームワークを提案する。
我々は,NuScenesデータセットから得られたデータセットに基づいてVLMを微調整し,その空間的知覚と鳥眼視画像理解能力を高める。
論文 参考訳(メタデータ) (2025-03-18T03:25:57Z) - Application of Vision-Language Model to Pedestrians Behavior and Scene Understanding in Autonomous Driving [5.456780031044544]
本稿では,大規模視覚言語基礎モデルから効率的な視覚ネットワークへ知識を伝達する知識蒸留法を提案する。
歩行者行動予測やシーン理解タスクに適用し,より多様で包括的なセマンティック属性を生成する上で,有望な結果を達成する。
論文 参考訳(メタデータ) (2025-01-12T01:31:07Z) - Explanatory Model Monitoring to Understand the Effects of Feature Shifts on Performance [61.06245197347139]
そこで本研究では,機能シフトによるブラックボックスモデルの振る舞いを説明する新しい手法を提案する。
本稿では,最適輸送と共有値の概念を組み合わせた提案手法について,説明的性能推定として紹介する。
論文 参考訳(メタデータ) (2024-08-24T18:28:19Z) - Reason induced visual attention for explainable autonomous driving [2.090380922731455]
ディープラーニング (DL) ベースのコンピュータビジョン (CV) モデルは一般的に、解釈性が悪いため、ブラックボックスと見なされる。
本研究の目的は,自律運転におけるDLモデルの解釈可能性を高めることにある。
提案手法は,視覚入力(画像)と自然言語を協調的にモデル化することにより,人間の運転者の学習過程を模倣する。
論文 参考訳(メタデータ) (2021-10-11T18:50:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。