論文の概要: Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving
- arxiv url: http://arxiv.org/abs/2608.30144v1
- Date: Mon, 31 Aug 2026 01:51:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.196092
- Title: Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving
- Title(参考訳): 自動運転車の効率的なVLAにおける言語の役割を再考する:より賢く信頼できる運転を目指して
- Authors: Tongfei Guo, Lili Su,
- Abstract要約: Vision-Language-Action(VLA)モデルが自動走行(AD)を改造
レイテンシとメモリの予算は厳しく、自動回帰デコーディングは本質的にシーケンシャルです。
この作業は、トレーニングコストが1回だけ支払われる間に、デプロイされたフレーム毎に推論コストが再帰するため、言語がいつ、いつ、どこで振る舞うべきかという中心的な疑問を再考する。
- 参考スコア(独自算出の注目度): 8.920589816043298
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models are reshaping autonomous driving (AD) by unifying perception, reasoning, and control through language, enabling semantic grounding, interpretable decisions, and better long-tail generalization. But language is expensive onboard: latency and memory budgets are tight, and autoregressive decoding is inherently sequential. This work reframes the central question as when and where language should act at inference, since inference cost recurs at every deployed frame while training cost is paid once. We introduce the Language Residue taxonomy to organize methods by their inference-time use of language: train-time-only supervision (L1), latent non-textual reasoning (L2), conditional invocation (L3), and full per-frame generation (L4). We review representative methods and tag each across five deployment axes (latency, parameters, memory, FLOPs, tokens), analyzing them on major open- and closed-loop driving benchmarks (e.g., nuScenes, NAVSIM, Bench2Drive). We further trace how efficient methods from NLP/LLM are adapted in AD, identifying the constraints and motivations driving these adaptations. A continuously updated repository will be available at Github.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、知覚、推論、言語による制御を統一することで、自律運転(AD)を再構築し、セマンティックグラウンドディング、解釈可能な決定、より優れたロングテール一般化を可能にしている。
レイテンシとメモリの予算は厳しく、自動回帰デコーディングは本質的にシーケンシャルです。
この作業は、トレーニングコストが1回だけ支払われる間に、デプロイされたフレーム毎に推論コストが再帰するため、言語がいつ、いつ、どこで振る舞うべきかという中心的な疑問を再考する。
提案手法は,L1,L2,L3,L4,L4,L4,L3,L4,L3,L3,L4,L3,L4,L3,L4,L3,L3,L4,L3,L4,L3,L4,L3,L3,L4,L2,L3,L4,L3,L4,L2,L2,L3, L3,L3,L3,L4,L3,L4,L3,L4,L3,L4,L3,L3,L4,L3,L3,L4,L3,L4,L4,L4,L4,L4,L4,L4,L4,L4,L4,L4,L4,L4,L
5つのデプロイ軸(レイテンシ、パラメータ、メモリ、FLOP、トークン)にまたがる代表的メソッドとタグをレビューし、主要なオープンループおよびクローズループ駆動ベンチマーク(例えば、nuScenes、NAVSIM、Bench2Drive)で解析する。
さらに、NLP/LLMの手法がADにどのように適応しているかを追究し、これらの適応を駆動する制約とモチベーションを特定した。
継続的に更新されたリポジトリはGithubで入手できる。
関連論文リスト
- AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation [78.80536515102305]
VLN(Vision-and-Language Navigation)は、エージェントが視覚環境内の自身の動きに言語命令を接地する必要がある。
本稿では,ナビゲーションモデルに自己認識推論機構を備えた新しいフレームワークであるAwareVLNを提案する。
提案手法は,(1)空間的およびタスク指向の自己認識を促進する構造的推論モジュール,(2)効果的な学習のための進歩分担付き自動データエンジンの2つの重要な革新を特徴とする。
論文 参考訳(メタデータ) (2026-05-21T17:58:26Z) - MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving [54.57163800903507]
我々は、自動運転のための最初の統合ストリーミングVLAアーキテクチャであるMindVLA-U1を紹介する。
統一されたVLMバックボーンは、1つの共有表現に1つのフォワードパスでAR言語トークンとフローマッチングされた連続的なアクショントラジェクトリを生成する。
ロングテールのWOD-E2Eベンチマークでは、MindVLA-U1が経験豊富な人間のドライバーを初めて上回った。
論文 参考訳(メタデータ) (2026-05-12T18:09:42Z) - Optimizing Language Models for Crosslingual Knowledge Consistency [90.86445137816942]
大規模な言語モデルは、しばしば一貫性のない知識を示すことが知られている。
これは、モデルが異なる言語で同様の質問をすることが多い、多言語シナリオにおいて特に問題となる。
本研究では,この問題を構造化報酬関数を用いた強化学習を用いて緩和することができることを示す。
論文 参考訳(メタデータ) (2026-03-04T23:36:55Z) - CLaS-Bench: A Cross-Lingual Alignment and Steering Benchmark [21.574271160875046]
CLaS-Benchは,32言語にわたる大規模言語モデル(LLM)における言語強制行動を評価するベンチマークである。
単純な残差ベースのDiffMeanメソッドは、他のすべてのメソッドよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-01-13T08:42:03Z) - MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning [51.20229133553804]
自律運転における現在のビジョン・ランゲージ・アクション(VLA)パラダイムは主に模倣学習(IL)に依存している
オンライン強化学習は、トライアル・アンド・エラー学習を通じてこれらの問題に対処するための有望な経路を提供する。
大規模言語モデル(LLM)と2つの異なるLoRAパラメータからなるVLAフレームワークであるMindDriveを提案する。
軌道レベルの報酬を推論空間に戻すことで、MindDriveは、限定的な言語駆動決定の有限セットに対する試行錯誤学習を可能にする。
論文 参考訳(メタデータ) (2025-12-15T18:31:32Z) - Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles [34.698147360764104]
ThinkDeeperは、決定を下す前に将来の空間状態を説明するフレームワークである。
Talk2Carのリーダーボードで1位にランクインし、DrivePilot、MoCAD、RefCOCO/+/gベンチマークで最先端のベースラインを上回っている。
さらに、ADにおけるマルチソースVGデータセットであるDrivePilotを紹介し、Retrieval-Augmented Generation (RAG)とChain-of-Thoughtパイプラインによって生成されるセマンティックアノテーションを特徴とする。
論文 参考訳(メタデータ) (2025-12-03T05:14:16Z) - BLIP-FusePPO: A Vision-Language Deep Reinforcement Learning Framework for Lane Keeping in Autonomous Vehicles [0.0]
自律車線維持(LK)のためのマルチモーダル強化学習(RL)のための新しいフレームワークを提案する。
提案手法により,エージェントは周囲を認識し,理解しやすい運転ルールを学習することができる。
セマンティックアライメント、LK精度、障害物回避、速度制御を含むハイブリッド報酬関数は、学習をより効率的で一般化しやすいものにするのに役立つ。
論文 参考訳(メタデータ) (2025-10-25T17:27:08Z) - ReCoVeR the Target Language: Language Steering without Sacrificing Task Performance [7.683783054626681]
ReCoVeRは、言語固有のステアリングベクトルに基づいた、言語の混乱を低減するための、新しい軽量なアプローチである。
3つのベンチマークと18の言語を含む我々の評価は、ReCoVeRがモノリンガルとクロスランガルの両方のセットアップにおいて、言語の混乱を効果的に軽減していることを示している。
論文 参考訳(メタデータ) (2025-09-18T10:15:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。