論文の概要: Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
- arxiv url: http://arxiv.org/abs/2608.01755v2
- Date: Tue, 04 Aug 2026 02:59:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.429969
- Title: Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
- Title(参考訳): 自律走行VLMにおける検証可能な推論のための将来の軌道のデフレの露光
- Authors: Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie, Yakun Zhu, Hao Geng, Xiaozhi Chen, Yikun Ban, Deqing Wang,
- Abstract要約: 我々は,教師モデルが現場証拠から決定を推測するよりも,明らかな結果の合理化を図っていることを示す。
GT軌道の除去は、このショートカットを除去するが、オープンエンド軌道生成は、精密な幾何学的合成と低レベルダイナミクスで高レベルな決定を絡ませる。
本稿では,先決定アンカーから後決定検証ターゲットへの将来の軌跡を変換するために,Deferred Exposure of Future Trajectories for RLVR (DEFT-RLVR)を提案する。
- 参考スコア(独自算出の注目度): 28.861025642391155
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent Vision-Language-Action (VLA) models for autonomous driving (AD) increasingly utilize chain-of-thought (CoT) supervision to enhance the reasoning capabilities of their Vision-Language Model (VLM) components, yet existing annotation pipelines commonly expose the teacher model to the logged ground-truth (GT) future trajectory. We empirically show that this induces trajectory anchoring bias: teacher models rationalize the revealed outcome rather than infer a decision from scene evidence, producing less causally faithful CoTs and substantially more severe hallucinations, especially in causally challenging scenes. Removing the GT trajectory eliminates this shortcut, but open-ended trajectory generation entangles high-level decision-making with precise geometric synthesis and low-level dynamics. To make trajectory-level driving decisions verifiable without requiring open-ended trajectory synthesis, we introduce Autonomous-Driving Multiple-Choice Question (AD-MCQ), which casts planning as selection among explicit trajectory candidates. Taking this a step further, we propose Deferred Exposure of Future Trajectories for RLVR (DEFT-RLVR) to transform future trajectories from pre-decision anchors into post-decision verification targets. Experimental results show that DEFT-RLVR improves AD reasoning while preserving or even enhancing general visual capabilities. With VLM-only inference and controllable difficulty through candidate construction, AD-MCQ provides a flexible, scalable, and extensible foundation for future research on verifiable AD reasoning.
- Abstract(参考訳): 近年の自律走行(AD)のためのビジョン・ランゲージ・アクション(VLA)モデルでは、チェーン・オブ・思想(CoT)の監督を利用してビジョン・ランゲージ・モデル(VLM)コンポーネントの推論能力を高めている。
教師モデルは、シーンエビデンスから決定を推測するのではなく、明らかな結果を合理化し、因果的忠実なCoTを減らし、特に因果的困難な場面において、より深刻な幻覚を生じさせる。
GT軌道の除去は、このショートカットを除去するが、オープンエンド軌道生成は、精密な幾何学的合成と低レベルダイナミクスで高レベルな決定を絡ませる。
そこで本稿では, 自律走行多視点質問 (AD-MCQ) を導入し, 明示的な軌跡候補の選択として計画を立てる。
さらにこれを一歩進めて、先決定アンカーから後決定検証ターゲットへ将来の軌道を変換するRLVR(DEFT-RLVR)のためのDedeerred Exposure of Future Trajectoriesを提案する。
実験結果から,DEFT-RLVRは一般的な視覚機能を維持したり,強化したりしながら,AD推論を改善することが示された。
VLMのみの推論と、候補構築による制御可能な困難さにより、AD-MCQは、将来の検証可能なAD推論の研究のための柔軟でスケーラブルで拡張可能な基盤を提供する。
関連論文リスト
- LIDAR-AD: A Decoder-Free Latent-Interaction Dreamer with Action-Residual Chains for Autonomous Driving [8.326300282526061]
LIDAR-ADは、自律運転のためのアクション・レジデンシャル・チェーンを備えたデコーダフリーのラテント・インタラクション・ドリーマーである。
観測再構成を冗長に再現された潜在アライメントに置き換え、リスク関連関係のコンパクトな表現を奨励する。
さらに、車両制御を残留動作更新としてモデル化し、残留動作シーケンスコントラスト学習を使用して、多段階残留駆動ロールアウトを将来の潜在状態と整合させる。
論文 参考訳(メタデータ) (2026-07-12T16:06:09Z) - LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning [51.969318585152116]
LatentPilotは、トレーニング中の将来の観察を貴重なデータソースとして利用して、アクション条件付きビジュアルダイナミクスを学習する。
そこで本稿では,フライホイール方式のトレーニング機構を提案する。これは,道路上の軌道を反復的に収集し,エージェントの行動分布に適合するようにモデルを再訓練する。
R2R-CE、RxR-CE、R2R-PEベンチマークの実験では新たなSOTA結果が得られた。
論文 参考訳(メタデータ) (2026-03-31T02:21:59Z) - EvoDriveVLA: Evolving Autonomous Driving Vision-Language-Action Model via Collaborative Perception-Planning Distillation [58.84721000276226]
EvoDriveVLAは、新しい協調認識計画フレームワークである。
自己認識の知覚的制約とオラクル誘導軌道最適化を統合している。
EvoDriveVLAはオープンループ評価におけるSOTA性能を実現し,クローズドループ評価における性能を大幅に向上させる。
論文 参考訳(メタデータ) (2026-03-10T10:19:07Z) - dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning [69.36145467833498]
本稿では,拡散に基づく視覚言語モデルであるdVLM-ADを導入する。
nuScenes と WOD-E2E で評価すると、dVLM-AD はより一貫性のある推論・アクションのペアとなり、既存の駆動VLM/VLAシステムに匹敵する計画性能を達成する。
論文 参考訳(メタデータ) (2025-12-04T05:05:41Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - AutoDrive-R$^2$: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving [37.260140808367716]
本稿では,自律運転システムの推論能力と自己回帰能力を両立させる新しいVLAフレームワークであるAutoDrive-R$2$を提案する。
まず,教師付き微調整のための新しいCoTデータセット nuScenesR$2$-6K を提案する。
次に, グループ相対政策最適化(GRPO)アルゴリズムを用いて, 信頼性の高い滑らかさと現実的な軌道計画を実現する。
論文 参考訳(メタデータ) (2025-09-02T04:32:24Z) - ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving [49.07731497951963]
ReCogDriveは、エンドツーエンドの自動運転のための新しい強化認知フレームワークである。
我々は、人間のドライバーのシーケンシャルな認知過程を模倣する階層的なデータパイプラインを導入する。
次に、VLMの学習した運転先を拡散プランナーに注入することで、言語行動ミスマッチに対処する。
論文 参考訳(メタデータ) (2025-06-09T03:14:04Z) - VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision [17.36342349850825]
教師としての視覚言語モデル(VLM)は、追加の監督を提供することで訓練を強化する。
VLM-ADは、nuScenesデータセットの計画精度と衝突率の大幅な改善を実現している。
論文 参考訳(メタデータ) (2024-12-19T01:53:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。