論文の概要: AnchorReasoning: A Visual Grounding and Causal Reasoning Dataset in Long-Tail Autonomous Driving Scenarios
- arxiv url: http://arxiv.org/abs/2609.28366v1
- Date: Wed, 23 Sep 2026 16:38:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.123476
- Title: AnchorReasoning: A Visual Grounding and Causal Reasoning Dataset in Long-Tail Autonomous Driving Scenarios
- Title(参考訳): Anchor Reasoning: 長距離自律走行シナリオにおける視覚的グラウンドと因果推論データセット
- Abstract要約: We introduced AnchorReasoning, a visually grounded reasoning dataset built on WOD-E2E。
各フレームは、決定クリティカルな要素の識別とローカライゼーションをリンクする視覚的に接地されたチェーン・オブ・ソート(VG-CoT)として構成される。
実験により、VG-CoTの監督は、基底的推論と軌道予測を改善することが示された。
- 参考スコア(独自算出の注目度): 16.070919731356643
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) offer a promising approach to long-tail autonomous driving, but existing driving datasets provide limited supervision for connecting decision-critical visual evidence with reasoning and planning. We introduce AnchorReasoning, a visually grounded reasoning dataset built on WOD-E2E, containing 416,119 annotated frames and 395,379 decision-critical elements across four major categories and 19 fine-grained types. Each frame is organized as a visually grounded chain-of-thought (VG-CoT) that links decision-critical element identification and localization, element attributes and implications, driving-action rationale, and action and trajectory planning. We further develop a curriculum supervised fine-tuning strategy that progressively learns these hierarchical capabilities, together with an object-size-aware grounding metric for evaluating localization quality. Experiments across eight general-purpose, embodied-AI, and AV-specific backbones show that VG-CoT supervision improves grounded reasoning and trajectory prediction. Across models, 5-s ADE and FDE decrease by 7.84 and 11.86, while RFS Frame and Cluster improve by 1.66 and 1.70. These gains are achieved with 18.5 fewer reasoning tokens and 0.32 s/frame lower inference latency on average, demonstrating the value of visually grounded, decision-focused supervision for VLM reasoning and planning in long-tail autonomous driving.
- Abstract(参考訳): 視覚言語モデル(VLM)は、長距離自動運転に対する有望なアプローチを提供するが、既存の運転データセットは、決定クリティカルな視覚的証拠と推論と計画を結びつけるための限定的な監督を提供する。
AnchorReasoningはWOD-E2E上に構築され,416,119の注釈付きフレームと395,379の決定クリティカルな要素を4つの主要カテゴリと19のきめ細かなタイプで含む視覚的根拠付き推論データセットである。
各フレームは、決定クリティカルな要素の識別とローカライゼーション、要素属性と含意、駆動アクションの合理性、行動と軌道計画をリンクする視覚的基盤化されたチェーン・オブ・シンク(VG-CoT)として構成される。
さらに,これらの階層的能力を段階的に学習する教師付き微調整戦略と,ローカライズ品質を評価するためのオブジェクトサイズ対応グラウンドリング指標を開発する。
8つの汎用、エンボディドAI、AV固有のバックボーンを用いた実験は、VG-CoTの監督が基底的推論と軌道予測を改善することを示している。
モデル全体の 5-s ADE と FDE は 7.84 と 11.86 に減少し、RDS Frame と Cluster は 1.66 と 1.70 に改善された。
これらの利得は18.5個の推論トークンを減らし、平均で0.32秒/フレームの推論遅延を減らし、長い尾の自動運転におけるVLM推論と計画のための視覚的基盤と意思決定中心の監督の価値を示す。
関連論文リスト
- Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs [28.861025642391155]
我々は,教師モデルが現場証拠から決定を推測するよりも,明らかな結果の合理化を図っていることを示す。
GT軌道の除去は、このショートカットを除去するが、オープンエンド軌道生成は、精密な幾何学的合成と低レベルダイナミクスで高レベルな決定を絡ませる。
本稿では,先決定アンカーから後決定検証ターゲットへの将来の軌跡を変換するために,Deferred Exposure of Future Trajectories for RLVR (DEFT-RLVR)を提案する。
論文 参考訳(メタデータ) (2026-08-03T06:24:36Z) - nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving [19.059816289219082]
nuReasoningは、推論中心の自動運転のための大規模な実世界のデータセットとベンチマークである。
データセットには、20秒毎に20,000のクリップが含まれており、複数の都市で収集されている。
推論評価と計画評価の両方をサポートし、推論の監督が運転性能にどのように影響するかを直接研究することができる。
論文 参考訳(メタデータ) (2026-05-29T17:40:04Z) - dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning [69.36145467833498]
本稿では,拡散に基づく視覚言語モデルであるdVLM-ADを導入する。
nuScenes と WOD-E2E で評価すると、dVLM-AD はより一貫性のある推論・アクションのペアとなり、既存の駆動VLM/VLAシステムに匹敵する計画性能を達成する。
論文 参考訳(メタデータ) (2025-12-04T05:05:41Z) - Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail [85.47497935739936]
Alpamayo-R1 (AR1) は、因果推論の連鎖と軌道計画を統合する視覚言語モデルである。
また,AR1は,軌道のみのベースラインに比べて,難問の計画精度が12%向上することを示した。
今後のアップデートで、AR1モデルとCoCのサブセットをリリースする予定です。
論文 参考訳(メタデータ) (2025-10-30T01:25:34Z) - LeAD: The LLM Enhanced Planning System Converged with End-to-end Autonomous Driving [48.607991747956255]
本稿では,大規模な言語モデル(LLM)拡張と模倣学習に基づくエンドツーエンド(E2E)フレームワークを統合した,二段階自動運転アーキテクチャLeADを提案する。
CARLAシミュレータでの実験的な評価は、LeADが従来と異なるシナリオをうまく扱えることを示し、Leadboard V1ベンチマークで71点、ルート完了率は93%である。
論文 参考訳(メタデータ) (2025-07-08T07:58:29Z) - SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models [15.50826328938879]
視覚言語モデル(VLM)の空間的推論能力を評価するためのベンチマークであるSURDSを紹介する。
nuScenesデータセットに基づいて構築されたSURDSは、41,080の視覚要求回答トレーニングインスタンスと9,250の評価サンプルで構成されている。
本研究では,空間的に接地された報酬信号を利用した強化学習に基づくアライメント手法を提案する。
論文 参考訳(メタデータ) (2024-11-20T08:14:01Z) - DiFSD: Ego-Centric Fully Sparse Paradigm with Uncertainty Denoising and Iterative Refinement for Efficient End-to-End Self-Driving [55.53171248839489]
我々は、エンドツーエンドの自動運転のためのエゴ中心の完全スパースパラダイムであるDiFSDを提案する。
特に、DiFSDは主にスパース知覚、階層的相互作用、反復的な運動プランナーから構成される。
nuScenesとBench2Driveデータセットで実施された実験は、DiFSDの優れた計画性能と優れた効率を実証している。
論文 参考訳(メタデータ) (2024-09-15T15:55:24Z) - Reason2Drive: Towards Interpretable and Chain-based Reasoning for Autonomous Driving [38.28159034562901]
Reason2Driveは600万以上のビデオテキストペアを備えたベンチマークデータセットである。
我々は、自律運転プロセスが知覚、予測、推論ステップの逐次的な組み合わせであると特徴付けている。
本稿では,自律システムにおける連鎖型推論性能を評価するための新しい集計評価指標を提案する。
論文 参考訳(メタデータ) (2023-12-06T18:32:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。