論文の概要: Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency
- arxiv url: http://arxiv.org/abs/2607.19194v2
- Date: Wed, 22 Jul 2026 03:53:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 14:36:03.349946
- Title: Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency
- Title(参考訳): 構造的シーン知識と検証可能な推論-行動整合性を用いた自律走行のための認知的デュアルプロシージャ計画
- Abstract要約: 視覚言語モデル(VLM)は、中間的推論を明示するが、それらが配置されたプランナーでの使用は、コストのかかる監視によって制限される。
本稿では,マシンパーザブルな構造化チェーン・オブ・シンクレットにおける計画関連シーン知識を表現した認知的二プロセス計画フレームワークを提案する。
適応推論とルールに基づく検証により、高レベルなVLM計画決定を支援することで、シーン知識の明示的な運用方法を示す。
- 参考スコア(独自算出の注目度): 15.031457072334662
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-level planning for autonomous driving is a knowledge-intensive engineering decision task that requires accurate scene understanding, timely inference, and internally consistent action selection. Vision-language models (VLMs) can make intermediate reasoning explicit, but their use in deployed planners is constrained by costly structured supervision, unnecessary reasoning in routine scenes, and possible inconsistencies between generated rationales and driving actions. We present a cognitive dual-process planning framework that represents planning-relevant scene knowledge in a machine-parsable structured chain-of-thought (S-CoT) schema. An automated data engine integrates perception foundation models, critical-path filtering, and an expert VLM to generate S-CoT supervision without manual annotation of individual rationales. A lightweight visual Arbiter estimates scene complexity from multilevel vision-encoder features before language decoding and routes each input to either fast meta-action prediction or slow structured reasoning. For slow-path outputs, a deterministic rule-based validator checks whether the parsed S-CoT fields are consistent with the final meta-action and provides verifiable rewards for Group Relative Policy Optimization (GRPO). In a 195-scene manual audit, the generated annotations achieve 91.8\% CoT accuracy and a 98.5\% Logical Consistency Score (LCS). On 574 manually verified NAVSIM test samples, the planner achieves 80.14\% planning accuracy and 97.20\% LCS while reducing average latency by 17.39\% relative to applying slow reasoning to every scene. Evaluation on external long-tail subsets further identifies conditions under which routing and planning performance degrade. Together, these results show how explicit scene knowledge can be operationalized through adaptive reasoning and rule-based verification to support high-level VLM planning decisions.
- Abstract(参考訳): 自律運転のためのハイレベルプランニングは、正確なシーン理解、タイムリー推論、内部的に一貫した行動選択を必要とする知識集約型エンジニアリング決定タスクである。
視覚言語モデル(VLM)は、中間的推論を明示するが、配置されたプランナーでの使用は、コストがかかる構造上の監督、日常的な場面での不要な推論、生成した論理と駆動動作の矛盾によって制限される。
本稿では,マシンパーザブルな構造化チェーン・オブ・ソート(S-CoT)スキーマにおいて,計画に関連のあるシーン知識を表現した認知的デュアルプロセス計画フレームワークを提案する。
自動データエンジンは、認識基盤モデル、クリティカルパスフィルタリング、エキスパートVLMを統合して、個々の論理のマニュアルアノテーションなしでS-CoT監視を生成する。
軽量ビジュアルArbiterは、言語復号の前にマルチレベル視覚エンコーダの機能からシーンの複雑さを推定し、各入力を高速なメタアクション予測または遅い構造化推論にルーティングする。
遅いパスの出力に対して、決定論的ルールベースのバリデータは、解析されたS-CoTフィールドが最終メタアクションと一致しているかどうかを確認し、グループ相対ポリシー最適化(GRPO)に対して検証可能な報酬を提供する。
195回のマニュアル監査では、生成されたアノテーションは91.8\% CoT精度と98.5\% Logical Consistency Score (LCS)を達成する。
574の手作業によるNAVSIMテストサンプルでは、プランナーは80.14\%の計画精度と97.20\%のLCSを達成し、平均遅延を各シーンにスロー推論を適用することと比較して17.39\%削減した。
外部のロングテールサブセットの評価は、ルーティングと計画性能が劣化する条件をさらに特定する。
これらの結果は,適応推論とルールに基づく検証によって,高レベルなVLM計画決定を支援することで,シーン知識の明示的な運用方法を示すものである。
関連論文リスト
- FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving [8.241982806652256]
計画クリティカル要因(PCF)による適応的多段階推論のためのエンドツーエンドフレームワークであるFacterDriveを提案する。
PCF-CoTデータセットは、軌道に関連のある空間物理学的証拠を推論する計画を立てる。
QS-GRPOはモンテカルロ木探索(MCTS)を軌道レベルの計画報酬でガイドし、より高い計画品質の推論経路を発見する。
論文 参考訳(メタデータ) (2026-08-10T13:26:09Z) - CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving [19.474428775260034]
超高速な生成計画と深い意味的推論を組み合わせたフレームワークであるCLEARを提案する。
CLEARはDrive-JEPAをビジュアルエンコーダとして採用し、VAEラテント空間におけるマルチステップデノイングチェーンを単一ステップ条件ドリフトに置き換える。
NAVSIM v1ベンチマークでは、CLEARは93.7の最先端のPDMSを達成した。
論文 参考訳(メタデータ) (2026-06-04T14:32:10Z) - Steered Generation via Gradient-Based Optimization on Sparse Query Features [1.587869707099313]
Prototype-Based Sparse Steeringは、Sparse Autoencodersを特にクエリアクティベーションに適用するフレームワークである。
本研究では,スパースクエリ表現が論理的計画法と構造的ニュアンスの両方を統一的かつ解釈可能な制御に必要であることを示す。
論文 参考訳(メタデータ) (2026-05-21T21:13:14Z) - VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model [54.35791816657227]
適応型テスト時間計算でVLAモデルを実現するフレームワークである textbfVLA-ATTC' を導入する。
VLA-ATTCは、不確実性に基づく認知クラッチ'を用いて、反射的実行からTTC熟考フェーズへ動的に移行する。
LIBERO-LONGベンチマークでは、VLA-ATTCはSOTAモデルPI0.5の故障率を50%以上削減する。
論文 参考訳(メタデータ) (2026-05-02T02:13:11Z) - OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models [69.2503510410147]
予め訓練されたVLM上に構築した統合自動運転フレームワークを提案する。
トレーニング済みのVLMアテンションは、純粋言語モデリング以上の強い伝達性を示すことを示す。
エンドツーエンドの自動運転ベンチマークの実験は、最先端のパフォーマンスを示している。
論文 参考訳(メタデータ) (2026-04-20T07:50:00Z) - Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles [40.195332742819865]
本研究では,大規模言語モデル(LLM)を利用して命令を解釈する命令実現フレームワークを提案する。
リアルタイムフィードバックに基づいて、複数のモデル予測制御(MPC)ベースのモーションプランナをスケジュールする実行可能なスクリプトを生成し、計画されたトラジェクトリを制御信号に変換する。
論文 参考訳(メタデータ) (2026-04-09T09:32:21Z) - Bridging Large-Model Reasoning and Real-Time Control via Agentic Fast-Slow Planning [42.15812524999639]
Agentic Fast-Slow Planning(エージェント・ファスト・スロー・プランニング)は、知覚、推論、計画、そして自然の時間スケールをまたいだ制御を分離する階層的なフレームワークである。
エージェント高速スロープランニングは摂動下での堅牢性を向上し、純粋なMPCおよびA*誘導MPCベースラインと比較して、横方向偏差を最大45%減らし、完了時間を12%以上短縮することを示した。
論文 参考訳(メタデータ) (2026-04-02T06:34:29Z) - SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving [52.02379432801349]
本稿では,運転特化知識階層に関するVLMの表現学習を構築する新しいフレームワークであるSGDriveを提案する。
トレーニング済みのVLMバックボーン上に構築されたSGDriveは、人間の運転認知を反映するシーンエージェントゴール階層に、駆動理解を分解する。
論文 参考訳(メタデータ) (2026-01-09T08:55:42Z) - Foundation Models for Logistics: Toward Certifiable, Conversational Planning Interfaces [59.80143393787701]
大規模言語モデル(LLM)は不確実性に対処し、導入障壁を低くしながら再計画の加速を約束する。
本稿では,自然言語対話のアクセシビリティと目標解釈の検証可能な保証とを組み合わせたニューロシンボリック・フレームワークを提案する。
わずか100個の不確実性フィルタで微調整された軽量モデルは、GPT-4.1のゼロショット性能を上回り、推論遅延を50%近く削減する。
論文 参考訳(メタデータ) (2025-07-15T14:24:01Z) - Control-Aware Prediction Objectives for Autonomous Driving [78.19515972466063]
本研究では,制御に対する予測の下流効果を評価するための制御認識予測目標(CAPOs)を提案する。
本稿では,エージェント間の注意モデルを用いた重み付けと,予測軌跡を接地真実軌跡に交換する際の制御変動に基づく重み付けの2つの方法を提案する。
論文 参考訳(メタデータ) (2022-04-28T07:37:21Z) - An Information Bottleneck Approach for Controlling Conciseness in
Rationale Extraction [84.49035467829819]
我々は,情報ボトルネック(IB)の目的を最適化することで,このトレードオフをよりよく管理できることを示す。
我々の完全教師なしのアプローチは、文上のスパース二項マスクを予測する説明器と、抽出された合理性のみを考慮したエンドタスク予測器を共同で学習する。
論文 参考訳(メタデータ) (2020-05-01T23:26:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。