論文の概要: XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving
- arxiv url: http://arxiv.org/abs/2608.10976v1
- Date: Tue, 11 Aug 2026 14:33:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:46.0758
- Title: XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving
- Title(参考訳): XCoT-VLA:視線制御駆動のための実行可能なチェーン
- Abstract要約: 本稿では,記述的有理をコンパクトな実行可能なCoTトークンに置き換えるXCoT-VLAを提案する。
ログ化された軌跡は行動証拠を提供し、シーンコンテキストは因果的意味論を提供する。
XCoT-VLAは自己回帰推論のオーバーヘッドを大幅に減らし、リアルタイムの計画予算内に留まる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models can connect scene understanding, semantic reasoning, and trajectory generation for autonomous driving. However, verbose natural-language Chain-of-Thought (CoT) is poorly suited to real-time control because it is open-ended, costly to decode, and difficult to optimize as an action-facing representation. We propose XCoT-VLA, which replaces descriptive rationales with compact executable CoT tokens learned from automatically constructed Reason-Action supervision. Logged trajectories provide action evidence, while scene context supplies causal semantics. The predicted XCoT sequence remains in context and conditions fixed trajectory queries through shared multimodal self-attention. Deterministic token-function routing applies the Reason FFN to XCoT tokens and the Control FFN to trajectory queries for flow-matching trajectory generation. We further introduce XCoT Policy Optimization (XCPO) as an optional refinement extension in the same executable token space. XCoT-VLA reduces longitudinal ADE from 1.645 to 1.323 on a general-distribution set and lateral FDE from 1.616 to 0.648 in lane-change scenarios. By representing driving-oriented reasoning with only 2-6 executable XCoT tokens, our method substantially reduces autoregressive reasoning overhead and remains within the real-time planning budget. These results demonstrate that driving-oriented reasoning can be compact, executable, and directly connected to trajectory generation.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、シーン理解、セマンティック推論、そして自律運転のための軌道生成を接続することができる。
しかし、自然言語のChain-of-Thought(CoT)は、オープンエンドであり、デコードにコストがかかり、アクション対応表現として最適化が難しいため、リアルタイム制御には適していない。
本稿では,XCoT-VLAを提案する。XCoT-VLAは,自動構築されたReason-Actionの監視から学んだ,コンパクトな実行可能なCoTトークンに置き換える。
ログ化された軌跡は行動証拠を提供し、シーンコンテキストは因果的意味論を提供する。
予測されたXCoTシーケンスは、共有マルチモーダル自己アテンションを通じて、コンテキストと条件が固定されたトラジェクトリクエリに留まる。
決定論的トークン関数ルーティングは、XCoTトークンにReason FFNを、フローマッチングトラジェクトリ生成のためのトラジェクトリクエリにControl FFNを適用する。
さらに、XCoT Policy Optimization (XCPO) を、同じ実行可能なトークン空間における任意の改善拡張として導入する。
XCoT-VLA は車線変更のシナリオにおいて、経時 ADE を 1.645 から 1.323 に、側方 FDE を 1.616 から 0.648 に削減する。
2-6個の実行可能なXCoTトークンで駆動指向推論を表現することで,自己回帰推論のオーバーヘッドを大幅に低減し,リアルタイム計画予算内に留まる。
これらの結果は、駆動指向推論がコンパクトで実行可能であり、軌道生成に直接接続可能であることを示す。
関連論文リスト
- Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving [37.533498955258544]
本稿では,インスタンスレベルの残差をクラスレベルの遅延シフトに置き換える単一パス誘導機構を提案する。
我々はLCSがより強力なコマンドアテンデンスを実現しつつ、推論遅延を約50%削減できることを実証した。
論文 参考訳(メタデータ) (2026-07-31T19:32:28Z) - Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency [15.031457072334662]
視覚言語モデル(VLM)は、中間的推論を明示するが、それらが配置されたプランナーでの使用は、コストのかかる監視によって制限される。
本稿では,マシンパーザブルな構造化チェーン・オブ・シンクレットにおける計画関連シーン知識を表現した認知的二プロセス計画フレームワークを提案する。
適応推論とルールに基づく検証により、高レベルなVLM計画決定を支援することで、シーン知識の明示的な運用方法を示す。
論文 参考訳(メタデータ) (2026-07-21T15:29:21Z) - End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation [59.188006170485046]
E2E-CDiffは、制御可能で現実的なシナリオ生成のためのエンドツーエンドの条件拡散フレームワークである。
微分可能な誘導は速度を規制し、乾燥可能な領域のコンプライアンスを強制し、衝突回避や衝突回避行動をサポートする。
E2E-CDiffは、学習ベースのエゴプランナーとしても競争力がある。
論文 参考訳(メタデータ) (2026-07-21T02:13:25Z) - MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving [54.57163800903507]
我々は、自動運転のための最初の統合ストリーミングVLAアーキテクチャであるMindVLA-U1を紹介する。
統一されたVLMバックボーンは、1つの共有表現に1つのフォワードパスでAR言語トークンとフローマッチングされた連続的なアクショントラジェクトリを生成する。
ロングテールのWOD-E2Eベンチマークでは、MindVLA-U1が経験豊富な人間のドライバーを初めて上回った。
論文 参考訳(メタデータ) (2026-05-12T18:09:42Z) - VECTOR-Drive: Tightly Coupled Vision-Language and Trajectory Expert Routing for End-to-End Autonomous Driving [10.83468363371212]
エンドツーエンドの自動運転は、交通シーンを理解し、運転意図を推測し、実行可能な動作計画を生成するモデルを必要とする。
本稿では,Qwen2.5-VL-3B上に構築された密結合型視覚言語アクションフレームワークであるVECTOR-DRIVEを提案する。
Bench2Driveでは、VECTOR-DRIVEは88.91のドライビングスコアを獲得し、代表的なエンドツーエンドとVLAベースのベースラインを上回っている。
論文 参考訳(メタデータ) (2026-05-09T09:34:50Z) - OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation [61.18260993245354]
Chain-of-Thought(CoT)推論は、VLAベースの自律運転において、軌道予測の強力なドライバである。
本稿では,2つの補助デコーダによって制御されるコンパクトな潜在トークンを通じて推論をルーティングする,統一VLAおよびワールドモデルフレームワークであるOneVLを提案する。
OneVLは、明示的なCoTを超える最初の遅延CoTメソッドとなり、応答のみのレイテンシで最先端の精度を提供する。
論文 参考訳(メタデータ) (2026-04-20T16:37:22Z) - OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models [69.2503510410147]
予め訓練されたVLM上に構築した統合自動運転フレームワークを提案する。
トレーニング済みのVLMアテンションは、純粋言語モデリング以上の強い伝達性を示すことを示す。
エンドツーエンドの自動運転ベンチマークの実験は、最先端のパフォーマンスを示している。
論文 参考訳(メタデータ) (2026-04-20T07:50:00Z) - DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models [50.07453075750711]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を直接ロボット行動にマッピングする。
近年の取り組みは、行動能力の前に思考でVLAモデルを育むために、Chain-of-Thought (CoT)推論を取り入れている。
並列推論機構を持つVLAモデルの視覚言語的CoT法であるDualCoT-VLAを提案する。
論文 参考訳(メタデータ) (2026-03-23T17:59:25Z) - Accelerating Structured Chain-of-Thought in Autonomous Vehicles [55.78214218065611]
チェーン・オブ・ソート(CoT)推論は、自律運転における視覚言語行動モデルの意思決定能力を高める。
FastDriveCoTはテンプレート構造CoTを高速化する新しい並列復号法である。
論文 参考訳(メタデータ) (2026-02-02T22:14:26Z) - ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving [44.008287454538596]
視覚言語モデル(VLM)は、クロスモーダルな先行とコモンセンス推論を導入することで、このパラダイムを豊かにする。
現在のVLMベースのプランナは、(i) 個別のテキスト推論と継続的制御のミスマッチ、(ii) 自己回帰的連鎖のデコーディングからの高い遅延、(iii) リアルタイムデプロイメントを制限する非効率または非因果的なプランナである。
テキストから潜在空間へ推論を転送し,それを階層的並列軌道デコーダで結合する統合視覚言語アクションフレームワークColaVLAを提案する。
論文 参考訳(メタデータ) (2025-12-28T14:06:37Z) - GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving [22.92109402334754]
運転計画は、エンドツーエンド(E2E)自動運転の重要な要素である。
textittextbfGuideFlowは、本質的にモード崩壊を緩和するフローマッチングプロセスを明示的にモデル化する。
textittextbfGuideFlowは、生成中の制御信号としてアグレッシブな動作をパラメータ化することで、トラジェクトリスタイルの正確な操作を可能にする。
論文 参考訳(メタデータ) (2025-11-24T03:45:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。