論文の概要: AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning
- arxiv url: http://arxiv.org/abs/2607.03182v1
- Date: Fri, 03 Jul 2026 10:38:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.546824
- Title: AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning
- Title(参考訳): AnchorVLA:ビジョン・ランゲージ・アクション・プランニングのための離散的決定と連続的軌道
- Abstract要約: AnchorVLAは階層的な意思決定型VLA計画フレームワークである。
トラジェクトリ・パターン・アンカーを高レベルなVLA推論と連続的なトラジェクトリ実行の間の明示的なインターフェースとして使用する。
最先端の成功率77.28、競争力89.92を達成している。
- 参考スコア(独自算出の注目度): 13.949868529278504
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous driving planning requires translating navigation intent, traffic rules, dynamic interactions, and language instructions into executable continuous trajectories. Vision-Language-Action models have been introduced into driving planning to improve long-tail generalization, commonsense reasoning, high-level semantic understanding, and explainability. However, existing VLA planners mainly follow planning-head-based trajectory prediction or full-trajectory autoregressive generation. The former only weakly constrains continuous trajectory generation with VLA reasoning, while the latter relies on long sequences of low-information-density coordinate tokens, making semantic-action alignment difficult and leading to discretization errors and inefficient inference. To address these limitations, we propose AnchorVLA, a hierarchical decision-anchored VLA planning framework that uses trajectory-pattern anchors as an explicit interface between high-level VLA reasoning and continuous trajectory execution. Specifically, Decision-as-Anchor Representation represents behavior-level driving decisions with anchor tokens, each encoding an entire local motion pattern rather than a single coordinate point. Decision-Anchored Residual Flow then generates fine-grained continuous trajectories in the selected anchor-defined residual space, capturing multi-modal execution refinements after high-level decision making. By reasoning over compact and semantically meaningful anchors instead of autoregressively generating waypoint sequences, AnchorVLA preserves LLM-based decision making while improving inference efficiency, semantic-action alignment, and continuous generation flexibility. Experiments on the Bench2Drive closed-loop benchmark show that AnchorVLA achieves a state-of-the-art Success Rate of 77.28 and a competitive Driving Score of 89.92.
- Abstract(参考訳): 自律運転計画では、ナビゲーションインテント、トラフィックルール、動的インタラクション、言語命令を実行可能な連続的なトラジェクトリに変換する必要がある。
Vision-Language-Actionモデルは、ロングテールの一般化、常識推論、ハイレベルなセマンティック理解、説明可能性を改善するための計画に導入された。
しかしながら、既存のVLAプランナーは、主に計画ヘッドに基づく軌道予測または全軌道自己回帰生成に従う。
前者はVLA推論による連続的な軌道生成を弱く制限する一方、後者は低情報密度座標トークンの長いシーケンスに依存し、セマンティック・アクションのアライメントが難しくなり、離散化エラーと非効率的な推論をもたらす。
これらの制約に対処するため,高レベルなVLA推論と連続的な軌跡実行の明示的なインターフェースとしてトラジェクトリ・パターン・アンカーを用いる階層的意思決定型VLA計画フレームワークであるAnchorVLAを提案する。
具体的には、動作レベルの決定をアンカートークンで表現し、それぞれが単一の座標点ではなく局所的な動きパターン全体を符号化する。
決定アンカー定義残差空間における細粒度連続軌道を決定アンカー定義残差空間に生成し,高次決定後のマルチモーダルな実行改善を捉える。
自動回帰的にウェイポイントシーケンスを生成する代わりに、コンパクトで意味のあるアンカーを推論することで、AnchorVLAは推論効率、セマンティックアクションアライメント、連続生成の柔軟性を改善しながらLLMベースの意思決定を保存する。
Bench2Driveのクローズドループベンチマークの実験では、AnchorVLAは77.28の最先端の成功率と89.92の競合駆動スコアを達成した。
関連論文リスト
- Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving [37.533498955258544]
本稿では,インスタンスレベルの残差をクラスレベルの遅延シフトに置き換える単一パス誘導機構を提案する。
我々はLCSがより強力なコマンドアテンデンスを実現しつつ、推論遅延を約50%削減できることを実証した。
論文 参考訳(メタデータ) (2026-07-31T19:32:28Z) - S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving [8.813976817688605]
VLM(Vision-Language Models)は、自律運転における高レベルの推論に顕著な可能性を示している。
VLMは、個別の言語トークンと連続的な軌道計画のミスマッチによって、正確で低レベルな制御アクションを生成するのに苦労する。
本稿では,視覚・言語・行動モデルにおける意味的・空間的ストリームを明示的に分離するS-squared-VLAを提案する。
論文 参考訳(メタデータ) (2026-07-15T15:07:02Z) - Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation [79.12557132788139]
VLN-CE(Vision-Language Navigation in Continuous Environments)では、エージェントが現実世界のような環境でナビゲートしながら自然言語の指示に従う必要がある。
ほとんどのVLN-CEアプローチでは、ウェイポイント予測器がウェイポイントを提案し、ナビゲータが最良のウェイポイントを選択する。
提案手法は,各候補の経路点を実行可能な軌道に配置する,トラジェクトリ・ウェイポイントという新しいパラダイムを導入する。
論文 参考訳(メタデータ) (2026-06-05T13:11:39Z) - Latent Goal Prediction from Language for Model-Based Planning [19.768973349254285]
Latent Goal Prediction from Language (LAGO) は、言語命令とアクション条件付きロールアウトから中間目標状態のシーケンスを予測するフレームワークである。
LAGOは、言語から純粋に頑健で正確なロングホライゾン計画を達成することで、テキスト誘導制御の柔軟性によって視覚目標の精度を橋渡しする。
論文 参考訳(メタデータ) (2026-05-26T20:04:33Z) - MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving [54.57163800903507]
我々は、自動運転のための最初の統合ストリーミングVLAアーキテクチャであるMindVLA-U1を紹介する。
統一されたVLMバックボーンは、1つの共有表現に1つのフォワードパスでAR言語トークンとフローマッチングされた連続的なアクショントラジェクトリを生成する。
ロングテールのWOD-E2Eベンチマークでは、MindVLA-U1が経験豊富な人間のドライバーを初めて上回った。
論文 参考訳(メタデータ) (2026-05-12T18:09:42Z) - VECTOR-Drive: Tightly Coupled Vision-Language and Trajectory Expert Routing for End-to-End Autonomous Driving [10.83468363371212]
エンドツーエンドの自動運転は、交通シーンを理解し、運転意図を推測し、実行可能な動作計画を生成するモデルを必要とする。
本稿では,Qwen2.5-VL-3B上に構築された密結合型視覚言語アクションフレームワークであるVECTOR-DRIVEを提案する。
Bench2Driveでは、VECTOR-DRIVEは88.91のドライビングスコアを獲得し、代表的なエンドツーエンドとVLAベースのベースラインを上回っている。
論文 参考訳(メタデータ) (2026-05-09T09:34:50Z) - Long-Horizon Manipulation via Trace-Conditioned VLA Planning [55.80061850746898]
LoHo-Manipは、短い水平VLA実行を専用のタスク管理VLMを介して長い水平命令にスケールするフレームワークである。
LoHo-Manipは、サブタスクシーケンスと明示的な完了+残り分割を軽量言語メモリとして組み合わせた、進捗対応の残計画を予測する。
実行器VLAは、レンダリングされたトレースの条件に適合し、長い水平決定を繰り返しローカル制御に変換する。
論文 参考訳(メタデータ) (2026-04-23T17:59:04Z) - OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation [61.18260993245354]
Chain-of-Thought(CoT)推論は、VLAベースの自律運転において、軌道予測の強力なドライバである。
本稿では,2つの補助デコーダによって制御されるコンパクトな潜在トークンを通じて推論をルーティングする,統一VLAおよびワールドモデルフレームワークであるOneVLを提案する。
OneVLは、明示的なCoTを超える最初の遅延CoTメソッドとなり、応答のみのレイテンシで最先端の精度を提供する。
論文 参考訳(メタデータ) (2026-04-20T16:37:22Z) - HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving [20.266736153749417]
Vision-Language-Action(VLA)モデルは、マルチモーダル理解を通じて自律運転に有望な機能を提供する。
安全クリティカルなシナリオにおけるそれらの利用は、数値推論、弱い3次元空間認識、文脈に対する高い感度を含む固有の制限によって制限されている。
信頼軌道生成用に設計された階層型時空間VLAモデルであるHiST-VLAを提案する。
論文 参考訳(メタデータ) (2026-02-11T07:08:33Z) - ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving [44.008287454538596]
視覚言語モデル(VLM)は、クロスモーダルな先行とコモンセンス推論を導入することで、このパラダイムを豊かにする。
現在のVLMベースのプランナは、(i) 個別のテキスト推論と継続的制御のミスマッチ、(ii) 自己回帰的連鎖のデコーディングからの高い遅延、(iii) リアルタイムデプロイメントを制限する非効率または非因果的なプランナである。
テキストから潜在空間へ推論を転送し,それを階層的並列軌道デコーダで結合する統合視覚言語アクションフレームワークColaVLAを提案する。
論文 参考訳(メタデータ) (2025-12-28T14:06:37Z) - Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future [125.92052530850425]
VLA(Vision-Language-Action)フレームワークは、認識と言語に基づく意思決定を統合する。
VLAフレームワークは、より解釈可能で、一般化可能で、人間に準拠した運転ポリシーへの道筋を提供する。
この研究は、人間と互換性のある自動運転システムを構築するための一貫性のある基盤を確立することを目的としている。
論文 参考訳(メタデータ) (2025-12-18T16:57:44Z) - FlowDrive: Energy Flow Field for End-to-End Autonomous Driving [50.89871153094958]
FlowDriveは、物理的に解釈可能なエネルギーベースのフローフィールドを導入し、セマンティックな前提と安全性をBEV空間にエンコードする新しいフレームワークである。
NAVSIM v2ベンチマークの実験では、FlowDriveが最先端のパフォーマンスを86.3で達成し、安全性と計画品質の両方において以前のベースラインを超えたことが示されている。
論文 参考訳(メタデータ) (2025-09-17T13:51:33Z) - ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving [49.07731497951963]
ReCogDriveは、エンドツーエンドの自動運転のための新しい強化認知フレームワークである。
我々は、人間のドライバーのシーケンシャルな認知過程を模倣する階層的なデータパイプラインを導入する。
次に、VLMの学習した運転先を拡散プランナーに注入することで、言語行動ミスマッチに対処する。
論文 参考訳(メタデータ) (2025-06-09T03:14:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。