論文の概要: Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving
- arxiv url: http://arxiv.org/abs/2608.00237v1
- Date: Fri, 31 Jul 2026 19:32:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.553991
- Title: Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving
- Title(参考訳): 遅発性セントロイドステアリング:コマンド付き自律運転のための単一パスクラシファイアフリーガイダンス
- Authors: Meibo Hu, Jiamian Wang, Pichao Wang, Zhiqiang Tao,
- Abstract要約: 本稿では,インスタンスレベルの残差をクラスレベルの遅延シフトに置き換える単一パス誘導機構を提案する。
我々はLCSがより強力なコマンドアテンデンスを実現しつつ、推論遅延を約50%削減できることを実証した。
- 参考スコア(独自算出の注目度): 37.533498955258544
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) have recently emerged as a promising paradigm for end-to-end autonomous driving, enabling agents to map multimodal inputs and high-level navigation instructions directly to executable trajectories. However, in practice, these models exhibit a persistent command-following gap: predicted trajectories often show weak sensitivity to navigation commands, resulting in incorrect behavior at critical decision points. We identify this issue as a form of conditional policy collapse, where regression-based training under multimodal trajectory distributions encourages the model to rely on dominant visual priors while marginalizing the language-conditioned signal. To address this issue, we introduce a principled formulation of classifier-free guidance (CFG) for regression-based vision-language driving. We show that CFG can be interpreted as isolating the instruction-induced residual in the action space by contrasting conditional and unconditional predictions, thereby explicitly amplifying the effect of the navigation command at inference time. However, a standard two-pass CFG introduces prohibitive latency for real-time control and produces noisy instance-level guidance directions. Building on a mean-shift interpretation of CFG, we propose Latent-Centroid Steering (LCS), a single-pass guidance mechanism that replaces instance-level residuals with class-level latent shifts. By projecting conditional representations toward precomputed command-specific centroids, LCS performs class-level latent steering based on cluster geometry that is both more stable and computationally efficient. We demonstrate that LCS reduces inference latency by approximately 50% while achieving stronger command adherence and improved driving performance on both closed-loop (Bench2Drive) and open-loop (nuScenes) benchmarks. Code will be released.
- Abstract(参考訳): 視覚言語モデル(VLM)は、エージェントがマルチモーダル入力とハイレベルナビゲーション命令を直接実行可能トラジェクトリにマッピングできるようにする、エンドツーエンドの自動運転のための有望なパラダイムとして最近登場した。
しかし、実際には、これらのモデルには永続的なコマンド追従ギャップがあり、予測された軌道はしばしばナビゲーションコマンドに対する弱い感度を示し、重要な決定点における誤った振る舞いをもたらす。
我々はこの問題を条件付き政策崩壊の一形態として認識し、多モーダル軌道分布下での回帰に基づく訓練は、言語条件付き信号の辺境化を図りながら、支配的な視覚的先行性に依存することを奨励する。
この問題に対処するために、回帰に基づく視覚言語駆動のための分類器フリーガイダンス(CFG)の定式化を導入する。
CFGは、条件付きおよび非条件付き予測を対比することにより、動作空間における命令誘起残差を分離し、推論時のナビゲーションコマンドの効果を明示的に増幅することができることを示す。
しかし、標準の2パスCFGはリアルタイム制御の禁止遅延を導入し、ノイズの多いインスタンスレベルの誘導指示を生成する。
CFGの平均シフト解釈に基づいて,インスタンスレベルの残差をクラスレベルの遅延シフトに置き換える単一パス誘導機構であるLatent-Centroid Steering (LCS)を提案する。
事前計算されたコマンド固有セントロイドに対して条件表現を投影することにより、LCSはより安定かつ計算効率のよいクラスタ幾何学に基づくクラスレベルの潜在ステアリングを行う。
我々はLCSがより強力なコマンドアテンデンスを実現し、クローズドループ(Bench2Drive)とオープンループ(nuScenes)ベンチマークの両方での駆動性能を改善しながら、推論遅延を約50%削減できることを実証した。
コードはリリースされる。
関連論文リスト
- End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation [59.188006170485046]
E2E-CDiffは、制御可能で現実的なシナリオ生成のためのエンドツーエンドの条件拡散フレームワークである。
微分可能な誘導は速度を規制し、乾燥可能な領域のコンプライアンスを強制し、衝突回避や衝突回避行動をサポートする。
E2E-CDiffは、学習ベースのエゴプランナーとしても競争力がある。
論文 参考訳(メタデータ) (2026-07-21T02:13:25Z) - AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning [13.949868529278504]
AnchorVLAは階層的な意思決定型VLA計画フレームワークである。
トラジェクトリ・パターン・アンカーを高レベルなVLA推論と連続的なトラジェクトリ実行の間の明示的なインターフェースとして使用する。
最先端の成功率77.28、競争力89.92を達成している。
論文 参考訳(メタデータ) (2026-07-03T10:38:30Z) - CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving [19.474428775260034]
超高速な生成計画と深い意味的推論を組み合わせたフレームワークであるCLEARを提案する。
CLEARはDrive-JEPAをビジュアルエンコーダとして採用し、VAEラテント空間におけるマルチステップデノイングチェーンを単一ステップ条件ドリフトに置き換える。
NAVSIM v1ベンチマークでは、CLEARは93.7の最先端のPDMSを達成した。
論文 参考訳(メタデータ) (2026-06-04T14:32:10Z) - Closed-Loop Neural Activation Control in Vision-Language-Action Models [19.22723477431829]
本稿では,静的干渉強度を適応時間変化制御信号に置き換えるクローズドループフレームワークを提案する。
我々はこのフレームワークをPIDと強化学習ベースのコントローラの両方でインスタンス化する。
実験により、残留STEERは固定係数ベースラインよりも安定な概念規制とステアリングタスク成功トレードオフを実現することが示された。
論文 参考訳(メタデータ) (2026-05-29T18:59:53Z) - OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation [61.18260993245354]
Chain-of-Thought(CoT)推論は、VLAベースの自律運転において、軌道予測の強力なドライバである。
本稿では,2つの補助デコーダによって制御されるコンパクトな潜在トークンを通じて推論をルーティングする,統一VLAおよびワールドモデルフレームワークであるOneVLを提案する。
OneVLは、明示的なCoTを超える最初の遅延CoTメソッドとなり、応答のみのレイテンシで最先端の精度を提供する。
論文 参考訳(メタデータ) (2026-04-20T16:37:22Z) - Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles [40.195332742819865]
本研究では,大規模言語モデル(LLM)を利用して命令を解釈する命令実現フレームワークを提案する。
リアルタイムフィードバックに基づいて、複数のモデル予測制御(MPC)ベースのモーションプランナをスケジュールする実行可能なスクリプトを生成し、計画されたトラジェクトリを制御信号に変換する。
論文 参考訳(メタデータ) (2026-04-09T09:32:21Z) - ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving [1.6961250145588112]
ICR-Driveは、言語条件の自律運転において、対実的ロバスト性を示すための診断フレームワークである。
我々は、一致したシミュレータ構成とシードの下で同一のCARLAルートを再生し、命令言語に起因する性能変化を分離する。
LMDriveとBEVDriverの実験では、マイナーな命令変更がパフォーマンス低下と障害モードの相違を引き起こす可能性がある。
論文 参考訳(メタデータ) (2026-04-07T03:24:22Z) - Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics [81.80010043113445]
局所的な微調整、LoRAに基づく適応、およびアクティベーションに基づく介入を分離して研究する。
制御信号によって誘導される動的ウェイト更新として、これらの介入をフレーム化する統一的な視点を示す。
提案手法では,選択と効用との間に一貫したトレードオフが観測される。
論文 参考訳(メタデータ) (2026-02-02T17:04:36Z) - GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs [56.93583799109029]
GrAInSは推論時ステアリングのアプローチで、言語のみのモデルと視覚言語の両方のモデルとタスクで動作する。
推論中、GrAInSはトークンレベルの属性信号によって誘導されるトランスフォーマー層で隠されたアクティベーションを隠蔽し、アクティベーションを正規化し、表現スケールを保存する。
微調整と既存のステアリングベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2025-07-24T02:34:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。