論文の概要: PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving
- arxiv url: http://arxiv.org/abs/2607.20175v1
- Date: Wed, 22 Jul 2026 14:09:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.107439
- Title: PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving
- Title(参考訳): PerceptDrive: エンド・ツー・エンドの自動運転のための適応的エキスパートルーティングによる知覚前世界行動モデリング
- Abstract要約: PerceptDriveは、アダプティブなエキスパートルーティングを備えた世界アクションモデリングフレームワークである。
PerceptDriveは、凍結して運転に適応したプロバイダから教師が蒸留した事前情報を供給している。
事前保持目的は、各ブランチをその前のブランチにアンカーする。
- 参考スコア(独自算出の注目度): 20.924755586440362
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Frozen perception foundation models encode rich geometric, semantic, and dynamic knowledge. Yet narrow conditioning interfaces may attenuate task-relevant cues, while static fusion cannot adjust expert contributions to each scene. We cast this challenge as the prior-to-plan transfer problem and introduce PerceptDrive, a perception prior world-action modeling framework with adaptive expert routing. PerceptDrive feeds teacher-distilled priors from a frozen, driving-adapted provider and dense observation latents from a frozen self-supervised video encoder into a trainable expert-routed world-action model. Expert-specific query branches process these signals, while a prior-retention objective anchors each branch to its prior. A router predicts soft gates from a shared scene representation and combines the expert conditions before trajectory generation. During training, privileged rule-based sub-metric estimates for branch-specific trajectory drafts provide soft-gate distillation targets. The predicted action-free future latent conditions a flow-matching actor. At inference, privileged components are absent; with one front-facing camera, PerceptDrive generates one trajectory per planning step without test-time scoring, reranking, or search. Experiments show that PerceptDrive achieves state-of-the-art performance with 90.4 PDMS on NAVSIM v1 and 90.2 EPDMS on NAVSIM v2, outperforming existing methods. Ablations confirm complementary gains from prior retention and scene-conditioned routing, alongside differential reliance on the three priors. These results demonstrate that preserving and adaptively routing perception priors improves direct planning without test-time candidate selection.
- Abstract(参考訳): 凍結認識基盤モデルは、リッチな幾何学的、意味的、動的知識を符号化する。
しかし、狭い条件付けインタフェースはタスク関連キューを減らし、静的融合は各シーンに専門的な貢献を調整できない。
我々は、この課題を事前から計画への転送問題とみなし、適応的な専門家ルーティングを備えた世界行動モデリングフレームワークPerceptDriveを紹介した。
PerceptDriveは、教師が駆使した先駆者を、凍った運転に適応したプロバイダーから、そして凍った自己監督ビデオエンコーダから密集した観察潜伏者を、訓練可能な専門家による世界行動モデルに供給する。
専門家固有のクエリブランチがこれらの信号を処理し、事前保持対象が各ブランチを先行にアンカーする。
ルータは、共有シーン表現からソフトゲートを予測し、軌道生成前に専門家条件を組み合わせる。
訓練中、ブランチ固有のトラジェクトリドラフトに対する特権付きルールベースのサブメトリック推定は、ソフトゲート蒸留ターゲットを提供する。
予測されたアクションフリーな未来の潜伏状態は、フローマッチングアクターを条件とする。
1つのフロントカメラで、PerceptDriveはテストタイムスコア、リランク、サーチなしで、計画ステップごとに1つのトラジェクトリを生成する。
実験の結果、PerceptDriveはNAVSIM v1では90.4 PDMS、NAVSIM v2では90.2 PDMS、既存の手法では90.2 PDMSで最先端のパフォーマンスを達成した。
アブレーションは、事前保持とシーン条件付きルーティングから相補的な利得を確認し、これら3つの先行への差分に依存する。
これらの結果は、事前認識を保存し、適応的にルーティングすることで、テスト時間候補選択なしで直接計画を改善することを示す。
関連論文リスト
- CoLT-Drive: Counterfactual Long-Tail Benchmarking and Knowledge-Preserving Adaptation for Driving Affordance Prediction [27.20821192335003]
長い尾の自律運転障害はまれな物体認識エラーとみなされることが多い。
我々は、この問題を、モデルがフロントビューイメージ、エゴモーション履歴、ナビゲーションコマンドを構造化された横方向メタアクションにマッピングする、意思決定レベルの駆動能力予測として定式化する。
デプロイ可能な小型のVLMを改善するために,構造化された知覚と意思決定のプロンプトを組み合わせた知識保存適応フレームワークであるKPA,SLERPベースのエキスパートマージ,レギュラー対応のLORA混在モジュールであるRegMoEを提案する。
論文 参考訳(メタデータ) (2026-08-31T18:44:30Z) - PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving [8.847248042144681]
本稿では,デュアルメモリアーキテクチャと適応メモリゲートを備えたメモリ拡張モジュールを提案する。
このアプローチは、さまざまなエンドツーエンドのベースラインにわたるパフォーマンスを一貫して改善します。
本手法はセンサの破損に対するロバスト性を本質的に向上するが,デュアルメモリ設計は,検索した前処理が信頼できない場合に安全なフォールバックを保証する。
論文 参考訳(メタデータ) (2026-06-30T15:36:48Z) - CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving [19.474428775260034]
超高速な生成計画と深い意味的推論を組み合わせたフレームワークであるCLEARを提案する。
CLEARはDrive-JEPAをビジュアルエンコーダとして採用し、VAEラテント空間におけるマルチステップデノイングチェーンを単一ステップ条件ドリフトに置き換える。
NAVSIM v1ベンチマークでは、CLEARは93.7の最先端のPDMSを達成した。
論文 参考訳(メタデータ) (2026-06-04T14:32:10Z) - TrajDiff: End-to-end Autonomous Driving without Perception Annotation [65.49718343700319]
エンドツーエンドの自動運転システムは、生センサ入力から直接駆動ポリシーを生成する。
TrajDiffはTrajectory-oriented BEV Conditioned Diffusionフレームワークであり、エンドツーエンドの自動運転のための知覚アノテーションのない生成方法を確立する。
NAVSIMベンチマークで評価すると、TrajDiffは87.5 PDMSを達成した。
論文 参考訳(メタデータ) (2025-11-30T04:34:20Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - FlowDrive: Energy Flow Field for End-to-End Autonomous Driving [50.89871153094958]
FlowDriveは、物理的に解釈可能なエネルギーベースのフローフィールドを導入し、セマンティックな前提と安全性をBEV空間にエンコードする新しいフレームワークである。
NAVSIM v2ベンチマークの実験では、FlowDriveが最先端のパフォーマンスを86.3で達成し、安全性と計画品質の両方において以前のベースラインを超えたことが示されている。
論文 参考訳(メタデータ) (2025-09-17T13:51:33Z) - DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving [62.62464518137153]
DriveTransformerは、スケールアップを簡単にするためのシンプルなE2E-ADフレームワークである。
タスク・セルフ・アテンション、センサー・クロス・アテンション、時間的クロス・アテンションという3つの統合された操作で構成されている。
シミュレーションされたクローズドループベンチマークBench2Driveと、FPSの高い実世界のオープンループベンチマークnuScenesの両方で、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-03-07T11:41:18Z) - DiFSD: Ego-Centric Fully Sparse Paradigm with Uncertainty Denoising and Iterative Refinement for Efficient End-to-End Self-Driving [55.53171248839489]
我々は、エンドツーエンドの自動運転のためのエゴ中心の完全スパースパラダイムであるDiFSDを提案する。
特に、DiFSDは主にスパース知覚、階層的相互作用、反復的な運動プランナーから構成される。
nuScenesとBench2Driveデータセットで実施された実験は、DiFSDの優れた計画性能と優れた効率を実証している。
論文 参考訳(メタデータ) (2024-09-15T15:55:24Z) - Valeo4Cast: A Modular Approach to End-to-End Forecasting [93.86257326005726]
我々のソリューションはArgoverse 2 end-to-end Forecasting Challengeで63.82 mAPfでランクインした。
私たちは、知覚から予測までエンドツーエンドのトレーニングを通じて、このタスクに取り組む現在のトレンドから離れ、代わりにモジュラーアプローチを使用します。
私たちは、昨年の優勝者より+17.1ポイント、今年の優勝者より+13.3ポイント、予測結果を+17.1ポイント上回る。
論文 参考訳(メタデータ) (2024-06-12T11:50:51Z) - IntentNet: Learning to Predict Intention from Raw Sensor Data [86.74403297781039]
本論文では,LiDARセンサが生成する3次元点群と,環境の動的なマップの両方を利用するワンステージ検出器と予測器を開発した。
当社のマルチタスクモデルは、それぞれの別々のモジュールよりも高い精度を実現し、計算を節約します。
論文 参考訳(メタデータ) (2021-01-20T00:31:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。