論文の概要: PRISM: Privileged Probabilistic Latent Supervision for End-to-End Autonomous Driving Motion Planning
- arxiv url: http://arxiv.org/abs/2608.01201v1
- Date: Sun, 02 Aug 2026 12:33:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.117677
- Title: PRISM: Privileged Probabilistic Latent Supervision for End-to-End Autonomous Driving Motion Planning
- Title(参考訳): PRISM: エンド・ツー・エンドの自律走行走行計画のための原始確率潜在型シミュレーション
- Authors: Volodymyr Havrylov, Faris Janjoš, Andreas Look, Jürgen Mathes, Andreas Geiger,
- Abstract要約: エンドツーエンドの自動運転システムは、認識、予測、計画を単一の異なるアーキテクチャに統合する。
近年の研究では、視覚言語モデル(VLM)の監視機能を統合してこの問題に対処している。
本手法は, 従来想定されていたVLM推論能力ではなく, トレーニング中のE2E ADモデルとGT(グラウンド・トゥルース)データとの潜伏接続から得られることを示す。
- 参考スコア(独自算出の注目度): 18.741741219314836
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: End-to-end autonomous driving (E2E AD) systems integrate perception, prediction, and planning into a single differentiable architecture. While these models show great promise, their standard training often relies on output-only supervision, which can lead to weak gradients for the hidden layers of increasingly complex models. Recent works have integrated vision-language model (VLM) supervision for latent features to address this, yielding substantial empirical gains, yet leaving the underlying theoretical mechanisms poorly understood. Our investigation into this methodology reveals that the resulting performance gains stem not from VLM reasoning capabilities, as previously assumed, but rather from the latent connections forged between the E2E AD model and ground-truth (GT) data during training. Building on this insight, we propose a probabilistic deep supervision framework that regularizes intermediate latent representations directly from GT data. By treating model latents as reparameterizable distributions, we optimize the architecture via the Evidence Lower Bound (ELBO). Our evaluations conducted on the nuScenes dataset demonstrate that supervising trajectory-related latents with future GT paths consistently improves planning performance. Using identical training data and E2E architectures, our method achieves an 8% reduction in planning L2 error and a 3% decrease in collision rates compared to competitive vectorized baselines, all while incurring negligible computational overhead.
- Abstract(参考訳): E2E AD(End-to-end autonomous driving)システムは、知覚、予測、計画を単一の異なるアーキテクチャに統合する。
これらのモデルは大きな可能性を示していますが、標準的なトレーニングは出力のみの監視に依存します。
最近の研究は、視覚言語モデル(VLM)の監督と、それに対応するために潜伏した特徴を統合し、かなりの経験的利益をもたらすが、基礎となる理論的メカニズムは十分に理解されていない。
本手法は, 従来想定されていたVLM推論能力ではなく, トレーニング中のE2E ADモデルとGT(グラウンド・トゥルース)データとの潜伏接続から得られる性能向上を実証するものである。
この知見に基づいて,GTデータから直接中間潜伏表現を規則化する確率的深層監視フレームワークを提案する。
モデル潜在物を再パラメータ化可能な分布として扱うことにより,ELBO(エビデンス・ロウアー・バウンド)を用いてアーキテクチャを最適化する。
nuScenesデータセットを用いて評価した結果,将来のGT経路を用いた軌道関連潜伏剤の監視は計画性能を継続的に改善することが示された。
同一のトレーニングデータとE2Eアーキテクチャを用いて,L2エラー計画の8%の削減,および競合するベクトル化ベースラインと比較しての衝突率の3%の削減を実現した。
関連論文リスト
- AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution [61.593935260052795]
Supervised Fine-Tuning (SFT) とReinforcement Learning (RL) による後学習は多モーダル大規模言語モデル(MLLM)における推論の強化に不可欠である
既存のパラダイムは、静的データの制限により、しばしばパフォーマンスのボトルネックに達する。
我々は,真理に順応したデータキュレーションとモデル進化を統合する新しいパラダイムであるアンカー進化(AnE)を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:26:34Z) - GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control [0.0]
GIRL(Generative Imagination Reinforcement Learning)は、この障害モードに2つの重要なコンポーネントで対処する潜在的世界モデルフレームワークである。
GIRLは、DreamerV3に対するタスク間の遅延ロールアウトドリフトを38~61%削減し、リターンを改善し、長距離タスクでの環境相互作用を少なくする。
蒸留前の変種はオーバーヘッドを減らし、フルモデルに対する計算効率を向上させる。
論文 参考訳(メタデータ) (2026-04-08T17:14:21Z) - Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models [15.709482146201283]
現代のビジョン・ファンデーション・モデル(Vision Foundation Models)の凍結した特徴に基づいて訓練された単純な線形分類器は、新しい最先端技術を確立している。
この基準線は標準ベンチマーク上の特別な検出器と一致し、また、ウィジェット内のデータセット上では決定的に優れていることを示す。
我々は、AIの法医学におけるパラダイムシフトを提唱し、静的ベンチマークの過度な適合から、ファンデーションモデルの進化する世界の知識を現実の信頼性に活用することへと移行した。
論文 参考訳(メタデータ) (2026-02-02T07:20:02Z) - PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models [51.43746425777865]
大規模言語モデル(LLM)は、しばしばグローバル戦略を定式化する能力に欠けており、長い水平タスクにおけるエラーの伝播につながる。
PILOTは,大規模モデルの戦略的監視を本質的な潜伏誘導に内部化するためのフレームワークである。
論文 参考訳(メタデータ) (2026-01-07T12:38:56Z) - Self-Improving Vision-Language-Action Models with Data Generation via Residual RL [29.682761652941963]
Probe, Learn, Distill (PLD)は3段階のプラグイン・アンド・プレイフレームワークで、視覚言語アクションモデルを改善する。
PLDはLIBEROでほぼ飽和した99%のタスク成功、SimplerEnvで50%以上、実世界のFrankaとYAMのアーム操作タスクで100%成功している。
論文 参考訳(メタデータ) (2025-10-30T06:24:04Z) - DIFFUMA: High-Fidelity Spatio-Temporal Video Prediction via Dual-Path Mamba and Diffusion Enhancement [5.333662480077316]
我々は,半導体ウェハダイシングプロセスに特化した最初の公開時空間画像データセットであるChip Dicing Laneデータセット(CHDL)をリリースする。
このような微細なダイナミクスに特化して設計された、革新的なデュアルパス予測アーキテクチャであるDIFFUMAを提案する。
実験の結果、DIFFUMAは既存の手法よりも優れており、平均二乗誤差(MSE)を39%削減し、類似性(SSIM)を0.926から0.988に改善した。
論文 参考訳(メタデータ) (2025-07-09T10:51:54Z) - Towards foundational LiDAR world models with efficient latent flow matching [3.971158433168816]
1つの事前学習モデルは、スクラッチからトレーニングよりも最大11%の絶対的な改善を達成でき、我々の比較の30/36では、スクラッチからトレーニングを上回ります。
トレーニングデータの半分と従来の手法の6倍の圧縮比を用いて,最先端の復元精度を実現する潜在条件付きフローマッチングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-30T00:16:55Z) - SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving [51.47621083057114]
SOLVEは、ビジョンランゲージモデルとエンド・ツー・エンド(E2E)モデルを相乗化して自動運転車の計画を強化する革新的なフレームワークである。
提案手法は,VLMとE2Eコンポーネント間の包括的インタラクションを実現するために,共有ビジュアルエンコーダによる機能レベルでの知識共有を重視している。
論文 参考訳(メタデータ) (2025-05-22T15:44:30Z) - Latent Diffusion Planning for Imitation Learning [78.56207566743154]
Latent Diffusion Planning (LDP) は、プランナーと逆ダイナミクスモデルからなるモジュラーアプローチである。
行動予測からプランニングを分離することにより、LDPは最適なデータと行動自由データのより密集した監視信号の恩恵を受けることができる。
シミュレーションされた視覚ロボット操作タスクにおいて、LDPは最先端の模倣学習アプローチより優れている。
論文 参考訳(メタデータ) (2025-04-23T17:53:34Z) - Learning from Reward-Free Offline Data: A Case for Planning with Latent Dynamics Models [79.2162092822111]
我々は,一連のナビゲーションタスクにおいて,強化学習(RL)と制御に基づく手法を体系的に評価する。
我々は、JEPA(Joint Embedding Predictive Architecture)を使用して、潜在ダイナミクスモデルを使用し、それを計画に使用します。
その結果,モデルベースプランニングではレイアウトが不明瞭になるのに対して,モデルフリーのRLは高品質なデータから恩恵を受けることがわかった。
論文 参考訳(メタデータ) (2025-02-20T18:39:41Z) - DiFSD: Ego-Centric Fully Sparse Paradigm with Uncertainty Denoising and Iterative Refinement for Efficient End-to-End Self-Driving [55.53171248839489]
我々は、エンドツーエンドの自動運転のためのエゴ中心の完全スパースパラダイムであるDiFSDを提案する。
特に、DiFSDは主にスパース知覚、階層的相互作用、反復的な運動プランナーから構成される。
nuScenesとBench2Driveデータセットで実施された実験は、DiFSDの優れた計画性能と優れた効率を実証している。
論文 参考訳(メタデータ) (2024-09-15T15:55:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。