論文の概要: PersonaDrive: Controllable Trajectory Prediction with Multi-Dimensional Driving Personas
- arxiv url: http://arxiv.org/abs/2608.15230v1
- Date: Sat, 15 Aug 2026 13:37:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.235283
- Title: PersonaDrive: Controllable Trajectory Prediction with Multi-Dimensional Driving Personas
- Title(参考訳): ペルソナドライブ:多次元運転ペルソナを用いた制御可能な軌道予測
- Abstract要約: 本稿では,Persona-Conditioned Trajectoryデータセットについて述べる。
我々はまた,ペルソナを言語から学習し,ペルソナ固有の軌跡を生成できるPersonaDriveを提案する。
テストによると、PersonaDriveは多次元シナリオで比較されたベースラインよりも一貫して改善されている。
- 参考スコア(独自算出の注目度): 24.951167128527477
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although recent trajectory prediction and end-to-end autonomous driving methods improve robustness in urban environments, they still lack meaningful controllability. Existing benchmarks either provide no persona-conditioned annotations or support only a single urgency spectrum (i.e., emergency, normal, relaxed), which cannot distinguish personas that share the same urgency level but require different driving dynamics. To address this, we propose (i) the Persona-Conditioned Trajectory (PCT) dataset, which decomposes driving personas along two axes, Temporal Urgency and Ride Comfort, and combines three levels of each to form a grid of nine personas, each paired with natural-language descriptions and trajectories, and (ii) PersonaDrive, a framework that can learn driving personas from language and can generate persona-specific trajectories. PersonaDrive incorporates Persona-Conditioned Anchor Transform (PCAT), which hierarchically reshapes anchors along both axes, and Persona-Conditioned Multi-Modal Fusion (PCMF) for BEV-level persona fusion. Training is supervised by a Hierarchical Guide Loss enforcing axis-aligned physical orderings and an Axis-Decomposed Diversity Loss preventing diagonal mode collapse. Experimental results show that PersonaDrive consistently improves over the compared baselines across multi-dimensional scenarios. The code and PCT dataset are available at https://github.com/VisualAIKHU/PersonaDrive
- Abstract(参考訳): 最近の軌道予測とエンドツーエンドの自動運転手法は都市環境の堅牢性を改善するが、それでも有意義な制御性は欠如している。
既存のベンチマークでは、ペルソナ条件のアノテーションは提供されていないか、1つの緊急スペクトル(緊急、正常、リラックス)しかサポートしていないが、同じ緊急レベルを共有するが、異なる運転力学を必要とするペルソナを区別できない。
これを解決するために,我々は提案する
一 時限緊急時及びライド快適時の二軸に沿って運転する人格を分解し、各3つのレベルを組み合わせて九人の人格を成し、それぞれに自然言語の記述と軌跡を交互に組み合わせたPCTデータセット
(ii)PersonaDriveは、言語からペルソナを学習し、ペルソナ固有のトラジェクトリを生成することができるフレームワークである。
PersonaDriveにはPersona-Conditioned Anchor Transform (PCAT)が組み込まれている。
トレーニングは、軸方向の物理的順序を強制する階層的ガイド損失と、斜めモードの崩壊を防ぐために軸方向の多様性損失によって監督される。
実験の結果,PersonaDriveは多次元シナリオで比較したベースラインよりも一貫して改善していることがわかった。
コードとPCTデータセットはhttps://github.com/VisualAIKHU/PersonaDriveで入手できる。
関連論文リスト
- PersonaDrive: Human-Style Retrieval-Augmented VLA Agents for Closed-Loop Driving Simulation [9.651475921652052]
我々は,人体に指示された運転データセットから抽出したデモに対して,視覚アクション駆動エージェントを条件付けるパイプラインであるPersonaDriveを紹介した。
パイプラインには3つのステージがある: 画像とテキストの類似度スコアの組み合わせによる、スタイルごとの人間の運転データに対するオフラインのトリプルトマイニング、凍結した視覚的特徴とスタイルごとのデータベースに対する小さな制御エンコーダを融合する軽量な検索ヘッドのトレーニング、検索したコンテキストポイントを行動デモとして扱うための単一のVLAバックボーンの微調整。
論文 参考訳(メタデータ) (2026-06-10T19:16:31Z) - CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving [19.474428775260034]
超高速な生成計画と深い意味的推論を組み合わせたフレームワークであるCLEARを提案する。
CLEARはDrive-JEPAをビジュアルエンコーダとして採用し、VAEラテント空間におけるマルチステップデノイングチェーンを単一ステップ条件ドリフトに置き換える。
NAVSIM v1ベンチマークでは、CLEARは93.7の最先端のPDMSを達成した。
論文 参考訳(メタデータ) (2026-06-04T14:32:10Z) - MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving [62.43744546817599]
視覚言語-アクション(VLA)モデルは、エンドツーエンドのモーションプランナーとして有効であるが、クローズドループ設定で評価すると不安定である。
本稿では, VLAモデルの潜在空間における動的駆動シナリオの, リアクティブでマルチエージェントなロールアウトのための新しいフレームワークMAPLEを提案する。
MAPLEはBench2Driveで最先端の駆動性能を実現し、堅牢なE2E自動運転システムのためのスケーラブルでクローズループなマルチエージェントプレイを実演する。
論文 参考訳(メタデータ) (2026-05-13T23:35:14Z) - Driving with A Thousand Faces: A Benchmark for Closed-Loop Personalized End-to-End Autonomous Driving [39.31712441721641]
Person2Driveは、包括的なパーソナライズされたE2E-ADプラットフォームとベンチマークである。
オープンソースのフレキシブルなデータ収集システムで、現実的なシナリオをシミュレートして、パーソナライズされた運転データセットを生成する。
私たちのデータセットとコードは、受け入れられてからリリースされます。
論文 参考訳(メタデータ) (2026-02-21T08:42:32Z) - ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving [49.07731497951963]
ReCogDriveは、エンドツーエンドの自動運転のための新しい強化認知フレームワークである。
我々は、人間のドライバーのシーケンシャルな認知過程を模倣する階層的なデータパイプラインを導入する。
次に、VLMの学習した運転先を拡散プランナーに注入することで、言語行動ミスマッチに対処する。
論文 参考訳(メタデータ) (2025-06-09T03:14:04Z) - Learning Personalized Driving Styles via Reinforcement Learning from Human Feedback [37.78654159363553]
生成軌道モデルのための人間のフィードバック駆動微調整フレームワークであるTrajHFを紹介する。
TrajHFは、マルチ条件デノイザと強化学習を人間のフィードバックで組み込んで、マルチモーダル軌道生成を洗練させる。
TrajHFは、NavSimベンチマークの最先端に匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-03-13T14:56:17Z) - DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving [62.62464518137153]
DriveTransformerは、スケールアップを簡単にするためのシンプルなE2E-ADフレームワークである。
タスク・セルフ・アテンション、センサー・クロス・アテンション、時間的クロス・アテンションという3つの統合された操作で構成されている。
シミュレーションされたクローズドループベンチマークBench2Driveと、FPSの高い実世界のオープンループベンチマークnuScenesの両方で、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-03-07T11:41:18Z) - GPD-1: Generative Pre-training for Driving [77.06803277735132]
本稿では,これらすべてのタスクを実現するために,GPD-1(Generative Pre-Training for Driving)モデルを提案する。
それぞれのシーンをエゴ、エージェント、マップトークンで表現し、統一トークン生成問題として自律運転を定式化する。
GPD-1は、シーン生成、交通シミュレーション、クローズドループシミュレーション、マップ予測、モーションプランニングなど、微調整なしで様々なタスクに適応する。
論文 参考訳(メタデータ) (2024-12-11T18:59:51Z) - ComDrive: Comfort-Oriented End-to-End Autonomous Driving [29.635377468912534]
ComDriveは、快適なエンドツーエンドの自動運転システムである。
時間的に一貫性があり、快適な軌道を生成する。
ComDriveは、快適さと安全性の両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-10-07T14:06:16Z) - DiFSD: Ego-Centric Fully Sparse Paradigm with Uncertainty Denoising and Iterative Refinement for Efficient End-to-End Self-Driving [55.53171248839489]
我々は、エンドツーエンドの自動運転のためのエゴ中心の完全スパースパラダイムであるDiFSDを提案する。
特に、DiFSDは主にスパース知覚、階層的相互作用、反復的な運動プランナーから構成される。
nuScenesとBench2Driveデータセットで実施された実験は、DiFSDの優れた計画性能と優れた効率を実証している。
論文 参考訳(メタデータ) (2024-09-15T15:55:24Z) - Policy Pre-training for End-to-end Autonomous Driving via
Self-supervised Geometric Modeling [96.31941517446859]
PPGeo (Policy Pre-training via Geometric Modeling) は,視覚運動運転における政策事前学習のための,直感的かつ直接的な完全自己教師型フレームワークである。
本研究では,大規模な未ラベル・未校正動画の3次元幾何学シーンをモデル化することにより,ポリシー表現を強力な抽象化として学習することを目的とする。
第1段階では、幾何モデリングフレームワークは、2つの連続したフレームを入力として、ポーズと深さの予測を同時に生成する。
第2段階では、視覚エンコーダは、将来のエゴモーションを予測し、現在の視覚観察のみに基づいて測光誤差を最適化することにより、運転方針表現を学習する。
論文 参考訳(メタデータ) (2023-01-03T08:52:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。