論文の概要: MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2605.10177v1
- Date: Mon, 11 May 2026 08:28:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.643861
- Title: MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning
- Title(参考訳): MTA-RL:マルチモーダルトランスフォーマーによるロバスト都市走行と強化学習
- Authors: Guangli Chen, Dianzhao Li, Wenjian Zhong, Bangquan Xie, Ostap Okhrin,
- Abstract要約: マルチモーダルトランスフォーマーを用いた3次元モデリングと強化学習(RL)
本稿では,マルチモーダルトランスフォーマーを用いた3D Affordances and Reinforcement Learning(RL)による知覚と制御をブリッジする最初のフレームワークであるMTA-RLを提案する。
- 参考スコア(独自算出の注目度): 4.076622576916001
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Robust urban autonomous driving requires reliable 3D scene understanding and stable decision-making under dense interactions. However, existing end-to-end models lack interpretability, while modular pipelines suffer from error propagation across brittle interfaces. This paper proposes MTA-RL, the first framework that bridges perception and control through Multi-modal Transformer-based 3D Affordances and Reinforcement Learning (RL). Unlike previous fusion models that directly regress actions, RGB images and LiDAR point clouds are fused using a transformer architecture to predict explicit, geometry-aware affordance representations. These structured representations serve as a compact observation space, enabling the RL policy to operate purely on predicted driving semantics, which significantly improves sample efficiency and stability. Extensive evaluations in CARLA Town01-03 across varying densities (20-60 background vehicles) show that MTA-RL consistently outperforms state-of-the-art baselines. Trained solely on Town03, our method demonstrates superior zero-shot generalization in unseen towns, achieving up to a 9.0% increase in Route Completion, an 11.0% increase in Total Distance, and an 83.7% improvement in Distance Per Violation. Furthermore, ablation studies confirm that our multi-modal fusion and reward shaping are critical, significantly outperforming image-only and unshaped variants, demonstrating the effectiveness of MTA-RL for robust urban autonomous driving.
- Abstract(参考訳): ロバストな都市自動運転は、密接な相互作用の下で信頼性の高い3Dシーン理解と安定した意思決定を必要とする。
しかし、既存のエンドツーエンドモデルは解釈性に欠けており、モジュールパイプラインは脆いインターフェイス間のエラー伝搬に悩まされている。
本稿では,マルチモーダルトランスフォーマーを用いた3D Affordances and Reinforcement Learning (RL)による知覚と制御をブリッジする最初のフレームワークであるMTA-RLを提案する。
アクションを直接回帰する従来の融合モデルとは異なり、RGBイメージとLiDARポイントクラウドはトランスフォーマーアーキテクチャを使用して、明示的で幾何対応の価格表現を予測している。
これらの構造化された表現は、コンパクトな観測空間として機能し、RLポリシーは予測駆動セマンティクス上で純粋に動作し、サンプル効率と安定性を大幅に改善する。
CARLA Town01-03において、様々な密度(20-60の背景車両)にわたる広範囲な評価は、MTA-RLが一貫して最先端のベースラインを上回っていることを示している。
本手法はタウン03のみを訓練し, 未確認の町ではゼロショットの一般化が優れており, 9.0%のルート完成率, 11.0%のトータル距離, 83.7%の遠隔操作率向上を実現している。
さらに,マルチモーダルフュージョンと報酬形成は画像のみおよび未形状の変種よりも極めて優れており,MTA-RLが都市部自律走行に有効であることを示す。
関連論文リスト
- Drive-Through 3D Vehicle Exterior Reconstruction via Dynamic-Scene SfM and Distortion-Aware Gaussian Splatting [16.30721514005399]
自動車外装の高忠実な3D再構築は、オンライン自動車市場における購入者の信頼を高める。
これらのモデルを散らかしたディーラードライブスルーで生成することは、深刻な技術的課題をもたらす。
2ピラーカメラリグを用いたエンドツーエンドパイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-27T17:42:42Z) - Optimization-Guided Diffusion for Interactive Scene Generation [52.23368750264419]
本稿では,拡散型サンプリングにおける構造的一貫性と相互作用認識を実現するための,最適化誘導型トレーニングフリーフレームワークであるOMEGAを提案する。
OMEGAは生成リアリズム,一貫性,可制御性を向上し,身体的および行動学的に有効なシーンの比率を増大させることを示す。
当社のアプローチでは,3秒未満の時間対コリションで,より近いコリジョンフレームを5ドル(約5,500円)で生成することも可能だ。
論文 参考訳(メタデータ) (2025-12-08T15:56:18Z) - Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail [85.47497935739936]
Alpamayo-R1 (AR1) は、因果推論の連鎖と軌道計画を統合する視覚言語モデルである。
また,AR1は,軌道のみのベースラインに比べて,難問の計画精度が12%向上することを示した。
今後のアップデートで、AR1モデルとCoCのサブセットをリリースする予定です。
論文 参考訳(メタデータ) (2025-10-30T01:25:34Z) - Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model [100.86587937568832]
Ring-1Tは、数兆のパラメータを持つ最初のオープンソースの最先端の思考モデルである。
総パラメータは1兆で、1トークンあたり約500億を活性化する。
論文 参考訳(メタデータ) (2025-10-21T17:46:14Z) - GMF-Drive: Gated Mamba Fusion with Spatial-Aware BEV Representation for End-to-End Autonomous Driving [5.450011907283289]
本稿では, GMF-Driveを紹介した。これは2つの原則的イノベーションを通じて, 課題を克服するエンドツーエンドフレームワークである。
まず、情報制限ヒストグラムに基づくLiDAR表現を、幾何学的に拡張された柱形式で置き換える。
第二に,高効率空間認識状態空間モデルを用いた高価な変圧器を代替する新しい階層型マンバ融合アーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-08-08T08:17:18Z) - DiFSD: Ego-Centric Fully Sparse Paradigm with Uncertainty Denoising and Iterative Refinement for Efficient End-to-End Self-Driving [55.53171248839489]
我々は、エンドツーエンドの自動運転のためのエゴ中心の完全スパースパラダイムであるDiFSDを提案する。
特に、DiFSDは主にスパース知覚、階層的相互作用、反復的な運動プランナーから構成される。
nuScenesとBench2Driveデータセットで実施された実験は、DiFSDの優れた計画性能と優れた効率を実証している。
論文 参考訳(メタデータ) (2024-09-15T15:55:24Z) - Multi-Modal Fusion Transformer for End-to-End Autonomous Driving [59.60483620730437]
画像表現とLiDAR表現を注目で統合する,新しいマルチモードフュージョントランスフォーマであるTransFuserを提案する。
本手法は, 衝突を76%低減しつつ, 最先端駆動性能を実現する。
論文 参考訳(メタデータ) (2021-04-19T11:48:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。