FlowR2A: Learning Reward-to-Action Distribution for Multimodal Driving Planning
Abstractの概要
FlowR2Aは、報酬を条件とする行動分布を学習するマルチモーダルなドライビングプランナーであり、シミュレーションの報酬を識別的なラベルから軌道生成のための条件へと再定義します。この手法は、大規模な行動語彙から得られる密な軌道と報酬のペアとフローマッチングデコーダを組み合わせることで、スコアベースのプランナーで使用される密な教師信号と、アンカーベースのプランナーの柔軟な提案生成とを統合することを目指しています。厳格な安全性の制約とより緩やかな進行目的のバランスを適切にとるため、主要な制約に対してはタイムステップごとのきめ細かい報酬信号を使用し、学習中の連続的な報酬にはノイズを追加します。推論時においては、この生成アプローチにより報酬ガイダンスとアンカーベースのサンプリングを通じた制御可能なサンプリングがサポートされ、個別のモードセレクタが生成された提案のランク付けを行います。
新規性
本論文の主な新規性は、マルチモーダルなドライビングプランニングを、行動に対する報酬の予測や固定アンカーからの提案生成としてではなく、報酬から行動への分布p(a|r)を学習するものとしてモデル化した点にあります。また、タイムステップごとの安全性やコンプライアンスの信号と報酬ノイズの拡張を組み合わせることで、高報酬の条件付けを実用的にする、運転に特化した報酬条件付けの設計を導入しています。
成果
NAVSIM v1において、FlowR2Aは60の提案を用いて92.8 PDMSを記録し、論文に記載された従来手法を上回る結果を示し、単一提案のバリアントでは90.0 PDMSに達しました。NAVSIM v2では88.9 EPDMSを達成し、NC、TTC、およびEPにおいて報告された手法をリードしている一方、拡張された快適性(extended comfort)については弱いことが著者によって言及されています。提案品質の分析により、比較対象のアンカーベースのベースラインよりも平均的な提案品質が高く分散が小さいことが示され、サンプリングされた軌道がより一貫して実行可能であることが示唆されています。
論文の注目点
- FlowR2Aは、密な行動と報酬のペアから報酬条件付きの軌道生成を学習し、スコアベースの密な教師信号とアンカーベースの提案生成の橋渡しをする。
- 本手法は、タイムステップごとの安全性・コンプライアンス信号と報酬ノイズの拡張によって報酬の条件付けを強化し、厳密な制約と連続的な目的とのトレードオフをより適切に処理する。
- NAVSIM v1およびv2での実験において、本手法は最先端のベンチマーク性能を示し、比較対象のマルチモーダルベースラインと比較して著しく優れた提案品質を示す。
参考リンク
- arXiv: https://arxiv.org/abs/2606.24231v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2606.24231v1
- Hugging Face Papers: https://huggingface.co/papers/2606.24231
- Project: https://lixirui142.github.io/flowr2a-ad