論文の概要: Beyond Self-Play: Hierarchical Reasoning for Continuous Motion in Closed-Loop Traffic Simulation
- arxiv url: http://arxiv.org/abs/2605.09153v1
- Date: Sat, 09 May 2026 20:31:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.090616
- Title: Beyond Self-Play: Hierarchical Reasoning for Continuous Motion in Closed-Loop Traffic Simulation
- Title(参考訳): セルフプレイを超えて: 閉ループ交通シミュレーションにおける連続動作のための階層的推論
- Authors: Weifan Zhang, Xiaofeng Zhao, Adel Bazzi, Mingrui Li, Yifan Wei, Dengfeng Sun,
- Abstract要約: 本稿では,ハイレベルなマルチエージェント相互作用推論と低レベルな連続軌道実現を組み合わせた階層型アーキテクチャを提案する。
SUMOをベースとした都市ネットワーク上での実験により,提案手法は自己再生や受動的模倣のベースラインと比較して,スムーズな制御と安全性を実現することが示された。
- 参考スコア(独自算出の注目度): 8.157621070273736
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Closed-loop traffic simulation requires agents that are both scalable and behaviorally realistic. Recent self-play reinforcement learning approaches demonstrate strong scalability, but their equilibrium strategies fail to capture the socially aware behaviors of real human drivers. We propose a hierarchical architecture that goes beyond self-play by combining high-level multi-agent interaction reasoning with low-level continuous trajectory realization. Specifically, a Stackelberg-style Multi-Agent Reinforcement Learning (MARL) module generates interaction-aware intention commands. These commands condition a low-level continuous motion module, translating the strategic intent into physically consistent, scene-responsive control sequences. To mitigate distribution shift in closed-loop deployment, we introduce a hybrid co-training scheme combining MARL with auxiliary recovery supervision. Experiments on a SUMO-based urban network demonstrate that the proposed framework achieves superior control smoothness and safety compared to self-play and passive imitation baselines, while maintaining competitive traffic efficiency.
- Abstract(参考訳): クローズドループトラフィックシミュレーションには、スケーラブルで行動的にリアルなエージェントが必要である。
近年の自己再生強化学習手法は高いスケーラビリティを示すが、その均衡戦略は実際の人間ドライバーの社会的に意識された振る舞いを捉えない。
本稿では,ハイレベルなマルチエージェント相互作用推論と低レベルな連続軌道実現を組み合わせた階層型アーキテクチャを提案する。
特に、StackelbergスタイルのMARL(Multi-Agent Reinforcement Learning)モジュールは、対話対応の意図コマンドを生成する。
これらのコマンドは低レベル連続動作モジュールを条件とし、戦略意図を物理的に一貫したシーン応答制御シーケンスに変換する。
閉ループ配置における分散シフトを軽減するため,MARLと補助的回復管理を組み合わせたハイブリッド協調学習方式を提案する。
SUMOをベースとした都市ネットワーク上での実験により,提案手法は,競争効率を維持しつつ,自己再生や受動的模倣ベースラインよりも制御のスムーズさと安全性を向上することを示した。
関連論文リスト
- Learning Reactive Dexterous Grasping via Hierarchical Task-Space RL Planning and Joint-Space QP Control [50.28263951510334]
本稿では,リアクティブなデクスタリーグルーピングのためのハイブリッド階層型制御フレームワークを提案する。
提案手法は,低レベル共同実行から高レベル空間意図を明示的に分離する。
我々は厳密なシミュレーションと現実のパイプラインを通して提案したフレームワークを広範囲に検証する。
論文 参考訳(メタデータ) (2026-05-05T04:49:38Z) - Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System [15.427164345561417]
VLA(Vision-Language-Action)モデルは、汎用的なロボット操作において有望なパラダイムである。
本稿では,新しいデュアルシステムVLAアーキテクチャであるLibra-VLAを紹介する。
当社のアプローチは,オープンワールド操作に対して,スケーラブルで堅牢で応答性の高いソリューションを提供しています。
論文 参考訳(メタデータ) (2026-04-27T19:02:46Z) - FAR-Drive: Frame-AutoRegressive Video Generation in Closed-Loop Autonomous Driving [11.275815014211046]
自律運転のための学習ベースのクローズドループシミュレータの構築は、3つの大きな課題を提起する。
長期の時間的・横断的な一貫性、反復的自己条件下での自己回帰劣化の緩和、低遅延推論制約を満たす。
自動運転のためのフレームレベル自動回帰ビデオ生成フレームワークであるFAR-Driveを提案する。
論文 参考訳(メタデータ) (2026-03-16T07:40:13Z) - TSC: Topology-Conditioned Stackelberg Coordination for Multi-Agent Reinforcement Learning in Interactive Driving [37.09409794849228]
トポロジ条件付きStackelberg Coordinationは、コミュニケーションフリー実行下での分散インタラクティブ運転のための学習フレームワークである。
TSCは,主要な指標をまたいだ代表的MARLベースラインよりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-02-27T10:46:41Z) - SPACeR: Self-Play Anchoring with Centralized Reference Models [50.55045557371374]
Simエージェントポリシーは、現実的で、人間らしく、高速で、マルチエージェント設定でスケーラブルである。
大規模な拡散モデルやトークン化モデルを用いた模倣学習の最近の進歩は、人間の運転データから直接行動を把握することができることを示している。
本研究では,事前訓練されたトークン化自己回帰運動モデルを利用したSPACeRを提案する。
論文 参考訳(メタデータ) (2025-10-20T19:53:02Z) - DecompGAIL: Learning Realistic Traffic Behaviors with Decomposed Multi-Agent Generative Adversarial Imitation Learning [59.63038625580992]
既存の模倣学習アプローチは、しばしば現実的な交通行動のモデル化に失敗する。
本稿では,現実性をエゴマップとエゴ隣接コンポーネントに明示的に分解するDecompGAILを提案する。
DecompGAILは、WOMD Sim Agents 2025ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-10-08T11:46:39Z) - RIFT: Group-Relative RL Fine-Tuning for Realistic and Controllable Traffic Simulation [13.319344167881383]
データ駆動シミュレーターにおいて、模擬学習事前学習を行う2段階のAV中心シミュレーションフレームワークを導入する。
次に、物理に基づくシミュレータで微調整を学習し、スタイルレベルの制御性を向上する。
微調整段階において,新しいグループ関連RL微調整戦略であるRIFTを提案する。
論文 参考訳(メタデータ) (2025-05-06T09:12:37Z) - SAFE-SIM: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable Adversaries [94.84458417662407]
制御可能なクローズドループ安全クリティカルシミュレーションフレームワークであるSAFE-SIMを紹介する。
提案手法は,1)現実の環境を深く反映した現実的な長距離安全クリティカルシナリオの生成,2)より包括的でインタラクティブな評価のための制御可能な敵行動の提供,の2つの利点をもたらす。
複数のプランナにまたがるnuScenesとnuPlanデータセットを使用して、我々のフレームワークを実証的に検証し、リアリズムと制御性の両方の改善を実証した。
論文 参考訳(メタデータ) (2023-12-31T04:14:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。