論文の概要: TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale
- arxiv url: http://arxiv.org/abs/2607.13028v1
- Date: Tue, 14 Jul 2026 17:59:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.246498
- Title: TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale
- Title(参考訳): TerraZero: ゼロデモによる大規模セルフプレイのための手続き駆動シミュレーション
- Abstract要約: TerraZeroはプロシージャ駆動シミュレータとセルフプレイトレーニングスタックである。
CエンジンはCPU上でシミュレーションを実行し、GPU上でゼロコピーパス上でポリシー推論を行う。
報告されたすべてのポリシーは、計算効率のよいセルフプレイレシピだけで強化学習によってゼロから訓練される。
- 参考スコア(独自算出の注目度): 18.077282979391423
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training robust autonomous driving agents requires a simulator that is fast enough for reinforcement learning at scale, realistic enough to ground behavior in real-world map structure, and diverse enough to cover the safety-critical long tail that logged data rarely contains. We present TerraZero, a procedural driving simulator and self-play training stack. A configurable C engine runs simulation on the CPU and policy inference on the GPU over a zero-copy path, sustaining 1.3M agent-steps per second on a single server-grade GPU, far faster than existing object-level simulators, while keeping fidelity lighter single-agent systems omit: heterogeneous agents, multiple dynamics models, and full traffic-rule enforcement. TerraZero treats logged data only as a source of real-world map geometry, populating each map with randomized rule-based road users and signal controllers and randomizing agent dynamics, rewards, and sizes per episode, so a map yields an unbounded set of scenarios. Every reported policy trains from scratch by reinforcement learning alone on a compute-efficient self-play recipe across GPUs, with zero human demonstrations and no fallback planner at inference. Policies generalize zero-shot across cities and datasets, including emergent left-hand-traffic driving without explicit supervision. As an ego policy, TerraZero is the first fully learned policy to top the InterPlan long-tail benchmark, ahead of larger learned planners; on routine-driving val14 it ranks among the best approaches and is the safest, posting the best collision and time-to-collision scores. On Waymo Open Sim Agents realism the same recipe outperforms other demonstration-free methods and is competitive with the strongest reference-anchored self-play method. One stack serves both roles: driving policies across dynamics for cars and trucks, and sim agents that jointly control vehicles, pedestrians, and cyclists.
- Abstract(参考訳): 堅牢な自律運転エージェントの訓練には、大規模に強化学習を行うのに十分な速度で、現実世界の地図構造で振る舞うのに十分リアルで、ログされたデータがほとんど含まない安全クリティカルなロングテールをカバーするのに十分な多様性を持つシミュレータが必要である。
本稿では,プロシージャ駆動シミュレータとセルフプレイトレーニングスタックであるTerraZeroを紹介する。
構成可能なCエンジンは、CPU上でシミュレーションを実行し、ゼロコピーパス上でGPU上のポリシー推論を実行し、1つのサーバグレードのGPU上で毎秒1.3Mのエージェントステップを持続する。
TerraZeroは、ログされたデータを実世界の地図幾何学のソースとしてのみ扱い、ランダム化されたルールベースの道路ユーザと信号コントローラーで各マップをポピュレートし、エージェントのダイナミックス、報酬、サイズを1回あたりランダム化する。
報告されたポリシはすべて、GPU全体で計算効率のよいセルフプレイレシピを学習することで、ゼロからゼロからトレーニングする。
政策は都市やデータセットにまたがってゼロショットを一般化する。
Egoポリシーとして、TerraZeroは、大規模な学習プランナーよりも先に、InterPlanのロングテールベンチマークをトップに、初めて完全に学習されたポリシーである。
Waymo Open Sim Agentsのリアリズムでは、同じレシピが他のデモ不要の手法よりも優れており、最強のリファレンスアンコール方式と競合する。
1つのスタックは、車とトラックのダイナミックスにまたがるポリシーを推進し、車、歩行者、サイクリストを共同で制御するsimエージェントを駆動する。
関連論文リスト
- Learning Sim-to-Real Humanoid Locomotion in 15 Minutes [51.500643119683225]
本稿では,FastSACとFastTD3という,非政治的RLアルゴリズムに基づくシンプルで実用的なレシピを提案する。
我々の単純なレシピは、何千もの並列環境において、政治外のRLアルゴリズムを大規模に安定化させる。
我々は,Unitree G1 と Booster T1 ロボット上でのヒューマノイド移動制御器のエンドツーエンドの迅速な学習を実演する。
論文 参考訳(メタデータ) (2025-12-01T18:55:17Z) - SPACeR: Self-Play Anchoring with Centralized Reference Models [50.55045557371374]
Simエージェントポリシーは、現実的で、人間らしく、高速で、マルチエージェント設定でスケーラブルである。
大規模な拡散モデルやトークン化モデルを用いた模倣学習の最近の進歩は、人間の運転データから直接行動を把握することができることを示している。
本研究では,事前訓練されたトークン化自己回帰運動モデルを利用したSPACeRを提案する。
論文 参考訳(メタデータ) (2025-10-20T19:53:02Z) - Learning to Drive from a World Model [0.5055815271772576]
そこで本研究では,実運転データを用いて実運転ポリシーを訓練するエンドツーエンドのトレーニングアーキテクチャを提案する。
本研究では,再計画型シミュレーションと学習世界モデルを用いたシミュレーションの2つの方法を示す。
クローズドループシミュレーションや,現実の先進運転支援システムに展開する場合に,これらのポリシーの性能を評価する。
論文 参考訳(メタデータ) (2025-04-27T02:17:22Z) - Building reliable sim driving agents by scaling self-play [3.3378669626639423]
シミュレーションエージェントは、自動運転車(AV)のような人間と相互作用するシステムの設計とテストに不可欠である
我々は,人間の知覚と制御に対する半現実的な制限の下で,オープンモーションデータセット上で数千のシナリオにセルフプレイをスケールすることを提案する。
テストシーンが見えないように一般化し、0.8%未満の衝突とオフロードインシデントで99.8%のゴール達成率を達成した。
論文 参考訳(メタデータ) (2025-02-20T16:30:45Z) - Robust Autonomy Emerges from Self-Play [63.44745854476206]
我々は、前例のない規模のシミュレーションにおいて、頑健で自然主義的な運転が、完全に自己プレイから現れることを示す。
Gigaflowは、42年間の主観的な運転体験を1時間に合成し、訓練することができる。
論文 参考訳(メタデータ) (2025-02-05T16:41:05Z) - Autonomous Vehicle Controllers From End-to-End Differentiable Simulation [57.278726604424556]
そこで我々は,AVコントローラのトレーニングにAPG(analytic Policy gradients)アプローチを適用可能なシミュレータを提案し,その設計を行う。
提案するフレームワークは, エージェントがより根底的なポリシーを学ぶのを助けるために, 環境力学の勾配を役立てる, エンド・ツー・エンドの訓練ループに, 微分可能シミュレータを組み込む。
ダイナミクスにおけるパフォーマンスとノイズに対する堅牢性の大幅な改善と、全体としてより直感的なヒューマンライクな処理が見られます。
論文 参考訳(メタデータ) (2024-09-12T11:50:06Z) - WROOM: An Autonomous Driving Approach for Off-Road Navigation [17.74237088460657]
オフロード環境における自動運転車のためのエンドツーエンド強化学習システム(RL)を設計する。
ルールベースのコントローラを模倣してエージェントを温め、PPO(Proximal Policy Optimization)を利用してポリシーを改善する。
オフロード走行シナリオを再現する新しいシミュレーション環境を提案し,本提案手法を実車に展開する。
論文 参考訳(メタデータ) (2024-04-12T23:55:59Z) - Sim-to-Real via Sim-to-Seg: End-to-end Off-road Autonomous Driving
Without Real Data [56.49494318285391]
我々は、オフロード自動運転の視覚的現実的ギャップを横断するRCANを再想像するSim2Segを紹介する。
これは、ランダム化されたシミュレーション画像をシミュレートされたセグメンテーションと深さマップに変換する学習によって行われる。
これにより、シミュレーションでエンドツーエンドのRLポリシーをトレーニングし、現実世界に直接デプロイできます。
論文 参考訳(メタデータ) (2022-10-25T17:50:36Z) - TrafficSim: Learning to Simulate Realistic Multi-Agent Behaviors [74.67698916175614]
リアル交通シミュレーションのためのマルチエージェント行動モデルであるTrafficSimを提案する。
特に、暗黙の潜在変数モデルを利用して、共同アクターポリシーをパラメータ化する。
TrafficSimは、多様なベースラインと比較して、より現実的で多様なトラフィックシナリオを生成します。
論文 参考訳(メタデータ) (2021-01-17T00:29:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。