論文の概要: Superhuman Safe and Agile Racing through Multi-Agent Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2605.22748v1
- Date: Thu, 21 May 2026 17:15:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.369563
- Title: Superhuman Safe and Agile Racing through Multi-Agent Reinforcement Learning
- Title(参考訳): マルチエージェント強化学習による超人的安全とアジャイルレース
- Authors: Ismail Geles, Leonard Bauersfeld, Markus Wulfmeier, Davide Scaramuzza,
- Abstract要約: マルチエージェント強化学習は,現実世界のインタラクションに必要な安全足場を提供する。
我々はエージェントに複雑な空力相互作用と様々なレーサーとの戦略的な操作を誘導するように訓練する。
我々のエージェントは、最先端の単一エージェントベースラインに比べて衝突率を50%向上させる。
- 参考スコア(独自算出の注目度): 22.65712097455206
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous systems have achieved superhuman performance in isolation or simulation, yet they remain brittle in shared, dynamic real-world spaces. This failure stems from the dominant single-agent paradigm for physical applications, where other actors are ignored or treated as environmental noise, preventing effective coordination. Here we show that multi-agent reinforcement learning provides the essential safety scaffolding required for real-world interaction. Using high-speed quadrotor racing as a high-stakes testbed, we train agents to navigate complex aerodynamic interactions and strategic maneuvering with a variable number of racers. Through league-based self-play, agents evolve sophisticated anticipatory behaviors, including proactive collision avoidance, overtaking, and handling multi-agent physical interactions, including aerodynamic downwash. Our agents outperform a champion-level human pilot in multi-player races at speeds exceeding 22 m/s, while simultaneously reducing collision rates by 50 % compared to state-of-the-art single-agent baselines. Crucially, training with diverse artificial agents enables zero-shot generalization to safer human interaction. These results suggest that the path to robust robotic co-existence lies not in isolated safety constraints, but in the rigorous demands of multi-agent interaction. Multimedia materials are available at: https://rpg.ifi.uzh.ch/marl
- Abstract(参考訳): 自律システムは分離やシミュレーションにおいて超人的性能を達成したが、共有された動的な現実世界空間では不安定なままである。
この失敗は、他のアクターが環境ノイズとして無視または扱われ、効果的な調整を妨げている物理応用における支配的な単一エージェントパラダイムに起因している。
ここでは,マルチエージェント強化学習が現実世界の相互作用に必須の安全足場を提供することを示す。
高速四輪車レースを高速テストベッドとして使用し,複雑な空力的相互作用と様々なレーサーとの戦略操作を行うエージェントを訓練する。
リーグベースのセルフプレイを通じて、エージェントは、積極的衝突回避、オーバーテイク、空気力学的ダウンウォッシュを含む多エージェントの物理的相互作用の処理を含む洗練された予測行動を発展させる。
我々のエージェントは、22m/s以上の速度でマルチプレイヤーレースでチャンピオンレベルの人間パイロットを上回り、同時に衝突率を最先端の単一エージェントベースラインと比較して50%削減する。
重要なのは、多様な人工エージェントによるトレーニングによって、ゼロショットの一般化により、人間のインタラクションがより安全になることだ。
これらの結果は,ロバストなロボット共存への道は孤立した安全制約ではなく,マルチエージェントインタラクションの厳密な要求にあることを示唆している。
マルチメディア素材は以下の通り。
関連論文リスト
- RPG: Robust Policy Gating for Smooth Multi-Skill Transitions in Humanoid Fighting [52.18271301977709]
我々は,スムーズで安定したヒューマノイド多スキル移行のためのハイブリッド・エキスパート・ポリシー・フレームワークであるRPGを提案する。
本手法では,動き遷移のランダム化と時間的ランダム化を取り入れて,アジャイルな戦闘行動を生成する統一的な政策を訓練する。
我々は、歩行/走る移動と戦闘スキルを統合する制御パイプラインを設計し、人間のような長時間の戦闘を任意の期間で行えるようにした。
論文 参考訳(メタデータ) (2026-04-23T07:14:35Z) - RoboStriker: Hierarchical Decision-Making for Autonomous Humanoid Boxing [43.240817529539356]
RoboStrikerは、完全に自律的なヒューマノイドボクシングを可能にする階層的な3段階のフレームワークである。
このフレームワークは、まず、人間のモーションキャプチャーデータに基づいてシングルエージェントモーショントラッカーをトレーニングすることにより、ボクシングスキルの包括的なレパートリーを学習する。
最終段階では、Latent-Space Neural Fictitious Self-Play (LS-NFSP)を導入する。
論文 参考訳(メタデータ) (2026-01-30T03:51:58Z) - Diffusion Forcing for Multi-Agent Interaction Sequence Modeling [52.769202433667125]
MAGNetはマルチエージェントモーション生成のための統合された自己回帰拡散フレームワークである。
フレキシブルな条件付けとサンプリングを通じて、幅広いインタラクションタスクをサポートする。
緊密に同期された活動と、ゆるやかに構造化された社会的相互作用の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-12-19T18:59:02Z) - Agile Flight Emerges from Multi-Agent Competitive Racing [7.9331622838838305]
アジャイルの飛行と戦略は、強化学習で訓練されたエージェントから生まれます。
マルチエージェントコンペティションは、単一エージェントのプログレッシブベースの報酬でトレーニングされたポリシーよりも、現実世界に確実に移行するポリシーを得られることが分かっています。
論文 参考訳(メタデータ) (2025-12-12T18:48:50Z) - InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs [72.5651722107621]
InterAgentはテキスト駆動型物理ベースのマルチエージェントヒューマノイド制御のためのエンドツーエンドフレームワークである。
本稿では,マルチストリームブロックを備えた自己回帰拡散トランスフォーマーを提案する。
また,空間依存性の微粒化を明示的に捉えた対話グラフのエクスセプション表現を提案する。
論文 参考訳(メタデータ) (2025-12-08T10:46:01Z) - Human-compatible driving partners through data-regularized self-play reinforcement learning [3.9682126792844583]
HR-PPO(Human-Regularized PPO)は、エージェントが人間の参照ポリシーから逸脱する小さなペナルティで自己プレイを通じて訓練されるマルチエージェントアルゴリズムである。
その結果,HR-PPOは93%,オフロード率3.5%,衝突率3%の目標達成に極めて有効であることがわかった。
論文 参考訳(メタデータ) (2024-03-28T17:56:56Z) - ProAgent: Building Proactive Cooperative Agents with Large Language
Models [89.53040828210945]
ProAgentは、大規模な言語モデルを利用してプロアクティブエージェントを生成する新しいフレームワークである。
ProAgentは現状を分析し、チームメイトの意図を観察から推測することができる。
ProAgentは高度なモジュール化と解釈可能性を示し、様々な調整シナリオに容易に統合できる。
論文 参考訳(メタデータ) (2023-08-22T10:36:56Z) - Learning Agile Soccer Skills for a Bipedal Robot with Deep Reinforcement Learning [26.13655448415553]
Deep Reinforcement Learning (Deep RL)は、低コストでミニチュアなヒューマノイドロボットのための洗練された安全な運動スキルを合成することができる。
我々はDeep RLを使って、20個の関節を持つヒューマノイドロボットを訓練し、1対1(1v1)のサッカーゲームを単純化した。
結果として得られるエージェントは、急激な転倒回復、歩行、回転、蹴りなど、堅牢でダイナミックな動きのスキルを示す。
論文 参考訳(メタデータ) (2023-04-26T16:25:54Z) - Learning Latent Representations to Influence Multi-Agent Interaction [65.44092264843538]
エージェントのポリシーの潜在表現を学習するための強化学習に基づくフレームワークを提案する。
提案手法は代替手段よりも優れており,他のエージェントに影響を与えることを学習している。
論文 参考訳(メタデータ) (2020-11-12T19:04:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。