論文の概要: Intercepting an Agile Target with Net-Carrying Drones using Competitive Multi-Agent Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.05939v1
- Date: Tue, 07 Jul 2026 07:41:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.434039
- Title: Intercepting an Agile Target with Net-Carrying Drones using Competitive Multi-Agent Reinforcement Learning
- Title(参考訳): 競争力のあるマルチエージェント強化学習を用いたネットキャリングドローンによるアジャイルターゲットの解釈
- Abstract要約: この記事では、漁網を運ぶアジャイルドローンのチームによって、アジャイルドローンを迎撃するソリューションを提示します。
競合するマルチエージェント強化学習(MARL)タスクとして問題を定式化する。
PFSPを用いたMAPPO(Multi-Agent Proximal Policy Optimization)による追跡者と回避者の訓練
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This article presents a solution to intercept an agile drone by a team of agile drone carrying catching nets. We formulate the problem as a competitive Multi-Agent Reinforcement Learning (MARL) task. To address the problem of nonstationarity and catastrophic forgetting of agents overfitting to the current opponent strategy, we train the pursuers and the evader using Multi-Agent Proximal Policy Optimization (MAPPO) with Prioritized Fictitious Self Play (PFSP). We train the agents in a high-fidelity simulator using low-level control commands, collective thrust and body rates (CTBR), to achieve agile flights for both the pursuers and the evader. We compare the performance of the trained policies in terms of catch rate, time to catch and crash rates, against heuristic baselines and show that our solution outperforms them. Ablation studies show that PFSP lead to more robust policies that can adapt to different opponent strategies, and that a low-level control commands are crucial for learning performing strategies in the pursuit-evasion task. Finally, a qualitative analysis of the learned behaviours highlights the emergence of cooperative tactics among the pursuers.
- Abstract(参考訳): この記事では、漁網を運ぶアジャイルドローンのチームによって、アジャイルドローンを迎撃するソリューションを提示します。
競合するマルチエージェント強化学習(MARL)タスクとして問題を定式化する。
現状の戦略に適合しないエージェントの非定常性や破滅的な忘れ忘れの問題に対処するため,PFSPを用いたMAPPO(Multi-Agent Proximal Policy Optimization)を用いて追跡者と回避者を訓練する。
我々は,低レベル制御コマンド,集合推力,体率(CTBR)を用いて高忠実度シミュレーターのエージェントを訓練し,追従者および避難者双方のアジャイル飛行を実現する。
キャッチレート、キャッチタイム、クラッシュレートの観点から、トレーニングされたポリシーのパフォーマンスを比較し、ヒューリスティックなベースラインに対して、ソリューションがそれらより優れていることを示す。
アブレーション研究は、PFSPが、異なる戦略に適応できるより堅牢なポリシーを導き、低レベルの制御コマンドが追従回避タスクにおける戦略を実行するために不可欠であることを示している。
最後に,学習行動の質的分析により,追跡者間の協調的戦術の出現が明らかになった。
関連論文リスト
- AgilePE: Autonomous UAV Pursuit-Evasion via Self-Play Reinforcement Learning [31.828745787124316]
本稿では,自律型UAV追尾回避システムであるAgilePEを提案する。
AgilePEはアジャイルの低レベルのコントロール、競合ポリシの最適化、統合されたフレームワークでのsim-to-realデプロイメントを統合しています。
トレーニングでは,プライオリティライズ・フィクション・セルフプレイ(PFSP)と多様な対戦プールを併用し,エージェントが歴史的方針に反する改善を可能にする。
実世界の実験では、急速ドッジや側面撮影を含むシミュレーションで観測された追跡回避戦術を再現し、インタラクティブな2エージェントゼロショット展開を実証している。
論文 参考訳(メタデータ) (2026-08-14T09:41:16Z) - Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks [56.45762972211923]
マルチターン攻撃に対するLDMの安全性を確保するためのプロアクティブ・ディフェンス・フレームワークを提案する。
特殊なエージェントが補完的な防衛戦略を実行するような、協調的なマルチエージェントアーキテクチャを採用している。
マルチターン攻撃における進化戦略をシミュレートするEMRAデータセットを提案する。
論文 参考訳(メタデータ) (2026-07-31T14:04:49Z) - Agile Interception of a Flying Target using Competitive Reinforcement Learning [2.982218441172364]
この記事では、捕獲網を積んだ別のアジャイルドローンによって、アジャイルドローンを迎撃するソリューションを提示します。
我々は、このインターセプションを競合強化学習問題として定式化し、インターセプターとターゲットドローンを個別のポリシーで制御する。
JAXで実装された現実的な四重項力学モデルと低レベル制御アーキテクチャを統合した高忠実度シミュレーション環境を提案する。
論文 参考訳(メタデータ) (2026-03-17T09:11:23Z) - Learned Controllers for Agile Quadrotors in Pursuit-Evasion Games [42.74003740156243]
我々は,アジャイル1v1クアッドロータ追従回避の問題に対処する。
これらの問題に対処するために,非同期多段階人口ベース (AMSPB) アルゴリズムを提案する。
このフレームワークでは、ベロシティコマンドまたはボディーレートを集合推力で出力するニューラルネットワークコントローラをトレーニングします。
論文 参考訳(メタデータ) (2025-06-03T13:19:23Z) - Toward Optimal LLM Alignments Using Two-Player Games [86.39338084862324]
本稿では,対戦相手と防御エージェントの反復的相互作用を含む2エージェントゲームのレンズによるアライメントについて検討する。
この反復的強化学習最適化がエージェントによって誘導されるゲームに対するナッシュ平衡に収束することを理論的に実証する。
安全シナリオにおける実験結果から、このような競争環境下での学習は、完全に訓練するエージェントだけでなく、敵エージェントと防御エージェントの両方に対する一般化能力の向上したポリシーにつながることが示されている。
論文 参考訳(メタデータ) (2024-06-16T15:24:50Z) - Efficient Adversarial Training in LLMs with Continuous Attacks [99.5882845458567]
大規模言語モデル(LLM)は、安全ガードレールをバイパスできる敵攻撃に対して脆弱である。
本稿では,2つの損失からなる高速対向訓練アルゴリズム(C-AdvUL)を提案する。
C-AdvIPOは、対向的に堅牢なアライメントのためのユーティリティデータを必要としない、対向型のIPOである。
論文 参考訳(メタデータ) (2024-05-24T14:20:09Z) - Coach-assisted Multi-Agent Reinforcement Learning Framework for
Unexpected Crashed Agents [120.91291581594773]
本稿では,予期せぬクラッシュを伴う協調型マルチエージェント強化学習システムの公式な定式化について述べる。
本稿では,教師支援型多エージェント強化学習フレームワークを提案する。
私たちの知る限りでは、この研究はマルチエージェントシステムにおける予期せぬクラッシュを初めて研究したものです。
論文 参考訳(メタデータ) (2022-03-16T08:22:45Z) - Robust Reinforcement Learning on State Observations with Learned Optimal
Adversary [86.0846119254031]
逆摂動状態観測による強化学習の堅牢性について検討した。
固定されたエージェントポリシーでは、摂動状態の観測に最適な敵を見つけることができる。
DRLの設定では、これは以前のものよりもはるかに強い学習された敵対を介してRLエージェントに新しい経験的敵対攻撃につながります。
論文 参考訳(メタデータ) (2021-01-21T05:38:52Z) - Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle
Coordination by Multi-Critic Policy Gradient Optimization [16.6182621419268]
農業、災害管理、捜索および救助活動、商業および軍事用途では、ドローンの艦隊を適用する利点は、自律的に協力する能力に由来します。
本稿では,政策ネットワークの安定的な更新と報酬信号開発における類似性を実現するマルチエージェント強化学習手法を提案する。
論文 参考訳(メタデータ) (2020-12-31T07:00:44Z) - Robust Deep Reinforcement Learning through Adversarial Loss [74.20501663956604]
近年の研究では、深層強化学習剤は、エージェントの入力に対する小さな逆方向の摂動に弱いことが示されている。
敵攻撃に対する堅牢性を向上した強化学習エージェントを訓練するための原則的フレームワークであるRADIAL-RLを提案する。
論文 参考訳(メタデータ) (2020-08-05T07:49:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。