論文の概要: Cooperative Multi-UAV Navigation in Complex Environments via Systematic Multi-Agent Deep Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.25754v1
- Date: Tue, 28 Jul 2026 14:16:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.866136
- Title: Cooperative Multi-UAV Navigation in Complex Environments via Systematic Multi-Agent Deep Reinforcement Learning
- Title(参考訳): 複合環境における多元深部強化学習による協調的多UAVナビゲーション
- Abstract要約: 局所的なオプティマトラップ、スパース報酬、エージェント間の不均衡の学習、クロスシナリオの一般化が不十分である。
本稿では,これらの課題を協調探索,実証利用,安全なカリキュラムスケジューリング,構造認識の一般化を通じて解決する多エージェント深層強化学習フレームワークを提案する。
シミュレーションの結果、コラボレーションの成功率、ナビゲーションの堅牢性、ゼロショットのクロスシナリオの一般化、動的環境適応性などにおいて、強い性能が確認された。
- 参考スコア(独自算出の注目度): 14.620999662200795
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cooperative navigation of multi-agent UAVs in complex environments faces key challenges including local optima traps, sparse rewards, learning imbalance among agents, and insufficient cross-scenario generalisation. This paper proposes a multi-agent deep reinforcement learning framework that addresses these issues through coordinated exploration, demonstration exploitation, safe curriculum scheduling, and structure-aware generalisation. First, a perception mechanism combining memory of visited states, directional novelty estimates, and penalty backpropagation enables agents to proactively detect and escape local optima. Second, a hierarchical collaborative demonstration buffer with tiered behaviour cloning manages trajectories by degree of team collaboration and applies differential supervision to the actor network, improving demonstration utilisation under sparse collaborative signals. Third, a safety-aware dual-condition curriculum scheduling mechanism reviews mastered scenarios through back-testing and experience pre-filling during training, suppressing catastrophic forgetting while ensuring both task performance and flight safety. For generalisation, local geometric features computed from sensor readings are abstracted into a domain parameter, through which a structure-aware gating network and mixture-of-experts mechanism condition the policy on local structural patterns rather than scenario-specific coordinates, enabling cross-scenario transfer without exposure to the target environment. The framework is further validated under mixed static-dynamic obstacle settings, showing robust adaptability to dynamic disturbances. Simulation results confirm strong performance in collaboration success rate, navigation robustness, zero-shot cross-scenario generalisation, and dynamic environment adaptability.
- Abstract(参考訳): 複雑な環境下でのマルチエージェントUAVの協調ナビゲーションは、局所的な最適トラップ、スパース報酬、エージェント間の不均衡の学習、クロスシナリオの一般化の不十分といった重要な課題に直面している。
本稿では,これらの課題を協調探索,実証利用,安全なカリキュラムスケジューリング,構造認識の一般化を通じて解決する多エージェント深層強化学習フレームワークを提案する。
第一に、訪問状態の記憶、方向性の新規性推定、ペナルティバックプロパゲーションを組み合わせた知覚機構により、エージェントは積極的に局所最適性を検知し、脱出することができる。
第二に、階層的な協調的なデモバッファと協調行動のクローンは、チームコラボレーションの度合いで軌道を管理し、アクターネットワークに差分監督を適用し、疎結合な信号下でのデモンストレーション利用を改善する。
第三に、安全に配慮した二重条件のカリキュラムスケジューリングメカニズムは、バックテストとトレーニング中のプレフィル経験を通じて、熟練したシナリオをレビューし、タスクパフォーマンスと飛行安全性の両方を確保しながら、破滅的な忘れを抑える。
一般化のために、センサ読み取りから計算された局所幾何学的特徴をドメインパラメータに抽象化し、構造認識ゲーティングネットワークと試験機構の混合条件により、シナリオ固有の座標ではなく局所構造パターンのポリシーを条件とし、ターゲット環境に露出することなく、クロスシナリオ転送を可能にする。
このフレームワークは、混合静的-動的障害物設定の下でさらに検証され、動的障害に対する堅牢な適応性を示す。
シミュレーションの結果、コラボレーションの成功率、ナビゲーションの堅牢性、ゼロショットのクロスシナリオの一般化、動的環境適応性などにおいて、強い性能が確認された。
関連論文リスト
- Safety-aware Skill Adaptation for Reinforcement Learning in Dynamic Environments [2.9923891863939946]
Dist-GPRLは、構造化ロボットスキル適応のための遠隔認識および安全誘導型強化学習フレームワークである。
ガウス過程(GP)に基づくスキルパラメタライゼーションを基盤として,スパーストラジェクトリの局所窓の重なり合いを逐次適応する。
シミュレーションにおける2つの動的オブジェクト操作タスクの枠組みを評価し,実世界のロボットに学習方針を伝達する。
論文 参考訳(メタデータ) (2026-09-10T12:05:54Z) - Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild [49.77540427384148]
本稿では,基礎モデルの汎用的マルチモーダル推論能力を野生でのHOI検出に伝達する,訓練不要なエージェント型フレームワークであるAgenHoIを提案する。
不完全な相互作用発見と複雑な場面におけるあいまいな局所化の課題に対処するために,2つの重要なメカニズムを導入する。
AgentHOIは、リアルタイム設定において、最先端の教師付きおよび弱教師付きメソッドよりも優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-07-15T14:30:20Z) - IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control [9.294981970003892]
本研究では,マルチエージェント制御のためのsim-to-real法を提案する。
提案手法は,ランダムな環境構造と閉ループ制御による個別の意味行動を組み合わせることで,政策学習をセマンティック・抽象化のレベルに引き上げる。
論文 参考訳(メタデータ) (2026-06-25T03:49:25Z) - CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment [54.84167973913561]
CoEnvは、安全な戦略探索のためにシミュレーションを活用するフレームワークであり、信頼性の高い現実世界のデプロイメントを保証する。
CoEnvは、物理的なワークスペースをデジタル化するリアル・ツー・シムのシーン再構築、コードベースの軌道生成によるリアルタイム計画と安全な配置のための衝突検出によるシム・トゥ・リアル転送の両方をサポートするVLM駆動のアクション合成という3つの段階を経験している。
論文 参考訳(メタデータ) (2026-04-07T06:24:41Z) - Multi-AUV Ad-hoc Networks-Based Multi-Target Tracking Based on Scene-Adaptive Embodied Intelligence [17.13365683218245]
本稿では,マルチAUVアドホックネットワークのためのシーン適応型エンボディインテリジェンス(EI)アーキテクチャを提案する。
EIは、知覚、意思決定、身体的実行を統一された認知ループに統合することで、AUVを具現化された実体として再考する。
論文 参考訳(メタデータ) (2026-03-28T08:48:22Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - Hybrid Motion Planning with Deep Reinforcement Learning for Mobile Robot Navigation [0.0]
深部強化学習(HMP-DRL)によるハイブリッド運動計画
状態空間と報酬関数の両方に符号化されたチェックポイントのシーケンスを通じて、局所DRLポリシーに統合されたパスを生成するグラフベースのグローバルプランナを提案する。
社会的コンプライアンスを確保するため、地域プランナーは、周辺エージェントのセマンティックタイプに基づいて、安全マージンと罰則を動的に調整するエンティティ対応報酬構造を採用する。
論文 参考訳(メタデータ) (2025-12-31T05:58:57Z) - Multi-Agent Deep Reinforcement Learning for Collaborative UAV Relay Networks under Jamming Atatcks [36.380478794869234]
本稿では,この課題を,分散実行トレーニング(CTDE)フレームワークを用いて解決したMARL(Multi-Agent Reinforcement Learning)問題として定式化する。
提案手法はベースラインを著しく上回り,システム全体のスループットを約50%向上し,同時にほぼゼロの衝突速度を実現した。
重要な発見は、エージェントが明示的なプログラミングなしに創発的なアンチジャミング戦略を開発することである。
論文 参考訳(メタデータ) (2025-12-09T08:11:21Z) - Grounded Test-Time Adaptation for LLM Agents [75.62784644919803]
大規模言語モデル(LLM)ベースのエージェントは、新規で複雑な環境への一般化に苦慮している。
環境特化情報を活用することで, LLMエージェントを適応するための2つの戦略を提案する。
論文 参考訳(メタデータ) (2025-11-06T22:24:35Z) - A Cross-Environment and Cross-Embodiment Path Planning Framework via a Conditional Diffusion Model [6.482051262912219]
本研究の目的は、未確認環境や新しいロボットマニピュレータに再訓練せずに一般化できる経路計画フレームワークを開発することである。
本稿では,Voxelized scene representationsに基づく共同空間軌跡を生成する拡散型計画モデルであるGADGETを提案する。
実験結果から,GADGETは球状障害物,ビンピッキング,シェルフ環境において衝突強度の低い高い高い成功率を達成できた。
論文 参考訳(メタデータ) (2025-10-21T23:30:14Z) - SAFE-SIM: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable Adversaries [94.84458417662407]
制御可能なクローズドループ安全クリティカルシミュレーションフレームワークであるSAFE-SIMを紹介する。
提案手法は,1)現実の環境を深く反映した現実的な長距離安全クリティカルシナリオの生成,2)より包括的でインタラクティブな評価のための制御可能な敵行動の提供,の2つの利点をもたらす。
複数のプランナにまたがるnuScenesとnuPlanデータセットを使用して、我々のフレームワークを実証的に検証し、リアリズムと制御性の両方の改善を実証した。
論文 参考訳(メタデータ) (2023-12-31T04:14:43Z) - Safe Multi-agent Learning via Trapping Regions [89.24858306636816]
我々は、動的システムの定性理論から知られているトラップ領域の概念を適用し、分散学習のための共同戦略空間に安全セットを作成する。
本稿では,既知の学習力学を持つシステムにおいて,候補がトラップ領域を形成することを検証するための二分分割アルゴリズムと,学習力学が未知のシナリオに対するサンプリングアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-02-27T14:47:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。