論文の概要: OGR-MARL: Option-Guided Residual Multi-Agent Reinforcement Learning for Heterogeneous USV Cooperative Pursuit in Constrained Port Waterways
- arxiv url: http://arxiv.org/abs/2608.12995v1
- Date: Thu, 13 Aug 2026 09:19:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.461051
- Title: OGR-MARL: Option-Guided Residual Multi-Agent Reinforcement Learning for Heterogeneous USV Cooperative Pursuit in Constrained Port Waterways
- Title(参考訳): OGR-MARL:不均質USV協調航路におけるオプションガイド型残留マルチエージェント強化学習
- Abstract要約: 制限された港水路におけるUSVの協力的追跡は、航法、交通、役割制約の下での避難者妨害を必要とする。
本稿では,オプション誘導型残留型マルチエージェント強化学習フレームワークであるOGR-MARLを提案する。
OGR-MARLは、共有エバダの信念、役割条件付きオプションターゲット、適応ルールの罰則、残留ポリシー学習を統合している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Heterogeneous USV cooperative pursuit in constrained port waterways requires evader interception under navigation, traffic, and role constraints. This paper proposes OGR-MARL, an option-guided residual multi-agent reinforcement learning framework that is decoupled from a specific MARL algorithm. OGR-MARL integrates shared evader belief, role-conditioned option targets, adaptive rule penalties, and residual policy learning, allowing different MARL algorithms to learn corrective actions on top of rule-guided behaviors rather than exploring constrained port environments from scratch. We instantiate OGR-MARL with representative continuous-control MARL backbones, including MADDPG, MATD3, MAPPO, and MASAC, yielding OGR-MADDPG, OGR-MATD3, OGR-MAPPO, and OGR-MASAC. Experiments in an abstract Xiazhimen port-waterway scenario show that the OGR-MASAC instantiation achieves a 75.0% capture rate, promising mission-effective rule compliance, and the best heterogeneous coordination among the tested methods. Without retraining, zero-shot transfer to a QGIS/AIS-informed Xiazhimen map achieves promising results, demonstrating the generalization potential of OGR-MARL in more complex port scenarios.
- Abstract(参考訳): 制約された港湾水路における不均一なUSV協調追求は、航法、交通、役割制約の下でのエバダのインターセプションを必要とする。
本稿では,OGR-MARLを提案する。OGR-MARLは,特定のMARLアルゴリズムから切り離された,オプション誘導型残留型マルチエージェント強化学習フレームワークである。
OGR-MARLは、共有エバダの信念、ロール条件付きオプションターゲット、適応ルールペナルティ、残留ポリシー学習を統合し、異なるMARLアルゴリズムは、制約された港環境をスクラッチから探索するのではなく、ルール誘導された行動に基づいて修正行動を学ぶことができる。
我々は、OGR-MADDPG、MATD3、MAPPO、MASACを含む代表的な連続制御MARLバックボーンを用いてOGR-MARLをインスタンス化し、OGR-MADDPG、OGR-MATD3、OGR-MAPPO、OGR-MASACを得る。
抽象的なXiazhimen港-水路シナリオの実験では、OGR-MASACインスタンス化は75.0%の捕捉率、有望なミッション効率の規則順守、試験方法の最良の不均一な調整を達成している。
再学習なしに、QGIS/AISインフォームドXiazhimenマップへのゼロショット転送は、より複雑なポートシナリオにおけるOGR-MARLの一般化可能性を示す、有望な結果をもたらす。
関連論文リスト
- Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models [48.79781352398832]
我々は,相互強化学習(Multual Reinforcement Learning)を紹介した。
このフレームワークは、共有エクスペリエンス交換(SEE)、マルチワークリソース割り当て(MWRA)、およびTokenizer Heterogeneity Layer(THL)を組み合わせる。
GRPO上の3つの制御されたプローブをインスタンス化する: Peer Rollout Pooling (PRP)によるデータレベルのロールアウト共有、Cross-Policy GRPO Advantage Sharing (XGRPO)による価値レベルのアドバンテージ共有、Success-Gated Transfer (SGT)による結果レベルの成功転送。
論文 参考訳(メタデータ) (2026-05-08T05:01:40Z) - Reinforcement Learning-Guided NSGA-II Enhanced with Gray Relational Coefficient for Multi-Objective Optimization: Application to NASDAQ Portfolio Optimization [17.7619832764273]
グレーリレーショナル係数(GRC)を付加した新しい強化学習(RL)誘導非支配的ソート遺伝的アルゴリズム(NSGA-II)を提案する。
RL-NSGA-II-GRCはNSGA-IIよりも約5.8%,4.4%の収束性向上を実現している。
ポートフォリオアプリケーションでは、最大シャープ比ポートフォリオの識別をサポートするスムーズで密集した効率的なフロンティアを生成する。
論文 参考訳(メタデータ) (2026-04-12T11:58:43Z) - Multi-AUV Cooperative Target Tracking Based on Supervised Diffusion-Aided Multi-Agent Reinforcement Learning [19.584329065489893]
本稿では,グローバルトレーニングスケジューリング,マルチエージェント調整,ローカル意思決定,リアルタイム実行の4層からなる階層型MARLアーキテクチャを提案する。
1) 分離された経験プールによる非定常性軽減のための構造化経験リプレイによる二重決定アーキテクチャ,2) 拡散モデルの逆復調過程を誘導して収束を加速する高忠実度トレーニングサンプルを生成する教師付き学習機構,3) 行動クローン損失を組み込んだ外乱ロバストなポリシー学習により,高品質なリプレイ動作を導出し,不要なネットワーク更新を実現すること,の3つの革新を特徴とする。
論文 参考訳(メタデータ) (2026-03-31T08:32:32Z) - Fluid Antenna System-assisted Physical Layer Secret Key Generation [64.92952968689636]
本稿では,流体アンテナシステム(FAS)を動的無線環境に適用することにより,多元系基地局システムにおける物理層生成(PLKG)について検討する。
本研究では,送信ビームフォーミングとポート選択を統合したPLKGモデルを提案する。
本論文で導入したスライディングウィンドウベースポート選択法は,動的ポート選択により,より少ないチェーンで高いKGRを実現する。
論文 参考訳(メタデータ) (2025-09-19T03:01:29Z) - Inpainting-Guided Policy Optimization for Diffusion Large Language Models [67.97530437998117]
自己回帰型LLMの代替として,マスケッド拡散大言語モデル (dLLM) が登場している。
本稿では,dLLMに対するRLアルゴリズムの設計について検討する。
論文 参考訳(メタデータ) (2025-09-12T16:44:31Z) - CAMAR: Continuous Actions Multi-Agent Routing [46.55914539550802]
CAMARは,連続動作環境におけるマルチエージェントパスフィンディングのための新しいMARLベンチマークである。
CAMARはエージェント間の協調的および競争的な相互作用をサポートし、毎秒最大10万の環境ステップで効率的に動作する。
また,アルゴリズムの進捗をよりよく追跡し,より深い性能解析を可能にする3層評価プロトコルを提案する。
論文 参考訳(メタデータ) (2025-08-18T11:32:26Z) - CH-MARL: Constrained Hierarchical Multiagent Reinforcement Learning for Sustainable Maritime Logistics [0.0]
CH-MARLは階層的意思決定と動的制約執行と公正な報酬形成を統合している。
模擬海洋ロジスティクス環境で行った実験は、排出をかなり減少させることを示した。
CH-MARLは、マルチエージェント調整課題に対するスケーラブルで一般化可能なソリューションを提供する。
論文 参考訳(メタデータ) (2025-02-04T07:13:21Z) - Semantically Aligned Task Decomposition in Multi-Agent Reinforcement
Learning [56.26889258704261]
我々は,MARL(SAMA)における意味的アライズされたタスク分解という,新しい「不整合」意思決定手法を提案する。
SAMAは、潜在的な目標を示唆し、適切な目標分解とサブゴールアロケーションを提供するとともに、自己回帰に基づくリプランニングを提供する、チェーン・オブ・シントによる事前訓練された言語モデルを促進する。
SAMAは, 最先端のASG法と比較して, 試料効率に有意な優位性を示す。
論文 参考訳(メタデータ) (2023-05-18T10:37:54Z) - Major-Minor Mean Field Multi-Agent Reinforcement Learning [29.296206774925388]
マルチエージェント強化学習(MARL)は多くのエージェントに拡張することが困難である。
平均場制御(MFC)を用いた最近のMARLは、他の難易度の高いMARLに対するトラクタブルで厳密なアプローチを提供する。
我々は、MFCを多種多様な複雑なエージェントを同時にモデル化するように一般化する。
論文 参考訳(メタデータ) (2023-03-19T14:12:57Z) - Modular Deep Reinforcement Learning for Continuous Motion Planning with
Temporal Logic [59.94347858883343]
本稿では,マルコフ決定過程(MDP)をモデルとした自律動的システムの運動計画について検討する。
LDGBA と MDP の間に組込み製品 MDP (EP-MDP) を設計することである。
モデルフリー強化学習(RL)のためのLDGBAベースの報酬形成と割引スキームは、EP-MDP状態にのみ依存する。
論文 参考訳(メタデータ) (2021-02-24T01:11:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。