論文の概要: High-Precision Formation Control for Heterogeneous Multi-Robot Systems via Hierarchical Hybrid Physics-Informed Deep Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.03512v1
- Date: Fri, 03 Jul 2026 17:38:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 12:38:29.735116
- Title: High-Precision Formation Control for Heterogeneous Multi-Robot Systems via Hierarchical Hybrid Physics-Informed Deep Reinforcement Learning
- Title(参考訳): 階層型ハイブリッド物理インフォームドディープ強化学習による異種多ロボットシステムの高精度形成制御
- Abstract要約: 本稿では,階層型ハイブリッド物理インフォームド深部強化学習(HHy-PIDRL)フレームワークを提案する。
異種多ロボットシステムのための高精度で応答性の高い生成制御を実現することを目的としている。
実験の結果, 上位階層の自律航法政策網とHM-DRLに基づく構成制御網の成功率は100%に達することがわかった。
- 参考スコア(独自算出の注目度): 10.865402396881416
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing classical control methods commonly require precise models and struggle to cope with model uncertainties and external disturbances, while end-to-end reinforcement learning (RL) approaches suffer from low sample efficiency and poor convergence. To overcome these challenges, this paper proposes a hierarchical hybrid physics-informed deep reinforcement learning (HHy-PIDRL) framework, aiming to realize high-precision, highly responsive formation control for heterogeneous multi-robot systems (HMRSs). The proposed framework contains two layers. Specifically, first, the upper layer designs an autonomous navigation policy network for Ackermann-steering leader based on the Soft Actor-Critic (SAC) deep reinforcement learning (DRL) algorithm. Second, the lower module integrates a high-fidelity physical feed-forward controller, a classical proportional-derivative (PD) controller, and an adaptive DRL residual controller to propose an effective hybrid model and DRL (HM-DRL)-based formation control policy network. Third, a unique hierarchical reward function is designed for training Omnidirectional followers, which effectively guides agents toward a refined, stable control policy. Experimental results demonstrate that, the success rate of both the upper-layer autonomous navigation policy network and the HM-DRL based formation control policy networks reach 100%. Meanwhile, ablation experiments are conducted to verify the validity and credibility of the proposed method.
- Abstract(参考訳): 既存の古典的制御手法では、モデルの不確実性や外乱に対処する上で、厳密なモデルと苦労が必要であり、一方、エンドツーエンド強化学習(RL)アプローチは、サンプル効率の低下と収束性の低下に悩まされている。
これらの課題を克服するために,HMRSの高精度かつ高応答な生成制御を実現することを目的とした階層型ハイブリッド物理インフォームドディープ強化学習(HHy-PIDRL)フレームワークを提案する。
提案するフレームワークには2つのレイヤがある。
具体的には、まず上層層がSoft Actor-Critic (SAC) Deep reinforcement Learning (DRL)アルゴリズムに基づいて、Ackermann-steering leaderのための自律ナビゲーションポリシーネットワークを設計する。
第二に、下段モジュールは、高忠実度物理フィードフォワードコントローラ、古典的比例デリバティブ(PD)コントローラ、適応型DRL残差コントローラを統合し、効果的なハイブリッドモデルとHM-DRLに基づく構成制御網を提案する。
第3に、一意の階層的な報酬関数は、エージェントを洗練された安定した制御ポリシーへ誘導する全方向のフォロワーを訓練するために設計されている。
実験の結果, 上位階層の自律航法政策網とHM-DRLに基づく構成制御網の成功率は100%に達することがわかった。
一方,提案手法の有効性と信頼性を検証するためにアブレーション実験を行った。
関連論文リスト
- Deep Reinforcement Learning for Spacecraft Attitude Control During Atmospheric Re-Entry [37.22137915015052]
宇宙船再突入時の姿勢制御のための強化学習について検討する。
RLフレームワークのアプリケーションを形式化し、継続的で非政治的なRLを適用します。
ハイブリッドコントローラは攻撃角をよりよく追跡でき、質量、慣性テンソル、フラップアクチュエータの帯域幅の変動により頑健であることを示す。
論文 参考訳(メタデータ) (2026-06-30T08:06:07Z) - Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning [88.42566960813438]
CalibRLは、制御可能な探索と専門家のガイダンスをサポートするハイブリッド政治RLVRフレームワークである。
CalibRLは政策エントロピーを誘導的に増加させ、目標分布を明らかにする。
ドメイン内設定とドメイン外設定の両方を含む8つのベンチマークの実験は、一貫した改善を示している。
論文 参考訳(メタデータ) (2026-02-22T07:23:36Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Model-based controller assisted domain randomization in deep reinforcement learning: application to nonlinear powertrain control [0.0]
本研究では, 深部強化学習(DRL)の枠組みを用いた新しいロバスト制御手法を提案する。
問題設定は、不確実性と非線形性を考慮した制御系に対して、バニラMDPの集合である潜在マルコフ決定プロセス(LMDP)を介してモデル化される。
従来のDRLベースの制御と比較して、提案するコントローラ設計はより賢く、高度な一般化能力を実現することができる。
論文 参考訳(メタデータ) (2025-04-28T12:09:07Z) - Modelling, Positioning, and Deep Reinforcement Learning Path Tracking
Control of Scaled Robotic Vehicles: Design and Experimental Validation [3.807917169053206]
スケールされたロボットカーは通常、車両の状態の推定と制御に特化したタスクを含む階層的な制御機構を備えている。
本稿では, (i) フェデレートされた拡張カルマンフィルタ (FEKF) と (ii) エキスパートデモレータを用いて訓練された新しい深部強化学習 (DRL) パストラッキングコントローラを提案する。
実験により検証されたモデルは、(i)FEKFの設計を支援するために使用され、(ii)DRLに基づく経路追跡アルゴリズムをトレーニングするためのデジタルツインとして機能する。
論文 参考訳(メタデータ) (2024-01-10T14:40:53Z) - SALMON: Self-Alignment with Instructable Reward Models [80.83323636730341]
本稿では,基本言語モデルと人間の監督を最小限に整合させる新しいアプローチ,すなわちSALMONを提案する。
私たちはDromedary-2という名のAIアシスタントを開発しており、コンテキスト内学習には6つの例と31の人間定義原則しかありません。
論文 参考訳(メタデータ) (2023-10-09T17:56:53Z) - Direct Preference Optimization: Your Language Model is Secretly a Reward Model [119.65409513119963]
本稿では,RLHFにおける報酬モデルの新たなパラメータ化について紹介する。
DPO(Direct Preference Optimization)と呼ばれる結果のアルゴリズムは、安定的で、性能が高く、計算的にも軽量である。
我々の実験は、DPOが人間の好みに合わせて微調整できるだけでなく、既存の方法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-05-29T17:57:46Z) - Demonstration-guided Deep Reinforcement Learning for Coordinated Ramp
Metering and Perimeter Control in Large Scale Networks [12.296779112932741]
本研究では,高速道路のランプ計測と同質都市道路の周方向制御の2つの代表的な制御手法について考察する。
本稿では,新しいメソマクロ動的ネットワークモデルを提案し,初めてデモ誘導DRL法を開発した。
研究結果は,大規模ネットワークにおける協調制御のための従来のコントローラとDRLを組み合わせる大きな可能性を明らかにしている。
論文 参考訳(メタデータ) (2023-03-04T11:49:49Z) - Reinforcement Learning from Demonstrations by Novel Interactive Expert
and Application to Automatic Berthing Control Systems for Unmanned Surface
Vessel [12.453219390225428]
RLfD(Reinforcement Learning from Demonstration)の2つの新しい実践的手法を開発し,無人表面容器の自動バーシング制御システムに適用した。
The new expert data generation method, called Model Predictive Based Expert (MPBE) was developed to provide high quality supervision data for RLfD algorithm。
また,MP-DDPGに基づく新たなRLfDアルゴリズムであるSelf-Guided Actor-Critic (SGAC)が存在する。
論文 参考訳(メタデータ) (2022-02-23T06:45:59Z) - Combining Pessimism with Optimism for Robust and Efficient Model-Based
Deep Reinforcement Learning [56.17667147101263]
実世界のタスクでは、強化学習エージェントはトレーニング中に存在しない状況に遭遇する。
信頼性を確保するため、RLエージェントは最悪の状況に対して堅牢性を示す必要がある。
本稿では,Robust Hallucinated Upper-Confidence RL (RH-UCRL)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-03-18T16:50:17Z) - Information Theoretic Model Predictive Q-Learning [64.74041985237105]
本稿では,情報理論的MPCとエントロピー正規化RLとの新たな理論的関連性を示す。
バイアスモデルを利用したQ-ラーニングアルゴリズムを開発した。
論文 参考訳(メタデータ) (2019-12-31T00:29:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。