論文の概要: SMaRT-Tug: Structured Multi-Agent Reinforcement Learning for Physics-Based Tugboat-Barge Collaborative Manipulation
- arxiv url: http://arxiv.org/abs/2609.07445v1
- Date: Mon, 07 Sep 2026 12:51:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 00:19:03.947877
- Title: SMaRT-Tug: Structured Multi-Agent Reinforcement Learning for Physics-Based Tugboat-Barge Collaborative Manipulation
- Title(参考訳): SMaRT-Tug:物理に基づくTugboat-Barge協調操作のための構造化多エージェント強化学習
- Abstract要約: 我々は、協調タグボート操作のための物理ベースのGPU加速シミュレーションおよび学習フレームワークを提案する。
シミュレータには、カスタマイズされた浮力モデル、波動モデリング、流体抵抗が組み込まれている。
我々の分散化フレームワークは、PIDベースのコントローラや集中型PPOベースラインに比べて信頼性が高く、正確な操作性能が得られることを示す。
- 参考スコア(独自算出の注目度): 17.246222390988617
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous tugboating is central for automating maritime operations such as port logistics and vessel maneuvering, where multiple tugboats must cooperatively transport/manipulate a larger vessel. Collaborative pushing in this setting is challenging due to coupled hydrodynamics, low resistance, strong environmental disturbances, underactuated barge dynamics, and contact-rich interactions. Conventional control methods often rely on simplified models and fixed configurations, which limit their adaptability, while learning-based approaches are constrained by the lack of scalable and physically realistic training environments. We address these challenges by introducing a physics-based, GPU-accelerated simulation and learning framework for collaborative tugboat manipulation. Our simulator incorporates a customized buoyancy model, wave modeling, and hydrodynamic resistance, and supports large-scale multi-agent training under marine dynamics. In this simulator, we train a decentralized MAPPO (Multi-Agent PPO) policy augmented with a structured control prior (SCP) to improve training stability and maintain feasible pushing configurations. We evaluate our learned policy on straight-line transit, turning, and deceleration tasks, where we show that our decentralized framework yields more reliable and accurate maneuvering performance compared to a PID-based controller and a centralized PPO baseline. We further demonstrate zero-shot generalization to more challenging sea states and advanced maneuvers, as well as zero-shot scalability to larger teams of three and four tugboats despite training with only two agents.
- Abstract(参考訳): 自動タグボートは、複数のタグボートが協力して大型船を輸送・操作する必要がある港の物流や船舶の操縦などの海事作業を自動化するための中心である。
この環境での協調的なプッシュは、結合した流体力学、低抵抗、強い環境障害、不活性化されたバージ力学、および接触豊富な相互作用によって困難である。
従来の制御手法は、単純化されたモデルと固定された構成に依存し、適応性を制限し、学習ベースのアプローチは、スケーラブルで物理的に現実的なトレーニング環境の欠如によって制約される。
物理ベースのGPU加速シミュレーションと,協調タグボート操作のための学習フレームワークを導入することで,これらの課題に対処する。
シミュレータには, カスタマイズされた浮力モデル, 波動モデリング, 流体抵抗が組み込まれ, 大規模マルチエージェント訓練を海洋力学下で支援している。
本シミュレータでは、分散MAPPO(Multi-Agent PPO)ポリシーをSCP(Structured Control Prior)で強化し、トレーニング安定性を改善し、実行可能なプッシュ構成を維持する。
そこでは,PIDベースのコントローラや集中型PPOベースラインに比べて,分散化フレームワークの方が信頼性が高く,正確な操作性能が得られることを示す。
さらに、より難易度の高い海の状態へのゼロショットの一般化と高度な操作、そして2つのエージェントで訓練したにもかかわらず、3と4つのタグボートからなる大規模チームへのゼロショットのスケーラビリティを実証する。
関連論文リスト
- Learning Reactive Dexterous Grasping via Hierarchical Task-Space RL Planning and Joint-Space QP Control [50.28263951510334]
本稿では,リアクティブなデクスタリーグルーピングのためのハイブリッド階層型制御フレームワークを提案する。
提案手法は,低レベル共同実行から高レベル空間意図を明示的に分離する。
我々は厳密なシミュレーションと現実のパイプラインを通して提案したフレームワークを広範囲に検証する。
論文 参考訳(メタデータ) (2026-05-05T04:49:38Z) - Onboard MuJoCo-based Model Predictive Control for Shipboard Crane with Double-Pendulum Sway Suppression [7.645323708488569]
海上での重荷の移動は、危険なペイロードのスウェイによって制限された効率的なクレーンの運用に依存している。
既存の制御方法はそのような設定で苦労し、しばしば単純化された分析モデルに依存している。
MuJoCo MPCフレームワークを中心とした,完全なリアルタイム制御パイプラインを示す。
論文 参考訳(メタデータ) (2026-03-17T11:43:52Z) - Sim-to-reality adaptation for Deep Reinforcement Learning applied to an underwater docking application [0.0]
Deep Reinforcement Learning (DRL)は、自律的な水中ドッキングのための従来の制御方法に代わる堅牢な代替手段を提供する。
本稿では,高忠実なディジタル双生児環境を活用することで,ジローナ自律水中車両(AUV)を用いた自律ドッキングの体系的アプローチを提案する。
論文 参考訳(メタデータ) (2026-03-12T15:01:25Z) - ACLM: ADMM-Based Distributed Model Predictive Control for Collaborative Loco-Manipulation [9.708461585583791]
重荷のロコ操作による共同輸送は、脚のあるロボットにとって難しいが必須の能力である。
本研究は,ロコマニピュレーションのための分散モデル予測制御フレームワークであるマルチプライアの交互方向法を提案する。
論文 参考訳(メタデータ) (2026-03-07T08:06:51Z) - Sim2Swim: Zero-Shot Velocity Control for Agile AUV Maneuvering in 3 Minutes [2.6511518230332753]
ホロノミック・自律型水中車両(AUV)は、翻訳的および回転的自由度(DOF)の両方において、アジャイル操作のハードウェア能力を有する
本報告では, 訓練期間をわずか3分で行うことにより, 経路追従とアジャイル6DOF操作を可能にする, 汎用ゼロショット・シム2リアル深部強化学習(DRL)速度制御器について述べる。
論文 参考訳(メタデータ) (2025-12-09T14:42:26Z) - From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning [59.88543114325153]
本稿では,航法基礎モデルの強化学習能力を高めるためのSeeing-to-Experiencingフレームワークを提案する。
S2Eは、ビデオの事前トレーニングとRLによるポストトレーニングの長所を組み合わせたものだ。
実世界のシーンを3DGSで再現した3D画像に基づく総合的なエンドツーエンド評価ベンチマークであるNavBench-GSを構築した。
論文 参考訳(メタデータ) (2025-07-29T17:26:10Z) - AI-Enhanced Automatic Design of Efficient Underwater Gliders [60.45821679800442]
自動設計フレームワークの構築は、グライダー形状を表現する複雑さと、複雑な固体-流体相互作用をモデル化する際の計算コストが高いため、困難である。
非自明な船体形状の水中ロボットを作れるようにすることで、これらの制限を克服するAI強化型自動計算フレームワークを導入する。
提案手法は, 形状と制御信号の両面を協調的に最適化するアルゴリズムで, 低次幾何表現と微分可能なニューラルネット型流体代理モデルを用いる。
論文 参考訳(メタデータ) (2025-04-30T23:55:44Z) - Evaluating Robustness of Reinforcement Learning Algorithms for Autonomous Shipping [2.9109581496560044]
本稿では,自律型海運シミュレータにおける内陸水路輸送(IWT)のために実装されたベンチマークディープ強化学習(RL)アルゴリズムのロバスト性について検討する。
モデルのないアプローチはシミュレーターで適切なポリシーを達成でき、訓練中に遭遇したことのないポート環境をナビゲートすることに成功した。
論文 参考訳(メタデータ) (2024-11-07T17:55:07Z) - Aquatic Navigation: A Challenging Benchmark for Deep Reinforcement Learning [53.3760591018817]
ゲームエンジンとDeep Reinforcement Learningの統合の最近の進歩を利用して,水上ナビゲーションのための新しいベンチマーク環境を提案する。
具体的には、最も広く受け入れられているアルゴリズムの一つであるPPOに着目し、先進的なトレーニング手法を提案する。
実験により,これらの成分をうまく組み合わせることで,有望な結果が得られることが示された。
論文 参考訳(メタデータ) (2024-05-30T23:20:23Z) - Skip Training for Multi-Agent Reinforcement Learning Controller for
Industrial Wave Energy Converters [94.84709449845352]
近年のウェーブ・エナジー・コンバータ(WEC)は、発電を最大化するために複数の脚と発電機を備えている。
従来のコントローラは複雑な波のパターンを捕捉する制限を示しており、コントローラはエネルギー捕獲を効率的に最大化する必要がある。
本稿では,従来のスプリングダンパよりも優れたマルチエージェント強化学習コントローラ(MARL)を提案する。
論文 参考訳(メタデータ) (2022-09-13T00:20:31Z) - UPDeT: Universal Multi-agent Reinforcement Learning via Policy
Decoupling with Transformers [108.92194081987967]
タスクに適合する1つのアーキテクチャを設計し、汎用的なマルチエージェント強化学習パイプラインを最初に試行する。
従来のRNNモデルとは異なり、トランスフォーマーモデルを用いてフレキシブルなポリシーを生成する。
提案方式はUPDeT(Universal Policy Decoupling Transformer)と名付けられ,動作制限を緩和し,マルチエージェントタスクの決定プロセスをより説明しやすいものにする。
論文 参考訳(メタデータ) (2021-01-20T07:24:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。