論文の概要: CORAL-AUV: CFD Oriented Reinforcement Learning for Autonomous Underwater Vehicles
- arxiv url: http://arxiv.org/abs/2607.09557v1
- Date: Fri, 10 Jul 2026 16:02:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.456336
- Title: CORAL-AUV: CFD Oriented Reinforcement Learning for Autonomous Underwater Vehicles
- Title(参考訳): Coral-AUV:自律型水中車両のためのCFD指向強化学習
- Authors: Steven Roche, Milo Van Mooy, Nathan McGuire, Levi Cai, Jonathan P. How, Yogesh Girdhar,
- Abstract要約: 自律型水中車両(AUV)の微粒化制御と位置決めは、サンプリング、メンテナンス、および調査用途において重要である。
AUVの従来の制御方法は労働集約的であり、車両の構成や環境条件の変化に対して堅牢ではない。
我々は、CFDデータに基づいて訓練された代理ドラッグモデル(SDM)上でポリシートレーニングを行う6-DOF AUV上で、ゼロショットRLポリシーを成功させた最初の人物である。
- 参考スコア(独自算出の注目度): 14.192376456398456
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fine grain control and positioning of autonomous underwater vehicles (AUVs) is critical for sampling, maintenance, and survey applications. Traditional control methods for AUVs are labor intensive and are not robust to changes in the vehicle configuration or environmental conditions. Reinforcement learning (RL) promises rapid controller development while handling a range of deployment parameters via domain randomization (DR). However, DR is still limited by the capacity of the underlying simulation to model real physics. In particular, drag physics are difficult to model and are a large contributor to sim-to-real gaps. Meanwhile, computational fluid dynamics (CFD) provides high fidelity drag models but is challenging to leverage within reinforcement learning frameworks due to its computational overhead. Thus, in this paper we exploit the idea of training surrogate approximations of CFD models of a given vehicle, enabling fast inference within RL pipelines. We are the first to successfully deploy a zero-shot RL policy on a 6-DOF AUV in which policy training is performed on surrogate drag models (SDMs) trained on CFD data. We find 31% lower energy usage compared to a controller using simplified physics while traversing between waypoints 11% faster with 19% less error. Our SDM based RL controller better predicts zero-shot transfer and is more robust across reward shaping design choices. When using DR to complete a task with perturbed parameters, we find that the CFD policy is the only controller that successfully transfers. The policies are evaluated in a controlled tank environment and in the field providing extensive testing of the policies' capabilities.
- Abstract(参考訳): 自律型水中車両(AUV)の微粒化制御と位置決めは、サンプリング、メンテナンス、および調査用途において重要である。
AUVの従来の制御方法は労働集約的であり、車両の構成や環境条件の変化に対して堅牢ではない。
強化学習(Reinforcement Learning, RL)は、ドメインランダム化(Domain randomization, DR)を通じて、さまざまなデプロイメントパラメータを処理しながら、迅速なコントローラ開発を実現する。
しかし、DRは実際の物理をモデル化する基礎となるシミュレーションの能力によって依然として制限されている。
特に、ドラッグ物理はモデル化が困難であり、シミュレートと現実のギャップに大きく貢献する。
一方、計算流体力学(CFD)は高忠実度ドラッグモデルを提供するが、計算オーバーヘッドのため強化学習フレームワーク内での活用は困難である。
そこで本論文では,所定の車両のCFDモデルのサロゲート近似をトレーニングすることで,RLパイプライン内での高速な推論を可能にする。
我々は、CFDデータに基づいて訓練された代理ドラッグモデル(SDM)上でポリシートレーニングを行う6-DOF AUV上で、ゼロショットRLポリシーを最初に展開する。
物理を単純化したコントローラに比べて31%のエネルギー使用量で、ウェイポイント間を11%高速化し、エラーを19%低減した。
我々のSDMベースのRLコントローラは、ゼロショット転送をより良く予測し、デザイン選択の報奨によってより堅牢である。
DRを用いて摂動パラメータでタスクを完了すると、CFDポリシーが唯一、転送に成功しているコントローラであることが分かる。
政策は、制御されたタンク環境と、政策の能力の広範なテストを提供する分野において評価される。
関連論文リスト
- Sim-to-reality adaptation for Deep Reinforcement Learning applied to an underwater docking application [0.0]
Deep Reinforcement Learning (DRL)は、自律的な水中ドッキングのための従来の制御方法に代わる堅牢な代替手段を提供する。
本稿では,高忠実なディジタル双生児環境を活用することで,ジローナ自律水中車両(AUV)を用いた自律ドッキングの体系的アプローチを提案する。
論文 参考訳(メタデータ) (2026-03-12T15:01:25Z) - Fast Policy Learning for 6-DOF Position Control of Underwater Vehicles [1.4883782513177095]
強化学習(Reinforcement Learning, RL)は強力な代替手段を提供するが、訓練は通常は遅く、シミュレートから現実への移行は難しいままである。
JAX と MuJoCo-XLA (MJX) で構築された GPU アクセラレーションによる RL トレーニングパイプラインを導入する。
大規模並列物理シミュレーションと学習更新を共同でJITコンパイルすることにより,2分以内のトレーニング時間を達成できる。
論文 参考訳(メタデータ) (2025-12-15T14:12:32Z) - Sim2Swim: Zero-Shot Velocity Control for Agile AUV Maneuvering in 3 Minutes [2.6511518230332753]
ホロノミック・自律型水中車両(AUV)は、翻訳的および回転的自由度(DOF)の両方において、アジャイル操作のハードウェア能力を有する
本報告では, 訓練期間をわずか3分で行うことにより, 経路追従とアジャイル6DOF操作を可能にする, 汎用ゼロショット・シム2リアル深部強化学習(DRL)速度制御器について述べる。
論文 参考訳(メタデータ) (2025-12-09T14:42:26Z) - Physics-informed Neural-operator Predictive Control for Drag Reduction in Turbulent Flows [109.99020160824553]
乱流のモデリングと制御のための効率的な深部強化学習フレームワークを提案する。
予測制御(PC)のためのモデルベースRLであり、乱流制御のためのポリシとオブザーバモデルの両方を共同で学習する。
その結果, PINO-PCは, バルク速度レイノルズ数15,000で39.0%の抗力低下を達成し, 従来の流体制御法を32%以上上回った。
論文 参考訳(メタデータ) (2025-10-03T00:18:26Z) - Large Language Model-Empowered Decision Transformer for UAV-Enabled Data Collection [71.84636717632206]
空間分散デバイスからの信頼性とエネルギー効率のよいデータ収集のための無人航空機(UAV)は、IoT(Internet of Things)アプリケーションをサポートする上で大きな可能性を秘めている。
有効なUAV制御ポリシーを学習するための共同言語モデル(LLM)を提案する。
LLM-CRDTは、現在の最先端DTアプローチよりも最大36.7%高いエネルギー効率を達成し、オンラインおよびオフラインメソッドのベンチマークより優れている。
論文 参考訳(メタデータ) (2025-09-17T13:05:08Z) - Physics Enhanced Residual Policy Learning (PERPL) for safety cruising in mixed traffic platooning under actuator and communication delay [8.172286651098027]
線形制御モデルは、その単純さ、使いやすさ、安定性解析のサポートにより、車両制御に広範囲に応用されている。
一方、強化学習(RL)モデルは適応性を提供するが、解釈可能性や一般化能力の欠如に悩まされる。
本稿では,物理インフォームドポリシによって強化されたRL制御系の開発を目標とする。
論文 参考訳(メタデータ) (2024-09-23T23:02:34Z) - Autonomous Vehicle Controllers From End-to-End Differentiable Simulation [57.278726604424556]
そこで我々は,AVコントローラのトレーニングにAPG(analytic Policy gradients)アプローチを適用可能なシミュレータを提案し,その設計を行う。
提案するフレームワークは, エージェントがより根底的なポリシーを学ぶのを助けるために, 環境力学の勾配を役立てる, エンド・ツー・エンドの訓練ループに, 微分可能シミュレータを組み込む。
ダイナミクスにおけるパフォーマンスとノイズに対する堅牢性の大幅な改善と、全体としてより直感的なヒューマンライクな処理が見られます。
論文 参考訳(メタデータ) (2024-09-12T11:50:06Z) - Sim-to-Real Transfer of Adaptive Control Parameters for AUV
Stabilization under Current Disturbance [1.099532646524593]
本稿では,最大エントロピー深層強化学習フレームワークを古典的なモデルベース制御アーキテクチャと組み合わせ,適応制御系を定式化する新しい手法を提案する。
本フレームワークでは,バイオインスパイアされた体験再生機構,拡張されたドメインランダム化手法,物理プラットフォーム上で実行される評価プロトコルなどを含むSim-to-Real転送戦略を導入する。
実験により,AUVの準最適モデルから有能なポリシを効果的に学習し,実車への移動時の制御性能を3倍に向上することを示した。
論文 参考訳(メタデータ) (2023-10-17T08:46:56Z) - Guided Constrained Policy Optimization for Dynamic Quadrupedal Robot
Locomotion [78.46388769788405]
我々は,制約付きポリシー最適化(CPPO)の実装に基づくRLフレームワークであるGCPOを紹介する。
誘導制約付きRLは所望の最適値に近い高速収束を実現し,正確な報酬関数チューニングを必要とせず,最適かつ物理的に実現可能なロボット制御動作を実現することを示す。
論文 参考訳(メタデータ) (2020-02-22T10:15:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。