論文の概要: A Unified Dynamics Framework for Reinforcement Learning and Classical Control of a Six-DOF Pipeline-Tracking ROV in NVIDIA Isaac Sim
- arxiv url: http://arxiv.org/abs/2610.04949v1
- Date: Sun, 04 Oct 2026 04:45:05 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:30:57.445174
- Title: A Unified Dynamics Framework for Reinforcement Learning and Classical Control of a Six-DOF Pipeline-Tracking ROV in NVIDIA Isaac Sim
- Title(参考訳): NVIDIA Isaac Simにおける6自由度パイプライン追従型ROVの強化学習と古典制御のための統一ダイナミクスフレームワーク
- Abstract要約: 本稿では6自由度遠隔操作車(ROV)のためのパイプライン追跡アーキテクチャを提案する。
1つのUniversal Scene Description (USD) シーンは、実際のBlueROV2-Heavy質量、付加質量、減衰、浮力、推力パラメータをシステムの両半分に供給する。
5つの強化学習アルゴリズム、PPO、ソフトアクター・クリティック、TD3、DDPG、TRPOは、1つの環境、報酬、ランダム化評価ハーネスに対して訓練される。
- 参考スコア(独自算出の注目度): 4.021733299734901
- License:
- Abstract: Reinforcement learning controllers for underwater vehicles are usually trained against one physics representation and deployed against another, so reported performance does not always describe behavior outside training. This paper presents a pipeline-tracking architecture for a six-degree-of-freedom remotely operated vehicle (ROV) in which one Universal Scene Description (USD) scene supplies the real BlueROV2-Heavy mass, added-mass, damping, buoyancy, and thruster parameters to both halves of the system: a vectorized NumPy implementation of Fossen's marine-craft equations, and an interactive NVIDIA Isaac Sim deployment applying the identical equations as PhysX forces at every step. The Coriolis-centripetal term is the primary dynamics model in both branches; a controlled ablation on PPO and TRPO shows that including it does not destabilize either algorithm and modestly improves tracking, about 19 percent lower standoff RMS error for TRPO. Five reinforcement learning algorithms, PPO, soft actor-critic, TD3, DDPG, and TRPO, are trained against one environment, reward, and randomized evaluation harness through a checkpoint-compatibility layer scoring any policy with the same code. The pipeline is extended with six classical baselines, PID, sliding-mode, fuzzy logic, feedback linearization, model predictive control, and an adaptive neuro-fuzzy inference system, driven by the same guidance geometry and thruster allocation as the learned policies. Under Coriolis-enabled dynamics, PPO, TRPO, and feedback linearization reach the strongest combination of 100 percent success and competitive accuracy; PID, fuzzy control, and the neuro-fuzzy baseline also reach 100 percent success with looser tracking; DDPG and TD3 each show a specific, explainable failure mode rather than a general weakness of off-policy learning; and classical control remains a strong baseline against the best learned policies.
- Abstract(参考訳): 水中車両の強化学習コントローラは通常、ある物理表現に対して訓練され、別の物理表現に対して展開される。
本稿では,6自由度遠隔操作車(ROV)のパイプライン追跡アーキテクチャについて述べる。1つのユニバーサルシーン記述(USD)シーンは,実際のBlueROV2-Heavy質量,付加質量,減衰,浮力,スラスタパラメータをシステムの両側に供給する。
Coriolis-centripetal 項は両方の分岐の一次力学モデルであり、PPO と TRPO の制御されたアブレーションは、アルゴリズムを不安定にせず、追跡を緩やかに改善しないが、TRPO のスタンドオフ RMS 誤差は約19%低い。
5つの強化学習アルゴリズム、PPO、ソフトアクタークリティカル、TD3、DDPG、TRPOは、同一コードで任意のポリシーをスコアリングするチェックポイント互換層を通じて、一つの環境、報酬、ランダム化評価ハーネスに対して訓練される。
パイプラインは6つの古典的ベースライン、PID、スライディングモード、ファジィ論理、フィードバック線形化、モデル予測制御、適応型ニューロファジィ推論システムで拡張され、学習ポリシーと同じガイダンス幾何とスラスタアロケーションによって駆動される。
Coriolisによるダイナミックスの下では、PPO、TRPO、フィードバック線形化は100%の成功と競争精度で最強の組み合わせに達し、PID、ファジィコントロール、神経ファジィベースラインは、より緩やかなトラッキングで100%成功し、DDPGとTD3はそれぞれ、政治外の学習の一般的な弱点ではなく、特定の説明可能な障害モードを示している。
関連論文リスト
- High-Precision Formation Control for Heterogeneous Multi-Robot Systems via Hierarchical Hybrid Physics-Informed Deep Reinforcement Learning [10.865402396881416]
本稿では,階層型ハイブリッド物理インフォームド深部強化学習(HHy-PIDRL)フレームワークを提案する。
異種多ロボットシステムのための高精度で応答性の高い生成制御を実現することを目的としている。
実験の結果, 上位階層の自律航法政策網とHM-DRLに基づく構成制御網の成功率は100%に達することがわかった。
論文 参考訳(メタデータ) (2026-07-03T17:38:17Z) - Reinforcement Learning with Inner-loop Dynamics Estimator for Aerial Manipulation under Uncertainty [0.560928143828791]
本稿では,Reinforcement Learning (RL) と内部ループ力学推定器を組み合わせた階層型制御フレームワークを提案する。
本研究では, 各種ペイロード条件下でのハードウェア実験により, 3DoFマニピュレータを備えたカスタム四極子に対する提案手法の有効性を検証した。
論文 参考訳(メタデータ) (2026-06-15T12:16:01Z) - Benchmarking Empirical and Learning-Based Approaches for Feedforward Steering Control in Autonomous Racing [2.183305325115666]
フィードフォワードステアリング制御は、自律走行のための階層型制御アーキテクチャの重要な構成要素である。
本稿では,2つの学習ベースと2つの経験的フィードフォワードコントローラのベンチマークを示す。
実世界Abu Dhabi Autonomous Racing Leagueコンペティションに基づく高忠実度シミュレーションフレームワークでフィードフォワードコントローラをテストする。
論文 参考訳(メタデータ) (2026-05-20T12:44:36Z) - Simple but Stable, Fast and Safe: Achieve End-to-end Control by High-Fidelity Differentiable Simulation [14.322775509774246]
障害物回避(Obstacle avoidance)は、四重項が高度なアプリケーションを実行できるようにするための基本的な視覚ベースのタスクである。
本稿では,深度画像を直接低レベルのボディレートコマンドにマッピングする新しいエンドツーエンドポリシーを提案する。
その結果,提案手法は,最先端のベースラインの中で,最も成功率が高く,かつ最低であることがわかった。
論文 参考訳(メタデータ) (2026-04-12T09:38:00Z) - Physics-Informed Reinforcement Learning of Spatial Density Velocity Potentials for Map-Free Racing [73.88859384645264]
Out-Of-Distribution (OOD) の様々なレーストラックへの一般化は、機械学習(ML)を用いて、エンドツーエンド制御のためのセンサデータと車両アクチュエーターの間の数学的関係を符号化する。
本稿では,非幾何学的,物理インフォームド報酬を用いた深度測定のスペクトル分布から非線形車両動特性をパラメータ化して,ニューラルネットワーク(ANN)による車両の時間最適・乗換レース制御を推定するDRL法を提案する。
このポリシーは、経験的なパセジカタイヤモデルに似たタイヤのダイナミックスで摩擦円を最大化することで、OODトラックの12%で人間のデモより優れています。
論文 参考訳(メタデータ) (2026-04-10T17:12:07Z) - DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training [94.568675548967]
実環境における訓練強化学習(RL)システムは、ノイズの多い監視とドメイン外の一般化が不十分なため、依然として困難である。
近年の分布RL法は、複数の量子点を持つ値をモデル化することでロバスト性を向上させるが、スカラーとして各量子点を独立に学習する。
DFPOは、時間ステップをまたいだ連続フローとして値をモデル化する、ロバストな分散RLフレームワークである。
論文 参考訳(メタデータ) (2026-02-05T17:07:42Z) - Plug-and-Play Benchmarking of Reinforcement Learning Algorithms for Large-Scale Flow Control [61.155940786140455]
強化学習(RL)は,アクティブフロー制御(AFC)において有望な結果を示した。
現在のAFCベンチマークは、外部計算流体力学(CFD)の解法に依存しており、完全には微分不可能であり、3Dとマルチエージェントのサポートが限られている。
AFCにおけるRLのための最初のスタンドアロンで完全に差別化可能なベンチマークスイートであるFluidGymを紹介する。
論文 参考訳(メタデータ) (2026-01-21T14:13:44Z) - Autonomous Vehicle Controllers From End-to-End Differentiable Simulation [57.278726604424556]
そこで我々は,AVコントローラのトレーニングにAPG(analytic Policy gradients)アプローチを適用可能なシミュレータを提案し,その設計を行う。
提案するフレームワークは, エージェントがより根底的なポリシーを学ぶのを助けるために, 環境力学の勾配を役立てる, エンド・ツー・エンドの訓練ループに, 微分可能シミュレータを組み込む。
ダイナミクスにおけるパフォーマンスとノイズに対する堅牢性の大幅な改善と、全体としてより直感的なヒューマンライクな処理が見られます。
論文 参考訳(メタデータ) (2024-09-12T11:50:06Z) - Physics-Inspired Temporal Learning of Quadrotor Dynamics for Accurate
Model Predictive Trajectory Tracking [76.27433308688592]
クオーロタのシステムダイナミクスを正確にモデル化することは、アジャイル、安全、安定したナビゲーションを保証する上で非常に重要です。
本稿では,ロボットの経験から,四重項系の力学を純粋に学習するための新しい物理インスパイアされた時間畳み込みネットワーク(PI-TCN)を提案する。
提案手法は,スパース時間的畳み込みと高密度フィードフォワード接続の表現力を組み合わせて,正確なシステム予測を行う。
論文 参考訳(メタデータ) (2022-06-07T13:51:35Z) - Collision-Free Flocking with a Dynamic Squad of Fixed-Wing UAVs Using
Deep Reinforcement Learning [2.555094847583209]
深層強化学習(DRL)による分散型リーダ・フォロワリング制御問題に対処する。
我々は,すべてのフォロワーに対して共有制御ポリシーを学習するための新しい強化学習アルゴリズムCACER-IIを提案する。
その結果、可変長系状態を固定長埋め込みベクトルに符号化することができ、学習されたDRLポリシーをフォロワーの数や順序と独立にすることができる。
論文 参考訳(メタデータ) (2021-01-20T11:23:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。