論文の概要: Physics-Aware End-to-End Deep Reinforcement Learning for Quadcopter Control with Actuator Dynamics
- arxiv url: http://arxiv.org/abs/2607.25985v1
- Date: Tue, 28 Jul 2026 17:05:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.94096
- Title: Physics-Aware End-to-End Deep Reinforcement Learning for Quadcopter Control with Actuator Dynamics
- Title(参考訳): アクチュエータダイナミクスを用いたクアッドコプタ制御のための物理学的エンド・ツー・エンド深部強化学習
- Abstract要約: 無人航空機(UAV)は、不安定な動特性のために自律制御に固有の課題を提示する。
本稿では,低レベルの身体入力に直接作用する物理認識・エンドツーエンドの深部強化学習(DRL)手法について検討する。
DDPG, TD3, PPO, SACの4つのDRLアルゴリズムを, (S1) 推力のみのホバーと (S2) ピッチトルクと翻訳目標の2段階で評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unmanned aerial vehicles (UAVs), particularly quadcopters, present unique challenges for autonomous control due to their underactuated dynamics: only four available control inputs must govern six degrees of freedom. This paper investigates a physics-aware, end-to-end deep reinforcement learning (DRL) approach that acts directly on low-level body inputs, total thrust and body torques $(T, τ_x, τ_y, τ_z)$, and closes the loop through a high-fidelity Simulink environment. Our simulator integrates a 12-state rigid-body model (MATLAB Level-2 S-Function) with (i) an Action2RPM allocation based on the Moore-Penrose pseudo-inverse of a coefficient matrix derived from thrust and drag terms, and (ii) first-order actuator dynamics for each motor (time constant $T_m = 0.076$ s), including rotor gyroscopic coupling. A shaped reward balances goal-reaching and stability using an exponential position well, attitude penalties, and quadratic velocity costs. Four DRL algorithms, DDPG, TD3, PPO, and SAC, are evaluated in two stages: (S1) thrust-only hover and (S2) hover with pitch torque and a translated goal. Results show that SAC and TD3 achieve superior stability and exploration efficiency, while PPO is less sample-efficient. The study highlights the significance of modeling actuator lags and aerodynamic moments for stable low-level control and provides a reproducible benchmark for quadcopter DRL.
- Abstract(参考訳): 無人航空機(UAV)、特にクワッドコプター(クワッドコプター)は、不動動により自律制御に固有の課題を提示している。
本稿では,低レベル体入力,全推力,体トルク$(T, τ_x, τ_y, τ_z)$に直接作用し,高忠実なシミュリンク環境を通じてループを閉じる物理認識型エンドツーエンド深部強化学習(DRL)手法について検討する。
シミュレータは12状態剛体モデル(MATLAB Level-2 S-Function)と統合する。
一 推力及び引力項から導出される係数行列のムーア・ペンローズ擬似逆数に基づくAction2RPM割当
(II)ロータジャイロカップリングを含む各モータの1次アクチュエータダイナミクス(時間定数$T_m = 0.076$s)
形状の報酬は、指数的位置の井戸、姿勢のペナルティ、二次速度のコストを用いて目標達成と安定性のバランスをとる。
DDPG, TD3, PPO, SACの4つのDRLアルゴリズムを, (S1) 推力のみのホバーと (S2) ピッチトルクと翻訳目標の2段階で評価した。
その結果, SACとTD3はより優れた安定性と探索効率を示し, PPOは試料効率が低いことがわかった。
この研究は、安定した低レベル制御のためのアクチュエータラグと空力モーメントをモデル化することの重要性を強調し、クワッドコプターDRLの再現可能なベンチマークを提供する。
関連論文リスト
- ZiMPedance: Impedance-Aware ZMP Modeling and Control for Payload Carrying with Quadruped Robots [4.183011762144409]
本稿では,ゼロモーメント点 (ZMP) の定式化を導出し, 剛性, 減衰, ペイロード質量を安定マージンに関連付けるパッシブ・ペイロード・インターフェース・ダイナミクスについて述べる。
シミュレーションにおいて、提案したコントローラは安定性違反を7.0%$から0.7%$に最大10倍減らし、水平地表面反応力の労力を名目ベースラインと比較して最大15%値下げすることで移動効率を向上させる。
論文 参考訳(メタデータ) (2026-06-17T10:00:19Z) - MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving [62.43744546817599]
視覚言語-アクション(VLA)モデルは、エンドツーエンドのモーションプランナーとして有効であるが、クローズドループ設定で評価すると不安定である。
本稿では, VLAモデルの潜在空間における動的駆動シナリオの, リアクティブでマルチエージェントなロールアウトのための新しいフレームワークMAPLEを提案する。
MAPLEはBench2Driveで最先端の駆動性能を実現し、堅牢なE2E自動運転システムのためのスケーラブルでクローズループなマルチエージェントプレイを実演する。
論文 参考訳(メタデータ) (2026-05-13T23:35:14Z) - Physics-Informed Reinforcement Learning of Spatial Density Velocity Potentials for Map-Free Racing [73.88859384645264]
Out-Of-Distribution (OOD) の様々なレーストラックへの一般化は、機械学習(ML)を用いて、エンドツーエンド制御のためのセンサデータと車両アクチュエーターの間の数学的関係を符号化する。
本稿では,非幾何学的,物理インフォームド報酬を用いた深度測定のスペクトル分布から非線形車両動特性をパラメータ化して,ニューラルネットワーク(ANN)による車両の時間最適・乗換レース制御を推定するDRL法を提案する。
このポリシーは、経験的なパセジカタイヤモデルに似たタイヤのダイナミックスで摩擦円を最大化することで、OODトラックの12%で人間のデモより優れています。
論文 参考訳(メタデータ) (2026-04-10T17:12:07Z) - Dynamic Control Allocation for Dual-Tilt UAV Platforms [0.6999740786886536]
本稿では,ヘキサロタUAVプラットフォームにおける動的制御アロケーションに着目した。
プラットフォームは二重タイルであり、飛行中に2軸に沿って各プロペラを独立に傾けることができる。
本稿では、トラッキングタスクに必要なレンチを生成する高レベルコントローラと、アクチュエータがそのようなレンチを生成することを保証する制御割り当て法とからなる階層型制御構造を提案する。
論文 参考訳(メタデータ) (2026-04-07T10:27:47Z) - Reinforcement Learning based 6-DoF Maneuvers for Microgravity Intravehicular Docking: A Simulation Study with Int-Ball2 in ISS-JEM [0.5046831208137847]
本研究は,JAXAのInt-Ball2ロボットを高忠実度アイザック・シムモデル(JEM)内にドッキングするための強化学習フレームワークを提案する。
PPO(Proximal Policy Optimization)を用いて、ドメインランダム化力学と有界観測雑音の下で制御器を訓練・評価する。
これにより、Int-Ball2の推進物理学が制約された微小重力内部でのRLベースのドッキング性能にどのように影響するかを制御できる。
論文 参考訳(メタデータ) (2025-12-15T16:42:48Z) - Sim2Swim: Zero-Shot Velocity Control for Agile AUV Maneuvering in 3 Minutes [2.6511518230332753]
ホロノミック・自律型水中車両(AUV)は、翻訳的および回転的自由度(DOF)の両方において、アジャイル操作のハードウェア能力を有する
本報告では, 訓練期間をわずか3分で行うことにより, 経路追従とアジャイル6DOF操作を可能にする, 汎用ゼロショット・シム2リアル深部強化学習(DRL)速度制御器について述べる。
論文 参考訳(メタデータ) (2025-12-09T14:42:26Z) - RobotDancing: Residual-Action Reinforcement Learning Enables Robust Long-Horizon Humanoid Motion Tracking [50.200035833530876]
RobotDancingはシンプルでスケーラブルなフレームワークで、残留する関節の目標を予測して、ダイナミックスの不一致を明示的に修正する。
複数分間の高エネルギー動作(ジャンプ、スピン、カートホイール)をトラッキングし、高いモーショントラッキング品質のハードウェアにゼロショットをデプロイする。
論文 参考訳(メタデータ) (2025-09-25T03:30:34Z) - Explainable AI-Enhanced Supervisory Control for Robust Multi-Agent Robotic Systems [0.0]
マルチエージェントロボットのためのAI強化型監視制御フレームワークを提案する。
我々は、このアプローチを、宇宙船形成飛行と自律水中車両の2つの対照的な領域で検証した。
論文 参考訳(メタデータ) (2025-09-18T23:59:13Z) - Learning a Single Near-hover Position Controller for Vastly Different
Quadcopters [56.37274861303324]
本稿では,クワッドコプターのための適応型ニアホバー位置制御器を提案する。
これは、非常に異なる質量、大きさ、運動定数を持つクワッドコプターに展開することができる。
また、実行中に未知の障害に迅速に適応する。
論文 参考訳(メタデータ) (2022-09-19T17:55:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。