論文の概要: Physics-enhanced reinforcement learning for real-time optimal control of dynamical systems
- arxiv url: http://arxiv.org/abs/2607.16177v1
- Date: Fri, 17 Jul 2026 17:56:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.928069
- Title: Physics-enhanced reinforcement learning for real-time optimal control of dynamical systems
- Title(参考訳): 動的システムのリアルタイム最適制御のための物理強化学習
- Abstract要約: 強化学習 (Reinforcement Learning, RL) は非線形および複雑な力学系のフィードバック制御戦略として期待されている。
本研究では、新しい物理エンハンスメント強化学習(PEARL)パラダイムを用いて、RLと従来の動的システムの最適制御を橋渡しする。
- 参考スコア(独自算出の注目度): 0.3499870393443268
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) has recently emerged as a promising feedback control strategy for nonlinear and complex dynamical systems. However, RL algorithms are sample inefficient and require a large number of interaction with the environment to synthesize optimal control strategies. Consequently, applications of RL are typically limited to sparse sensors and actuators due to the curse of dimensionality entailed by the exploration-exploitation dilemma in high-dimensional spaces. In this work, we bridge RL and traditional optimal control for dynamical system with a novel Physics-EnhAnced Reinforcement Learning (PEARL) paradigm tailored to the control of high-dimensional and parametric dynamical systems, exploiting the differentibility of their dynamics. Specifically, PEARL employs an actor-adjoint algorithm that leverages automatic differentiation to compute policy gradients over short horizons and adjoint-based sensitivities of future returns approximated via neural networks, significantly reducing the number of environment interactions, while mitigating long-term gradient instabilities. Through two challenging parametric navigation problems in unsteady flows, we show that PEARL (i) effectively exploits differentiable environments to outperform state-of-the-art RL algorithms, (ii) is sample efficient, thanks to the physics-guided policy learning, (iii) generalizes across multiple scenarios, which is crucial when dealing with parametric systems, and (iv) enables scaling RL to high-dimensional state and action spaces, without requiring low-dimensional state representations or multi-agent strategies.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は, 非線形および複雑な力学系のフィードバック制御戦略として最近登場した。
しかし、RLアルゴリズムはサンプル非効率であり、最適な制御戦略を合成するためには環境との多数の相互作用が必要である。
その結果、RLの応用は通常、高次元空間における探索・探索ジレンマによって引き起こされる次元性の呪いによって、スパースセンサーやアクチュエータに限られる。
本研究では、高次元およびパラメトリックな力学系の制御に適した新しいPEARLパラダイムを用いて、RLと従来の動的系の最適制御を橋渡しし、それらの力学の微分可能性を活用する。
具体的には、PEARLはアクター-アジョイントアルゴリズムを用いて、短時間の地平線上のポリシー勾配と、ニューラルネットワークによって近似された将来のアジョイントベースの感度を計算し、環境相互作用の数を著しく削減し、長期的勾配不安定を緩和する。
非定常流における2つのパラメトリック航法問題を通して、PEARLが示す。
(i) 微分可能な環境を効果的に利用し、最先端のRLアルゴリズムより優れている。
(ii) 物理誘導型政策学習により, サンプリング効率が向上した。
(iii)パラメトリックシステムを扱う上で重要な複数のシナリオにまたがって一般化し、
(iv) 低次元状態表現やマルチエージェント戦略を必要とせずに、RLを高次元状態およびアクション空間にスケーリングすることができる。
関連論文リスト
- HypEMBER: Hypernetwork-based Ensemble for Robust Policy Learning of Parametrized Dynamical Systems [0.7099737083842057]
本稿では,ハイパーネットワークとアンサンブル学習を組み合わせた新しいRLフレームワークHypEMBERを紹介する。
その結果、HypEMBERはトレーニングの安定性とサンプル効率を継続的に改善し、システム力学と可観測性の両方に影響を及ぼす不確実性に対して優れた堅牢性を実現している。
論文 参考訳(メタデータ) (2026-07-21T23:37:34Z) - Sample-Efficient Neurosymbolic Deep Reinforcement Learning [49.60927398960061]
本稿では,背景記号知識を統合し,サンプル効率を向上させるニューロシンボリックディープRL手法を提案する。
オンライン推論は2つのメカニズムを通じてトレーニングプロセスのガイドを行う。
我々は、最先端の報奨機ベースラインよりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-01-06T09:28:53Z) - Rethinking the Role of Dynamic Sparse Training for Scalable Deep Reinforcement Learning [58.533203990515034]
ニューラルネットワークのスケーリングは機械学習における画期的な進歩をもたらしたが、このパラダイムは深層強化学習(DRL)では失敗している。
我々は、動的スパーストレーニング戦略が、アーキテクチャの改善によって確立された主要なスケーラビリティ基盤を補完するモジュール固有の利点を提供することを示す。
アーキテクチャ改善の利点を生かした実践的なフレームワークであるModule-Specific Training (MST) にこれらの知見を精査し、アルゴリズムの修正なしに様々なRLアルゴリズムをまたいだ大幅なスケーラビリティ向上を示す。
論文 参考訳(メタデータ) (2025-10-14T03:03:08Z) - Latent feedback control of distributed systems in multiple scenarios through deep learning-based reduced order models [3.5161229331588095]
高次元分散システムの継続的な監視とリアルタイム制御は、望まれる物理的な振る舞いを保証するためにアプリケーションに不可欠である。
完全順序モデルに依存する従来のフィードバック制御設計は、制御計算の遅延のため、これらの要求を満たすことができない。
非線形非侵襲的深層学習に基づく還元順序モデル(DL-ROM)により強化されたリアルタイム閉ループ制御戦略を提案する。
論文 参考訳(メタデータ) (2024-12-13T08:04:21Z) - Efficiently Training Deep-Learning Parametric Policies using Lagrangian Duality [55.06411438416805]
制約付きマルコフ決定プロセス(CMDP)は、多くの高度な応用において重要である。
本稿では,パラメトリックアクターポリシーを効率的に訓練するための2段階深度決定規則(TS-DDR)を提案する。
現状の手法と比較して, 解の質を高め, 数桁の計算時間を削減できることが示されている。
論文 参考訳(メタデータ) (2024-05-23T18:19:47Z) - SINDy-RL: Interpretable and Efficient Model-Based Reinforcement Learning [5.036739921794781]
SINDy-RLは、SINDyとDRLを組み合わせて、ダイナミックスモデル、報酬関数、制御ポリシーの効率的、解釈可能、信頼性の高い表現を作成するためのフレームワークである。
本稿では,ベンチマーク制御環境とフロー制御問題に対するアプローチの有効性を示す。
論文 参考訳(メタデータ) (2024-03-14T05:17:39Z) - Asynchronous Parallel Reinforcement Learning for Optimizing Propulsive
Performance in Fin Ray Control [3.889677386753812]
魚のひれは、万能な移動を促進するために、魚のひれを固定した魚の高度な制御システムを構成する。
魚の移動のキネマティクスと流体力学の広範な研究にもかかわらず、フィン線運動における複雑な制御戦略はほとんど解明されていない。
本研究では,様々な推進性能目標に適した複雑なフィン線制御戦略を得るために,流体構造相互作用(FSI)環境と相互作用する最先端のオフポリチックDRLアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-01-21T00:06:17Z) - Latent Dynamics Networks (LDNets): learning the intrinsic dynamics of
spatio-temporal processes [2.3694122563610924]
ラテント・ダイナミクス・ネットワーク(LDNet)は、非マルコフ力学系の低次元固有力学を発見できる。
LDNetは軽量で訓練が容易で、時間外挿方式でも精度と一般化性に優れている。
論文 参考訳(メタデータ) (2023-04-28T21:11:13Z) - Accelerated Policy Learning with Parallel Differentiable Simulation [59.665651562534755]
微分可能シミュレータと新しいポリシー学習アルゴリズム(SHAC)を提案する。
本アルゴリズムは,スムーズな批判機能により局所最小化の問題を軽減する。
現状のRLと微分可能なシミュレーションベースアルゴリズムと比較して,サンプル効率と壁面時間を大幅に改善した。
論文 参考訳(メタデータ) (2022-04-14T17:46:26Z) - Learning Robust Policy against Disturbance in Transition Dynamics via
State-Conservative Policy Optimization [63.75188254377202]
深層強化学習アルゴリズムは、ソースとターゲット環境の相違により、現実世界のタスクでは不十分な処理を行うことができる。
本研究では,前もって乱れをモデル化せずにロバストなポリシーを学習するための,モデルフリーなアクター批判アルゴリズムを提案する。
いくつかのロボット制御タスクの実験では、SCPOは遷移力学の乱れに対する堅牢なポリシーを学習している。
論文 参考訳(メタデータ) (2021-12-20T13:13:05Z) - Efficient Model-Based Multi-Agent Mean-Field Reinforcement Learning [89.31889875864599]
マルチエージェントシステムにおける学習に有効なモデルベース強化学習アルゴリズムを提案する。
我々の理論的な貢献は、MFCのモデルベース強化学習における最初の一般的な後悔の限界である。
コア最適化問題の実用的なパラメトリゼーションを提供する。
論文 参考訳(メタデータ) (2021-07-08T18:01:02Z) - Sample-Efficient Automated Deep Reinforcement Learning [33.53903358611521]
本稿では、任意のオフポリティックなRLアルゴリズムをメタ最適化する、人口ベース自動RLフレームワークを提案する。
集団全体で収集した経験を共有することで,メタ最適化のサンプル効率を大幅に向上させる。
我々は,MuJoCoベンチマークスイートで人気のTD3アルゴリズムを用いたケーススタディにおいて,サンプル効率のよいAutoRLアプローチの能力を実証した。
論文 参考訳(メタデータ) (2020-09-03T10:04:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。