論文の概要: Optimistic Online LQR via Intrinsic Rewards
- arxiv url: http://arxiv.org/abs/2603.28938v1
- Date: Mon, 30 Mar 2026 19:16:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:02.749311
- Title: Optimistic Online LQR via Intrinsic Rewards
- Title(参考訳): 固有リワードによる最適オンラインLQR
- Authors: Marcell Bartos, Bruce D. Lee, Lenart Treven, Andreas Krause, Florian Dörfler, Melanie N. Zeilinger,
- Abstract要約: Intrinsic Rewards LQR (IR-LQR) は楽観的なオンライン線形二次規制 (LQR) アルゴリズムである。
IR-LQRはコスト関数のみを変更することで標準LQR合成問題の構造を保持する。
IR-LQRは、最安値の$sqrtT$の後悔率を達成し、様々な最先端のオンラインLQRアルゴリズムと比較する。
- 参考スコア(独自算出の注目度): 36.89493663384693
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Optimism in the face of uncertainty is a popular approach to balance exploration and exploitation in reinforcement learning. Here, we consider the online linear quadratic regulator (LQR) problem, i.e., to learn the LQR corresponding to an unknown linear dynamical system by adapting the control policy online based on closed-loop data collected during operation. In this work, we propose Intrinsic Rewards LQR (IR-LQR), an optimistic online LQR algorithm that applies the idea of intrinsic rewards originating from reinforcement learning and the concept of variance regularization to promote uncertainty-driven exploration. IR-LQR retains the structure of a standard LQR synthesis problem by only modifying the cost function, resulting in an intuitively pleasing, simple, computationally cheap, and efficient algorithm. This is in contrast to existing optimistic online LQR formulations that rely on more complicated iterative search algorithms or solve computationally demanding optimization problems. We show that IR-LQR achieves the optimal worst-case regret rate of $\sqrt{T}$, and compare it to various state-of-the-art online LQR algorithms via numerical experiments carried out on an aircraft pitch angle control and an unmanned aerial vehicle example.
- Abstract(参考訳): 不確実性に直面した最適化は、強化学習における探索と搾取のバランスを取るための一般的なアプローチである。
ここでは、オンライン線形二次規制(LQR)問題、すなわち、未知の線形力学系に対応するLQRを、操作中に収集された閉ループデータに基づいてオンラインに制御ポリシーを適用することで学習する。
本研究では、強化学習に基づく固有報酬の概念と分散正規化の概念を適用し、不確実性駆動探索を促進する楽観的なオンラインLQRアルゴリズムであるIntrinsic Rewards LQR(IR-LQR)を提案する。
IR-LQRはコスト関数を変更するだけで標準的なLQR合成問題の構造を保持しており、直感的で、単純で、計算コストが低く、効率的である。
これは、より複雑な反復探索アルゴリズムに依存する既存の楽観的なオンラインLQR定式化や、計算に要求される最適化問題の解決とは対照的である。
IR-LQRは, 航空機のピッチ角制御と無人航空機の例による数値実験により, 様々な最先端のオンラインLQRアルゴリズムと比較し, 最適最悪の後悔率を$\sqrt{T}$とすることを示した。
関連論文リスト
- Regret Analysis of Policy Optimization over Submanifolds for Linearly Constrained Online LQG [10.32831487961828]
線形に制約された安定化コントローラの多様体上でのオンライン線形二次ガウス問題(LQG)について検討する。
コスト関数列の2次情報に基づいてオンラインコントローラをオンザフライで生成するオンラインNewton on manifold(ONM)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-03-13T14:06:18Z) - REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback [61.54791065013767]
報酬関数と人間の嗜好の相違は、現実世界で破滅的な結果をもたらす可能性がある。
近年の手法は、人間の嗜好から報酬関数を学習することで、不適応を緩和することを目的としている。
本稿では,ロボットRLHFフレームワークにおける報酬正規化の新たな概念を提案する。
論文 参考訳(メタデータ) (2023-12-22T04:56:37Z) - Robust Learning for Smoothed Online Convex Optimization with Feedback
Delay [43.85262428603507]
我々は、新しい機械学習(ML)拡張オンラインアルゴリズム、Robustness-Constrained Learning(RCL)を提案する。
RCLは信頼できないML予測と、制約付きプロジェクションを通じて信頼された専門家のオンラインアルゴリズムを組み合わせることで、ML予測を堅牢化する。
RCLは、マルチステップ切替コストとフィードバック遅延の場合に、証明可能な堅牢性を保証する最初のML拡張アルゴリズムである。
論文 参考訳(メタデータ) (2023-10-31T00:22:55Z) - Efficient Methods for Non-stationary Online Learning [63.268670895111654]
動的後悔と適応的後悔を最適化する効率的な方法を提案する。
提案アルゴリズムでは,各ラウンドで1つの勾配クエリと1つの関数評価しか必要としない。
また、さらに強力な測度、すなわち「内部的動的後悔」を研究し、ラウンド当たりの射影数を$O(log2 T)$から$$$$に減らした。
論文 参考訳(メタデータ) (2023-09-16T07:30:12Z) - Regret Analysis of Online LQR Control via Trajectory Prediction and
Tracking: Extended Version [1.6344851071810074]
本稿では,オンライン線形二次規制(LQR)制御の新しい手法の提案と解析を行う。
提案手法では,最適軌道の予測に利用可能なコスト行列と,その方向を追従するトラッキングコントローラを用いる。
提案手法は,従来のオンラインLQR法と比較して性能が向上することを示す。
論文 参考訳(メタデータ) (2023-02-21T02:48:57Z) - Solving Multistage Stochastic Linear Programming via Regularized Linear
Decision Rules: An Application to Hydrothermal Dispatch Planning [77.34726150561087]
AdaSO(Adaptive least absolute shrinkage and selection operator)に基づく線形決定規則(LDR)の新しい正規化手法を提案する。
実験により、MSLPを解くために古典的な非正規化LDRを使用する場合、過度に適合する脅威は無視できないことが示された。
LHDP問題に対しては、非正規化ベンチマークと比較して、提案したフレームワークの次の利点を強調した。
論文 参考訳(メタデータ) (2021-10-07T02:36:14Z) - Regret Analysis of Distributed Online LQR Control for Unknown LTI
Systems [8.832969171530056]
線形時間不変(LTI)系に対する分散オンライン線形2次レギュレータ(LQR)問題について研究する。
本稿では,各エージェントが探索段階でシステム推定を計算するオンラインlqrアルゴリズムの分散型を提案する。
我々は,提案アルゴリズムが$tildeO(T2/3)$をスケールしていることを証明する。
論文 参考訳(メタデータ) (2021-05-15T23:02:58Z) - Online Apprenticeship Learning [58.45089581278177]
見習い学習(AL)では、コスト関数にアクセスせずにマルコフ決定プロセス(MDP)が与えられます。
目標は、事前に定義されたコスト関数のセットで専門家のパフォーマンスに一致するポリシーを見つけることです。
ミラー下降型ノンレグレットアルゴリズムを2つ組み合わせることで,OAL問題を効果的に解くことができることを示す。
論文 参考訳(メタデータ) (2021-02-13T12:57:51Z) - Decomposability and Parallel Computation of Multi-Agent LQR [19.710361049812608]
連続時間線形MASにおける線形レギュレータ(LQR)設計のための並列RLスキームを提案する。
我々は、MAS が均質であれば、この分解は閉ループ最適性を保持することを示す。
提案手法は,LQRコストの累積価値を損なうことなく,学習の大幅な高速化を保証できる。
論文 参考訳(メタデータ) (2020-10-16T20:15:39Z) - Learning the Linear Quadratic Regulator from Nonlinear Observations [135.66883119468707]
我々は、LQR with Rich Observations(RichLQR)と呼ばれる連続制御のための新しい問題設定を導入する。
本設定では, 線形力学と二次的コストを有する低次元連続潜伏状態によって環境を要約する。
本結果は,システムモデルと一般関数近似における未知の非線形性を持つ連続制御のための,最初の証明可能なサンプル複雑性保証である。
論文 参考訳(メタデータ) (2020-10-08T07:02:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。