論文の概要: Rate-Optimal Online Convex Optimization in Adaptive Linear Control
- arxiv url: http://arxiv.org/abs/2206.01426v1
- Date: Fri, 3 Jun 2022 07:32:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2022-06-06 14:05:28.654288
- Title: Rate-Optimal Online Convex Optimization in Adaptive Linear Control
- Title(参考訳): 適応線形制御におけるレート最適オンライン凸最適化
- Abstract要約: コストの逆変化による未知凸線形系の制御について考察する。
最適線形後角関数を実現するための最初の計算式を提示する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We consider the problem of controlling an unknown linear dynamical system
under adversarially changing convex costs and full feedback of both the state
and cost function. We present the first computationally-efficient algorithm
that attains an optimal $\smash{\sqrt{T}}$-regret rate compared to the best
stabilizing linear controller in hindsight, while avoiding stringent
assumptions on the costs such as strong convexity. Our approach is based on a
careful design of non-convex lower confidence bounds for the online costs, and
uses a novel technique for computationally-efficient regret minimization of
these bounds that leverages their particular non-convex structure.
- Abstract(参考訳): 対流コストの逆変化と状態とコスト関数の完全なフィードバックの下で未知の線形力学系を制御する問題を考える。
本稿では,後見における最適安定化線形制御器と比較して最適な$\smash{\sqrt{t}}$-regret率を達成する最初の計算効率アルゴリズムを提案する。
提案手法は, オンラインコストに対する非凸低信頼境界を慎重に設計し, 特定の非凸構造を利用した, 計算効率のよい最小化のための新しい手法を用いる。
関連論文リスト
- A Perturbation Approach to Unconstrained Linear Bandits [48.45987210959519]
我々は、制約のない帯域線形最適化(uBLO)の文脈で、Abernethy et al. (2008) の標準摂動に基づくアプローチを再考する。
制約のない環境では、バンド線形最適化(BLO)を標準オンライン線形最適化(OLO)問題に効果的に還元することを示す。
論文 参考訳(メタデータ) (2026-03-30T09:17:46Z) - Cost-aware Stopping for Bayesian Optimization [53.34052774820105]
本稿では,様々な評価コストに適応し,チューニングが不要なベイズ最適化のためのコスト対応停止則を提案する。
我々は,最先端の取得関数と組み合わせた場合,停止規則によって得られる期待累積評価コストを拘束する理論的な保証を証明した。
論文 参考訳(メタデータ) (2025-07-16T17:54:14Z) - Regret Analysis of Policy Optimization over Submanifolds for Linearly Constrained Online LQG [10.32831487961828]
線形に制約された安定化コントローラの多様体上でのオンライン線形二次ガウス問題(LQG)について検討する。
コスト関数列の2次情報に基づいてオンラインコントローラをオンザフライで生成するオンラインNewton on manifold(ONM)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-03-13T14:06:18Z) - Projection-Free Online Convex Optimization with Stochastic Constraints [0.0]
我々は制約付きオンライン凸最適化のためのプロジェクションフリーアルゴリズムを開発した。
各種設定に対してサブ線形後悔と制約違反境界を推定する。
我々は、制約違反を減らして、後悔と同じ成長をすることができることを証明している。
論文 参考訳(メタデータ) (2023-05-02T11:27:34Z) - Online Nonstochastic Control with Adversarial and Static Constraints [12.2632894803286]
本稿では,オンライン非確率的制御アルゴリズムを提案する。
我々のアルゴリズムは敵の制約に適応し、より少ない累積コストと違反を達成する。
論文 参考訳(メタデータ) (2023-02-05T16:46:12Z) - Smoothed Online Convex Optimization Based on Discounted-Normal-Predictor [68.17855675511602]
円滑なオンライン凸最適化(SOCO)のためのオンライン予測戦略について検討する。
提案アルゴリズムは,各区間の切替コストで適応的後悔を最小限に抑えることができることを示す。
論文 参考訳(メタデータ) (2022-05-02T08:48:22Z) - Efficient Online Linear Control with Stochastic Convex Costs and Unknown
Dynamics [0.0]
本稿では,最良安定化線形コントローラに対して,最適$sqrtT$後悔率を得る計算効率のよいアルゴリズムを提案する。
これまでの研究とは対照的に,我々のアルゴリズムは顔の不確実性パラダイムにおける最適化に基づいている。
論文 参考訳(メタデータ) (2022-03-02T15:19:20Z) - Robust Online Control with Model Misspecification [96.23493624553998]
本研究では,未知の非線形力学系のモデル不特定性を考慮したオンライン制御について検討する。
本研究は, 線形近似からの偏差を許容できる程度に測定できるロバスト性に着目した。
論文 参考訳(メタデータ) (2021-07-16T07:04:35Z) - Regret-optimal Estimation and Control [52.28457815067461]
後悔最適推定器と後悔最適制御器は状態空間形式で導出可能であることを示す。
非線形力学系に対するモデル予測制御(MPC)と拡張KalmanFilter(EKF)の残差最適類似性を提案する。
論文 参考訳(メタデータ) (2021-06-22T23:14:21Z) - Non-stationary Online Learning with Memory and Non-stochastic Control [71.14503310914799]
我々は,過去の決定に依拠する損失関数を許容するメモリを用いたオンライン凸最適化(OCO)の問題について検討する。
本稿では,非定常環境に対してロバストなアルゴリズムを設計するための性能指標として,動的ポリシーの後悔を紹介する。
我々は,時間的地平線,非定常度,メモリ長といった面で,最適な動的ポリシーの後悔を確実に享受するメモリ付きOCOの新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-02-07T09:45:15Z) - Bandit Linear Control [0.0]
ノイズ, 逆選択コスト, および帯域フィードバックの下で既知の線形力学系を制御することの問題点を考察する。
我々は,強い凸とスムーズなコストのために,時間的地平線の平方根で成長する後悔を得る,新しい効率的アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-07-01T21:12:19Z) - Adaptive Control and Regret Minimization in Linear Quadratic Gaussian
(LQG) Setting [91.43582419264763]
我々は不確実性に直面した楽観主義の原理に基づく新しい強化学習アルゴリズムLqgOptを提案する。
LqgOptはシステムのダイナミクスを効率的に探索し、モデルのパラメータを信頼区間まで推定し、最も楽観的なモデルのコントローラをデプロイする。
論文 参考訳(メタデータ) (2020-03-12T19:56:38Z) - Logarithmic Regret for Adversarial Online Control [56.12283443161479]
対数的後悔を伴う最初のアルゴリズムを任意対数外乱列に対して与える。
我々のアルゴリズムと分析はオフライン制御法の特徴を利用してオンライン制御問題を(遅延)オンライン学習に還元する。
論文 参考訳(メタデータ) (2020-02-29T06:29:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。