Fugu-MT 論文翻訳(概要): Non-Stochastic Control with Bandit Feedback

論文の概要: Non-Stochastic Control with Bandit Feedback

arxiv url: http://arxiv.org/abs/2008.05523v1
Date: Wed, 12 Aug 2020 18:40:00 GMT
ステータス: 翻訳完了
システム内更新日: 2022-10-31 05:04:25.615001
Title: Non-Stochastic Control with Bandit Feedback
Title（参考訳）: バンディットフィードバックを用いた非確率制御
Authors: Paula Gradu and John Hallman and Elad Hazan
Abstract要約: 未知あるいは未知のシステムに対して,効率的なサブ線形後悔アルゴリズムを提案する。アルゴリズムの主な難しさは、過去の制御への損失の依存である。本稿では,メモリを有する損失関数に対して,バンド凸最適化の一般設定のための効率的なアルゴリズムを提案する。
参考スコア（独自算出の注目度）: 30.33117611898598
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: We study the problem of controlling a linear dynamical system with adversarial perturbations where the only feedback available to the controller is the scalar loss, and the loss function itself is unknown. For this problem, with either a known or unknown system, we give an efficient sublinear regret algorithm. The main algorithmic difficulty is the dependence of the loss on past controls. To overcome this issue, we propose an efficient algorithm for the general setting of bandit convex optimization for loss functions with memory, which may be of independent interest.
Abstract（参考訳）: 本研究では, 制御器に利用可能なフィードバックがスカラーロスのみであり, 損失関数自体が不明な線形力学系を逆摂動で制御する問題について検討する。この問題に対して、既知のシステムまたは未知のシステムにおいて、効率的なサブ線形後悔アルゴリズムを与える。アルゴリズムの主な困難は、過去の制御への損失の依存である。この問題を解決するために,メモリを持つ損失関数に対して,バンド凸最適化を一般化するための効率的なアルゴリズムを提案する。

関連論文リスト

The Central Role of the Loss Function in Reinforcement Learning [46.72524235085568]
回帰損失関数の違いが値に基づく意思決定アルゴリズムのサンプル効率と適応性に与える影響を実証する。複数の設定にまたがって、バイナリクロスエントロピー損失を用いたアルゴリズムが、最適ポリシーのコストで1次境界スケーリングを実現することを証明した。本論文は, 種々の損失関数を持つ意思決定アルゴリズムのガイドとして機能し, 読者により良い損失関数を求め, 任意の意思決定アルゴリズムを改善することを期待する。
論文参考訳（メタデータ） (2024-09-19T14:10:38Z)
LEARN: An Invex Loss for Outlier Oblivious Robust Online Optimization [56.67706781191521]
敵は、学習者に未知の任意の数kの損失関数を破損させることで、外れ値を導入することができる。我々は,任意の数kで損失関数を破損させることで,敵が外乱を発生させることができる,頑健なオンラインラウンド最適化フレームワークを提案する。
論文参考訳（メタデータ） (2024-08-12T17:08:31Z)
Sub-linear Regret in Adaptive Model Predictive Control [56.705978425244496]
本稿では,STT-MPC (Self-Tuning tube-based Model Predictive Control) について述べる。システム力学を最初に認識したアルゴリズムと比較して,アルゴリズムの後悔を解析する。
論文参考訳（メタデータ） (2023-10-07T15:07:10Z)
Data-Driven Adversarial Online Control for Unknown Linear Systems [17.595231077524467]
このオンライン制御問題に対処する新しいデータ駆動型オンライン適応制御アルゴリズムを提案する。我々のアルゴリズムは、高い確率で有界な$tmO(T2/3)の後悔勾配を保証し、この問題の最もよく知られた後悔勾配と一致する。
論文参考訳（メタデータ） (2023-08-16T04:05:22Z)
On Convex Data-Driven Inverse Optimal Control for Nonlinear, Non-stationary and Stochastic Systems [0.7240153598817866]
本稿では, エージェントの動作を駆動する非定常コストの観測から, 再構成を目標とする有限水平逆制御問題について考察する。本研究では,非定常エージェントコストの対流的な問題を解くことで,コスト最適化を実現する結果を提案する。すべての実験が我々のアプローチの有効性を確認した。
論文参考訳（メタデータ） (2023-06-24T10:25:53Z)
Non-stationary Online Learning with Memory and Non-stochastic Control [71.14503310914799]
我々は,過去の決定に依拠する損失関数を許容するメモリを用いたオンライン凸最適化(OCO)の問題について検討する。本稿では,非定常環境に対してロバストなアルゴリズムを設計するための性能指標として,動的ポリシーの後悔を紹介する。我々は,時間的地平線,非定常度,メモリ長といった面で,最適な動的ポリシーの後悔を確実に享受するメモリ付きOCOの新しいアルゴリズムを提案する。
論文参考訳（メタデータ） (2021-02-07T09:45:15Z)
Persistent Reductions in Regularized Loss Minimization for Variable Selection [3.3504365823045035]
広い種類の損失関数に対して、係数がゼロであることが保証される部分集合を効率的に同定できることが示される。我々は、超高次元問題に適用できるように、既存のレイアルゴリズムを極端線識別に使用し、保証アルゴリズムを適用させる。
論文参考訳（メタデータ） (2020-11-30T04:59:44Z)
Bandit Linear Control [0.0]
ノイズ, 逆選択コスト, および帯域フィードバックの下で既知の線形力学系を制御することの問題点を考察する。我々は,強い凸とスムーズなコストのために,時間的地平線の平方根で成長する後悔を得る,新しい効率的アルゴリズムを提案する。
論文参考訳（メタデータ） (2020-07-01T21:12:19Z)
Logarithmic Regret for Adversarial Online Control [56.12283443161479]
対数的後悔を伴う最初のアルゴリズムを任意対数外乱列に対して与える。我々のアルゴリズムと分析はオフライン制御法の特徴を利用してオンライン制御問題を(遅延)オンライン学習に還元する。
論文参考訳（メタデータ） (2020-02-29T06:29:19Z)
Improper Learning for Non-Stochastic Control [78.65807250350755]
逆方向の摂動, 逆方向に選択された凸損失関数, 部分的に観察された状態を含む, 未知の線形力学系を制御することの問題点を考察する。このパラメトリゼーションにオンライン降下を適用することで、大規模なクローズドループポリシーに対してサブリニア後悔を実現する新しいコントローラが得られる。我々の境界は、線形力学コントローラの安定化と競合する非確率的制御設定における最初のものである。
論文参考訳（メタデータ） (2020-01-25T02:12:48Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。