論文の概要: Meta-LinEXP3: Online-within-Online Learning for Adversarial Linear Contextual Bandits
- arxiv url: http://arxiv.org/abs/2609.09907v2
- Date: Tue, 15 Sep 2026 12:35:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.065855
- Title: Meta-LinEXP3: Online-within-Online Learning for Adversarial Linear Contextual Bandits
- Title(参考訳): Meta-LinEXP3: 逆線形コンテキスト帯域のためのオンラインオンライン学習
- Abstract要約: 本稿では,LinEXP3学習者の内的指導を行うために,完了したタスクから予測可能なタスクレベルを構築するオンラインオンライン・イン・オンライン・アルゴリズムを提案する。
メタLinEXP3の有効性を示す実験は、構造化ハイパースペクトルテンソルサンプリングへの応用を含む。
- 参考スコア(独自算出の注目度): 13.847359093328222
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Meta-learning has emerged as an effective paradigm for transferring knowledge across sequential bandit tasks. While substantial progress has been made for stochastic bandits and non-contextual adversarial bandits, meta-learning for adversarial linear contextual bandits (ALCBs) with random action sets remains largely unexplored. To address this problem, we propose Meta-LinEXP3, an online-within-online algorithm that constructs a predictable task-level prior from completed tasks to guide the inner LinEXP3 learner. For known context distributions, we develop a policy-centered estimator that achieves an intrinsic-dimension $\mathcal{O}(\sqrt{n})$ per-task regret bound. For unknown distributions, we introduce a past-only regularized moment estimator with an $\mathcal{O}(n^{2/3})$ leading regret term and explicit finite-sample error. We further establish a direct connection between prior accuracy and transfer regret, showing that increasingly accurate priors yield sublinear transfer-dependent regret across tasks. Experiments demonstrate the effectiveness of Meta-LinEXP3, including its application to structured hyperspectral tensor sampling.
- Abstract(参考訳): メタラーニングは、シーケンシャルなバンディットタスク間で知識を伝達するための効果的なパラダイムとして登場した。
確率的バンディットと非文脈的逆境バンディットにはかなりの進歩があったが、ランダムなアクションセットを持つ対角的線形文脈バンディット(ALCB)のメタラーニングはほとんど未発見のままである。
そこで本研究では,LinEXP3学習者の内的指導を支援するために,タスクを事前に予測可能なタスクレベルを構築するオンライン・イン・オンライン・アルゴリズムであるMeta-LinEXP3を提案する。
既知の文脈分布に対して、本質的な次元$\mathcal{O}(\sqrt{n})$ per-task regret boundを達成するポリシー中心推定器を開発する。
未知の分布に対しては、過去専用正規化モーメント推定器を$\mathcal{O}(n^{2/3})$リード後悔項と明示的な有限サンプル誤差で導入する。
さらに, 先行精度と伝達後悔の直接的な関連性を確立し, タスク間のサブ線形移動依存的後悔がますます正確になることを示す。
メタLinEXP3の有効性を示す実験は、構造化ハイパースペクトルテンソルサンプリングへの応用を含む。
関連論文リスト
- To Retain or to Adapt? Generalizing Continual Learning [39.95178050304739]
我々は、静止しない環境において、保持の優先順位付けはリアルタイム適応を妨げると論じている。
環境学と学習学の相互作用が支配するオンライン最適化問題としてCLを定式化する。
本稿では,予測連続学習と呼ぶ連続学習アルゴリズムの一般クラスを提案する。
論文 参考訳(メタデータ) (2026-07-06T20:11:53Z) - Learning Shared Representations for Multi-Task Linear Bandits [7.978226788634307]
マルチタスク表現学習は、関連するタスク間で共有潜在表現を学習するアプローチである。
特徴次元 d を持つ T の並列線型バンドイットタスクは、次元 r ll Mind,T$ の共通潜在表現を共有する。
我々は、共有低ランク表現を利用して意思決定を強化する、顔の不確かさリニア(OFUL)アルゴリズムの新たな最適化を提案する。
論文 参考訳(メタデータ) (2026-04-01T06:18:17Z) - Generalized Linear Bandits: Almost Optimal Regret with One-Pass Update [70.38810219913593]
非線形リンク関数を組み込んで古典線形モデルを拡張したコンテキスト型多武装バンディットフレームワークである一般化線形バンディット問題(GLB)について検討する。
GLBは現実世界のシナリオに広く適用できるが、その非線形性は計算効率と統計効率の両方を達成する上で大きな課題をもたらす。
本稿では,$mathcalO(1)$時間と1ラウンドあたりの空間複雑度をほぼ最適に再現するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-07-16T02:24:21Z) - Distributed No-Regret Learning for Multi-Stage Systems with End-to-End Bandit Feedback [7.8539454948826375]
本稿では,エンド・ツー・エンドの帯域フィードバックを用いたマルチステージシステムについて検討する。
各ジョブは、結果を生成する前に、異なるエージェントによって管理される複数のステージを通過する必要があります。
本研究の目的は,敵対的環境におけるサブ線形後悔を実現するために,分散オンライン学習アルゴリズムを開発することである。
論文 参考訳(メタデータ) (2024-04-06T05:34:12Z) - Random Representations Outperform Online Continually Learned Representations [68.42776779425978]
既存のオンライン学習深層ネットワークは、単純な事前定義されたランダム変換に比べて劣った表現を生成することを示す。
我々の手法はRanDumbと呼ばれ、あらゆるオンライン連続学習ベンチマークにおいて、最先端の学習表現を著しく上回っている。
本研究は, 表現学習の大きな限界, 特に低経験, オンライン連続学習のシナリオについて明らかにした。
論文 参考訳(メタデータ) (2024-02-13T22:07:29Z) - Meta-Learning Adversarial Bandit Algorithms [55.72892209124227]
我々は,バンディットフィードバックを用いたオンラインメタラーニングについて研究する。
我々は自己協和障壁正規化器を用いてオンラインミラー降下一般化(OMD)をチューニングすることを学ぶ。
論文 参考訳(メタデータ) (2023-07-05T13:52:10Z) - Meta-Learning Adversarial Bandits [49.094361442409785]
本研究の目的は,複数のタスクにまたがる帯域幅フィードバックを用いてオンライン学習を学習し,タスク間の平均性能を改善することである。
敵対的設定を最初に対象とするメタアルゴリズムとして,マルチアーム・バンディット(MAB)とバンディット・最適化(BLO)の2つの重要なケースに対して,特定の保証を設定するメタアルゴリズムを設計する。
我々の保証は、非正規化されたフォローザリーダーと乗法重みを組み合わせることで、オンラインで非滑らかで非Bシーケンスを学ぶのに十分であることを示すことに依存しています。
論文 参考訳(メタデータ) (2022-05-27T17:40:32Z) - Anti-Concentrated Confidence Bonuses for Scalable Exploration [57.91943847134011]
固有の報酬は、探検と探検のトレードオフを扱う上で中心的な役割を果たす。
楕円ボーナスを効率的に近似するためのエンファンティ集中型信頼境界を導入する。
我々は,Atariベンチマーク上での現代固有の報酬と競合する,深層強化学習のための実用的な変種を開発する。
論文 参考訳(メタデータ) (2021-10-21T15:25:15Z) - Meta-learning with Stochastic Linear Bandits [120.43000970418939]
我々は、よく知られたOFULアルゴリズムの正規化バージョンを実装するバンディットアルゴリズムのクラスを考える。
我々は,タスク数の増加とタスク分散の分散が小さくなると,タスクを個別に学習する上で,我々の戦略が大きな優位性を持つことを理論的および実験的に示す。
論文 参考訳(メタデータ) (2020-05-18T08:41:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。