論文の概要: Optimal Baseline Corrections for Off-Policy Contextual Bandits
- arxiv url: http://arxiv.org/abs/2405.05736v2
- Date: Wed, 14 Aug 2024 14:14:02 GMT
- ステータス: 処理完了
- システム内更新日: 2024-08-15 17:46:37.912691
- Title: Optimal Baseline Corrections for Off-Policy Contextual Bandits
- Title(参考訳): オフポリティコンテキスト帯域に対する最適ベースライン補正
- Authors: Shashank Gupta, Olivier Jeunen, Harrie Oosterhuis, Maarten de Rijke,
- Abstract要約: オンライン報酬指標の偏りのないオフライン推定を最適化する意思決定ポリシーを学習することを目指している。
学習シナリオにおける同値性に基づく単一のフレームワークを提案する。
我々のフレームワークは、分散最適非バイアス推定器の特徴付けを可能にし、それに対する閉形式解を提供する。
- 参考スコア(独自算出の注目度): 61.740094604552475
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The off-policy learning paradigm allows for recommender systems and general ranking applications to be framed as decision-making problems, where we aim to learn decision policies that optimize an unbiased offline estimate of an online reward metric. With unbiasedness comes potentially high variance, and prevalent methods exist to reduce estimation variance. These methods typically make use of control variates, either additive (i.e., baseline corrections or doubly robust methods) or multiplicative (i.e., self-normalisation). Our work unifies these approaches by proposing a single framework built on their equivalence in learning scenarios. The foundation of our framework is the derivation of an equivalent baseline correction for all of the existing control variates. Consequently, our framework enables us to characterize the variance-optimal unbiased estimator and provide a closed-form solution for it. This optimal estimator brings significantly improved performance in both evaluation and learning, and minimizes data requirements. Empirical observations corroborate our theoretical findings.
- Abstract(参考訳): オフ政治学習パラダイムにより、リコメンデータシステムと一般的なランキングアプリケーションは、意思決定の問題として枠を組むことができ、オンライン報酬メトリックのバイアスのないオフライン見積を最適化する決定ポリシーを学習することを目指している。
偏見のない場合、潜在的に高い分散が生じ、推定分散を減らすために一般的な方法が存在する。
これらの方法は典型的には、加法(ベースライン補正または二重ロバストな方法)または乗法(自己正規化)のいずれかの制御変数を使用する。
我々の研究は、学習シナリオにおける等価性に基づいて構築された単一のフレームワークを提案することによって、これらのアプローチを統一する。
我々のフレームワークの基礎は、既存の制御変数すべてに対する等価なベースライン補正の導出である。
したがって, このフレームワークは, 分散最適アンバイアス推定器を特徴付けることができ, クローズドフォームの解が得られる。
この最適推定器は、評価と学習の両方のパフォーマンスを大幅に改善し、データ要求を最小化する。
経験的観察は我々の理論的な発見を裏付ける。
関連論文リスト
- $Δ\text{-}{\rm OPE}$: Off-Policy Estimation with Pairs of Policies [13.528097424046823]
Inverse Propensity Scoring estimator に基づいた$Deltatext-rm OPE$メソッドを提案する。
シミュレーション,オフライン,オンライン実験により,本手法は評価タスクと学習タスクの両方のパフォーマンスを著しく向上させることが示された。
論文 参考訳(メタデータ) (2024-05-16T12:04:55Z) - Likelihood Ratio Confidence Sets for Sequential Decision Making [51.66638486226482]
確率に基づく推論の原理を再検討し、確率比を用いて妥当な信頼シーケンスを構築することを提案する。
本手法は, 精度の高い問題に特に適している。
提案手法は,オンライン凸最適化への接続に光を当てることにより,推定器の最適シーケンスを確実に選択する方法を示す。
論文 参考訳(メタデータ) (2023-11-08T00:10:21Z) - Importance-Weighted Offline Learning Done Right [16.4989952150404]
文脈的帯域幅問題におけるオフラインポリシー最適化の問題について検討する。
目標は、準最適行動ポリシーによって収集された決定データのデータセットに基づいて、ほぼ最適ポリシーを学ぶことである。
我々は、citet2015の「単純探索」推定に基づく単純な代替手法が、過去の全ての結果よりもほぼ全ての可能な条件で優れた性能保証を与えることを示した。
論文 参考訳(メタデータ) (2023-09-27T16:42:10Z) - Offline Policy Optimization with Eligible Actions [34.4530766779594]
オフラインポリシーの最適化は多くの現実世界の意思決定問題に大きな影響を与える可能性がある。
重要度サンプリングとその変種は、オフラインポリシー評価において一般的に使用されるタイプの推定器である。
そこで本稿では, 州ごとの正規化制約によって過度に適合することを避けるアルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-07-01T19:18:15Z) - Off-Policy Evaluation with Policy-Dependent Optimization Response [90.28758112893054]
我々は,テキスト政治に依存した線形最適化応答を用いた非政治評価のための新しいフレームワークを開発した。
摂動法による政策依存推定のための非バイアス推定器を構築する。
因果介入を最適化するための一般的なアルゴリズムを提供する。
論文 参考訳(メタデータ) (2022-02-25T20:25:37Z) - Learning to Estimate Without Bias [57.82628598276623]
ガウスの定理は、重み付き最小二乗推定器は線形モデルにおける線形最小分散アンバイアスド推定(MVUE)であると述べている。
本稿では、バイアス制約のあるディープラーニングを用いて、この結果を非線形設定に拡張する第一歩を踏み出す。
BCEの第二の動機は、同じ未知の複数の推定値が平均化されてパフォーマンスが向上するアプリケーションにおいてである。
論文 参考訳(メタデータ) (2021-10-24T10:23:51Z) - Scalable Control Variates for Monte Carlo Methods via Stochastic
Optimization [62.47170258504037]
本稿では,制御,カーネル,ニューラルネットワークを用いた既存のアプローチを包含し,一般化するフレームワークを提案する。
新たな理論的結果は、達成可能な分散還元に関する洞察を与えるために提示され、ベイズ推定への応用を含む経験的評価が支持される。
論文 参考訳(メタデータ) (2020-06-12T22:03:25Z) - Learning the Truth From Only One Side of the Story [58.65439277460011]
一般化線形モデルに焦点をあて、このサンプリングバイアスを調整しなければ、モデルは準最適に収束するか、あるいは最適解に収束しないかもしれないことを示す。
理論的保証を伴って適応的なアプローチを提案し、いくつかの既存手法を実証的に上回っていることを示す。
論文 参考訳(メタデータ) (2020-06-08T18:20:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。