論文の概要: Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits
- arxiv url: http://arxiv.org/abs/2607.22012v1
- Date: Fri, 24 Jul 2026 06:17:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.058386
- Title: Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits
- Title(参考訳): コンテキスト帯域のクロスドメインオフポリシー評価と学習
- Authors: Yuta Natsubori, Masataka Ushiku, Yuta Saito,
- Abstract要約: 文脈的帯域におけるオフ・ポリティ・アセスメント・アンド・ラーニング(OPE/L)は,現実のシステムにおいて急速に普及している。
OPE/Lの既存のメソッドは、少数ショットデータ、決定論的ロギングポリシー、新しいアクションなど、多くの困難なシナリオに対処できない。
我々は、対象ドメインからのログデータだけでなく、他のドメインから収集したログデータセットにもアクセス可能な、クロスドメインOPE/Lの新たな問題設定を提案する。
- 参考スコア(独自算出の注目度): 17.993446186878188
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Off-Policy Evaluation and Learning (OPE/L) in contextual bandits is rapidly gaining popularity in real systems because new policies can be evaluated and learned securely using only historical logged data. However, existing methods in OPE/L cannot handle many challenging but prevalent scenarios such as few-shot data, deterministic logging policies, and new actions. In many applications, such as personalized medicine, content recommendations, education, and advertising, we need to evaluate and learn new policies in the presence of these challenges. Existing methods cannot evaluate and optimize effectively in these situations due to the notorious variance issue or limited exploration in the logged data. To enable OPE/L even under these unsolved challenges, we propose a new problem setup of Cross-Domain OPE/L, where we have access not only to the logged data from the target domain in which the new policy will be implemented but also to logged datasets collected from other domains. This novel formulation is widely applicable because we can often use historical data not only from the target hospital, country, device, or user segment but also from other hospitals, countries, devices, or segments. We develop a new estimator and policy gradient method to solve OPE/L by leveraging both target and source datasets, resulting in substantially enhanced OPE/L in the previously unsolved situations in our empirical evaluations.
- Abstract(参考訳): 歴史的記録データのみを用いて新しいポリシーを評価・学習できるため,文脈的帯域におけるオフポリシー評価学習(OPE/L)が現実システムで急速に普及している。
しかし、OPE/Lの既存のメソッドは、少数ショットデータ、決定論的ロギングポリシー、新しいアクションなど、難しいが一般的なシナリオの多くを処理できない。
パーソナライズドメディカル、コンテンツレコメンデーション、教育、広告など、多くのアプリケーションにおいて、これらの課題の存在下で新しいポリシーを評価し、学習する必要がある。
既存の手法は、悪名高い分散問題やログデータの限られた探索のため、これらの状況において効果的に評価・最適化できない。
我々は,これらの未解決課題の下でもOPE/Lを有効にするために,新たなポリシを実装した対象ドメインからのログデータだけでなく,他のドメインから収集したデータセットにもアクセス可能なクロスドメインOPE/Lの新たな問題設定を提案する。
この新定式化は, 対象病院, 国, デバイス, ユーザセグメントだけでなく, 他の病院, 国, デバイス, セグメントからも, 歴史的データを利用することができるため, 広く適用可能である。
我々は,OPE/Lをターゲットとソースの両方のデータセットを利用して解くための新しい推定法とポリシー勾配法を開発し,実験的な評価において未解決の状況において,OPE/Lを大幅に向上させた。
関連論文リスト
- Predicting Long Term Sequential Policy Value Using Softer Surrogates [45.9831721774649]
オフ政治政策評価は、異なる政策から収集された歴史的データを用いて、新しい政策の結果を推定する。
我々は,全地平線データの10%を観測した後のみ,政策値の正確な予測を行うことができることを示した。
論文 参考訳(メタデータ) (2024-12-30T01:01:15Z) - OPERA: Automatic Offline Policy Evaluation with Re-weighted Aggregates of Multiple Estimators [13.408838970377035]
オフライン政策評価(OPE)により、新たなシーケンシャルな意思決定方針のパフォーマンスを評価し、見積もることができる。
統計的手法を用いた明示的な選択に頼ることなく,データセットに与えられたOPE推定器の集合を適応的にブレンドするアルゴリズムを提案する。
我々の研究は、オフラインRLのための汎用的、推定対象に依存しない、非政治評価フレームワークの使いやすさの向上に寄与する。
論文 参考訳(メタデータ) (2024-05-27T23:51:20Z) - When is Off-Policy Evaluation (Reward Modeling) Useful in Contextual Bandits? A Data-Centric Perspective [64.73162159837956]
ログ化されたデータセットだけで仮説的ターゲットポリシーの価値を評価することは重要だが、難しい。
データ中心のフレームワークであるDataCOPEを提案する。
医療データセットを用いたログ化された文脈的帯域設定におけるDataCOPEの実証分析により、機械学習と人間の専門家ポリシーの両方を評価する能力が確認された。
論文 参考訳(メタデータ) (2023-11-23T17:13:37Z) - Conformal Off-Policy Evaluation in Markov Decision Processes [53.786439742572995]
強化学習は、データから効率的な制御ポリシーを特定し評価することを目的としている。
この学習タスクのほとんどの方法は、Off-Policy Evaluation (OPE)と呼ばれ、正確さと確実性を保証するものではない。
本稿では,目標方針の真報を含む区間を所定の確信度で出力するコンフォーマル予測に基づく新しいOPE手法を提案する。
論文 参考訳(メタデータ) (2023-04-05T16:45:11Z) - Variance-Optimal Augmentation Logging for Counterfactual Evaluation in
Contextual Bandits [25.153656462604268]
オフラインのA/Bテストと反ファクトラーニングの手法は、検索システムやレコメンデーションシステムに急速に採用されている。
これらの手法で一般的に使用される対物推定器は、ログポリシが評価対象のポリシーと大きく異なる場合、大きなバイアスと大きなばらつきを持つ可能性がある。
本稿では,下流評価や学習問題の分散を最小限に抑えるロギングポリシーを構築するための,MVAL(Minimum Variance Augmentation Logging)を提案する。
論文 参考訳(メタデータ) (2022-02-03T17:37:11Z) - Benchmarks for Deep Off-Policy Evaluation [152.28569758144022]
我々は,政策外の評価のベンチマークに使用できるポリシーの集合を提案する。
私たちのベンチマークの目標は、一連の原則から動機付けられた進歩の標準化された尺度を提供することです。
この領域における今後の研究を促進するために、当社のデータとコードに対するオープンソースアクセスを提供しています。
論文 参考訳(メタデータ) (2021-03-30T18:09:33Z) - MUSBO: Model-based Uncertainty Regularized and Sample Efficient Batch
Optimization for Deployment Constrained Reinforcement Learning [108.79676336281211]
データ収集とオンライン学習のための新しいポリシーの継続的展開はコスト非効率か非現実的かのどちらかである。
モデルベース不確実性正規化とサンプル効率的なバッチ最適化という新しいアルゴリズム学習フレームワークを提案する。
本フレームワークは,各デプロイメントの新規で高品質なサンプルを発見し,効率的なデータ収集を実現する。
論文 参考訳(メタデータ) (2021-02-23T01:30:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。