論文の概要: Kernel weighted importance sampling for off-policy evaluation in contextual bandits
- arxiv url: http://arxiv.org/abs/2607.15067v1
- Date: Thu, 16 Jul 2026 14:38:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.139208
- Title: Kernel weighted importance sampling for off-policy evaluation in contextual bandits
- Title(参考訳): カーネル重み付き重要サンプリングによる文脈的バンディットの非政治評価
- Abstract要約: 本稿では、オフラインデータのみを用いて、文脈的盗聴に対して、政治外の評価を行うための新しい推定器を提案する。
提案した推定器であるKernel-WISは、強塩基性より経験的に優れていることを示す。
- 参考スコア(独自算出の注目度): 0.22990955182759565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This article presents a novel estimator for performing off-policy evaluation using only offline data for contextual bandits. The proposed estimator, Kernel-WIS is demonstrated to be asymptotically consistent and to empirically outperform strong baselines (including vanilla weighted importance sampling), particularly under complex conditions including behaviour policy miss-specification. The benefit of Kernel-WIS is derived from combining the bounded property of vanilla weighted importance sampling with the linearity of vanilla importance sampling.
- Abstract(参考訳): 本稿では、オフラインデータのみを用いて、文脈的盗聴に対して、政治外の評価を行うための新しい推定器を提案する。
提案した推定器であるKernel-WISは漸近的に一貫性を示し、特に行動ポリシーミス特定を含む複雑な条件下で、強塩基性(バニラ重み付き重要サンプリングを含む)を経験的に上回っている。
Kernel-WISの利点は、バニラ重み付き重み付けサンプリングとバニラ重み付けサンプリングの線形性を組み合わせることで得られる。
関連論文リスト
- Stabilising Explainability Fragility in Cybersecurity AI: The Impact and Mitigation of Multicollinearity in Public Benchmark Datasets [1.1172382217477128]
多重線型性は帰属分散を膨らませるという公式な定理を導入する。
線形、ツリーベース、カーネル、ニューラルの4つのモデルが、フルおよびプルーニングされた機能セットで評価されている。
本稿では,説明可能性の脆弱性スコア(Explainability Fragility Score)の新たな指標と,拡張複雑性を緩和する2つの新しい手法を提案する。
論文 参考訳(メタデータ) (2026-05-21T14:20:33Z) - Epistemic Robust Offline Reinforcement Learning [5.915633148484684]
離散アンサンブルをQ値上のコンパクト不確実集合に置き換える統一フレームワークを提案する。
また、リスクに敏感な行動ポリシーの下でオフラインRLアルゴリズムを評価するためのベンチマークも導入する。
論文 参考訳(メタデータ) (2026-04-08T13:26:00Z) - GIPO: Gaussian Importance Sampling Policy Optimization [12.306486689840774]
GIPOは、切り詰められた重要度サンプリングに基づく政策最適化の目標として提案されている。
硬い切り抜きを対数比に基づくガウス的信頼重みに置き換え、極めて重要な比率を抑える。
GIPOは、クリッピングベースのベースライン間で、幅広いリプレイバッファサイズで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-04T11:34:59Z) - What Makes Value Learning Efficient in Residual Reinforcement Learning? [57.635661297706065]
残留強化学習(Residual reinforcement learning, RL)は、ベースを凍結し、境界修正のみを学習することにより、表現的事前訓練政策の安定したオンライン改善を可能にする。
本研究では,冷戦開始の病理学において,批判者が基本方針に関する価値景観の知識を欠いている点と,構造的スケールミスマッチという2つの主要なボトルネックを同定する。
残差RLにおける効率的な値学習を目的とした最小限のアプローチであるDAWNを提案する。
論文 参考訳(メタデータ) (2026-02-11T05:25:39Z) - Provable Offline Preference-Based Reinforcement Learning [95.00042541409901]
本研究では,PbRL(Preference-based Reinforcement Learning)の問題について,人間のフィードバックを用いて検討する。
我々は、報酬が軌道全体にわたって定義できる一般的な報酬設定について考察する。
我々は, 軌道毎の集中性によって上界に拘束できる新しい単極集中係数を導入する。
論文 参考訳(メタデータ) (2023-05-24T07:11:26Z) - A Tale of Sampling and Estimation in Discounted Reinforcement Learning [50.43256303670011]
割引平均推定問題に対して最小値の最小値を求める。
マルコフ過程の割引されたカーネルから直接サンプリングすることで平均を推定すると、説得力のある統計的性質が得られることを示す。
論文 参考訳(メタデータ) (2023-04-11T09:13:17Z) - Uncertainty-Aware Instance Reweighting for Off-Policy Learning [63.31923483172859]
本研究では,不確実性を考慮した逆確率スコア推定器 (UIPS) を提案する。
実世界の3つのレコメンデーションデータセットを用いた実験結果から,提案したUIPS推定器の有効サンプル効率が示された。
論文 参考訳(メタデータ) (2023-03-11T11:42:26Z) - A Sharp Characterization of Linear Estimators for Offline Policy
Evaluation [33.37672297925897]
オフライン政策評価は 強化学習の基本的な統計問題です
古典的手法に必要で十分である単純な制御理論と線形代数的条件を同定する。
この結果から, オフライン政策評価のための線形推定器の挙動の全体像が得られた。
論文 参考訳(メタデータ) (2022-03-08T17:52:57Z) - Importance Weighting Approach in Kernel Bayes' Rule [43.221685127485735]
本研究では,特徴量を用いたベイズ計算における非パラメトリック手法について検討する。
ベイズ更新に関わる全ての量は観測データから学習され、この手法は完全にモデル無しである。
提案手法は重要度重み付けに基づいており,既存のKBR手法よりも優れた数値安定性が得られる。
論文 参考訳(メタデータ) (2022-02-05T03:06:59Z) - False Correlation Reduction for Offline Reinforcement Learning [115.11954432080749]
本稿では,実効的かつ理論的に証明可能なアルゴリズムであるオフラインRLに対するfalSe Correlation Reduction (SCORE)を提案する。
SCOREは、標準ベンチマーク(D4RL)において、様々なタスクにおいて3.1倍の高速化でSoTA性能を達成することを実証的に示す。
論文 参考訳(メタデータ) (2021-10-24T15:34:03Z) - GenDICE: Generalized Offline Estimation of Stationary Values [108.17309783125398]
重要なアプリケーションでは,効果的な推定が依然として可能であることを示す。
我々のアプローチは、定常分布と経験分布の差を補正する比率を推定することに基づいている。
結果として得られるアルゴリズム、GenDICEは単純で効果的である。
論文 参考訳(メタデータ) (2020-02-21T00:27:52Z) - Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement
Learning [70.01650994156797]
教育医療などのバッチ強化学習において、観察データからのシーケンシャルな意思決定方針のオフ・アセスメントが必要である。
我々は、ある政策の境界を推定するアプローチを開発する。
より凝縮したデータを集めることで、シャープな境界への収束を証明します。
論文 参考訳(メタデータ) (2020-02-11T16:18:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。