論文の概要: Variance-Optimal Off-Policy Evaluation with Conjunct Effect Modeling
- arxiv url: http://arxiv.org/abs/2610.08677v1
- Date: Tue, 06 Oct 2026 16:58:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.133534
- Title: Variance-Optimal Off-Policy Evaluation with Conjunct Effect Modeling
- Title(参考訳): 共役効果モデリングによる可変最適オフポリシィ評価
- Abstract要約: 行動レベルの重み付けが過度の分散を引き起こす場合、文脈的盗賊政策のオフ政治評価は困難である。
OffCEM (Conjunct Effect Model) による事前推定では、より安定したクラスタレベルの重みに置き換える。
OffCEM と DR を補間する不偏推定器群が存在することを示す。
分散を最小化するために係数を選択する可変最適CEM推定器を提案する。
- 参考スコア(独自算出の注目度): 5.821451087760636
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Off-policy evaluation (OPE) for contextual bandit policies becomes challenging when action-level importance weighting incurs excessive variance. Doubly robust (DR) estimation remains unbiased under common support but retains these high-variance action-level weights. A prior estimator, Off-policy evaluation with Conjunct Effect Model (OffCEM), replaces them with more stable cluster-level weights, at the cost of relying on local correctness of the reward model. In this paper, we show that, under the assumptions required by DR and OffCEM, there exists an unbiased family of estimators that interpolates between OffCEM and DR. Building on this result, we propose the Variance Optimal-CEM (VOCEM) estimator, which selects the interpolation coefficient to minimize variance. We derive the population-optimal coefficient in closed form and show that the resulting estimator has variance no larger than either endpoint, OffCEM or DR. Experiments in controlled synthetic settings and on two large-action benchmarks show that VOCEM improves upon both endpoints in all 23 evaluated conditions, exhibiting greater stability and empirical robustness.
- Abstract(参考訳): 行動レベルの重要度重み付けが過度の分散を引き起こすと、文脈的バンディット政策のためのオフ政治評価(OPE)が困難になる。
二重ロバスト(DR)推定は、共通の支持の下では不偏であるが、これらの高分散アクションレベル重みを維持している。
より安定したクラスタレベルの重み付けにより、報酬モデルの局所的正当性に依存して、より安定したクラスタレベルの重み付けに置き換える。
本稿では,DR と OffCEM の仮定の下で,OFCEM と DR を補間する不偏推定器群が存在することを示す。この結果に基づいて,分散を最小化するために補間係数を選択する可変最適CEM (VOCEM) 推定器を提案する。
我々は, 個体群最適係数をクローズド形式で導出し, 結果として得られる推定値が, いずれのエンドポイント, OffCEM あるいは DR よりも大きくないことを示し, 制御された合成設定実験と2つの大アクションベンチマークにより, VOCEM が全ての23条件において両エンドポイントで向上し, 安定性と経験的堅牢性を示すことを示した。
関連論文リスト
- Adaptive Doubly Robust Off-Policy Evaluation for Ranking Policies under Diverse User Behavior [0.7161783472741748]
Inverse Propensity Scoring (IPS) は過度な分散を持つ。
IPS と Reward Interaction IPS (RIPS) は、ユーザーがランキングを閲覧する方法に関する仮定を定め、ばらつきを減らす。
本稿では適応重み付けと再帰回帰を組み合わせた適応二重ロバスト(ADR)を提案する。
論文 参考訳(メタデータ) (2026-08-30T06:43:36Z) - IADD-TR: Intervention-Aware Dynamics Decoupling with Targeted Regularization for Model-Based Reinforcement Learning [57.16513298507272]
IADD-TRは、IADD(Intervention-Aware Dynamics Decoupling)とTR(Targeted Regularization)を組み合わせた統合フレームワークである。
IADDは、ゼロアクションアンカーを用いて、アクション干渉段階とアクションフリー自然進化段階への遷移を分解し、堅牢な一般化のためにこの2段階の分解の非特異性を解決する。
政策学習においては,リプレイ状態の政策段階関数の効率的な影響関数からTRを導出する。
論文 参考訳(メタデータ) (2026-08-11T08:20:02Z) - Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport [6.379494871147752]
インタイムスケーリング手法はプロセス・リワード・モデル(PRM)に依存している。
本研究では, PRMの校正, 条件OT(CondOT)マップ学習 citebunne2022 の修正, 単調条件量子関数の推定における条件最適輸送の最初の利用を提案する。
これにより、構造的に有効な量子的推定が得られ、任意のレベルでの信頼境界の効率的な抽出が可能となる。
論文 参考訳(メタデータ) (2026-05-07T18:00:04Z) - EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training [69.32453275232662]
学習した評論家は、利点のばらつきを減らさずに、取得した状態信号を超える推定ノイズを注入できることを示す。
本稿では,各トレーニングステップでバッチレベルのEVを監視し,批判ベースとバッチ平均の利点推定を適応的に切り替えるEVPOを提案する。
論文 参考訳(メタデータ) (2026-04-21T14:07:39Z) - K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge [51.93484138861584]
視覚生成モデルの急速な開発により、よりスケーラブルで人間に合わせた評価方法の必要性が高まっている。
K-Sort Evalは,後方補正と動的マッチングを統合した信頼性と効率的なVLMに基づく評価フレームワークである。
実験の結果、K-Sort EvalはK-Sort Arenaと一致した評価結果を提供する。
論文 参考訳(メタデータ) (2026-02-10T05:07:46Z) - On the Plasticity and Stability for Post-Training Large Language Models [54.757672540381236]
塑性と安定性勾配の矛盾として根本原因を同定する。
本稿では,確率的衝突解決法(PCR)を提案する。
PCRはトレーニングの軌道を著しく滑らかにし、様々な推論タスクにおいて優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-06T07:31:26Z) - CCE: Confidence-Consistency Evaluation for Time Series Anomaly Detection [56.302586730134806]
本稿では,新しい評価指標である信頼性・一貫性評価(CCE)を紹介する。
CCEは同時に、予測の信頼性と不確実性を測定する。
RankEvalは、さまざまなメトリクスのランキング機能を比較するためのベンチマークです。
論文 参考訳(メタデータ) (2025-09-01T03:38:38Z) - Off-Policy Evaluation for Large Action Spaces via Conjunct Effect
Modeling [30.835774920236872]
大規模離散行動空間に対する文脈的帯域ポリシーの非政治的評価について検討する。
共役効果モデル (CEM) に基づく新しい推定器であるOffCEMを提案し, 因果効果をクラスター効果に分解し, 残留効果を示す。
実験により、OFCEMは特に多くのアクションが存在する場合、OPEを大幅に改善することが示された。
論文 参考訳(メタデータ) (2023-05-14T04:16:40Z) - Off-Policy Evaluation via the Regularized Lagrangian [110.28927184857478]
最近提案された分布補正推定(DICE)ファミリーは, 行動に依存しないデータを用いた非政治的評価において, 技術の現状を推し進めている。
本稿では,これらを線形プログラムの正規化ラグランジアンとして統一する。
双対解は、安定性と推定バイアスの間のトレードオフをナビゲートする際の柔軟性を向上し、一般的にはより優れた見積もりを提供する。
論文 参考訳(メタデータ) (2020-07-07T13:45:56Z) - Distributional robustness of K-class estimators and the PULSE [4.56877715768796]
古典的Kクラス推定器は、Kクラス推定器とアンカー回帰との接続を確立することにより、そのような最適性を満たすことを証明する。
データ駆動型シミュレーションKクラス推定器として効率的に計算できることを示す。
弱い楽器の設定を含むいくつかの設定があり、他の推定値よりも優れています。
論文 参考訳(メタデータ) (2020-05-07T09:39:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。