論文の概要: Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random
- arxiv url: http://arxiv.org/abs/2606.20206v1
- Date: Thu, 18 Jun 2026 13:19:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.872784
- Title: Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random
- Title(参考訳): ランダムに欠席したMDPの失業リスクに対するオフ・ポリシィ評価
- Authors: Ziheng Wei, Annie Qu, Rui Miao,
- Abstract要約: オフラインの強化学習では、ログ化されたバッチデータの即時報酬は、スパースや不規則なレコード保持のため、しばしば無視される。
この問題は、医療やマーケティングなど、実践的な設定で発生する。
報酬依存確率モデルを定式化し、将来の状態を影変数として使用し、全データ条件の平均報酬を同定する。
- 参考スコア(独自算出の注目度): 3.3867417468597574
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In offline Reinforcement Learning, immediate rewards in logged batch data are often unobserved due to sparse or irregular record-keeping, or censored beyond certain reward values. This issue arises in practical settings, including health care and marketing. We investigate off-policy evaluation (OPE) in finite-horizon Markov decision processes when rewards are missing not at random (MNAR), which breaks ignorability and induces selection bias even after conditioning on states and actions. To address this, we formalize a reward-dependent propensity model and use future states as shadow variables to identify the full-data conditional mean reward. We further introduce a bridge function that recovers the conditional mean reward without explicitly modeling the MNAR mechanism, and estimate it via a min-max procedure to avoid double sampling. Building upon these identification results, we propose an Fitted-Q-Evaluation-style estimator that propagates the recovered rewards while allowing target policies to depend on past missingness indicators. Finally, we establish consistency and finite-sample error bounds for our OPE estimator, and show through experiments the strong performance of our method compared to existing methods on simulated and MIMIC-III Sepsis data.
- Abstract(参考訳): オフラインの強化学習(Reinforcement Learning)では、ログ化されたバッチデータの即時報酬は、スパースや不規則なレコード保持のために無視されるか、特定の報酬値を超えて検閲されることが多い。
この問題は、医療やマーケティングなど、実践的な設定で発生する。
我々は,有限水平マルコフ決定過程において,報酬がランダムでなければ(MNAR)、無知を破り,状態や行動に条件を付けた後でも選択バイアスを生じさせる非政治的評価(OPE)について検討する。
これを解決するために、報酬依存の確率モデルを定式化し、将来の状態を影変数として使用して、全データ条件付き平均報酬を識別する。
さらに,MNAR機構を明示的にモデル化することなく条件平均報酬を復元するブリッジ関数を導入する。
これらの識別結果に基づいて、過去の失明指標に依存しつつ、回収した報酬を伝達するFitted-Q-Evaluation-style estimatorを提案する。
最後に、OPE推定器の整合性および有限サンプル誤差境界を確立し、実験を通して、シミュレーションおよびMIMIC-IIISepsisデータに対する既存の手法と比較して、我々の手法の強い性能を示す。
関連論文リスト
- A Principled Approach to Randomized Selection under Uncertainty: Applications to Peer Review and Grant Funding [61.86327960322782]
本稿では,各項目の品質の間隔推定に基づくランダム化意思決定の枠組みを提案する。
最適化に基づく最適化手法であるMERITを導入する。
MERITが既存のアプローチで保証されていない望ましい公理特性を満たすことを証明している。
論文 参考訳(メタデータ) (2025-06-23T19:59:30Z) - Deterministic Uncertainty Propagation for Improved Model-Based Offline Reinforcement Learning [12.490614705930676]
本稿では,ベルマン目標計算によって得られたモンテカルロ試料数に対する準最適性の強い依存性を示す理論的結果を示す。
我々の主な貢献は、進行モーメントマッチングを利用するベルマン目標に対する決定論的近似である。
我々は,既存のモンテカルロサンプリング手法よりもMOMBOの準最適性について,より厳密な保証を提供することが可能であることを示す。
論文 参考訳(メタデータ) (2024-06-06T13:58:41Z) - Adaptive Conformal Prediction by Reweighting Nonconformity Score [0.0]
我々は、QRF(Quantile Regression Forest)を用いて、不整合スコアの分布を学習し、QRFの重みを利用して、テストポイントに類似した残差を持つサンプルにより重要度を割り当てる。
提案手法は,仮定のない有限標本境界範囲と訓練条件範囲を満足し,適切な仮定の下で条件付き範囲を確保できる。
論文 参考訳(メタデータ) (2023-03-22T16:42:19Z) - Reward Imputation with Sketching for Contextual Batched Bandits [48.80803376405073]
コンテキストバッチバンドイット(Contextual batched bandit、CBB)は、各エピソードの最後に環境から報酬のバッチを観測する設定である。
CBBの既存のアプローチは、実行されていないアクションの報酬を無視し、フィードバック情報の未利用につながることが多い。
本研究では,未観測の報酬をスケッチを用いて完遂するSketched Policy Updating with Imputed Rewards (SPUIR)を提案する。
論文 参考訳(メタデータ) (2022-10-13T04:26:06Z) - Proximal Reinforcement Learning: Efficient Off-Policy Evaluation in
Partially Observed Markov Decision Processes [65.91730154730905]
医療や教育などの観察データへのオフライン強化学習の適用においては、観察された行動は観測されていない要因に影響される可能性があるという一般的な懸念がある。
ここでは、部分的に観察されたマルコフ決定過程(POMDP)における非政治評価を考慮し、この問題に取り組む。
我々は、近位因果推論の枠組みをPOMDP設定に拡張し、識別が可能となる様々な設定を提供する。
論文 参考訳(メタデータ) (2021-10-28T17:46:14Z) - Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement
Learning [70.01650994156797]
教育医療などのバッチ強化学習において、観察データからのシーケンシャルな意思決定方針のオフ・アセスメントが必要である。
我々は、ある政策の境界を推定するアプローチを開発する。
より凝縮したデータを集めることで、シャープな境界への収束を証明します。
論文 参考訳(メタデータ) (2020-02-11T16:18:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。