論文の概要: Fitted Occupancy-Ratio Evaluation without Bellman Completeness
- arxiv url: http://arxiv.org/abs/2607.05375v1
- Date: Mon, 06 Jul 2026 17:53:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.270869
- Title: Fitted Occupancy-Ratio Evaluation without Bellman Completeness
- Title(参考訳): ベルマン完全性のない適合咬合率評価
- Abstract要約: 職業比は、オフライン強化学習における分布シフトを正す。
本稿では, 占有率の低下を特徴付ける固定点配置法である, 占有率評価 (FORE) を提案する。
経験的再帰について、KL における収束を対数比近似誤差に導く有限サンプル後悔境界を確立する。
- 参考スコア(独自算出の注目度): 40.322273308230606
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Occupancy ratios correct distribution shift in offline reinforcement learning and are central to off-policy evaluation. Existing primal-dual and minimax methods typically estimate these ratios by enforcing occupancy-balance moments over a critic class. We propose fitted occupancy-ratio evaluation (FORE), a fitted fixed-point method that characterizes the discounted occupancy ratio through an adjoint Bellman recursion. At each iteration, FORE solves a single-level density-ratio objective on one-step-transition data, thereby projecting the adjoint Bellman image onto a log-ratio class in Kullback--Leibler (KL) divergence. Unlike analyses of fitted Q-evaluation, which typically require value-function realizability together with Bellman completeness or projected-operator stability, our central approximation condition is just realizability of the discounted occupancy ratio itself. Under this condition, the population KL-projected recursion contracts in relative entropy toward the true ratio by virtue of the adjoint Bellman operator being a KL-contraction. For the empirical recursion, we establish finite-sample regret bounds that yield convergence in KL up to log-ratio approximation error and a statistical error governed by the complexity of the ratio hypothesis class. The fitted ratio supports direct value estimation by reward reweighting, occupancy-weighted fitted Q-evaluation, and doubly robust estimation that combines the fitted ratio with a fitted Q-function. Together, these results identify discounted occupancy-ratio realizability as a sufficient condition for offline policy evaluation without any completeness assumptions.
- Abstract(参考訳): 職業比率は、オフライン強化学習における分布変化を正し、非政治評価の中心となる。
既存の原始双対法とミニマックス法は、批判階級に占有バランスモーメントを強制することによってこれらの比率を推定するのが一般的である。
本稿では,隣り合うベルマン再帰を通した割引占有率を特徴付ける固定点法である適合占有率評価(FORE)を提案する。
各イテレーションにおいて、FOREは1段階の遷移データに対して1レベル密度比の目的を解き、KL(Kullback--Leibler)の分岐において、隣接するベルマン像を対数比のクラスに投影する。
ベルマン完全性やプロジェクテッド・オペレーショナル安定性とともに、一般に値関数の再現性を必要とする適合Q-評価の解析とは異なり、我々の中心的近似条件は、割引占有率自体の実現可能性である。
この条件下では、KL-プロジェクターはKL-トラクションである随伴ベルマン作用素により、相対エントロピーの真の比に対する再帰契約を提出した。
経験的再帰について、KLの収束を対数比近似誤差と比仮説クラスの複雑性に支配される統計的誤差に導く有限サンプル後悔境界を確立する。
適合比は、報酬再重み付けによる直接値推定、占有重み付き適合Q値評価、および適合比と適合Q値関数を組合せた二重ロバストな推定をサポートする。
これらの結果から, 完全性の仮定を伴わないオフライン政策評価に十分な条件として, 割引占有率実現可能性を確認した。
関連論文リスト
- Bellman Calibration for Marginalized Importance Weighting in Offline Reinforcement Learning [40.322273308230606]
一次元モデルに依存しない後処理法である等速ベルマンキャリブレーションを導入する。
提案手法は, 1次元の非減少型変換に適合した占有率評価(FORE)を適用することにより, 推定値のスケールと形状を補正する。
キャリブレーション・リファインダは, キャリブレーション誤差の小さい任意の適合比が, 最良な後処理とほぼ同等であることを示す。
論文 参考訳(メタデータ) (2026-08-25T17:44:02Z) - Convex-Hull-Neighborhood Smooth Dual Generalization: Controlling Local Correction Propagation in Offline RL [7.803284875836737]
ブートストラップは オフライン強化学習における 推定誤差を増幅する
本稿では,ベルマンのバックアップをサンプル値のターゲットとして表現し,CHN局所補正を行うConvex Hull Neborhood Smooth Dual Generalizationを提案する。
Gym-MuJoCoとAntMazeの実験は、強力な集約性能と安定した値推定を示す。
論文 参考訳(メタデータ) (2026-08-04T04:30:02Z) - Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning [58.088509347353465]
強化学習(Reinforcement Learning, RL)は、言語モデルトレーニングにおいて広く使われている。
我々は,このトレードオフに明確な統計的解釈を与えるゲーム理論の枠組みを提案する。
論文 参考訳(メタデータ) (2026-07-29T00:19:09Z) - Distributional Soft Bellman Operator under the Cramér Geometry [19.762345326138536]
本稿では,DSPIの政策評価ステップに関連する,クラメール幾何学的ベルマンの不動点について検討する。
これは、DSPIスタイルのアルゴリズムにおいて、近似批評家、評価誤差、および批判損失設計を研究するための基準点を提供する。
論文 参考訳(メタデータ) (2026-07-20T12:44:30Z) - Quotient-Categorical Representations for Bellman-Compatible Average-Reward Distributional Reinforcement Learning [8.988097534171995]
本稿では、状態付きバイアス法則を共通翻訳まで特定する商空間定式化を導入する。
同期の正確な更新は、商法レベルでゲイン非依存であることを示す。
論文 参考訳(メタデータ) (2026-05-11T22:17:09Z) - Fitted Q Evaluation Without Bellman Completeness via Stationary Weighting [40.322273308230606]
この仮定の必要性は、基本的な標準ミスマッチに由来する。
定常密度比の推定値を用いて各回帰ステップを再重み付けする。
これにより、実現可能性やベルマン完全性の欠如を強く評価できる。
論文 参考訳(メタデータ) (2025-12-29T19:04:40Z) - Stability and Generalization for Bellman Residuals [8.250374560598493]
ベルマン残留最小化(BRM)はオフライン強化学習の魅力的な治療法として浮上している。
本稿では,SGDAが近傍のデータセット上で実行され,O(1/n)平均引数-安定性境界が得られる,単一のリアプノフポテンシャルを紹介する。
その結果、標準のニューラルネットワークパラメータ化とミニバッチSGDが得られた。
論文 参考訳(メタデータ) (2025-08-26T07:15:36Z) - To bootstrap or to rollout? An optimal and adaptive interpolation [4.755935781862859]
本稿では,ブートストラップ法とロールアウト法を補間するベルマン演算子のクラスを紹介する。
我々の推定器は、ブートストラップに基づく時間差(TD)推定器とロールアウトに基づくモンテカルロ(MC)手法の強度を組み合わせる。
論文 参考訳(メタデータ) (2024-11-14T19:00:00Z) - Relaxed Quantile Regression: Prediction Intervals for Asymmetric Noise [51.87307904567702]
量子レグレッション(Quantile regression)は、出力の分布における量子の実験的推定を通じてそのような間隔を得るための主要なアプローチである。
本稿では、この任意の制約を除去する量子回帰に基づく区間構成の直接的な代替として、Relaxed Quantile Regression (RQR)を提案する。
これにより、柔軟性が向上し、望ましい品質が向上することが実証された。
論文 参考訳(メタデータ) (2024-06-05T13:36:38Z) - Optimal variance-reduced stochastic approximation in Banach spaces [114.8734960258221]
可分バナッハ空間上で定義された収縮作用素の定点を推定する問題について検討する。
演算子欠陥と推定誤差の両方に対して漸近的でない境界を確立する。
論文 参考訳(メタデータ) (2022-01-21T02:46:57Z) - Bayesian Bellman Operators [55.959376449737405]
ベイズ強化学習(RL)の新しい視点について紹介する。
我々のフレームワークは、ブートストラップが導入されたとき、モデルなしアプローチは実際には値関数ではなくベルマン作用素よりも後部を推測する、という洞察に動機づけられている。
論文 参考訳(メタデータ) (2021-06-09T12:20:46Z) - Evaluating probabilistic classifiers: Reliability diagrams and score
decompositions revisited [68.8204255655161]
確率的に統計的に一貫性があり、最適に結合し、再現可能な信頼性図を自動生成するCORP手法を導入する。
コーパスは非パラメトリックアイソトニック回帰に基づいており、プール・アジャセント・ヴァイオレータ(PAV)アルゴリズムによって実装されている。
論文 参考訳(メタデータ) (2020-08-07T08:22:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。