論文の概要: Online Inference in Distributional Temporal-Difference Learning
- arxiv url: http://arxiv.org/abs/2608.14408v1
- Date: Fri, 14 Aug 2026 15:51:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.427194
- Title: Online Inference in Distributional Temporal-Difference Learning
- Title(参考訳): 分散時間差学習におけるオンライン推論
- Abstract要約: 本研究では, 返却分布の関数に対するオンライン統計的推測を定式化して検討した。
Polyak--Ruppert 平均推定器について、そのルート-$T$誤差がクラメル空間のガウスランダム要素に弱収束することを証明する。
非滑らかな統計汎関数に対しては、有限個のしきい値からなる$T-1/2$-隣り合わせで推定された戻り値 CDF の局所理論を開発する。
- 参考スコア(独自算出の注目度): 12.653922692549969
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study online statistical inference for functionals of the return distribution under a fixed policy. The return distribution is estimated by nonparametric distributional temporal-difference learning from a single Markov trajectory. For the Polyak--Ruppert averaged estimator, we prove that its root-$T$ error converges weakly to a centered Gaussian random element in Cramér space. We also prove that, conditionally on the observed trajectory, the root-$T$ difference between the bootstrap and original averages converges weakly to the same Gaussian limit. These results justify bootstrap inference for smooth statistical functionals, including variance, CVaR, expected shortfall, and expectiles. For nonsmooth statistical functionals, we develop a local asymptotic theory for the estimated return CDF over $T^{-1/2}$-neighborhoods of finitely many thresholds, together with its bootstrap analogue. This theory allows us to conduct inference for nonsmooth statistical functionals characterized by CDF equations, including return quantiles.
- Abstract(参考訳): 固定ポリシの下で,返却分布の関数に対するオンライン統計的推測について検討した。
回帰分布は1つのマルコフ軌道からの非パラメトリック分布時間差学習により推定される。
Polyak--Ruppert 平均推定器について、そのルート-$T$誤差がクラメル空間のガウスランダム要素に弱収束することを証明する。
また、観測軌道上では、ブートストラップと元の平均とのルート=T$差が同じガウス極限に弱収束していることも証明した。
これらの結果は, 変動, CVaR, 期待不足, 期待値を含むスムーズな統計関数に対するブートストラップ推論を正当化する。
非滑らかな統計汎関数に対しては、そのブートストラップアナログとともに有限個のしきい値からなる$T^{-1/2}$-隣辺での推定戻りCDFの局所漸近理論を開発する。
この理論により、戻り量子を含むCDF方程式によって特徴づけられる非滑らかな統計汎関数の推論を行うことができる。
関連論文リスト
- The V-fold jackknife for semiparametric inference: variance estimation, confidence intervals, and simultaneous confidence bands [2.715949869811686]
bootstrapは、その広範な適用性と最小限の分析要件のため、統計的推論のデフォルトツールである。
我々は,半パラメトリック推論の計算効率と理論的に正当化された代替手段として,$V$フォールド・ジャックナイフを開発した。
論文 参考訳(メタデータ) (2026-07-24T17:05:54Z) - Statistical Efficiency and Inference of Quantile Distributional Reinforcement Learning [16.700969464418936]
統計的効率の観点から, 量子化に基づく分布強化学習について検討する。
W_infty$ の上限の下で $_m(n)$ と $_m$ の非漸近誤差を定めている。
量子化に基づく推定器は、無限次元の極限においてパラメトリックに効率的であることを示す。
論文 参考訳(メタデータ) (2026-07-09T13:06:07Z) - Efficient reductions from a Gaussian source with applications to statistical-computational tradeoffs [8.162867143465382]
我々はこの手法を利用して、平均ケースの複雑さにおいて広く信じられている予想の下で、いくつかの正準高次元統計モデルに対して、還元に基づく計算下界を確立する。
ガウス雑音を持つスパイクテンソルPCAの計算下界は、クラス内の他のガウス雑音分布にまで拡張可能であることを示す。
論文 参考訳(メタデータ) (2025-10-08T17:16:36Z) - Robust Estimation for Kernel Exponential Families with Smoothed Total Variation Distances [2.317910166616341]
統計的推測では、標本は独立であり、確率分布から同一に分布していると一般的に仮定する。
本稿では,GAN-like 推定器の一般統計モデルへの応用について検討する。
論文 参考訳(メタデータ) (2024-10-28T05:50:47Z) - Online Bootstrap Inference with Nonconvex Stochastic Gradient Descent
Estimator [0.0]
本稿では,凸問題の文脈における統計的推論のための勾配降下(SGD)の理論的性質について検討する。
多重誤差最小値を含む2つの干渉手順を提案する。
論文 参考訳(メタデータ) (2023-06-03T22:08:10Z) - Distributional Reinforcement Learning with Dual Expectile-Quantile Regression [51.87411935256015]
分布RLに対する量子レグレッションアプローチは、任意の戻り分布を柔軟かつ効果的に学習する方法を提供する。
我々は,分布推定が消失することを示し,推定分布が急速に平均に崩壊することを実証的に観察した。
我々は,$L$の学習効率に感化され,効率のよい学習方法として,返却分布の期待値と量子値を共同で学習することを提案する。
論文 参考訳(メタデータ) (2023-05-26T12:30:05Z) - Kernel-based off-policy estimation without overlap: Instance optimality
beyond semiparametric efficiency [53.90687548731265]
本研究では,観測データに基づいて線形関数を推定するための最適手順について検討する。
任意の凸および対称函数クラス $mathcalF$ に対して、平均二乗誤差で有界な非漸近局所ミニマックスを導出する。
論文 参考訳(メタデータ) (2023-01-16T02:57:37Z) - Robust computation of optimal transport by $\beta$-potential
regularization [79.24513412588745]
最適輸送(OT)は、確率分布間の差を測定する機械学習分野で広く使われているツールである。
我々は、いわゆる$beta$-divergenceに付随するベータポテンシャル項でOTを正規化することを提案する。
提案アルゴリズムで計算した輸送行列は,外乱が存在する場合でも確率分布を頑健に推定するのに役立つことを実験的に実証した。
論文 参考訳(メタデータ) (2022-12-26T18:37:28Z) - Covariance Estimators for the ROOT-SGD Algorithm in Online Learning [7.00422423634143]
ROOT-SGDのアルゴリズム共分散に対する2つの推定器を開発した。
最初の推定器はプラグインの考え方を採用し, 共分散公式の未知の要素ごとに, 経験的手法で置き換える。
2つ目の推定器は、制限を克服するヘッセン自由推定器である。
論文 参考訳(メタデータ) (2022-12-02T15:55:52Z) - Optimal policy evaluation using kernel-based temporal difference methods [78.83926562536791]
カーネルヒルベルト空間を用いて、無限水平割引マルコフ報酬過程の値関数を推定する。
我々は、関連するカーネル演算子の固有値に明示的に依存した誤差の非漸近上界を導出する。
MRP のサブクラスに対する minimax の下位境界を証明する。
論文 参考訳(メタデータ) (2021-09-24T14:48:20Z) - SLOE: A Faster Method for Statistical Inference in High-Dimensional
Logistic Regression [68.66245730450915]
実用データセットに対する予測の偏見を回避し、頻繁な不確実性を推定する改善された手法を開発している。
私たちの主な貢献は、推定と推論の計算時間をマグニチュードの順序で短縮する収束保証付き信号強度の推定器SLOEです。
論文 参考訳(メタデータ) (2021-03-23T17:48:56Z) - Distributional Reinforcement Learning via Moment Matching [54.16108052278444]
ニューラルネットワークを用いて各戻り分布から統計量の有限集合を学習する手法を定式化する。
我々の手法は、戻り分布とベルマン目標の間のモーメントの全ての順序を暗黙的に一致させるものとして解釈できる。
Atariゲームスイートの実験により,本手法は標準分布RLベースラインよりも優れていることが示された。
論文 参考訳(メタデータ) (2020-07-24T05:18:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。