論文の概要: Stability and Sensitivity Analysis of Relative Temporal-Difference Learning: Extended Version
- arxiv url: http://arxiv.org/abs/2603.27874v2
- Date: Tue, 07 Apr 2026 15:04:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 15:04:55.34726
- Title: Stability and Sensitivity Analysis of Relative Temporal-Difference Learning: Extended Version
- Title(参考訳): 相対時間差学習の安定性と感度分析:拡張版
- Abstract要約: 相対時間差学習(TD)は、割引係数が1に近づくと、TD法の緩やかな収束に導入された。
本稿では,線形関数近似を用いて相対的TD学習を分析する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Relative temporal-difference (TD) learning was introduced to mitigate the slow convergence of TD methods when the discount factor approaches one by subtracting a baseline from the temporal-difference update. While this idea has been studied in the tabular setting, stability guarantees with function approximation remain poorly understood. This paper analyzes relative TD learning with linear function approximation. We establish stability conditions for the algorithm and show that the choice of baseline distribution plays a central role. In particular, when the baseline is chosen as the empirical distribution of the state-action process, the algorithm is stable for any non-negative baseline weight and any discount factor. We also provide a sensitivity analysis of the resulting parameter estimates, characterizing both asymptotic bias and covariance. The asymptotic covariance and asymptotic bias are shown to remain uniformly bounded as the discount factor approaches one.
- Abstract(参考訳): 時間差分更新から基準線を減じて、割引係数が1に近づくと、TD法の緩やかな収束を緩和するために、相対時間差分学習(TD)を導入した。
この考え方は表形式で研究されているが、関数近似による安定性の保証はいまだに理解されていない。
本稿では,線形関数近似を用いて相対的TD学習を分析する。
我々は,アルゴリズムの安定性条件を確立し,ベースライン分布の選択が中心的な役割を果たすことを示す。
特に、ベースラインが状態-作用過程の実験的分布として選択された場合、アルゴリズムは非負のベースライン重みと割引係数に対して安定である。
また、漸近バイアスと共分散の両方を特徴付けるパラメータ推定結果の感度解析を行った。
漸近的共分散と漸近的偏差は、割引係数が1に近づくにつれて一様に保たれる。
関連論文リスト
- Statistical Inference on Gradient Flows [46.05870703588429]
経験的リスク最小化から生じる勾配流の時間一様統計的推測の理論を考案する。
本稿では,勾配流と連動して進化し,行列の逆転,再サンプリング,サンプル分割を回避するアルゴリズム対応共分散推定器を提案する。
この結果は統計的推測と最適化力学を結びつけ、勾配法における不確実性定量化のための実用的なツールを提供する。
論文 参考訳(メタデータ) (2026-05-31T14:22:37Z) - Statistical Inference for Stochastic Gradient Descent Beyond Finite Variance [10.36372217426986]
勾配降下 (SGD) は、大規模統計学習と最適化のための基礎アルゴリズムである。
我々は,SGD軌道から信頼領域を構築するための,効率的なモデルに依存しない手法を開発した。
論文 参考訳(メタデータ) (2026-05-25T16:18:39Z) - Statistical Inference for Temporal Difference Learning with Linear Function Approximation [55.80276145563105]
The statistics properties of Temporal difference learning with Polyak-Ruppert averaging。
3つの理論的な貢献により、現在の最先端の成果が向上する。
論文 参考訳(メタデータ) (2024-10-21T15:34:44Z) - Unlearning-based Neural Interpretations [51.99182464831169]
静的関数を用いて定義される現在のベースラインは、バイアスがあり、脆弱であり、操作可能であることを示す。
UNIは、学習不可能で、偏りがなく、適応的なベースラインを計算し、入力を最も急な上昇の未学習方向に向けて摂動させることを提案する。
論文 参考訳(メタデータ) (2024-10-10T16:02:39Z) - The ODE Method for Stochastic Approximation and Reinforcement Learning with Markovian Noise [23.71604056844816]
近似アルゴリズムを解析する根本的な課題は、その安定性を確立することである。
我々は、マルティンゲール差分雑音設定からマルコフ雑音設定へ有界な安定性に対するボルカール・メインの定理を拡張した。
論文 参考訳(メタデータ) (2024-01-15T17:20:17Z) - A Stability Principle for Learning under Non-Stationarity [1.1510009152620668]
非定常環境における統計的学習のための多目的フレームワークを開発する。
我々は、人口損失が強く凸している場合やリプシッツのみにおいて、最小限の最小値である後悔境界を対数的要因まで証明する。
本研究は,需要予測と病院看護スタッフの実際のデータ実験を通じて,本手法の実用性を評価する。
論文 参考訳(メタデータ) (2023-10-27T17:53:53Z) - Non-Parametric Learning of Stochastic Differential Equations with Non-asymptotic Fast Rates of Convergence [65.63201894457404]
非線形微分方程式のドリフトと拡散係数の同定のための新しい非パラメトリック学習パラダイムを提案する。
鍵となる考え方は、基本的には、対応するフォッカー・プランク方程式のRKHSに基づく近似をそのような観測に適合させることである。
論文 参考訳(メタデータ) (2023-05-24T20:43:47Z) - Data-Driven Influence Functions for Optimization-Based Causal Inference [105.5385525290466]
統計的汎関数に対するガトー微分を有限差分法で近似する構成的アルゴリズムについて検討する。
本研究では,確率分布を事前知識がないが,データから推定する必要がある場合について検討する。
論文 参考訳(メタデータ) (2022-08-29T16:16:22Z) - Understanding and Detecting Convergence for Stochastic Gradient Descent
with Momentum [18.88380216480131]
本稿では,一定の学習率と運動量を有する勾配勾配について考察する。
連続勾配間の内積を用いた定常位相収束の統計的診断試験を構築した。
論文 参考訳(メタデータ) (2020-08-27T16:24:18Z) - On Learning Rates and Schr\"odinger Operators [105.32118775014015]
本稿では,学習率の影響に関する一般的な理論的分析を行う。
学習速度は、幅広い非ニューラルクラス関数に対してゼロとなる傾向にある。
論文 参考訳(メタデータ) (2020-04-15T09:52:37Z) - Is Temporal Difference Learning Optimal? An Instance-Dependent Analysis [102.29671176698373]
我々は、割引決定過程における政策評価の問題に対処し、生成モデルの下で、ll_infty$errorに対するマルコフに依存した保証を提供する。
我々は、ポリシー評価のために、局所ミニマックス下限の両漸近バージョンと非漸近バージョンを確立し、アルゴリズムを比較するためのインスタンス依存ベースラインを提供する。
論文 参考訳(メタデータ) (2020-03-16T17:15:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。