論文の概要: Extending Differential Temporal Difference Methods for Episodic Problems
- arxiv url: http://arxiv.org/abs/2605.04368v1
- Date: Wed, 06 May 2026 00:10:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.585136
- Title: Extending Differential Temporal Difference Methods for Episodic Problems
- Title(参考訳): エピソード問題に対する時間差分法の拡張
- Abstract要約: 時間差差分法(TD)は、値に基づく強化学習アルゴリズムである。
エピソード問題を中心とした報酬について検討し、微分TDの一般化を提案する。
線形TDの形式と等価性を示し、それらのアルゴリズムで示された理論的保証を継承する。
- 参考スコア(独自算出の注目度): 4.184451801360084
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Differential temporal difference (TD) methods are value-based reinforcement learning algorithms that have been proposed for infinite-horizon problems. They rely on reward centering, where each reward is centered by the average reward. This keeps the return bounded and removes a value function's state-independent offset. However, reward centering can alter the optimal policy in episodic problems, limiting its applicability. Motivated by recent works that emphasize the role of normalization in streaming deep reinforcement learning, we study reward centering in episodic problems and propose a generalization of differential TD. We prove that this generalization maintains the ordering of policies in the presence of termination, and thus extends differential TD to episodic problems. We show equivalence with a form of linear TD, thereby inheriting theoretical guarantees that have been shown for those algorithms. We then extend several streaming reinforcement learning algorithms to their differential counterparts. Across a range of base algorithms and environments, we empirically validate that reward centering can improve sample efficiency in episodic problems.
- Abstract(参考訳): 微分時間差法(英: Differential temporal difference, TD)は、無限水平問題に対して提案された値に基づく強化学習アルゴリズムである。
彼らは報酬中心の報酬に頼っており、各報酬は平均的な報酬に中心を置いている。
これにより戻り値がバウンドされ、値関数の状態独立オフセットが削除される。
しかし、報酬センタリングは、エピソード問題における最適ポリシーを変更し、適用性を制限することができる。
ストリーミング深層強化学習における正規化の役割を強調した最近の研究に触発され, エピソード問題を中心とした報酬について検討し, 微分TDの一般化を提案する。
この一般化は、終端の存在下でポリシーの順序を保ち、したがって微分TDをエピソード問題に拡張する。
線形TDの形式と等価性を示し、それらのアルゴリズムで示された理論的保証を継承する。
次に、いくつかのストリーミング強化学習アルゴリズムを、その差分に拡張します。
様々な基礎アルゴリズムや環境において,報奨センタリングがエピソード問題におけるサンプル効率を向上させることを実証的に検証する。
関連論文リスト
- Almost Sure Convergence of Differential Temporal Difference Learning for Average Reward Markov Decision Processes [19.67390261007849]
差分時間差(TD)学習アルゴリズムは、平均報酬RLの大きな進歩である。
既存の収束保証は、州訪問数に関連する学習率の局所的な時計を必要とする。
ローカルクロックを使わずに、標準的な減少する学習率を用いて、任意の$n$に対して、オンラインの$n$-step差分TDがほぼ確実に収束していることを証明する。
論文 参考訳(メタデータ) (2026-02-18T17:24:27Z) - Amortized Posterior Sampling with Diffusion Prior Distillation [55.03585818289934]
Amortized Posterior Smplingは、逆問題における効率的な後方サンプリングのための新しい変分推論手法である。
本手法は,拡散モデルにより暗黙的に定義された変動分布と後続分布とのばらつきを最小限に抑えるために条件付き流れモデルを訓練する。
既存の手法とは異なり、我々のアプローチは教師なしであり、ペア化されたトレーニングデータを必要としておらず、ユークリッドと非ユークリッドの両方のドメインに適用できる。
論文 参考訳(メタデータ) (2024-07-25T09:53:12Z) - Episodic Return Decomposition by Difference of Implicitly Assigned
Sub-Trajectory Reward [8.445578144906415]
本稿では,ダイアスターと呼ばれる新しいエピソード回帰分解法を提案する。
ダイアスターはエピソード報酬を任意のカットポイントで2つの分割されたサブトラジェクトリのクレジットに分解する。
実験結果から,本手法は試料効率と性能の両面から従来の最先端手法よりも優れていることがわかった。
論文 参考訳(メタデータ) (2023-12-17T07:58:19Z) - Maximum-Likelihood Inverse Reinforcement Learning with Finite-Time
Guarantees [56.848265937921354]
逆強化学習(IRL)は報酬関数と関連する最適ポリシーを回復することを目的としている。
IRLの多くのアルゴリズムは本質的にネスト構造を持つ。
我々は、報酬推定精度を損なわないIRLのための新しいシングルループアルゴリズムを開発した。
論文 参考訳(メタデータ) (2022-10-04T17:13:45Z) - Instance-Dependent Confidence and Early Stopping for Reinforcement
Learning [99.57168572237421]
強化学習(RL)のための様々なアルゴリズムは、その収束率の劇的な変動を問題構造の関数として示している。
この研究は、観察されたパフォーマンスの違いについて、textitexを説明する保証を提供する。
次の自然なステップは、これらの理論的保証を実際に有用なガイドラインに変換することです。
論文 参考訳(メタデータ) (2022-01-21T04:25:35Z) - Anti-Concentrated Confidence Bonuses for Scalable Exploration [57.91943847134011]
固有の報酬は、探検と探検のトレードオフを扱う上で中心的な役割を果たす。
楕円ボーナスを効率的に近似するためのエンファンティ集中型信頼境界を導入する。
我々は,Atariベンチマーク上での現代固有の報酬と競合する,深層強化学習のための実用的な変種を開発する。
論文 参考訳(メタデータ) (2021-10-21T15:25:15Z) - Can Q-learning solve Multi Armed Bantids? [0.0]
現在の強化学習アルゴリズムでは,マルチアーマッド・バンディット問題を解くことができないことを示す。
これはポリシー間の差異が原因であり、2つの問題を引き起こす。
本稿では,アダプティブ・シンメトリ・リワード・ノーミング(ASRN)手法を提案する。
論文 参考訳(メタデータ) (2021-10-21T07:08:30Z) - Beyond Value-Function Gaps: Improved Instance-Dependent Regret Bounds
for Episodic Reinforcement Learning [50.44564503645015]
有限エピソードマルコフ決定過程における強化学習のための改良されたギャップ依存的後悔境界を提供する。
楽観的なアルゴリズムでは,より強い後悔境界を証明し,多数のMDPに対して新たな情報理論的下限を伴う。
論文 参考訳(メタデータ) (2021-07-02T20:36:05Z) - Emphatic Algorithms for Deep Reinforcement Learning [43.17171330951343]
時間差学習アルゴリズムは関数近似とオフポリシーサンプリングを組み合わせると不安定になる。
強調時間差(ETD($lambda$)アルゴリズム)は、TD($lambda$)更新を適切に重み付けすることで線形の場合の収束を保証する。
本稿では,ETD($lambda$)をフォワードビュー・マルチステップ・リターンを用いた一般的な深層強化学習アルゴリズムに適用することにより,性能が低下することを示す。
論文 参考訳(メタデータ) (2021-06-21T12:11:39Z) - Decentralized Local Stochastic Extra-Gradient for Variational
Inequalities [125.62877849447729]
我々は、不均一(非IID)で多くのデバイスに分散する問題データを持つ領域上での分散変分不等式(VIs)を考察する。
我々は、完全に分散化された計算の設定を網羅する計算ネットワークについて、非常に一般的な仮定を行う。
理論的には, モノトン, モノトンおよび非モノトンセッティングにおける収束速度を理論的に解析する。
論文 参考訳(メタデータ) (2021-06-15T17:45:51Z) - Simple and optimal methods for stochastic variational inequalities, II:
Markovian noise and policy evaluation in reinforcement learning [9.359939442911127]
本稿ではマルコフ雑音下での変分不等式(VI)のリセットに着目する。
我々のアルゴリズム開発における顕著な応用は、強化学習における政策評価問題である。
論文 参考訳(メタデータ) (2020-11-15T04:05:22Z) - Policy Gradient for Continuing Tasks in Non-stationary Markov Decision
Processes [112.38662246621969]
強化学習は、マルコフ決定プロセスにおいて期待される累積報酬を最大化するポリシーを見つけることの問題を考える。
我々は、ポリシーを更新するために上昇方向として使用する値関数の偏りのないナビゲーション勾配を計算する。
ポリシー勾配型アルゴリズムの大きな欠点は、定常性の仮定が課せられない限り、それらがエピソジックなタスクに限定されていることである。
論文 参考訳(メタデータ) (2020-10-16T15:15:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。