論文の概要: Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.02034v1
- Date: Mon, 03 Aug 2026 10:30:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.487875
- Title: Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning
- Title(参考訳): オフポリティ強化学習のための上述のマルチステップQラーニング
- Abstract要約: マルチステップは、非政治強化学習における報酬の伝播を加速させるが、各決定の評価を、それに続く最適なログ化された行動に合わせることで、地平線に沿って成長する悲観的バイアスを誘発する。
本稿では, 対称な$n$-step temporal-difference (TD) 損失を, アクション値誤差の非対称な期待値損失に置き換える予測型$n$-step Q-learning (ENQ)を提案する。
- 参考スコア(独自算出の注目度): 12.008878527093364
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-step returns accelerate reward propagation in off-policy reinforcement learning, but couple the evaluation of each decision to the suboptimal logged actions that follow it, inducing a pessimistic bias that grows with the horizon. We propose Expectile $n$-step Q-learning (ENQ), which replaces the symmetric $n$-step temporal-difference (TD) loss with an asymmetric expectile loss on the action-value error, with expectile level $τ$ as the only method-specific hyperparameter added beyond $n$-step TD. We prove that the ENQ operator is a $γ^{n}$-contraction. Under deterministic dynamics, at $τ=1$, its bias vanishes at the optimal action-value function $Q^*$ on covered in-support pairs, and the corresponding fixed point satisfies the separation-$n$ instance and its multiples of the lower-bound inequality used by Long-Horizon Q-learning (LQL). Under stochastic dynamics, the operator bias admits two-sided bounds with horizon-independent noise constants. Using a single expectile level $τ=0.8$ and a fixed backup horizon across 27 manipulation and navigation task instances, ENQ is competitive with LQL on aggregate, achieves higher measured training-step throughput in our profiling study, and benefits more from a ten-critic ensemble in a controlled scaling experiment.
- Abstract(参考訳): マルチステップは、非政治強化学習における報酬の伝播を加速させるが、各決定の評価を、それに続く最適なログ化された行動に合わせることで、地平線に沿って成長する悲観的バイアスを誘発する。
本稿では, アクション値誤差に対して, 対称な$n$-step 時間差分(TD)損失を非対称な期待値損失に置き換え, $n$-step TDを超えるメソッド固有ハイパーパラメータとして, expectile level $τ$を提案する。
ENQ作用素が$γ^{n}$-トラクションであることを証明する。
決定論的力学の下では、そのバイアスは最適作用値関数$Q^*$で消失し、対応する固定点は、Long-Horizon Q-learning (LQL) で使われる分離-n$インスタンスとその下界不等式を満足する。
確率力学の下では、作用素バイアスは水平非依存ノイズ定数を持つ両側境界を許容する。
ENQは27の操作およびナビゲーションタスクインスタンスにまたがる単一の期待レベルであるτ=0.8$と固定されたバックアップ水平地平線を用いて、集約上のLQLと競合し、プロファイリング研究においてより高いトレーニングステップスループットを実現し、コントロールされたスケーリング実験において、より10クリティカルなアンサンブルの恩恵を受ける。
関連論文リスト
- Revisiting TD Target Aggregation under Uncertainty in Q-Learning [2.4908682918195804]
Deep Q-Networks(DQN)は、ブートストラップされた時間差分更新を通じて値関数を学習する。
我々は、TDターゲットの生成方法を規則化するQラーニングへの簡単なロールアウトである、textbfSuccessor Rollout textbfAggregation textbfDeep textbfQ-Network (SADQ)を提案する。
論文 参考訳(メタデータ) (2026-08-04T03:31:24Z) - Gated Q-learning: Add Off-Policy Bias to Taste [2.7074235008521246]
Qラーニングにおける非政治バイアスの管理は、依然として根本的な課題である。
Gated Q-learningは、効果的なマルチステップ水平線のカスタマイズを可能にしながら、重要サンプリングの簡単な代替手段を提供する。
実証的な評価は、中間ゲーティングが安全により長いクレジット割り当て水平線を可能にすることを証明している。
論文 参考訳(メタデータ) (2026-07-31T00:32:46Z) - Distribution-Aware Robust Bilevel Optimization: Quantile-Guided Huber Updates in Two-Timescale Stochastic Approximation [16.106678611834102]
双レベル最適化(BLO)は階層的な決定には基本的だが、重み付き雑音下での臨界不安定性に悩まされている。
既存の技術は通常、等級チェックに依存しており、情報的幾何学的信号と外れ値の区別に失敗する。
論文 参考訳(メタデータ) (2026-06-21T10:57:37Z) - Provably Efficient and Agile Randomized Q-Learning [35.14581235983678]
我々は、サンプリングベースの探索をアジャイル、ステップワイド、ポリシー更新と統合した新しいQ-ラーニングアルゴリズムをRandomizedQと呼ぶ。
経験的に、RandomizedQは、ボーナスベースとベイズベースで標準ベンチマークを探索する既存のQラーニングモデルと比較して、優れたパフォーマンスを示している。
論文 参考訳(メタデータ) (2025-06-30T16:08:29Z) - A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation [67.66904892192794]
我々は、強化学習のための新しいアルゴリズム、MQL-UCBを用いたモノトニックQ-Learningを提案する。
MQL-UCBは、$tildeO(dsqrtHK)$の最小限の後悔を実現する。
本研究は,非線形関数近似を用いたサンプル効率およびデプロイメント効率のよいQ-ラーニングの設計に重点を置いている。
論文 参考訳(メタデータ) (2023-11-26T08:31:57Z) - Addressing Maximization Bias in Reinforcement Learning with Two-Sample Testing [0.0]
過大評価バイアスは、価値に基づく強化学習アルゴリズムに対する既知の脅威である。
平均的な2サンプルテストに基づいて,過大評価と過小評価を柔軟に補間する$T$-Estimator (TE)を提案する。
また、TEと同じバイアスと分散境界に従うK$-Estimator (KE) という一般化も導入する。
論文 参考訳(メタデータ) (2022-01-20T09:22:43Z) - Temporal-Difference Value Estimation via Uncertainty-Guided Soft Updates [110.92598350897192]
Q-Learningは、制御タスクを実行するポリシーを学ぶのに効果的であることが証明されている。
推定ノイズは、政策改善ステップにおける最大演算子の後、バイアスとなる。
UQL(Unbiased Soft Q-Learning)は、2つのアクション、有限状態空間からマルチアクション、無限状態マルコフ決定プロセスまで、EQLの作業を拡張する。
論文 参考訳(メタデータ) (2021-10-28T00:07:19Z) - Tightening the Dependence on Horizon in the Sample Complexity of
Q-Learning [59.71676469100807]
この研究は、同期Q-ラーニングのサンプルの複雑さを、任意の$0varepsilon 1$に対して$frac|mathcalS| (1-gamma)4varepsilon2$の順序に絞る。
計算やストレージを余分に必要とせずに、高速なq-learningにマッチするvanilla q-learningの有効性を明らかにした。
論文 参考訳(メタデータ) (2021-02-12T14:22:05Z) - Fast Rates for the Regret of Offline Reinforcement Learning [69.23654172273085]
無限水平割引決定プロセス(MDP)における固定行動ポリシーによって生成されたオフラインデータからの強化学習の後悔について検討する。
最適品質関数 $Q*$ に対する任意の推定が与えられたとき、定義するポリシーの後悔は、$Q*$-estimate の点収束率の指数によって与えられる速度で収束することを示す。
論文 参考訳(メタデータ) (2021-01-31T16:17:56Z) - Finite-Time Analysis for Double Q-learning [50.50058000948908]
二重Q-ラーニングのための非漸近的有限時間解析を初めて提供する。
同期と非同期の二重Q-ラーニングの両方が,グローバル最適化の$epsilon$-accurate近辺に収束することが保証されていることを示す。
論文 参考訳(メタデータ) (2020-09-29T18:48:21Z) - Sample Complexity of Asynchronous Q-Learning: Sharper Analysis and
Variance Reduction [63.41789556777387]
非同期Q-ラーニングはマルコフ決定過程(MDP)の最適行動値関数(またはQ-関数)を学習することを目的としている。
Q-関数の入出力$varepsilon$-正確な推定に必要なサンプルの数は、少なくとも$frac1mu_min (1-gamma)5varepsilon2+ fract_mixmu_min (1-gamma)$の順である。
論文 参考訳(メタデータ) (2020-06-04T17:51:00Z) - Upper Confidence Primal-Dual Reinforcement Learning for CMDP with
Adversarial Loss [145.54544979467872]
マルコフ決定過程(CMDP)に対するオンライン学習の検討
本稿では,遷移モデルから標本化した軌跡のみを必要とする,新しいEmphupper confidence primal-dualアルゴリズムを提案する。
我々の分析では、ラグランジュ乗算過程の新たな高確率ドリフト解析を、高信頼強化学習の記念後悔解析に組み入れている。
論文 参考訳(メタデータ) (2020-03-02T05:02:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。