論文の概要: Limiting-Kernel Q($λ$): Bridging Short and Long Horizons
- arxiv url: http://arxiv.org/abs/2609.27741v1
- Date: Wed, 23 Sep 2026 11:56:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.006087
- Title: Limiting-Kernel Q($λ$): Bridging Short and Long Horizons
- Title(参考訳): Limiting-Kernel Q($λ$): Bridging Short and Long Horizons
- Abstract要約: 制限カーネル (LK) に基づいて,$n$-step truncation とlong-horizon 近似を組み合わせたオフ政治値推定器を導入する。
LKQLは、$n$-step推定器と同じ複雑さの順序を持ち、オン/オフのアクター-クリティカルアルゴリズムと直接統合する。
LKQLは、特に長期タスクにおいて、ほとんどの設定において、$n$-stepのベースラインを改善する。
- 参考スコア(独自算出の注目度): 3.033221007650832
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: In value-based reinforcement learning, improving the accuracy of policy evaluation has been shown to improve downstream policy optimization performance. The widely adopted family of approximations relying on $n$-step truncation yields computationally efficient value estimators but is inherently limited to a short evaluation horizon. In contrast, methods that exploit the global structure of the transition dynamics can accelerate policy evaluation, but their memory and computational requirements often limit scalability to large or continuous state spaces. To reconcile these limitations, we introduce Limiting-Kernel Q($λ$) (LKQL), an off-policy value estimator that combines $n$-step truncation with a long-horizon approximation based on the limiting kernel (LK). LKQL has the same order of complexity as $n$-step estimators and integrates directly into both on- and off-policy actor-critic algorithms. We prove that, under aperiodicity and in the near-on-policy regime, the operator underlying LKQL improves the policy evaluation convergence rate over its truncated counterpart for sufficiently large $n$, and that LKQL itself converges almost surely to the optimal values in finite Markov decision processes (MDPs) under a fixed behavior policy. On the MuJoCo continuous-control benchmark, we show that LKQL improves over $n$-step baselines in most settings, particularly on long-horizon tasks.
- Abstract(参考訳): 価値に基づく強化学習では、下流政策最適化性能を改善するために、政策評価の精度を向上させることが示されている。
より広く採用されている近似の族は、$n$-step truncationに依存するため、計算効率の良い値推定器が得られるが、本質的には短い評価水平線に限られる。
対照的に、遷移力学のグローバルな構造を利用する手法は政策評価を加速させるが、そのメモリと計算要求は拡張性を大規模または連続的な状態空間に制限することが多い。
制限カーネル (LK) に基づく長い水平近似と$n$-step truncation を組み合わせたオフ政治値推定器であるLimiting-Kernel Q($λ$) (LKQL) を導入する。
LKQLは、$n$-step推定器と同じ複雑さの順序を持ち、オン/オフのアクター-クリティカルアルゴリズムと直接統合する。
我々は,LKQLの運用者は,周期性とほぼ政治体制の下で,十分に大きな$n$の処理を行う場合,LKQL自体が有限マルコフ決定過程(MDP)の最適値にほぼ確実に収束することを証明した。
MuJoCoの継続的制御ベンチマークでは、LKQLは多くの設定、特に長距離タスクにおいて、$n$-step以上のベースラインを改善している。
関連論文リスト
- Ratio-Variance Regularized Policy Optimization [64.95520246570446]
ポリシ比の分散を明示的に制約することは、信頼領域の制約に対する原則的な局所近似をもたらすことを示す。
本稿では,この制約を実装したR2bf VPO$(Ratio-Variance Regularized Policy Optimization)を紹介する。
論文 参考訳(メタデータ) (2026-05-26T09:53:42Z) - Peng's Q($λ$) for Conservative Value Estimation in Offline Reinforcement Learning [35.18584220158021]
我々は、モデルなしオフライン多段階強化学習アルゴリズム、Reserve PengのQ($$)(CPQL)を提案する。
我々のアルゴリズムはベルマン演算子の代替としてペンのQ($$) (PQL)演算子を保守的な値推定に適応させる。
CPQLは同時に過悲観的な値推定を緩和し、動作ポリシよりもパフォーマンスを向上(あるいは同等)し、ほぼ最適なパフォーマンス保証を提供する。
論文 参考訳(メタデータ) (2026-05-14T12:48:44Z) - Holder Policy Optimisation [26.521180498291717]
textbfHlderPOは、一般的なポリシー最適化フレームワークである。
トークンレベルの確率アグリゲーションをHlder平均を介して統一する。
複数の数学ベンチマークにおいて、最先端の平均精度は54.9%である。
論文 参考訳(メタデータ) (2026-05-12T12:45:03Z) - Learning Partial Action Replacement in Offline MARL [11.861550409939818]
部分アクション置換(Partial Action Replacement)は、アクションをデータセットするエージェントのサブセットをアンカーすることで、これを緩和する。
PLCQLは、PARサブセット選択を文脈的帯域幅問題として定式化するフレームワークである。
本研究では,推定誤差が予測されるエージェント数と線形にスケールすることを示す値エラー境界を証明した。
論文 参考訳(メタデータ) (2026-03-30T15:28:13Z) - Weakly Time-Coupled Approximation of Markov Decision Processes [3.573962752571186]
有限水平マルコフ決定プロセス(MDPs)は、ベルムダンのバリュエーションやエクササイズ、リアルオプションなど、運用と金融に発生する。
共通近似は基底関数を用いた値関数を表すが、重み付け方法は異なる段階最適化を扱う。
この結合は近似アーキテクチャのアーチファクトであり、段差依存が地平線に依存しない弱時間結合近似(WTCA)を開発する。
論文 参考訳(メタデータ) (2026-03-13T04:14:42Z) - Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning [66.4260157478436]
政策学習における強化学習について検討する。
目的は、特定の種類の利害関係において最高の政策と競争力のある政策を見つけることである。
論文 参考訳(メタデータ) (2025-07-06T14:40:05Z) - Accelerating RL for LLM Reasoning with Optimal Advantage Regression [52.0792918455501]
本稿では,最適優位関数を直接近似する新しい2段階ポリシー最適化フレームワークを提案する。
A$*-POは、幅広い数学的推論ベンチマークで競合性能を達成する。
PPO、GRPO、REBELと比較して、トレーニング時間を最大2$times$、ピークメモリ使用率を30%以上削減する。
論文 参考訳(メタデータ) (2025-05-27T03:58:50Z) - Nearly Optimal Latent State Decoding in Block MDPs [74.51224067640717]
エピソードブロック MDP では、意思決定者は少数の潜在状態から生成される豊富な観測やコンテキストにアクセスすることができる。
まず、固定動作ポリシーに基づいて生成されたデータに基づいて、潜時状態復号関数を推定することに興味がある。
次に、報酬のないフレームワークにおいて、最適に近いポリシーを学習する問題について研究する。
論文 参考訳(メタデータ) (2022-08-17T18:49:53Z) - Softmax Policy Gradient Methods Can Take Exponential Time to Converge [60.98700344526674]
Softmax Policy gradient(PG)メソッドは、現代の強化学習におけるポリシー最適化の事実上の実装の1つです。
ソフトマックス PG 法は、$mathcalS|$ および $frac11-gamma$ の観点から指数時間で収束できることを実証する。
論文 参考訳(メタデータ) (2021-02-22T18:56:26Z) - Kalman meets Bellman: Improving Policy Evaluation through Value Tracking [59.691919635037216]
政策評価は強化学習(RL)における重要なプロセスである
我々はKalman Optimization for Value Approximation (KOVA)と呼ばれる最適化手法を考案した。
KOVAはパラメータとノイズリターンの不確実性の両方に関する正規化対象関数を最小化する。
論文 参考訳(メタデータ) (2020-02-17T13:30:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。