論文の概要: Gated Q-learning: Add Off-Policy Bias to Taste
- arxiv url: http://arxiv.org/abs/2607.28916v1
- Date: Fri, 31 Jul 2026 00:32:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.556643
- Title: Gated Q-learning: Add Off-Policy Bias to Taste
- Title(参考訳): Gated Q-learning: 味覚にOff-Policy Biasを加える
- Authors: Brett Daley,
- Abstract要約: Qラーニングにおける非政治バイアスの管理は、依然として根本的な課題である。
Gated Q-learningは、効果的なマルチステップ水平線のカスタマイズを可能にしながら、重要サンプリングの簡単な代替手段を提供する。
実証的な評価は、中間ゲーティングが安全により長いクレジット割り当て水平線を可能にすることを証明している。
- 参考スコア(独自算出の注目度): 2.7074235008521246
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multistep credit assignment is critical for sample-efficient reinforcement learning, yet managing off-policy bias in Q-learning remains a fundamental challenge. For 30 years, practitioners have been limited to a binary choice: eliminate the bias at the cost of severely truncated eligibility traces (Watkins' Q($λ$)), or ignore the bias to learn faster while injecting detrimental errors into the value estimates (Peng's Q($λ$)). Modern off-policy estimators fail to resolve this tension, as importance-sampling ratios collapse under Q-learning's greedy target policy. We introduce Gated Q-learning, a novel algorithmic framework that ends this dilemma by smoothly interpolating between the two historical extremes. Rather than relying on importance sampling, our approach employs a continuous, state-action-dependent gating mechanism to selectively attenuate eligibility traces in an exploration-aware manner. We provide a rigorous theoretical foundation for this mechanism, proving that the expected operator remains a contraction mapping and deriving its exact fixed point. Empirical evaluations verify that intermediate gating safely enables longer credit-assignment horizons, yielding faster initial learning than either extreme. Gated Q-learning offers a simple alternative to importance sampling while enabling customization of the effective multistep horizon and the amount of off-policy bias in Q-learning agents.
- Abstract(参考訳): マルチステップのクレジット割り当ては、サンプル効率のよい強化学習には不可欠だが、Qラーニングにおける非政治バイアスの管理は、依然として根本的な課題である。
30年間、実践者は二進的選択に限られてきた: 厳しい切り詰められた適性トレースのコストでバイアスを取り除く(WatkinsのQ($λ$))か、あるいは、評価値に有害エラーを注入しながらより早く学習するためにバイアスを無視する(Peng's Q($λ$))。
現代の非政治予測者は、Qラーニングの欲求目標政策の下で重要サンプリング比率が崩壊するため、この緊張を解消することができない。
Gated Q-learningは、2つの歴史的極端をスムーズに補間することで、このジレンマを終わらせる新しいアルゴリズムフレームワークである。
提案手法では, 重要サンプリングに頼るのではなく, 連続的かつ状態依存的なゲーティング機構を用いて, 探索に注意して, 可視性トレースを選択的に減衰させる。
この機構の厳密な理論的基礎を提供し、期待作用素が縮約写像のままであり、その正確な定点を導出することを証明する。
実験的な評価では、中間ゲーティングがより長いクレジット割り当ての水平線を安全に可能にし、どちらの極端よりも高速な初期学習をもたらすことが確認されている。
ゲーテッドQラーニングは、効果的な多段階地平線とQラーニングエージェントの非政治バイアス量のカスタマイズを可能にしながら、重要サンプリングの簡単な代替手段を提供する。
関連論文リスト
- Q-learning with Adjoint Matching [58.78551025170267]
本稿では,新しいTD-based reinforcement learning (RL)アルゴリズムであるAdjoint Matching (QAM) を用いたQ-learningを提案する。
QAMは、最近提案された生成モデリング手法であるadjoint matchingを活用することで、2つの課題を回避している。
オフラインとオフラインの両方のRLにおいて、ハードでスパースな報酬タスクに対する従来のアプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-01-20T18:45:34Z) - Regularized Q-learning through Robust Averaging [3.4354636842203026]
本稿では,既存のQラーニング手法の弱点を原則的に解決する,2RA Qラーニングと呼ばれる新しいQラーニング変種を提案する。
そのような弱点の1つは、制御できない、しばしばパフォーマンスが低下する、基礎となる推定バイアスである。
2RA Q-learningは最適ポリシーに収束し、理論平均二乗誤差を解析する。
論文 参考訳(メタデータ) (2024-05-03T15:57:26Z) - Projected Off-Policy Q-Learning (POP-QL) for Stabilizing Offline
Reinforcement Learning [57.83919813698673]
Projected Off-Policy Q-Learning (POP-QL) は、政治外のサンプルを同時に重み付け、分散を防止し、価値近似誤差を減らすためにポリシーを制約する新しいアクタ批判アルゴリズムである。
我々の実験では、POP-QLは標準ベンチマーク上での競合性能を示すだけでなく、データ収集ポリシーがかなり最適化されていないタスクにおいて競合するメソッドよりも優れています。
論文 参考訳(メタデータ) (2023-11-25T00:30:58Z) - Trajectory-Aware Eligibility Traces for Off-Policy Reinforcement
Learning [44.50394347326546]
多段階リターンからのオフ政治学習は、サンプル効率の強化学習に不可欠である。
オフ政治バイアスは、決定ごとに修正されるが、トレースが完全にカットされると、その効果は逆転できない。
本稿では,多段階演算子を提案する。
論文 参考訳(メタデータ) (2023-01-26T18:57:41Z) - Balanced Q-learning: Combining the Influence of Optimistic and
Pessimistic Targets [74.04426767769785]
シナリオによっては、特定の種類の偏見が好ましいかもしれないことを示す。
そこで我々は,目標を悲観的かつ楽観的な用語の凸組合せに修正した新しい強化学習アルゴリズムであるBa balanced Q-learningを設計する。
論文 参考訳(メタデータ) (2021-11-03T07:30:19Z) - On the Estimation Bias in Double Q-Learning [20.856485777692594]
二重Q学習は完全にバイアスがなく、過小評価バイアスに悩まされている。
そのような過小評価バイアスは、近似されたベルマン作用素の下で複数の最適でない不動点をもたらす可能性があることを示す。
ダブルQ-ラーニングにおける過小評価バイアスに対する部分修正として,単純だが効果的なアプローチを提案する。
論文 参考訳(メタデータ) (2021-09-29T13:41:24Z) - Cross Learning in Deep Q-Networks [82.20059754270302]
本稿では、値に基づく強化学習手法において、よく知られた過大評価問題を緩和することを目的とした、新しいクロスQ-ラーニングアルゴリズムを提案する。
本アルゴリズムは,並列モデルの集合を維持し,ランダムに選択されたネットワークに基づいてQ値を算出することによって,二重Q-ラーニングに基づいて構築する。
論文 参考訳(メタデータ) (2020-09-29T04:58:17Z) - ConQUR: Mitigating Delusional Bias in Deep Q-learning [45.21332566843924]
妄想バイアスは、近似Q-ラーニングにおける基本的なエラー源である。
我々は,根底にある欲求政策クラスと「一致」したラベルを持つQ近似器を訓練することで,妄想バイアスを緩和する効率的な方法を開発した。
論文 参考訳(メタデータ) (2020-02-27T19:22:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。