論文の概要: Revisiting TD Target Aggregation under Uncertainty in Q-Learning
- arxiv url: http://arxiv.org/abs/2608.03069v1
- Date: Tue, 04 Aug 2026 03:31:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.019114
- Title: Revisiting TD Target Aggregation under Uncertainty in Q-Learning
- Title(参考訳): Q-Learningにおける不確実性下におけるTDターゲットアグリゲーションの再検討
- Abstract要約: Deep Q-Networks(DQN)は、ブートストラップされた時間差分更新を通じて値関数を学習する。
我々は、TDターゲットの生成方法を規則化するQラーニングへの簡単なロールアウトである、textbfSuccessor Rollout textbfAggregation textbfDeep textbfQ-Network (SADQ)を提案する。
- 参考スコア(独自算出の注目度): 2.4908682918195804
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Deep Q-Networks (DQNs) learn value functions through bootstrapped temporal-difference updates, where future returns are approximated using a greedy maximization over next-state action values. While effective, this aggregation rule is inherently sensitive to estimation noise: when Q-values are uncertain, the maximization operator deterministically favors the largest estimate, regardless of its reliability, leading to amplified errors through bootstrapping. In this work, we propose the \textbf{S}uccessor Rollout \textbf{A}ggregation \textbf{D}eep \textbf{Q}-Network (SADQ), a simple modification to Q-learning that regularizes how the TD target is formed. SADQ uses one-step rollout predictions from a learned dynamics model to guide the comparison among candidate next-state actions, introducing additional structure into the aggregation step without altering the underlying learning framework. The resulting mixed Bellman update attenuates unreliable maxima while preserving the standard fixed point under diminishing model error. We provide theoretical analysis showing that SADQ reduces bootstrap-induced overestimation in a pointwise manner. Empirically, SADQ consistently improves training stability across classical control tasks, real-world vector-based environments, and Atari benchmarks when compared to strong DQN variants.
- Abstract(参考訳): Deep Q-Networks(DQN)は、ブートストラップされた時間差分更新を通じて値関数を学習する。
Q-値が不確かである場合、最大化演算子は、その信頼性に関わらず、決定論的に最大の推定を好み、ブートストラップによる誤りを増幅する。
そこで本研究では,TDターゲットの生成方法を標準化したQラーニングの簡易な修正である,‘textbf{S}uccessor Rollout \textbf{A}ggregation \textbf{D}eep \textbf{Q}-Network (SADQ) を提案する。
SADQは、学習力学モデルからの1ステップのロールアウト予測を使用して、候補の次状態アクションの比較をガイドし、基礎となる学習フレームワークを変更することなく、アグリゲーションステップに追加構造を導入する。
その結果得られた混合ベルマン更新は、モデル誤差の減少の下で標準固定点を保ちながら、信頼性の低い最大値を減衰させる。
SADQはブートストラップによる過大評価をポイントワイズで減少させる。
SADQは、古典的な制御タスク、実世界のベクトルベースの環境、そして強力なDQNの亜種と比較してAtariベンチマークのトレーニング安定性を一貫して改善する。
関連論文リスト
- SCQ: Stabilizing Conservative Q-Learning with Sigmoid-Bounded Entropy [2.299479454443024]
SCQ(Sigmoid-Bounded conservative Q-Learning)を導入し、標準的な対数エントロピー項を厳密な正のシグモイド有界な定式化に置き換える。
SCQはベースラインのパフォーマンスと一致またはオーバーし、ステートベースおよびビジュアルベンチマーク間のより安定したトレーニングダイナミックスを示す。
直接クリッピング介入は、傾きにマッチした正スコア制御とともに、負の対数確率の寄与を除去し、特定のスコアの形状だけでなく、肯定性も改善の多くを駆動していることを示す。
論文 参考訳(メタデータ) (2026-09-11T11:59:52Z) - GB-DQN: Gradient Boosted DQN Models for Non-stationary Reinforcement Learning [0.0]
逐次残差学習によるモデルドリフトに対応する適応型アンサンブル法であるemphGradient-Boosted Deep Q-Networks (GB-DQN)を提案する。
GB-DQNは、単一のQ-ネットワークを再訓練する代わりに、新たな学習者がドリフト後の現在のアンサンブルのベルマン残差を近似するように訓練された付加的なアンサンブルを構築する。
論文 参考訳(メタデータ) (2025-12-18T19:53:50Z) - Enhancing Q-Value Updates in Deep Q-Learning via Successor-State Prediction [3.2883573376133555]
ディープQ-Networks(DQN)は、リプレイバッファからサンプリングされた遷移から学習することで、将来のリターンを推定する。
SADQは後続状態分布をQ値推定プロセスに統合する。
我々は、SADQがトレーニングのばらつきを低減しつつ、不偏値の推定を維持できることを理論的に保証する。
論文 参考訳(メタデータ) (2025-11-05T20:04:53Z) - Uncertainty Quantification for Regression using Proper Scoring Rules [76.24649098854219]
CRPS,対数,2乗誤差,2次スコアなど,適切なスコアリングルールに基づく回帰のための統一的UQフレームワークを提案する。
実測パラメトリックな仮定に基づく不確実性尺度に対する閉形式式を導出し、モデルのアンサンブルを用いてそれらを推定する方法を示す。
合成および実世界の回帰データセットに対する広範な評価は、信頼性の高いUQ尺度を選択するためのガイダンスを提供する。
論文 参考訳(メタデータ) (2025-09-30T17:52:12Z) - Large Continual Instruction Assistant [59.585544987096974]
CIT(Continuous Instruction Tuning)は、大規模モデルにデータによる人間の意図データに従うよう指示するために用いられる。
既存の更新勾配は、CITプロセス中に前のデータセットのパフォーマンスを著しく損なうことになる。
本稿では,この課題に対処する汎用的な連続的命令チューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-08T11:24:59Z) - Selective Learning: Towards Robust Calibration with Dynamic Regularization [79.92633587914659]
ディープラーニングにおけるミススキャリブレーションとは、予測された信頼とパフォーマンスの間には相違がある、という意味である。
トレーニング中に何を学ぶべきかを学ぶことを目的とした動的正規化(DReg)を導入し、信頼度調整のトレードオフを回避する。
論文 参考訳(メタデータ) (2024-02-13T11:25:20Z) - Towards Continual Learning Desiderata via HSIC-Bottleneck
Orthogonalization and Equiangular Embedding [55.107555305760954]
本稿では,レイヤワイドパラメータのオーバーライトや決定境界の歪みに起因する,概念的にシンプルで効果的な手法を提案する。
提案手法は,ゼロの指数バッファと1.02倍の差が絶対的に優れていても,競争精度が向上する。
論文 参考訳(メタデータ) (2024-01-17T09:01:29Z) - Understanding, Predicting and Better Resolving Q-Value Divergence in
Offline-RL [86.0987896274354]
まず、オフラインRLにおけるQ値推定のばらつきの主な原因として、基本パターン、自己励起を同定する。
そこで本研究では,Q-network の学習における進化特性を測定するために,SEEM(Self-Excite Eigen Value Measure)尺度を提案する。
われわれの理論では、訓練が早期に発散するかどうかを確実に決定できる。
論文 参考訳(メタデータ) (2023-10-06T17:57:44Z) - Temporal-Difference Value Estimation via Uncertainty-Guided Soft Updates [110.92598350897192]
Q-Learningは、制御タスクを実行するポリシーを学ぶのに効果的であることが証明されている。
推定ノイズは、政策改善ステップにおける最大演算子の後、バイアスとなる。
UQL(Unbiased Soft Q-Learning)は、2つのアクション、有限状態空間からマルチアクション、無限状態マルコフ決定プロセスまで、EQLの作業を拡張する。
論文 参考訳(メタデータ) (2021-10-28T00:07:19Z) - Parameter-Free Deterministic Reduction of the Estimation Bias in
Continuous Control [0.0]
パラメータフリーで新しいQ-ラーニングバリアントを導入し、この過小評価バイアスを連続制御に還元する。
我々は、MuJoCoとBox2Dの連続制御タスクのセットで改善性能をテストする。
論文 参考訳(メタデータ) (2021-09-24T07:41:07Z) - Estimation Error Correction in Deep Reinforcement Learning for
Deterministic Actor-Critic Methods [0.0]
価値に基づく深層強化学習法では、値関数の近似は過大評価バイアスを誘発し、準最適ポリシーをもたらす。
過大評価バイアスを克服することを目的とした深いアクター批判的手法では,エージェントが受信した強化信号に高いばらつきがある場合,顕著な過大評価バイアスが発生することを示す。
過小評価を最小限に抑えるため,パラメータフリーで新しいQ-ラーニングモデルを提案する。
論文 参考訳(メタデータ) (2021-09-22T13:49:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。