論文の概要: Spectral Analysis of Dueling Q-Learning
- arxiv url: http://arxiv.org/abs/2607.08340v1
- Date: Thu, 09 Jul 2026 10:29:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.502832
- Title: Spectral Analysis of Dueling Q-Learning
- Title(参考訳): デューリングQラーニングのスペクトル解析
- Authors: Donghwan Lee,
- Abstract要約: Q-learning is a fundamental algorithm in reinforcement learning (RL) forsolved Markov decision process (MDPs)
ディープQネットワーク(DQN)は、Q関数近似のためのディープニューラルネットワークを用いてQラーニングを拡張する。
Q-ラーニングはQ-関数を値関数と有利関数に分解し、2つの成分を共に学習する。
- 参考スコア(独自算出の注目度): 7.8232617281369805
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Q-learning is a fundamental algorithm in reinforcement learning (RL) for solving discounted Markov decision processes (MDPs) when the transition kernel is unknown. The deep Q-network (DQN) extends Q-learning by using a deep neural network for Q-function approximation, which makes Q-learning applicable to more practical high-dimensional problems. Dueling Q-learning decomposes the Q-function into a value function and an advantage function and learns the two components jointly, which can improve learning efficiency. However, the theoretical understanding of dueling Q-learning is still limited. Recent work has initiated an analysis of tabular dueling Q-learning, but existing guarantees focus on a regularized formulation and leave the pure tabular update less completely understood. This paper strengthens that line of analysis by adding a direct interpretation of the centered tabular decomposition and by establishing convergence guarantees for the unregularized, unprojected constant step-size recursion. In particular, we derive an exact switching linear system representation for deterministic dueling Q-learning and a finite-time error bound in expectation for the sampled stochastic version. The analysis clarifies how the value and advantage updates act as different gains on the action-common (value function) and action-differential (advantage function) components of the Q-function.
- Abstract(参考訳): Qラーニング(Q-learning)は、遷移カーネルが不明なときの割引マルコフ決定過程(MDP)を解決するための強化学習(RL)の基本アルゴリズムである。
ディープQネットワーク(DQN)は、Q関数近似のためのディープニューラルネットワークを用いてQ学習を拡張し、Q学習をより実用的な高次元問題に適用する。
Q-ラーニングは、Q-関数を値関数と有利関数に分解し、2つのコンポーネントを共同で学習し、学習効率を向上させる。
しかし、デュエルQ学習の理論的理解はいまだに限られている。
最近の研究は、Q-ラーニングによる表型デュエルの分析を始めているが、既存の保証は、正規化された定式化に焦点を合わせ、純粋な表型更新を完全には理解していない。
本稿では、中心となる表分解を直接解釈し、非正規化された未計画の定数ステップサイズ再帰に対する収束保証を確立することにより、解析の行を強化する。
特に、決定論的デューリングQ-ラーニングのための正確な切替線形系表現と、サンプル確率バージョンに対する期待値の有限時間誤差を導出する。
この分析は、Q関数のアクション共通(値関数)およびアクション微分(アドバンテージ関数)コンポーネントにおいて、値と利点の更新がどのように異なる利得として振舞うかを明らかにする。
関連論文リスト
- Finite-Time Error Analysis of Soft Q-Learning: Switching System Approach [4.36117236405564]
ソフトQラーニングは、エントロピー正規化マルコフ決定問題を解くために設計されたQラーニングのバリエーションである。
本稿では,ソフトQ-ラーニングアルゴリズムの有限時間制御理論解析を新規かつ統一的に提供することを目的とする。
論文 参考訳(メタデータ) (2024-03-11T01:36:37Z) - Online Target Q-learning with Reverse Experience Replay: Efficiently
finding the Optimal Policy for Linear MDPs [50.75812033462294]
我々は,Q-ラーニングの実践的成功と悲観的理論的結果とのギャップを埋める。
本稿では,新しいQ-Rex法とQ-RexDaReを提案する。
Q-Rex は線形 MDP の最適ポリシを効率的に見つけることができる。
論文 参考訳(メタデータ) (2021-10-16T01:47:41Z) - Finite-Time Analysis of Asynchronous Q-Learning with Discrete-Time
Switching System Models [6.85316573653194]
一定のステップサイズを持つQ学習を離散時間切替線形系として自然に定式化できることを実証する。
主に制御フレームワークに基づくQ-ラーニングに関する新規かつ直感的な洞察を提供する。
論文 参考訳(メタデータ) (2021-02-17T05:32:07Z) - Finite-Time Analysis for Double Q-learning [50.50058000948908]
二重Q-ラーニングのための非漸近的有限時間解析を初めて提供する。
同期と非同期の二重Q-ラーニングの両方が,グローバル最適化の$epsilon$-accurate近辺に収束することが保証されていることを示す。
論文 参考訳(メタデータ) (2020-09-29T18:48:21Z) - Cross Learning in Deep Q-Networks [82.20059754270302]
本稿では、値に基づく強化学習手法において、よく知られた過大評価問題を緩和することを目的とした、新しいクロスQ-ラーニングアルゴリズムを提案する。
本アルゴリズムは,並列モデルの集合を維持し,ランダムに選択されたネットワークに基づいてQ値を算出することによって,二重Q-ラーニングに基づいて構築する。
論文 参考訳(メタデータ) (2020-09-29T04:58:17Z) - Q-Learning with Differential Entropy of Q-Tables [4.221871357181261]
我々は、Q-ラーニングの長期トレーニングセッションにおけるパフォーマンスの低下は、情報の喪失によって引き起こされると推測する。
本稿では,Q-ラーニングアルゴリズムに外部情報損失検出器として,Q-tables(DE-QT)の微分エントロピーを導入する。
論文 参考訳(メタデータ) (2020-06-26T04:37:10Z) - Can Temporal-Difference and Q-Learning Learn Representation? A Mean-Field Theory [110.99247009159726]
時間差とQ-ラーニングは、ニューラルネットワークのような表現力のある非線形関数近似器によって強化される深層強化学習において重要な役割を担っている。
特に時間差学習は、関数近似器が特徴表現において線形であるときに収束する。
論文 参考訳(メタデータ) (2020-06-08T17:25:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。