論文の概要: Learning the Supports for Categorical Critic in Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.01880v1
- Date: Thu, 02 Jul 2026 08:34:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.74647
- Title: Learning the Supports for Categorical Critic in Reinforcement Learning
- Title(参考訳): 強化学習におけるカテゴリー批判支援の学習
- Abstract要約: 本稿では,サポートの下位境界と上位境界を事前に割り当てる代わりに学習する手法を提案する。
この目的が平均二乗ベルマン誤差の上限となることを示す。
我々の理論的解析は、この境界がHL-Gaussの非学習支援よりも厳密であることを示している。
- 参考スコア(独自算出の注目度): 44.603295025494674
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Value functions are an essential component in actor-critic based deep reinforcement learning (RL). Conventionally, these functions are trained as a regression task by minimising the mean squared error (MSE) relative to bootstrapped target values. Meanwhile, in distributional RL, a distribution of returns is modelled based on the distributional Bellman operator. This work investigates the Gaussian Histogram Loss (HL-Gauss), a recent approach that reframes value estimation as classification by encoding each scalar Bellman target as a Gaussian-smoothed categorical target. Despite its potential, applying histogram-based losses to RL presents inherent challenges, most notably the requirement to pre-define a fixed support interval, which is often complicated by the non-stationary and stochastic nature of target values typically found in RL tasks. In this work, we propose an approach that dynamically learns the lower and upper bounds of the support instead of assigning them beforehand. We derive an objective that jointly learns these bounds whilst learning the categorical representation of the scalar values, and we show that this objective forms an upper bound on the mean-squared Bellman error. Our theoretical analysis further shows that this bound is tighter than that of non-learned supports of HL-Gauss. Empirically, the proposed objective enables stable adaptation of the support interval and matches HL-Gauss-based actor-critic algorithms on most continuous-control tasks whilst improving on a subset, without requiring a pre-specified support interval.
- Abstract(参考訳): 価値関数はアクター批判に基づく深層強化学習(RL)において不可欠な要素である。
従来、これらの関数は、ブートストラップされたターゲット値に対する平均二乗誤差(MSE)を最小化することにより、回帰タスクとして訓練される。
一方、分布RLでは、分布ベルマン作用素に基づいて戻り値の分布をモデル化する。
本研究では,ガウス的ヒストグラム損失 (HL-Gauss) について検討し,各スカラーベルマンターゲットをガウス的平滑な分類対象としてエンコードすることで,値推定を分類として再編成する手法を提案する。
その可能性にもかかわらず、ヒストグラムに基づく損失をRLに適用することは固有の課題を示し、特に、固定的なサポート間隔を事前に定義する必要がある。
本研究では,前もってアサインするのではなく,サポートの下限と上限を動的に学習する手法を提案する。
我々は、スカラー値のカテゴリー表現を学習しながら、これらの境界を共同で学習する目的を導出し、この目的が平均二乗のベルマン誤差の上界を形成することを示す。
我々の理論的解析は、この境界がHL-Gaussの非学習支援よりも厳密であることを示している。
提案手法は, HL-Gauss をベースとしたアクタクリティカルアルゴリズムを, 所定のサポート間隔を必要とせず, サブセットの改善を図りながら, HL-Gauss ベースのアクタクリティカルアルゴリズムと一致させることを実証的に可能とした。
関連論文リスト
- Start Classifying: Categorical Critics for LLM Reinforcement Learning [35.51572984401546]
HL-Gauss PPOは、スカラーMSEヘッドを、離散値サポートよりもカテゴリー予測器で置き換える。
強いPPOとDAPOのベースラインを継続的に改善する。
1ホット、2ホット、ベルヌーイの2ビンの批判による制御は、より大きな出力ヘッドもバイナリ分類も利得を説明できないことを示している。
論文 参考訳(メタデータ) (2026-08-03T13:05:38Z) - Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning [58.088509347353465]
強化学習(Reinforcement Learning, RL)は、言語モデルトレーニングにおいて広く使われている。
我々は,このトレードオフに明確な統計的解釈を与えるゲーム理論の枠組みを提案する。
論文 参考訳(メタデータ) (2026-07-29T00:19:09Z) - RL2ML: Finite-Rollout Surrogate Objectives from Reinforcement Learning to Maximum Likelihood [0.0]
本稿では、有限ロールアウトされた代理対象の族であるRL2MLを、閉形式、正確に偏りのない勾配推定器で開発する。
代理目的の最良の選択は、最大可能性に近づいたり、人口レベルの重みだけで決められたりしないことを示す。
論文 参考訳(メタデータ) (2026-05-28T16:14:45Z) - Relative Score Policy Optimization for Diffusion Language Models [29.344961499429257]
拡散大言語モデル(dLLMs)は、並列かつ効率的なテキスト生成への有望な経路を提供する。
抽出可能なシーケンスレベルのログ比の欠如により、既存の手法は高分散ELBOベースの近似に頼らざるを得なくなった。
textbfRelative textbfScore textbfPolicy textbfOptimization (RSPO)を提案する。
論文 参考訳(メタデータ) (2026-05-11T08:58:40Z) - Symmetric Q-learning: Reducing Skewness of Bellman Error in Online
Reinforcement Learning [55.75959755058356]
深層強化学習では、状態や行動の質を評価するために、価値関数を推定することが不可欠である。
最近の研究では、値関数を訓練する際の誤差分布はベルマン作用素の特性のためにしばしば歪むことが示唆されている。
そこで我々は,ゼロ平均分布から発生する合成ノイズを目標値に加え,ガウス誤差分布を生成するSymmetric Q-learning法を提案する。
論文 参考訳(メタデータ) (2024-03-12T14:49:19Z) - Value-Distributional Model-Based Reinforcement Learning [59.758009422067]
政策の長期的業績に関する不確実性の定量化は、シーケンシャルな意思決定タスクを解決するために重要である。
モデルに基づくベイズ強化学習の観点から問題を考察する。
本稿では,値分布関数を学習するモデルに基づくアルゴリズムであるEpicemic Quantile-Regression(EQR)を提案する。
論文 参考訳(メタデータ) (2023-08-12T14:59:19Z) - Deep Autoregressive Regression [5.257719744958367]
平均二乗誤差損失を用いた回帰の大幅な制限は、ターゲットの規模に対する感度であることを示す。
本稿では,実数値回帰目標,自己回帰回帰に基づく深層学習モデルの学習手法を提案する。
論文 参考訳(メタデータ) (2022-11-14T15:22:20Z) - Bridging the Gap Between Target Networks and Functional Regularization [61.051716530459586]
関数空間における凸正規化器であり、容易に調整できる明示的な関数正規化を提案する。
提案手法の収束を理論的・実験的に解析し,より理論的に根ざした機能正規化アプローチでターゲットネットワークを置き換えることにより,サンプリング効率と性能が向上することが実証された。
論文 参考訳(メタデータ) (2022-10-21T22:27:07Z) - KL Guided Domain Adaptation [88.19298405363452]
ドメイン適応は重要な問題であり、現実世界のアプリケーションにしばしば必要である。
ドメイン適応文学における一般的なアプローチは、ソースとターゲットドメインに同じ分布を持つ入力の表現を学ぶことである。
確率的表現ネットワークにより、KL項はミニバッチサンプルにより効率的に推定できることを示す。
論文 参考訳(メタデータ) (2021-06-14T22:24:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。