論文の概要: Multivariate Distributional Reinforcement Learning Using Sliced Divergences
- arxiv url: http://arxiv.org/abs/2605.31222v1
- Date: Fri, 29 May 2026 12:26:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.598011
- Title: Multivariate Distributional Reinforcement Learning Using Sliced Divergences
- Title(参考訳): スライスダイバージェンスを用いた多変量分布強化学習
- Abstract要約: Sliced Distributional Reinforcement Learningは、抽出可能な1次元の発散を持ち上げ、射影を通して多変量帰還分布を導出する。
We analyze Wasserstein, Cramér, and Maximum Mean Discrepancy (MMD)
我々は,おもちゃチェーン問題とグリッドワールドイメージベース環境,およびアタリゲームのサブセットに対するSDRLの評価を行った。
- 参考スコア(独自算出の注目度): 37.5115685757579
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Distributional reinforcement learning (DRL) models the full return distribution rather than expectations, but extending it to multivariate settings remains challenging. Many common metrics do not naturally generalize beyond one dimension or lose computational tractability, and the multivariate case introduces additional difficulties such as general matrix discounting, for which no contraction results are available. We introduce Sliced Distributional Reinforcement Learning (SDRL), which lifts tractable one-dimensional divergences to multivariate return distributions via projections. We prove Bellman contraction for uniform slicing under shared scalar discounting, and introduce a maximum-slicing variant with contraction under general dense discount matrices. SDRL supports a broad class of base divergences; we analyze Wasserstein, Cramér, and Maximum Mean Discrepancy (MMD), and characterize which SDRL variants suit the standard single-sample Bellman update used in distributional RL. We evaluate SDRL on a toy chain problem and a gridworld image-based environment as well as a subset of Atari games.
- Abstract(参考訳): 分布強化学習(DRL)は、期待よりも完全な回帰分布をモデル化するが、多変量設定に拡張することは依然として困難である。
多くの一般的な測度は、自然に1次元を超えて一般化したり、計算的トラクタビリティを失うことはない。
SDRL(Sliced Distributional Reinforcement Learning)を導入し,抽出可能な1次元の分散性を持ち出し,射影による多変量分布を実現する。
共有スカラー割引の下での均一スライシングに対するベルマンの収縮を証明し、一般密度の割引行列の下での収縮を伴う最大スライシング変種を導入する。
我々は、Wasserstein, Cramér, Maximum Mean Discrepancy (MMD)を分析し、どのSDRL変種が分散RLで使用される標準シングルサンプルベルマン更新に適合するかを特徴付ける。
我々は,おもちゃチェーン問題とグリッドワールドイメージベース環境,およびアタリゲームのサブセットに対するSDRLの評価を行った。
関連論文リスト
- DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - Calibrated Multimodal Representation Learning with Missing Modalities [100.55774771852468]
マルチモーダル表現学習は、それらを統一潜在空間に整列させることにより、異なるモダリティを調和させる。
最近の研究は、従来のクロスモーダルアライメントを一般化して、強化されたマルチモーダル・シナジーを生成するが、すべてのモダリティを共通の例に含める必要がある。
我々は、アンカーシフトの観点から、この問題に関する理論的洞察を提供する。
モーダルの欠如に起因する不完全なアライメントを校正するために,マルチモーダル表現学習のためのCalMRLを提案する。
論文 参考訳(メタデータ) (2025-11-15T05:01:43Z) - The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward [57.56453588632619]
Reinforcement Learning with Verifiable Reward (RLVR) を用いた細調整大型言語モデル(LLM)における中心的パラドックスは、多目的性能の頻繁な劣化である。
これはしばしば破滅的な忘れが伴い、モデルが以前獲得したスキルを失う。
我々は,標準RLVR目標には知識保持のための重要なメカニズムが欠如していると主張している。
論文 参考訳(メタデータ) (2025-09-09T06:34:32Z) - Distribution-dependent Generalization Bounds for Tuning Linear Regression Across Tasks [24.2043855572415]
L1係数とL2係数をチューニングする際の検証損失に対する一般化誤差の分布依存境界を求める。
我々はその結果をリッジ回帰の一般化にまで拡張し、そこでは基底真理分布の平均を考慮に入れたより厳密な境界を達成する。
論文 参考訳(メタデータ) (2025-07-07T15:08:45Z) - Bayesian Multivariate Density-Density Regression [25.35298354797079]
多変量密度回帰(DDR)のための新規でスケーラブルなベイズフレームワークを提案する。
提案手法は,異なる次元の空間に居住する分布の重要な問題に対処する。
ベイジアンDDRは、従来の手法と比較して、堅牢な適合性、優れた予測性能、複雑な生物学的相互作用に関する貴重な洞察を提供する。
論文 参考訳(メタデータ) (2025-04-17T03:46:03Z) - Diverse Projection Ensembles for Distributional Reinforcement Learning [6.144680854063937]
分布強化学習アルゴリズムは、期待値ではなく、リターンの分布を学習することを目的としている。
分布アンサンブルにおける複数の異なる射影と表現の組み合わせについて検討する。
我々は,平均1-ワッサーシュタイン距離で測定されたアンサンブル不一致を,深層探査のボーナスとして利用するアルゴリズムを導出する。
論文 参考訳(メタデータ) (2023-06-12T13:59:48Z) - Policy Evaluation in Distributional LQR [70.63903506291383]
ランダムリターンの分布を閉形式で表現する。
この分布は有限個の確率変数で近似できることを示す。
近似回帰分布を用いて,リスク・アバースLQRに対するゼロ階ポリシー勾配アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-03-23T20:27:40Z) - The Generalization Error of Stochastic Mirror Descent on
Over-Parametrized Linear Models [37.6314945221565]
ディープネットワークは、目に見えないデータにうまく一般化することが知られている。
正規化特性は「良い」性質を持つ補間解が見つかることを保証している。
理論を検証し、2つのデータモデルを導入するシミュレーション結果を提案する。
論文 参考訳(メタデータ) (2023-02-18T22:23:42Z) - Benign Overfitting of Constant-Stepsize SGD for Linear Regression [122.70478935214128]
帰納バイアスは 経験的に過剰フィットを防げる中心的存在です
この研究は、この問題を最も基本的な設定として考慮している: 線形回帰に対する定数ステップサイズ SGD。
我々は、(正規化されていない)SGDで得られるアルゴリズム正則化と、通常の最小二乗よりも多くの顕著な違いを反映する。
論文 参考訳(メタデータ) (2021-03-23T17:15:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。