論文の概要: A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs
- arxiv url: http://arxiv.org/abs/2605.04880v1
- Date: Wed, 06 May 2026 13:16:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.828353
- Title: A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs
- Title(参考訳): SMDPにおける平均逆強化学習の高調波平均定式化
- Authors: Erel Shtossel, Alicia Vidler, Uri Shaham, Gal A. Kaminka,
- Abstract要約: 本稿では,非定常条件下でも報酬率を正確に計算する修正調和平均演算子を提案する。
修正調和平均演算子の理論的性質を実証し,既存のアルゴリズムと比較して実効性を実証した。
- 参考スコア(独自算出の注目度): 2.777708468041713
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent research has revived and amplified interest in algorithms for undiscounted average reward reinforcement learning in infinite-horizon, non-episodic (continuing) tasks. Semi-Markov decision processes (SMDPs) are of particular interest. In SMDPs, discrete actions stochastically generate both rewards and durations, and the objective is to optimize the average reward rate. Existing algorithms approach this by optimizing the ratio of rewards to durations. However, when rewards and durations are non-stationary (in the infinite horizon), this can be incorrect. This paper presents a novel modified harmonic mean operator that correctly computes reward rates even under such conditions. This yields model-free learning algorithms that can work with SMDPs, while maintaining robustness to non-stationary reward and duration distributions over time. We prove theoretical properties of the modified harmonic mean operator, and empirically demonstrate its efficacy in comparison to existing algorithms.
- Abstract(参考訳): 最近の研究は、無限水平非エポゾディック(継続)タスクにおける非カウント平均報酬強化学習のためのアルゴリズムへの関心を復活させ、増幅している。
半マルコフ決定プロセス(SMDP)は特に興味深い。
SMDPでは、離散的な行動は報酬と期間の両方を確率的に生成し、その目的は平均報酬率を最適化することである。
既存のアルゴリズムは、報酬と期間の比率を最適化することで、この問題にアプローチする。
しかし、報酬と期間が(無限の地平線において)非定常であるとき、これは誤りである。
本稿では,そのような条件下でも報酬率を正確に計算する修正調和平均演算子を提案する。
これにより、SMDPと併用可能なモデルフリー学習アルゴリズムが得られ、非定常報酬や持続時間分布に対する堅牢性は時間とともに維持される。
修正調和平均演算子の理論的性質を実証し,既存のアルゴリズムと比較して実効性を実証した。
関連論文リスト
- Inference-Time Scaling of Diffusion Language Models with Particle Gibbs Sampling [70.8832906871441]
我々は、モデルを再訓練することなく、所望の報酬に向けて世代を操る方法を研究する。
従来の手法では、通常は1つの認知軌道内でサンプリングやフィルタを行い、軌道レベルの改善なしに報酬をステップバイステップで最適化する。
本稿では,拡散言語モデル(PG-DLM)の粒子ギブスサンプリングについて紹介する。
論文 参考訳(メタデータ) (2025-07-11T08:00:47Z) - A Differential Perspective on Distributional Reinforcement Learning [7.028778922533688]
エージェントが時間段階当たりの報酬を最適化することを目的として,分布強化学習を平均逆設定に拡張する。
特に、Quantileベースのアプローチを用いて、ステップごとの報酬分布の長期学習および/または最適化を成功させるアルゴリズムの最初のセットを開発する。
論文 参考訳(メタデータ) (2025-06-03T19:26:25Z) - Redistributing Rewards Across Time and Agents for Multi-Agent Reinforcement Learning [14.852334980733369]
共用型マルチエージェント強化学習において、各エージェントの共用報酬への貢献を阻害する信用割り当ては重要な課題である。
本稿では、この制約から信用モデリングを分離するアプローチであるTAR(Temporal-Agent Reward Redistribution)を導入する。
本手法は,モデル精度によらず最適ポリシーが維持されることを保証するPBRSと等価であることを示す。
論文 参考訳(メタデータ) (2025-02-07T12:07:57Z) - MindFlayer SGD: Efficient Parallel SGD in the Presence of Heterogeneous and Random Worker Compute Times [49.1574468325115]
最適勾配を計算できる複数の並列作業者の設定において、滑らかな非関数の期待を最小化する問題について検討する。
この文脈における課題は、任意に不均一で分散された計算時間の存在である。
本稿では,このギャップに対処する新しい並列SGD法であるMindFlayer SGDを紹介する。
論文 参考訳(メタデータ) (2024-10-05T21:11:32Z) - On the Global Convergence of Policy Gradient in Average Reward Markov
Decision Processes [50.68789924454235]
我々は、平均報酬マルコフ決定過程(MDP)の文脈における政策勾配の最初の有限時間大域収束解析を示す。
我々の分析によると、ポリシー勾配は、$Oleft(frac1Tright)$のサブリニアレートで最適ポリシーに収束し、$Oleft(log(T)right)$ regretに変換され、$T$は反復数を表す。
論文 参考訳(メタデータ) (2024-03-11T15:25:03Z) - Beyond Exponentially Fast Mixing in Average-Reward Reinforcement
Learning via Multi-Level Monte Carlo Actor-Critic [61.968469104271676]
本稿では,アクター・アクターとアクター・アクター・アクター・アルゴリズムに埋め込まれた平均報酬に対して,マルチレベルモンテカルロ推定器を用いて混合時間に適応したRL手法を提案する。
不安定な報酬を伴うRL問題において,安定性に要求される技術的条件の緩和効果が,実用上優れた性能に変換されることを実験的に示す。
論文 参考訳(メタデータ) (2023-01-28T04:12:56Z) - Maximum-Likelihood Inverse Reinforcement Learning with Finite-Time
Guarantees [56.848265937921354]
逆強化学習(IRL)は報酬関数と関連する最適ポリシーを回復することを目的としている。
IRLの多くのアルゴリズムは本質的にネスト構造を持つ。
我々は、報酬推定精度を損なわないIRLのための新しいシングルループアルゴリズムを開発した。
論文 参考訳(メタデータ) (2022-10-04T17:13:45Z) - Langevin Dynamics for Adaptive Inverse Reinforcement Learning of
Stochastic Gradient Algorithms [21.796874356469644]
逆強化学習(IRL)は, エージェントの応答を観察することで, エージェントの報酬関数を推定することを目的としている。
我々は、報酬関数 $R(theta)$ を推定するために一般化されたランゲヴィン力学を示す。
提案したIRLアルゴリズムは、カーネルベースの受動的学習スキームを用いて、$exp(R(theta)$に比例した分布からサンプルを生成する。
論文 参考訳(メタデータ) (2020-06-20T23:12:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。