論文の概要: Bellman-Taylor Score Decoding for Markov Decision Processes with State-Dependent Feasible Action Sets
- arxiv url: http://arxiv.org/abs/2606.10979v1
- Date: Tue, 09 Jun 2026 15:15:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-10 15:40:58.578142
- Title: Bellman-Taylor Score Decoding for Markov Decision Processes with State-Dependent Feasible Action Sets
- Title(参考訳): 状態依存可能な動作集合を持つマルコフ決定過程のベルマン・テイラースコア復号法
- Authors: Yi Chen, Rushuai Yang, Qiang Chen, Dongyan, Huo,
- Abstract要約: 本稿では,政策学習をユークリッドのスコア空間に移行し,アクションデコーダによる実行可能性を高める枠組みを提案する。
このフレームワークを,状態依存型インデックスベースのディスパッチルールを本質的に学習する待ち行列ネットワーク制御問題に適用する。
数値実験により、小さなインスタンスではほぼ最適性能を示し、大規模システムではベンチマークよりも大幅に改善されている。
- 参考スコア(独自算出の注目度): 14.165642103539632
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many Markov decision processes (MDPs) in operations research have feasible actions that are state dependent and defined implicitly by various operational constraints. These features make it difficult to use standard deep reinforcement learning (DRL) algorithms, whose action interfaces typically assume either a fixed finite action catalog or a simple Euclidean space. Motivated by a Taylor expansion of the optimal action-value function, we propose Bellman--Taylor score decoding, a framework that moves policy learning to a Euclidean score space while enforcing feasibility through an action decoder. The induced latent-score MDP then can be optimized by standard DRL algorithms without differentiating through the decoder. We provide a performance guarantee showing that the optimality gap of this approach decomposes into a structural approximation error and an algorithmic learning error. Lastly, we apply this framework to a queueing network control problem, where the policy essentially learns a state-dependent index-based dispatching rule. Numerical experiments show near-optimal performance in small instances and considerable improvements over benchmarks in larger systems.
- Abstract(参考訳): オペレーション研究における多くのマルコフ決定プロセス(MDP)は、様々な操作制約によって暗黙的に定義された状態依存の実行可能なアクションを持つ。
これらの特徴により、標準の深層強化学習(DRL)アルゴリズムの使用が困難となり、アクションインターフェースは通常、固定された有限作用カタログか単純なユークリッド空間のいずれかを仮定する。
最適作用値関数のテイラー展開を動機として,政策学習をユークリッドスコア空間に移動させるフレームワークであるベルマン・テイラースコア復号法を提案する。
誘導された潜在スコア MDP はデコーダを介さずに標準のDRLアルゴリズムで最適化できる。
本稿では,本手法の最適性ギャップが構造近似誤差とアルゴリズム学習誤差に分解されることを示す性能保証を提供する。
最後に、このフレームワークをキューネットワーク制御問題に適用し、ポリシーは基本的に状態依存のインデックスベースのディスパッチルールを学習する。
数値実験により、小さなインスタンスではほぼ最適性能を示し、大規模システムではベンチマークよりも大幅に改善されている。
関連論文リスト
- Breaking the Computational Barrier: Provably Efficient Actor-Critic for Low-Rank MDPs [53.412166189410904]
低ランクマルコフ決定過程(MDPs)の下で広く採用されているRLオーラクルの階層を確立するために,教師付き学習を計算プロキシとして利用する。
本研究の目的は,政策評価にのみ依存する新しい楽観的アクター批判アルゴリズムを提案することである。
提案アルゴリズムは,従来の計算コストの高い計画や最適化オーラクルを回避しつつ,既存のサンプル複雑度保証よりも優れていることを示す。
論文 参考訳(メタデータ) (2026-05-02T04:46:54Z) - Sample and Oracle Efficient Reinforcement Learning for MDPs with Linearly-Realizable Value Functions [10.225358400539719]
本稿では,線形作用が特徴写像に一般化される決定法(MDP)の効率的な強化アルゴリズムを提案する。
具体的には、この設定において、最適に近いポリシーを効率的に見つける新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-09-07T14:38:05Z) - Multi-Objective Policy Gradients with Topological Constraints [108.10241442630289]
本稿では, PPOアルゴリズムの簡単な拡張により, TMDPにおけるポリシー勾配に対する新しいアルゴリズムを提案する。
シミュレーションと実ロボットの両方の目的を任意に並べた実世界の多目的ナビゲーション問題に対して,これを実証する。
論文 参考訳(メタデータ) (2022-09-15T07:22:58Z) - Provable Benefits of Actor-Critic Methods for Offline Reinforcement
Learning [85.50033812217254]
アクター批判法はオフラインの強化学習に広く用いられているが、理論的にはそれほどよく理解されていない。
ペシミズムの原理を自然に取り入れた新しいオフラインアクター批判アルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-08-19T17:27:29Z) - Logistic Q-Learning [87.00813469969167]
MDPにおける最適制御の正規化線形プログラミング定式化から導いた新しい強化学習アルゴリズムを提案する。
提案アルゴリズムの主な特徴は,広範に使用されているベルマン誤差の代わりとして理論的に音声として機能する,政策評価のための凸損失関数である。
論文 参考訳(メタデータ) (2020-10-21T17:14:31Z) - Adaptive Sampling for Best Policy Identification in Markov Decision
Processes [79.4957965474334]
本稿では,学習者が生成モデルにアクセスできる場合の,割引マルコフ決定(MDP)における最良の政治的識別の問題について検討する。
最先端アルゴリズムの利点を論じ、解説する。
論文 参考訳(メタデータ) (2020-09-28T15:22:24Z) - CertRL: Formalizing Convergence Proofs for Value and Policy Iteration in
Coq [1.154957229836278]
強化学習アルゴリズムは,長期報酬を最適化することにより,確率的環境における逐次的意思決定問題を解決する。
本稿では、有限状態マルコフ決定過程に対する値とポリシーの反復という、2つの正準強化学習アルゴリズムの形式化を開発する。
CertRLライブラリは、Markov決定プロセスと強化学習アルゴリズムに関する特性を証明するための一般的なフレームワークを提供する。
論文 参考訳(メタデータ) (2020-09-23T22:28:17Z) - Zeroth-Order Supervised Policy Improvement [94.0748002906652]
政策勾配(PG)アルゴリズムは強化学習(RL)に広く用いられている。
ゼロ次監視政策改善(ZOSPI)を提案する。
ZOSPIは、PGメソッドの局所的な利用を保ちながら、推定値関数を全世界で$Q$で活用する。
論文 参考訳(メタデータ) (2020-06-11T16:49:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。