論文の概要: Low-Complexity Policy Tessellations in Structured Markov Decision Processes
- arxiv url: http://arxiv.org/abs/2606.25593v1
- Date: Wed, 24 Jun 2026 09:00:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.288707
- Title: Low-Complexity Policy Tessellations in Structured Markov Decision Processes
- Title(参考訳): 構造マルコフ決定過程における低複雑さ政策テッセルレーション
- Abstract要約: 構造化マルコフ決定過程における最適政治幾何について検討する。
最適ポリシーは、より単純な決定テッセルレーションを誘導する。
政策領域を直接学習する境界ベースの政策近似を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study optimal-policy geometry in structured Markov decision processes. While approximate dynamic programming and reinforcement learning typically approximate high-dimensional value functions, we show that optimal policies induce simpler decision tessellations. We propose boundary-based policy approximations that learn policy regions directly. A policy-loss decomposition links performance degradation to action margins and explains why errors concentrate near indifference boundaries. Inventory control and queue admission experiments show lower policy error, smaller value gaps, faster error decay, and stability than reinforcement learning baselines.
- Abstract(参考訳): 構造化マルコフ決定過程における最適政治幾何について検討する。
近似動的プログラミングと強化学習は一般に高次元値関数を近似するが、最適ポリシーはより単純な決定テッセル化を誘導することを示す。
政策領域を直接学習する境界ベースの政策近似を提案する。
ポリシーロス分解は、パフォーマンス劣化とアクションマージンを結びつけ、なぜエラーが差分境界付近に集中するのかを説明する。
インベントリ制御とキュー入力実験は、強化学習ベースラインよりも、ポリシーエラーの低減、値ギャップの縮小、エラーの高速化、安定性を示している。
関連論文リスト
- Offline Policy Learning with Weight Clipping and Heaviside Composite Optimization [6.133885868970599]
オフラインポリシー学習は、歴史的データを使用して、最適なパーソナライズされた決定ルールを学ぶことを目的としています。
そこで我々は,小確率のスコアをトラストするウェイトクリッピング推定器に基づくオフラインポリシー学習アルゴリズムを開発した。
論文 参考訳(メタデータ) (2026-01-17T17:35:00Z) - Memoryless Policy Iteration for Episodic POMDPs [0.0]
ポリシイテレーションアルゴリズムを単調に改良した新しいファミリを導入する。
この家系は,自然計算効率指数を最大化する最適パターンを認めている。
さらに、データから値を推定し、メモリレスポリシーを直接学習するモデルフリーな変種を開発します。
論文 参考訳(メタデータ) (2025-12-11T19:54:57Z) - Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning [77.92320830700797]
強化学習は、大規模言語モデルの推論機能を実現する上で中心的な役割を果たしてきた。
本稿では,ポリシー更新時の曲率情報を追跡し,活用するトラクタブルな計算フレームワークを提案する。
アルゴリズムであるCurvature-Aware Policy Optimization (CAPO)は、不安定な更新に寄与するサンプルを特定し、それらをマスクアウトする。
論文 参考訳(メタデータ) (2025-10-01T12:29:32Z) - Transfer Learning for Classification under Decision Rule Drift with Application to Optimal Individualized Treatment Rule Estimation [50.34670342434884]
本研究では,ベイズ決定規則による後方ドリフトのモデル化手法を提案する。
穏やかな規則性条件の下では、推定器の整合性を確立し、リスク境界を導出する。
本稿では,最適な個別化処理ルールの推定に適応させることにより,本手法の幅広い適用性について述べる。
論文 参考訳(メタデータ) (2025-08-28T16:03:06Z) - Reinforcement Learning with Continuous Actions Under Unmeasured Confounding [14.510042451844766]
本稿では,連続行動空間を用いた強化学習におけるオフライン政策学習の課題に対処する。
我々は,ミニマックス推定器を開発し,クラス内最適ポリシーを特定するためのポリシー勾配に基づくアルゴリズムを提案する。
得られた最適方針の整合性、有限サンプル誤差境界、後悔境界に関する理論的結果を提供する。
論文 参考訳(メタデータ) (2025-05-01T04:55:29Z) - Statistical Analysis of Policy Space Compression Problem [54.1754937830779]
政策探索手法は強化学習において重要であり、継続的な状態反応と部分的に観察可能な問題に対処するための枠組みを提供する。
政策圧縮による政策空間の削減は、学習プロセスを加速するための強力で報酬のないアプローチとして現れます。
この手法は方針空間をより小さく代表的な集合に凝縮し、元の効果のほとんどを維持している。
論文 参考訳(メタデータ) (2024-11-15T02:46:55Z) - Projected Off-Policy Q-Learning (POP-QL) for Stabilizing Offline
Reinforcement Learning [57.83919813698673]
Projected Off-Policy Q-Learning (POP-QL) は、政治外のサンプルを同時に重み付け、分散を防止し、価値近似誤差を減らすためにポリシーを制約する新しいアクタ批判アルゴリズムである。
我々の実験では、POP-QLは標準ベンチマーク上での競合性能を示すだけでなく、データ収集ポリシーがかなり最適化されていないタスクにおいて競合するメソッドよりも優れています。
論文 参考訳(メタデータ) (2023-11-25T00:30:58Z) - Supported Trust Region Optimization for Offline Reinforcement Learning [59.43508325943592]
本稿では,行動方針の支持範囲内で制約された政策を用いて信頼地域政策の最適化を行う,信頼地域最適化(STR)を提案する。
近似やサンプリング誤差を仮定すると、STRはデータセットの最適サポート制約ポリシーに収束するまで厳密なポリシー改善を保証する。
論文 参考訳(メタデータ) (2023-11-15T13:16:16Z) - Stable Policy Optimization via Off-Policy Divergence Regularization [50.98542111236381]
信頼地域政策最適化(TRPO)とPPO(Pximal Policy Optimization)は、深層強化学習(RL)において最も成功した政策勾配アプローチの一つである。
本稿では, 連続的な政策によって引き起こされる割引状態-行動訪問分布を, 近接項で抑制し, 政策改善を安定化させる新しいアルゴリズムを提案する。
提案手法は, ベンチマーク高次元制御タスクの安定性と最終的な性能向上に有効である。
論文 参考訳(メタデータ) (2020-03-09T13:05:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。