論文の概要: Threshold Structure of Optimal Policies in Restart POMDPs
- arxiv url: http://arxiv.org/abs/2608.10936v1
- Date: Tue, 11 Aug 2026 14:03:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:46.067235
- Title: Threshold Structure of Optimal Policies in Restart POMDPs
- Title(参考訳): 再起動型PMDPにおける最適ポリシの閾値構造
- Abstract要約: 一般ボレル状態空間上の再スタートPOMDP(Partially Observable Markov Decision Process)について検討する。
最後に観測された状態と再起動から経過した時間からなる十分統計表現を爆発させ,その問題を十分に観測されたMDPに還元する。
- 参考スコア(独自算出の注目度): 2.8686127872933724
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study a Restart POMDP (Partially Observable Markov Decision Process) on a general Borel state space, where the controller either lets the hidden state evolve unobserved or restarts the system and observes the new state. Exploiting a sufficient-statistic representation consisting of the last observed state and the elapsed time since restart, we reduce the problem to a fully observed MDP. Under a natural one-step cost deterioration condition, we prove that optimal policies have a threshold structure in the elapsed time for both the discounted and total undiscounted cost criteria. When the state space is partially ordered and the kernel is stochastically monotone, we further show that the optimal threshold is nonincreasing in the state. For the average cost criterion, under additional assumptions of geometric ergodicity and domination of the transient gain, we establish analogous threshold results via the vanishing discount approach, after showing the uniform boundedness of the optimal thresholds and relative value functions.
- Abstract(参考訳): 本稿では,一般的なボレル状態空間上でのリスタートPOMDP(Partially Observable Markov Decision Process)について検討する。
最後に観測された状態と再起動から経過した時間からなる十分統計表現を爆発させ,その問題を十分に観測されたMDPに還元する。
自然の1段階のコスト劣化条件下では, 最適政策は, 割引と非割引の費用基準の両面において, 経過時間にしきい値構造を有することを示す。
状態空間が部分的に順序付けられ、カーネルが確率的に単調であるとき、最適しきい値は状態内では増加しないことを示す。
平均コスト基準では, 幾何エルゴード性および過渡利得支配の仮定を付加して, 最適閾値と相対値関数の均一な有界性を示した後, 消滅割引手法を用いて類似しきい値を求める。
関連論文リスト
- Ratio-Variance Regularized Policy Optimization [64.95520246570446]
ポリシ比の分散を明示的に制約することは、信頼領域の制約に対する原則的な局所近似をもたらすことを示す。
本稿では,この制約を実装したR2bf VPO$(Ratio-Variance Regularized Policy Optimization)を紹介する。
論文 参考訳(メタデータ) (2026-05-26T09:53:42Z) - Understanding Quantization of Optimizer States in LLM Pre-training: Dynamics of State Staleness and Effectiveness of State Resets [10.325245543844245]
我々は,低精度指数移動平均 (EMA) 状態について検討し,量子化が同じ保存値に多くの名目更新を引き起こすことを示す。
本研究では,1段階の停止確率を推定し,時間の経過とともに停止する確率を推定する簡易なストールの予測モデルを構築した。
この観点は、なぜ状態リセットが低い精度で役立つのかという力学的な説明を提供する。
論文 参考訳(メタデータ) (2026-03-17T16:14:36Z) - Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum [62.691095807959215]
我々は,シングルタイムスケールアクター・クリティック(AC)アルゴリズムを用いて,$O(-2)$の最適なグローバルポリシを得るための最適なサンプル複雑性を確立する。
これらのメカニズムは、既存のディープラーニングアーキテクチャと互換性があり、実用的な適用性を損なうことなく、小さな修正しか必要としない。
論文 参考訳(メタデータ) (2026-02-02T00:35:42Z) - Monitoring State Transitions in Markovian Systems with Sampling Cost [65.4151496405543]
自然なアプローチは、予想される予測損失がクエリコスト以下で、クエリがなければいつ発生するかを予測する、欲張りのポリシーである。
最適(OPT)戦略は状態依存のしきい値ポリシである。
遷移確率が未知の場合、我々は、グレディポリシーの予測勾配降下(PSGD)に基づく学習変種を提案する。
論文 参考訳(メタデータ) (2025-10-25T15:07:37Z) - Sampling Complexity of TD and PPO in RKHS [32.00317289826905]
機能空間の観点からPPO(Proximal Policy Optimization)を再考する。
我々の結果は、PPOを有限次元の仮定を超えた厳密な理論上の足場に置く。
論文 参考訳(メタデータ) (2025-09-29T16:19:19Z) - MDPs with a State Sensing Cost [3.673994921516517]
予測割引コストマルコフ決定プロセス(MDP)を定式化する。
最適値関数の下位境界を導出し、任意のポリシーの最適値以下のギャップを埋めることを可能にする。
また,政策改善に基づく計算効率のよいアルゴリズムSPIを提案する。
論文 参考訳(メタデータ) (2025-05-06T08:06:45Z) - On the Global Convergence of Policy Gradient in Average Reward Markov
Decision Processes [50.68789924454235]
我々は、平均報酬マルコフ決定過程(MDP)の文脈における政策勾配の最初の有限時間大域収束解析を示す。
我々の分析によると、ポリシー勾配は、$Oleft(frac1Tright)$のサブリニアレートで最適ポリシーに収束し、$Oleft(log(T)right)$ regretに変換され、$T$は反復数を表す。
論文 参考訳(メタデータ) (2024-03-11T15:25:03Z) - Hallucinated Adversarial Control for Conservative Offline Policy
Evaluation [64.94009515033984]
本研究では,環境相互作用のオフラインデータセットが与えられた場合,政策のパフォーマンスを低く抑えることを目的とした,保守的非政治評価(COPE)の課題について検討する。
本稿では,遷移力学の不確実性を考慮した学習モデルに基づくHAMBOを紹介する。
結果のCOPE推定値が妥当な下界であることを証明し、正則性条件下では、真に期待された戻り値への収束を示す。
論文 参考訳(メタデータ) (2023-03-02T08:57:35Z) - Structural Estimation of Markov Decision Processes in High-Dimensional
State Space with Finite-Time Guarantees [39.287388288477096]
本研究では,実施行動と訪問状態の観測可能な履歴に基づいて,人間エージェントによる動的決定の構造モデルの推定作業を検討する。
この問題には固有のネスト構造があり、内部問題では与えられた報酬関数に対する最適ポリシーが特定され、外部問題では適合度の測定が最大化される。
本研究では,高次元状態空間を扱うための有限時間保証付き単一ループ推定アルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-10-04T00:11:38Z) - Robust and Adaptive Temporal-Difference Learning Using An Ensemble of
Gaussian Processes [70.80716221080118]
本稿では、時間差学習(TD)による政策評価の世代的視点について考察する。
OS-GPTDアプローチは、状態-逆ペアのシーケンスを観測することにより、与えられたポリシーの値関数を推定するために開発された。
1つの固定カーネルに関連する限られた表現性を緩和するために、GP前の重み付けアンサンブル(E)を用いて代替のスキームを生成する。
論文 参考訳(メタデータ) (2021-12-01T23:15:09Z) - Near Optimality of Finite Memory Feedback Policies in Partially Observed
Markov Decision Processes [0.0]
システム力学と測定チャネルモデルが知られていると仮定したPOMDPの計画問題について検討する。
軽度非線形フィルタ安定性条件下で近似的信念モデルに対する最適ポリシーを求める。
また、有限ウィンドウメモリサイズと近似誤差境界を関連づけた収束結果のレートを確立する。
論文 参考訳(メタデータ) (2020-10-15T00:37:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。