論文の概要: Risk-Averse Online POMDP Planning via CVaR of the Immediate Cost with Performance Guarantees
- arxiv url: http://arxiv.org/abs/2609.35874v1
- Date: Sat, 26 Sep 2026 18:37:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.872791
- Title: Risk-Averse Online POMDP Planning via CVaR of the Immediate Cost with Performance Guarantees
- Title(参考訳): 性能保証付き即時コストCVaRによるリスク逆オンラインPMDP計画
- Abstract要約: オンラインPOMDPプランナーは、予測累積コストを最適化し、高コストの州にかなりの質量を置くと、危険な状態を隠蔽することができる。
既存のリスク逆法は、リスク関数に静的または動的条件付値(CVaR)を適用し、軌道レベルのリスクを捕捉するが、2つのギャップを共有している。
CVaRを各ステップにおける信念の即時コストに適用し、電流に関するステップごとの不確実性を直接ターゲットとする。
- 参考スコア(独自算出の注目度): 9.269394037577177
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Online POMDP planners optimize the expected cumulative cost, which can mask dangerous states when the belief places significant mass on high-cost states. Existing risk-averse methods apply static or dynamic Conditional Value at Risk (CVaR) to the value function, capturing trajectory-level risk, but share two gaps: (i) by retaining the immediate cost as an expectation of a state-dependent cost over the belief, the risk \emph{within} the belief is left unaddressed; and (ii) by modifying the value function, they require new tailored algorithms rather than reusing existing expectation-based planners. We instead apply CVaR to the immediate cost over the belief at each step, directly targeting per-step uncertainty about the current state. The standard expected cumulative return is retained as the objective, so the resulting problem has a standard MDP structure: any expectation-based POMDP planner can be made risk-sensitive by changing only the cost computation. We inherit finite-time guarantees for policy evaluation and sparse sampling---with estimation error independent of the risk level---and, as our central theoretical result, prove a finite-time bound on the gap between the particle belief MDP surrogate and the original POMDP, which together yield an end-to-end guarantee from the true POMDP value to the algorithmic estimate. In the risk-neutral limit, the formulation recovers standard expectation-based planning.
- Abstract(参考訳): オンラインPOMDPプランナーは、予測累積コストを最適化し、高コストの州にかなりの質量を置くと、危険な状態を隠蔽することができる。
既存のリスク逆法では、静的あるいは動的条件付きリスク値(CVaR)を値関数に適用し、軌道レベルのリスクをキャプチャするが、2つのギャップを共有する。
一 信条に対する国家依存の費用の期待として即時費用を保ち、その信条が遵守されないリスクを負うこと。
(ii)値関数を変更することで、既存の予測ベースのプランナを再利用するのではなく、新しい調整アルゴリズムが必要となる。
CVaRを各ステップの信念の即時コストに適用し、現在の状態に関するステップごとの不確実性を直接ターゲットとします。
標準累積リターンは目的として保持されるので、結果として得られる問題は標準のMDP構造であり、予測ベースのPOMDPプランナはコスト計算だけを変更することでリスクに敏感にすることができる。
我々は, リスクレベルに依存しない推定誤差を伴って, 政策評価とスパースサンプリングの有限時間保証を継承し, 粒子信念MDPサロゲートと元のPOMDPとのギャップに有限時間境界を証明し, 真のPOMDP値からアルゴリズム的推定に終端保証を与える。
リスクニュートラル限界では、定式化は標準予測に基づく計画を回復する。
関連論文リスト
- Long-Term Sequential Decision Making under Risk [0.0]
本研究では,Emphrootに基づく(絶対的)リスク目標の下での有限水平MDP計画について検討し,全リターン分布にランク依存関数を適用した。
我々は列挙自由でサンプリング不要な方法である textbfERQDP を提案する。
論文 参考訳(メタデータ) (2026-07-22T08:44:25Z) - Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability [79.08785366532287]
部分観測可能性下でのリスク感応制御のための軽量なリスクゲート強化学習近似を提案する。
安全クリティカルな部分観測可能な2つの領域 – 自動グルコース調節と安全制約ナビゲーション – でアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-14T01:23:09Z) - Accelerated Online Risk-Averse Policy Evaluation in POMDPs with Theoretical Guarantees and Novel CVaR Bounds [9.269394037577177]
この研究は、部分的に観測可能な領域における条件付き値-アット・リスク評価を加速するための理論的枠組みを導入する。
単純化された信念-MDPから計算可能なCVaR値関数の上下境界を確立する。
我々は,確率的保証を伴う粒子信頼型MDPフレームワーク内で,これらの境界に対する推定器を開発する。
論文 参考訳(メタデータ) (2026-02-26T15:01:40Z) - Online Risk-Averse Planning in POMDPs Using Iterated CVaR Value Function [9.269394037577177]
動的リスク尺度(ICVaR)を用いた部分観測可能性下におけるリスク感受性計画に関する研究
ICVaRのポリシー評価アルゴリズムは,動作空間の濃度に依存しない有限時間性能保証を用いて開発されている。
ベンチマークPOMDP領域の実験では、提案したICVaRプランナは、リスクニュートラルなプランナに比べて、テールリスクが低いことが示されている。
論文 参考訳(メタデータ) (2026-01-28T12:48:20Z) - Model-Based Epistemic Variance of Values for Risk-Aware Policy Optimization [59.758009422067]
モデルベース強化学習における累積報酬に対する不確実性を定量化する問題を考察する。
我々は、解が値の真後分散に収束する新しい不確実性ベルマン方程式(UBE)を提案する。
本稿では,リスク・サーキングとリスク・アバース・ポリシー最適化のいずれにも適用可能な汎用ポリシー最適化アルゴリズムQ-Uncertainty Soft Actor-Critic (QU-SAC)を導入する。
論文 参考訳(メタデータ) (2023-12-07T15:55:58Z) - COptiDICE: Offline Constrained Reinforcement Learning via Stationary
Distribution Correction Estimation [73.17078343706909]
オフラインの制約付き強化学習(RL)問題。エージェントは、所定のコスト制約を満たしながら期待されるリターンを最大化するポリシーを計算し、事前に収集されたデータセットからのみ学習する。
定常分布空間におけるポリシーを最適化するオフライン制約付きRLアルゴリズムを提案する。
我々のアルゴリズムであるCOptiDICEは、コスト上限を制約しながら、利益に対する最適政策の定常分布補正を直接見積もる。
論文 参考訳(メタデータ) (2022-04-19T15:55:47Z) - Robust and Adaptive Temporal-Difference Learning Using An Ensemble of
Gaussian Processes [70.80716221080118]
本稿では、時間差学習(TD)による政策評価の世代的視点について考察する。
OS-GPTDアプローチは、状態-逆ペアのシーケンスを観測することにより、与えられたポリシーの値関数を推定するために開発された。
1つの固定カーネルに関連する限られた表現性を緩和するために、GP前の重み付けアンサンブル(E)を用いて代替のスキームを生成する。
論文 参考訳(メタデータ) (2021-12-01T23:15:09Z) - Risk-Averse Stochastic Shortest Path Planning [25.987787625028204]
最適、定常、マルコフの方針が存在することを示し、特別なベルマン方程式を用いて見出すことができる。
ローバーナビゲーションMDPを用いて,条件値値リスク(CVaR)とエントロピー値値リスク(EVaR)のコヒーレントリスク尺度を用いて提案手法を説明する。
論文 参考訳(メタデータ) (2021-03-26T20:49:14Z) - Reinforcement Learning of Risk-Constrained Policies in Markov Decision
Processes [5.081241420920605]
マルコフ決定プロセス(MDPs)は、確率的不確実性の存在下でのシーケンシャルな意思決定のためのデファクト・フレームワークである。
破滅的な結果が再帰する障害状態と相まって, 対価を割引したMDPについて検討する。
我々の主な貢献は、UDTのような探索とMDPとの学習的相互作用を組み合わせた効率的なリスク制約型プランニングアルゴリズムである。
論文 参考訳(メタデータ) (2020-02-27T13:36:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。