論文の概要: Analytic Planning under Uncertainty with Moment Closure
- arxiv url: http://arxiv.org/abs/2608.02519v1
- Date: Mon, 03 Aug 2026 17:17:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.727719
- Title: Analytic Planning under Uncertainty with Moment Closure
- Title(参考訳): モーメント閉鎖による不確実性下における解析計画
- Abstract要約: フルステートを解析的に伝播させることは、これを行うための原則的な方法を提供するが、伝統的に、トラクタブルな状態を維持するために制限的な政策や報酬構造を必要としてきた。
このような制約を伴わずに分散対応計画が可能であるかを検討する。
提案手法は, 連続制御における観測下での予測不確実性を良好に評価し, 目標分散を低減させる。
- 参考スコア(独自算出の注目度): 32.403961716203455
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Effective model-based reinforcement learning in stochastic environments requires planning that accounts for predictive uncertainty. Propagating full state distributions analytically offers a principled way to do this, but has traditionally required restrictive policy or reward structures to remain tractable. Consequently, modern deep reinforcement learning has largely retreated to either stochastic sampling, which introduces significant target variance, or deterministic point estimates that ignore predictive covariance entirely. We investigate whether distribution-aware planning is possible without these constraints. Using a quadratic action-value parameterization, we first reduce the Bellman backup to an expectation over the state-value function alone; the key idea is then a compatibility principle between the predictive transition distribution and the value function class, under which this expectation is analytic in the distribution's moments. We instantiate this principle with a Gaussian transition model paired with a radial-basis value function, yielding a closed-form backup that propagates both predictive mean and covariance. Empirically, our approach reduces target variance and yields well-calibrated predictive uncertainty under stochastic observations in continuous control, providing a principled framework for planning with learned distribution models.
- Abstract(参考訳): 確率的環境における効果的なモデルに基づく強化学習には、予測の不確実性を考慮した計画が必要である。
完全な状態分布の伝播は、分析的にこれを行うための原則的な方法を提供するが、伝統的に、引き出せるように制限的な政策や報酬構造を必要としてきた。
その結果、現代の深層強化学習は、大きな目標分散をもたらす確率的サンプリングや、予測的共分散を完全に無視する決定論的点推定に大きく後退した。
このような制約を伴わずに分散対応計画が可能であるかを検討する。
第一の考え方は、予測遷移分布と値関数クラスとの整合原理であり、この期待は分布のモーメントで解析される。
我々はこの原理を、放射基底値関数と組み合わせたガウス遷移モデルでインスタンス化し、予測平均と共分散の両方を伝播する閉形式バックアップを生成する。
実験的に,本手法は目標の分散を低減し,連続制御における確率的観測下での予測の不確実性を良好に補正し,学習分布モデルを用いて計画するための基本的枠組みを提供する。
関連論文リスト
- Two-stage Odd Residual Flows for Mean-Preserving Probabilistic Time Series Forecasting [9.992963275755159]
2段階のOdd Residual Flows (TORF) は不確実性推定から平均予測を分離するフレームワークである。
TORFは、近距離および長距離予測において、強い密度推定性能(CRPS)を提供しながら、最先端の決定論的精度(NMAE)を達成する。
論文 参考訳(メタデータ) (2026-08-11T16:22:47Z) - Rethinking Gaussian Trajectory Predictors: Calibrated Uncertainty for Safe Planning [4.546517638153619]
既存の軌道予測器は主に負の対数的損失に依存しており、これは過度あるいは過度に信頼される分布を予測しがちである。
本稿では,予測の不確実性を校正する新たな損失関数を提案する。
提案手法は,異なる状態領域のガウス軌道予測器によって予測される信頼度の信頼性を著しく向上することを示す。
論文 参考訳(メタデータ) (2026-03-11T04:42:49Z) - Unified Inference Framework for Single and Multi-Player Performative Prediction: Method and Asymptotic Optimality [15.289993502701305]
本稿では,単一エージェントと複数エージェントのパフォーマンスを橋渡しする,統一的な統計的推論フレームワークを提案する。
動的でパフォーマンスの高い環境で、信頼性の高い見積もりと意思決定のための原則化されたツールキットを提供する。
論文 参考訳(メタデータ) (2026-02-03T03:17:54Z) - Adaptive Conformal Prediction Intervals Over Trajectory Ensembles [50.31074512684758]
将来の軌道は、自律運転、ハリケーン予測、疫病モデルといった領域で重要な役割を果たしている。
本稿では,サンプル軌道を理論的カバレッジ保証付き校正された予測区間に変換する共形予測に基づく統一的なフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-18T21:14:07Z) - CUQDS: Conformal Uncertainty Quantification under Distribution Shift for Trajectory Prediction [6.029850098632435]
軌道予測モデルは、有限未来の軌道とその関連する不確実性の両方をオンライン環境で推測することができる。
本研究では、予測された軌道の不確かさを定量化するために、分散シフトフレームワークCUQDSのコンフォーマル不確実性定量化を提案する。
論文 参考訳(メタデータ) (2024-06-17T21:25:36Z) - Value-Distributional Model-Based Reinforcement Learning [59.758009422067]
政策の長期的業績に関する不確実性の定量化は、シーケンシャルな意思決定タスクを解決するために重要である。
モデルに基づくベイズ強化学習の観点から問題を考察する。
本稿では,値分布関数を学習するモデルに基づくアルゴリズムであるEpicemic Quantile-Regression(EQR)を提案する。
論文 参考訳(メタデータ) (2023-08-12T14:59:19Z) - Model-Based Uncertainty in Value Functions [89.31922008981735]
MDP上の分布によって引き起こされる値の分散を特徴付けることに重点を置いている。
従来の作業は、いわゆる不確実性ベルマン方程式を解くことで、値よりも後方の分散を境界にしている。
我々は、解が値の真後分散に収束する新しい不確実性ベルマン方程式を提案する。
論文 参考訳(メタデータ) (2023-02-24T09:18:27Z) - The Implicit Delta Method [61.36121543728134]
本稿では,不確実性のトレーニング損失を無限に正規化することで機能する,暗黙のデルタ法を提案する。
有限差分により無限小変化が近似された場合でも, 正則化による評価の変化は評価推定器の分散に一定であることを示す。
論文 参考訳(メタデータ) (2022-11-11T19:34:17Z) - Uncertainty Quantification for Traffic Forecasting: A Unified Approach [21.556559649467328]
不確実性は時系列予測タスクに不可欠な考慮事項である。
本研究では,交通予測の不確かさの定量化に焦点をあてる。
STUQ(Deep S-Temporal Uncertainity Quantification)を開発した。
論文 参考訳(メタデータ) (2022-08-11T15:21:53Z) - Uncertainty estimation of pedestrian future trajectory using Bayesian
approximation [137.00426219455116]
動的トラフィックシナリオでは、決定論的予測に基づく計画は信頼できない。
著者らは、決定論的アプローチが捉えられない近似を用いて予測中の不確実性を定量化する。
将来の状態の不確実性に対する降雨重量と長期予測の影響について検討した。
論文 参考訳(メタデータ) (2022-05-04T04:23:38Z) - Dense Uncertainty Estimation [62.23555922631451]
本稿では,ニューラルネットワークと不確実性推定手法について検討し,正確な決定論的予測と確実性推定の両方を実現する。
本研究では,アンサンブルに基づく手法と生成モデルに基づく手法の2つの不確実性推定法について検討し,それらの長所と短所を,完全/半端/弱度に制御されたフレームワークを用いて説明する。
論文 参考訳(メタデータ) (2021-10-13T01:23:48Z) - CovarianceNet: Conditional Generative Model for Correct Covariance
Prediction in Human Motion Prediction [71.31516599226606]
本稿では,将来の軌道の予測分布に関連する不確かさを正確に予測する手法を提案する。
我々のアプローチであるCovariaceNetは、ガウス潜在変数を持つ条件付き生成モデルに基づいている。
論文 参考訳(メタデータ) (2021-09-07T09:38:24Z) - Which Invariance Should We Transfer? A Causal Minimax Learning Approach [18.71316951734806]
本稿では、因果的観点からの包括的ミニマックス分析について述べる。
最小の最悪のリスクを持つサブセットを探索する効率的なアルゴリズムを提案する。
本手法の有効性と有効性は, 合成データとアルツハイマー病の診断で実証された。
論文 参考訳(メタデータ) (2021-07-05T09:07:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。