論文の概要: Scalable Rao-Blackwellized Online Planning for High-Dimensional POMDPs
- arxiv url: http://arxiv.org/abs/2609.01351v1
- Date: Tue, 01 Sep 2026 14:57:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.782456
- Title: Scalable Rao-Blackwellized Online Planning for High-Dimensional POMDPs
- Title(参考訳): 高次元PMDPのためのスケーラブルなラオ黒化オンラインプランニング
- Authors: Jiho Lee, Nisar Ahmed, Kyle Hollins Wray, Zachary Sunberg,
- Abstract要約: 我々は,Rao-Blackwellized Online POMDP (RB-POMDP) フレームワークを拡張し,その高次元設定における一般化性を向上させる。
本稿では,FastSLAM 2.0と統合することで,ロボット検索・救助作業におけるこのフレームワークの有効性を実証する。
- 参考スコア(独自算出の注目度): 10.757434965980124
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Online planning under uncertainty remains a fundamental challenge for robotic systems operating in partially observable environments with high-dimensional state spaces. While sampling-based POMDP solvers enable approximate decision-making in large or continuous domains, their performance degrades as belief dimensionality increases due to the high variance inherent in Monte Carlo-based estimation. In this work, we extend the Rao-Blackwellized online POMDP (RB-POMDP) framework to improve its generalizability in high-dimensional settings through hybrid continuous-discrete belief representations. By analytically propagating uncertainty associated with marginalized state components during tree-based planning, the proposed approach reduces sampling-induced variance in value estimation. We demonstrate the effectiveness of this framework in a robotic search-and-rescue task by integrating it with FastSLAM 2.0. Experimental results show that the proposed planner achieves higher cumulative rewards using significantly fewer particles and planning simulations than purely sampling-based methods under equivalent computational budgets. These results suggest that structured high-dimensional robotic problems admitting tractable sufficient statistics can be effectively leveraged within the RB-POMDP framework for computationally feasible online decision-making.
- Abstract(参考訳): 不確実性の下でのオンラインプランニングは、高次元の状態空間を持つ部分的に観測可能な環境で動くロボットシステムにとって、依然として根本的な課題である。
サンプリングベースPOMDPソルバは、大域または連続領域における近似決定を可能にするが、モンテカルロ推定に固有の高分散により、信念次元が増加するにつれて、その性能は低下する。
本研究では,Rao-Blackwellized Online POMDP (RB-POMDP) フレームワークを拡張し,ハイブリッド連続離散的信念表現により高次元設定における一般化性を向上させる。
木をベースとした計画において, 余分な状態成分に関連する不確実性を解析的に伝播することにより, サンプリング誘起の値推定のばらつきを低減させる。
本稿では,FastSLAM 2.0と統合することで,ロボット検索・救助作業におけるこのフレームワークの有効性を実証する。
実験結果から,提案したプランナーは,等価な計算予算下での純粋サンプリング法よりも,極めて少ない粒子と計画シミュレーションを用いて,高い累積報酬を達成できることが示唆された。
これらの結果から, 計算可能なオンライン意思決定のためのRB-POMDPフレームワークにおいて, 十分な統計量を有する構造的高次元ロボット問題を効果的に活用できることが示唆された。
関連論文リスト
- Online Robust Planning under Model Uncertainty: A Sample-Based Approach [8.599681538174888]
本稿では,Markov Decision Processs (MDP) のためのオンライン計画アルゴリズムであるRobust Sparse Sampling (RSS)を紹介した。
RSSはサンプル平均近似(SAA)の効率性と理論的特性を活用することでロバストな値関数を計算する
RSSは無限の状態空間や連続状態空間に適用でき、そのサンプルと計算の複雑さは状態空間のサイズとは独立である。
論文 参考訳(メタデータ) (2025-09-12T11:41:23Z) - Improved Monte Carlo Planning via Causal Disentanglement for Structurally-Decomposed Markov Decision Processes [0.9768138268100163]
本稿では,MDPの時間的因果グラフを独立成分に分割するために,因果解離を利用した構造分解型MDP(SD-MDP)を提案する。
様々な物流および金融分野のベンチマークよりも優れた政策性能を示す。
論文 参考訳(メタデータ) (2024-06-23T16:22:40Z) - Sample Complexity of Offline Distributionally Robust Linear Markov Decision Processes [37.15580574143281]
オフライン強化学習(RL)
本稿では、オフラインデータを用いた全変動距離を特徴とする不確実性を伴う分布安定線形マルコフ決定過程(MDP)のサンプル複雑性について考察する。
我々は悲観的なモデルに基づくアルゴリズムを開発し、最小限のデータカバレッジ仮定の下でそのサンプルの複雑さを確立する。
論文 参考訳(メタデータ) (2024-03-19T17:48:42Z) - Learning Logic Specifications for Policy Guidance in POMDPs: an
Inductive Logic Programming Approach [57.788675205519986]
我々は任意の解法によって生成されるPOMDP実行から高品質なトレースを学習する。
我々は、データと時間効率のIndu Logic Programming(ILP)を利用して、解釈可能な信念に基づくポリシー仕様を生成する。
ASP(Answer Set Programming)で表現された学習は、ニューラルネットワークよりも優れた性能を示し、より少ない計算時間で最適な手作りタスクに類似していることを示す。
論文 参考訳(メタデータ) (2024-02-29T15:36:01Z) - Provably Efficient UCB-type Algorithms For Learning Predictive State
Representations [55.00359893021461]
逐次決定問題は、予測状態表現(PSR)によってモデル化された低ランク構造が認められる場合、統計的に学習可能である
本稿では,推定モデルと実モデル間の全変動距離を上限とする新しいボーナス項を特徴とする,PSRに対する最初のUCB型アプローチを提案する。
PSRに対する既存のアプローチとは対照的に、UCB型アルゴリズムは計算的トラクタビリティ、最優先の準最適ポリシー、モデルの精度が保証される。
論文 参考訳(メタデータ) (2023-07-01T18:35:21Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z) - Modular Deep Reinforcement Learning for Continuous Motion Planning with
Temporal Logic [59.94347858883343]
本稿では,マルコフ決定過程(MDP)をモデルとした自律動的システムの運動計画について検討する。
LDGBA と MDP の間に組込み製品 MDP (EP-MDP) を設計することである。
モデルフリー強化学習(RL)のためのLDGBAベースの報酬形成と割引スキームは、EP-MDP状態にのみ依存する。
論文 参考訳(メタデータ) (2021-02-24T01:11:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。