論文の概要: Synthesizing POMDP Policies: Sampling Meets Model-checking via Learning
- arxiv url: http://arxiv.org/abs/2605.14440v1
- Date: Thu, 14 May 2026 06:37:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.66504
- Title: Synthesizing POMDP Policies: Sampling Meets Model-checking via Learning
- Title(参考訳): POMDPポリシーの合成: 学習によるモデルチェックのサンプリング
- Authors: Debraj Chakraborty, Anirban Majumdar, Prince Mathew, Sayan Mukherjee, Jean-François Raskin,
- Abstract要約: POMDPは不確実性の下での意思決定の標準フレームワークである。
サンプリングベースの手法はうまくスケールするが、正式な正当性保証がないため、安全クリティカルなアプリケーションには適さない。
本稿では,サンプリング,自動学習,モデルチェックを統合した合成フレームワークを提案する。
- 参考スコア(独自算出の注目度): 2.375990942704781
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Partially Observable Markov Decision Processes (POMDPs) are the standard framework for decision-making under uncertainty. While sampling-based methods scale well, they lack formal correctness guarantees, making them unsuitable for safety-critical applications. Conversely, formal synthesis techniques provide correctness-by-construction but often struggle with scalability, as general POMDP synthesis is undecidable. To bridge this gap, we propose a synthesis framework that integrates sampling, automata learning, and model-checking. Inspired by Angluin's $L^*$ algorithm, our approach utilizes sampling as a membership oracle and model-checking as an equivalence oracle. This enables the synthesis of finite-state controllers with formal guarantees, provided the sampling-induced policy is regular. We establish a relative completeness result for this framework. Experimental results from our prototypical implementation demonstrate that this method successfully solves threshold-safety problems that remain challenging for existing formal synthesis tools. We believe our algorithm serves as a valuable component in a portfolio approach to tackling the inherent difficulty of POMDP synthesis problems.
- Abstract(参考訳): 部分的に観察可能なマルコフ決定プロセス(POMDP)は不確実性の下での意思決定の標準フレームワークである。
サンプリングベースの手法はうまくスケールするが、正式な正当性保証がないため、安全クリティカルなアプリケーションには適さない。
逆に、形式的な合成技術は正確性バイコンストラクションを提供するが、一般的なPOMDP合成は決定不可能であるためスケーラビリティに苦慮することが多い。
このギャップを埋めるために,サンプリング,自動学習,モデルチェックを統合した合成フレームワークを提案する。
アングルンの$L^*$アルゴリズムにインスパイアされた我々の手法は、サンプリングをメンバーシップオラクル、モデルチェックを等価オラクルとして利用する。
これにより、サンプリング誘導ポリシーが正則であれば、正式な保証付き有限状態コントローラの合成が可能になる。
このフレームワークに対する相対的な完全性の結果を確立します。
提案手法は,既存の形式的合成ツールでは依然として困難なしきい値安全問題の解決に成功していることを示す。
我々は,本アルゴリズムがPOMDP合成問題の本質的な難しさに対処するためのポートフォリオアプローチにおいて,重要な要素であると考えている。
関連論文リスト
- Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Constrained and Robust Policy Synthesis with Satisfiability-Modulo-Probabilistic-Model-Checking [4.064849471241967]
本稿では,任意の構造制約を受けるロバストポリシを効果的に計算するための最初のアプローチを提案する。
数百のベンチマークの実験は、制約付きかつ堅牢なポリシー合成の実現可能性を示している。
論文 参考訳(メタデータ) (2025-11-11T10:28:42Z) - Unlocking Symbol-Level Precoding Efficiency Through Tensor Equivariant Neural Network [84.22115118596741]
シンボルレベルのプリコーディングにおいて,推論の複雑さの低いエンドツーエンドディープラーニング(DL)フレームワークを提案する。
提案手法は,従来の手法よりも約80倍の高速化を実現しつつ,SLPの大幅な性能向上を達成できることを示す。
論文 参考訳(メタデータ) (2025-10-02T15:15:50Z) - Efficient Solution and Learning of Robust Factored MDPs [57.2416302384766]
未知の環境との相互作用からr-MDPを学習することで、性能保証による堅牢なポリシーの合成が可能になる。
本稿では,因子状態表現に基づくr-MDPの解法と学習法を提案する。
論文 参考訳(メタデータ) (2025-08-01T15:23:15Z) - Formal Controller Synthesis for Markov Jump Linear Systems with
Uncertain Dynamics [64.72260320446158]
マルコフジャンプ線形系に対する制御器の合成法を提案する。
本手法は,MJLSの離散(モードジャンピング)と連続(確率線形)の両方の挙動を捉える有限状態抽象化に基づいている。
本手法を複数の現実的なベンチマーク問題,特に温度制御と航空機の配送問題に適用する。
論文 参考訳(メタデータ) (2022-12-01T17:36:30Z) - Sample Complexity of Robust Reinforcement Learning with a Generative
Model [0.0]
本稿では,モデルに基づく強化学習(RL)アルゴリズムを提案する。
我々は,全変動距離,カイ二乗発散,KL発散の3種類の不確実性集合を考察した。
この結果に加えて,ロバストポリシの利点に関する公式な分析的議論も提示する。
論文 参考訳(メタデータ) (2021-12-02T18:55:51Z) - Adaptive Sampling for Best Policy Identification in Markov Decision
Processes [79.4957965474334]
本稿では,学習者が生成モデルにアクセスできる場合の,割引マルコフ決定(MDP)における最良の政治的識別の問題について検討する。
最先端アルゴリズムの利点を論じ、解説する。
論文 参考訳(メタデータ) (2020-09-28T15:22:24Z) - Learning with Safety Constraints: Sample Complexity of Reinforcement
Learning for Constrained MDPs [13.922754427601491]
我々は,安全性の制約と,所望の精度を確保するために必要なサンプル数との関係を特徴付ける。
我々の主な発見は、制約のない状態の最もよく知られた境界と比較して、制約されたRLアルゴリズムのサンプルは制約の数に対数的な因子によって増加することである。
論文 参考訳(メタデータ) (2020-08-01T18:17:08Z) - Control as Hybrid Inference [62.997667081978825]
本稿では、反復推論と償却推論のバランスを自然に仲介するCHIの実装について述べる。
連続的な制御ベンチマークでアルゴリズムのスケーラビリティを検証し、強力なモデルフリーおよびモデルベースラインを上回る性能を示す。
論文 参考訳(メタデータ) (2020-07-11T19:44:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。