論文の概要: Property-driven Causal Abstractions for Markov Decision Processes
- arxiv url: http://arxiv.org/abs/2607.26787v1
- Date: Wed, 29 Jul 2026 11:28:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.652109
- Title: Property-driven Causal Abstractions for Markov Decision Processes
- Title(参考訳): マルコフ決定過程における特性駆動因果解法
- Authors: Jule Schmidt, Maximilian Weininger, Clemens Dubslaff, David Parker, Nils Jansen,
- Abstract要約: 決定過程 (MDPs) は意思決定モデルとして広く用いられ、一般に分解状態空間上で特定される。
抽象化は、MDPを削減し、拡張性の問題を軽減するための有望なテクニックである。
本稿では, 因果的因果的因果的概念と, 特性駆動因果的抽象化技術を紹介する。
- 参考スコア(独自算出の注目度): 15.195623277178095
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Markov Decision Processes (MDPs) are widely used as decision-making models, commonly specified over factored state spaces through state variables and their valuations. The exponential blowup in the number of states renders many reasoning tasks in MDPs challenging. Abstractions are promising techniques to reduce MDPs and thus mitigate scalability issues. In this work, we introduce a notion of causality on factored MDPs and a novel property-driven causal abstraction technique that retains many characteristics of the original MDP model. For this, we rely on causal relations over state variable predicates and identify those states that share the same reasons for fulfilling or violating a given abstraction property. We theoretically and empirically compare various causal MDP abstractions using different model types such as MDPs, interval MDPs, or stochastic games. Our evaluation demonstrates the potential of our approach: For several standard benchmarks, we obtain small abstractions that allow us to compute near-optimal policies for the original MDP. Furthermore, our causal abstractions often generalize to related large-scale MDP models.
- Abstract(参考訳): マルコフ決定過程 (MDPs) は意思決定モデルとして広く用いられ、状態変数とその評価を通じて決定された状態空間上で一般的に特定される。
州数の指数的な爆発は、MDPにおける多くの推論タスクを困難にしている。
抽象化は、MDPを削減し、拡張性の問題を軽減するための有望なテクニックである。
本稿では, 因果的因果的因果的因果的因果的因果的因果的因果的概念と, 元のMDPモデルの特徴を多く保持する, 特性駆動因果的抽象手法を紹介する。
このために、状態変数の述語に対する因果関係に頼り、与えられた抽象プロパティを満たすか違反するのと同じ理由を共有している状態を特定します。
理論的および実験的に、MDP、インターバルMDP、確率ゲームなどの異なるモデルタイプを用いて、様々な因果的MDP抽象化を比較した。
いくつかの標準ベンチマークでは、元のMDPのほぼ最適ポリシーを計算できる小さな抽象化が得られます。
さらに、我々の因果抽象化は、しばしば関連する大規模MDPモデルに一般化される。
関連論文リスト
- Model-Based Learning of Near-Optimal Finite-Window Policies in POMDPs [8.784438985280092]
部分的に観測可能なマルコフ決定過程(POMDP)における有限ウィンドウポリシーのモデルに基づく学習について検討する。
部分的可観測性の下での学習の一般的なアプローチは、有限の行動観測窓を用いて履歴依存を近似することである。
この超状態 MDP のモデルが利用可能になると、標準的な MDP アルゴリズムを使って最適なポリシーを計算できる。
論文 参考訳(メタデータ) (2026-04-01T15:32:47Z) - Realizable Abstractions: Near-Optimal Hierarchical Reinforcement Learning [4.024538378639506]
本稿では,ジェネリック低レベルMDPとそれに関連する高レベル意思決定プロセスとの新たな関係であるRealizable Abstractionsを定義した。
我々は,任意の抽象的ポリシーを,選択肢の適切な構成を通じて,低レベルMDPの準最適ポリシーに翻訳可能であることを示す。
本稿では,合成および準最適低レベルポリシを返す新しいHRLアルゴリズムであるRARLを提案する。
論文 参考訳(メタデータ) (2025-12-04T16:26:56Z) - Robust Counterfactual Inference in Markov Decision Processes [3.047215509762019]
現在のアプローチでは、カウンターファクトを識別するために特定の因果モデルを想定している。
反実遷移確率の厳密な境界を計算できる新しい非パラメトリック手法を提案する。
論文 参考訳(メタデータ) (2025-02-19T13:56:20Z) - Sample Complexity Characterization for Linear Contextual MDPs [67.79455646673762]
文脈決定プロセス(CMDP)は、遷移カーネルと報酬関数がコンテキスト変数によってインデックス付けされた異なるMDPで時間とともに変化できる強化学習のクラスを記述する。
CMDPは、時間とともに変化する環境で多くの現実世界のアプリケーションをモデル化するための重要なフレームワークとして機能する。
CMDPを2つの線形関数近似モデルで検討する: 文脈変化表現とすべての文脈に対する共通線形重み付きモデルIと、すべての文脈に対する共通表現と文脈変化線形重み付きモデルIIである。
論文 参考訳(メタデータ) (2024-02-05T03:25:04Z) - Causal Dynamics Learning for Task-Independent State Abstraction [61.707048209272884]
タスク独立状態抽象化(CDL)のための因果ダイナミクス学習を導入する。
CDLは、状態変数とアクションの間の不要な依存関係を取り除く理論的に証明された因果ダイナミクスモデルを学ぶ。
状態抽象化は、学習されたダイナミクスから導き出すことができる。
論文 参考訳(メタデータ) (2022-06-27T17:02:53Z) - Model-Invariant State Abstractions for Model-Based Reinforcement
Learning [54.616645151708994]
textitmodel-invarianceという新しいタイプの状態抽象化を紹介します。
これにより、状態変数の見当たらない値の新しい組み合わせへの一般化が可能になる。
このモデル不変状態抽象化を通じて最適なポリシーを学習できることを実証する。
論文 参考訳(メタデータ) (2021-02-19T10:37:54Z) - Learning Robust State Abstractions for Hidden-Parameter Block MDPs [55.31018404591743]
我々は、ブロックMDPにインスパイアされた堅牢な状態抽象化を実現するために、HiP-MDP設定からの共通構造の概念を活用する。
マルチタスク強化学習 (MTRL) とメタ強化学習 (Meta-RL) の両方のための新しいフレームワークのインスタンス化を導出する。
論文 参考訳(メタデータ) (2020-07-14T17:25:27Z) - Invariant Causal Prediction for Block MDPs [106.63346115341862]
環境全体にわたる一般化は、実世界の課題への強化学習アルゴリズムの適用の成功に不可欠である。
本稿では,多環境環境における新しい観測を一般化するモデル不適合状態抽象化(MISA)を学習するための不変予測法を提案する。
論文 参考訳(メタデータ) (2020-03-12T21:03:01Z) - Plannable Approximations to MDP Homomorphisms: Equivariance under
Actions [72.30921397899684]
学習した表現に作用同値を強制する対照的な損失関数を導入する。
損失が 0 であるとき、決定論的マルコフ決定過程の準同型が存在することを証明している。
本研究では, 決定論的MDPに対して, 抽象MDPの最適方針を元のMDPに引き上げることに成功した。
論文 参考訳(メタデータ) (2020-02-27T08:29:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。