論文の概要: The Curious Case of Exploding DecPOMDPs: Containing the Fire through Policy Counting
- arxiv url: http://arxiv.org/abs/2608.17749v2
- Date: Wed, 19 Aug 2026 10:55:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 13:35:39.315929
- Title: The Curious Case of Exploding DecPOMDPs: Containing the Fire through Policy Counting
- Title(参考訳): 爆発するデポMDPの奇妙な事例--政策計数による火災の抑制
- Abstract要約: DecPOMDPは不確実性の下でのマルチエージェント意思決定をモデル化するためのフレームワークを提供する。
DecPOMDPは、エージェント数の指数関数的な複雑さに悩まされていることが知られている。
ポリシーカウントされたDecPOMDPを効率的に解くために,コンパクト表現を用いたポリシーカウント動的プログラミングを提案する。
- 参考スコア(独自算出の注目度): 2.3541805386826797
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Decentralised partially observable Markov decision processes (DecPOMDPs) provide a general framework for modelling multi-agent decision making under uncertainty. However, DecPOMDPs are known to suffer from exponential complexity in the number of agents. One way to combat this intractability in agent numbers is to look at partitions of agents that exhibit a form of symmetry among agents, allowing for a compact encoding by counting. However, a challenge arises as the policy space explodes, even though the model complexity and evaluation cost reduce to a polynomial dependence. In this paper, we redirect our focus from counting agents to counting policies, which actually enables tractability in agent numbers for so called policy-counted DecPOMDPs. Further, we present policy-counted dynamic programming using the compact representation to solve policy-counted DecPOMDPs efficiently.
- Abstract(参考訳): 分散された部分観測可能なマルコフ決定プロセス(DecPOMDPs)は、不確実性の下でのマルチエージェント意思決定をモデル化するための一般的なフレームワークを提供する。
しかし、DecPOMDPはエージェント数の指数関数的な複雑さに悩まされていることが知られている。
エージェント番号におけるこの難易度に対処する方法の1つは、エージェント間の対称性の形式を示すエージェントの分割を調べ、カウントすることでコンパクトな符号化を可能にすることである。
しかし、モデル複雑性と評価コストが多項式依存に還元されたとしても、政策空間が爆発するにつれて問題が発生する。
本稿では、エージェントのカウントからカウントポリシーへのフォーカスをリダイレクトし、エージェント番号のトラクタビリティを実際に実現した。
さらに、ポリシーカウントされたDecPOMDPを効率的に解くために、コンパクト表現を用いたポリシーカウント動的プログラミングを提案する。
関連論文リスト
- Enhancing Decision-Making with Large Language Models through Multi-Agent Fictitious Play [53.56274149236814]
Multi-Agent Fictitious Play (MAFP)は、ステークホルダーのスタンスをエージェントとして表現する新しいMASパラダイムである。
MAFPは各エージェントの判断を、他のエージェントの過去の決定の実証的な混合に応じて反復的に更新する。
我々は、行動前に競合シナリオの戦略を決定する能力をテストする挑戦的な意思決定タスクにおいて、MAFPを評価する。
論文 参考訳(メタデータ) (2026-06-17T17:31:06Z) - Finite-State Controllers for (Hidden-Model) POMDPs using Deep Reinforcement Learning [12.28676420967728]
マルコフ決定プロセス(POMDP)の解決には、不完全な状態情報の下での計算ポリシーが必要である。
我々は,脳神経政策の訓練に深層強化学習を用いたPOMDP問題解決のためのLexpopフレームワークを提案する。
我々はLexpopを拡張して、有限個のPOMDPを記述した隠れモデルPOMDP(HM-POMDP)のロバストなポリシーを計算する。
実験の結果,LexpopはPMDPやHM-POMDPの最先端の解法よりも優れていた。
論文 参考訳(メタデータ) (2026-02-09T14:39:16Z) - Principal-Agent Reward Shaping in MDPs [50.914110302917756]
主要な問題とは、ある政党が他の政党に代わって行動し、利害対立を引き起こすことである。
本研究では,主役とエージェントが異なる報酬関数を持つ2人プレイのスタックゲームについて検討し,エージェントは両プレイヤーに対してMDPポリシーを選択する。
この結果は,有限の地平線を持つ木と決定論的決定過程を確立した。
論文 参考訳(メタデータ) (2023-12-30T18:30:44Z) - Approximate Linear Programming for Decentralized Policy Iteration in Cooperative Multi-agent Markov Decision Processes [5.842054972839244]
我々は,mエージェントを含む協調的マルチエージェントマルコフ決定過程について考察する。
マルチエージェント設定のポリシーイテレーションプロセスでは、アクションの数はエージェントの数とともに指数関数的に増加する。
本稿では,関数近似を用いた近似線形計画法を用いて,近似分散型ポリシー反復アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-11-20T14:14:13Z) - On the Complexity of Multi-Agent Decision Making: From Learning in Games
to Partial Monitoring [105.13668993076801]
マルチエージェント強化学習(MARL)理論における中心的な問題は、構造条件やアルゴリズムの原理がサンプル効率の学習保証につながるかを理解することである。
本稿では,複数のエージェントを用いた対話型意思決定のための一般的な枠組みとして,この問題について考察する。
マルチエージェント意思決定における統計的複雑性を特徴付けることは、単一エージェント決定の統計的複雑性を特徴付けることと等価であることを示す。
論文 参考訳(メタデータ) (2023-05-01T06:46:22Z) - Efficient Policy Iteration for Robust Markov Decision Processes via
Regularization [49.05403412954533]
ロバストな意思決定プロセス(MDP)は、システムのダイナミクスが変化している、あるいは部分的にしか知られていない決定問題をモデル化するためのフレームワークを提供する。
最近の研究は、長方形長方形の$L_p$頑健なMDPと正規化されたMDPの等価性を確立し、標準MDPと同じレベルの効率を享受する規則化されたポリシー反復スキームを導出した。
本研究では、政策改善のステップに焦点をあて、欲求政策と最適なロバストなベルマン作用素のための具体的な形式を導出する。
論文 参考訳(メタデータ) (2022-05-28T04:05:20Z) - Permutation Invariant Policy Optimization for Mean-Field Multi-Agent
Reinforcement Learning: A Principled Approach [128.62787284435007]
本稿では,平均場近似ポリシ最適化(MF-PPO)アルゴリズムを提案する。
我々は,MF-PPOが収束のサブ線形速度で世界的最適政策を達成することを証明した。
特に、置換不変ニューラルアーキテクチャによって引き起こされる誘導バイアスは、MF-PPOが既存の競合より優れていることを示す。
論文 参考訳(メタデータ) (2021-05-18T04:35:41Z) - Dealing with Non-Stationarity in Multi-Agent Reinforcement Learning via
Trust Region Decomposition [52.06086375833474]
非定常性は多エージェント強化学習における厄介な問題である。
ポリシーシーケンスの定常性を明示的にモデル化するための$delta$-stationarity測定を導入する。
共同政策の分岐を推定するために,メッセージパッシングに基づく信頼領域分解ネットワークを提案する。
論文 参考訳(メタデータ) (2021-02-21T14:46:50Z) - Verifiable Planning in Expected Reward Multichain MDPs [20.456052208569115]
エージェントの意思決定方針を導出する定常計画問題について検討する。
提案プログラムに対する最適解が、厳密な行動保証を伴う定常的な政策をもたらすことを証明した。
論文 参考訳(メタデータ) (2020-12-03T18:54:24Z) - Strengthening Deterministic Policies for POMDPs [5.092711491848192]
我々は、時間論理制約の形で洗練された仕様をサポートする新しいMILP符号化を提供する。
我々は、メモリベースの決定を包含するために、POMDPの事前処理を採用する。
提案手法の利点は, 計算的トラクタビリティを損なうことなく, 簡単な決定論的政策を強化する柔軟性と, 任意に多くの仕様の証明可能な満足度を強制する能力である。
論文 参考訳(メタデータ) (2020-07-16T14:22:55Z) - Implicit Distributional Reinforcement Learning [61.166030238490634]
2つのディープジェネレータネットワーク(DGN)上に構築された暗黙の分布型アクター批判(IDAC)
半単純アクター (SIA) は、フレキシブルなポリシー分布を利用する。
我々は,代表的OpenAI Gym環境において,IDACが最先端のアルゴリズムより優れていることを観察する。
論文 参考訳(メタデータ) (2020-07-13T02:52:18Z) - Multiagent Value Iteration Algorithms in Dynamic Programming and
Reinforcement Learning [0.0]
各段階における制御がいくつかの異なる決定から構成される無限水平動的プログラミング問題を考える。
以前の研究では、ポリシーの反復アルゴリズムを導入しました。
論文 参考訳(メタデータ) (2020-05-04T16:34:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。