論文の概要: NashDreamer: Model-Based Reinforcement Learning for Zero-Sum Imperfect-Information Games
- arxiv url: http://arxiv.org/abs/2609.01549v1
- Date: Tue, 01 Sep 2026 17:15:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.888907
- Title: NashDreamer: Model-Based Reinforcement Learning for Zero-Sum Imperfect-Information Games
- Title(参考訳): NashDreamer: ゼロサム不完全な情報ゲームのためのモデルベース強化学習
- Authors: Tomáš Holeček, Viliam Lisý,
- Abstract要約: 不完全な情報ゲーム(IIG)のためのモデルベース強化学習フレームワークを提案する。
NashDreamerは任意のポリシー勾配アルゴリズムを使用するように設計され、理想化されたモデルの下でNash平衡に対する収束保証を継承する。
実験により、NashDreamerはモデルフリーベースラインよりもサンプル効率を大幅に向上することが示された。
- 参考スコア(独自算出の注目度): 3.4935179780034242
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model-based reinforcement learning (MBRL) has achieved remarkable results in single-agent domains, yet its extension to competitive imperfect information games (IIGs) remains underexplored. In multi-agent settings, opponent-induced non-stationarity complicates the learning process, and decentralized model learning faces severe identifiability barriers, which we argue make centralized model learning a mathematical necessity. Building on this analysis, we propose NashDreamer, a principled MBRL framework for two-player zero-sum IIGs. It introduces a centralized Multi-Agent Recurrent State-Space Model (MARSSM) that decouples environment dynamics from the effect of players' strategies on their individual observations. NashDreamer is designed to use arbitrary policy gradient algorithms and inherits their convergence guarantees towards Nash equilibria under an idealized model. Empirical evaluations across four benchmark games demonstrate that NashDreamer substantially improves sample efficiency over model-free baselines early in the training. Finally, we theoretically analyze the architecture's optimization landscape, identifying the vulnerability of the Dreamer family of algorithms to posterior collapse in stochastic environments. We leave it as an open challenge.
- Abstract(参考訳): モデルベース強化学習(MBRL)は単エージェントドメインにおいて顕著な成果を上げているが、競争不完全情報ゲーム(IIG)への拡張は未定である。
マルチエージェント環境では、非定常性は学習過程を複雑にし、分散モデル学習は深刻な識別可能性障壁に直面し、集中モデル学習を数学的必要とみなす。
この分析に基づいて、2つのプレイヤーゼロサムIIGのための原則的MBRLフレームワークであるNashDreamerを提案する。
マルチエージェント・リカレント・ステート・スペース・モデル(MARSSM)を導入し、プレイヤーの戦略が個々の観察に与える影響から環境力学を分離する。
NashDreamerは任意のポリシー勾配アルゴリズムを使用するように設計され、理想化されたモデルの下でNash平衡に対する収束保証を継承する。
4つのベンチマークゲームに対する実験的な評価により、NashDreamerはトレーニングの初期段階でモデルフリーのベースラインよりもサンプル効率を大幅に向上することが示された。
最後に,アーキテクチャの最適化環境を理論的に解析し,確率的環境下での後方崩壊に対するドリーマー系アルゴリズムの脆弱性を同定する。
私たちはそれをオープンチャレンジとして残します。
関連論文リスト
- Double Oracle Neural Architecture Search for Game Theoretic Deep Learning Models [28.238075755838487]
本稿では,ゲーム理論の概念を用いたディープラーニングモデルの学習手法を提案する。
最良応答オラクルを用いた二重対角フレームワークをデプロイする。
主観的質的評価と定量的指標の両面で,我々の変種は有意な改善が見られた。
論文 参考訳(メタデータ) (2024-10-07T05:42:01Z) - Preference-Based Multi-Agent Reinforcement Learning: Data Coverage and Algorithmic Techniques [65.55451717632317]
PbMARL(Preference-based Multi-Agent Reinforcement Learning)について検討する。
一般ゲームにおける嗜好のみのオフラインデータセットからナッシュ平衡を同定する。
以上の結果から,PbMARLの多面的アプローチが示唆された。
論文 参考訳(メタデータ) (2024-09-01T13:14:41Z) - Model-Based RL for Mean-Field Games is not Statistically Harder than Single-Agent RL [57.745700271150454]
モデルに基づく関数近似を用いた平均フィールドゲーム(MFG)における強化学習のサンプル複雑性について検討した。
本稿では、モデルクラスの複雑性を特徴付けるためのより効果的な概念である部分モデルベースエルダー次元(P-MBED)を紹介する。
論文 参考訳(メタデータ) (2024-02-08T14:54:47Z) - Deep autoregressive density nets vs neural ensembles for model-based
offline reinforcement learning [2.9158689853305693]
本稿では、利用可能なデータからシステムダイナミクスを推定し、仮想モデルロールアウトにおけるポリシー最適化を行うモデルベース強化学習アルゴリズムについて考察する。
このアプローチは、実際のシステムで破滅的な失敗を引き起こす可能性のあるモデルエラーを悪用することに対して脆弱である。
D4RLベンチマークの1つのよく校正された自己回帰モデルにより、より良い性能が得られることを示す。
論文 参考訳(メタデータ) (2024-02-05T10:18:15Z) - HarmonyDream: Task Harmonization Inside World Models [93.07314830304193]
モデルベース強化学習(MBRL)は、サンプル効率の学習を約束する。
本稿では,タスク調和性を維持するために損失係数を自動的に調整する,シンプルで効果的なアプローチであるHarmonyDreamを提案する。
論文 参考訳(メタデータ) (2023-09-30T11:38:13Z) - Efficient Model-based Multi-agent Reinforcement Learning via Optimistic
Equilibrium Computation [93.52573037053449]
H-MARL (Hallucinated Multi-Agent Reinforcement Learning) は,環境と数回交流した後の平衡政策を学習する。
自律運転シミュレーションベンチマークにおいて,本手法を実験的に実証した。
論文 参考訳(メタデータ) (2022-03-14T17:24:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。