論文の概要: Global Policy-Space Response Oracles for Two-Player Zero-Sum Games
- arxiv url: http://arxiv.org/abs/2605.28273v1
- Date: Wed, 27 May 2026 10:18:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.967793
- Title: Global Policy-Space Response Oracles for Two-Player Zero-Sum Games
- Title(参考訳): ツープレイヤーゼロサムゲームのための世界政策空間対応オラクル
- Authors: Junyu Zhang, Feihong Yang, Jian Wang, Chao Wang, Xudong Zhang,
- Abstract要約: ポリシー空間応答 オラクルは、大きなゼロサムゲームに平衡計算をスケールする。
人口爆発性は、制限された戦略セットがゲーム全体をどれだけうまく表現するかを測定する。
グローバルPSROは、以前のPSRO法よりも政策イテレーションが大幅に少ないナッシュ平衡を近似する。
- 参考スコア(独自算出の注目度): 18.686097245170533
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The Policy-Space Response Oracles (PSRO) framework scales equilibrium computation to large zero-sum games by iteratively expanding a restricted strategy set using deep reinforcement learning (DRL). A central challenge is to construct, under limited computational budgets, a small strategy population whose induced game well approximates the full game. Existing PSRO variants typically expand the population using best responses to meta-strategies computed from restricted-game payoffs, which can lead to inefficient expansions that provide limited global improvement. We propose to guide population expansion by directly evaluating the post-expansion population quality. Specifically, we adopt Population Exploitability (PE) to measure how well a restricted strategy set represents the full game, and introduce a two-phase exploration--selection framework that explicitly minimizes PE during expansion. We instantiate this framework as Global PSRO, a practical DRL-based algorithm that efficiently generates candidate responses and estimates PE via parameter-sharing conditional neural networks. Experiments across multiple two-player zero-sum games show that Global PSRO achieves lower exploitability and approximates Nash equilibria with significantly fewer policy iterations than prior PSRO methods.
- Abstract(参考訳): 政策空間対応オラクル(PSRO)フレームワークは、深い強化学習(DRL)を使用して制限された戦略を反復的に拡張することにより、平衡計算を大規模なゼロサムゲームにスケールする。
中心的な課題は、限られた計算予算の下で、誘導ゲームがゲーム全体をよく近似する小さな戦略人口を構築することである。
既存のPSROの変種は、制限されたゲームペイオフから計算されたメタストラテジーに対する最良の応答を使用して人口を拡大する。
我々は,戦後の人口の質を直接評価することで,人口拡大を導くことを提案する。
具体的には,Population Exploitability (PE) を用いて,制限された戦略セットがゲーム全体を表現するかを測定するとともに,拡張時にPEを明示的に最小化する2段階探索-選択フレームワークを導入する。
我々はこのフレームワークを,DRLに基づく実用的なアルゴリズムであるGlobal PSROとしてインスタンス化し,パラメータ共有条件付きニューラルネットワークを用いてPEを推定する。
複数の2プレイヤーゼロサムゲームに対する実験により、Global PSROはより低いエクスプロイラビリティを実現し、従来のPSRO法よりもはるかに少ないポリシー反復でナッシュ均衡を近似することが示された。
関連論文リスト
- Policy Abstraction and Nash Refinement in Tree-Exploiting PSRO [10.137357924571262]
Policy Space Response Oracles (PSRO) は、従来の分析手法では複雑すぎるゲームを解決するために、実験的なゲーム理論解析を深層強化学習 (DRL) とインターリーブする。
ツリー露光PSRO (TE-PSRO) は、広義に粗い経験ゲームモデルを反復的に構築するこのアプローチの変種である。
TE-PSROには2つの方法論的進歩があり、不完全情報の複雑なゲームへの適用性を高めている。
論文 参考訳(メタデータ) (2025-02-05T05:48:16Z) - Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning [55.65738319966385]
我々は、新しいオンラインアルゴリズム、反復的ナッシュポリシー最適化(INPO)を提案する。
従来の方法とは異なり、INPOは個々の応答に対する期待される勝利率を推定する必要性を回避している。
LLaMA-3-8BベースのSFTモデルで、INPOはAlpacaEval 2.0で42.6%、Arena-Hardで37.8%の勝利率を達成した。
論文 参考訳(メタデータ) (2024-06-30T08:00:34Z) - Neural Population Learning beyond Symmetric Zero-sum Games [52.20454809055356]
我々はNuPL-JPSROという,スキルの伝達学習の恩恵を受けるニューラル集団学習アルゴリズムを導入し,ゲームの粗相関(CCE)に収束する。
本研究は, 均衡収束型集団学習を大規模かつ汎用的に実施可能であることを示す。
論文 参考訳(メタデータ) (2024-01-10T12:56:24Z) - Population-size-Aware Policy Optimization for Mean-Field Games [34.80183622480149]
エージェントの最適なポリシーは,平均フィールドゲームにおけるエージェント数(人口規模)とともにどのように進化するかを検討する。
本稿では,2つの自然な選択肢(拡張とハイパーネットワーク)を統一し,性能を大幅に向上させる,人口規模対応政策最適化(PAPO)を提案する。
PAPOは3つの要素から構成される:i) 集団サイズの本来の値を等価な符号化に変換する集団サイズ符号化、i) トレーニング崩壊を避けるためのハイパーネットワーク、i) 集団サイズで条件付けられた各ゲームに対して異なるポリシーを生成するためのハイパーネットワーク、iii) 生成されたポリシーへの追加入力として人口サイズを生成する。
論文 参考訳(メタデータ) (2023-02-07T10:16:00Z) - ApproxED: Approximate exploitability descent via learned best responses [61.17702187957206]
連続的なアクションセットを持つゲームの近似的ナッシュ均衡を求める問題について検討する。
本稿では,戦略プロファイルに対するエクスプロイラビリティの近似を最小化する2つの新しい手法を提案する。
論文 参考訳(メタデータ) (2023-01-20T23:55:30Z) - Self-Play PSRO: Toward Optimal Populations in Two-Player Zero-Sum Games [69.5064797859053]
本稿では,各イテレーションの個体群に対して,ほぼ最適なポリシーを付加する手法であるemphSelf-Play PSRO(SP-PSRO)を紹介する。
SP-PSRO は経験的に APSRO よりもはるかに早く収束する傾向があり、多くのゲームではほんの数イテレーションで収束する。
論文 参考訳(メタデータ) (2022-07-13T22:55:51Z) - Efficient Policy Space Response Oracles [61.71849698253696]
ポリシー空間応答 Oracle 法 (PSRO) は、2プレイヤーゼロサムゲームにおけるナッシュ均衡の一般解を提供する。
我々の開発の中心は、制限なし(URR)ゲームにおけるミニマックス最適化の導入である。
壁面時間, 10倍のデータ効率, および既存のPSRO法と同様のエクスプロイザビリティを, Kuhn と Leduc Poker のゲームで50倍高速化したことを報告した。
論文 参考訳(メタデータ) (2022-01-28T17:54:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。