Fugu-MT 論文翻訳(概要): Learning not to Regret

論文の概要: Learning not to Regret

arxiv url: http://arxiv.org/abs/2303.01074v2
Date: Mon, 19 Feb 2024 21:55:51 GMT
ステータス: 翻訳完了
システム内更新日: 2024-02-21 21:42:36.192718
Title: Learning not to Regret
Title（参考訳）: Regretを使わないことを学ぶ
Authors: David Sychrovsk\'y, Michal \v{S}ustr, Elnaz Davoodi, Michael Bowling, Marc Lanctot, Martin Schmid
Abstract要約: 特定の分布に合わせて最小限の後悔をメタ学習できる新しい「後悔しない学習」フレームワークを提案する。我々の重要な貢献であるNeural Predictive Regret Matchingは、選択されたゲームの分布に対して急速に収束するようにメタ学習されています。実験の結果,メタ学習アルゴリズムは非メタ学習アルゴリズムよりも優れ,10倍以上の改善が得られた。
参考スコア（独自算出の注目度）: 19.945846614714167
License: http://creativecommons.org/licenses/by/4.0/
Abstract: The literature on game-theoretic equilibrium finding predominantly focuses on single games or their repeated play. Nevertheless, numerous real-world scenarios feature playing a game sampled from a distribution of similar, but not identical games, such as playing poker with different public cards or trading correlated assets on the stock market. As these similar games feature similar equilibra, we investigate a way to accelerate equilibrium finding on such a distribution. We present a novel "learning not to regret" framework, enabling us to meta-learn a regret minimizer tailored to a specific distribution. Our key contribution, Neural Predictive Regret Matching, is uniquely meta-learned to converge rapidly for the chosen distribution of games, while having regret minimization guarantees on any game. We validated our algorithms' faster convergence on a distribution of river poker games. Our experiments show that the meta-learned algorithms outpace their non-meta-learned counterparts, achieving more than tenfold improvements.
Abstract（参考訳）: ゲーム理論平衡に関する文献は、主にシングルゲームや繰り返しプレイに焦点を当てている。それにもかかわらず、多くの現実世界のシナリオでは、異なる公開カードでポーカーをプレイしたり、株式市場で関連資産を取引したり、類似しているが同一ではないゲームの分布からサンプリングされたゲームをプレイする。これらの類似のゲームは類似の平衡を特徴とするので、そのような分布上の平衡探索を加速する方法を考察する。我々は,特定の分布に合わせた後悔の最小化をメタ学習する,新しい「後悔しない学習」フレームワークを提案する。我々の重要な貢献であるNeural Predictive Regret Matchingは、選択されたゲームの配信に対して迅速に収束するようにメタ学習されています。河川ポーカーゲームの分布に対するアルゴリズムの高速収束性を検証した。実験では,メタ学習アルゴリズムが非メタ学習アルゴリズムを上回り,10倍以上の改善が得られた。

関連論文リスト

Meta-Learning in Self-Play Regret Minimization [10.843705580746397]
両プレイヤーゼロサムゲームにおけるナッシュ均衡を近似する多くのアルゴリズムにおいて,オンライン最適化に対する一般的なアプローチを提案する。これに基づいてフレームワークを、最先端の平衡近似アルゴリズムの基盤である、より困難なセルフプレイ設定に拡張する。私たちのメタ学習アルゴリズムは、他の最先端の後悔の最小化アルゴリズムよりもかなり優れています。
論文参考訳（メタデータ） (2025-04-26T13:27:24Z)
Swap Regret and Correlated Equilibria Beyond Normal-Form Games [62.01542145970044]
「我々は、プロファイルスワップ後悔と呼ぶポリトープゲームのスワップ後悔の新しい変種を提示する。」プロファイルスワップ後悔は、プレイの書き起こしが与えられた場合、NPハードであることが示されるが、少なくとも$O(sqrtT)$プロファイルスワップ後悔を保証する効率的な学習アルゴリズムを設計することは可能である。
論文参考訳（メタデータ） (2025-02-27T16:16:26Z)
Securing Equal Share: A Principled Approach for Learning Multiplayer Symmetric Games [21.168085154982712]
マルチプレイヤーゲームにおける平衡は、一意でも爆発的でもない。本稿では,平等な共有という自然な目的に焦点をあてることで,これらの課題に対処するための最初の一歩を踏み出す。我々は、様々な設定でほぼ同じシェアを確実に得る、非回帰学習にインスパイアされた、一連の効率的なアルゴリズムを設計する。
論文参考訳（メタデータ） (2024-06-06T15:59:17Z)
No Algorithmic Collusion in Two-Player Blindfolded Game with Thompson Sampling [10.376707874029561]
プレイヤーがトンプソンサンプリングを使用すると、ゲームダイナミクスはペイオフ行列の軽度な仮定の下でナッシュ平衡に収束することを示す。アルゴリズムによる共謀は発生しないプレイヤーが意図的に競争戦略を展開していないにもかかわらず
論文参考訳（メタデータ） (2024-05-23T08:21:48Z)
Is Learning in Games Good for the Learners? [14.781100349601587]
2人のエージェント間の繰り返しのゲームプレイにおいて、報酬と後悔の間のトレードオフを考慮する。このような平衡は、任意の相手に対する後悔の保証を維持するアルゴリズムのペアによって到達可能であることを示す。また,ゲーム開始時において,未学習エージェントとの繰り返しプレイを通じて報酬-最適戦略を学習する問題についても検討する。
論文参考訳（メタデータ） (2023-05-31T02:10:27Z)
Hardness of Independent Learning and Sparse Equilibrium Computation in Markov Games [70.19141208203227]
マルコフゲームにおける分散型マルチエージェント強化学習の問題点を考察する。我々は,全てのプレイヤーが独立に実行すると,一般のサムゲームにおいて,アルゴリズムが到達しないことを示す。我々は,全てのエージェントが集中型アルゴリズムによって制御されるような,一見簡単な設定であっても,下位境界が保持されていることを示す。
論文参考訳（メタデータ） (2023-03-22T03:28:12Z)
On the Convergence of No-Regret Learning Dynamics in Time-Varying Games [89.96815099996132]
時間変化ゲームにおける楽観的勾配降下(OGD)の収束を特徴付ける。我々のフレームワークは、ゼロサムゲームにおけるOGDの平衡ギャップに対して鋭い収束境界をもたらす。また,静的ゲームにおける動的後悔の保証に関する新たな洞察も提供する。
論文参考訳（メタデータ） (2023-01-26T17:25:45Z)
Finding mixed-strategy equilibria of continuous-action games without gradients using randomized policy networks [83.28949556413717]
グラデーションへのアクセスを伴わない連続アクションゲームのナッシュ平衡を近似的に計算する問題について検討する。ニューラルネットワークを用いてプレイヤーの戦略をモデル化する。本論文は、制約のない混合戦略と勾配情報のない一般的な連続アクションゲームを解決する最初の方法である。
論文参考訳（メタデータ） (2022-11-29T05:16:41Z)
Learning in Multi-Player Stochastic Games [1.0878040851638]
有限ホライズン設定において、多くのプレイヤーとゲームにおける同時学習の問題を考える。ゲームの典型的な対象解はナッシュ均衡であるが、これは多くのプレイヤーにとって難解である。我々は異なるターゲットに目を向ける:全てのプレイヤーが使用するときの平衡を生成するアルゴリズム。
論文参考訳（メタデータ） (2022-10-25T19:02:03Z)
Learning Correlated Equilibria in Mean-Field Games [62.14589406821103]
我々は平均場相関と粗相関平衡の概念を発展させる。ゲームの構造に関する仮定を必要とせず,効率よくゲーム内で学習できることが示される。
論文参考訳（メタデータ） (2022-08-22T08:31:46Z)
Regret Minimization and Convergence to Equilibria in General-sum Markov Games [57.568118148036376]
汎用マルコフゲームにおいて,全てのエージェントが実行した場合のサブ線形後悔保証を提供する学習アルゴリズムを初めて提示する。我々のアルゴリズムは分散化され、計算効率が良く、エージェント間の通信は不要である。
論文参考訳（メタデータ） (2022-07-28T16:27:59Z)
No-Regret Learning in Time-Varying Zero-Sum Games [99.86860277006318]
固定ゼロサムゲームにおける繰り返しプレイからの学習は、ゲーム理論とオンライン学習における古典的な問題である。提案手法は,3つの性能基準の下で,良好な保証を同時に享受できる1つのパラメータフリーアルゴリズムである。本アルゴリズムは,ある特性を満たすブラックボックスベースラーナー群に対するメタアルゴリズムを用いた2層構造に基づく。
論文参考訳（メタデータ） (2022-01-30T06:10:04Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。