論文の概要: Equilibrium Residuals Expose Three Regimes of Matrix-Game Strategic Reasoning in Language Models
- arxiv url: http://arxiv.org/abs/2605.10410v1
- Date: Mon, 11 May 2026 11:49:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.78329
- Title: Equilibrium Residuals Expose Three Regimes of Matrix-Game Strategic Reasoning in Language Models
- Title(参考訳): Equilibrium Residuals Expose Three Regimes of Matrix-Game Strategic Reasoning in Language Models
- Authors: Wenhua Nie, Binhan Luo, Zijie Meng, Jyh-Shing Roger Jang, Ching-Wen Ma,
- Abstract要約: 大きな言語モデルは、名前付きゲーム理論のベンチマークでうまくスコアを付けることができ、セマンティックキューが取り除かれると、同じ戦略的計算で失敗する。
プロシージャ的に生成されたゼロサム行列ゲームとはこのギャップを示す。
トレーニングは2時間2ドルと3時間3ドルで、教師なしの微調整は5時間5ドルから7時間7ドルを2%から61%に引き上げる。
- 参考スコア(独自算出の注目度): 6.170669604828877
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models can score well on named game-theory benchmarks while failing on the same strategic computation once semantic cues are removed. We show this gap with procedurally generated zero-sum matrix games: a model that recognizes familiar games drops to 34%, 18%, and 2% success on anonymous $2{\times}2$, $3{\times}3$, and $5{\times}5$ payoff matrices. The benchmark separates semantic recall, learned approximate Nash computation, and an output-interface bottleneck that limits scale. Training only on $2{\times}2$ and $3{\times}3$ games, supervised fine-tuning raises unseen $5{\times}5$--$7{\times}7$ success from 2% to 61%, while exploitability-reward training averages 37% with high seed variance. We prove that the exploitability residual is $2$-Lipschitz in payoff perturbations, unlike discontinuous vertex-returning LP equilibrium selectors, explaining why residual training can transfer under payoff shifts even when formatting instability limits mean performance. A dominated-action padding experiment provides causal evidence: trained models solve $3{\times}3$ games embedded in much larger matrices, while random-padded controls fail and dense $12{\times}12$ games remain near failure. Procedural evaluation is therefore necessary for measuring strategic reasoning, and residual rewards expose a real but format-limited route to approximate equilibrium computation.
- Abstract(参考訳): 大きな言語モデルは、名前付きゲーム理論のベンチマークでうまくスコアを付けることができ、セマンティックキューが取り除かれると、同じ戦略的計算で失敗する。
使い慣れたゲームを認識するモデルは、匿名の2{\times}2$, $3{\times}3$, 5{\times}5$ペイオフ行列で34%, 18%, 2%の成功率に減少する。
このベンチマークでは、セマンティックリコール、学習された近似Nash計算、スケールを制限するアウトプット-インターフェースボトルネックを分離する。
トレーニングは2ドル2セントと3ドル3ドルで、教師なしの微調整は5ドル-7ドル7ドル、成功率は2%から61%だ。
我々は,不連続な頂点反転LP平衡セレクタと異なり,不確実性に制限された場合においても,残余トレーニングがペイオフシフトの下で移動可能であることを説明して,ペイオフ摂動において2ドルLipschitzが有効であることを証明した。
トレーニングされたモデルは、はるかに大きな行列に埋め込まれた3ドル(約3,300円)のゲームを解決します。
したがって、戦略的推論を測るためには手続き的評価が必要であり、残余の報酬は、近似平衡計算のための実数だが形式に制限された経路を露呈する。
関連論文リスト
- Scale-Invariant Fast Convergence in Games [67.02769061793619]
我々は,スケールフリーでもスケール不変でも,高速収束を実現する学習力学を開発した。
2プレーヤゼロサムゲームに対しては、$tildeO(A_mathrmdiff)$で有界な外部後悔を伴うスケールフリーかつスケール不変のダイナミクスが得られる。
マルチプレイヤーの汎用ゲームでは、過去の観測に基づいて観察された勾配をクリップする2倍のクリッピングと呼ばれる手法によって、スケールフリーの学習も可能となる。
論文 参考訳(メタデータ) (2026-02-12T11:57:20Z) - Two-Player Zero-Sum Games with Bandit Feedback [6.66618805642802]
本研究では,行プレーヤが敵列プレーヤに対する報酬を最大化することを目的とした2プレイヤーゼロサムゲームについて検討する。
本研究では,Explore-Then-Commitフレームワークに基づく3つのアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-17T13:46:32Z) - Instance-Dependent Regret Bounds for Learning Two-Player Zero-Sum Games with Bandit Feedback [60.610120215789976]
純粋な戦略 ナッシュ均衡が存在するとき、$c$ は 0 となり、最適のインスタンス依存後悔境界となることを示す。
また,本アルゴリズムは最終段階の収束性も享受し,ほぼ最適サンプルを用いて純粋な戦略ナッシュ均衡を同定することができる。
論文 参考訳(メタデータ) (2025-02-24T20:20:06Z) - Corrupted Learning Dynamics in Games [62.73758165845971]
すべてのプレイヤーが楽観的な追従型リーダー(OFTRL)に従うと、平衡は$O(log T)$の速さで計算できる。
本稿では,各プレイヤーが所定のアルゴリズムによって提案される戦略から逸脱する程度に依存する速度で,適応的に平衡を求める学習ダイナミクスを提案する。
論文 参考訳(メタデータ) (2024-12-10T02:23:44Z) - Policy Mirror Ascent for Efficient and Independent Learning in Mean
Field Games [35.86199604587823]
平均場ゲームは対称および匿名の$N$-playerゲームに対して近似的なナッシュ均衡を得るための理論的ツールとして使われてきた。
ポリシーミラーを実行する$N$エージェントは、$widetildemathcalO(varepsilon-2)$サンプル内で正規化ゲームのナッシュ平衡に収束することを示す。
論文 参考訳(メタデータ) (2022-12-29T20:25:18Z) - Minimax-Optimal Multi-Agent RL in Zero-Sum Markov Games With a
Generative Model [50.38446482252857]
2人プレイのゼロサムマルコフゲームは多エージェント強化学習においておそらく最も基本的な設定である。
我々は,$$ widetildeObiggを用いて,$varepsilon$-approximate Markov NEポリシーを学習する学習アルゴリズムを開発した。
我々は、分散型量の役割を明確にするFTRLに対する洗練された後悔境界を導出する。
論文 参考訳(メタデータ) (2022-08-22T17:24:55Z) - No-Regret Learning in Time-Varying Zero-Sum Games [99.86860277006318]
固定ゼロサムゲームにおける繰り返しプレイからの学習は、ゲーム理論とオンライン学習における古典的な問題である。
提案手法は,3つの性能基準の下で,良好な保証を同時に享受できる1つのパラメータフリーアルゴリズムである。
本アルゴリズムは,ある特性を満たすブラックボックスベースラーナー群に対するメタアルゴリズムを用いた2層構造に基づく。
論文 参考訳(メタデータ) (2022-01-30T06:10:04Z) - A Bayesian Learning Algorithm for Unknown Zero-sum Stochastic Games with
an Arbitrary Opponent [9.094186120476174]
ゼロサムゲームのための後サンプリング強化学習(PSRL-ZSG)
ゼロサムゲームのための後サンプリング強化学習(PSRL-ZSG)を提案する。
論文 参考訳(メタデータ) (2021-09-08T02:05:40Z) - Learning Zero-Sum Simultaneous-Move Markov Games Using Function
Approximation and Correlated Equilibrium [116.56359444619441]
両プレイヤーのゼロサム有限ホライゾンマルコフゲームに対する効率の良い強化学習アルゴリズムを開発した。
オフライン環境では、両プレイヤーを制御し、双対性ギャップを最小化してナッシュ平衡を求める。
オンライン環境では、任意の相手と対戦する1人のプレイヤーを制御し、後悔を最小限に抑える。
論文 参考訳(メタデータ) (2020-02-17T17:04:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。