論文の概要: ICM Out! Better Tournament Strategy from Computed Continuations, vs. Solvers and LLMs
- arxiv url: http://arxiv.org/abs/2608.09586v1
- Date: Mon, 10 Aug 2026 13:20:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.286667
- Title: ICM Out! Better Tournament Strategy from Computed Continuations, vs. Solvers and LLMs
- Title(参考訳): ICMアウト!Computed Continuation, vs. Solvers, LLMsによるより良いトーナメント戦略
- Abstract要約: 現在の成果を列挙する政策構成法は、それらを後継国家にマップする。
我々は,100万ドルの賞金プールを持つ3人のジャム/フォールドトーナメントにおいて,結果のポリシーを評価する。
ICMがトーナメント戦略構築の不十分な目標になったときに、この価値対政治対コストの連鎖が直接表示される。
- 参考スコア(独自算出の注目度): 38.06569764716213
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The Independent Chip Model (ICM) converts tournament chips into reference prize equity, and policies are routinely constructed against those values. Because ICM reads only stack sizes, it omits action order, blind obligations, and seat rotation, and it does not price the elimination pressure a big stack puts on the short stacks it can bust. Those omissions can alter the successor-state contrasts that determine a move. We introduce Strategic-Continuation Optimization (SCO), a policy-construction method that enumerates current-hand outcomes, maps them to successor states, prices those states with continuation values computed from the finite tournament model, and optimizes and freezes the resulting current-hand policy. The fixed-ICM comparison policy changes one thing only: the same optimizer solves the same game with successor states priced by analytic ICM, so the two policies differ only through that pricing. We evaluate the resulting policies in a three-player jam/fold tournament with a \$1M prize pool. Relative to the frozen strategic-continuation benchmark, analytic ICM has \$9{,}036 mean absolute value error across all 2,838 state--seat entries. That value error rewrites the ranges it prices: measured against each decision point's own fixed-ICM jam range, SCO moves the jam frequency by an average of 14.08\%. To price those different moves, we compare all 946 states and three policy owners while changing only the focal policy and holding both opponents and the continuation evaluator fixed. The policy produced by SCO earns \$214.33 more prize equity per hand on average and is favored in 2,433 of 2,838 matched units. The ordering survives replacing the solver-built opponent with two LLMs and with a family of non-modeling threshold players. This value-to-policy-to-cost chain shows directly when ICM becomes an inadequate objective for tournament strategy construction.
- Abstract(参考訳): 独立チップモデル(ICM)はトーナメントチップを基準賞品に換算し、それらの値に対するポリシーを定期的に構築する。
ICMはスタックサイズのみを読み取るため、動作順序、ブラインド義務、座席回転を省略し、大きなスタックが破壊可能な短いスタックに与える除去圧力を値付けしない。
これらの省略は、移動を決定する後継状態のコントラストを変更することができる。
戦略継続最適化(SCO: Strategic-Continuation Optimization)は、現在の成果を列挙し、それらを後継州にマップし、有限トーナメントモデルから計算した継続値でそれらの状態を価格設定し、その結果の現在の政策を最適化し凍結する政策構築手法である。
固定ICM比較ポリシーは1つだけを変える: 同じオプティマイザは、解析的ICMによって価格付けされた後継状態と同一のゲームを解決するため、この2つのポリシーは、その価格でのみ異なる。
我々は,100万ドル相当の賞金プールを持つ3人のジャム/フォールドトーナメントにおいて,結果のポリシーを評価する。
凍結した戦略継続ベンチマークとは対照的に、解析的ICMは2,838のステートシートエントリに対して9{,}036の平均絶対値誤差を持つ。
この値誤差は値範囲を書き換える:各決定点の自身の固定ICMジャム範囲に対して測定すると、SCOはジャム周波数を平均14.08\%移動させる。
これらの異なる動きを価格設定するために、焦点ポリシーのみを変更し、双方の相手と継続評価器を固定しながら、946の州と3つの政策所有者を比較します。
SCOによる政策は、平均して214.33ドル以上の賞金を勝ち取り、2,838台のうち2,433台が好まれる。
オーダリングは、ソルバが構築した相手を2つのLSMに置き換え、非モデリングしきい値プレーヤーのファミリーに置き換える。
ICMがトーナメント戦略構築の不十分な目標になったときに、この価値対政治対コストの連鎖が直接表示される。
関連論文リスト
- Incentives and Market Structure in Intent-Based Exchanges: Evidence from a Solver-Reward Reform [2.5599656137521425]
プロトコルによって設計された報酬ルールの変更が、どのように価値をキャプチャするかを測定する。
CoW Protocol CIP-74は、固定されたソルバ・リワード・キャップをプロトコル収益に結びついたものに置き換え、広告価値のボリューム料金を導入した。
日替わりで395日超の株式を保有し、注文規模で取引価値を再配分した。
論文 参考訳(メタデータ) (2026-07-24T04:04:15Z) - Strategic Buying Agents [5.678371127103685]
Agentic AIは、オンラインショッピングを検索からデリゲートされた購入へとシフトしている。
本研究では,有限のショッピングウィンドウ内でいつ購入するかを判断しなければならない戦略的購入エージェントの設計について検討する。
我々はこの問題を定常、ベイジアン、ロバストという3つの情報体制で定式化する。
論文 参考訳(メタデータ) (2026-07-06T06:24:17Z) - Online Learning for Uninformed Markov Games: Empirical Nash-Value Regret and Non-Stationarity Adaptation [54.274028560515454]
対戦相手の行動や方針が守られない2人プレイヤのマルコフゲームにおいて,オンライン学習を学習する。
経験的ナッシュバリュー後悔は,ナッシュバリュー後悔よりも強く,新たな後悔の概念である。
我々は,このアルゴリズムを,相手の潜在的非定常性に応じて適切な$で適応的に再起動する方法を示す。
論文 参考訳(メタデータ) (2026-02-06T21:25:54Z) - Reinforcement Learning from Adversarial Preferences in Tabular MDPs [62.73758165845971]
我々は,敵対的嗜好を持つエピソードマルコフ決定プロセス(MDP)の新たな枠組みを導入する。
PbMDP では、標準的なエピソード MDP とは異なり、学習者は2つの候補アーム間の好みを観察する。
我々は、既知遷移の下で、T2/3$という残差境界を達成するアルゴリズムを開発する。
論文 参考訳(メタデータ) (2025-07-15T20:19:32Z) - Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback [49.84060509296641]
オンライン有限水平マルコフ決定過程を逆向きに変化した損失と総括的帯域幅フィードバック(フルバンド幅)を用いて研究する。
この種のフィードバックの下では、エージェントは、軌跡内の各中間段階における個々の損失よりも、軌跡全体に生じる総損失のみを観察する。
この設定のための最初のポリシー最適化アルゴリズムを紹介します。
論文 参考訳(メタデータ) (2025-02-06T12:03:24Z) - Provably Efficient Fictitious Play Policy Optimization for Zero-Sum
Markov Games with Structured Transitions [145.54544979467872]
本研究では,ゼロサムマルコフゲームに対して,構造的だが未知の遷移を伴う架空のプレイポリシー最適化アルゴリズムを提案し,解析する。
我々は、2年制の競争ゲームシナリオで、$K$のエピソードに続き、$widetildemathcalO(sqrtK)$ regret boundsを証明した。
提案アルゴリズムは,アッパー信頼境界(UCB)型最適化と,同時政策最適化の範囲内での架空のプレイの組み合わせを特徴とする。
論文 参考訳(メタデータ) (2022-07-25T18:29:16Z) - Policy Optimization for Markov Games: Unified Framework and Faster
Convergence [81.3266426402464]
このアルゴリズムのステートワイド平均ポリシはゲームの近似ナッシュ平衡(NE)に収束することを示す。
このアルゴリズムをマルチプレイヤー一般のMarkov Gamesに拡張し、CCE(Correlated Equilibria)への$mathcalwidetildeO(T-1/2)$収束率を示す。
論文 参考訳(メタデータ) (2022-06-06T14:23:13Z) - Efficient Policy Iteration for Robust Markov Decision Processes via
Regularization [49.05403412954533]
ロバストな意思決定プロセス(MDP)は、システムのダイナミクスが変化している、あるいは部分的にしか知られていない決定問題をモデル化するためのフレームワークを提供する。
最近の研究は、長方形長方形の$L_p$頑健なMDPと正規化されたMDPの等価性を確立し、標準MDPと同じレベルの効率を享受する規則化されたポリシー反復スキームを導出した。
本研究では、政策改善のステップに焦点をあて、欲求政策と最適なロバストなベルマン作用素のための具体的な形式を導出する。
論文 参考訳(メタデータ) (2022-05-28T04:05:20Z) - OffCon$^3$: What is state of the art anyway? [20.59974596074688]
モデルフリー連続制御タスクに対する2つの一般的なアプローチは、SACとTD3である。
TD3 は DPG から派生したもので、決定論的ポリシーを用いて値関数に沿ってポリシー上昇を行う。
OffCon$3$は、両方のアルゴリズムの最先端バージョンを特徴とするコードベースである。
論文 参考訳(メタデータ) (2021-01-27T11:45:08Z) - Joint Policy Search for Multi-agent Collaboration with Imperfect
Information [31.559835225116473]
我々は,各情報集合に局所化されるポリシー変更に対して,ゲーム値のグローバルな変化を分解可能であることを示す。
本稿では,不完全な情報ゲームにおける協調エージェントの協調ポリシーを反復的に改善する共同ポリシー探索を提案する。
論文 参考訳(メタデータ) (2020-08-14T17:58:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。