論文の概要: GTO Wizard Benchmark
- arxiv url: http://arxiv.org/abs/2603.23660v1
- Date: Tue, 24 Mar 2026 19:04:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-26 21:06:11.000061
- Title: GTO Wizard Benchmark
- Title(参考訳): GTOウィザードベンチマーク
- Authors: Marc-Antoine Provost, Nejc Ilenic, Christopher Solinas, Philippe Beardsell,
- Abstract要約: GTO Wizard BenchmarkはHeads-Up No-Limit Texas Hold'em (HUNL)でアルゴリズムをベンチマークするためのフレームワークである。
このベンチマークは、最先端の超人ポーカーエージェントであるGTO Wizard AIに対するエージェントを評価する。
ゼロショット条件下での最先端の大規模言語モデルの総合的なベンチマーク研究を行う。
- 参考スコア(独自算出の注目度): 0.6999740786886536
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce GTO Wizard Benchmark, a public API and standardized evaluation framework for benchmarking algorithms in Heads-Up No-Limit Texas Hold'em (HUNL). The benchmark evaluates agents against GTO Wizard AI, a state-of-the-art superhuman poker agent that approximates Nash Equilibria, and defeated Slumbot, the 2018 Annual Computer Poker Competition champion and previous strongest publicly accessible HUNL benchmark, by $19.4$ $\pm$ $4.1$ bb/100. Variance is a fundamental challenge in poker evaluation; we address this by integrating AIVAT, a provably unbiased variance reduction technique that achieves equivalent statistical significance with ten times fewer hands than naive Monte Carlo evaluation. We conduct a comprehensive benchmarking study of state-of-the-art large language models under zero-shot conditions, including GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro, Grok 4, and others. Initial results and analysis reveal dramatic progress in LLM reasoning over recent years, yet all models remain far below the baseline established by our benchmark. Qualitative analysis reveals clear opportunities for improvement, including representation and the ability to reason over hidden states. This benchmark provides researchers with a precise and quantifiable setting to evaluate advances in planning and reasoning in multi-agent systems with partial observability.
- Abstract(参考訳): GTO Wizard BenchmarkはHUNL(Heads-Up No-Limit Texas Hold'em)において,ベンチマークアルゴリズムのための公開APIと標準化された評価フレームワークである。
このベンチマークは、Nash Equilibriaを近似した最先端のスーパーヒューマンポーカーエージェントであるGTO Wizard AIに対するエージェントの評価を行い、2018年のコンピュータポーカーコンペティションのチャンピオンであり、これまで最も広く公開されたHUNLベンチマークであるSlumbotを、19.4ドルの$\pm$4.1$ bb/100で破った。
可変性はポーカー評価の基本的な課題であり、モンテカルロ評価の10倍の精度で等価な統計的意義を達成できる、確率的に偏りのない分散還元技術であるAIVATを統合することでこの問題に対処する。
GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro、Grok 4など、ゼロショット条件下での最先端の大規模言語モデルの包括的なベンチマーク研究を行う。
初期の結果と分析結果から,近年のLSM推論の進歩が明らかになっているが,我々のベンチマークでは,全てのモデルがベースラインよりはるかに低いままである。
質的な分析は、表現や隠れた状態を推論する能力を含む、改善の明確な機会を明らかにします。
このベンチマークは、部分可観測性を持つマルチエージェントシステムにおける計画と推論の進歩を評価するための正確で定量的な設定を提供する。
関連論文リスト
- Benchmark^2: Systematic Evaluation of LLM Benchmarks [66.2731798872668]
3つの相補的なメトリクスからなる包括的なフレームワークであるBenchmark2を提案する。
数学、推論、知識ドメインにまたがる15のベンチマークで実験を行います。
本分析により,既存のベンチマーク間での有意な品質変化が明らかとなり,選択的なベンチマーク構築が同等な評価性能を達成できることが示されている。
論文 参考訳(メタデータ) (2026-01-07T14:59:03Z) - Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models [9.972892886403228]
評価指標を体系的に過小評価する手法が広く用いられていることを示す。
グループ構造をよりよく活用し、かなり隠れた能力を明らかにするグループマッチングスコアを導入します。
テスト時間マッチング(TTM, Test-Time Matching)は、外部の監視なしにモデル性能をさらにブートストラップする反復的自己改善アルゴリズムである。
論文 参考訳(メタデータ) (2025-10-09T00:00:49Z) - Benchmarking AI Models in Software Engineering: A Review, Search Tool, and Unified Approach for Elevating Benchmark Quality [4.213480330807674]
2014年以降、273のAI4SEベンチマークを識別する247の研究のレビューを行う。
それらを分類し、現在のプラクティスのギャップを露呈し、適切なベンチマークを見つけるためのセマンティック検索ツールであるBenchScoutを紹介します。
参加者22名のユーザスタディにおいて、BenchScoutは、ユーザビリティ、有効性、直感性を4.5、4.0、そして5.1で達成した。
論文 参考訳(メタデータ) (2025-03-07T18:44:32Z) - ReFeR: Improving Evaluation and Reasoning through Hierarchy of Models [12.035509884945789]
テキストと画像の両方を含む生成出力を評価するために設計されたReFeRというチューニング不要のフレームワークを導入する。
フレームワークであるReFeRを4つの多様な評価タスクで厳格に評価します。
4つの推論タスクの実験は、フレームワークのより優れた集団推論能力を示す。
論文 参考訳(メタデータ) (2024-07-16T08:25:26Z) - Evaluation Metrics in the Era of GPT-4: Reliably Evaluating Large
Language Models on Sequence to Sequence Tasks [9.801767683867125]
我々は,3つのNLPベンチマークの予備的およびハイブリッドな評価を,自動評価と人的評価の両方を用いて提供する。
ChatGPTは、ほとんどのメトリクスにおいて、人間のレビュアーによって、他の人気のあるモデルよりも一貫して優れています。
また、人間のレビュアーは、最高のモデルの出力よりも金の基準を格段に悪く評価し、多くの人気のあるベンチマークの品質が劣っていることを示している。
論文 参考訳(メタデータ) (2023-10-20T20:17:09Z) - ARB: Advanced Reasoning Benchmark for Large Language Models [94.37521840642141]
複数の分野における先進的推論問題からなる新しいベンチマークであるABBを紹介する。
ARBのサブセットとして、高度なシンボリック推論とドメイン知識を必要とする数学と物理学の問題を紹介する。
我々は, GPT-4 や Claude on ARB などの最近のモデルを評価し, より要求の高いタスクにおいて, 現在のモデルが50%以下であることを示す。
論文 参考訳(メタデータ) (2023-07-25T17:55:19Z) - AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models [122.63704560157909]
我々は,人間中心の標準化試験の文脈で基礎モデルを評価するために設計された新しいベンチマークであるAGIEvalを紹介する。
GPT-4, ChatGPT, Text-Davinci-003 など,最先端基盤モデルの評価を行った。
GPT-4はSAT、LSAT、数学の競争で平均的な人事成績を上回り、SAT Mathテストでは95%の精度で、中国国立大学入試では92.5%の精度で合格している。
論文 参考訳(メタデータ) (2023-04-13T09:39:30Z) - News Summarization and Evaluation in the Era of GPT-3 [73.48220043216087]
GPT-3は,大規模な要約データセット上で訓練された微調整モデルと比較する。
我々は,GPT-3サマリーが圧倒的に好まれるだけでなく,タスク記述のみを用いることで,現実性に乏しいようなデータセット固有の問題に悩まされることも示している。
論文 参考訳(メタデータ) (2022-09-26T01:04:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。