論文の概要: Game Arena: Strategic LLM Evaluation in Competitive Environments
- arxiv url: http://arxiv.org/abs/2609.31473v1
- Date: Fri, 25 Sep 2026 16:20:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.488044
- Title: Game Arena: Strategic LLM Evaluation in Competitive Environments
- Title(参考訳): ゲームアリーナ:競争環境における戦略LDM評価
- Abstract要約: カグルゲームアリーナ(Kaggle Game Arena)は,大規模言語モデル(LLM)を競争ゲームを通じて評価するオープンで拡張可能なプラットフォームである。
Game Arenaは、モデルが進化するにつれて、ゲームプレイの強度が自然に増加する構造化環境で、モデルが頭から頭までのマッチアップをプレイすることを可能にする。
この技術レポートはGame Arenaの基盤を詳述し、Chess、Poker、Werewolfの3つのパイロットゲーム環境について説明している。
- 参考スコア(独自算出の注目度): 35.06459997423752
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Kaggle Game Arena, an open and ever-expanding platform to evaluate large language models (LLMs) through competitive games. Different from static benchmarks, game arena enables models to play head-to-head matchups in structured environments where the gameplay strength naturally increases as models evolve, preventing performance saturation. This technical report details the infrastructure behind Game Arena and describes the three pilot game environments: Chess, Poker, and Werewolf. These environments span perfect information, imperfect information, and multiplayer game settings, enabling a systematic study of models' strategic planning, adaptation, and robustness under uncertainty. For each game, we provide a detailed description of the environment, evaluation metrics, and results from running full competitions across models. Through robust infrastructure and large-scale ground-truth based evaluation, Game Arena ensures reproducibility, transparency and generalizability to new games and variants over time.
- Abstract(参考訳): カグルゲームアリーナ(Kaggle Game Arena)は,大規模言語モデル(LLM)を競争ゲームを通じて評価するオープンで拡張可能なプラットフォームである。
静的ベンチマークとは異なり、ゲームアリーナは、モデルが進化するにつれてゲームプレイの強度が自然に増加する構造化環境で、ヘッド・ツー・ヘッドのマッチアップをプレイすることができ、パフォーマンスの飽和を防ぐことができる。
この技術レポートはGame Arenaの基盤を詳述し、Chess、Poker、Werewolfの3つのパイロットゲーム環境について説明している。
これらの環境は完璧な情報、不完全な情報、マルチプレイヤーゲームの設定にまたがっており、不確実性の下でモデルの戦略的計画、適応、堅牢性の体系的な研究を可能にする。
各ゲームに対して、モデル間の完全な競合の実行による環境、評価指標、および結果の詳細な説明を提供する。
堅牢なインフラと大規模な地道に基づく評価を通じて、Game Arenaは、新しいゲームや変種に対する再現性、透明性、一般化性を時間とともに保証する。
関連論文リスト
- MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs [54.81359054218573]
大規模言語モデル(LLM)のためのマルチゲームアリーナと評価プラットフォームであるMindgamesを紹介する。
Mindgamesは、統合されたインタラクションインターフェース、TrueSkillベースの評価、および4つのゲーム環境にわたる完全な軌跡ログを提供する。
我々は,決定論的オフライントーナメントプロトコルMG-Refとともに,ターンレベルの観察,アクション,報酬を含む29,571個のマルチエージェントゲームを分析した。
論文 参考訳(メタデータ) (2026-05-28T07:33:47Z) - InfoChess: A Game of Adversarial Inference and a Laboratory for Quantifiable Information Control [3.198144010381572]
InfoChessは、競争情報獲得を主目的に高める対称的敵対ゲームである。
プレイヤーはゲーム中に相手のキング位置を確率論的に推測して得点する。
我々は, 信念エントロピー, オラクルクロスエントロピー, 予測ログスコアを含む, 自然情報理論的特徴によるゲームプレイの分析を行った。
論文 参考訳(メタデータ) (2026-04-15T16:07:42Z) - LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition [104.81487689011341]
本稿では,Mortal Kombat IIにおける大規模マルチモーダルモデルを評価する新しいフレームワークであるLM Fight Arenaを紹介する。
静的評価とは異なり、LM Fight Arenaは完全に自動化され、再現可能で、LMMの戦略的推論能力の客観的評価を提供する。
論文 参考訳(メタデータ) (2025-10-10T02:19:21Z) - Who is a Better Player: LLM against LLM [53.46608216197315]
本稿では,大規模言語モデル (LLM) の総合的な性能を評価するための対戦型ベンチマークフレームワークを提案する。
広範にプレイされている5つのゲームをサポートし,20のLDMを駆使したプレーヤーを対象とする,特別な評価プラットフォームであるQi Townを紹介した。
論文 参考訳(メタデータ) (2025-08-05T06:41:47Z) - TMGBench: A Systematic Game Benchmark for Evaluating Strategic Reasoning Abilities of LLMs [45.12542636218608]
ゲームタイプの包括的カバレッジ,多様なシナリオ,フレキシブルなゲーム組織を特徴とするTMGBenchを提案する。
具体的には、ベンチマークで古典ゲームとして構築された2x2ゲームのロビンソン・ゴーフォーストポロジーによって要約された144種類のゲームタイプをすべて組み込む。
より強力なLSMに適応可能な持続可能な評価フレームワークを提供するため、上記のゲームを原子単位として扱う。
論文 参考訳(メタデータ) (2024-10-14T13:15:34Z) - All by Myself: Learning Individualized Competitive Behaviour with a
Contrastive Reinforcement Learning optimization [57.615269148301515]
競争ゲームのシナリオでは、エージェントのセットは、彼らの目標を最大化し、敵の目標を同時に最小化する決定を学習する必要があります。
本稿では,競争ゲームの表現を学習し,特定の相手の戦略をどうマップするか,それらを破壊するかを学習する3つのニューラルネットワーク層からなる新しいモデルを提案する。
我々の実験は、オフライン、オンライン、競争特化モデル、特に同じ対戦相手と複数回対戦した場合に、我々のモデルがより良いパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2023-10-02T08:11:07Z) - Individualized Context-Aware Tensor Factorization for Online Games
Predictions [6.602875221541352]
ユーザパフォーマンスとゲーム結果を予測するために,Neural Individualized Context-aware Embeddings(NICE)モデルを提案する。
提案手法は,ユーザとコンテキストの潜在表現を学習することで,異なるコンテキストにおける個人行動の違いを識別する。
我々は,MOBAゲームLeague of Legendsのデータセットを用いて,勝利の予測,個々のユーザパフォーマンス,ユーザエンゲージメントを大幅に改善することを示した。
論文 参考訳(メタデータ) (2021-02-22T20:46:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。