論文の概要: CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V
- arxiv url: http://arxiv.org/abs/2604.07733v1
- Date: Thu, 09 Apr 2026 02:29:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 18:34:05.646105
- Title: CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V
- Title(参考訳): CivBench: LLMの文明における戦略的意思決定の進歩的評価 V
- Authors: John Chen, Sihan Cheng, Can Gurkan, Mingyi Lin,
- Abstract要約: マルチプレイヤーCivilization VにおけるLSMストラテジスト(エージェント設定)のベンチマークであるCivBenchを紹介する。
CivBenchはターンレベルゲーム状態のモデルをトレーニングし、プレイ全体を通して勝利確率を推定し、予測、構成、収束妥当性を通じて検証する。
我々は,不飽和ベンチマークとして戦略能力を推定するCivBenchの可能性を実証し,エージェント設定のモデル固有の効果を明らかにするとともに,結果のみの評価では見えない異なる戦略プロファイルを概説する。
- 参考スコア(独自算出の注目度): 0.8673752869253052
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Evaluating strategic decision-making in LLM-based agents requires generative, competitive, and longitudinal environments, yet few benchmarks provide all three, and fewer still offer evaluation signals rich enough for long-horizon, multi-agent play. We introduce CivBench, a benchmark for LLM strategists (i.e., agentic setups) in multiplayer Civilization V. Because terminal win/loss is too sparse a signal in games spanning hundreds of turns and multiple opponents, CivBench trains models on turn-level game state to estimate victory probabilities throughout play, validated through predictive, construct, and convergent validity. Across 307 games with 7 LLMs and multiple CivBench agent conditions, we demonstrate CivBench's potential to estimate strategic capabilities as an unsaturated benchmark, reveal model-specific effects of agentic setup, and outline distinct strategic profiles not visible through outcome-only evaluation.
- Abstract(参考訳): LLMベースのエージェントで戦略的意思決定を評価するには、生成的、競争的、そして長手な環境を必要とするが、3つ全てを提供するベンチマークは少ない。
CivBench はマルチプレイヤー文明における LLM ストラテジスト (エージェント・セットアップ) のベンチマークである CivBench を導入している。端末の勝利/損失は数百のターンと複数の対戦をまたがるゲームにおいて信号がスパースすぎるため、CivBench はターンレベルのゲーム状態でモデルを訓練し、プレイ全体を通して勝利確率を推定し、予測的、構成的、収束的妥当性を検証している。
7つのLLMと複数のCivBenchエージェント条件を持つ307ゲームにわたって、不飽和ベンチマークとして戦略能力を見積もるCivBenchの可能性を示し、エージェント設定のモデル固有の効果を明らかにし、結果のみの評価では見えない異なる戦略プロファイルを概説する。
関連論文リスト
- TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as Agents [5.173133826653683]
本稿では,RTSゲームにおけるタワー防衛サブジャンルを基盤とした,新しい環境であるタワーミンドを紹介する。
我々は、広く使われている大規模言語モデルを評価するために、5つのベンチマークレベルを設計する。
その結果、LLMと人間の専門家の能力と幻覚の両面において、明らかなパフォーマンスギャップが明らかとなった。
論文 参考訳(メタデータ) (2026-01-09T16:18:08Z) - Agents of Change: Self-Evolving LLM Agents for Strategic Planning [28.172006841163938]
HexMachinaは、環境発見と戦略改善を分離する継続的学習マルチエージェントシステムである。
制御されたカタナトロン実験では、HexMachinaはスクラッチから学び、最強の人造ベースラインを上回るプレイヤーを進化させる。
論文 参考訳(メタデータ) (2025-06-05T05:45:24Z) - VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments [25.534332634912005]
マルチエージェント環境における戦略的能力のための視覚言語モデルを評価するベンチマークであるVisual Strategic Bench (VS-Bench)を紹介する。
VLMエージェントの性能は、要素認識精度で測定された知覚、次のアクション予測精度で測定された戦略的推論、正規化エピソードリターンで測定された意思決定の3つの次元にわたって評価される。
論文 参考訳(メタデータ) (2025-06-03T02:57:38Z) - GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents [4.209869303518743]
大規模言語モデルの戦略的推論能力を評価するためのクロスドメインベンチマークであるGameBenchを紹介する。
戦略的推論能力の向上を目的とした2つの足場フレームワークとともに,GPT-3とGPT-4をベースとして評価を行った。
以上の結果から,試験対象モデルと人体性能は一致せず,GPT-4は無作為な動作よりも悪い結果が得られた。
論文 参考訳(メタデータ) (2024-06-07T00:28:43Z) - How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments [83.78240828340681]
GAMA($gamma$)-Benchは、マルチエージェント環境における大規模言語モデルのゲーム能力を評価するための新しいフレームワークである。
$gamma$-Benchは8つの古典ゲーム理論シナリオと、LSMの性能を評価するために特別に設計された動的スコアリングスキームを含んでいる。
以上の結果から, GPT-3.5は強い強靭性を示すが, 一般化性は限定的であり, Chain-of-Thoughtのような手法で拡張可能であることが示唆された。
論文 参考訳(メタデータ) (2024-03-18T14:04:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。