論文の概要: WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models
- arxiv url: http://arxiv.org/abs/2506.10264v1
- Date: Thu, 12 Jun 2025 01:16:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-06-13 15:37:22.508201
- Title: WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models
- Title(参考訳): WGSR-Bench:大規模言語モデルのためのゲーム理論戦略推論ベンチマーク
- Abstract要約: 本稿では,WGSR-Benchについて紹介する。WGSR-BenchはLarge Language Models (LLMs) の最初の戦略推論ベンチマークであり,WGSR-Benchをその評価環境として利用する。
我々は,戦略的推論の主要な能力を評価するために,環境意識,対人リスクモデリング,政策生成という3つの中核的課題に関するテストサンプルを設計する。
- 参考スコア(独自算出の注目度): 28.28739884703072
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent breakthroughs in Large Language Models (LLMs) have led to a qualitative leap in artificial intelligence' s performance on reasoning tasks, particularly demonstrating remarkable capabilities in mathematical, symbolic, and commonsense reasoning. However, as a critical component of advanced human cognition, strategic reasoning, i.e., the ability to assess multi-agent behaviors in dynamic environments, formulate action plans, and adapt strategies, has yet to be systematically evaluated or modeled. To address this gap, this paper introduces WGSR-Bench, the first strategy reasoning benchmark for LLMs using wargame as its evaluation environment. Wargame, a quintessential high-complexity strategic scenario, integrates environmental uncertainty, adversarial dynamics, and non-unique strategic choices, making it an effective testbed for assessing LLMs' capabilities in multi-agent decision-making, intent inference, and counterfactual reasoning. WGSR-Bench designs test samples around three core tasks, i.e., Environmental situation awareness, Opponent risk modeling and Policy generation, which serve as the core S-POE architecture, to systematically assess main abilities of strategic reasoning. Finally, an LLM-based wargame agent is designed to integrate these parts for a comprehensive strategy reasoning assessment. With WGSR-Bench, we hope to assess the strengths and limitations of state-of-the-art LLMs in game-theoretic strategic reasoning and to advance research in large model-driven strategic intelligence.
- Abstract(参考訳): 近年のLarge Language Models(LLM)のブレークスルーは、推論タスクにおける人工知能のパフォーマンスの質的な飛躍をもたらし、特に数学的、記号的、常識的推論において顕著な能力を示している。
しかし、高度な人間の認知、戦略的推論、すなわち動的環境におけるマルチエージェント行動の評価、行動計画の定式化、適応戦略の重要な要素として、体系的な評価やモデル化は行われていない。
このギャップに対処するために,ウォーゲームを評価環境として利用した LLM の戦略推論ベンチマーク WGSR-Bench を紹介する。
極めて複雑な戦略シナリオであるウォーゲームは、環境の不確実性、敵対的ダイナミクス、および非普遍的な戦略選択を統合し、マルチエージェント意思決定、意図推論、および反事実推論においてLLMの能力を評価する効果的なテストベッドとなる。
WGSR-Benchは、戦略的推論の主要な能力を評価するために、環境状況認識、対人リスクモデリング、およびS-POEアーキテクチャとして機能するポリシー生成の3つのコアタスクに関するテストサンプルを設計した。
最後に、LLMベースのウォーゲームエージェントは、これらを総合的な戦略推論評価のために統合するように設計されている。
WGSR-Benchでは、ゲーム理論の戦略的推論における最先端のLSMの強みと限界を評価し、大規模モデル駆動型戦略知能の研究を進めたい。
関連論文リスト
- Beyond Rational Illusion: Behaviorally Realistic Strategic Classification [56.458581740660236]
本稿では,行動的現実的な戦略分類問題に対処するために,プロビジョンガイド型戦略フレームワーク(Pro-SF)を提案する。
Pro-SFは、行動学的に現実的な戦略的な反応の下でモデル化し、学習するための予測理論に基づく原則化されたフレームワークである。
合成および実世界のデータセットの実験は、Pro-SFを戦略分類の行動的基盤としたアプローチとして確立する。
論文 参考訳(メタデータ) (2026-05-19T11:04:55Z) - Foresight Optimization for Strategic Reasoning in Large Language Models [24.13855510359357]
我々は、大規模言語モデル(LLM)における戦略的推論を強化するために、フォレストポリシー最適化(FoPO)を導入する。
FoPOは、対立するモデリング原則をポリシー最適化に統合することで、自己利益とそれに対応する影響の両方を明確に考慮することができる。
実験により、FoPOは様々な大きさと起源のLSMをまたいだ戦略的推論を著しく向上させることが示された。
論文 参考訳(メタデータ) (2026-04-15T07:55:41Z) - Beyond Scaling: Assessing Strategic Reasoning and Rapid Decision-Making Capability of LLMs in Zero-sum Environments [15.538910160052964]
本稿では,マルチエージェント評価フレームワークであるStrategic Tactical Agent Reasoning (STAR) Benchmarkを紹介する。
STARはターンベースとリアルタイムの両方の設定をサポートし、長期戦略計画の制御可能な分析を可能にする。
対話型環境における戦略的インテリジェンスは、推論の深さだけでなく、計画をタイムリーな行動に変換する能力にも依存することを示す。
論文 参考訳(メタデータ) (2026-03-10T08:14:13Z) - Expanding LLM Agent Boundaries with Strategy-Guided Exploration [51.98616048282804]
強化学習(RL)は、コンピュータ使用、ツール呼び出し、コーディングなどのタスクのエージェントとして、大規模言語モデル(LLM)の訓練後において顕著な成功を収めた。
我々は,低レベルな行動から高レベルな言語戦略に移行するための戦略ガイド探索(SGE)を提案する。
論文 参考訳(メタデータ) (2026-03-02T16:28:39Z) - LLMsPark: A Benchmark for Evaluating Large Language Models in Strategic Gaming Contexts [19.97430860742638]
本稿では,大規模言語モデルの意思決定戦略と社会行動を測定するゲーム理論に基づく評価プラットフォームについて述べる。
本システムでは,トップボードランキングとスコアリング機構を用いて,15のLLMを横断的に評価する。
この研究は、LLMの戦略的知性を評価するための新しい視点を導入し、既存のベンチマークを強化し、インタラクティブでゲーム理論的なシナリオにおけるそれらの評価を広げる。
論文 参考訳(メタデータ) (2025-09-20T10:21:17Z) - CHBench: A Cognitive Hierarchy Benchmark for Evaluating Strategic Reasoning Capability of LLMs [10.29314561183905]
ゲームプレイ能力は、大規模言語モデルの戦略的推論能力を評価する指標となる。
行動経済学の認知階層モデルに着想を得た新しい評価フレームワークであるCHBenchを提案する。
論文 参考訳(メタデータ) (2025-08-16T07:10:26Z) - KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation [78.96590724864606]
我々はKOR-BenchとGymnasiumに触発された動的評価プラットフォームであるKORGym(Knowledge Orthogonal Reasoning Gymnasium)を紹介する。
KORGymはテキストまたはビジュアル形式で50以上のゲームを提供し、強化学習シナリオによるインタラクティブでマルチターンアセスメントをサポートする。
論文 参考訳(メタデータ) (2025-05-20T16:06:32Z) - Strategy-Augmented Planning for Large Language Models via Opponent Exploitation [11.840105106884543]
LLMエージェントの攻撃的利用能力を大幅に向上させる2段階戦略拡張計画(SAP)フレームワークを提案する。
オフラインの段階では、明示的な戦略空間を構築し、その後戦略評価ネットワーク(SEN)をトレーニングするための戦略アウトカムペアデータを収集する。
オンラインフェーズでは、SAPは相手の戦略を動的に認識し、よく訓練されたSEN上で最良のレスポンス戦略を探索することにより、それらを強引に活用する。
論文 参考訳(メタデータ) (2025-05-13T11:41:10Z) - EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement Learning [69.55982246413046]
戦略的推論のための明示的なポリシー最適化(EPO)を提案する。
我々は,マルチターン強化学習(RL)による戦略的推論モデルを訓練し,プロセス報酬と反復的な自己プレイを活用する。
本研究は, EPOに出現する様々な協調的推論機構と, 新規戦略の創出における有効性を明らかにするものである。
論文 参考訳(メタデータ) (2025-02-18T03:15:55Z) - STRIDE: A Tool-Assisted LLM Agent Framework for Strategic and Interactive Decision-Making [43.734386326024016]
大規模言語モデル(LLM)は自然言語処理に革命をもたらしており、言語能力と推論能力が顕著である。
本稿では,その戦略的意思決定能力を高めるため,メモリと特殊なツールを備えた新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-05-25T23:25:10Z) - LLM as a Mastermind: A Survey of Strategic Reasoning with Large Language Models [75.89014602596673]
戦略推論は、戦略を調整しながら、マルチエージェント設定における敵の行動を理解し、予測する必要がある。
大規模言語モデルを用いた戦略的推論に関連するスコープ,アプリケーション,方法論,評価指標について検討する。
戦略的推論を重要な認知能力として重要視し、将来の研究の方向性や潜在的な改善に関する洞察を提供する。
論文 参考訳(メタデータ) (2024-04-01T16:50:54Z) - K-Level Reasoning: Establishing Higher Order Beliefs in Large Language Models for Strategic Reasoning [76.3114831562989]
マルチエージェント環境で戦略を動的に適応させるためには、LLM(Large Language Model)エージェントが必要である。
我々は,「K-Level Reasoning with Large Language Models (K-R)」という新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-02T16:07:05Z) - ALYMPICS: LLM Agents Meet Game Theory -- Exploring Strategic
Decision-Making with AI Agents [77.34720446306419]
Alympicsは、ゲーム理論の研究にLarge Language Model (LLM)エージェントを利用する、体系的なシミュレーションフレームワークである。
Alympicsは、複雑なゲーム理論の問題を研究するための汎用的なプラットフォームを作成する。
論文 参考訳(メタデータ) (2023-11-06T16:03:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。