論文の概要: DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat
- arxiv url: http://arxiv.org/abs/2607.29577v1
- Date: Fri, 31 Jul 2026 16:03:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.791724
- Title: DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat
- Title(参考訳): DungeonBench: Dungeons & Dragons Combatにおけるルール・リッチ戦術推論のベンチマーク
- Abstract要約: ダンジョンズ&ドラゴンズの戦いにおける戦術的推論のベンチマークであるダンジョンベンチを紹介する。
それぞれのステップで、DungeonBenchは完全な戦術的な観察、保留中の決定、および実行可能なオプションのインデックス付きリストを公開する。
同じエンジン生成の意思決定ストリームは、コントローラ、言語モデルポリシー、学習されたオプションランク付け、マスクされたアクション強化学習エージェントをサポートする。
- 参考スコア(独自算出の注目度): 0.5352699766206808
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Games and simulators make valuable benchmarks by turning decisions into measurable outcomes, but many current suites under-test rules-rich tactical reasoning: the ability to choose well when geometry, timing, resources, objectives, and rule interactions all matter at once. We introduce DungeonBench, a benchmark for tactical reasoning in Dungeons & Dragons combat, built to cover the vast majority of combat-relevant 2014 System Reference Document content whose effects can be resolved by the simulator while retaining mechanics that simplified combat simulators often abstract away. At each step, DungeonBench exposes a complete tactical observation, a pending decision, and an indexed list of executable options spanning movement, attacks, spells, reactions, objectives, preparation, and scarce resources. The task is to value legal choices whose consequences depend on action economy, creature traits, battlefield geometry, timing windows, and future encounters. DungeonBench has two tracks: Encounter, which evaluates local tactical play in single fights, and Day, which links encounters through persistent hit points, spell slots, consumables, preparation, and short-rest timing, forcing policies to trade off immediate tactical advantage against future survivability. The same engine-generated decision stream supports heuristic controllers, language-model policies, learned option rankers, and masked-action reinforcement-learning agents. We evaluate frontier language-model policies on this shared decision stream. Results show that full tactical observations do not saturate the benchmark: frontier policies often win direct encounters, but linked encounter days expose failures in resource budgeting, rest timing, and rule-aware tactical discipline.
- Abstract(参考訳): ゲームやシミュレーターは、決定を測定可能な結果に変換することで、貴重なベンチマークを行うが、現在の多くのスイートは、ルールに富んだ戦術的推論(幾何学、タイミング、リソース、目的、ルールの相互作用がすべて同時に重要であるときに、適切に選択できる能力)をテストしている。
ダンジョンズ&ドラゴンズ戦闘における戦術的推論のベンチマークであるDungeonBenchを紹介し、戦闘関連 2014 System Reference Documentコンテンツの大部分をカバーするために構築されている。
それぞれのステップで、DungeonBenchは完全な戦術的な観察、保留中の決定、そして動き、攻撃、呪文、反応、目的、準備、不足するリソースにまたがる実行可能な選択肢のインデックスリストを公開する。
この課題は、アクションエコノミー、生物の特徴、戦場の幾何学、タイミングウィンドウ、将来の遭遇に依存する法的選択を評価することである。
ダンジョンベンチには2つのトラックがある: 単一の戦闘で局所的な戦術的なプレーを評価するエンカウンターと、永続的なヒットポイント、スペルスロット、消費物、準備、短命のタイミングを通じて遭遇をリンクするデイ。
同じエンジン生成による意思決定ストリームは、ヒューリスティックコントローラ、言語モデルポリシー、学習オプションランク付け、マスクアクション強化学習エージェントをサポートする。
この共有決定ストリーム上で、フロンティア言語モデルポリシーを評価する。
フェデラーポリシーは直接の出会いに勝利することが多いが、関連する遭遇日は、リソース予算の失敗、休息のタイミング、ルールを意識した戦術の規律を明らかにする。
関連論文リスト
- Chess on Ice: Curling Tactical Decision-Making via Backward Induction and Deep Reinforcement Learning [10.932188857276605]
カーリングにおける選択肢を定量的に評価・比較できる強化学習フレームワークを提案する。
我々は、ゲームにおける有限水平構造を利用するために、Deep Deterministic Policy Gradient actor-criticアルゴリズムを用いる。
実効的なカーリング戦略は人手による注釈付きデータなしで完全に自己管理的に得ることができることを示す。
論文 参考訳(メタデータ) (2026-08-03T15:23:42Z) - MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs [54.81359054218573]
大規模言語モデル(LLM)のためのマルチゲームアリーナと評価プラットフォームであるMindgamesを紹介する。
Mindgamesは、統合されたインタラクションインターフェース、TrueSkillベースの評価、および4つのゲーム環境にわたる完全な軌跡ログを提供する。
我々は,決定論的オフライントーナメントプロトコルMG-Refとともに,ターンレベルの観察,アクション,報酬を含む29,571個のマルチエージェントゲームを分析した。
論文 参考訳(メタデータ) (2026-05-28T07:33:47Z) - GenTac: Generative Modeling and Forecasting of Soccer Tactics [66.35532694378146]
GenTacはサッカーの戦術を、連続したマルチプレイヤーの軌跡と個別の意味的な出来事のプロセスとして概念化している。
対戦行動、特定のチームやリーグプレースタイル、戦略的目的など、リッチなコンテキスト条件付けをサポートする。
バスケットボール、アメリカンフットボール、アイスホッケーなど、他のダイナミックチームスポーツへの一般化をうまく訓練することができる。
論文 参考訳(メタデータ) (2026-04-13T17:53:49Z) - GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents [76.60994803070436]
GameWorldは、ブラウザ環境におけるマルチモーダル大言語モデル(MLLM)ゲームエージェントの評価のためのベンチマークである。
2つのゲームエージェントインタフェースが研究され、 (i) キーボードとマウスのコントロールを直接出力するコンピュータ利用エージェント、 (ii) セマンティックアクション空間で作用する汎用マルチモーダルエージェントが研究されている。
18組のモデルとインタフェースのペアによる結果は、最高のパフォーマンスエージェントでさえ、ビデオゲームで人間の能力を達成するには程遠いことを示唆している。
論文 参考訳(メタデータ) (2026-04-08T17:49:03Z) - Large Language Models as Pokémon Battle Agents: Strategic Play and Content Generation [4.782714372521615]
ポケモンの戦いは、タイプマッチ、統計的なトレードオフ、リスクアセスメントに関する推論を要求する。
本研究は,Large Language Models (LLM) が有能な戦闘エージェントとして機能するかどうかを検討する。
我々は,LLMが事前にプログラムされた論理ではなく,戦闘状態に基づいて行動を選択するターンベースのポケモンバトルシステムを開発した。
論文 参考訳(メタデータ) (2025-12-19T07:46:29Z) - Monopoly Deal: A Benchmark Environment for Bounded One-Sided Response Games [0.0]
カードゲームは、不確実性の下でシーケンシャルな意思決定を研究するために広く使われている。
有界片側対応ゲーム(BORG)を特徴とするゲームを指す。
我々は、この動的を隔離するベンチマーク環境として、Monopoly Dealの修正版を紹介します。
論文 参考訳(メタデータ) (2025-10-29T01:38:19Z) - Beyond Survival: Evaluating LLMs in Social Deduction Games with Human-Aligned Strategies [54.08697738311866]
Werewolfのようなソーシャル推論ゲームは、言語、推論、戦略を組み合わせている。
我々は,100時間以上のビデオ,32.4M発声トークン,15の規則変種を含む高品質で人間認証されたWerewolfデータセットをキュレートした。
本稿では,勝利派戦略を2段階の真理として活用する新たな戦略調整評価法を提案する。
論文 参考訳(メタデータ) (2025-10-13T13:33:30Z) - LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition [104.81487689011341]
本稿では,Mortal Kombat IIにおける大規模マルチモーダルモデルを評価する新しいフレームワークであるLM Fight Arenaを紹介する。
静的評価とは異なり、LM Fight Arenaは完全に自動化され、再現可能で、LMMの戦略的推論能力の客観的評価を提供する。
論文 参考訳(メタデータ) (2025-10-10T02:19:21Z) - NTRL: Encounter Generation via Reinforcement Learning for Dynamic Difficulty Adjustment in Dungeons and Dragons [8.856568375969848]
ダンジョンズ&ドラゴンズ(D&D)における動的困難調整(DDA)を自動化する新しいアプローチ
NTRLは、問題を文脈的盗聴としてフレーミングすることで、リアルタイムのパーティーメンバー属性に基づいて遭遇を生成する。
古典的DMと比較して、NTRLは遭遇を反復的に最適化して戦闘長寿(+200%)を延長し、党員へのダメージを増大させ、試合後のヒットポイントを減少させ、プレイヤーの死亡数を増大させる。
論文 参考訳(メタデータ) (2025-06-24T11:34:01Z) - Efficient exploration of zero-sum stochastic games [83.28949556413717]
ゲームプレイを通じて,ゲームの記述を明示せず,託宣のみにアクセス可能な,重要で一般的なゲーム解決環境について検討する。
限られたデュレーション学習フェーズにおいて、アルゴリズムは両方のプレイヤーのアクションを制御し、ゲームを学習し、それをうまくプレイする方法を学習する。
私たちのモチベーションは、クエリされた戦略プロファイルの支払いを評価するのにコストがかかる状況において、利用可能性の低い戦略を迅速に学習することにあります。
論文 参考訳(メタデータ) (2020-02-24T20:30:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。