論文の概要: Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning
- arxiv url: http://arxiv.org/abs/2607.22732v1
- Date: Wed, 22 Jul 2026 12:10:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.847105
- Title: Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning
- Title(参考訳): LLMゲームエージェントにおける空間推論:因果関係とマルチステッププランニングの影響
- Authors: Mohit Jiwatode, Ronja Fuchs, Robin Schmöcker, Bodo Rosenhahn, Alexander Dockhorn,
- Abstract要約: さまざまなモデルスケール、推論モード、計画的地平線をまたいだ実験を行います。
空間ナビゲーションを分離する5つの難易度を持つ3つのカスタムゲームからなる集中型GVGAIベンチマークを提案する。
提案手法により, より正確な位置の同定が可能であるが, 座標マッチングの全体的な性能は, より小さなモデルに限られていることがわかった。
- 参考スコア(独自算出の注目度): 56.67877550139192
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: LLM-based game agents often perform poorly on more complex tasks. This work examines whether these failures are linked to limited spatial reasoning and evaluates whether causal prompt augmentation and multi-step planning can improve win-rates while managing response latency. Using the open-source Qwen3 model family, we conduct experiments across varying model scales, reasoning modes, and planning horizons. We further introduce a focused GVGAI benchmark consisting of three custom games with five difficulty levels to isolate spatial navigation. The evaluation follows two paradigms: an initial ``positioning experiment'' to test an agent's ability to find its exact coordinates, and a study of game-play success. Our results show that while larger models with an enabled thinking mode identify their positions more accurately, overall performance in coordinate matching remains limited for smaller models. Win rates decrease as game levels and layout complexity increase, validating the benchmark's difficulty scaling. Integrating causal context into the prompts tends to improve the agents' success rates, particularly for bigger models. While enabling thinking mode and longer planning horizons significantly improve performance, multi-step planning further reduces mean per-step response times, offering a practical trade-off between reasoning depth and execution speed.
- Abstract(参考訳): LLMベースのゲームエージェントは、より複雑なタスクではよく機能しない。
本研究は,これらの障害が限られた空間的推論に結びついているかどうかを検証し,応答待ち時間を管理しながら因果的プロンプト増強と多段階計画が勝利率を改善することができるかどうかを評価する。
オープンソースのQwen3モデルファミリを使用して、さまざまなモデルスケール、推論モード、計画的地平線をまたいだ実験を行います。
さらに,空間ナビゲーションを分離する5つの難易度を持つ3つのカスタムゲームからなる集中型GVGAIベンチマークを導入する。
評価は、エージェントの正確な座標を見つける能力をテストする最初の「配置実験」と、ゲームプレイの成功の研究の2つのパラダイムに従う。
提案手法では, より正確な位置の同定が可能であるが, 座標マッチングの全体的な性能は, より小さなモデルに限られている。
ゲームレベルとレイアウトの複雑さが増すにつれて、勝利率は低下し、ベンチマークのスケーリングの困難さが検証される。
因果文脈をプロンプトに組み込むことはエージェントの成功率、特に大きなモデルを改善する傾向にある。
思考モードを有効にし、計画の長期化により性能が大幅に向上する一方で、多段階計画では、平均ステップ毎のレスポンス時間を減らし、推論深度と実行速度の間に実用的なトレードオフを提供する。
関連論文リスト
- WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning [6.545488752368577]
本稿では,Causal Event Graph を備えた低レベルコントローラを備えた長時間水平エージェントフレームワーク WISE を提案する。
WISEは、観察とタスク関連性をリンクする明確な因果構造でエピソード記憶を増強する。
実験により、WISEは長時間のスパースタスクにおけるタスクの成功と効率を大幅に改善することが示された。
論文 参考訳(メタデータ) (2026-06-11T03:35:02Z) - MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs [54.81359054218573]
大規模言語モデル(LLM)のためのマルチゲームアリーナと評価プラットフォームであるMindgamesを紹介する。
Mindgamesは、統合されたインタラクションインターフェース、TrueSkillベースの評価、および4つのゲーム環境にわたる完全な軌跡ログを提供する。
我々は,決定論的オフライントーナメントプロトコルMG-Refとともに,ターンレベルの観察,アクション,報酬を含む29,571個のマルチエージェントゲームを分析した。
論文 参考訳(メタデータ) (2026-05-28T07:33:47Z) - AgentCollab: A Self-Evaluation-Driven Collaboration Paradigm for Efficient LLM Agents [37.232397795331444]
我々は,エージェント実行中に異なる推論能力を持つモデルを動的にコーディネートする,自己駆動型協調推論フレームワークであるAgenCollabを提案する。
外部ルーティングモジュールに頼る代わりに、このフレームワークはエージェント自身の自己反射信号を使用して、現在の推論軌道が有意義な進歩を遂げているかどうかを判断する。
論文 参考訳(メタデータ) (2026-03-27T03:07:34Z) - LLM CHESS: Benchmarking Reasoning and Instruction-Following in LLMs through Chess [30.797553771114746]
LLM CHESSは,大規模言語モデル(LLM)における推論と命令追従能力の一般化を調査するための評価フレームワークである。
我々は,移動品質,移動法則,幻覚行動,ゲーム持続時間などの行動指標を用いて,ランダムな相手と対戦することで,50以上のオープンかつクローズドなソースモデルをランク付けする。
トップ推論モデルのサブセットとして,可変構成のスキルを持つチェスエンジンと対戦して,Elo推定を導出する。
論文 参考訳(メタデータ) (2025-12-01T18:51:08Z) - Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding [59.60915947702282]
検証可能な報酬(RLVR)による強化学習は,大規模言語モデル(LLM)の推論能力の向上に成功している。
既存のRLVR手法は、訓練データの困難さとモデルの能力のミスマッチにより、探索の非効率に悩まされることが多い。
本稿では,高効率領域に留まることの難易度を動的に調整する新しい監視支援RLVRフレームワークであるSEELEを提案する。
論文 参考訳(メタデータ) (2025-09-08T17:36:21Z) - MetaScale: Test-Time Scaling with Evolving Meta-Thoughts [51.35594569020857]
実験の結果、MetaScaleは標準推論アプローチよりも一貫して優れています。
METASCALEは、サンプリング予算を増やしてより効果的にスケールし、より構造化された専門家レベルのレスポンスを生成する。
論文 参考訳(メタデータ) (2025-03-17T17:59:54Z) - TMGBench: A Systematic Game Benchmark for Evaluating Strategic Reasoning Abilities of LLMs [45.12542636218608]
ゲームタイプの包括的カバレッジ,多様なシナリオ,フレキシブルなゲーム組織を特徴とするTMGBenchを提案する。
具体的には、ベンチマークで古典ゲームとして構築された2x2ゲームのロビンソン・ゴーフォーストポロジーによって要約された144種類のゲームタイプをすべて組み込む。
より強力なLSMに適応可能な持続可能な評価フレームワークを提供するため、上記のゲームを原子単位として扱う。
論文 参考訳(メタデータ) (2024-10-14T13:15:34Z) - Improving Long-Horizon Imitation Through Instruction Prediction [93.47416552953075]
本研究では、しばしば使われない補助的監督源である言語の使用について検討する。
近年のトランスフォーマーモデルの発展にインスパイアされたエージェントは,高レベルの抽象化で動作する時間拡張表現の学習を促す命令予測損失を持つエージェントを訓練する。
さらなる分析では、複雑な推論を必要とするタスクにおいて、命令モデリングが最も重要であり、単純な計画を必要とする環境において、より小さなゲインを提供する。
論文 参考訳(メタデータ) (2023-06-21T20:47:23Z) - Off-Beat Multi-Agent Reinforcement Learning [62.833358249873704]
オフビート動作が一般的環境におけるモデルフリーマルチエージェント強化学習(MARL)について検討した。
モデルレスMARLアルゴリズムのための新しいエピソードメモリLeGEMを提案する。
我々は,Stag-Hunter Game,Quarry Game,Afforestation Game,StarCraft IIマイクロマネジメントタスクなど,オフビートアクションを伴うさまざまなマルチエージェントシナリオ上でLeGEMを評価する。
論文 参考訳(メタデータ) (2022-05-27T02:21:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。