論文の概要: CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI
- arxiv url: http://arxiv.org/abs/2609.02459v1
- Date: Wed, 02 Sep 2026 11:31:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.244103
- Title: CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI
- Title(参考訳): CivBench: 文明におけるツール媒介エージェントの長期ベンチマークVI
- Abstract要約: CivBenchは、ツールを介する環境で言語モデルエージェントを評価するためのオープンソースのベンチマークである。
単一のエピソードは300回以上のターンにまたがり、大規模なアクション空間上で数千のツールコールを発生させる。
CivBenchを使って、23の許容実行で4つのモデルファミリにまたがるエージェントの動作を特徴付ける。
- 参考スコア(独自算出の注目度): 15.345634962043858
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present CivBench, an open-source benchmark for evaluating language model agents in long-horizon, tool-mediated environments through the Model Context Protocol (MCP). A single episode spans 300+ turns and produces thousands of tool calls over a large action space, requiring sustained planning, state monitoring, and execution under partial observability. The environment exposes 76 MCP tools and a narration layer that converts visual game state into structured text. We use CivBench to characterise agent behaviour across four model families in 23 admissible runs. The sample is a pilot, not a model ranking: aggregate outcomes do not reliably discriminate models at this scale. Instead, we introduce two interface-level metrics that the environment makes measurable: Proactive Monitoring Rate (PMR), capturing whether agents actively query latent strategic state, and RAG@10, capturing whether commitments stated in structured planning reflections are executed within ten subsequent turns. Across runs we observe two consistent patterns under a shared playbook protocol. Agents under-monitor strategically relevant state that is available but requires explicit querying: despite playbook guidance to query victory progress every 20 turns, agents do so only every 30 to 75 turns, and in 7 of 20 detectable defeats they failed to query within the 20 turn warning window before game end. Agents also frequently fail to execute near-term commitments stated in their own planning reflections (RAG@10 between 48.2% and 65.8% across models). Both patterns arise despite tool access and explicit guidance, and we interpret them as deviations under instruction rather than absences of capability. We release the environment, scenarios, logs, metrics, and analysis pipeline at https://github.com/lmwilki/civ6-mcp
- Abstract(参考訳): CivBenchは,言語モデルエージェントを評価するためのオープンソースのベンチマークであり,MCP(Model Context Protocol)を通じて,長期のツールを介する環境下での言語モデルエージェントの評価を行う。
単一のエピソードは300回以上のターンにまたがり、大規模なアクション空間上で数千のツールコールを生成し、持続的な計画、状態監視、部分的な可観測性の下での実行を必要とする。
環境は76のMPPツールと、視覚ゲーム状態を構造化されたテキストに変換するナレーション層を公開する。
CivBenchを使って、23の許容実行で4つのモデルファミリにまたがるエージェントの動作を特徴付ける。
サンプルはパイロットであり、モデルランキングではなく、集計結果は、このスケールでモデルを確実に識別するものではない。
プロアクティブモニタリングレート(PMR)は、エージェントが潜在戦略状態に積極的に問い合わせるかどうかを計測し、RAG@10は、構造化された計画リフレクションで記述されたコミットメントが10回以内に実行されるかどうかを計測する。
実行中に、共有プレイブックプロトコルの下で2つの一貫したパターンを観察します。
エージェントは30ターンから75ターンごとにのみ実行し、20回中7回はゲーム終了前の20ターンの警告ウィンドウ内でクエリできなかった。
エージェントは自身の計画リフレクション(RAG@10:48.2%から65.8%)で述べた短期的なコミットメントの実行にも失敗する。
ツールアクセスと明示的なガイダンスにもかかわらず、どちらのパターンも現れます。
環境、シナリオ、ログ、メトリクス、分析パイプラインをhttps://github.com/lmwilki/civ6-mcpでリリースしています。
関連論文リスト
- BekchiAI: Measuring, Observing, and Controlling LLM Agents in One Click [0.0]
本稿では,エージェントスキル測定のためのベンチマークであるBekchiAIと,ライブエージェントの監視と制御のためのプラットフォームについて紹介する。
BekchiAI-Platformは、デプロイされたエージェントのための補完的なWebベースの可観測性とコントロールレイヤであり、完全なトークンとテレメトリとリモート実行終了を提供する。
論文 参考訳(メタデータ) (2026-08-27T09:30:08Z) - AgentWeave: Routing Before Reasoning for Efficient Function Calling in Tool-Rich Language Models [0.0]
我々は,有界モデル可視アクション空間を構成する決定論的事前推論ルーティング層であるAgentWeaveを紹介する。
オールツールの露出とは対照的に、AgentWeaveは70.18%のツールを減らし、61.70%の入力トークンを減らし、平均的なローカルモデルのレイテンシを50.95%低下させる。
論文 参考訳(メタデータ) (2026-08-24T10:38:08Z) - MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents [50.27505102982638]
本稿では,ツールコールエージェントのベンチマークおよび評価フレームワークであるMM-ToolSandBoxを紹介する。
このフレームワークは16のアプリケーションドメインで500以上のツールにまたがるステートフルな実行環境を提供する。
マルチイメージのマルチターンタスクをサポートしており、エージェントは実行可能ツールコールに徐々に視覚的な入力を入力しなければならない。
論文 参考訳(メタデータ) (2026-07-13T17:13:09Z) - ACCORD: Action-Conditioned Contextual Grounding for Language Agents [69.73525608707764]
ACCORD(Action-Conditioned Contextual Grounding)は、適応的なグラウンドのためのエージェントフレームワークである。
現状のエージェントは、しばしばそうすることができないことを示す。それらは、観察された特定の情報よりもむしろ仮定から行動し、収集した可能性のある情報を見落とし、既に返された証拠を組み込むことに失敗する。
論文 参考訳(メタデータ) (2026-06-15T09:05:55Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation [11.272830796781925]
8つのモデルバックエンドから60個のSWEベンチ検証タスクの2,614個のOpenHandsトラジェクトリを評価した。
このサブセットで通過する軌道の中で、10.7%はラッキーパスと呼ばれる振る舞いを示す。
本稿では,SWEエージェント軌道のプロセスレベル評価フレームワークであるAgentLensを紹介する。
論文 参考訳(メタデータ) (2026-05-13T03:00:57Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - ESAA: Event Sourcing for Autonomous Agents in LLM-Based Software Engineering [0.0]
本稿では,ESAA(Event Sourcing for Autonomous Agents)アーキテクチャについて述べる。
アーキテクチャは、イベントソーシングパターンにインスパイアされた、認知意図とプロジェクトの状態突然変異を分離する。
2つのケーススタディは、アーキテクチャを検証し、単一エージェントのシナリオを超えたアーキテクチャのスケーラビリティの実証的な証拠を提供する。
論文 参考訳(メタデータ) (2026-02-26T16:45:59Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。