論文の概要: FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents
- arxiv url: http://arxiv.org/abs/2608.18423v2
- Date: Thu, 20 Aug 2026 20:49:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:31.847877
- Title: FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents
- Title(参考訳): FM-Bench: 競合エージェントによる長期管理のためのベンチマーク
- Abstract要約: FM-Bench (Football Management Benchmark) は有界タスクを計測する。
エージェントは26のツールと約340から400の意思決定停止で20年間サッカークラブを運営している。
全てのライバル、取引業者、契約交渉、施設と若者への投資、ラインナップの設定、そしてそれを解雇できる委員会への回答と同じ予算でチームを起草する。
- 参考スコア(独自算出の注目度): 16.48804532565337
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language model agents now execute bounded tasks reliably. Whether they can sustain effective decision-making over long horizons, where actions have cumulative consequences and the environment responds to their choices, remains largely unmeasured. FM-Bench (Football Management Benchmark) measures this. An LLM agent runs a football club for 20 in-game years through 26 tools and roughly 340 to 400 decision stops. It drafts a squad on the same budget as every rival, trades players, negotiates contracts, invests in facilities and youth, sets lineups, and answers to a board that can fire it, while a deterministic engine accumulates every year into one final score with no LLM judge or human rater. The solo track plays each of 15 frontier models against a frozen scripted world, and the Arena places the same models plus a scripted anchor in one shared 20-year world; to our knowledge, the first head-to-head evaluation at this scale. We measure six behavioral capabilities behind the score. Across three seeds, all 15 models complete every horizon while the blind scripted baselines die out in most of theirs, and claude-fable-5 tops the solo board on mean score and the Arena, where the title nonetheless rotates among ten models. Neither scale, price, nor vendor predicts the order; the order settles only late in the horizon, and the best first-play human lands only at the bottom of the model board. What separates the models is managerial behavior rather than computation. Higher-scoring models reduce slow-payoff investment near the end, keep cash invested rather than idle, and open renewals well before the deadline, while token spend predicts nothing. No model learns the market's hidden prices from hundreds of rejected bids, and self-managed memory fails in two opposite modes: an archive that only grows or a plan rewritten every season. Code is available at https://github.com/Analogy-AI/fm-bench.
- Abstract(参考訳): 言語モデルエージェントが境界付きタスクを確実に実行できるようになった。
行動が累積的な結果をもたらし、環境が彼らの選択に反応する長い地平線上で効果的な意思決定を維持できるかどうかは、いまだにほとんど測定されていない。
FM-Bench(Football Management Benchmark)はこれを測定する。
LLMのエージェントが26のツールと約340から400の意思決定停止で20年間サッカークラブを運営している。
全てのライバル、トレーディングプレーヤー、契約交渉、施設と若者への投資、ラインアップ、そしてそれを解雇できる委員会への回答、そして決定論的エンジンは毎年1つの最終スコアにまとめられ、LLMの審査員も人間もいない。
ソロトラックは15のフロンティアモデルのそれぞれを凍結されたスクリプト付き世界に対して演奏し、アリーナは同じモデルとスクリプト付きアンカーを1つの共有20年の世界に配置します。
スコアの背後にある6つの行動能力を測定します。
3つの種にまたがって全15モデルが水平線を完了し、盲目の台本が枯渇し、クロード・ファブル5が平均スコアとアリーナでソロボードを上回り、それでもタイトルは10モデルの間で回転する。
スケールも価格もベンダーも、注文を予測していない。注文は地平線上では遅く、モデルボードの下部でのみ、最高のファーストプレイの人類の土地に落ち着く。
モデルを切り離すのは、計算よりも管理的な振る舞いです。
より高いスコーリングモデルでは、終盤に近い低賃金の投資を減らし、アイドルではなく現金を投資し、期限よりずっと早くリニューアルし、トークンの支出は何も予測しない。
数百件の入札から市場の隠れた価格を学習するモデルはなく、自己管理型メモリは2つの逆のモードで失敗する。
コードはhttps://github.com/Analogy-AI/fm-bench.comで入手できる。
関連論文リスト
- FIFA World Cup 2026 as a Contamination-Free Benchmark for LLM Forecasting Agents: Four Models, a Bookmaker, and 104 Matches [2.8722431362974077]
大規模言語モデル(LLM)を評価するためのベンチマークとデータセットであるWC2026-Agentsを紹介する。
2026 FIFAワールドカップの104試合ごとに、4つのフロンティアモデルが同一のサーチ・アクト・リフレクト・ループを実行した。
4人のエージェントを、同じ情報環境から引き出された5番目の競合相手と組み合わせます。
論文 参考訳(メタデータ) (2026-07-20T10:00:11Z) - SportD: Can VLMs Physically Strategize? [3.6356011518439684]
SportDは、2022年のFIFAワールドカップにおける478の判定結果からなるベンチマークである。
それぞれのモデル選択は、攻撃チームの得点率を最も高めるアクションを推定する所有価値モデルに対して評価される。
3つのフロンティアVLMで、最多は31.4%のイベントで、プロの選手は38.9%だった。
論文 参考訳(メタデータ) (2026-07-16T06:30:26Z) - When Agents Lie: Premeditation, Persistence, and Exploitation in Repeated Games [69.060029640261]
10ラウンドにわたる同質群と異質群の6つのゲームにおけるフロンティアモデルの評価を行った。
異なるモデルは発表を無矛盾に解釈し、いくつかはバインディングのコミットメントとして、もうひとつは安価なトークとして解釈する。
論文 参考訳(メタデータ) (2026-07-06T14:17:59Z) - AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents [34.450981549319266]
長期 LLM エージェントの記憶は、将来の決定が何を見るかに関する契約である。
すべての決定は、型付き検索によって組み立てられた新鮮なユーザメッセージからなされます。
Slay the Spire 2はクローズドルールのデッキビルディングゲームだ。
論文 参考訳(メタデータ) (2026-07-02T14:44:32Z) - MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs [54.81359054218573]
大規模言語モデル(LLM)のためのマルチゲームアリーナと評価プラットフォームであるMindgamesを紹介する。
Mindgamesは、統合されたインタラクションインターフェース、TrueSkillベースの評価、および4つのゲーム環境にわたる完全な軌跡ログを提供する。
我々は,決定論的オフライントーナメントプロトコルMG-Refとともに,ターンレベルの観察,アクション,報酬を含む29,571個のマルチエージェントゲームを分析した。
論文 参考訳(メタデータ) (2026-05-28T07:33:47Z) - KellyBench: A Benchmark for Long-Horizon Sequential Decision Making [0.6180808157777046]
スポーツベッティング市場におけるシーケンシャルな意思決定評価環境であるKellyBenchを紹介する。
エージェントは2023-24年のイングランド・プレミアリーグシーズンの連続シミュレーションに置かれる。
評価されたすべてのフロンティアモデルは、シーズン平均で5つの種で損失を被ることがわかった。
論文 参考訳(メタデータ) (2026-04-30T13:47:22Z) - LUDOBENCH: Evaluating LLM Behavioural Decision-Making Through Spot-Based Board Game Scenarios in Ludo [1.5718921092089344]
LudoBenchは、マルチエージェントボードゲームであるLudoにおける戦略的推論を評価するためのベンチマークである。
LudoBenchは、12の行動的に異なる決定カテゴリにわたる480の手作りのスポットシナリオで構成されている。
全てのモデルはゲーム理論のベースラインと一致しており、その40-46%しか使われていない。
論文 参考訳(メタデータ) (2026-04-07T10:34:13Z) - LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition [104.81487689011341]
本稿では,Mortal Kombat IIにおける大規模マルチモーダルモデルを評価する新しいフレームワークであるLM Fight Arenaを紹介する。
静的評価とは異なり、LM Fight Arenaは完全に自動化され、再現可能で、LMMの戦略的推論能力の客観的評価を提供する。
論文 参考訳(メタデータ) (2025-10-10T02:19:21Z) - Provably Efficient Generalized Lagrangian Policy Optimization for Safe
Multi-Agent Reinforcement Learning [105.7510838453122]
制約付きマルコフゲームを用いたオンライン安全なマルチエージェント強化学習について検討する。
我々は,このラグランジアン問題を解くための高信頼強化学習アルゴリズムを開発した。
提案アルゴリズムは,オンラインミラー降下によるミニマックス決定主元変数と,投影勾配ステップによる双対変数を更新する。
論文 参考訳(メタデータ) (2023-05-31T22:09:24Z) - ApproxED: Approximate exploitability descent via learned best responses [61.17702187957206]
連続的なアクションセットを持つゲームの近似的ナッシュ均衡を求める問題について検討する。
本稿では,戦略プロファイルに対するエクスプロイラビリティの近似を最小化する2つの新しい手法を提案する。
論文 参考訳(メタデータ) (2023-01-20T23:55:30Z) - Mastering the Game of Stratego with Model-Free Multiagent Reinforcement
Learning [86.37438204416435]
Strategoは、人工知能(AI)がまだマスターしていない数少ない象徴的なボードゲームの一つだ。
ストラテゴにおける決定は、行動と結果の間に明らかな結びつきがなく、多数の個別の行動に対してなされる。
DeepNashは、ストラテゴの既存の最先端AIメソッドを破り、Gravonゲームプラットフォームで年間(2022年)と最高3位を達成した。
論文 参考訳(メタデータ) (2022-06-30T15:53:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。