論文の概要: WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament
- arxiv url: http://arxiv.org/abs/2608.04008v1
- Date: Tue, 04 Aug 2026 17:59:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.306673
- Title: WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament
- Title(参考訳): WorldCup Arena:ライブトーナメントにおけるフロンティアLLMの予見的,漏洩のない評価
- Abstract要約: 6台のフロンティアLSMが104試合全てに7市場予測カードを入力するよう求められた。
質問された時点では何の回答もなかったので、その評価は建設によるリークフリーである。
トーナメントが確立しているのは、6つのシステムが共有する行動のセットです。
- 参考スコア(独自算出の注目度): 1.4943316571343976
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Benchmarks that measure the forecasting ability of large language models are almost always retrospective: the event has happened, the answer is somewhere on the Web, and the evaluation must defend itself against memorisation. We report the opposite design. Over the 39 days of the 2026 FIFA World Cup, six frontier LLMs -- all with extended thinking and native server-side web search -- were asked before every kickoff, one match at a time, to fill in a seven-market prediction card for all 104 matches, plus 12 group winners and a pre-tournament outright pool; no answer existed when the question was asked, so the evaluation is leakage-free by construction rather than by filtering, and the frozen archive holds 4,494 scored predictions. What the tournament establishes is a set of behaviours the six systems share. On match outcome they average 63.9%, level with backing the bookmaker's favourite -- which is in fact what they usually do. They agree with one another far more often than they are right, so a majority vote adds nothing. They under-commit to draws and to goals, and crowd their scoreline picks onto a single prototypical result. Accuracy tracks how lopsided a fixture is rather than how much is known about it: it collapses in the closest ties, where the dossiers are richest, while questions about the tournament as a whole are answered well. On this task the current generation of frontier systems is not sharply differentiated: the standings hold up at the top and the bottom across the run and churn in the middle, and the margins stay narrow throughout. The briefing dossiers, fixtures and official results are released as a benchmark, together with the scoring code.
- Abstract(参考訳): 大規模な言語モデルの予測能力を測定するベンチマークは、ほとんど常に振り返りである。
私たちは反対のデザインを報告します。
2026 FIFAワールドカップ(FIFA)の39日間で、6つのフロンティアLDM(全て拡張された思考とサーバーサイドのウェブサーチを含む)が、104試合すべてで7市場予測カードを1回に1回ずつ満たす前に要求された。
トーナメントが確立しているのは、6つのシステムが共有する行動のセットです。
試合の成績は平均63.9%で、本屋の好みを裏付けるレベルだ。
彼らは正しいことよりもずっと頻繁に互いに同意するので、過半数の投票では何も加えない。
彼らは引き分けとゴールに過小評価し、スコアラインのピックを1つの原型的な結果に群がる。
ドシエが最も豊かである最も近い関係で崩壊し、トーナメント全体の質問がうまく答えられる。
このタスクでは、現在の世代のフロンティアシステムは明確に区別されず、スタンドはランを挟んで上と下を支え、中央を曲がり、マージンは至る所で狭く保つ。
ブリーフィングドシエ、フィクスチャ、公式な結果は、スコアリングコードとともにベンチマークとしてリリースされている。
関連論文リスト
- DraftFM: A FoundationModel for Day-Zero Drafting in Magic: The Gathering [0.0]
ドラフトFMは、ドラフトされたプールとドラフトの状態に条件付けされた現在のパックで利用可能なすべてのカードをスコアする。
29の展開から1億1900万件の人間のピックに装着されたネットワークは、全体の3つの拡張において、ホールドアウトのピックを予測している。
同じアーキテクチャでは、当時未発表だったThe Hobbitのカードランキングが作成され、その完全な暗号証明が封印された。
論文 参考訳(メタデータ) (2026-08-20T02:13:23Z) - FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents [16.48804532565337]
FM-Bench (Football Management Benchmark) は有界タスクを計測する。
エージェントは26のツールと約340から400の意思決定停止で20年間サッカークラブを運営している。
全てのライバル、取引業者、契約交渉、施設と若者への投資、ラインナップの設定、そしてそれを解雇できる委員会への回答と同じ予算でチームを起草する。
論文 参考訳(メタデータ) (2026-08-19T01:33:36Z) - AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament Prediction [0.0]
本報告では,2026年FIFAワールドカップ全体について,10名のアシスタントが1回の予報を行ったEmphAI World Cupベンチマークを報告する。
予測では、グループステージスコア、グループランキング、ノックアウトブラケット、最終配置、信頼性値、短い説明がカバーされた。
GPT-5.5は744点、GPT-5.5は717点、ジェミニは699点、Qwen 3.7は687点であった。
論文 参考訳(メタデータ) (2026-08-04T10:07:14Z) - WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting [10.941871398755403]
We present WorldCupArena, a benchmark for language model and Deep-Research agent。
結果とスコア、おそらくプレイヤーやイベント、統計、そして競技結果を予測する。
予測されたスコアが近いが正確ではない場合に、結果の精度、精度、スコアラインスコアを報告する。
論文 参考訳(メタデータ) (2026-07-20T15:52:48Z) - FIFA World Cup 2026 as a Contamination-Free Benchmark for LLM Forecasting Agents: Four Models, a Bookmaker, and 104 Matches [2.8722431362974077]
大規模言語モデル(LLM)を評価するためのベンチマークとデータセットであるWC2026-Agentsを紹介する。
2026 FIFAワールドカップの104試合ごとに、4つのフロンティアモデルが同一のサーチ・アクト・リフレクト・ループを実行した。
4人のエージェントを、同じ情報環境から引き出された5番目の競合相手と組み合わせます。
論文 参考訳(メタデータ) (2026-07-20T10:00:11Z) - Training-Free Off-Screen Player Imputation for Broadcast-Based Spatial Football Analytics [0.9185901163605424]
スポーツフットボールのメトリクスは、22人の選手のポジションにアクセスできることを前提としている。
メインカメラは10~16台しか表示できない。
得られた歪みを再現可能なオープンなベンチマークで定量化する。
論文 参考訳(メタデータ) (2026-07-13T13:33:45Z) - Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short [51.667769734342635]
検証可能な報酬付き強化学習(RLVR)は,大規模言語モデルの推論能力向上のための主要なパラダイムとなっている。
本研究では,非多変量報酬群を判定システムにルーティングする適応学習フレームワークであるReasoning Arenaを提案する。
我々は、Reasoning Arenaが、競争数学やコーディングベンチマークにおいて、RLVRベースラインを平均で7.6%上回っていることを示す。
論文 参考訳(メタデータ) (2026-06-08T11:57:17Z) - OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs [49.82435858489898]
OVOS-Benchは、人間中心の空間知能をストリーミングするための完全な注釈付きベンチマークである。
348のソースビデオに関する1,680の質問で構成されている。
それぞれの質問はクエリとエビデンスインターバルを持ち、評価において、モデルはクエリの前のプレフィックスのみを表示する。
論文 参考訳(メタデータ) (2026-06-02T16:51:32Z) - MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs [54.81359054218573]
大規模言語モデル(LLM)のためのマルチゲームアリーナと評価プラットフォームであるMindgamesを紹介する。
Mindgamesは、統合されたインタラクションインターフェース、TrueSkillベースの評価、および4つのゲーム環境にわたる完全な軌跡ログを提供する。
我々は,決定論的オフライントーナメントプロトコルMG-Refとともに,ターンレベルの観察,アクション,報酬を含む29,571個のマルチエージェントゲームを分析した。
論文 参考訳(メタデータ) (2026-05-28T07:33:47Z) - OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation [53.88666485159289]
OpenDeepThinkは、集団ベースのテスト時間計算フレームワークで、ペアワイズBradley-Terryの比較によって選択する。
OpenDeepThinkはGemini 3.1 ProのCodeforces Eloを8回のLCMコールラウンドで+405ポイント引き上げる。
CF-73は、国際グランドマスターアノテーションによる73の専門家評価コードフォース問題と、公式判決に対する99%の地域評価合意のキュレートされたセットである。
論文 参考訳(メタデータ) (2026-05-14T17:57:40Z) - Results and Retrospective Analysis of the CODS 2025 AssetOpsBench Challenge [3.5112866130906926]
我々は、産業用マルチエージェントオーケストレーションに関するCodabenchコンペティションであるCODS 2025アセットオプシブチャレンジを再考する。
最終ランクシート,300サーバログ,149チーム登録,ベストサブミッションエクスポート,オーガナイザ勝者レポート,アセットオプシブシステムペーパー,検証済みのプランニング・トラックソースツリーを組み合わせる。
公開スコアとプライベートスコアは、計画では適度に相関するが、実行では否定的に相関する。
論文 参考訳(メタデータ) (2026-05-08T22:00:58Z) - CodeClash: Benchmarking Goal-Oriented Software Engineering [63.65464283837602]
6つのアリーナで8つのLMを評価するために、1680のトーナメント(合計25,200ラウンド)を実行しました。
結果は,モデルが多様な開発スタイルを示す一方で,戦略的推論の基本的制約を共有していることを明らかにする。
私たちはCodeClashをオープンソースにして、自律的でゴール指向のコード開発の研究を進めています。
論文 参考訳(メタデータ) (2025-11-02T07:42:51Z) - The Leaderboard Illusion [61.27964089648608]
アリーナは最も有能なAIシステムランキングのリーダーボードとして登場した。
我々は,ゆがんだ競技場に生じた体系的な問題を同定する。
論文 参考訳(メタデータ) (2025-04-29T15:48:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。