論文の概要: AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament Prediction
- arxiv url: http://arxiv.org/abs/2608.03416v1
- Date: Tue, 04 Aug 2026 10:07:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.122238
- Title: AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament Prediction
- Title(参考訳): AI World Cup 2026: エンドツーエンドのフットボールトーナメント予測のための大規模言語モデルのベンチマーク
- Authors: Jonaid Shianifar, Iias Faiud,
- Abstract要約: 本報告では,2026年FIFAワールドカップ全体について,10名のアシスタントが1回の予報を行ったEmphAI World Cupベンチマークを報告する。
予測では、グループステージスコア、グループランキング、ノックアウトブラケット、最終配置、信頼性値、短い説明がカバーされた。
GPT-5.5は744点、GPT-5.5は717点、ジェミニは699点、Qwen 3.7は687点であった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are now regularly asked to forecast real-world events, but comparisons are often difficult because models receive different information, use different tools, and are evaluated under different rules. This paper reports the completed \emph{AI World Cup} benchmark, in which ten LLM-based assistants made a single pre-tournament forecast of the entire 2026 FIFA World Cup. Every submission used the same tournament snapshot, prompt, JSON schema, and scoring procedure. The forecasts covered group-stage scores, group rankings, the knockout bracket, final placings, confidence values, and short explanations. After all 104 matches had been played, GPT-5.5 Thinking finished first with 744 points, followed by GPT-5.5 with 717, Gemini with 699, and Qwen 3.7 with 687. GPT-5.5 Thinking was also the only model to select Spain, which defeated Argentina 1--0 in the final, as champion. The final ranking was driven mainly by knockout performance: total score was strongly correlated with knockout points ($r=0.986$), but showed little relationship with group-stage match points ($r=0.055$), group-standing points ($r=-0.103$), or their combined pre-knockout score ($r=-0.054$). Match-level accuracy produced a different ordering. Claude Sonnet 4.6 correctly predicted the largest number of group-stage outcomes (63.89\%) but placed sixth overall. Average self-reported confidence was also unrelated to either outcome accuracy ($r=-0.060$) or total score ($r=-0.067$). The results suggest that forecasting a complete tournament tests something different from predicting matches one at a time, while also showing how strongly a bracket-based leaderboard can depend on scoring design. The benchmark materials, raw responses, and scoring code are released to support replication and future extensions.
- Abstract(参考訳): 大規模言語モデル(LLM)は、現在定期的に現実世界の事象を予測するよう求められているが、モデルが異なる情報を受け取り、異なるツールを使用し、異なるルールで評価されるため、比較が難しいことが多い。
本報告では,2026年のFIFAワールドカップ全体について,LLMをベースとした10人のアシスタントが1回の予報を行った,完了した 'emph{AI World Cup} ベンチマークを報告する。
各サブミッションは、同じトーナメントスナップショット、プロンプト、JSONスキーマ、スコアリング手順を使用していた。
予測では、グループステージスコア、グループランキング、ノックアウトブラケット、最終配置、信頼性値、短い説明がカバーされた。
104試合全てに出場した後、GPT-5.5シンキングは744点、GPT-5.5は717点、ジェミニは699点、キューン3.7は687点に終わった。
GPT-5.5 シンキングは、決勝でアルゼンチンを1-0で破ったスペインを選んだ唯一のモデルでもあった。
総合得点はノックアウトポイント(r=0.986$)と強く相関していたが、グループステージマッチポイント(r=0.055$)、グループスタンディングポイント(r=-0.103$)、またはそれらの組み合わせたプレノックアウトスコア(r=-0.054$)とはほとんど関係がなかった。
一致レベルの精度は、異なる順序付けを生み出した。
Claude Sonnet 4.6 はグループステージの結果の最大数 (63.89\%) を正確に予測したが、全体としては6位であった。
平均自己申告された自信は、結果の正確さ(r=-0.060$)と総得点(r=-0.067$)とも無関係であった。
その結果、完全なトーナメントの予測は、マッチを1度に予測するのとは異なるものをテストすると同時に、ブラケットベースのリーダーボードがどれだけスコアリング設計に依存するかを示すことが示唆された。
ベンチマーク資料、生のレスポンス、スコアングコードは、レプリケーションと将来の拡張をサポートするためにリリースされている。
関連論文リスト
- WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting [10.941871398755403]
We present WorldCupArena, a benchmark for language model and Deep-Research agent。
結果とスコア、おそらくプレイヤーやイベント、統計、そして競技結果を予測する。
予測されたスコアが近いが正確ではない場合に、結果の精度、精度、スコアラインスコアを報告する。
論文 参考訳(メタデータ) (2026-07-20T15:52:48Z) - FIFA World Cup 2026 as a Contamination-Free Benchmark for LLM Forecasting Agents: Four Models, a Bookmaker, and 104 Matches [2.8722431362974077]
大規模言語モデル(LLM)を評価するためのベンチマークとデータセットであるWC2026-Agentsを紹介する。
2026 FIFAワールドカップの104試合ごとに、4つのフロンティアモデルが同一のサーチ・アクト・リフレクト・ループを実行した。
4人のエージェントを、同じ情報環境から引き出された5番目の競合相手と組み合わせます。
論文 参考訳(メタデータ) (2026-07-20T10:00:11Z) - Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short [51.667769734342635]
検証可能な報酬付き強化学習(RLVR)は,大規模言語モデルの推論能力向上のための主要なパラダイムとなっている。
本研究では,非多変量報酬群を判定システムにルーティングする適応学習フレームワークであるReasoning Arenaを提案する。
我々は、Reasoning Arenaが、競争数学やコーディングベンチマークにおいて、RLVRベースラインを平均で7.6%上回っていることを示す。
論文 参考訳(メタデータ) (2026-06-08T11:57:17Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - NCAA Bracket Prediction Using Machine Learning and Combinatorial Fusion Analysis [1.1493781265003744]
ランキングを利用して、 Combinatorial Fusion Analysisを使用して、2024データセットのチームランキングを生成します。
我々の結果は74.60%の精度で、人気の高い10のランキングシステムの中で最高のものよりも高い。
論文 参考訳(メタデータ) (2026-03-11T16:01:01Z) - Consistency Checks for Language Model Forecasters [54.62507816753479]
予測器の性能を,論理的に異なる質問に対する予測の整合性の観点から測定する。
我々は,一連の基本質問を生成し,これらの質問から整合性チェックをインスタンス化し,予測者の予測を導き,予測の整合性を測定する自動評価システムを構築した。
論文 参考訳(メタデータ) (2024-12-24T16:51:35Z) - Momentum Capture and Prediction System Based on Wimbledon Open2023 Tournament Data [4.733690536516437]
本研究では,エントロピー重み法(EWM)とグレイ関係解析(GRA)を相乗化して,運動量の影響を定量化する評価モデルを提案する。
モデルが特定の要因が一致力学に与える影響を識別する能力は、両方向の距離が点の間を走るときに、その長所を示す。
論文 参考訳(メタデータ) (2024-08-02T19:14:49Z) - Unifying Language Learning Paradigms [96.35981503087567]
データセットやセットアップ全体にわたって普遍的に有効である事前学習モデルのための統一的なフレームワークを提案する。
本研究では, 事前学習対象を相互に配置し, 異なる対象間の補間を効果的に行う方法を示す。
また,テキスト内学習において,ゼロショットSuperGLUEで175B GPT-3,ワンショット要約でT5-XXLの性能を3倍に向上させた。
論文 参考訳(メタデータ) (2022-05-10T19:32:20Z) - CommonsenseQA 2.0: Exposing the Limits of AI through Gamification [126.85096257968414]
現代自然言語理解モデルの能力をテストするベンチマークを構築した。
本研究では,データ構築の枠組みとしてゲーミフィケーションを提案する。
論文 参考訳(メタデータ) (2022-01-14T06:49:15Z) - Team Enigma at ArgMining-EMNLP 2021: Leveraging Pre-trained Language
Models for Key Point Matching [0.0]
本稿では,ArgMining 2021におけるキーポイント分析共有タスクへのシステム記述について述べる。
入力(トピック、キーポイント、引数)から抽出した追加データや特徴を組み込んで、パフォーマンスを向上させるとともに、事前訓練された言語モデルの既存の状態を活用しました。
評価フェーズでは,mAP厳格化,mAP緩和スコアが0.872,0.966となり,リーダーボードでは5位となった。
論文 参考訳(メタデータ) (2021-10-24T07:10:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。