論文の概要: From Score Matrices to Football-Aware Match-State Simulation: An Auditable LLM Harness for Exact-Score Reranking
- arxiv url: http://arxiv.org/abs/2608.05030v1
- Date: Wed, 05 Aug 2026 16:34:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.997373
- Title: From Score Matrices to Football-Aware Match-State Simulation: An Auditable LLM Harness for Exact-Score Reranking
- Title(参考訳): スコアマトリクスからフットボール対応マッチ状態シミュレーション:エクササイズリグレードのための聴取可能なLCMハーネス
- Authors: Shaopeng Liang,
- Abstract要約: フットボールのスコア予測は、強い統計コアと難しい文脈のエッジを組み合わせる。
監査可能な情報ハーネスを通じて、両方のコンポーネントを結合します。
2025-26イングランド・プレミアリーグの最初の150試合のリプレイで、V1は10.0%のTop-1と26.7%のTop-3の精度を達成した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Football score forecasting combines a strong statistical core with a difficult contextual edge. Dynamic Poisson-family models estimate team strength, expected goals, and coherent score probabilities, but do not directly understand roles, tactical matchups, motivation, or how a first goal changes behaviour. Large language models (LLMs) can reason about such concepts, yet are not calibrated probability engines. We combine both components through an auditable information harness. This paper documents four iterations: V1, a dynamic score-driven Dixon-Coles baseline; V2, which maps LLM contextual ratings back into expected-goal parameters; V3, which replaces scalar correction with goal-by-goal simulations over a frozen score-candidate set; and V4, which adds shared first-breakthrough and post-goal cascade judgments, time-aware stopping, and deterministic tail candidates. The harness defines input semantics, supplies pre-match evidence, and constrains the LLM to an inspectable reasoning route. On a chronological replay of the first 150 matches of the 2025-26 English Premier League, V1 achieved 10.0% Top-1 and 26.7% Top-3 exact-score accuracy. V3 reached 12.0% and 30.0%, while V4 reached 14.7% and 30.7%. V4 increased candidate coverage from 77.3% to 84.7%, although no added tail candidate became a Top-3 exact hit. V1's native 1X2 distribution achieved 53.3% argmax accuracy, 0.9878 log loss, 0.5870 Brier score, and 0.2095 ranked probability score. These results are exploratory: the development slice is not an untouched benchmark, and temporal input isolation cannot exclude outcome memory in a closed LLM. The contribution is an auditable hybrid architecture, a clear design evolution, and negative findings showing where football-aware simulation does and does not improve score selection.
- Abstract(参考訳): フットボールのスコア予測は、強い統計コアと難しい文脈のエッジを組み合わせる。
動的ポアソンモデルでは、チームの強さ、期待されたゴール、一貫性のあるスコアの確率を見積もっていますが、役割、戦術的なマッチング、モチベーション、あるいは第一のゴールがどのように振る舞いを変えるかを直接理解していません。
大規模言語モデル(LLM)はそのような概念を推論できるが、キャリブレーションされた確率エンジンではない。
監査可能な情報ハーネスを通じて、両方のコンポーネントを結合します。
本稿では,動的スコア駆動型Dixon-ColesベースラインであるV1,LLMの文脈評価を期待ゴールパラメータにマッピングするV2,凍結スコア候補上でのゴール・バイ・ゴール・シミュレーションにスカラー補正を置き換えるV3,共有ファースト・ブレークスルーとポスト・ゴール・カスケード判定,タイム・アウェア・ストップ,決定論的テール候補を付加するV4の4つのイテレーションについて述べる。
ハーネスは入力セマンティクスを定義し、プレマッチの証拠を提供し、LLMを検査可能な推論経路に制約する。
2025-26イングランド・プレミアリーグの最初の150試合のタイムリプレイで、V1は10.0%のTop-1、26.7%のTop-3の正確さを達成した。
V3は12.0%、30.0%、V4は14.7%、30.7%に達した。
V4は77.3%から84.7%まで候補範囲を拡大したが、後尾候補がTop-3の正確なヒットにはならなかった。
V1のネイティブな1X2分布は53.3%のargmax精度、0.9878ログロス、0.5870ブライアスコア、0.2095ランクの確率スコアを達成した。
これらの結果は探索的であり、開発スライスは未修正のベンチマークではなく、時間的入力分離は閉LLMにおける結果メモリを除外できない。
この貢献は、監査可能なハイブリッドアーキテクチャ、明確な設計の進化、そしてフットボール・アウェア・シミュレーションがどこで行われ、スコア選択を改善していないかを示す負の発見である。
関連論文リスト
- AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament Prediction [0.0]
本報告では,2026年FIFAワールドカップ全体について,10名のアシスタントが1回の予報を行ったEmphAI World Cupベンチマークを報告する。
予測では、グループステージスコア、グループランキング、ノックアウトブラケット、最終配置、信頼性値、短い説明がカバーされた。
GPT-5.5は744点、GPT-5.5は717点、ジェミニは699点、Qwen 3.7は687点であった。
論文 参考訳(メタデータ) (2026-08-04T10:07:14Z) - WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting [10.941871398755403]
We present WorldCupArena, a benchmark for language model and Deep-Research agent。
結果とスコア、おそらくプレイヤーやイベント、統計、そして競技結果を予測する。
予測されたスコアが近いが正確ではない場合に、結果の精度、精度、スコアラインスコアを報告する。
論文 参考訳(メタデータ) (2026-07-20T15:52:48Z) - Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality? [74.69723255239663]
グラウンドド・パーソナリティ・推論は、MLLMがそれぞれのビッグファイブ・格付けを、評価、推論、根拠の連鎖を通じて観察可能な証拠に固定することを要求する。
MM-OCEANは、人間の検証によるマルチエージェントパイプラインによって生成され、タイムスタンプによる行動観察、エビデンスに基づく特性分析、およびキューグラウンドMCQの7つのカテゴリがある。
この分析では、フィールド全体にわたって、正しい評価の51%が取得された手がかりに基づかず、ホリスティック・ギャラリング・レートは0-33.5%にしか達していないという顕著な偏見のギャップが明らかになった。
論文 参考訳(メタデータ) (2026-05-21T07:42:47Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Simulation-Based Optimisation of Batting Order and Bowling Plans in T20 Cricket [0.0]
本稿では,T20クリケットにおける2つの反復的内決定を最適化するための統合マルコフ決定プロセスフレームワークを開発する。
最適打順はムンバイ・インディアンの勝利確率を4.1ポイント(52.4%から56.5%)改善し、最適グジャラート・タイタンズのボウリング計画では防御確率を5.2ポイント(39.1%から44.3%)改善する。
どちらの場合も、観測された準最適性は位相に依存しない配置と一致している。
論文 参考訳(メタデータ) (2026-04-15T13:28:45Z) - vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models [58.633451339058986]
VLAモデルは一般的に、各モデルリポジトリによって独立して維持されるベンチマークスクリプト毎に評価される。
本稿では、ベンチマーク実行からモデル推論を分離するオープンソースの評価ハーネスであるvla evalを紹介する。
完全な評価では、vla eval serveとvla eval runの2つのコマンドしか必要としない。
論文 参考訳(メタデータ) (2026-03-14T14:38:53Z) - ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks [12.396822247035578]
目的抽出とメタ認知のためのベンチマークであるexMTを提案する。
マルチターン書き起こしが与えられた場合、モデルは1文ベース目標と自己報告された自信を出力しなければならない。
正確性は金の目標と類似性によって評価され、300の校正項目で1度閾値付けされる。
論文 参考訳(メタデータ) (2025-08-23T03:32:04Z) - Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making [38.75183725659772]
大規模言語モデル(LLM)は、複雑な推論を必要とするタスクにますます使われている。
モデル動作の理解と信頼性向上には,内部プロセスの測定が不可欠である,と我々は主張する。
計画,修正,資源制約のある意思決定という3つの中核的な側面に沿ってLCMを評価する枠組みを導入する。
論文 参考訳(メタデータ) (2025-06-13T17:59:10Z) - HCQA-1.5 @ Ego4D EgoSchema Challenge 2025 [77.414837862995]
本稿では,CVPR 2025におけるEgo4D Egocentric Challengeの3位を獲得する方法を提案する。
提案手法では,多様な予測を生成するマルチソースアグリゲーション戦略を導入し,次いで信頼性に基づくフィルタリング機構を提案する。
本手法は,5000以上の質問に対して77%の精度を達成している。
論文 参考訳(メタデータ) (2025-05-27T02:45:14Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - Language Generation with Strictly Proper Scoring Rules [70.340673452404]
本稿では,非局所的なスコアリングルールを用いた言語モデリングが可能な,スコアリングルールを言語生成に適用するための戦略を提案する。
対数スコアの代替として、ブライアスコアと球面スコアの2つの古典的厳密なスコアルールを用いて言語生成モデルを訓練する。
論文 参考訳(メタデータ) (2024-05-29T09:09:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。