論文の概要: What Does MMLU Actually Measure? A Psychometric Audit of Difficulty Structure in Aggregate Benchmark Scores
- arxiv url: http://arxiv.org/abs/2609.09372v1
- Date: Tue, 08 Sep 2026 19:11:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.794451
- Title: What Does MMLU Actually Measure? A Psychometric Audit of Difficulty Structure in Aggregate Benchmark Scores
- Title(参考訳): MMLUは実際に何を測定するのか? ベンチマークスコアにおける難解な構造の心理学的監査
- Abstract要約: 14,042 MMLU テスト項目に対して,1000 個のオープンウェイト言語モデルの項目難度を校正する。
一つのテストで両方の能力を評価することは本質的に欠陥があることを示します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although MMLU is widely adopted as a benchmark for calibrating general AI capabilities, we psychometrically demonstrate that its aggregate score primarily evaluates a model's factual retrieval capacity rather than its reasoning ability. By calibrating item difficulty for 1,000 open-weights language models over 14,042 MMLU test items using Item Response Theory, we show that evaluating both abilities via a single test is inherently flawed. Difficulty is then regressed on a deterministic, text-extractable framework of structural complexity. Applying a joint Wald test with subject-clustered covariances demonstrates that the MMLU conflates fundamentally separable constructs. The mapping from structural complexity to difficulty is not invariant across the benchmark's STEM and non-STEM partitions. This finding has practical consequences. Aggregate leaderboard ranks track non-STEM accuracy more closely than STEM accuracy, so selecting a Top-50 model on the aggregate for a reasoning-intensive deployment displaces roughly 22% of the STEM-appropriate choices. Furthermore, when controlling for the multiple-choice guessing floor natively inside the response model, we find that higher-ability models continue to degrade more steeply under increased reasoning depth. The MMLU aggregate therefore weights retrieval capacity and reasoning stability unequally, inadvertently favoring models optimized for retrieval. We release our deterministic framework as a reproducible auditing instrument and recommend disaggregated reporting.
- Abstract(参考訳): MMLUは一般的なAI能力を校正するためのベンチマークとして広く採用されているが、その集計スコアは推論能力よりもモデルの事実検索能力を評価することを精神医学的に実証している。
項目応答理論を用いて,1000個のオープンウェイト言語モデルの項目難度を14,042個のMMLUテスト項目で校正することにより,各項目の能力評価が本質的に問題であることを示す。
難易度は、構造的複雑性の決定論的かつテキスト抽出可能なフレームワークに回帰される。
対象クラスタ化共分散を伴うウォルドの合同テストを適用することで、MMLUは根本的に分離可能な構成を膨らませることを示す。
構造複雑性から難易度へのマッピングは、ベンチマークのSTEMおよび非STEMパーティション間で不変ではない。
この発見は実際的な結果をもたらす。
Aggregateのリーダーボードは、STEMの精度よりもSTEMの精度をより正確に追跡しているため、推理集約的な展開のためのTop-50モデルを選択すると、STEMに適した選択の約22%が置き換えられる。
さらに,応答モデル内における複数階層推定フロアをネイティブに制御する場合,高信頼度モデルは推理深度が増大するに従ってより急激に劣化し続けることが判明した。
したがって、MMLU集約は、検索能力と推論安定性を不平等に重み付け、必然的に検索に最適化されたモデルを好む。
我々は,再現可能な監査手段として決定論的な枠組みを公開し,非凝集報告を推奨する。
関連論文リスト
- Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses [6.004875368104112]
大規模な言語モデル(LLM)は治療として提案されているが、完全なサーベイワークフロー全体にわたる厳密な評価はほとんど残っていない。
アンケート設計, サンプル選択, パイロットテスト, 欠落データ計算, および収集後の分析を対象とする, LLM 統合のための5段階フレームワークを提示し, 評価した。
保護モチベーション理論 (PMT) 制約付き共起知識グラフを導入し, ゼロショット推論, 検索拡張ベースライン, 新規な理論インフォームド変種にまたがる7つのLLM構成を開発する。
論文 参考訳(メタデータ) (2026-05-19T00:58:36Z) - GIM: Evaluating models via tasks that integrate multiple cognitive domains [42.01371688303606]
Grounded Integration Measureは、820のオリジナルの問題のベンチマークである。
それぞれの問題は、オリジナルの専門家による作曲である。
バランスのとれた公民分離は、汚染診断を内蔵する。
論文 参考訳(メタデータ) (2026-05-18T17:09:50Z) - From 0-Order Selection to 2-Order Judgment: Combinatorial Hardening Exposes Compositional Failures in Frontier LLMs [4.478347601177043]
複数選択推論ベンチマークは、進行するモデルからの迅速な飽和とデータ汚染という2つの課題に直面している。
ここでは、0階選択を2階論理判断に決定的に変換する形式的なフレームワークであるLogiHardを紹介する。
論文 参考訳(メタデータ) (2026-05-08T05:33:58Z) - TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering [80.93487993878836]
現実世界のクエリの一般的なクラスは暗黙的に予測され、単に検索するのではなく、歴史的パターンから観測されていない回答を推測する必要がある。
これらのクエリには、潜在意図を認識することと、大規模テーブル上での信頼性の高い予測推論という2つの課題がある。
単点予測から意思決定,処理効果分析,複雑な推論に至るまで,4つのサブタスクにわたる779のサンプルからなるベンチマークであるTopBenchを紹介する。
論文 参考訳(メタデータ) (2026-04-30T16:22:51Z) - Adaptive Multi-Expert Reasoning via Difficulty-Aware Routing and Uncertainty-Guided Aggregation [0.2864713389096699]
本稿では,動的適応戦略による推論による問題複雑性に着目したフレームワークであるAdaptive Multi-Expert Reasoning (AMR)について述べる。
問題テキストに焦点を当てたアジャイルルーティングシステムは、問題の難しさと不確実性を予測し、再構成可能なサンプリングメカニズムを誘導し、生成の幅を管理する。
GSM8Kデータセットで評価すると、AMRはオリジナルのトレーニングデータのみを使用しながら75.28%の精度を達成した。
論文 参考訳(メタデータ) (2026-04-11T19:44:57Z) - RankLLM: Weighted Ranking of LLMs by Quantifying Question Difficulty [102.02839046225468]
RankLLMは質問の難しさとモデルの能力の両方を定量化する新しいフレームワークである。
複数のドメインにまたがる35,550の質問に対して30のモデルを評価する。
論文 参考訳(メタデータ) (2026-02-12T21:28:46Z) - CoT-Seg: Rethinking Segmentation with Chain-of-Thought Reasoning and Self-Correction [50.67483317563736]
本稿では,段階的に考察し,必要な情報を検索し,結果を生成し,自己評価を行い,結果を洗練するシステムを提案する。
CoT-Segは、思考の連鎖推論と自己補正を組み合わせることで、推論セグメンテーションを再考する、トレーニング不要のフレームワークである。
論文 参考訳(メタデータ) (2026-01-24T11:41:54Z) - Learning to Reason in LLMs by Expectation Maximization [55.721496945401846]
我々は推論を潜在変数モデルとして定式化し、推論を学ぶための期待最大化目標を導出する。
この見解はEMと現代の報酬に基づく最適化を結びつけるものであり、正しい答えを正当化する有理性を生成するサンプリング分布を設計することの主な課題であることを示している。
論文 参考訳(メタデータ) (2025-12-23T08:56:49Z) - PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies [16.537126902822127]
PRISMM-Benchは、科学論文において、実際のレビュアーがフラッグした不整合に基づいた最初のベンチマークである。
不整合同定、治療、ペアマッチングという3つのタスクを設計し、不整合の検出、修正、推論を行うモデルの能力を評価する。
我々は、大きなオープンウェイトモデル(GLM-4.5V 106B、InternVL3 78B)やプロプライエタリモデル(Gemini 2.5 Pro、GPT-5)を含む21のLMMをベンチマークした。
論文 参考訳(メタデータ) (2025-10-18T13:46:26Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search [61.11836311160951]
本稿では,知識集約型タスクにおける小言語モデルの推論能力を高める新しいアプローチであるMCTS-RAGを紹介する。
通常、推論から独立して情報を取得する標準的なRAG法とは異なり、MCTS-RAGは構造化推論と適応的検索を組み合わせる。
この統合されたアプローチは意思決定を強化し、幻覚を減らし、事実の正確性と応答の整合性を向上させる。
論文 参考訳(メタデータ) (2025-03-26T17:46:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。