論文の概要: Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks
- arxiv url: http://arxiv.org/abs/2608.03340v1
- Date: Tue, 04 Aug 2026 08:49:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.104677
- Title: Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks
- Title(参考訳): ベンチマークのベンチマーク:Commonsenseベンチマークの予測妥当性をテストする
- Authors: Ine Gevers, Walter Daelemans,
- Abstract要約: 確立された4つのコモンセンスベンチマーク,4つのリワークされた変種,3つの非常識制御,8つの下流タスクの6つのファミリーから23のモデルを評価した。
我々は、モデルランキング、計算制御された相関関係を比較し、コモンセンスベンチマークの基準妥当性を評価するために、一戸一戸一戸建てのクロスバリデーションを使用する。
- 参考スコア(独自算出の注目度): 1.671764884922859
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Predicting LLM's capabilities on real-world tasks is essential, yet the extent to which performance on commonsense benchmarks predicts downstream performance remains underspecified. To establish the practical usability of widely adopted commonsense benchmarks, we evaluate 23 models from six families on four established commonsense benchmarks, four reworked variants, three non-commonsense controls, and eight downstream tasks requiring implicit social, pragmatic, temporal, or physical reasoning. We compare model rankings, compute controlled correlations, and use leave-one-family-out cross-validation to assess the criterion validity of commonsense benchmarks. Our results show that revised benchmarks largely preserve original model rankings and do not improve downstream predictive power. Commonsense benchmarks show consistent cross-family predictive validity for only a narrow subset of downstream tasks, with smaller or metric-specific gains elsewhere. Overall, standardized commonsense benchmarks provide task-dependent rather than broad evidence of downstream commonsense competence.
- Abstract(参考訳): 実世界のタスクにおいてLLMの能力を予測することは不可欠であるが、Commonsenseベンチマークのパフォーマンスが下流のパフォーマンスを予測する程度は未定のままである。
広く採用されているコモンセンスベンチマークの実用性を確立するため,4つの確立されたコモンセンスベンチマーク,4つのリワークされた変種,3つの非コモンセンスコントロール,および8つのダウンストリームタスクに対して,暗黙の社会的,実践的,時間的,物理的推論を必要とする6つのファミリーから23のモデルを評価する。
我々は、モデルランキング、計算制御された相関関係を比較し、コモンセンスベンチマークの基準妥当性を評価するために、一戸一戸一戸建てのクロスバリデーションを使用する。
本結果から,改良されたベンチマークは,従来のモデルランキングをほとんど保持せず,下流予測能力は向上しないことが明らかとなった。
Commonsenseベンチマークは、下流タスクの狭いサブセットのみに対して一貫したクロスファミリー予測の妥当性を示し、他の部分ではより小さいまたはメートル法固有の利得を示している。
全体として、標準化されたコモンセンスベンチマークは、下流のコモンセンス能力の広範な証拠ではなく、タスクに依存している。
関連論文リスト
- Silicon Bureaucracy and AI Test-Oriented Education: Contamination Sensitivity and Score Confidence in LLM Benchmarks [43.45152572188735]
本稿では,言語モデルにおける汚染感度とスコア信頼度を解析するための監査フレームワークを提案する。
ノイズ条件下では, 広範に不均一なベースラインゲインが得られる。
これらの結果は、類似のベンチマークスコアが、かなり異なる信頼レベルを持つ可能性があることを示唆している。
論文 参考訳(メタデータ) (2026-03-23T07:03:07Z) - IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation [85.56193980646981]
命令追従のための総合的メタ評価ベンチマークであるIF-RewardBenchを提案する。
各命令に対して、複数の応答間の全てのペアの選好を含む選好グラフを構築する。
IF-RewardBenchの実験は、現在の審査モデルに重大な欠陥を呈している。
論文 参考訳(メタデータ) (2026-03-05T02:21:17Z) - Benchmark^2: Systematic Evaluation of LLM Benchmarks [66.2731798872668]
3つの相補的なメトリクスからなる包括的なフレームワークであるBenchmark2を提案する。
数学、推論、知識ドメインにまたがる15のベンチマークで実験を行います。
本分析により,既存のベンチマーク間での有意な品質変化が明らかとなり,選択的なベンチマーク構築が同等な評価性能を達成できることが示されている。
論文 参考訳(メタデータ) (2026-01-07T14:59:03Z) - The Flaw of Averages: Quantifying Uniformity of Performance on Benchmarks [32.00464870277127]
本稿では,分布の観点からベンチマークの信頼性について検討し,ベンチマークの調和を導入する。
高調和性は望ましいベンチマーク特性であり、凝集度がモデル間の均一なコンピテンスを反映していることを示している。
正確さとともに調和を報告することを推奨することで、単純なパフォーマンス平均から、より堅牢で分散的に信頼性の高いパフォーマンス測定まで、評価を見直します。
論文 参考訳(メタデータ) (2025-09-30T02:14:30Z) - Benchmark Profiling: Mechanistic Diagnosis of LLM Benchmarks [34.09939383415074]
ベンチマークプロファイリングは、ベンチマークのパフォーマンスを10の認知的基盤を持つ能力に分解する。
パフォーマンス向上がユーザ認識能力に必ずしも変換されない理由を説明する。
論文 参考訳(メタデータ) (2025-09-23T15:32:47Z) - The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models [94.31327813151208]
BiGGen Benchは、77のタスクにわたるLMの9つの異なる能力を徹底的に評価するために設計された、原則化された世代ベンチマークである。
BiGGen Benchの重要な特徴は、インスタンス固有の評価基準の使用であり、人間の評価のニュアンスな識別を忠実に反映している。
論文 参考訳(メタデータ) (2024-06-09T12:30:30Z) - A Backdoor-based Explainable AI Benchmark for High Fidelity Evaluation of Attributions [60.06461883533697]
まず、属性手法の信頼性ベンチマークが満たすであろう信頼度基準のセットを同定する。
次に、望ましい忠実度基準に準拠したBackdoorベースのeXplainable AIベンチマーク(BackX)を紹介します。
我々の分析はまた、属性を利用して神経トロイの木馬を守るための洞察を提供する。
論文 参考訳(メタデータ) (2024-05-02T13:48:37Z) - Don't Make Your LLM an Evaluation Benchmark Cheater [142.24553056600627]
大規模言語モデル(LLM)は人工知能のフロンティアを大幅に進歩させ、モデルキャパシティを著しく向上させた。
モデル性能を評価するために, LLMの能力レベルを測定するための評価ベンチマークを構築するのが典型的な方法である。
評価ベンチマークを用いて不適切なリスクと影響について検討し,評価結果を誤って解釈する。
論文 参考訳(メタデータ) (2023-11-03T14:59:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。