論文の概要: BenchScope: How Many Independent Signals Does Your Benchmark Provide?
- arxiv url: http://arxiv.org/abs/2603.29357v1
- Date: Tue, 31 Mar 2026 07:28:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:03.252572
- Title: BenchScope: How Many Independent Signals Does Your Benchmark Provide?
- Title(参考訳): BenchScope: ベンチマークで得られる独立シグナルはいくつか?
- Authors: Tommy Sha, Stella Zhao,
- Abstract要約: 測定幅の高速・集団条件上界診断法であるエフェクト・ディメンダリティ(ED)を導入する。
EDは8ドメインにわたる22のベンチマークと8,400以上のモデル評価に対して、インスタンスごとの粒度で適用される。
相対EDランキングは一致次元制御の下で安定であり、EDは冗長なスイートコンポーネントにフラグを付けることができることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI evaluation suites often report many scores without checking whether those scores carry independent information. We introduce Effective Dimensionality (ED), the participation ratio of a centered benchmark-score spectrum, as a fast, population-conditional upper-bound diagnostic of measurement breadth. Applied at per-instance granularity to 22 benchmarks across 8 domains and more than 8,400 model evaluations, ED reveals substantial redundancy: the six-score Open LLM Leaderboard behaves like roughly two effective measurement axes (ED = 1.7), BBH and MMLU-Pro are near-interchangeable (rho = 0.96, stable across seven subpopulations), and measurement breadth varies more than 20x across current benchmarks. We show that relative ED rankings are stable under matched-dimension controls and that ED can flag redundant suite components, monitor performance-conditional compression, and guide benchmark maintenance. Because binary spectra overestimate absolute latent dimensionality, we interpret ED as a screening statistic rather than a literal factor count and complement it with null, reliability, and saturation analyses. We provide a 22-benchmark reference atlas and a four-step diagnostic workflow that benchmark maintainers can run with a score matrix and a few lines of code.
- Abstract(参考訳): AI評価スイートは、これらのスコアが独立した情報を持っているかどうかを確認することなく、多くのスコアを報告します。
そこで本研究では,集中型ベンチマークスコアスペクトルの参加率である有効次元(ED)を,測定幅の高速・集団条件上界診断として導入する。
6スコアのOpen LLM Leaderboardは、およそ2つの効果的な測定軸(ED = 1.7)、BBHとMMLU-Proはほぼ交換可能(rho = 0.96)、測定幅は現在のベンチマークで20倍以上に変化する。
適合次元制御下では相対EDランキングが安定であり,冗長なスイートコンポーネントのフラグ付けや性能条件の監視,ベンチマークのガイド管理が可能であることを示す。
二項スペクトルは絶対潜在次元を過大評価するため、EDをリテラル因子数ではなくスクリーニング統計と解釈し、ヌル、信頼性、飽和分析で補完する。
ベンチマークのメンテナがスコア行列と数行のコードで実行できる、22ベンチマーク参照アトラスと4ステップの診断ワークフローを提供する。
関連論文リスト
- BenchBench: Benchmarking Automated Benchmark Generation [10.44497524694021]
BenchBenchは、自動ベンチマーク生成をベンチマークするためのパイプラインとデータセットである。
我々は16.7Kアイテムを生成し、15Kコアアイテムをポストフィルタに保持し、152Kグレードのモデル-イテム応答を生成する。
論文 参考訳(メタデータ) (2026-03-21T13:05:32Z) - DEP: A Decentralized Large Language Model Evaluation Protocol [51.3646001384887]
分散評価プロトコル(Decentralized Evaluation Protocol, DEP)は、分散化されているが統一され、標準化された評価フレームワークである。
ユーザ、LLM、ベンチマークを分離することで、DEPはモジュラー、プラグ・アンド・プレイの評価を可能にする。
我々は,ブレークポイントの再開,同時要求,混雑制御などの機能をサポートするプロトコル互換ツールキットであるDEP Toolkitを開発した。
論文 参考訳(メタデータ) (2026-03-01T16:10:16Z) - Fantastic Bugs and Where to Find Them in AI Benchmarks [28.604919035475188]
本稿では, 応答パターンの統計的解析を利用して, 潜在的に無効な質問にフラグを付ける手法を提案する。
我々のアプローチは、平均スコアがモデル性能を十分に要約する、AI評価で一般的に使用されるコア仮定に基づいています。
提案手法は,9つの広く使用されているベンチマークにおいて,最大84%の精度で問題のある問題を特定するために専門家のレビューをガイドする。
論文 参考訳(メタデータ) (2025-11-20T22:49:21Z) - Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts [49.99400612296149]
強力な視覚的理解なしに、モデルが多くのベンチマークを達成できることがわかりました。
これは視覚的な入力を意図した視覚中心のベンチマークでは特に問題となる。
ベンチマーク設計には診断原則を採用しており、もしベンチマークをゲーム化できれば、それをゲーム化します。
論文 参考訳(メタデータ) (2025-11-06T18:43:21Z) - Do Large Language Model Benchmarks Test Reliability? [66.1783478365998]
モデル信頼性の定量化について検討する。
信頼性評価におけるこのギャップにより、我々はいわゆるプラチナベンチマークの概念を提案する。
我々は、これらのプラチナベンチマークにおいて、幅広いモデルを評価し、実際、フロンティアLSMは、単純なタスクで失敗を示す。
論文 参考訳(メタデータ) (2025-02-05T18:58:19Z) - How Should We Build A Benchmark? Revisiting 274 Code-Related Benchmarks For LLMs [60.25940747590386]
本稿では,コード関連ベンチマークの開発を包括的に管理するためのガイドラインとして,55の基準チェックリストからなるHow2Benchを提案する。
私たちは過去10年以内にリリースされた274のベンチマークをプロファイルし、問題を見つけました。
ベンチマークの70%近くはデータ品質保証の措置を取らず、10%以上がオープンソースでも、部分的にはオープンソースでもなかった。
論文 参考訳(メタデータ) (2025-01-18T09:51:57Z) - MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models [71.36392373876505]
我々は、LVLM(Large Vision-Language Models)において、インターリーブされたマルチモーダル理解と生成を評価するための大規模ベンチマークであるMMIEを紹介する。
MMIEは、数学、コーディング、物理学、文学、健康、芸術を含む3つのカテゴリ、12のフィールド、102のサブフィールドにまたがる20Kの厳密にキュレートされたマルチモーダルクエリで構成されている。
インターリーブされたインプットとアウトプットの両方をサポートし、多様な能力を評価するために、複数選択とオープンな質問フォーマットの混合を提供する。
論文 参考訳(メタデータ) (2024-10-14T04:15:00Z) - metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models [5.972993094932516]
大きな言語モデル(LLM)は、様々なタスクでその能力が異なる。
これらのベンチマークを測る共通基盤能力の小さなセットがあることが示される。
スパースベンチマークであるメタベンチを蒸留し、これらは6つのベンチマークの原サイズの3%以下である。
論文 参考訳(メタデータ) (2024-07-04T17:57:38Z) - ACCORD: Closing the Commonsense Measurability Gap [16.572584339052753]
ACCORDは、大規模言語モデル(LLM)の共通理解基盤と推論能力の分離のためのフレームワークである
形式的要素をコモンセンス推論に導入し、典型的な 1 または 2 ホップを超えて、推論の複雑さを明示的に制御し、定量化する。
任意の推論複雑性のベンチマークを自動的に生成するので、将来のLLMの改善に合わせてスケールすることができる。
論文 参考訳(メタデータ) (2024-06-04T22:08:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。