論文の概要: A Statistical Audit of Physical AI Benchmark Redundancy
- arxiv url: http://arxiv.org/abs/2608.25940v2
- Date: Sat, 29 Aug 2026 14:08:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 13:34:07.675629
- Title: A Statistical Audit of Physical AI Benchmark Redundancy
- Title(参考訳): 物理AIベンチマーク冗長性の統計的調査
- Authors: Zaruhi Navasardyan, Hrant Davtyan,
- Abstract要約: 物理AIモデルは、モデルレポートによって異なるベンチマークスイートで評価され、モデルバイベンチマークマトリックスはスパースのままである。
51のベンチマークと152のモデルのレジストリから,12の物理AIベンチマーク上に51モデルの行列を構築した。
ベンチマークがどの程度の情報を共有しているかを測定し、冗長性の定量的な証拠を示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Physical AI models are evaluated on suites of benchmarks that differ across model reports, leaving the model-by-benchmark matrix sparse and the relationship between benchmarks unmeasured. We construct a matrix of 51 models on 12 physical AI benchmarks, selected from a registry of 51 benchmarks and 152 models by reporting density, combining scores from model cards and benchmark papers with our own evaluation runs under each benchmark's official protocol. We measure how much information the benchmarks share and show quantitative evidence of Redundancy. Redundancy affects reported rankings: collapsing the two substitute pairs into single columns moves 22 of 51 models by three or more places under an equally weighted average. We then select benchmarks greedily under a utility combining score dispersion with variance not explained by the already-selected set, and obtain a four-benchmark subset retaining 78.5\% of the utility of all 12, on which we fit a Bradley--Terry ranking. The procedure requires only benchmark-level scores with sufficient overlap and is not specific to physical AI.
- Abstract(参考訳): 物理AIモデルは、モデルレポートによって異なるベンチマークのスイートで評価され、モデルバイベンチマーク行列はスパースであり、ベンチマーク間の関係は未測定のままである。
我々は、51のベンチマークと152のモデルのレジストリから選択された12の物理AIベンチマーク上に51のモデルからなる行列を構築し、各ベンチマークの公式プロトコルの下で、モデルカードとベンチマーク論文のスコアと、私たち自身の評価結果を組み合わせる。
ベンチマークがどの程度の情報を共有しているかを測定し、冗長性の定量的な証拠を示す。
2つの代替ペアを1つの列にまとめると、同じ重み付き平均の下で51モデルのうち22個を3つ以上の場所に移動させる。
次に、既に選択された集合によって説明されていない分散とスコア分散を組み合わせたユーティリティの下で、厳密にベンチマークを選択し、Bradley-Terry ランキングに適合する全 12 のユーティリティの78.5 %を保持する 4 つのベンチマーク部分集合を得る。
このプロシージャは十分なオーバーラップを伴うベンチマークレベルのスコアのみを必要とし、物理的なAIに固有のものではない。
関連論文リスト
- RepBench: Compiling Benchmarks into Capability Representations for Large Language Models [5.276992083399684]
RepBenchは、機能整合型表現探索のためのベンチマーク地上データ層である。
13,427のベンチマーク論文は、13の家系で182の能力クラスタの分類を出力し、353の公開ベンチマークデータセットを収集すると、94の能力をカバーする46,149の監査済みプローブテキストが生成される。
論文 参考訳(メタデータ) (2026-07-30T10:56:44Z) - PACE: A Proxy for Agentic Capability Evaluation [60.3743414796937]
PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
論文 参考訳(メタデータ) (2026-07-02T10:59:03Z) - Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment [53.72927532626824]
わずか50個のサンプル(0.3%のデータ)のサブセットは、完全なベンチマークスコアと0.93以上のピアソン相関を達成可能であることを示す。
選好をより良く予測するために、選択したサブセットの回帰モデルを訓練し、0.98の相関を達成した。
これは回帰モデリングにおいて、よく計算されたサブセットが完全なベンチマークを予測し、量を超える品質を示すことを示している。
論文 参考訳(メタデータ) (2026-04-20T00:57:31Z) - When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation [80.66788281323414]
主要モデル開発者のテクニカルレポートから選択した60のLarge Language Model (LLM)ベンチマークのベンチマーク飽和を分析した。
分析の結果、ベンチマークのほぼ半数が飽和しており、ベンチマークの年齢とともに上昇していることがわかった。
専門家によるベンチマークは、クラウドソースのベンチマークよりも飽和に抵抗する。
論文 参考訳(メタデータ) (2026-02-18T16:51:37Z) - Benchmark^2: Systematic Evaluation of LLM Benchmarks [66.2731798872668]
3つの相補的なメトリクスからなる包括的なフレームワークであるBenchmark2を提案する。
数学、推論、知識ドメインにまたがる15のベンチマークで実験を行います。
本分析により,既存のベンチマーク間での有意な品質変化が明らかとなり,選択的なベンチマーク構築が同等な評価性能を達成できることが示されている。
論文 参考訳(メタデータ) (2026-01-07T14:59:03Z) - Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks [26.89839484242575]
ATLASは大規模言語モデルの適応テストフレームワークである。
フィッシャー情報誘導項目選択によるモデル能力の推定を行う。
測定精度を維持しながら90%の項目削減を実現している。
論文 参考訳(メタデータ) (2025-10-26T03:54:12Z) - metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models [5.972993094932516]
大きな言語モデル(LLM)は、様々なタスクでその能力が異なる。
これらのベンチマークを測る共通基盤能力の小さなセットがあることが示される。
スパースベンチマークであるメタベンチを蒸留し、これらは6つのベンチマークの原サイズの3%以下である。
論文 参考訳(メタデータ) (2024-07-04T17:57:38Z) - Do Question Answering Modeling Improvements Hold Across Benchmarks? [84.48867898593052]
20種類の多種多様なモデリング手法を用いて32のQAベンチマークの一致を計測する。
何年にもわたってコミュニティは少数のベンチマークに力を入れてきたが、研究対象のモデリングの改善は広く続いている。
論文 参考訳(メタデータ) (2021-02-01T18:55:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。