論文の概要: Balance of Benchmarks: Semantic Density Reweighting for Benchmark Multiplicity and Task-Conditioned Evaluation
- arxiv url: http://arxiv.org/abs/2608.30044v2
- Date: Fri, 04 Sep 2026 19:47:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 22:37:20.316388
- Title: Balance of Benchmarks: Semantic Density Reweighting for Benchmark Multiplicity and Task-Conditioned Evaluation
- Title(参考訳): ベンチマークのバランス:ベンチマークの多重度とタスク定義評価のための意味密度の重み付け
- Abstract要約: ベンチマークのバランスはベンチマーク記述を埋め、各ベンチマークに逆密度のセマンティックウェイトを割り当てる。
残留フィールドは同じ幾何学を用いてタスククエリのランク付けを条件付けする。
BoBは最も高い平均プロファイルを獲得し、最寄り、調整されたトップ(k)、半径、クラスタベースのアグリゲーションを著しく上回っている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language models are commonly compared by averaging scores across a benchmark list with equal weight. Such lists grow through publication outside an explicit measurement design, so equal weighting turns the density of published benchmarks into an implicit capability weight: densely benchmarked regions count repeatedly. We introduce Balance of Benchmarks (BoB), which embeds benchmark descriptions and assigns each benchmark an inverse-density semantic weight. Nearby entries share aggregate influence at a disclosed density scale. After equating heterogeneous scores onto a common latent scale, a residual field uses the same geometry to condition model rankings on a task query. The two components serve distinct empirical roles. On a snapshot of 605 models and 14 benchmarks, BoB predicts which models are unusually strong on a held-out task beyond their general ability, reaching a profile correlation of 0.483 compared with 0.049 under equal weighting. Among controls that share its score equating, residuals, precision weights, and regularization, BoB attains the highest mean profile and significantly outperforms nearest-neighbour, tuned top-\(k\), radius, and cluster-based aggregation after multiple-comparison correction. It also limits the influence of densely repeated benchmarks on the aggregate. After adding four copies of each benchmark in turn, the resulting rankings retain Kendall \(τ=0.995\), compared with 0.936 under equal weighting. The residual field therefore provides task-conditioned prediction, and inverse-density weighting provides robustness to benchmark multiplicity. Together, they turn benchmark-list composition from an incidental property of evaluation suites into an explicit, controllable part of measurement design, providing a principled foundation for task-aware and multiplicity-robust model evaluation.
- Abstract(参考訳): 言語モデルは、ベンチマークリストの平均スコアを同じ重さで比較するのが一般的である。
このようなリストは、明示的な測定設計外の公開を通じて成長するので、同値な重み付けは、公表されたベンチマークの密度を暗黙の能力重みに変える。
ベンチマーク記述を埋め込み、各ベンチマークに逆密度のセマンティックウェイトを割り当てるベンチマークのバランス(BoB)を導入する。
近傍のエントリは、公表された密度スケールで集合的影響を共有する。
不均一なスコアを共通の潜在尺度に等式化した後、残場は同じ幾何学を用いてタスククエリのランク付けを条件付けする。
この2つの構成要素は異なる経験的役割を担っている。
605モデルと14のベンチマークのスナップショットでは、BoBはどのモデルが一般的な能力を超える保持タスクで異常に強いかを予測し、同じ重み付けの下で0.049と比較して0.483のプロファイル相関に達した。
スコアの偏り、残差、精度の重み、正規化を共有するコントロールの中で、BoBは最も高い平均プロファイルを獲得し、多重比較補正後の近辺、チューニングされたトップ(k)、半径、クラスタベースのアグリゲーションを著しく上回っている。
また、集約に対する厳密な反復ベンチマークの影響も制限される。
それぞれのベンチマークのコピーを4つ加えた後、結果のランクはKendall \(τ=0.995\)であり、同じ重み付けで0.936である。
剰余体はタスク条件付き予測を提供し、逆密度重み付けはベンチマーク多重性に対して堅牢性を与える。
同時に、ベンチマークリストの合成を、評価スイートの付随的な特性から、明示的で制御可能な測定設計の一部に転換し、タスク認識および多重度ロバストモデル評価の原則的基盤を提供する。
関連論文リスト
- A Statistical Audit of Physical AI Benchmark Redundancy [0.0]
物理AIモデルは、モデルレポートによって異なるベンチマークスイートで評価され、モデルバイベンチマークマトリックスはスパースのままである。
51のベンチマークと152のモデルのレジストリから,12の物理AIベンチマーク上に51モデルの行列を構築した。
ベンチマークがどの程度の情報を共有しているかを測定し、冗長性の定量的な証拠を示す。
論文 参考訳(メタデータ) (2026-08-26T15:54:15Z) - Rank-Deviation Quality: A Distance-Aware Metric for Multi-Answer Retrieval and Ranking Evaluation [51.55909067323666]
Rank-Deviation Quality (RDQ) は、検索およびランキングシステムの評価指標である。
検索された基準項目はそれぞれ、ランクずれペナルティによって乗算された出力位置重みに寄与する。
RDQは順序付きランキングで動作し、アノテータはペアワイドまたはリストワイドの判断によって生成することができる。
論文 参考訳(メタデータ) (2026-08-26T03:00:18Z) - Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts [47.02978329409663]
そこで本研究では,Q手法に基づく対称型人間-LLM評価フレームワークを提案する。
私たちのプロトコルでは、人間とモデルは同一の140項目の道徳的ステートメントを、共有された9カラムの強制分布に分類します。
240個の複製されたQ-sortを2つの温度設定で4つのモデルファミリーにまたがる12個のLLMを評価した。
論文 参考訳(メタデータ) (2026-06-20T08:15:41Z) - Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO [70.38763678943648]
検証可能な報酬(RLVR)による強化学習は、大規模言語モデルにおける推論とコード生成を改善するための中心的なパラダイムとなっている。
標準的なGRPOはシーケンスアグリゲーションを使用し、最近の研究はトークンアグリゲーションをより良い代替手段として提唱している。
トークンアグリゲーションは符号長結合を導入し、シーケンスアグリゲーションは暗黙的にダウンウェイトを延長する。
論文 参考訳(メタデータ) (2026-04-14T09:48:46Z) - IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation [85.56193980646981]
命令追従のための総合的メタ評価ベンチマークであるIF-RewardBenchを提案する。
各命令に対して、複数の応答間の全てのペアの選好を含む選好グラフを構築する。
IF-RewardBenchの実験は、現在の審査モデルに重大な欠陥を呈している。
論文 参考訳(メタデータ) (2026-03-05T02:21:17Z) - Learning More from Less: Unlocking Internal Representations for Benchmark Compression [37.69575776639016]
異種隠蔽状態を統一潜在空間に整列させて代表コアセットを構成するREPCOREを導入する。
5つのベンチマークと200以上のモデルの実験は、ランキングの相関と推定精度において、出力ベースラインよりも一貫した利得を示している。
論文 参考訳(メタデータ) (2026-01-31T13:11:39Z) - Benchmark^2: Systematic Evaluation of LLM Benchmarks [66.2731798872668]
3つの相補的なメトリクスからなる包括的なフレームワークであるBenchmark2を提案する。
数学、推論、知識ドメインにまたがる15のベンチマークで実験を行います。
本分析により,既存のベンチマーク間での有意な品質変化が明らかとなり,選択的なベンチマーク構築が同等な評価性能を達成できることが示されている。
論文 参考訳(メタデータ) (2026-01-07T14:59:03Z) - The Flaw of Averages: Quantifying Uniformity of Performance on Benchmarks [32.00464870277127]
本稿では,分布の観点からベンチマークの信頼性について検討し,ベンチマークの調和を導入する。
高調和性は望ましいベンチマーク特性であり、凝集度がモデル間の均一なコンピテンスを反映していることを示している。
正確さとともに調和を報告することを推奨することで、単純なパフォーマンス平均から、より堅牢で分散的に信頼性の高いパフォーマンス測定まで、評価を見直します。
論文 参考訳(メタデータ) (2025-09-30T02:14:30Z) - KG-EDAS: A Meta-Metric Framework for Evaluating Knowledge Graph Completion Models [0.0]
知識グラフ(KG)を評価する上での大きな課題は、複数のデータセットとメトリクスのパフォーマンスを比較することだ。
我々は,平均解からの距離に基づくKG評価を提案し,マルチメトリック・マルチデータセットのパフォーマンスを統一的なランキングに組み込む。
EDASは、より情報のあるモデル選択をサポートし、データセット間の評価において公平性を促進するグローバルな視点を提供する。
論文 参考訳(メタデータ) (2025-08-21T08:37:35Z) - ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities [30.123976500620834]
従来の固定テストセットは、ファンデーションモデルのオープンな機能を評価するのに不足しています。
ONEBenchは、個々の評価データセットを統一し、拡張し続けるサンプルプールに統合する新しいテストパラダイムである。
ONEBenchは、テストセットにまたがってサンプルを集約することにより、オリジナルのテストセットでカバーされたもの以上の多様な機能の評価を可能にする。
論文 参考訳(メタデータ) (2024-12-09T18:37:14Z) - Preserving Knowledge Invariance: Rethinking Robustness Evaluation of Open Information Extraction [49.15931834209624]
実世界におけるオープン情報抽出モデルの評価をシミュレートする最初のベンチマークを示す。
我々は、それぞれの例が知識不変のcliqueである大規模なテストベッドを設計し、注釈付けする。
さらにロバスト性計量を解明することにより、その性能が全体の傾きに対して一貫して正確であるならば、モデルはロバストであると判断される。
論文 参考訳(メタデータ) (2023-05-23T12:05:09Z) - BUMP: A Benchmark of Unfaithful Minimal Pairs for Meta-Evaluation of
Faithfulness Metrics [70.52570641514146]
不誠実な最小対 (BUMP) のベンチマークを示す。
BUMPは、889人の人間が書いた最小限のサマリーペアのデータセットである。
非ペアベースのデータセットとは異なり、BUMPはメトリクスの一貫性を測定するために使用することができる。
論文 参考訳(メタデータ) (2022-12-20T02:17:30Z) - Counting Like Human: Anthropoid Crowd Counting on Modeling the
Similarity of Objects [92.80955339180119]
メインストリームの群衆計数法は 密度マップを補強して 計数結果を得るために統合する。
これに触発された我々は,合理的かつ人為的な集団カウントフレームワークを提案する。
論文 参考訳(メタデータ) (2022-12-02T07:00:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。