論文の概要: The Double Measurement Confound in Agent Benchmarks: De-Scaffolding, Ground-Truth Scoring, and Reliability Beyond the Mean
- arxiv url: http://arxiv.org/abs/2609.09218v1
- Date: Sun, 06 Sep 2026 21:23:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.737657
- Title: The Double Measurement Confound in Agent Benchmarks: De-Scaffolding, Ground-Truth Scoring, and Reliability Beyond the Mean
- Title(参考訳): エージェントベンチマークにおける二重測定の問題点:デスカフォールディング、グラウンド・トゥルース・スコアリング、および平均を超える信頼性
- Abstract要約: エージェントベンチマークは、大規模言語モデル(LLM)の比較やデプロイメント決定のガイドにますます使用されている。
実行クリティカルな決定はモデルの代わりに固定された足場によって行われ、スコアラはタスクの正しさを反映しない基準を用いて出力を評価する。
ベンチマークスコアをモデル能力の証拠として解釈できる場合に特徴付ける測定理論の枠組みでこれらの問題を統一する。
- 参考スコア(独自算出の注目度): 2.822987192839875
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent benchmarks are increasingly used to compare large language models (LLMs) and guide deployment decisions, yet benchmark scores are meaningful only if they measure model capability rather than properties of the evaluation pipeline. We identify a double measurement confound: execution-critical decisions are performed by a fixed scaffold instead of the model, while the scorer evaluates outputs using criteria that may not reflect task correctness. We unify these issues within a measurement-theoretic framework that characterizes when benchmark scores can be interpreted as evidence of model capability, and instantiate it with an audit-and-repair protocol that (i) transfers execution-critical decisions from the scaffold to the model, (ii) replaces shape-based evaluation with seeded ground-truth scoring, and (iii) reports reliability beyond the mean through worst-case and tail-risk metrics. Experiments on ComtradeBench show that the joint intervention transforms a nearly flat leaderboard into a reliability spectrum that distinguishes both average performance and robustness across seeds. Applying the audit to existing benchmarks further shows that scorer validity is benchmark-specific, whereas scaffold ownership is an uncontrolled axis wherever we probed it. Our results suggest that benchmark scores should be interpreted together with their scaffolding level, scoring criterion, and reliability profile, providing a practical framework for more valid evaluation of LLM agents.
- Abstract(参考訳): エージェントベンチマークは、大規模言語モデル(LLM)とデプロイメント決定のガイドに使用されることが多いが、ベンチマークスコアは、評価パイプラインの特性ではなく、モデル能力を測定する場合に限られる。
実行クリティカルな決定はモデルの代わりに固定された足場によって行われ、スコアラはタスクの正しさを反映しない基準を用いて出力を評価する。
ベンチマークスコアをモデル能力のエビデンスとして解釈できる場合を特徴付ける測定理論フレームワーク内でこれらの問題を統一し、監査・修復プロトコルでインスタンス化する。
i) 実行クリティカルな決定を足場からモデルに転送する。
(二) 形状評価を接地スコアで代用し、
三 最悪の場合及び尾リスクの指標により、平均以上の信頼性を報告すること。
ComtradeBenchの実験では、共同介入により、ほぼ平らなリーダーボードが、種子の平均的なパフォーマンスと堅牢性の両方を区別する信頼性スペクトルに変換されることが示された。
既存のベンチマークに監査を適用すると、スコアの妥当性はベンチマーク固有のものであるのに対して、足場オーナシップは、調査対象であれば、制御不能な軸であることがわかる。
この結果から, ベンチマークスコアは, 足場レベル, 評価基準, 信頼性プロファイルとともに解釈されるべきであることが示唆された。
関連論文リスト
- Position: Evaluation Scores Are Perishable Knowledge Claims [0.0]
評価スコアは、形式性、スコープ、妥当性の3つの特性を持つクレームとして扱われるべきである。
HELMリーダーボードにおける平均アグリゲーションのコストについて説明する。
論文 参考訳(メタデータ) (2026-07-28T18:50:39Z) - DualEval: Joint Model-Item Calibration for Unified LLM Evaluation [67.99119926012686]
DualEvalは、モデルと評価項目を共有空間で表現する潜在モデルイテムキャリブレーションフレームワークである。
我々はDualEvalを、コーディング、数学、雑多なドメイン知識タスク、汎用的な日常的なユーザクエリの4つの領域にまたがって適用する。
論文 参考訳(メタデータ) (2026-06-24T22:40:46Z) - Latent Performance Profiling of Large Language Models [47.009623327601226]
隠れたアクティベーションと出力分布からタスクに依存しない診断を導出するフレームワークであるLatent Performance Profiling(LPP)を紹介する。
静的精度スコアとは異なり、LPPは同様のサイズのモデル間で安定でアーキテクチャに敏感なシグネチャを提供する。
類似のベンチマークスコアを持つモデルは、エントロピーや適応性の違いなど、対照的なプロファイルを示すことができることを示す。
論文 参考訳(メタデータ) (2026-05-28T14:41:26Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks [0.36748639131154315]
本研究は、確立されたベンチマーク設定の堅牢性を調査し、本質的なバイアスを測定する方法を検討する。
本実験では,評価設定が変更された場合のベンチマーク動作に有意な差がみられた。
モデル固有の不安定性を観察し、より堅牢で包括的な安全性評価フレームワークの必要性を明確に示す。
論文 参考訳(メタデータ) (2026-05-11T14:27:39Z) - Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone [11.663456969895462]
機械学習におけるアライメント評価は、主にモデルの評価となっている。
本稿では, モデルレベルの評価だけでは, 配置関連アライメントを推定できないことを論じる。
論文 参考訳(メタデータ) (2026-05-06T03:28:30Z) - IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation [85.56193980646981]
命令追従のための総合的メタ評価ベンチマークであるIF-RewardBenchを提案する。
各命令に対して、複数の応答間の全てのペアの選好を含む選好グラフを構築する。
IF-RewardBenchの実験は、現在の審査モデルに重大な欠陥を呈している。
論文 参考訳(メタデータ) (2026-03-05T02:21:17Z) - Benchmark^2: Systematic Evaluation of LLM Benchmarks [66.2731798872668]
3つの相補的なメトリクスからなる包括的なフレームワークであるBenchmark2を提案する。
数学、推論、知識ドメインにまたがる15のベンチマークで実験を行います。
本分析により,既存のベンチマーク間での有意な品質変化が明らかとなり,選択的なベンチマーク構築が同等な評価性能を達成できることが示されている。
論文 参考訳(メタデータ) (2026-01-07T14:59:03Z) - The Flaw of Averages: Quantifying Uniformity of Performance on Benchmarks [32.00464870277127]
本稿では,分布の観点からベンチマークの信頼性について検討し,ベンチマークの調和を導入する。
高調和性は望ましいベンチマーク特性であり、凝集度がモデル間の均一なコンピテンスを反映していることを示している。
正確さとともに調和を報告することを推奨することで、単純なパフォーマンス平均から、より堅牢で分散的に信頼性の高いパフォーマンス測定まで、評価を見直します。
論文 参考訳(メタデータ) (2025-09-30T02:14:30Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Generating Benchmarks for Factuality Evaluation of Language Models [61.69950787311278]
FACTOR: Factual Assessment via Corpus Transformation, a scalable approach for LM factuality。
FACTORは、興味のある事実のコーパスをLMの正当性を評価するベンチマークに自動的に変換し、コーパスから真事実を生成する。
その結果, (i) ベンチマークスコアはモデルサイズに応じて増加し, LMが検索によって拡張されたときに向上する; (ii) ベンチマークスコアとパープレキシティは必ずしもモデルランキングに一致しない; (iii) パープレキシティとベンチマークスコアが一致しない場合, 後者はオープンエンド世代における事実性を反映する。
論文 参考訳(メタデータ) (2023-07-13T17:14:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。