論文の概要: Auditing MCQA Benchmarks through Probability Landscapes
- arxiv url: http://arxiv.org/abs/2608.30372v1
- Date: Mon, 31 Aug 2026 07:28:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.283229
- Title: Auditing MCQA Benchmarks through Probability Landscapes
- Title(参考訳): 確率景観によるMCQAベンチマークの検証
- Abstract要約: 本稿では,複数の質問応答ベンチマークを監査するための2成分確率的フレームワークを提案する。
ベンチマークレベルの分析では、トップ予測確率を用いて確率景観を特徴付ける。
アイテムレベルの診断では、ノイズ注入を導入し、意味のあるトラクタ競合を減らす。
- 参考スコア(独自算出の注目度): 15.39409235702177
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Large Language Models rapidly advance, performance on standard multiple-choice question answering (MCQA) benchmarks is reaching saturation. While the community has responded by developing increasingly difficult datasets, validating question quality and filtering flawed items remains a labor-intensive process. To provide a scalable diagnostic approach, we propose a two-component probabilistic framework for auditing MCQA benchmarks using model output distributions. First, for benchmark-level analysis, we characterize the probability landscape using the top prediction probability ($P_{top1}$) and normalized residual entropy ($H_{norm}$), summarized globally by Mean Pairwise Distance (MPD). Second, for item-level diagnostics, we introduce noise injection to reduce meaningful distractor competition, enabling us to flag candidate items for targeted human review and categorize residual failure patterns. Across four MCQA benchmarks, our landscape analysis reveals benchmark-level differences in model confidence and residual option competition. Concurrently, our noise-injection method flags potentially actionable item-level issues, showing alignment with expert error annotations from MMLU-Redux. These results suggest that our probability-based framework provides a lightweight audit lens for comparing macro-level benchmark structure and prioritizing individual items for targeted human review.
- Abstract(参考訳): 大規模言語モデルが急速に進歩するにつれて、標準のMCQA(Multiple-choice Question answering)ベンチマークのパフォーマンスは飽和状態に達している。
コミュニティはますます難しいデータセットを開発することで対応してきたが、質問の品質の検証と欠陥項目のフィルタリングは労働集約的なプロセスのままである。
スケーラブルな診断手法として,モデル出力分布を用いたMCQAベンチマーク監査のための2成分確率的フレームワークを提案する。
まず,トップ予測確率(P_{top1}$)と正規化残差エントロピー(H_{norm}$)を用いて,ベンチマークレベルの解析を行う。
第2に、アイテムレベルの診断において、ノイズインジェクションを導入し、意味のあるトラヒックの競合を減らし、対象とする人間レビューの候補項目をフラグ付けし、残留故障パターンを分類する。
MCQAの4つのベンチマークでは,モデル信頼性と残留オプション競合のベンチマークレベル差が明らかになった。
同時に、当社のノイズ注入手法は、MMLU-Reduxのエキスパートエラーアノテーションとの整合性を示す、潜在的に実行可能なアイテムレベルの問題をフラグ化します。
これらの結果から,我々の確率ベースフレームワークは,マクロレベルのベンチマーク構造を比較し,対象とする評価項目を優先順位付けするための軽量な監査レンズを提供する可能性が示唆された。
関連論文リスト
- PACE: A Proxy for Agentic Capability Evaluation [60.3743414796937]
PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
論文 参考訳(メタデータ) (2026-07-02T10:59:03Z) - When Metrics Disagree: A Meta-Analysis of Knowledge-Graph-Completion Model Benchmarking [0.0]
本稿では, 整合性, クロスデータセット安定性, 距離独立性, 雑音下での頑健性, 一般化性という, 5つのテストにまたがる7つのアグリゲータのメタ分析について述べる。
Across tail $(h,r,?)$ and relation $(h,?,t)$ prediction, Z-score is the most balanced aggregator, which rank of DualE highest for tail prediction, FMS highest for relation prediction。
このフレームワークは、評価の不整合を解消し、KGCにおけるアグリゲータの選択とモデルベンチマークのためのエビデンスベースのガイダンスを提供する。
論文 参考訳(メタデータ) (2026-06-09T01:20:43Z) - Tailoring Strictly Proper Scoring Rules for Downstream Tasks: An Application to Causal Inference [48.78219918881965]
本稿では,ダウンストリーム誤差メトリックの局所曲率をマッチングすることにより,タスク固有の厳密なスコアリングルールを導出するフレームワークを提案する。
これを平均処理効果 (ATE) 推定に適用し, 閉形式損失と対応する正準確率写像を導出する。
論文 参考訳(メタデータ) (2026-06-02T08:41:25Z) - Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces [14.997092856930061]
Filtered Reasoning Score (FRS)は、最も確実なトレースの上位K%だけを使用して推論品質を計算する。
本稿では,忠実さ,一貫性,実用性,事実性といった次元に沿った推論トレースを評価する推論スコアを提案する。
論文 参考訳(メタデータ) (2026-04-13T19:37:09Z) - Learning Ordinal Probabilistic Reward from Preferences [25.069054134899744]
確率的リワードモデル(PRM: Probabilistic Reward Model)を提案する。
提案手法では,報酬を決定論的スカラーとしてモデル化する代わりに,ランダム変数として扱い,各応答の品質の完全な確率分布を学習する。
OPRM上に構築したRerea Flooding Tuning(RgFT)と呼ばれるデータ効率のトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2026-02-13T06:43:02Z) - Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts [49.99400612296149]
強力な視覚的理解なしに、モデルが多くのベンチマークを達成できることがわかりました。
これは視覚的な入力を意図した視覚中心のベンチマークでは特に問題となる。
ベンチマーク設計には診断原則を採用しており、もしベンチマークをゲーム化できれば、それをゲーム化します。
論文 参考訳(メタデータ) (2025-11-06T18:43:21Z) - Do Bias Benchmarks Generalise? Evidence from Voice-based Evaluation of Gender Bias in SpeechLLMs [22.24010339935349]
特定のMCQA動作を誘導するために,LoRAアダプタを用いて3つのSpeechLLMを微調整する。
我々は、これらの振る舞いが別のMCQAベンチマークに一般化するかどうかを評価し、より重要なのは、長文で創造的なタスクである。
論文 参考訳(メタデータ) (2025-09-24T16:16:59Z) - Fluid Language Model Benchmarking [126.92394365620525]
我々は,複数の次元にわたるLMベンチマークを進展させる新しい評価手法であるFluid Benchmarkingを紹介する。
サイコメトリックスにインスパイアされたFluid Benchmarkingは、ベンチマーク項目の相対値がLMの能力レベルに依存するという洞察に基づいている。
効率性,妥当性,分散性,飽和性の4つの次元を検証した結果,Fluid Benchmarkingがすべてにおいて優れた性能を発揮することがわかった。
論文 参考訳(メタデータ) (2025-09-14T05:49:42Z) - Beyond the Singular: The Essential Role of Multiple Generations in Effective Benchmark Evaluation and Analysis [10.133537818749291]
大規模言語モデル(LLM)は、現実世界のアプリケーションにおいて重要なユーティリティを実証している。
LLMの能力を評価するにはベンチマーク評価が不可欠である。
論文 参考訳(メタデータ) (2025-02-13T03:43:33Z) - Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions [75.45274978665684]
VLU(Vision-Language Understanding)ベンチマークには、提供されたコンテキストによってサポートされない仮定に答えが依存するサンプルが含まれている。
サンプル毎にコンテキストデータを収集し,エビデンスに基づくモデル予測を促進するためにコンテキスト選択モジュールをトレーニングする。
我々は,十分なコンテキストを欠いたサンプルを同定し,モデル精度を向上させる汎用なコンテキスト・アワレ認識検出器を開発した。
論文 参考訳(メタデータ) (2024-05-18T02:21:32Z) - Query Performance Prediction using Relevance Judgments Generated by Large Language Models [53.97064615557883]
自動生成関連判定(QPP-GenRE)を用いた新しいクエリ性能予測(QPP)フレームワークを提案する。
QPP-GenREは、QPPを独立したサブタスクに分解し、ランクリスト内の各項目の関連性を所定のクエリに予測する。
我々は,オープンソースの大規模言語モデル (LLM) を用いて,科学的妥当性を確保することにより,項目の関連性を予測する。
論文 参考訳(メタデータ) (2024-04-01T09:33:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。