論文の概要: Can We Trust Item Response Theory for AI Evaluation?
- arxiv url: http://arxiv.org/abs/2607.15190v2
- Date: Fri, 17 Jul 2026 07:01:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.573194
- Title: Can We Trust Item Response Theory for AI Evaluation?
- Title(参考訳): AI評価のための項目応答理論を信頼できますか?
- Authors: Han Jiang, Sunbeom Kwon, Jinwen Luo, Ziang Xiao, Susu Zhang,
- Abstract要約: AIベンチマークは、アイテムレベルの統計モデルを活用して、能力の推定、ランクシステム、情報的サンプルの選択、ベンチマーク品質の診断を行う。
IRTツールは当初、人間のテスト用に開発されたが、AIベンチマークには、スキューやクラスタ化、マルチモーダルといった、より少ないモデル、はるかに多くのアイテム、能力分布が含まれることが多い。
本研究では、これらの制度が、AI評価のためのIRTモデリングの信頼性にどのように不適合しているかを検討する。
- 参考スコア(独自算出の注目度): 10.509963423246974
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: AI benchmarks increasingly leverage item-level statistical models, particularly item response theory (IRT), to estimate model capabilities, rank systems, select informative examples, and diagnose benchmark quality. However, AI benchmark data often departs from the data regime of human testing, for which standard IRT estimation tools were originally developed: benchmarks typically involve fewer evaluated models, far more items, and capability distributions that may be skewed, clustered, or multimodal. We examine how these regime mismatches challenge the reliability of IRT modeling for AI evaluation. Using item parameters and capability distributions derived from six widely used LLM benchmarks, we simulate response matrices under three common IRT models and compare four estimation tools used in recent benchmark studies: marginal maximum likelihood, Markov chain Monte Carlo, variational inference, and a neural pseudo-Siamese estimator. Across 18,000 simulation conditions, we systematically evaluate computational feasibility, scalability, and the reliability of IRT inferences about model rankings, predicted performance, and item characteristics. Results show that classical estimators can become infeasible in large benchmark settings, whereas scalable estimators can produce unreliable item-level and ranking inferences with small or non-normally distributed model sets. This study identifies when latent trait models reliably support or risk distorting AI benchmarking claims, and what sample sizes and diagnostics are needed for trustworthy use.
- Abstract(参考訳): AIベンチマークは、アイテムレベルの統計モデル、特にアイテム応答理論(IRT)を活用して、モデル能力、ランクシステム、情報的サンプルの選択、ベンチマーク品質の診断を行う。
しかし、AIベンチマークのデータはしばしば人間のテストのデータ体制から逸脱し、標準的なIRT推定ツールはもともと開発され、ベンチマークは通常、より少ない評価モデル、はるかに多くのアイテム、スキュー、クラスタ化、マルチモーダルの能力分布を含む。
我々は、これらの制度が、AI評価のためのIRTモデリングの信頼性にどのように不適合しているかを検討する。
6つの LLM ベンチマークから得られた項目パラメータと能力分布を用いて、3つの共通IRTモデルに基づいて応答行列をシミュレートし、最近のベンチマーク研究で用いられる4つの推定ツールを比較する。
18,000のシミュレーション条件で、モデルランキング、予測性能、アイテム特性に関するIRT推論の計算可能性、スケーラビリティ、信頼性を体系的に評価する。
以上の結果から,大規模なベンチマーク設定では古典的推定が不可能となる一方で,拡張性のある推定器では信頼性の低い項目レベルの推定や,小規模あるいは非正規分布のモデルセットによるランキング推定が可能であることが示唆された。
この研究は、潜在特性モデルがAIベンチマークの主張を確実に支持するか、あるいは歪ませるか、そして信頼できる使用のためにどのようなサンプルサイズと診断が必要かを特定する。
関連論文リスト
- First-Order Efficiency for Probabilistic Value Estimation via A Statistical Viewpoint [18.696678371045216]
本稿では,サンプリング法則を直接選択し,第1次MSEを最小化する効率性を考慮したサロゲート調整型推定器(EASE)を提案する。
我々は、EASEが様々な確率値に対して常に最先端の推定値を上回ることを実証する。
論文 参考訳(メタデータ) (2026-05-04T17:02:17Z) - A Theoretical Framework for Statistical Evaluability of Generative Models [57.9316356505791]
本稿では、生成モデルを評価するための理論的枠組みを導入し、一般的なメトリクスに対する評価結果を確立する。
テストベースのメトリクス、例えば積分確率測定(IPM)とレニイ発散(Rényi divergences)の2つのカテゴリについて検討する。
任意の有界テストクラスに対するIPMは、乗法および加法近似誤差まで有限標本から評価できることを示す。
対照的に、レニイとKLの発散は、希少事象によってその値が批判的に決定されるため、有限標本から評価できない。
論文 参考訳(メタデータ) (2026-04-07T01:53:59Z) - Post-Selection Distributional Model Evaluation [31.006941545235396]
選択後分布モデル評価(PS-DME)
PS-DMEは任意のデータ依存モデル選択後に統計的に有効な分布モデル評価のためのフレームワークである。
結果:PS-DMEは,様々な信頼性レベルの候補構成の信頼性比較を可能にする。
論文 参考訳(メタデータ) (2026-03-24T10:51:30Z) - STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction [78.0692157478247]
本稿では,知識駆動型エージェント推論を用いて,データ駆動型静的予測を橋渡しするフレームワークSTARを提案する。
STARはスコアベースとランクベースの両方の基準線を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-12T16:30:07Z) - Benchmark^2: Systematic Evaluation of LLM Benchmarks [66.2731798872668]
3つの相補的なメトリクスからなる包括的なフレームワークであるBenchmark2を提案する。
数学、推論、知識ドメインにまたがる15のベンチマークで実験を行います。
本分析により,既存のベンチマーク間での有意な品質変化が明らかとなり,選択的なベンチマーク構築が同等な評価性能を達成できることが示されている。
論文 参考訳(メタデータ) (2026-01-07T14:59:03Z) - Model Correlation Detection via Random Selection Probing [62.093777777813756]
既存の類似性に基づく手法では、モデルパラメータにアクセスしたり、しきい値なしでスコアを生成する必要がある。
本稿では,モデル相関検出を統計的テストとして定式化する仮説テストフレームワークであるランダム選択探索(RSP)を紹介する。
RSPは相関の証拠を定量化する厳密なp-値を生成する。
論文 参考訳(メタデータ) (2025-09-29T01:40:26Z) - Beyond the Singular: The Essential Role of Multiple Generations in Effective Benchmark Evaluation and Analysis [10.133537818749291]
大規模言語モデル(LLM)は、現実世界のアプリケーションにおいて重要なユーティリティを実証している。
LLMの能力を評価するにはベンチマーク評価が不可欠である。
論文 参考訳(メタデータ) (2025-02-13T03:43:33Z) - Don't Make Your LLM an Evaluation Benchmark Cheater [142.24553056600627]
大規模言語モデル(LLM)は人工知能のフロンティアを大幅に進歩させ、モデルキャパシティを著しく向上させた。
モデル性能を評価するために, LLMの能力レベルを測定するための評価ベンチマークを構築するのが典型的な方法である。
評価ベンチマークを用いて不適切なリスクと影響について検討し,評価結果を誤って解釈する。
論文 参考訳(メタデータ) (2023-11-03T14:59:54Z) - How Faithful is your Synthetic Data? Sample-level Metrics for Evaluating
and Auditing Generative Models [95.8037674226622]
ドメインに依存しない方法で生成モデルの忠実度,多様性,一般化性能を特徴付ける3次元評価指標を提案する。
当社のメトリクスは、精度リコール分析により統計的発散測定を統合し、モデル忠実度と多様性のサンプルおよび分布レベルの診断を可能にします。
論文 参考訳(メタデータ) (2021-02-17T18:25:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。