論文の概要: Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation
- arxiv url: http://arxiv.org/abs/2608.00794v3
- Date: Wed, 05 Aug 2026 05:37:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.036362
- Title: Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation
- Title(参考訳): 妥当性のない測定:エージェントAI評価における複合信頼性問題
- Authors: William Caban,
- Abstract要約: エージェントAI評価パイプラインは、デプロイメント決定、安全認定、規制コンプライアンス要求を正当化するベンチマークスコアを生成する。
正式なフレームワークはまだ、これらのパイプラインのステージにおける妥当性の低下を特徴付けていない。
本稿では,タスク生成,人間シミュレーションキャリブレーション,自動判定の3層合成妥当性モデルを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic AI evaluation pipelines produce benchmark scores that justify deployment decisions, safety certifications, and regulatory compliance claims. No formal framework has yet characterized how validity degrades across the stages of these pipelines. We present a three-layer compounding validity model, V_total <= V_1 x V_2 x V_3, that captures multiplicative degradation across task generation (V_1), human-simulator calibration (V_2), and automated judgment (V_3). Under empirically grounded estimates, a pipeline retaining 70% validity at each stage is at most 34% valid against the intended construct (range 0.22--0.54). We validate the model against a structured survey of 55 published agentic evaluation papers, finding that approximately 82% apply structurally mismatched, incomplete, or absent inter-rater reliability (IRR) metrics---a pattern consistent with systematic V_3 collapse. We further identify empirical evidence of V_1 failures (task validity flaws in 7 of 10 popular benchmarks) and V_2 miscalibration (up to 9 percentage points inter-simulator variance, with systematic demographic disparities for non-Standard American English speakers). We derive eight prescriptions grounded in psychometric science and domain-stratified reliability thresholds (ICC>=0.70; alpha >= 0.67/0.70/0.80 by consequence level) that practitioners and benchmark authors can apply immediately. The framework provides a tractable knowledge-based tool for diagnosing and correcting evaluation pipeline validity before deployment decisions are made.
- Abstract(参考訳): エージェントAI評価パイプラインは、デプロイメント決定、安全認定、規制コンプライアンス要求を正当化するベンチマークスコアを生成する。
正式なフレームワークはまだ、これらのパイプラインのステージにおける妥当性の低下を特徴付けていない。
本稿では,タスク生成(V_1),人間シミュレーションキャリブレーション(V_2),自動判定(V_3)の3層複合妥当性モデルであるV_total <= V_1 x V_2 x V_3を提案する。
経験的根拠に基づく推定では、各段階で70%の有効性を保ったパイプラインは、意図された構成に対して少なくとも34%有効である(0.22-0.54の範囲)。
我々は,55件のエージェント評価論文の構造化調査に対して,約82%が構造的ミスマッチ,不完全,不完全,あるいは不完全,レータ間信頼度(IRR)の指標を適用し,系統的なV_3崩壊と整合したパターンを検証した。
さらに、V_1故障(人気ベンチマーク10件中7件のタスク妥当性の欠陥)とV_2誤校正(シミュレーション間差異最大9ポイント、非標準アメリカ英語話者の体系的人口格差)の実証的証拠を明らかにした。
我々は,臨床医やベンチマーク研究者が直ちに適用できる,心身医学とドメイン階層化信頼性閾値(ICC>=0.70; α >= 0.67/0.70/0.80)の8つの処方薬を導出する。
このフレームワークは、デプロイメント決定が行われる前に評価パイプラインの妥当性を診断し、修正するための、抽出可能な知識ベースのツールを提供する。
関連論文リスト
- ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents [0.0]
小さな言語モデルからの正しい回答の50~69%は、根本的な欠陥のある推論を含んでいる。
本稿では,レイタ間合意を実質的に検証したプロセスベース計量であるReasoning Integrity Score(RIS)を紹介する。
メタ認知は十分なモデルキャパシティを伴わずに混乱を増幅するのに対し、RAGは外部のエビデンスに基礎を置き、エラーを7.6%削減する。
論文 参考訳(メタデータ) (2026-01-01T23:54:15Z) - Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems [3.215065407261898]
大規模言語モデルと外部ツールを組み合わせたマルチエージェントシステムは、研究機関からハイテイクドメインへと急速に移行している。
この「先進的な」続編は、アルゴリズムのインスタンス化や経験的な証拠を提供することで、そのギャップを埋める。
AMDMは擬似ゴールドリフトで異常検出遅延を12.3秒から5.6秒に減らし、偽陽性率を4.5%から0.9%に下げる。
論文 参考訳(メタデータ) (2025-08-28T15:52:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。