論文の概要: Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation
- arxiv url: http://arxiv.org/abs/2608.00794v3
- Date: Wed, 05 Aug 2026 05:37:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.036362
- Title: Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation
- Title(参考訳): 妥当性のない測定:エージェントAI評価における複合信頼性問題
- Abstract要約: エージェントAI評価パイプラインは、デプロイメント決定、安全認定、規制コンプライアンス要求を正当化するベンチマークスコアを生成する。
正式なフレームワークはまだ、これらのパイプラインのステージにおける妥当性の低下を特徴付けていない。
本稿では,タスク生成,人間シミュレーションキャリブレーション,自動判定の3層合成妥当性モデルを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic AI evaluation pipelines produce benchmark scores that justify deployment decisions, safety certifications, and regulatory compliance claims. No formal framework has yet characterized how validity degrades across the stages of these pipelines. We present a three-layer compounding validity model, V_total <= V_1 x V_2 x V_3, that captures multiplicative degradation across task generation (V_1), human-simulator calibration (V_2), and automated judgment (V_3). Under empirically grounded estimates, a pipeline retaining 70% validity at each stage is at most 34% valid against the intended construct (range 0.22--0.54). We validate the model against a structured survey of 55 published agentic evaluation papers, finding that approximately 82% apply structurally mismatched, incomplete, or absent inter-rater reliability (IRR) metrics---a pattern consistent with systematic V_3 collapse. We further identify empirical evidence of V_1 failures (task validity flaws in 7 of 10 popular benchmarks) and V_2 miscalibration (up to 9 percentage points inter-simulator variance, with systematic demographic disparities for non-Standard American English speakers). We derive eight prescriptions grounded in psychometric science and domain-stratified reliability thresholds (ICC>=0.70; alpha >= 0.67/0.70/0.80 by consequence level) that practitioners and benchmark authors can apply immediately. The framework provides a tractable knowledge-based tool for diagnosing and correcting evaluation pipeline validity before deployment decisions are made.
- Abstract(参考訳): エージェントAI評価パイプラインは、デプロイメント決定、安全認定、規制コンプライアンス要求を正当化するベンチマークスコアを生成する。
正式なフレームワークはまだ、これらのパイプラインのステージにおける妥当性の低下を特徴付けていない。
本稿では,タスク生成(V_1),人間シミュレーションキャリブレーション(V_2),自動判定(V_3)の3層複合妥当性モデルであるV_total <= V_1 x V_2 x V_3を提案する。
経験的根拠に基づく推定では、各段階で70%の有効性を保ったパイプラインは、意図された構成に対して少なくとも34%有効である(0.22-0.54の範囲)。
我々は,55件のエージェント評価論文の構造化調査に対して,約82%が構造的ミスマッチ,不完全,不完全,あるいは不完全,レータ間信頼度(IRR)の指標を適用し,系統的なV_3崩壊と整合したパターンを検証した。
さらに、V_1故障(人気ベンチマーク10件中7件のタスク妥当性の欠陥)とV_2誤校正(シミュレーション間差異最大9ポイント、非標準アメリカ英語話者の体系的人口格差)の実証的証拠を明らかにした。
我々は,臨床医やベンチマーク研究者が直ちに適用できる,心身医学とドメイン階層化信頼性閾値(ICC>=0.70; α >= 0.67/0.70/0.80)の8つの処方薬を導出する。
このフレームワークは、デプロイメント決定が行われる前に評価パイプラインの妥当性を診断し、修正するための、抽出可能な知識ベースのツールを提供する。
関連論文リスト
- AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation [48.55515767840701]
AIスロープ(AI slop)は、アーティファクト、幻覚的脆弱性、可視だが正しくないパッチ、セマンティックに再パッケージされたバグレポートである。
本稿では,実証的証拠を調査し,統一メカニズムを特定し,信頼に値するトリアージへの道筋をたどる。
論文 参考訳(メタデータ) (2026-08-26T11:48:38Z) - Evidence-State Reliability Under Controlled Degradation: Parser-Validity Divergence in a Multi-Stage LLM Pipeline [1.6921396880325779]
下流のステージで利用可能な証拠が不完全になったり、圧縮されたり、矛盾したりしても、マルチステージのLSMパイプラインは構造的に有効である。
本稿では, 中間的証拠が十分に完全であり, 基礎的であり, 内部的整合性があり, ステージに割り当てられた機能に利用できるかどうかを評価するための評価層であるエビデンス・ステート・信頼性(ESR)を紹介し, 運用する。
GLM-5.2を4つの証拠条件 (清浄, 圧縮, 部分ドロップアウト, ノイズ・コンフリクト) で評価した。
論文 参考訳(メタデータ) (2026-08-21T18:50:13Z) - DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making [0.7699235580548228]
DFAH-Benchは、金融業者の意思決定における観測可能な行動不安定性を測定するリプレイベンチマークである。
同じツールパスに従っている間、フロンティアモデルは95%の時間で決定に合意できるのは77%に過ぎません。
入力によらず1つの出力に崩壊することでほぼ完全な一致を達成できるパターンマッチング,比較的一貫したツール使用プロセスを持つ安定した実行器,そして物質的に異なるツールパスとエビデンスコンタクトを通じて同じ結論に達する軌道分岐器の3つの挙動プロファイルを同定する。
論文 参考訳(メタデータ) (2026-06-10T03:31:09Z) - Evidence-Grounded Ensemble Diagnosis of 802.11 Packet Captures: A Multi-Stage Pipeline with Deterministic Reliability Scoring [1.0170129555792935]
802.11パケットキャプチャの診断には、専門家のプロトコル知識が必要で、遅く、エンジニア間で一貫性がなく、スケールできない。
LLMベースのアプローチは、キャプチャーから欠落するが製造されたプロトコルイベントを聴取し、未校正された信頼スコアを生成し、テスト中のモデルによって黄金の基準が共同生成されると評価バイアスを被る。
PROBEは3つの障害に対処する多段階パイプラインである。
論文 参考訳(メタデータ) (2026-06-05T03:39:58Z) - Agentic Proving for Program Verification [44.663012714194025]
エージェントシステムは、形式数学における自動定理証明のための最先端のアプローチとして登場した。
検証可能なコード生成のためのLean 4ベンチマークであるCLEVERのエージェント証明フレームワークでClaude Codeを評価した。
論文 参考訳(メタデータ) (2026-05-22T15:41:27Z) - RISED: A Pre-Deployment Safety Evaluation Framework for Clinical AI Decision-Support Systems [0.0]
本稿では,信頼性,指数性,感度,等価性,展開性に関する5次元事前デプロイ評価を提案する。
RISEDはオープンソースのPythonパッケージとしてリリースされ、既存の臨床AIレポート標準の量的検証を提供する。
論文 参考訳(メタデータ) (2026-05-13T02:17:13Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - SAAG: Structured Agent Assessment and Grounding [13.62148061055744]
本稿では,エージェント呼び出し評価を3段階に分解するケースケード診断フレームワークを提案する。
このフレームワークは,5,10,15エージェントのレジストリサイズにまたがって,Glaiveの関数呼び出しデータセットから得られたベンチマークで評価する。
論文 参考訳(メタデータ) (2026-04-30T19:33:58Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents [0.0]
小さな言語モデルからの正しい回答の50~69%は、根本的な欠陥のある推論を含んでいる。
本稿では,レイタ間合意を実質的に検証したプロセスベース計量であるReasoning Integrity Score(RIS)を紹介する。
メタ認知は十分なモデルキャパシティを伴わずに混乱を増幅するのに対し、RAGは外部のエビデンスに基礎を置き、エラーを7.6%削減する。
論文 参考訳(メタデータ) (2026-01-01T23:54:15Z) - Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems [3.215065407261898]
大規模言語モデルと外部ツールを組み合わせたマルチエージェントシステムは、研究機関からハイテイクドメインへと急速に移行している。
この「先進的な」続編は、アルゴリズムのインスタンス化や経験的な証拠を提供することで、そのギャップを埋める。
AMDMは擬似ゴールドリフトで異常検出遅延を12.3秒から5.6秒に減らし、偽陽性率を4.5%から0.9%に下げる。
論文 参考訳(メタデータ) (2025-08-28T15:52:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。