論文の概要: Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation
- arxiv url: http://arxiv.org/abs/2608.00794v1
- Date: Sat, 01 Aug 2026 17:50:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.908384
- Title: Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation
- Title(参考訳): 妥当性のない測定:エージェントAI評価における複合信頼性問題
- Abstract要約: エージェントAIシステムは、デプロイメント決定、安全認証、規制コンプライアンス要求を正当化するスコアを正当化する自動ベンチマークを使用して評価される。
本研究は,これらのスコアが,現在の実践よりも体系的に信頼性が低いことを示す実証分析である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic AI systems are evaluated using automated benchmarks whose scores justify deployment decisions, safety certifications, and regulatory compliance claims. We present an empirical analysis demonstrating that these scores are systematically less trustworthy than current practice acknowledges. The problem operates at three compounding layers. First, tasks are increasingly generated by language models: audits of ten popular benchmarks found validity flaws in seven and reporting gaps in all ten. Second, human users are replaced by LLM simulators, but calibration studies document inter-simulator variance up to 9 percentage points and systematic directional miscalibration, particularly for non-Standard American English speakers. Third, our structured survey of 55 papers finds that approximately 82% apply structurally mismatched, incomplete, or absent inter-rater reliability (IRR) metrics. These failures compound multiplicatively rather than additively. Under independence, a pipeline retaining 70% of valid signal at task generation, 80% at simulation, and 65% at judgment is at most 36% valid against the intended construct; the bound spans 0.22--0.54 across the empirical estimate range. We formalize this as $V_{\text{total}} \leq V_1 \times V_2 \times V_3$ and show it tightens further under correlated failures when the same model family operates across all three layers. We derive eight prescriptions grounded in psychometric science: a simulation calibration floor of $\text{ICC}(A,1) \geq 0.70$; domain-stratified reliability thresholds ($α\geq 0.67$ / $0.70$ / $0.80$ by consequence level); structured IRR metric selection rules based on pipeline design; and IRR as a mandatory reporting field. The measurement tools exist; the field's task is to apply them.
- Abstract(参考訳): エージェントAIシステムは、デプロイメント決定、安全認証、規制コンプライアンス要求を正当化するスコアを正当化する自動ベンチマークを使用して評価される。
本研究は,これらのスコアが,現在の実践よりも体系的に信頼性が低いことを示す実証分析である。
問題は3つの複合層で機能する。
まず、タスクは言語モデルによってますます生成されます。10の人気のあるベンチマークの監査では、7つに妥当性の欠陥が見つかり、全10つにギャップが報告されています。
第二に、人間のユーザはLSMシミュレータに置き換えられるが、キャリブレーション研究はシミュレーション間の分散を最大9ポイント、系統的方向の誤校正を文書化している。
第3に、55件の構造化調査の結果、約82%が、構造的ミスマッチ、不完全、または不完全である。
これらの失敗は加法ではなく多元的に結合する。
独立下では、タスク生成時の有効信号の70%、シミュレーション時の80%、判断時の65%は、意図された構成に対して少なくとも36%有効である。
我々はこれを $V_{\text{total}} \leq V_1 \times V_2 \times V_3$ と定式化し、同じモデルファミリが3つのレイヤすべてにわたって動作する場合に、相関する障害の下でさらに強化することを示す。
シミュレーションキャリブレーションフロアは$\text{ICC}(A,1) \geq 0.70$, domain-stratified reliability thresholds (α\geq 0.67$ / $0.70$ / $0.80$ by result level), structured IRR metric selection rules based on pipeline design, IRR as a mandatory report field。
測定ツールは存在し、フィールドのタスクはそれらを適用することである。
関連論文リスト
- AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation [48.55515767840701]
AIスロープ(AI slop)は、アーティファクト、幻覚的脆弱性、可視だが正しくないパッチ、セマンティックに再パッケージされたバグレポートである。
本稿では,実証的証拠を調査し,統一メカニズムを特定し,信頼に値するトリアージへの道筋をたどる。
論文 参考訳(メタデータ) (2026-08-26T11:48:38Z) - Evidence-State Reliability Under Controlled Degradation: Parser-Validity Divergence in a Multi-Stage LLM Pipeline [1.6921396880325779]
下流のステージで利用可能な証拠が不完全になったり、圧縮されたり、矛盾したりしても、マルチステージのLSMパイプラインは構造的に有効である。
本稿では, 中間的証拠が十分に完全であり, 基礎的であり, 内部的整合性があり, ステージに割り当てられた機能に利用できるかどうかを評価するための評価層であるエビデンス・ステート・信頼性(ESR)を紹介し, 運用する。
GLM-5.2を4つの証拠条件 (清浄, 圧縮, 部分ドロップアウト, ノイズ・コンフリクト) で評価した。
論文 参考訳(メタデータ) (2026-08-21T18:50:13Z) - DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making [0.7699235580548228]
DFAH-Benchは、金融業者の意思決定における観測可能な行動不安定性を測定するリプレイベンチマークである。
同じツールパスに従っている間、フロンティアモデルは95%の時間で決定に合意できるのは77%に過ぎません。
入力によらず1つの出力に崩壊することでほぼ完全な一致を達成できるパターンマッチング,比較的一貫したツール使用プロセスを持つ安定した実行器,そして物質的に異なるツールパスとエビデンスコンタクトを通じて同じ結論に達する軌道分岐器の3つの挙動プロファイルを同定する。
論文 参考訳(メタデータ) (2026-06-10T03:31:09Z) - Evidence-Grounded Ensemble Diagnosis of 802.11 Packet Captures: A Multi-Stage Pipeline with Deterministic Reliability Scoring [1.0170129555792935]
802.11パケットキャプチャの診断には、専門家のプロトコル知識が必要で、遅く、エンジニア間で一貫性がなく、スケールできない。
LLMベースのアプローチは、キャプチャーから欠落するが製造されたプロトコルイベントを聴取し、未校正された信頼スコアを生成し、テスト中のモデルによって黄金の基準が共同生成されると評価バイアスを被る。
PROBEは3つの障害に対処する多段階パイプラインである。
論文 参考訳(メタデータ) (2026-06-05T03:39:58Z) - Agentic Proving for Program Verification [44.663012714194025]
エージェントシステムは、形式数学における自動定理証明のための最先端のアプローチとして登場した。
検証可能なコード生成のためのLean 4ベンチマークであるCLEVERのエージェント証明フレームワークでClaude Codeを評価した。
論文 参考訳(メタデータ) (2026-05-22T15:41:27Z) - RISED: A Pre-Deployment Safety Evaluation Framework for Clinical AI Decision-Support Systems [0.0]
本稿では,信頼性,指数性,感度,等価性,展開性に関する5次元事前デプロイ評価を提案する。
RISEDはオープンソースのPythonパッケージとしてリリースされ、既存の臨床AIレポート標準の量的検証を提供する。
論文 参考訳(メタデータ) (2026-05-13T02:17:13Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - SAAG: Structured Agent Assessment and Grounding [13.62148061055744]
本稿では,エージェント呼び出し評価を3段階に分解するケースケード診断フレームワークを提案する。
このフレームワークは,5,10,15エージェントのレジストリサイズにまたがって,Glaiveの関数呼び出しデータセットから得られたベンチマークで評価する。
論文 参考訳(メタデータ) (2026-04-30T19:33:58Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents [0.0]
小さな言語モデルからの正しい回答の50~69%は、根本的な欠陥のある推論を含んでいる。
本稿では,レイタ間合意を実質的に検証したプロセスベース計量であるReasoning Integrity Score(RIS)を紹介する。
メタ認知は十分なモデルキャパシティを伴わずに混乱を増幅するのに対し、RAGは外部のエビデンスに基礎を置き、エラーを7.6%削減する。
論文 参考訳(メタデータ) (2026-01-01T23:54:15Z) - Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems [3.215065407261898]
大規模言語モデルと外部ツールを組み合わせたマルチエージェントシステムは、研究機関からハイテイクドメインへと急速に移行している。
この「先進的な」続編は、アルゴリズムのインスタンス化や経験的な証拠を提供することで、そのギャップを埋める。
AMDMは擬似ゴールドリフトで異常検出遅延を12.3秒から5.6秒に減らし、偽陽性率を4.5%から0.9%に下げる。
論文 参考訳(メタデータ) (2025-08-28T15:52:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。