論文の概要: Prediction-Powered Smoothing and Validation for Disaggregated AI Evaluation
- arxiv url: http://arxiv.org/abs/2609.20758v1
- Date: Thu, 17 Sep 2026 17:42:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.407868
- Title: Prediction-Powered Smoothing and Validation for Disaggregated AI Evaluation
- Title(参考訳): 分散AI評価のための予測駆動平滑化と検証
- Abstract要約: 我々はAIシステムの評価と検証のための統合ワークフローを開発する。
推定のために,各領域の予測駆動推定に適合するベイズモデルである予測駆動平滑化(PP-S)を提案する。
検証のために、直進的および平滑な推定器の中から選択するための、ほぼ偏りのない設計に基づくクロスバリデーションスコアを導出する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating an AI system requires disaggregated assessment, as performance varies across domains such as benchmark task types or conversation types in deployed agents. Exhaustive testing is expensive, so evaluation rests on a sample of labeled units. We treat the evaluation set as a finite population and seek accurate point and interval estimates of each domain mean. Direct estimators, including prediction-powered inference (PPI), use only a domain's own labels and are imprecise where labels are few. Small area estimation addresses this problem, and we build on it to develop an integrated workflow for estimation and validation. For estimation, we propose prediction-powered smoothing (PP-S), a Bayesian model fit to each domain's prediction-powered estimate, with an extension that borrows strength across a reporting taxonomy (PP-TS). For validation, we derive a new, approximately unbiased design-based cross-validation score for choosing among direct and smoothed estimators. We study a curated benchmark with verifiable grading and deployed agent traffic graded by humans, each with every outcome observed. In both, the proposed estimators improve on the direct estimators in point and interval estimation, with near-nominal coverage. At the same sampling budget, our score selects as well as an independent validation sample does and estimates the selected estimator's error far more accurately.
- Abstract(参考訳): AIシステムを評価するには、デプロイされたエージェントのベンチマークタスクタイプや会話タイプなど、パフォーマンスがドメインによって異なるため、非集約的な評価が必要である。
排気試験は高価であるため、評価はラベル付きユニットのサンプルに依存する。
評価セットを有限集団として扱い,各領域の平均点と間隔の正確な推定を求める。
予測駆動推論(PPI)を含む直接推定器は、ドメイン自身のラベルのみを使用し、ラベルが少ない場所では不正確である。
小領域推定ではこの問題に対処し,評価と検証のための統合ワークフローを構築する。
予測型スムーシング(PP-S)は,各領域の予測型推定に適合するベイズモデルである。
検証のために、直進的および平滑な推定器の中から選択するための、ほぼ偏りのない設計に基づくクロスバリデーションスコアを導出する。
検証可能なグレーティングと展開エージェントのトラフィックを人間によって評価し,それぞれが観察結果のすべてで評価した。
いずれの場合も、提案した推定器は、ほぼ最小のカバレッジで、点推定と区間推定において直接推定器を改善する。
同じサンプリング予算で、我々のスコアは独立した検証サンプルと同様に選択され、選択した推定器の誤差をはるかに正確に推定する。
関連論文リスト
- CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion [65.53153291902454]
コラボレーティブ・アセスメント(CollabEval)は、異なるモデルの歴史的実行間の依存関係を同じタスクで活用し、統計的効率を改善するための、シンプルで効果的で原則化された方法である。
スコア行列の低ランク近似を構築し、再構成された値を用いて真の評価基準平均の偏りのない推定を保証します。
その結果,CollabEval では,平均信頼区間サイズと点推定値の平均2乗誤差を,同じアノテーション予算における基準手法と比較して大幅に削減できることがわかった。
論文 参考訳(メタデータ) (2026-07-06T13:22:04Z) - Fault-Tolerant Evaluation for Sample-Efficient Model Performance Estimators [13.227055178509524]
本稿では, バイアスと分散を考慮した耐障害性評価フレームワークを提案する。
我々は、$varepsilon$の適切なキャリブレーションにより、異なる分散状態の信頼性が保証されることを示す。
実世界のデータセットの実験は、我々のフレームワークが推定器の振る舞いに関する包括的で実行可能な洞察を提供することを示した。
論文 参考訳(メタデータ) (2026-02-06T22:14:46Z) - A Unified Evaluation Framework for Epistemic Predictions [4.881392509032435]
本稿では,不確実性認識型分類器の統一評価フレームワークを提案する。
ユーザは、適切に設計されたパフォーマンス指標を使用して、精度と予測精度のトレードオフを調整できる。
これにより、所望のトレードオフの関数として、特定の現実世界のアプリケーションに最も適したモデルを選択することができる。
論文 参考訳(メタデータ) (2025-01-28T12:59:29Z) - SureMap: Simultaneous Mean Estimation for Single-Task and Multi-Task Disaggregated Evaluation [75.56845750400116]
分散評価(disaggregated evaluation) -- 異なるサブポピュレーション上での機械学習モデルのパフォーマンスの推定 - は、AIシステムのパフォーマンスとグループフェアネスを評価する上で、中核的なタスクである。
ブラックボックスモデルの評価において,マルチタスクとシングルタスクの双方に対して高い推定精度を持つSureMapを開発した。
提案手法は, ウェル・チョーゼンを用いた最大後部推定と, スタインの非バイアスリスク推定(SURE)によるクロスバリデーションフリーチューニングを併用する。
論文 参考訳(メタデータ) (2024-11-14T17:53:35Z) - Semiparametric conformal prediction [79.6147286161434]
ベクトル値の非整合性スコアの結合相関構造を考慮した共形予測セットを構築する。
スコアの累積分布関数(CDF)を柔軟に推定する。
提案手法は,現実の回帰問題に対して,所望のカバレッジと競争効率をもたらす。
論文 参考訳(メタデータ) (2024-11-04T14:29:02Z) - Leveraging Variational Autoencoders for Parameterized MMSE Estimation [10.141454378473972]
条件付き線形最小二乗誤差推定器のパラメータ化のための変分オートエンコーダに基づくフレームワークを提案する。
導出した推定器は、推定問題の生成前として変分オートエンコーダを用いて最小平均2乗誤差推定器を近似する。
提案手法と最小平均二乗誤差推定器の差分を限定して厳密な解析を行う。
論文 参考訳(メタデータ) (2023-07-11T15:41:34Z) - Leveraging Unlabeled Data to Predict Out-of-Distribution Performance [63.740181251997306]
実世界の機械学習デプロイメントは、ソース(トレーニング)とターゲット(テスト)ディストリビューションのミスマッチによって特徴づけられる。
本研究では,ラベル付きソースデータとラベルなしターゲットデータのみを用いて,対象領域の精度を予測する手法を検討する。
本稿では,モデルの信頼度をしきい値として学習し,精度をラベルなし例のごく一部として予測する実践的手法である平均閾値保持信頼度(ATC)を提案する。
論文 参考訳(メタデータ) (2022-01-11T23:01:12Z) - Estimating Gradients for Discrete Random Variables by Sampling without
Replacement [93.09326095997336]
我々は、置換のないサンプリングに基づいて、離散確率変数に対する期待値の偏りのない推定器を導出する。
推定器は3つの異なる推定器のラオ・ブラックウェル化として導出可能であることを示す。
論文 参考訳(メタデータ) (2020-02-14T14:15:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。