論文の概要: Prediction-Powered Active Testing
- arxiv url: http://arxiv.org/abs/2607.08347v1
- Date: Thu, 09 Jul 2026 10:52:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.504335
- Title: Prediction-Powered Active Testing
- Title(参考訳): 予測駆動アクティブテスト
- Authors: Kianoosh Ashouritaklimi, Valentin Kilian, Daolang Huang, Tom Rainforth, François Caron,
- Abstract要約: アクティブテストは、どのテストポイントにラベルを付けるべきかを適応的に選択することで、リスク見積に対するラベル効率のよいアプローチを提供する。
本稿では,新しいラベル効率の高いリスク推定フレームワークであるbfbfPrediction-Powered Active Testing (PPAT)を提案する。
- 参考スコア(独自算出の注目度): 14.083979525233316
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Active testing provides a label--efficient approach to risk estimation by adaptively selecting which test points should be labelled. However, existing estimators fail to exploit the informative predictions of powerful black--box models, even though such predictions are increasingly available in settings where labels remain expensive. To address this, we propose \textbf{Prediction--Powered Active Testing (PPAT)}, a novel label--efficient risk estimation framework that combines the unbiased LURE estimator \citep{farquhar2021statistical} with a prediction--powered control variate. Rather than using proxy predictions as biased pseudo--labels, PPAT uses them to residualise the loss, preserving unbiasedness while reducing variance. Beyond the estimator itself, PPAT also changes which points should be acquired: we derive oracle and practical surrogate--based acquisition rules tailored to reducing the variance of our estimator. Moreover, we establish asymptotic normality for PPAT, yielding asymptotically valid confidence intervals and thus a principled estimate of the uncertainty around our estimates. Across tabular regression and image--classification tasks, PPAT outperforms existing methods in risk estimation, while its confidence intervals attain the target coverage with substantially fewer labels and smaller widths.
- Abstract(参考訳): アクティブテストは、どのテストポイントにラベルを付けるべきかを適応的に選択することで、リスク評価に対するラベル効率のよいアプローチを提供する。しかし、既存の推定器は、ラベルが高価なままの環境では、そのような予測がますます利用され続けているにもかかわらず、強力なブラックボックスモデルの情報的予測を活用できない。
そこで本研究では,未バイアスのLURE推定器であるcitep{farquhar2021statistical} と予測駆動の制御変数を組み合わせた,新たなラベル効率の高いリスク評価フレームワークである \textbf{Prediction--Powered Active Testing (PPAT) を提案する。
推定器自体の他に、推定器のばらつきを軽減するために、オラクルと実用的なサロゲートベースの取得ルールを導出するなど、どの点も変更する。さらに、PPATの漸近的正規性を確立し、漸近的に妥当な信頼区間を生じさせ、その結果、推定値に関する不確実性を原理的に推定する。表層回帰および画像分類タスク全体において、PPATは、既存のリスク推定手法よりも優れ、その信頼性間隔はラベルや幅が小さく、目標範囲がかなり小さい。
関連論文リスト
- Heuristic Pathologies and Further Variance Reduction via Uncertainty Propagation in the AIVAT Family of Techniques [62.94836578759359]
AIVAT推定の不確かさを定量化するために、不確実性がどのように伝播できるかを示す。
実験では,1万本のポーカーハンドのデータセットを用いて,病態と不確実性を示す。
論文 参考訳(メタデータ) (2026-05-14T02:04:26Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - TRUST: Test-time Resource Utilization for Superior Trustworthiness [15.031121920821109]
このようなノイズの影響を考慮し,より信頼性の高い信頼度推定を行う新しいテスト時間最適化法を提案する。
このスコアは単調なサブセット選択関数を定義し、低いスコアを持つサンプルを除去すると、集団の精度は一貫して上昇する。
論文 参考訳(メタデータ) (2025-06-06T12:52:32Z) - OT Score: An OT based Confidence Score for Source Free Unsupervised Domain Adaptation [2.6912673131004468]
本稿では,新しい理論解析から得られた信頼度尺度である最適輸送(OT)スコアを紹介する。
OTスコアは直感的に解釈でき、理論的には厳密である。
これは、任意の対象の擬ラベルの任意の集合に対して原則化された不確実性推定を提供する。
トレーニング時間の再重み付けによってSFUDAのパフォーマンスを改善し、モデルパフォーマンスのための信頼性の高いラベルなしプロキシを提供する。
論文 参考訳(メタデータ) (2025-05-16T20:09:05Z) - Uncertainty-Calibrated Test-Time Model Adaptation without Forgetting [65.21599711087538]
テスト時間適応(TTA)は、与えられたモデルw.r.t.を任意のテストサンプルに適用することにより、トレーニングデータとテストデータの間の潜在的な分散シフトに取り組むことを目指している。
事前の手法は各テストサンプルに対してバックプロパゲーションを実行するため、多くのアプリケーションに対して許容できない最適化コストがかかる。
本稿では, 有効サンプル選択基準を策定し, 信頼性および非冗長なサンプルを同定する, 効率的なアンチフォッティングテスト時間適応法を提案する。
論文 参考訳(メタデータ) (2024-03-18T05:49:45Z) - Model-Based Epistemic Variance of Values for Risk-Aware Policy Optimization [59.758009422067]
モデルベース強化学習における累積報酬に対する不確実性を定量化する問題を考察する。
我々は、解が値の真後分散に収束する新しい不確実性ベルマン方程式(UBE)を提案する。
本稿では,リスク・サーキングとリスク・アバース・ポリシー最適化のいずれにも適用可能な汎用ポリシー最適化アルゴリズムQ-Uncertainty Soft Actor-Critic (QU-SAC)を導入する。
論文 参考訳(メタデータ) (2023-12-07T15:55:58Z) - Distribution-free uncertainty quantification for classification under
label shift [105.27463615756733]
2つの経路による分類問題に対する不確実性定量化(UQ)に焦点を当てる。
まず、ラベルシフトはカバレッジとキャリブレーションの低下を示すことでuqを損なうと論じる。
これらの手法を, 理論上, 分散性のない枠組みで検討し, その優れた実用性を示す。
論文 参考訳(メタデータ) (2021-03-04T20:51:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。