論文の概要: Bet on Features: Anytime-Valid and Feature-Aware Auditing of Conditional Quantile Forecasters
- arxiv url: http://arxiv.org/abs/2607.11653v1
- Date: Mon, 13 Jul 2026 15:04:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.520443
- Title: Bet on Features: Anytime-Valid and Feature-Aware Auditing of Conditional Quantile Forecasters
- Title(参考訳): Bet on Features: 条件付き量子フォアキャスタの任意のValidおよびFeature-Aware監査
- Abstract要約: ブラックボックス条件量子予測は、非対称コストの下でのシーケンシャルな決定に広く用いられている。
フォアキャスターは、より豊かな情報を持つ監査役に誤診されたまま、粗い情報を持つ監査役に目を向けることができる。
非損失のブラックボックス条件付き量子化予測器を継続的に監査するための分布自由ゲーム理論テストフレームワークを開発した。
- 参考スコア(独自算出の注目度): 4.458834881246723
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Black-box conditional quantile forecasts are widely used for sequential decisions under asymmetric costs, such as inventory planning in supply chain management. Once deployed, such forecasters must be monitored continuously as data streams drift and regimes change; this invalidates standard, fixed-horizon backtests for calibration. Further, existing backtests do not take into account that the notion of calibration is, in fact, information-dependent: forecasts can look calibrated to an auditor with coarse information while being miscalibrated to an auditor with richer information. We develop a distribution-free and game-theoretic testing framework for continuously auditing black-box conditional quantile forecasters with non-i.i.d. losses, such that the resulting evidence process is powerful against predictably chosen alternatives specified by the features available to the auditor. We first formalize notions of conditional quantile calibration when different sets of features are available to the auditor, establishing that the coarseness of the auditor's information set determines the hardness of the testing problem. We then identify the sets of alternatives for which the auditor can achieve power, and focusing on contextual bets linear in the features, we derive finite-time detection guarantees for such alternatives, all without an i.i.d. assumption. The resulting evidence processes are interpretable at the feature level, as they quantify fine-grained, "feature-aware" evidence for miscalibration. We empirically validate these methods on simulated and real data, finding that a popular time series forecaster (Chronos-2) is highly miscalibrated w.r.t. multiple relevant features.
- Abstract(参考訳): ブラックボックス条件量子予測は、サプライチェーン管理における在庫計画のような非対称なコストの下でのシーケンシャルな決定に広く用いられている。
一度デプロイされると、データストリームがドリフトしてレシエーションが変化するにつれて、そのような予測は継続的に監視されなければなりません。
さらに、既存のバックテストでは、キャリブレーションの概念が情報に依存していることを考慮していない。
我々は,ブラックボックス条件付き量子的予測器を非損失で連続的に監査し,その結果のエビデンスプロセスが,監査者に利用可能な機能によって規定される予測可能な代替品に対して強力であるような,分散フリーでゲーム理論的なテストフレームワークを開発した。
まず, 監査者の情報集合の粗さがテスト問題の硬さを決定することを確認し, 異なる特徴集合が監査者に利用可能である場合に, 条件量子校正の概念を定式化する。
次に、監査者が力を達成するための代替案の集合を特定し、特徴量に線形な文脈的賭けに焦点をあて、そのような代替案に対する有限時間検出保証を導出する。
結果として得られたエビデンスプロセスは機能レベルで解釈され、細粒度で「機能に見合った」誤診の証拠を定量化する。
我々はこれらの手法をシミュレーションおよび実データ上で実証的に検証し、人気時系列予測器(Chronos-2)が複数の関連する特徴について非常に誤解されていることを発見した。
関連論文リスト
- Bayesian control for coding agents [63.64172141184361]
本稿では,コーディングエージェントのためのコスト依存型シーケンシャル仮説テストフレームワークを提案する。
ベイズ管制官は、正確性に対する信念を維持し、より多くの証拠を集め、候補者を精査し、検証し、停止するかを決定する。
本研究では, 信頼状態が, 不確実性定量化のためのトークン確率と生ツール・サクセスベースラインを上回り, 解釈可能な正当性スコアを得ることを示す。
論文 参考訳(メタデータ) (2026-06-23T11:41:32Z) - Recipes for Calibration Checks in Safety-Critical Applications [0.0]
安全クリティカルな予測システムの校正チェックのためのフレームワークを提案する。
チェックは、予測器から収集されたデータに対して、単一の受け入れ/拒絶判定を生成する。
天気予報とロボットのポーズ推定という2つの相補的な事例にフレームワークの適用性を示す。
論文 参考訳(メタデータ) (2026-04-29T09:43:55Z) - Statistical Inference for Score Decompositions [0.0]
本稿では,評価関数を3つの解釈可能な成分に分割するスコア分解法を提案する。
調査インフレ予測では,総合的な予測能力がない場合でも,識別能力は著しく異なることが判明した。
バックテストのパフォーマンスから予測精度を遠ざけることで、現在の銀行規制における重大な欠点を明らかにする。
論文 参考訳(メタデータ) (2026-03-04T16:57:08Z) - Calibrating an Imperfect Auxiliary Predictor for Unobserved No-Purchase Choice [1.5484595752241122]
企業が競争相手から購入するか、買わないか、会社のオファーを十分に考慮するか、といった、主要な消費者行動を見ることができないのが一般的である。
この外部オプション情報が欠落しているため、単純なマルチノミアルロジット(MNL)モデルであっても、市場規模と嗜好の推定が困難になる。
我々は,ブラックボックス補助予測器が外部オプションの確率を提供する相補的な設定について検討するが,異なるチャネル,期間,集団で訓練されたため,バイアスや誤判定の可能性がある。
我々は、これらの不完全予測を、焦点からの購入専用データを用いた統計的に有効なノン購入推定に変換するキャリブレーション手法を開発した。
論文 参考訳(メタデータ) (2026-02-12T03:00:36Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - Provably Reliable Conformal Prediction Sets in the Presence of Data Poisoning [53.42244686183879]
コンフォーマル予測は、モデルに依存しない、分布のない不確実性定量化を提供する。
しかし、敵が訓練データと校正データを操作した場合の毒殺攻撃では、共形予測は信頼性が低い。
信頼性予測セット (RPS): 汚染下での信頼性保証を証明可能な共形予測セットを構築するための最初の効率的な方法を提案する。
論文 参考訳(メタデータ) (2024-10-13T15:37:11Z) - Calibration by Distribution Matching: Trainable Kernel Calibration
Metrics [56.629245030893685]
カーネルベースのキャリブレーションメトリクスを導入し、分類と回帰の両方で一般的なキャリブレーションの形式を統一・一般化する。
これらの指標は、異なるサンプル推定を許容しており、キャリブレーションの目的を経験的リスク最小化に組み込むのが容易である。
決定タスクにキャリブレーションメトリクスを調整し、正確な損失推定を行ない、後悔しない決定を行うための直感的なメカニズムを提供する。
論文 参考訳(メタデータ) (2023-10-31T06:19:40Z) - Sequential Kernelized Independence Testing [77.237958592189]
我々は、カーネル化依存度にインスパイアされたシーケンシャルなカーネル化独立試験を設計する。
シミュレーションデータと実データの両方にアプローチのパワーを実証する。
論文 参考訳(メタデータ) (2022-12-14T18:08:42Z) - A Review of Uncertainty Calibration in Pretrained Object Detectors [5.440028715314566]
多クラス設定における事前訓練対象検出アーキテクチャの不確実性校正特性について検討する。
公平でバイアスのない,繰り返し可能な評価を実現するためのフレームワークを提案する。
検出器のキャリブレーションが低い理由について、新しい知見を提供する。
論文 参考訳(メタデータ) (2022-10-06T14:06:36Z) - Distribution-Free, Risk-Controlling Prediction Sets [112.9186453405701]
ユーザ特定レベルにおける将来のテストポイントにおける期待損失を制御するブラックボックス予測器から設定値予測を生成する方法を示す。
提案手法は,予測セットのサイズをキャリブレーションするホールドアウトセットを用いて,任意のデータセットに対して明確な有限サンプル保証を提供する。
論文 参考訳(メタデータ) (2021-01-07T18:59:33Z) - Distribution-free binary classification: prediction sets, confidence
intervals and calibration [106.50279469344937]
分布自由条件における二項分類のための不確実性定量化(キャリブレーション、信頼区間、予測セット)の3つの概念について検討する。
固定幅と一様質量の両双対の双対確率に対する信頼区間を導出する。
我々の「三脚」定理の結果として、双有理確率に対するこれらの信頼区間は分布自由キャリブレーションに繋がる。
論文 参考訳(メタデータ) (2020-06-18T14:17:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。