論文の概要: The Calibration Channel Determines the Bayes-Error Proxy: An Exact Law for Temperature-Induced Distortion
- arxiv url: http://arxiv.org/abs/2607.18162v1
- Date: Mon, 20 Jul 2026 17:07:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.716213
- Title: The Calibration Channel Determines the Bayes-Error Proxy: An Exact Law for Temperature-Induced Distortion
- Title(参考訳): Calibration Channel Determines the Bayes-Error Proxy: an Exact Law for temperature-induced Distortion (特集 ベイズ・エラー・プロキシ)
- Abstract要約: 石田らによるベイズエラー推定器ベータ(z) = E[min(z, 1-z)] は、確率値ラベルから直接二進タスクの既約誤差を推定する。
Ushioらによる最近の研究は、確率が真の後部でない場合、この推定器は脆弱であることを示した。
最も広く使われているポストホックキャリブレーションマップ -- 温度スケーリング -- がプロキシを歪めているのを正確に特徴付けます。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The soft-label Bayes-error estimator beta(z) = E[min(z, 1-z)] of Ishida et al. estimates the irreducible error of a binary task directly from probability-valued labels. Recent work by Ushio et al. showed that this estimator is fragile when the probabilities are not the true posterior: even perfectly calibrated soft labels can yield a substantially inaccurate estimate, and they propose isotonic calibration as a consistent remedy. We complement that line of work by characterizing exactly how the most widely used post-hoc calibration map -- temperature scaling -- distorts the proxy. We prove an exact, model-free identity reducing the temperature-scaled proxy to the classifier's margin distribution, from which we obtain (i) strict monotonicity in the temperature and (ii) a continuous bijection from the temperature axis onto the open interval (0, 1/2), so that a fixed classifier -- with fixed decisions and fixed 0-1 error -- can be made to report any proxy value whatsoever. Under a Gaussian model of the logits we further derive a two-parameter closed form for the entire proxy-versus-temperature curve. Across CIFAR-10, Fashion-MNIST, and SVHN (eight binary tasks), the proxy varies by 56x to 980x at constant test error, the closed form reproduces the empirical curve to within 0.018, and the calibration temperature that minimizes the expected calibration error does not coincide with any stable proxy value. Our results give a precise, predictive account of the distortion whose existence motivates calibration-based remedies, and they reinforce the practical recommendation that a proxy value is meaningful only together with the mechanism that produced its probabilities.
- Abstract(参考訳): 石田らによるソフトラベルベイズ・エラー推定器β(z) = E[min(z, 1-z)] は確率値ラベルから直接二進タスクの既約誤差を推定する。
Ushioらによる最近の研究によると、この推定器は、確率が真の後部でなければ脆弱であり、完璧に校正された軟質ラベルでさえ、ほぼ不正確な推定値が得られることを示し、一貫した治療としてイソトニックキャリブレーションを提案する。
私たちは、最も広く使われているポストホックキャリブレーションマップ -- 温度スケーリング -- がプロキシを歪めているのを正確に特徴付けることで、その作業ラインを補完します。
我々は、温度スケールされたプロキシを分類器のマージン分布に還元する正確なモデル自由IDを証明し、そこから得られる。
(i)温度と温度の厳密な単調性
(i) 温度軸から開区間 (0, 1/2) への連続的単射により、固定決定と固定0-1誤差の固定分類器を任意のプロキシ値に報知することができる。
対数のガウスモデルの下で、我々はさらにプロキシ対温度曲線全体の2パラメータ閉形式を導出する。
CIFAR-10、Fashion-MNIST、SVHN(8つのバイナリタスク)全体で、プロキシは一定のテスト誤差で56xから980x変化し、クローズドフォームは経験曲線を0.018の範囲で再現し、期待されるキャリブレーション誤差を最小化するキャリブレーション温度は安定したプロキシ値と一致しない。
以上の結果から,キャリブレーションに基づく治療を動機とする歪みを正確に予測し,その確率を生み出すメカニズムとともに,プロキシ値が有意義であるという現実的な勧告を補強した。
関連論文リスト
- EDGE: a closed-form directed test for the calibration of probabilistic binary classifiers [0.0]
本稿では,正規確率分類器の校正テストであるEDGEを提案し,ロジスティック回帰法を提案する。
EDGEは、同一のビン付き予測観測テーブルを信頼性図のプロットとして読み出し、その標準化されたビン残差をスムーズなキャリブレーション歪みの小さな前提に投影する。
リンクと特徴の相違により、既定のデフォルトが22のシナリオのうち、19のシナリオで全ての競合するビン付きテストに導かれるか、あるいは結び付けられ、再適合ベースのStukelスコアテストが20%から28%のサンプルで分離される場合、計算可能のままであった。
論文 参考訳(メタデータ) (2026-08-20T19:06:05Z) - The Minimax Rate of Second-Order Calibration [8.791341107339637]
二項分類における二階キャリブレーション誤差を推定するミニマックス速度を特徴付ける。
結論として、二階プラッツスケーリングに対する最初の有限サンプル保証を与える。
論文 参考訳(メタデータ) (2026-05-08T14:41:56Z) - Geometric Calibration and Neutral Zones for Uncertainty-Aware Multi-Class Classification [0.0]
この研究は情報幾何学と統計的学習を橋渡しし、厳密な検証を必要とするアプリケーションにおいて不確実性を認識した分類の正式な保証を提供する。
アデノ関連ウイルスの分類に関する実証的な検証は、2段階のフレームワークが72.5%のエラーをキャプチャし、34.5%のサンプルを遅延させ、自動決定エラー率を16.8%から6.9%に下げていることを示している。
論文 参考訳(メタデータ) (2025-11-26T01:29:49Z) - On the good reliability of an interval-based metric to validate prediction uncertainty for machine learning regression tasks [0.0]
本研究では,不確実性の平均校正を予測するための(より)信頼性の高い検証手法を提案する。
不確実性や誤差分布の重みの存在に非常に敏感な分散ベースのキャリブレーション指標を考えると、間隔ベースの測度であるPICP(Prediction Interval Coverage Probability)へのシフトが提案される。
結果のPICPは、分散ベースのキャリブレーション指標よりも迅速かつ確実に検査される。
論文 参考訳(メタデータ) (2024-08-23T14:16:10Z) - Orthogonal Causal Calibration [55.28164682911196]
我々は、因果校正作業を標準(非因果予測モデル)の校正作業に還元する一般的なアルゴリズムを開発する。
以上の結果から,既存のキャリブレーションアルゴリズムを因果的設定に応用できることが示唆された。
論文 参考訳(メタデータ) (2024-06-04T03:35:25Z) - Calibrated Uncertainty Quantification for Operator Learning via
Conformal Prediction [95.75771195913046]
本稿では, リスク制御型量子ニューラル演算子, 分布のない有限サンプル機能キャリブレーション等式予測法を提案する。
関数領域上の点の期待値として定義されるカバレッジ率に関する理論的キャリブレーションを保証する。
2次元ダーシー流と3次元自動車表面圧力予測タスクに関する実験結果から,我々の理論的結果が検証された。
論文 参考訳(メタデータ) (2024-02-02T23:43:28Z) - The Lipschitz-Variance-Margin Tradeoff for Enhanced Randomized Smoothing [85.85160896547698]
ディープニューラルネットワークの現実的な応用は、ノイズの多い入力や敵攻撃に直面した場合、その不安定な予測によって妨げられる。
入力にノイズ注入を頼りに、認証された半径を持つ効率的な分類器を設計する方法を示す。
新たな認証手法により、ランダムな平滑化による事前学習モデルの使用が可能となり、ゼロショット方式で現在の認証半径を効果的に改善できる。
論文 参考訳(メタデータ) (2023-09-28T22:41:47Z) - A Consistent and Differentiable Lp Canonical Calibration Error Estimator [21.67616079217758]
ディープニューラルネットワークは校正が不十分で、自信過剰な予測を出力する傾向がある。
ディリクレ核密度推定に基づく低バイアス・トレーニング可能な校正誤差推定器を提案する。
提案手法はカーネルの自然な選択であり,他の量の一貫した推定値を生成するのに利用できる。
論文 参考訳(メタデータ) (2022-10-13T15:11:11Z) - Sample-dependent Adaptive Temperature Scaling for Improved Calibration [95.7477042886242]
ニューラルネットワークの誤りを補うポストホックアプローチは、温度スケーリングを実行することだ。
入力毎に異なる温度値を予測し、信頼度と精度のミスマッチを調整することを提案する。
CIFAR10/100およびTiny-ImageNetデータセットを用いて,ResNet50およびWideResNet28-10アーキテクチャ上で本手法をテストする。
論文 参考訳(メタデータ) (2022-07-13T14:13:49Z) - T-Cal: An optimal test for the calibration of predictive models [49.11538724574202]
有限検証データセットを用いた予測モデルの誤校正を仮説検証問題として検討する。
誤校正の検出は、クラスの条件付き確率が予測の十分滑らかな関数である場合にのみ可能である。
我々は、$ell$-Expected Error(ECE)のデバイアスドプラグイン推定器に基づくキャリブレーションのためのミニマックステストであるT-Calを提案する。
論文 参考訳(メタデータ) (2022-03-03T16:58:54Z) - Calibration of Neural Networks using Splines [51.42640515410253]
キャリブレーション誤差の測定は、2つの経験的分布を比較します。
古典的コルモゴロフ・スミルノフ統計テスト(KS)にインスパイアされたビンニングフリーキャリブレーション尺度を導入する。
提案手法は,KS誤差に対する既存の手法と,他の一般的なキャリブレーション手法とを一貫して比較する。
論文 参考訳(メタデータ) (2020-06-23T07:18:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。