論文の概要: Rethinking the Test-Time Prompt Tuning Objective from the Perspective of Calibration
- arxiv url: http://arxiv.org/abs/2608.30230v2
- Date: Tue, 08 Sep 2026 07:43:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 22:37:20.318621
- Title: Rethinking the Test-Time Prompt Tuning Objective from the Perspective of Calibration
- Title(参考訳): 校正の観点からのテストタイム・プロンプト・チューニング・オブジェクトの再考
- Abstract要約: テスト時間プロンプトチューニング(TPT)は強力なパラダイムとして登場し、複数の拡張ビュー上でエントロピー最小化(EM)を介して各テストサンプルに対してプロンプトを精製する。
本稿では,従来のEM損失の代替として,クロスエントロピーによる拡張ビューから導出される目標分布と,オリジナルビュー予測を一致させることを提案する。
我々は,信頼度に応じて各拡張ビュー予測に信頼性を考慮した温度スケーリングを適用し,不確かさを和らげつつ,信頼度予測を鋭くする。
- 参考スコア(独自算出の注目度): 14.593876228926185
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Test-time prompt tuning (TPT) has emerged as a powerful paradigm, refining prompts for each test sample via entropy minimization (EM) over multiple augmented views. However, we identify a limitation in the standard EM-based adaptation: it inherently drives the model toward overconfident predictions disregarding sample-specific uncertainty, leading to significant calibration degradation. To address these limitations, we propose a new objective that replaces the conventional EM loss by aligning the original-view prediction with a target distribution derived from augmented views via cross-entropy, while adversarially incorporating the entropy of the target distribution to capture sample-specific uncertainty. Furthermore, to better construct this target distribution, we apply confidence-aware temperature scaling to each augmented-view prediction according to its confidence, sharpening confident predictions while softening uncertain ones. This formulation allows the model to increase confidence only when the target distribution is reliable, while preserving uncertainty when it reflects ambiguous or conflicting augmented-view predictions. Extensive experiments across diverse benchmarks demonstrate that our approach not only achieves state-of-the-art accuracy but also significantly improves model calibration.
- Abstract(参考訳): テスト時間プロンプトチューニング(TPT)は強力なパラダイムとして登場し、複数の拡張ビュー上でエントロピー最小化(EM)を介して各テストサンプルに対してプロンプトを精製する。
しかし、標準EMベースの適応の限界は、サンプル固有の不確実性を無視した過信予測に向けてモデルが本質的に駆動され、キャリブレーションが著しく低下する。
これらの制約に対処するため,本研究では,対象分布のエントロピーを反対に組み込んでサンプル固有不確かさを捉えつつ,原ビュー予測とクロスエントロピーによる拡張ビューからのターゲット分布とを整合させることにより,従来のEM損失を代替する新たな目的を提案する。
さらに、この分布をより良く構築するために、信頼度に応じて各拡張ビュー予測に信頼性を考慮した温度スケーリングを適用し、不確かさを和らげながら信頼度予測を鋭くする。
この定式化により、対象の分布が信頼できる場合にのみ信頼性を高めることができ、不明瞭または矛盾する拡張ビュー予測を反映して不確実性を保つことができる。
様々なベンチマークによる大規模な実験により、我々のアプローチは最先端の精度を達成するだけでなく、モデルのキャリブレーションを大幅に改善することを示した。
関連論文リスト
- Nonparametric Distribution Regression Re-calibration [3.0204520109309847]
全体的な予測誤差の最小化は、キャリブレーションよりも情報を優先することをモデルに推奨する。
安全クリティカルな設定では、信頼に値する不確実性推定は狭い間隔よりも価値があることが多い。
条件付きカーネル平均埋め込みに基づく新しい非パラメトリック再校正アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-02-13T11:48:43Z) - Quantifying the Reliability of Predictions in Detection Transformers: Object-Level Calibration and Image-Level Uncertainty [6.209833978040362]
実際には、DETRは画像に存在するオブジェクトの実際の数よりはるかに多い数百の予測を生成する。
これらすべての予測を信頼し、使用できますか?
我々は、同じ画像内の異なる予測がどのように異なる役割を果たすかを示す実証的な証拠を示し、その結果、信頼性のレベルが異なることを示す。
論文 参考訳(メタデータ) (2024-12-02T18:34:17Z) - Confidence Aware Learning for Reliable Face Anti-spoofing [52.23271636362843]
本稿では,その能力境界を意識した信頼認識顔アンチスプーフィングモデルを提案する。
各サンプルの予測中にその信頼性を推定する。
実験の結果,提案したCA-FASは予測精度の低いサンプルを効果的に認識できることがわかった。
論文 参考訳(メタデータ) (2024-11-02T14:29:02Z) - Uncertainty-Calibrated Test-Time Model Adaptation without Forgetting [65.21599711087538]
テスト時間適応(TTA)は、与えられたモデルw.r.t.を任意のテストサンプルに適用することにより、トレーニングデータとテストデータの間の潜在的な分散シフトに取り組むことを目指している。
事前の手法は各テストサンプルに対してバックプロパゲーションを実行するため、多くのアプリケーションに対して許容できない最適化コストがかかる。
本稿では, 有効サンプル選択基準を策定し, 信頼性および非冗長なサンプルを同定する, 効率的なアンチフォッティングテスト時間適応法を提案する。
論文 参考訳(メタデータ) (2024-03-18T05:49:45Z) - Selective Learning: Towards Robust Calibration with Dynamic Regularization [79.92633587914659]
ディープラーニングにおけるミススキャリブレーションとは、予測された信頼とパフォーマンスの間には相違がある、という意味である。
トレーニング中に何を学ぶべきかを学ぶことを目的とした動的正規化(DReg)を導入し、信頼度調整のトレードオフを回避する。
論文 参考訳(メタデータ) (2024-02-13T11:25:20Z) - Multiclass Alignment of Confidence and Certainty for Network Calibration [10.15706847741555]
最近の研究では、ディープニューラルネットワーク(DNN)が過信的な予測を行う傾向があることが示されている。
予測平均信頼度と予測確実性(MACC)の多クラスアライメントとして知られる簡易なプラグアンドプレイ補助損失を特徴とする列車時キャリブレーション法を提案する。
本手法は,領域内および領域外両方のキャリブレーション性能を実現する。
論文 参考訳(メタデータ) (2023-09-06T00:56:24Z) - Improving Adaptive Conformal Prediction Using Self-Supervised Learning [72.2614468437919]
我々は、既存の予測モデルの上に自己教師付きプレテキストタスクを持つ補助モデルを訓練し、自己教師付きエラーを付加的な特徴として用いて、非整合性スコアを推定する。
合成データと実データの両方を用いて、効率(幅)、欠陥、共形予測間隔の超過といった付加情報の利点を実証的に実証する。
論文 参考訳(メタデータ) (2023-02-23T18:57:14Z) - Calibrating Deep Neural Networks using Explicit Regularisation and
Dynamic Data Pruning [25.982037837953268]
ディープニューラルネットワーク(DNN)は誤った予測をしがちで、予測された出力と関連する信頼スコアのミスマッチを示すことが多い。
そこで本研究では,分類損失を伴う新たな正規化手法を提案する。
論文 参考訳(メタデータ) (2022-12-20T05:34:58Z) - MEMO: Test Time Robustness via Adaptation and Augmentation [131.28104376280197]
テスト時間ロバスト化の問題、すなわちモデルロバスト性を改善するためにテストインプットを用いて検討する。
最近の先行研究ではテスト時間適応法が提案されているが、それぞれ追加の仮定を導入している。
モデルが確率的で適応可能な任意のテスト環境で使用できるシンプルなアプローチを提案する。
論文 参考訳(メタデータ) (2021-10-18T17:55:11Z) - Unlabelled Data Improves Bayesian Uncertainty Calibration under
Covariate Shift [100.52588638477862]
後続正則化に基づく近似ベイズ推定法を開発した。
前立腺癌の予後モデルを世界規模で導入する上で,本手法の有用性を実証する。
論文 参考訳(メタデータ) (2020-06-26T13:50:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。