論文の概要: Continual Calibration: Coverage Can Collapse Before Accuracy in Lifelong LLM Fine-Tuning
- arxiv url: http://arxiv.org/abs/2604.23987v1
- Date: Mon, 27 Apr 2026 03:03:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 17:12:07.711131
- Title: Continual Calibration: Coverage Can Collapse Before Accuracy in Lifelong LLM Fine-Tuning
- Title(参考訳): LLMファインチューニングの精度向上をめざして - 継続的な校正をめざして
- Authors: Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma,
- Abstract要約: 不確実性信頼性は、トップ1のパフォーマンスよりも早く、より急激に低下する可能性がある。
逐次微調整モデル上での共形被覆と校正誤差を計測し,これを実証的に検討する。
タスク固有のバッファを保持し,タスク固有の整合しきい値に適合する軽量なポストホックプロシージャであるキャリブレーション・リプレイを提案する。
- 参考スコア(独自算出の注目度): 6.908972852063454
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Continual learning for large language models is typically evaluated through accuracy retention under sequential fine-tuning. We argue that this perspective is incomplete, because uncertainty reliability can degrade earlier and more sharply than top-1 performance. We study this empirically by measuring conformal coverage and calibration error on sequentially fine-tuned models across three model families and eight task sequences drawn primarily from classification and multiple-choice benchmarks. Across the classification-style settings we study, coverage loss exceeds accuracy loss by a factor of roughly \(3.4\times \pm 0.5\times\) on average across seeds; in the most pronounced case, coverage drops from \(0.92\) to \(0.61\), while accuracy remains within three points of baseline. Standard continual-learning methods that preserve accuracy do not automatically preserve coverage, and naive calibration baselines recover only part of the gap. We propose calibration replay, a lightweight post-hoc procedure that maintains a task-specific held-out buffer and refits a task-specific conformal threshold under the current model after each update. It adds no training-time gradient cost, uses less than one percent of the memory of ordinary experience replay, and typically restores coverage to within two points of nominal at buffer size \(m = 200\). We accompany the empirical study with a drift decomposition, a finite-sample recovery theorem showing exact conformal validity under exchangeability, and a mixture-validity proposition explaining why pooled thresholds do not suffice. Our guarantees are stated for classification-style tasks with task-specific buffers; extensions to open-ended generation are exploratory.
- Abstract(参考訳): 大規模言語モデルの連続学習は、典型的にはシーケンシャルな微調整の下で精度の保持によって評価される。
この観点は不完全であると主張する。なぜなら、不確実性はトップ1のパフォーマンスよりも早く、より鋭く低下する可能性があるからだ。
本研究は、3つのモデルファミリーと8つのタスクシーケンスにまたがる逐次的微調整モデルに対して、主に分類と多重選択ベンチマークから得られたコンフォメーションカバレッジとキャリブレーション誤差を測定して実証的に研究する。
分類式設定全体では, 被覆損失は種子平均で約3.4\times \pm 0.5\times {\displaystyle \pm 0.5\times \) の精度損失を超えるが, 最も顕著な場合では, 被覆損失は3点以内の精度で減少する。
精度を保つ標準的な連続学習手法は、自動的にカバレッジを保存せず、キャリブレーションベースラインがギャップの一部を回復する。
本稿では,タスク固有のホールトアウトバッファを維持し,更新後の現在のモデルの下でタスク固有のコンフォメーション閾値を補正する軽量なポストホックプロシージャであるキャリブレーション・リプレイを提案する。
トレーニング時間勾配のコストが不要で、通常のエクスペリエンスリプレイのメモリの1%未満を使用し、通常、バッファサイズ \(m = 200\)で2ポイント以内までカバレッジを復元する。
本稿では, ドリフト分解, 交換可能性の下での正確な整合性を示す有限サンプル回復定理, プールドしきい値が十分でない理由を説明する混合正当性命題を伴って, 実験的検討を行った。
我々の保証はタスク固有のバッファを持つ分類スタイルのタスクに対して述べられており、オープンエンド生成の拡張は探索的である。
関連論文リスト
- Post-Hoc Split-Point Self-Consistency Verification for Efficient, Unified Quantification of Aleatoric and Epistemic Uncertainty in Deep Learning [5.996056764788456]
不確実性定量化(UQ)は、信頼できる深層学習には不可欠であるが、既存の手法は計算集約的であるか、タスク固有の部分的な見積もりのみを提供する。
本研究では,事前訓練したモデルの変更や再訓練を伴わずに,アレタリックおよびてんかんの不確実性を共同でキャプチャするポストホック・シングルフォワード・パス・フレームワークを提案する。
提案手法は,EmphSplit-Point Analysis (SPA) を用いて,予測残差を上下サブセットに分解し,各側でEmphMean Absolute Residuals (MAR) を演算する。
論文 参考訳(メタデータ) (2025-09-16T17:16:01Z) - Rethinking Early Stopping: Refine, Then Calibrate [49.966899634962374]
キャリブレーション・リファインメント分解の新規な変分定式化について述べる。
我々は,校正誤差と精錬誤差が訓練中に同時に最小化されないという理論的,実証的な証拠を提供する。
論文 参考訳(メタデータ) (2025-01-31T15:03:54Z) - Calibrated Uncertainty Quantification for Operator Learning via
Conformal Prediction [95.75771195913046]
本稿では, リスク制御型量子ニューラル演算子, 分布のない有限サンプル機能キャリブレーション等式予測法を提案する。
関数領域上の点の期待値として定義されるカバレッジ率に関する理論的キャリブレーションを保証する。
2次元ダーシー流と3次元自動車表面圧力予測タスクに関する実験結果から,我々の理論的結果が検証された。
論文 参考訳(メタデータ) (2024-02-02T23:43:28Z) - Calibration by Distribution Matching: Trainable Kernel Calibration
Metrics [56.629245030893685]
カーネルベースのキャリブレーションメトリクスを導入し、分類と回帰の両方で一般的なキャリブレーションの形式を統一・一般化する。
これらの指標は、異なるサンプル推定を許容しており、キャリブレーションの目的を経験的リスク最小化に組み込むのが容易である。
決定タスクにキャリブレーションメトリクスを調整し、正確な損失推定を行ない、後悔しない決定を行うための直感的なメカニズムを提供する。
論文 参考訳(メタデータ) (2023-10-31T06:19:40Z) - Calibrated and Sharp Uncertainties in Deep Learning via Density Estimation [10.209143402485406]
本稿では, キャリブレーションが重要であり, 維持が容易であることを論じる。
校正されたモデルを生成する再校正に基づく簡単なトレーニング手順を導入し、全体的な性能を犠牲にしない。
論文 参考訳(メタデータ) (2021-12-14T06:19:05Z) - Learning Prediction Intervals for Regression: Generalization and
Calibration [12.576284277353606]
不確実性定量のための回帰における予測間隔の生成について検討する。
我々は一般学習理論を用いて、リプシッツ連続性とVC-サブグラフクラスを含む最適性と実現可能性のトレードオフを特徴づける。
我々は既存のベンチマークと比べてテスト性能の点で、区間生成とキャリブレーションアルゴリズムの強みを実証的に示している。
論文 参考訳(メタデータ) (2021-02-26T17:55:30Z) - Calibration of Neural Networks using Splines [51.42640515410253]
キャリブレーション誤差の測定は、2つの経験的分布を比較します。
古典的コルモゴロフ・スミルノフ統計テスト(KS)にインスパイアされたビンニングフリーキャリブレーション尺度を導入する。
提案手法は,KS誤差に対する既存の手法と,他の一般的なキャリブレーション手法とを一貫して比較する。
論文 参考訳(メタデータ) (2020-06-23T07:18:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。