論文の概要: OCRR: A Benchmark for Online Correction Recovery under Distribution Shift
- arxiv url: http://arxiv.org/abs/2605.03153v1
- Date: Mon, 04 May 2026 20:51:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-06 19:35:43.650403
- Title: OCRR: A Benchmark for Online Correction Recovery under Distribution Shift
- Title(参考訳): OCRR: 流通シフトによるオンライン補正のベンチマーク
- Authors: Adrian Grassi,
- Abstract要約: OCRR (Online Correction Recovery Rate) は、コーパスを分類システムを通じてストリームし、間違った予測にオラクルや修正を適用するベンチマークである。
連続学習ベースラインは、同じメモリ予算で32.6ポイントも上回っている。
また、LoRA-on-DeBERTa-v3の保持率も84.6%アップした。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Static benchmarks measure a model frozen at training time. Real systems face distribution shift: new categories, paraphrased queries, drift: and must recover online via user corrections. No existing benchmark measures recovery speed under correction streams. We introduce OCRR (Online Correction Recovery Rate): a benchmark that streams a corpus through a classification system, applies oracle or stochastic corrections to wrong predictions, and reports two curves: novel-class accuracy and original-distribution accuracy versus correction count. We evaluate the substrate alongside nine baseline algorithms from five families plus seven bounded-storage variants of the substrate for the Pareto sweep, including standard online-learning baselines (river), continual-learning methods (EWC, A-GEM, LwF), retrieval/parametric hybrids (kNN-LM), parameter-efficient fine-tuning of a 1.5 B-parameter encoder (LoRA on DeBERTa-v3-large), and a hash-chained append-only substrate (Substrate). On Banking77 and CLINC150, under oracle and sparse correction policies, the substrate is the only system that simultaneously recovers novel-class accuracy (88.7 +/- 2.9 %) and retains original-distribution accuracy (95.4 +/- 0.8 %) beating the next-best published continual-learning baseline by 32.6 percentage points at equal memory budget, and beating LoRA-on-DeBERTa-v3-large by 84.6 percentage points on retention. We further find that classification accuracy remains stable at 99 % even as approximate-nearest-neighbour recall@5 degrades from 0.69 to 0.23 across 10 k to 10 M corpus scales, suggesting the substrate's margin-band majority vote is robust to retrieval imperfection in a way that pure top-k recall metrics do not predict. Code and data are available at https://github.com/adriangrassi/ocrr-benchmark.
- Abstract(参考訳): 静的ベンチマークは、トレーニング時に凍結されたモデルを測定する。
リアルタイムシステムは、新しいカテゴリ、言い換えられたクエリ、ドリフト、そしてユーザー修正を通じてオンラインを回復しなければならない。
既存のベンチマークでは、修正ストリーム下でのリカバリ速度を測定していません。
OCRR (Online Correction Recovery Rate): 分類システムを通じてコーパスをストリームし、誤り予測にオラクルまたは確率的補正を適用し、新しいクラス精度とオリジナル配信精度と補正カウントの2つの曲線を報告する。
標準オンライン学習ベースライン(River)、連続学習法(EWC, A-GEM, LwF)、検索/パラメトリックハイブリッド(kNN-LM)、1.5Bパラメータエンコーダ(LoRA on DeBERTa-v3-large)、ハッシュチェーン付付加専用基板(Substrate)を含む、Paretoスイープ用ベースラインの9種類のベースラインアルゴリズムと7種類のバウンドストレージ変種を併用して評価した。
Banking77とCLINC150は、オラクルとスパース補正ポリシーの下で、新規クラスの精度(88.7 +/-2.9 %)を同時に回復し、再配布の精度(95.4 +/- 0.8 %)が同じメモリ予算で32.6ポイント、LoRA-on-DeBERTa-v3-largeを84.6ポイント上回る唯一のシステムである。
さらに,10kから10Mのコーパススケールで0.69から0.23に低下しても,分類精度は99 %で安定していることがわかった。
コードとデータはhttps://github.com/adriangrassi/ocrr-benchmarkで公開されている。
関連論文リスト
- Continual Calibration: Coverage Can Collapse Before Accuracy in Lifelong LLM Fine-Tuning [6.908972852063454]
不確実性信頼性は、トップ1のパフォーマンスよりも早く、より急激に低下する可能性がある。
逐次微調整モデル上での共形被覆と校正誤差を計測し,これを実証的に検討する。
タスク固有のバッファを保持し,タスク固有の整合しきい値に適合する軽量なポストホックプロシージャであるキャリブレーション・リプレイを提案する。
論文 参考訳(メタデータ) (2026-04-27T03:03:38Z) - Reducing Maintenance Burden in Behaviour-Driven Development: A Paraphrase-Robust Duplicate-Step Detector with a 1.1M-Step Open Benchmark [1.9537983097153042]
振る舞い駆動開発スイートは、ドキュメント化されたメンテナンスコストとステップ重複の重複を蓄積します。
私たちはこれまでで最大の組織横断的なBDDステップコーパスをリリースします。
論文 参考訳(メタデータ) (2026-04-22T11:44:05Z) - Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration [76.08899010904652]
CapCalは、ランキング決定から位置バイアスを機械的に分離する、トレーニング不要のフレームワークである。
シングルパス効率を保ちながら、トレーニング不要の手法で優れた性能を発揮する。
論文 参考訳(メタデータ) (2026-04-11T10:47:22Z) - Enhancing Continual Learning for Software Vulnerability Prediction: Addressing Catastrophic Forgetting via Hybrid-Confidence-Aware Selective Replay for Temporal LLM Fine-Tuning [43.24339861841546]
本稿では,CVE-linked データセット上でのデコーダ型言語モデル (phi/phi-2 with LoRA) の微調整について検討する。
本研究では,ウィンドウオンリーおよび累積学習,リプレイベースライン,正規化ベースバリアントを含む8つの連続学習戦略を評価する。
ハイブリッドCASRはベースラインと比較してウィンドウ当たりのトレーニング時間を約17%削減する一方、累積トレーニングは15.9倍の計算コストでF1をわずかに増加させる(0.661)。
論文 参考訳(メタデータ) (2026-02-27T09:13:23Z) - Correctness-Optimized Residual Activation Lens (CORAL): Transferrable and Calibration-Aware Inference-Time Steering [3.7758197704962835]
重み付きデカイプローブを用いて、モデル内部のアクティベーションから正当性信号を捕捉する正規化時間ステアリング法であるCORALを導入する。
コラルは、常に精度を10%改善し、期待キャリブレーション誤差(ECE)を平均50%改善する。
本結果は,個々のニューロンが不十分な場合,正規化プローブを用いてモデル内部の分散情報を抽出できるという仮説を支持する。
論文 参考訳(メタデータ) (2026-02-05T18:55:56Z) - Classifier Calibration at Scale: An Empirical Study of Model-Agnostic Post-Hoc Methods [0.0]
教師付き二項分類における確率的予測を改善するためのモデル非依存のポストホック校正法について検討した。
我々は、線形モデル、SVM、ツリーアンサンブル(CatBoost、XGBoost、LightGBM)を含む21の広く使われている分類器をベンチマークした。
一般的な校正手順,特にプラットスケーリングと等調回帰は,適切なスコアリング性能を体系的に低下させる可能性がある。
論文 参考訳(メタデータ) (2026-01-19T18:23:36Z) - Adaptive Set-Mass Calibration with Conformal Prediction [60.47079469141295]
提案手法は,まず共形予測から始まり,所望のカバレッジを与えるラベルの集合を得る。
次に、共形制約に合わせて、質量正規化と温度スケーリングに基づくルールの2つの簡単なポストホックキャリブレータをインスタンス化する。
論文 参考訳(メタデータ) (2025-05-21T12:18:15Z) - Rapid Adaptation in Online Continual Learning: Are We Evaluating It
Right? [135.71855998537347]
オンライン連続学習(OCL)アルゴリズムの適応性を評価するための一般的な手法を,オンライン精度の指標を用いて再検討する。
空白のブラインド分類器でさえ、非現実的に高いオンライン精度を達成できるため、この指標は信頼できない。
既存のOCLアルゴリズムは、オンラインの精度も高いが、有用な情報の保持は不十分である。
論文 参考訳(メタデータ) (2023-05-16T08:29:33Z) - Certified Error Control of Candidate Set Pruning for Two-Stage Relevance
Ranking [57.42241521034744]
本稿では、妥当性ランキングのための候補セットプルーニングの認証エラー制御の概念を提案する。
提案手法は,第1段階から抽出した候補集合を抽出し,第2段階の復位速度を向上する。
論文 参考訳(メタデータ) (2022-05-19T16:00:13Z) - Calibration of Neural Networks using Splines [51.42640515410253]
キャリブレーション誤差の測定は、2つの経験的分布を比較します。
古典的コルモゴロフ・スミルノフ統計テスト(KS)にインスパイアされたビンニングフリーキャリブレーション尺度を導入する。
提案手法は,KS誤差に対する既存の手法と,他の一般的なキャリブレーション手法とを一貫して比較する。
論文 参考訳(メタデータ) (2020-06-23T07:18:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。