論文の概要: NOMADD: Numerical Optimization of Models Adapting to Data Drift
- arxiv url: http://arxiv.org/abs/2608.02845v1
- Date: Mon, 03 Aug 2026 20:02:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.940553
- Title: NOMADD: Numerical Optimization of Models Adapting to Data Drift
- Title(参考訳): NOMADD: データドリフトに対応するモデルの数値最適化
- Abstract要約: タブラルモデルの性能は、時間とともに特徴分布が変化するか、時間とともに特徴と結果変数の関係が変化するときに低下する。
本稿では,様々なモデルに適用可能なコンセプトドリフトを削減するためのポストホック法を提案する。
提案アルゴリズムは,各ラベル付きトレーニング期間ごとに基本モデルに適合し,これらの期間にプールされた1つのアンカーモデルに対してパラメータがどのように進化するかを測定し,これらの変化を低ランク因子化で圧縮し,減衰した正規化予測で各潜在因子を前方に外挿する。
- 参考スコア(独自算出の注目度): 0.9167082845109437
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tabular model performance degrades when feature distributions change over time or the relationship between features and outcome variables change over time, known as data drift and concept drift, respectively. These issues are challenging to mitigate in real time because labeled data may not be immediately available, or re-training a model could be impractical. While tools exist to reduce drift, they are typically bespoke to neural network architectures and adapt how models are trained. In this paper, we offer an alternative post-hoc method to reduce concept drift, which is applicable to a variety of models, from trees to neural networks to tabular foundation models. This new tool is especially useful when constraints, such as high model accuracy, bounded inference time, or model size requires users to choose between different models for their specific use-cases. Our algorithm fits the base model separately on each labeled training period, measures how its parameters evolve against a single anchor model pooled over all of those periods, compresses those changes with a low-rank factorization, and extrapolates each latent factor forward with a damped, regularized forecast. On the 18-dataset Drift-Resilient TabPFN benchmark, evaluated under that benchmark's own protocol and metric, the extrapolation improves every base family it is applied to, and achieves performance competitive with the state-of-the-art Drift-Resilient TabPFN with seconds of training. In contrast, Drift-Resilient TabPFN requires pre-training on millions of synthetic datasets over approximately 1,300 GPU-hours, and is orders of magnitude slower in inference (depending on the model). In the discussion, we explore the promise and challenges of extending this tool to other modalities.
- Abstract(参考訳): タブラルモデルの性能は、時間とともに特徴分布が変化するときや、データドリフトと概念ドリフトと呼ばれる、時間とともに特徴と結果変数の関係が変化するときに低下する。
これらの問題は、ラベル付きデータがすぐに利用できない場合や、モデルの再トレーニングが現実的でない場合など、リアルタイムで緩和することが難しい。
ドリフトを減らすツールは存在するが、一般的にはニューラルネットワークアーキテクチャに注目し、モデルのトレーニング方法に適応する。
本稿では,木やニューラルネットワーク,表層基盤モデルなど,さまざまなモデルに適用可能なコンセプトドリフトを削減するための,ポストホック法を提案する。
この新ツールは、高いモデル精度、境界推論時間、モデルサイズといった制約が、ユーザが特定のユースケースに対して異なるモデルを選択する必要がある場合に特に有用である。
提案アルゴリズムは,各ラベル付きトレーニング期間ごとに基本モデルに適合し,これらの期間にプールされた1つのアンカーモデルに対してパラメータがどのように進化するかを測定し,これらの変化を低ランク因子化で圧縮し,減衰した正規化予測で各潜在因子を前方に外挿する。
ベンチマークのプロトコルとメトリックに基づいて評価された18データセットのDrift-Resilient TabPFNベンチマークでは、外挿は適用対象のベースファミリーを改良し、最新技術であるDrift-Resilient TabPFNと数秒のトレーニングで競合するパフォーマンスを実現する。
対照的に、Drift-Resilient TabPFNは、およそ1300GPU時間で数百万の合成データセットを事前トレーニングする必要がある。
議論では、このツールを他のモダリティに拡張するという約束と課題について検討する。
関連論文リスト
- Nonparametric Data Attribution for Diffusion Models [57.820618036556084]
生成モデルのデータ属性は、個々のトレーニング例がモデル出力に与える影響を定量化する。
生成画像とトレーニング画像のパッチレベルの類似性によって影響を測定する非パラメトリック属性法を提案する。
論文 参考訳(メタデータ) (2025-10-16T03:37:16Z) - Estimating Time Series Foundation Model Transferability via In-Context Learning [74.65355820906355]
時系列基礎モデル(TSFM)は、大規模な事前訓練を通じて強力なゼロショット予測を提供する。
微調整は、公開データに制限のあるドメインのパフォーマンス向上に依然として不可欠である。
モデル選択をコンテキスト内学習問題として再キャストする転送可能性推定フレームワークであるTimeTicを紹介する。
論文 参考訳(メタデータ) (2025-09-28T07:07:13Z) - Drift-Resilient TabPFN: In-Context Learning Temporal Distribution Shifts on Tabular Data [39.40116554523575]
In-Context Learning with a Prior-Data Fitted Network に基づく新しいアプローチである Drift-Resilient TabPFN を提案する。
先行した合成データセットのベイズ推定を近似することを学ぶ。
精度は0.688から0.744に向上し、OC AUCは0.786から0.832に向上し、キャリブレーションも強化された。
論文 参考訳(メタデータ) (2024-11-15T23:49:23Z) - Quilt: Robust Data Segment Selection against Concept Drifts [30.62320149405819]
継続的機械学習パイプラインは、モデルが定期的にデータストリームでトレーニングされる産業環境で一般的である。
概念ドリフトは、データXとラベルy、P(X, y)の結合分布が時間とともに変化し、おそらくモデルの精度が低下するデータストリームで発生する。
既存のコンセプトドリフト適応アプローチは、主にモデルを新しいデータに更新することに集中し、ドリフトした履歴データを破棄する傾向がある。
モデル精度を最大化するデータセグメントを識別および選択するためのデータ中心フレームワークであるQultを提案する。
論文 参考訳(メタデータ) (2023-12-15T11:10:34Z) - OneNet: Enhancing Time Series Forecasting Models under Concept Drift by
Online Ensembling [65.93805881841119]
ドリフト問題に対処するため,textbfOnline textbfensembling textbfNetwork (OneNet)を提案する。
OneNet は State-Of-The-Art (SOTA) 法と比較してオンライン予測エラーを $mathbf50%$ 以上削減する。
論文 参考訳(メタデータ) (2023-09-22T06:59:14Z) - Towards Flexible Time-to-event Modeling: Optimizing Neural Networks via
Rank Regression [17.684526928033065]
我々はDART(Time-to-event Prediction)のためのDeep AFT Rank-regressionモデルを導入する。
このモデルは、表現学習において効率的で信頼性の高いゲハンのランク統計に基づく客観的関数を用いる。
提案手法は, 生存時間分布に分布仮定を課さない半パラメトリックなAFTモデリング手法である。
論文 参考訳(メタデータ) (2023-07-16T13:58:28Z) - Deep incremental learning models for financial temporal tabular datasets
with distribution shifts [0.9790236766474201]
このフレームワークは、単純な基本的なビルディングブロック(決定木)を使用して、必要な複雑さの自己相似モデルを構築する。
我々は,NumeraiデータセットでトレーニングしたXGBoostモデルを用いて提案手法を実証し,異なるモデルスナップショット上での2層のXGBoostモデルの深部アンサンブルが高品質な予測を提供することを示す。
論文 参考訳(メタデータ) (2023-03-14T14:10:37Z) - Online learning techniques for prediction of temporal tabular datasets
with regime changes [0.0]
時間パネルデータセットの予測をランキングするモジュール型機械学習パイプラインを提案する。
パイプラインのモジュラリティにより、GBDT(Gradient Boosting Decision Tree)やニューラルネットワークなど、さまざまなモデルの使用が可能になる。
モデルの再トレーニングを必要としないオンライン学習技術は、予測後の結果を高めるために使用することができる。
論文 参考訳(メタデータ) (2022-12-30T17:19:00Z) - Employing chunk size adaptation to overcome concept drift [2.277447144331876]
ブロックベースのデータストリーム分類アルゴリズムに適応可能な新しいチャンク適応復元フレームワークを提案する。
提案アルゴリズムは,概念ドリフト検出時のデータチャンクサイズを調整し,その変更が使用済みモデルの予測性能に与える影響を最小限に抑える。
論文 参考訳(メタデータ) (2021-10-25T12:36:22Z) - Closed-form Continuous-Depth Models [99.40335716948101]
連続深度ニューラルモデルは高度な数値微分方程式解法に依存している。
我々は,CfCネットワークと呼ばれる,記述が簡単で,少なくとも1桁高速な新しいモデル群を提示する。
論文 参考訳(メタデータ) (2021-06-25T22:08:51Z) - Churn Reduction via Distillation [54.5952282395487]
本研究は, 基礎モデルを教師として用いた蒸留によるトレーニングと, 予測的チャーンに対する明示的な制約によるトレーニングとの等価性を示す。
次に, 蒸留が近年の多くのベースラインに対する低チャーン訓練に有効であることを示す。
論文 参考訳(メタデータ) (2021-06-04T18:03:31Z) - Anomaly Detection of Time Series with Smoothness-Inducing Sequential
Variational Auto-Encoder [59.69303945834122]
Smoothness-Inducing Sequential Variational Auto-Encoder (SISVAE) モデルを提案する。
我々のモデルは、フレキシブルニューラルネットワークを用いて各タイムスタンプの平均と分散をパラメータ化する。
合成データセットと公開実世界のベンチマークの両方において,本モデルの有効性を示す。
論文 参考訳(メタデータ) (2021-02-02T06:15:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。