論文の概要: Distillation of Tabular Foundation Models into Efficient Predictors
- arxiv url: http://arxiv.org/abs/2610.01435v1
- Date: Thu, 01 Oct 2026 10:31:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.057224
- Title: Distillation of Tabular Foundation Models into Efficient Predictors
- Title(参考訳): 単語基礎モデルの効率的な予測器への蒸留
- Abstract要約: タブラル基礎モデル(TFM)は、文脈内学習によって強い予測性能を達成する。
ラベル付きデータに対する繰り返し条件付けは推論を高価にする。
知識蒸留は、データセット固有の学生に予測能力を移すことで、このコストを削減することができる。
- 参考スコア(独自算出の注目度): 8.331524801839162
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Tabular foundation models (TFMs) achieve strong predictive performance through in-context learning, yet repeatedly conditioning on labeled data makes inference expensive. Knowledge distillation can reduce this cost by transferring their predictive ability to lightweight, dataset-specific students. However, the dependence of TFM predictions on both a labeled context and a query introduces two design questions: how to construct teacher supervision and whether expanding query coverage improves distillation. We examine these questions across two TFMs and both neural and tree-based students, and derive an effective distillation recipe. The recipe uses the full labeled training set as teacher context and trains students solely on teacher predictions for observed and synthetic queries. On TabArena, the resulting students outperform their supervised trained tuned-and-ensembled counterparts by 57-98 Elo points. Applied unchanged to TALENT, the same recipe improves matched default students on 236-258 of 300 datasets and reduces median primary error by 4.0-6.4%. The distilled students also achieve median inference speedups of 3.0-21.6 times over their teachers, offering a practical trade-off between predictive performance and repeated inference cost. Code is available at https://github.com/nums-ai/TFM_Distillation .
- Abstract(参考訳): タブラル基礎モデル(TFM)は、文脈内学習によって強い予測性能を得るが、ラベル付きデータに繰り返し条件を付けると推論が高価になる。
知識蒸留は、予測能力を軽量でデータセット固有の学生に転送することで、このコストを削減することができる。
しかし、ラベル付きコンテキストとクエリの両方に対するFM予測の依存は、教師の監督を構築する方法と、クエリ範囲の拡大が蒸留を改善するかどうかという2つの設計上の疑問をもたらす。
我々は,この質問を2つのFMと神経系および木系の両方の学生を対象に検討し,効果的な蒸留法を導出する。
このレシピは、教師のコンテキストとしてラベル付きトレーニングセットを使用し、観察および合成クエリの教師予測のみを訓練する。
TabArenaでは、教師付きチューン&アンサンブルの生徒を57-98エロポイントで上回りました。
TALENTに準じることなく、300データセットの236-258で、同じレシピがデフォルトの学生と一致し、中央値の一次誤差を4.0-6.4%削減する。
蒸留された学生は、教師に対して3.0~21.6倍の平均的な推論速度を達成し、予測性能と繰り返しの推論コストのトレードオフを提供する。
コードはhttps://github.com/nums-ai/TFM_Distillationで入手できる。
関連論文リスト
- Distilling Tabular Foundation Models for Structured Health Data [3.6863200438303]
タブラル基礎モデル(TFM)は、健康データセット上で高いパフォーマンスを達成するが、その推論コストとインフラ要件は実用的利用を制限する。
本研究は, その予測行動が知識蒸留により, 軽量な表紙モデルに伝達できるかどうかを考察する。
蒸留された学生は、AUCの90%以上を保有し、いくつかのケースでは教師より優れており、CPU上では最低でも26時間以上高速に動作し、健康アプリケーションにとって重要な校正と公平性を維持する。
論文 参考訳(メタデータ) (2026-05-18T17:37:28Z) - DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation [49.98710755440242]
蒸留により、コンパクトなビジョンランゲージモデル(VLM)が強力な推論能力を得ることができる。
標準チャート/文書推論データセットにおけるプロンプトの最大69%は、事実上ゼロデルタである。
既存のデータセットをシードとして再利用し、学生の障害モードを積極的にターゲットとして、より良いプロンプトを生成するためのステージド合成パイプラインを提案する。
論文 参考訳(メタデータ) (2026-05-15T02:04:12Z) - Curriculum Learning-Guided Progressive Distillation in Large Language Models [18.961191510804134]
既存の蒸留アプローチでは、トレーニングデータの学習順序と、教師と学生のモデル間の容量ミスマッチという、2つの重要な要因を見落としていることが多い。
本稿では,教師の強度とデータ難易度を一致させることにより,両要因を統一したフレームワークであるCLPD(Curriculum Learning-Guided Progressive Distillation)を提案する。
私たちのフレームワークはモジュール化されており、最小限のオーバーヘッドで標準的な蒸留アルゴリズムに統合することができます。
論文 参考訳(メタデータ) (2026-05-11T21:37:20Z) - Learning from Stochastic Teacher Representations Using Student-Guided Knowledge Distillation [64.15918654558816]
教師表現のフィルタリングと重み付けのための自己蒸留(SSD)訓練戦略を導入し,タスク関連表現のみから抽出する。
UCR Archiveのウェアラブル/バイオサインデータセット、HARデータセット、画像分類データセットなどの実世界の感情コンピューティングに関する実験結果は、提案したSSD手法が最先端の手法より優れていることを示している。
論文 参考訳(メタデータ) (2025-04-19T14:08:56Z) - OD-DETR: Online Distillation for Stabilizing Training of Detection Transformer [14.714768026997534]
本稿では,オンライン蒸留によるDETRトレーニングの安定化を目的とする。
指数移動平均(EMA)で蓄積した教師モデルを利用する。
実験の結果,提案したOD-DETRはトレーニングの安定化に成功し,パラメータを増やすことなく性能を大幅に向上することがわかった。
論文 参考訳(メタデータ) (2024-06-09T14:07:35Z) - Debiased Distillation by Transplanting the Last Layer [14.861216810146114]
ディープモデルは、後処理のときでさえ、急激な相関を学習することに影響を受けやすい。
DeTT(Debiasing by Teacher Transplanting)という簡単な知識蒸留アルゴリズムを提案する。
DeTTは学生モデルを脱臭し、最悪のグループ精度で一貫してベースラインを上回ります。
論文 参考訳(メタデータ) (2023-02-22T07:41:09Z) - Distantly-Supervised Named Entity Recognition with Adaptive Teacher
Learning and Fine-grained Student Ensemble [56.705249154629264]
NERモデルの堅牢性を改善するために,自己学習型教員学生フレームワークを提案する。
本稿では,2つの教員ネットワークからなる適応型教員学習を提案する。
微粒な学生アンサンブルは、教師モデルの各フラグメントを、生徒の対応するフラグメントの時間移動平均で更新し、各モデルフラグメントのノイズに対する一貫した予測を強化する。
論文 参考訳(メタデータ) (2022-12-13T12:14:09Z) - Teaching What You Should Teach: A Data-Based Distillation Method [20.595460553747163]
知識蒸留フレームワークに「教えるべきものを教える」戦略を導入する。
本稿では,より効率的かつ合理的な蒸留を支援するために,望まれる増補サンプルを探索するデータベース蒸留手法"TST"を提案する。
具体的には,教師の強みと生徒の弱みを補うことを支援する,優先バイアス付きニューラルネットワークベースのデータ拡張モジュールを設計する。
論文 参考訳(メタデータ) (2022-12-11T06:22:14Z) - Unified and Effective Ensemble Knowledge Distillation [92.67156911466397]
知識蒸留は、複数の教師モデルから知識を抽出し、それを1人の学生モデルにエンコードする。
既存の多くの手法は、ラベル付きデータのみに基づいて学生モデルを学習し、蒸留する。
本研究では,教師モデルのアンサンブルから,ラベル付きデータとラベルなしデータの両方から単一学生モデルを蒸留する,統一的で効果的なアンサンブル知識蒸留法を提案する。
論文 参考訳(メタデータ) (2022-04-01T16:15:39Z) - Deep Semi-supervised Knowledge Distillation for Overlapping Cervical
Cell Instance Segmentation [54.49894381464853]
本稿では, ラベル付きデータとラベルなしデータの両方を, 知識蒸留による精度向上に活用することを提案する。
摂動に敏感なサンプルマイニングを用いたマスク誘導型平均教師フレームワークを提案する。
実験の結果,ラベル付きデータのみから学習した教師付き手法と比較して,提案手法は性能を著しく向上することがわかった。
論文 参考訳(メタデータ) (2020-07-21T13:27:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。