論文の概要: Localized TabICLv2: Scaling Tabular In-Context Learning through k-NN
- arxiv url: http://arxiv.org/abs/2608.16429v1
- Date: Mon, 17 Aug 2026 11:30:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.662304
- Title: Localized TabICLv2: Scaling Tabular In-Context Learning through k-NN
- Title(参考訳): ローカライズされたTabICLv2:k-NNによるタブラルインコンテキスト学習のスケーリング
- Abstract要約: ローカライズされたTabICLv2は、テストポイント毎にk最寄りのトレーニング隣人のみを取得することで、TabICLv2の推論コストを削減する。
TabArenaの分類タスクでは、微調整されたローカライズドモデルはフルタブICLv2の98.64%の精度を維持している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Foundational models for tabular data have made significant progress in recent years, with TabICLv2 reporting state-of-the-art performance on several tabular classification tasks. However, full-context tabular ICL still suffers from attention cost that grows with the training-context size, which limits its ability to handle large datasets efficiently. Localized TabICLv2 introduces a method that reduces the inference cost of TabICLv2 by retrieving only the k nearest training neighbours for each test point, measured by similarity in the model's Stage 2 row-representation space, rather than using the full training context. This requires no architectural changes, and we show that accuracy retention can be improved through additional Stage 2 and Stage 3 fine-tuning. On TabArena classification tasks, the fine-tuned localized model retains 98.64% of Full TabICLv2 accuracy and it achieves a median 2.18$\times$ speedup in batch inference, and reaches approximately 249$\times$ median speedup in the single-query serving setting.
- Abstract(参考訳): 表型データの基本モデルは近年大きな進歩を遂げており、TabICLv2はいくつかの表型分類タスクにおける最先端のパフォーマンスを報告している。
しかし、フルコンテキストの表形式のICLは、トレーニングコンテキストサイズによって増大する注意コストに悩まされており、大規模なデータセットを効率的に処理する能力が制限されている。
ローカライズされたTabICLv2は、完全なトレーニングコンテキストではなく、モデルのステージ2行表現空間の類似性によって測定された、各テストポイントに最も近いk個のトレーニング隣人のみを取得することで、TabICLv2の推論コストを削減する方法を導入する。
これはアーキテクチャの変更を必要とせず、ステージ2とステージ3の微調整によって精度を向上できることを示す。
TabArenaの分類タスクでは、微調整されたローカライズドモデルは全TabICLv2の98.64%の精度を保持し、バッチ推論における中央値2.18$\times$スピードアップを達成し、シングルクエリサービス設定における中央値249$\times$スピードアップに達する。
関連論文リスト
- TabSwift: An Efficient Tabular Foundation Model with Row-Wise Attention [47.480923979431886]
タブラル基礎モデルは、ラベル付きトレーニング例から直接テストラベルを推測して、コンテキスト内学習を通じて予測を行う。
最近のモデルでは、ますます複雑なアーキテクチャによって精度が向上し、推論コストが高くなり、実用的なデプロイメントが制限されることが多い。
ライトウェイトな行ワイドアテンションのみのバックボーンは、2つの単純な拡張と高い競争力を維持することができることを示す。
論文 参考訳(メタデータ) (2026-06-05T14:55:30Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - TabH2O: A Unified Foundation Model for Tabular Prediction [12.882141870947706]
本研究では,テキスト内学習による1つの前方パスの分類と回帰を行うモデルであるTabH2Oを提案する。
我々はTALENTベンチマークでTabH2O v1(29.2Mパラメータ)を評価し、6つの評価手法のうち平均2.55のランクを達成した。
論文 参考訳(メタデータ) (2026-05-18T13:27:54Z) - TabICLv2: A better, faster, scalable, and open tabular foundation model [18.594859017648346]
3つの柱上に構築された回帰と分類のための新しい最先端基盤モデルであるTabICLv2を紹介する。
Tabiclv2は、50GBのGPUメモリ下での百万規模のデータセットを効果的に一般化し、RealTabPFN-2.5よりも著しく高速である。
論文 参考訳(メタデータ) (2026-02-11T18:51:02Z) - Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training [53.07879717463279]
textscDomain2Vecは任意のデータセットを複数のEmphmetaドメインの線形結合に分解する
textscDomain2Vecは、最小の計算オーバーヘッドでダウンストリームタスクのパフォーマンスを向上させるデータミックスを見つけるのに役立つ。
論文 参考訳(メタデータ) (2025-06-12T17:53:51Z) - A Closer Look at TabPFN v2: Understanding Its Strengths and Extending Its Capabilities [51.08999772842298]
Tabular Prior-data Fitted Network v2 (TabPFN v2)は、さまざまな下流データセット間で、前例のないコンテキスト内学習性能を達成する。
本研究では,TabPFN v2が属性トークンをランダムに入力しても属性関係を推測可能であることを示す。
我々はTabPFN v2の制限がテスト時間分割・コンテキスト戦略によって対処できることを実証した。
論文 参考訳(メタデータ) (2025-02-24T17:38:42Z) - TabICL: A Tabular Foundation Model for In-Context Learning on Large Data [15.08819125687632]
最大60Kサンプルの合成データセットを事前学習した表層ベースモデルであるTabICLを導入する。
TALENTベンチマークから200を越える分類データセットのうち、TabICLはTabPFNv2と同等であり、体系的に高速(最大10倍)である。
10K以上のサンプルを持つ53のデータセットで、TabICLはTabPFNv2とCatBoostを上回り、大規模データに対するICLの可能性を示している。
論文 参考訳(メタデータ) (2025-02-08T13:25:04Z) - TabDPT: Scaling Tabular Foundation Models on Real Data [20.00390825519329]
ICLに基づく検索と自己教師付き学習を組み合わせた基礎モデルの学習手法を提案する。
事前学習フェーズに実際のデータを組み込むことで、学習が大幅に速くなり、見当たらないデータへの一般化が向上することを示す。
得られたモデルであるTabDPTは回帰 (CTR23) と分類 (CC18) のベンチマークで最高の性能を達成する。
論文 参考訳(メタデータ) (2024-10-23T18:00:00Z) - Continual Learning on a Diet: Learning from Sparsely Labeled Streams Under Constrained Computation [123.4883806344334]
本研究では,学習アルゴリズムが学習段階ごとに制限された計算予算を付与する,現実的な連続学習環境について検討する。
この設定を,スパースラベル率の高い大規模半教師付き連続学習シナリオに適用する。
広範に分析と改善を行った結果,DietCLはラベル空間,計算予算,その他様々な改善の完全な範囲で安定していることがわかった。
論文 参考訳(メタデータ) (2024-04-19T10:10:39Z) - Improving Calibration for Long-Tailed Recognition [68.32848696795519]
このようなシナリオにおけるキャリブレーションとパフォーマンスを改善する2つの方法を提案します。
異なるサンプルによるデータセットバイアスに対して,シフトバッチ正規化を提案する。
提案手法は,複数の長尾認識ベンチマークデータセットに新しいレコードをセットする。
論文 参考訳(メタデータ) (2021-04-01T13:55:21Z) - Understanding tables with intermediate pre-training [11.96734018295146]
我々は、テーブルベースのBERTモデルであるTAPAASを適用して、エンターテイメントを認識する。
我々は,テーブルプルーニングを前処理ステップとして評価し,トレーニングと予測効率を大幅に向上させる。
論文 参考訳(メタデータ) (2020-10-01T17:43:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。