論文の概要: Towards Evaluating Data Priors for Tabular Foundation Models
- arxiv url: http://arxiv.org/abs/2606.29241v1
- Date: Sun, 28 Jun 2026 07:12:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.843791
- Title: Towards Evaluating Data Priors for Tabular Foundation Models
- Title(参考訳): タブラル基礎モデルの事前データ評価に向けて
- Authors: Zeynep Türkmen, Kürşat Kaya, Alexander Pfefferle, Frank Hutter,
- Abstract要約: 我々は、実際のデータセットから構築された公開事前および事前の統一インターフェースを実装している。
我々は、事前からトレーニングタスクを生成し、同じモデルアーキテクチャを固定されたトレーニングプロトコルでトレーニングし、共有下流分類タスクで得られたモデルを評価する。
以上の結果から,より強い絶対性能を達成できるものや,データセット間の相対的ランキングの一貫性が向上するものもある。
- 参考スコア(独自算出の注目度): 74.75794086564035
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Data-generating priors are a central component of tabular foundation models because they define the task distribution used during pretraining. However, priors are rarely evaluated as independent components, making it difficult to understand how much they affect downstream model behavior. This raises a methodological question: how can priors from different tabular foundation models be compared independently of the architectures and training protocols they were introduced with? To study this question, we implement a unified interface for publicly available priors from recent tabular foundation models and priors constructed from real datasets. We generate training tasks from each prior, train the same model architecture under a fixed training protocol, and evaluate the resulting models on shared downstream classification tasks. We compare priors through both generated-task statistics and downstream predictive performance. Our results show that different priors favor different downstream behaviors, with some achieving stronger absolute performance and others exhibiting more consistent relative rankings across datasets. We further find that data-level similarity only partially explains downstream behavior. Our code is available at https://github.com/automl/TFM-Playground/tree/prior-dev.
- Abstract(参考訳): データ生成の事前は、事前トレーニングで使用されるタスク分布を定義するため、表形式の基礎モデルの中心的なコンポーネントである。
しかしながら、事前は独立したコンポーネントとして評価されることはめったにないため、下流モデルの振る舞いにどの程度影響するかを理解するのは難しい。
異なる表の基盤モデルからの事前を、導入したアーキテクチャやトレーニングプロトコルとは独立して比較するには、どうすればよいのか?
そこで本研究では,最近の表層基盤モデルと実際のデータセットから構築した先行データから,公開可能な先行データに対する統一インターフェースを実装した。
我々は、事前からトレーニングタスクを生成し、同じモデルアーキテクチャを固定されたトレーニングプロトコルでトレーニングし、共有下流分類タスクで得られたモデルを評価する。
生成タスク統計と下流予測性能の両面から先行データを比較した。
以上の結果から,より強い絶対性能を達成できるものや,データセット間の相対的ランキングの一貫性が向上するものもある。
さらに、データレベルの類似性は、下流の振る舞いを部分的にしか説明できないことが分かりました。
私たちのコードはhttps://github.com/automl/TFM-Playground/tree/prior-devで利用可能です。
関連論文リスト
- Mitra: Mixed Synthetic Priors for Enhancing Tabular Foundation Models [85.64873567417396]
実世界のデータに対して,その多様性,特異性,および性能のために選択された合成前駆体の硬化した混合物をトレーニングしたTFMであるMitraを紹介する。
Mitraは、TabPFNv2やTabICLのような最先端のTFMを、分類と回帰のベンチマークで一貫して上回っている。
論文 参考訳(メタデータ) (2025-10-24T07:15:06Z) - Estimating Time Series Foundation Model Transferability via In-Context Learning [74.65355820906355]
時系列基礎モデル(TSFM)は、大規模な事前訓練を通じて強力なゼロショット予測を提供する。
微調整は、公開データに制限のあるドメインのパフォーマンス向上に依然として不可欠である。
モデル選択をコンテキスト内学習問題として再キャストする転送可能性推定フレームワークであるTimeTicを紹介する。
論文 参考訳(メタデータ) (2025-09-28T07:07:13Z) - Zero-shot Meta-learning for Tabular Prediction Tasks with Adversarially Pre-trained Transformer [2.1677183904102257]
本稿では、実世界のデータセットを事前学習することなく、表形式の予測タスクでゼロショットメタ学習を行うことのできるAdversarially Pre-trained Transformer(APT)を提案する。
APTは、異なる合成データセットで意図的にモデルに挑戦する敵対的な合成データエージェントで事前訓練されている。
筆者らのフレームワークは,データセットの特徴をフィルタリングすることなく,小さな分類タスクにおける最先端のパフォーマンスと一致していることを示す。
論文 参考訳(メタデータ) (2025-02-06T23:58:11Z) - Analyzing Similarity Metrics for Data Selection for Language Model Pretraining [39.02299450717135]
トレーニング例間の類似性の測定は、言語モデルのための高品質で多様な事前学習データセットのキュレーションに不可欠である。
標準オフザシェルフ埋め込みモデルは、事前学習データキュレーション設定には適していない。
論文 参考訳(メタデータ) (2025-02-04T17:09:44Z) - Measuring Pre-training Data Quality without Labels for Time Series Foundation Models [10.64362760848387]
基礎モデルで学習した表現空間の質を評価するための新しい尺度であるコントラスト精度を導入する。
実験の結果,提案手法とモデル精度との正の相関関係を下流タスクの集合上で明らかにした。
論文 参考訳(メタデータ) (2024-12-09T10:38:30Z) - Scaling TabPFN: Sketching and Feature Selection for Tabular Prior-Data
Fitted Networks [31.82225213006849]
タブラル分類は伝統的に教師付きアルゴリズムに依存しており、トレーニングデータを用いて予測モデルのパラメータを推定する。
近年、TabPFNのようなPFN(Presideed Data Fitted Networks)は、コンテキスト内の表データの分類に成功している。
このようなモデルは非常に有望であるが、実際のデータに適用可能であるのは計算規模が限られているためである。
論文 参考訳(メタデータ) (2023-11-17T16:04:27Z) - Never Train from Scratch: Fair Comparison of Long-Sequence Models Requires Data-Driven Priors [44.5740422079]
標準的なデノベーション目的による事前トレーニングは、複数のアーキテクチャで劇的に向上することを示す。
先行研究とは対照的に、適切に事前訓練された場合の長距離アリーナでのS4の性能に適合するバニラトランスフォーマーが見つかる。
論文 参考訳(メタデータ) (2023-10-04T17:17:06Z) - On the Transferability of Pre-trained Language Models: A Study from
Artificial Datasets [74.11825654535895]
大規模未ラベルテキストデータ上での事前学習言語モデル(LM)により、ダウンストリームのパフォーマンスが極めて容易になる。
我々は,事前学習データに含まれる特定の特徴について,セマンティクス以外では,下流タスクのスクラッチからトレーニングしたデータよりも,事前学習したLMを優れているか検討した。
論文 参考訳(メタデータ) (2021-09-08T10:39:57Z) - Self-Attention Between Datapoints: Going Beyond Individual Input-Output
Pairs in Deep Learning [36.047444794544425]
一度に1つのデータポイントを処理するのではなく、データセット全体を入力として扱う汎用ディープラーニングアーキテクチャを導入します。
このアプローチでは、データポイント間の関係を明示的に推論するために、自己注意を使用します。
従来の非パラメトリックモデルとは異なり、予測に他のデータポイントを使う方法をデータからエンド・ツー・エンドに学習させる。
論文 参考訳(メタデータ) (2021-06-04T16:30:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。