論文の概要: Understanding Context Sampling in TabPFN on Small Tabular Datasets
- arxiv url: http://arxiv.org/abs/2607.26628v1
- Date: Wed, 29 Jul 2026 08:54:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.585951
- Title: Understanding Context Sampling in TabPFN on Small Tabular Datasets
- Title(参考訳): 小語彙データセットを用いたタブPFNにおけるコンテキストサンプリングの理解
- Abstract要約: 15個のOpenMLデータセットの繰り返しコンテキストサンプリングを用いて,コンテキストが予測安定性,精度,選択コストに与える影響について検討した。
AUC係数はk=16で約6~18%から、大きなコンテキストサイズでは1~4%に低下する。
混合効果分析は、特徴平均マッチングよりも多様性とカバレッジを、精度のより強い予測因子として識別する。
- 参考スコア(独自算出の注目度): 0.40611352512781873
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: TabPFN performs classification through in-context learning: it conditions on a set of labeled training rows (the context, or prototypes) and predicts test labels without gradient updates. On small tabular datasets, practitioners must still choose the context size and which rows constitute the context. We study how these choices affect prediction stability, accuracy, and selection cost using repeated context sampling on 15 OpenML datasets. Specifically, we investigate (i) whether larger contexts reduce prediction variability across random draws, (ii) whether accuracy depends on preserving the training distribution or on feature-space coverage, and (iii) whether expensive selection methods such as K-Means and farthest-point sampling provide benefits over uniform random sampling. We find that larger contexts are both more accurate and substantially more stable, with AUC coefficient of variation decreasing from roughly 6 to 18% at k=16 to 1 to 4% at larger context sizes on datasets with room for improvement. Although accuracy correlates with distribution representativeness in random contexts, controlled experiments show that matching feature means alone can reduce accuracy by up to 0.5 AUC because it reduces context diversity. Mixed-effects analysis identifies diversity and coverage, rather than feature-mean matching, as the stronger predictor of accuracy (diversity beta=+0.23, p=3x10^-12; feature-mean shift beta=-0.01, p=0.71). K-Means and farthest-point sampling achieve similar accuracy to random selection while requiring two to three orders of magnitude more selection cost. These results show that random sampling succeeds because it provides feature-space coverage in expectation, not because it reproduces the underlying data distribution.
- Abstract(参考訳): TabPFNはコンテキスト内学習を通じて分類を行い、ラベル付きトレーニング行(コンテキスト、プロトタイプ)のセットに条件を設定し、勾配更新なしでテストラベルを予測する。
小さな表のデータセットでは、実践者はコンテキストサイズとどの行がコンテキストを構成するかを選択する必要があります。
我々は,この選択が予測安定性,精度,選択コストにどのように影響するかを,15のOpenMLデータセット上で繰り返しコンテキストサンプリングを用いて検討した。
具体的には
i) より大きなコンテキストがランダムな引き込みにおける予測変数を減少させるか否か。
二 トレーニング分布の保存又は特徴空間のカバレッジに依存しているか、及び
3) K平均や最遠点サンプリングのような高価な選択法が一様ランダムサンプリングよりも有益であるか否か。
AUC係数はk=16で約6~18%から、改善の余地のあるデータセットでより大きなコンテキストサイズで1~4%に低下する。
精度はランダムな文脈における分布代表性と相関するが、制御された実験により、一致した特徴だけで文脈の多様性を減少させるため、最大0.5AUCの精度を低下させることができることが示されている。
混合効果分析は、特徴平均マッチングよりも多様性とカバレッジを精度の強い予測因子として同定する(多様性ベータ=+0.23, p=3x10^-12;特徴平均シフトベータ=-0.01, p=0.71)。
K平均と最遠点サンプリングは、選択コストの2~3桁を要しながら、ランダム選択と同じような精度を達成する。
これらの結果は,データ分布を再現するためではなく,期待する特徴空間のカバレッジを提供するため,ランダムサンプリングが成功することを示している。
関連論文リスト
- Adaptive $k$ Nearest Neighbors Classifier via Granular Ball Computing [60.23863579199315]
k$-Nearest Neighbor(KNN)アルゴリズムは様々なタスクで広く使われている。
本稿では,粒度計算による適応的かつ効率的なKNN手法を提案する。
論文 参考訳(メタデータ) (2026-08-13T07:39:46Z) - Rethinking Representativeness and Diversity in Dynamic Data Selection [32.400383488290906]
動的データ選択は、精度を維持しながらデータセットの変動するサブセットをサンプリングすることで、トレーニングを加速する。
サンプル評価の基礎となる2つの基本概念、代表性と多様性を再考する。
本手法は2倍以上のトレーニングアクセラレーションと完全データ精度を一致または超える。
論文 参考訳(メタデータ) (2026-03-05T09:21:58Z) - Optimal Prediction-Augmented Algorithms for Testing Independence of Distributions [4.200594864147057]
複数の確率変数に対して$p$の独立性をテストする問題に対処する。
補助的だが信頼できない、予測可能な情報を組み込んだテスタを設計します。
我々のフレームワークは、予測の品質に関わらず、テスターが堅牢で、最悪のケースの妥当性を維持することを保証します。
論文 参考訳(メタデータ) (2026-03-04T21:55:08Z) - Faithful and Fast Influence Function via Advanced Sampling [10.773767694482858]
特徴量とロジットに基づく2つの高度なサンプリング手法を提案する。
これらのサンプルは、機能やログの分布を考慮して、データセット全体の小さいが代表的なサブセットを選択する。
モデルがいかに効率的にクラスを忘れるかを測定するためにF1スコアを用いて、クラス除去実験を通じてアプローチを検証する。
論文 参考訳(メタデータ) (2025-10-30T17:55:19Z) - Size-adaptive Hypothesis Testing for Fairness [8.315080617799445]
我々は、公正性評価を証拠に基づく統計的決定に変換する統一的、サイズ適応的、仮説テストフレームワークを導入する。
統計的パリティ差に対して中央限の結果が証明され、解析的信頼区間と、タイプI(偽陽性)エラーがレベル$alpha$で保証されるウォルド試験が導かれる。
小さな交叉群の長い尾に対して、完全ベイズ的ディリクレ・マルチノミカル推定器を導出する。
論文 参考訳(メタデータ) (2025-06-12T11:22:09Z) - Regression-Based Estimation of Causal Effects in the Presence of Selection Bias and Confounding [52.1068936424622]
治療が介入によって設定された場合、対象変数$Y$に対して、予測因果効果$E[Y|do(X)]$を推定する問題を考える。
選択バイアスや欠点のない設定では、$E[Y|do(X)] = E[Y|X]$ となる。
選択バイアスとコンバウンディングの両方を組み込んだフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-26T13:43:37Z) - Semiparametric conformal prediction [79.6147286161434]
ベクトル値の非整合性スコアの結合相関構造を考慮した共形予測セットを構築する。
スコアの累積分布関数(CDF)を柔軟に推定する。
提案手法は,現実の回帰問題に対して,所望のカバレッジと競争効率をもたらす。
論文 参考訳(メタデータ) (2024-11-04T14:29:02Z) - Bootstrap Sampling Rate Greater than 1.0 May Improve Random Forest Performance [0.0]
ランダムフォレスト(RF)は、ブートストラップサンプリングを使用して、各コンポーネントツリーの個別のトレーニングセットを生成する。
ブートストラップ率(英: bootstrap rate, BR)は、各ブートストラップサンプルの観測回数とトレーニングインスタンスの総数との比率である。
BR値が高いと、標準設定に比べて分類精度が統計的に有意に向上することを示した。
論文 参考訳(メタデータ) (2024-10-05T22:13:08Z) - Downstream-Pretext Domain Knowledge Traceback for Active Learning [138.02530777915362]
本稿では、下流知識と事前学習指導のデータ相互作用をトレースするダウンストリーム・プレテキスト・ドメイン知識トレース(DOKT)手法を提案する。
DOKTは、トレースバックの多様性指標とドメインベースの不確実性推定器から構成される。
10のデータセットで行った実験は、我々のモデルが他の最先端の手法よりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-20T01:34:13Z) - Data Selection for Language Models via Importance Resampling [90.9263039747723]
我々は、望まれるターゲット分布に合わせるために、大規模な未ラベルデータセットのサブセットを選択するという問題を形式化する。
我々は、LMデータ選択のために低次元で使用される古典的な重要度再サンプリング手法を拡張した。
DSIRフレームワークをhash n-gram機能でインスタンス化し、4.5時間で1億のドキュメントを選択できる。
論文 参考訳(メタデータ) (2023-02-06T23:57:56Z) - Predict then Interpolate: A Simple Algorithm to Learn Stable Classifiers [59.06169363181417]
Predict then Interpolate (PI) は環境全体にわたって安定な相関関係を学習するためのアルゴリズムである。
正しい予測と間違った予測の分布を補間することにより、不安定な相関が消えるオラクル分布を明らかにすることができる。
論文 参考訳(メタデータ) (2021-05-26T15:37:48Z) - Least Squares Estimation Using Sketched Data with Heteroskedastic Errors [0.0]
ランダムなプロジェクションによってスケッチされたデータを用いた推定は、エラーがホモスケダスティックであるかのように振る舞うことを示す。
楽器関連性の第一段階Fテストを含む推論は、スケッチスキームが適切に選択された場合の完全なサンプルケースよりも簡単である。
論文 参考訳(メタデータ) (2020-07-15T15:58:27Z) - Stable Prediction via Leveraging Seed Variable [73.9770220107874]
従来の機械学習手法は、非因果変数によって誘導されるトレーニングデータにおいて、微妙に刺激的な相関を利用して予測する。
本研究では, 条件付き独立性テストに基づくアルゴリズムを提案し, 種子変数を先行変数とする因果変数を分離し, 安定な予測に採用する。
我々のアルゴリズムは、安定した予測のための最先端の手法より優れている。
論文 参考訳(メタデータ) (2020-06-09T06:56:31Z) - Parameter Space Factorization for Zero-Shot Learning across Tasks and
Languages [112.65994041398481]
本稿では,ニューラルパラメータの空間に対するベイズ生成モデルを提案する。
タスク言語の組み合わせから得られたデータに基づいて、そのような潜伏変数よりも後部を推測する。
我々のモデルは、最先端のゼロショットの言語間転送手法よりも、同等か良い結果が得られる。
論文 参考訳(メタデータ) (2020-01-30T16:58:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。