論文の概要: When Does Small Data Work? Accuracy and Efficiency Trade-offs Between Tabular Foundation Models and Conventional Methods for Crowd-State Classification at Hajj and Umrah
- arxiv url: http://arxiv.org/abs/2607.04013v1
- Date: Sat, 04 Jul 2026 20:19:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.792096
- Title: When Does Small Data Work? Accuracy and Efficiency Trade-offs Between Tabular Foundation Models and Conventional Methods for Crowd-State Classification at Hajj and Umrah
- Title(参考訳): 小規模データはいつ機能するのか? - Hajj と Umrah のクラウドステート分類におけるタブラファウンデーションモデルと従来手法との精度と効率のトレードオフ-
- Authors: AlJawharh S. AlOtaibi, Mohamed Eltahir, Jude AlSubaie,
- Abstract要約: タブラル基礎モデルは、タスク固有のトレーニングなしで少数の例からのみ予測する。
本研究では,ラベルが不足している場合の有効度を評価するために,群集状態の分類試験を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning from few labeled examples is a central challenge in tabular machine learning, and it becomes the binding constraint in domains where labeling is costly, such as crowd monitoring during Hajj and Umrah. Tabular foundation models, which predict from only a handful of examples without task-specific training, were recently introduced to address this very-few-label regime. In this study we test them on crowd-state classification to assess how much they help when labels are scarce, and we compare them against standard machine learning methods to characterize the accuracy and efficiency trade-offs between the two approaches. Using three real datasets we evaluate different machine learning models, in untuned and tuned forms, against three foundation models. Results show that no single family is best everywhere. The right choice depends on the label budget. When labels are very few, foundation models lead. As labels grow, tuned conventional models catch up and significantly surpass the foundation models on the more structural geometry target. Efficiency separates them further where tuned machine learning models incur a large tuning cost that foundation models avoid, although foundation models reprocess their context at every prediction. We summarize these results as a practical map of which approach to prefer under a given label budget and computational budget.
- Abstract(参考訳): ほとんどラベル付けされていない例から学ぶことは、表計算機械学習における中心的な課題であり、HajjやUmrahのクラウドモニタリングなど、ラベル付けがコストがかかるドメインにおけるバインディング制約になる。
タスク固有のトレーニングを伴わない少数の例からのみ予測できるタブラル基礎モデルが最近導入された。
本研究は,ラベルが不足している場合にどの程度役立つかを評価するために,群集状態の分類試験を行い,その精度と効率のトレードオフを特徴付けるための標準的な機械学習手法と比較する。
3つの実際のデータセットを使用して、3つの基礎モデルに対して、トレーニングされていない、チューニングされていない形式で異なる機械学習モデルを評価する。
結果は、どの家族も至る所で最善を尽くさないことを示している。
正しい選択はラベルの予算に依存する。
ラベルがほとんどない場合、ファンデーションモデルがリードします。
ラベルが大きくなるにつれて、調整された従来のモデルは、より構造的な幾何学的対象の基盤モデルに追いつき、はるかに上回る。
効率性により、チューニングされた機械学習モデルは基礎モデルが避ける大きなチューニングコストを発生させるが、基礎モデルは予測毎にコンテキストを再処理する。
これらの結果は,ラベル予算と計算予算に基づいて,どのアプローチを優先するかの実践的なマップとして要約する。
関連論文リスト
- Foundation Models for Credit Risk Prediction: A Game Changer? [12.43753732401141]
予測モデルは信用リスク管理において重要な役割を担い、デフォルト確率と損失の正確な推定を通じて重要な決定を導く。
多様なドメインからの広範なデータセットに基づいて事前訓練されたファンデーションモデルは、事前の知識を活用することで、顕著なパフォーマンスを誇示している。
論文 参考訳(メタデータ) (2026-05-18T09:52:48Z) - Machine Learning from Explanations [17.28638946021444]
より小さなデータセット上で信頼性の高い分類モデルをトレーニングするための革新的なアプローチを導入する。
提案手法は,モデル予測精度の向上と,説明に合うように注意を精査する2段階の学習サイクルを中心に展開する。
トレーニングサイクルがより正確で信頼性の高いモデルへの収束を早めることを示す。
論文 参考訳(メタデータ) (2025-07-07T09:09:52Z) - Auto-Labeling Data for Object Detection [20.557988700343373]
本稿では,基礎となる真理ラベルを使わずに標準物体検出モデルを訓練する問題に対処する。
視覚言語基礎モデルを用いて,アプリケーション固有の擬似「地下真実」ラベルを生成する。
当社のアプローチは,複数のデータセット上での競合性能を維持する上で,標準的なラベル付けに代わる有効な手段であることに気付きました。
論文 参考訳(メタデータ) (2025-06-03T01:27:56Z) - A Simple Baseline for Predicting Events with Auto-Regressive Tabular Transformers [70.20477771578824]
イベント予測への既存のアプローチには、タイムアウェアな位置埋め込み、学習行とフィールドエンコーディング、クラス不均衡に対処するオーバーサンプリング方法などがある。
基本位置埋め込みと因果言語モデリングの目的を持つ標準自己回帰型LPM変換器を用いて,単純だが柔軟なベースラインを提案する。
私たちのベースラインは、一般的なデータセットで既存のアプローチよりも優れており、さまざまなユースケースに使用することができます。
論文 参考訳(メタデータ) (2024-10-14T15:59:16Z) - When is an Embedding Model More Promising than Another? [33.540506562970776]
埋め込みは機械学習において中心的な役割を担い、あらゆるオブジェクトを数値表現に投影し、様々な下流タスクを実行するために利用することができる。
埋め込みモデルの評価は一般にドメイン固有の経験的アプローチに依存する。
本稿では, 組込み器の評価を統一的に行い, 充足性と情報性の概念を考察する。
論文 参考訳(メタデータ) (2024-06-11T18:13:46Z) - Label-Retrieval-Augmented Diffusion Models for Learning from Noisy
Labels [61.97359362447732]
ノイズの多いラベルからの学習は、実際のアプリケーションのための機械学習において、重要かつ長年にわたる問題である。
本稿では,生成モデルの観点からラベルノイズ問題を再構成する。
我々のモデルは、標準的な実世界のベンチマークデータセットで新しいSOTA(State-of-the-art)結果を達成する。
論文 参考訳(メタデータ) (2023-05-31T03:01:36Z) - Synthetic Model Combination: An Instance-wise Approach to Unsupervised
Ensemble Learning [92.89846887298852]
ラベル付きデータのトレーニングセットから学ぶ機会のない、新しいテストデータに対する予測を検討する。
専門家モデルのセットと予測へのアクセスと、トレーニングに使用するデータセットに関する制限された情報を提供すること。
論文 参考訳(メタデータ) (2022-10-11T10:20:31Z) - Cross-Model Pseudo-Labeling for Semi-Supervised Action Recognition [98.25592165484737]
CMPL(Cross-Model Pseudo-Labeling)と呼ばれる,より効果的な擬似ラベル方式を提案する。
CMPLは、それぞれRGBモダリティとラベル付きデータのみを使用して、Kinetics-400とUCF-101のTop-1の精度を17.6%と25.1%で達成している。
論文 参考訳(メタデータ) (2021-12-17T18:59:41Z) - When in Doubt, Summon the Titans: Efficient Inference with Large Models [80.2673230098021]
本稿では,大規模モデルのモデル化の利点を実現する蒸留に基づく2段階の枠組みを提案する。
簡単な"例のサブセットでのみ正確な予測を行うために、私たちは、大きな教師モデルを使用して、軽量な学生モデルをガイドします。
提案した蒸留法は, 簡単な事例のみを扱うため, 学生規模でより積極的なトレードオフが可能であり, 推論の償却コストを低減できる。
論文 参考訳(メタデータ) (2021-10-19T22:56:49Z) - DoubleEnsemble: A New Ensemble Method Based on Sample Reweighting and
Feature Selection for Financial Data Analysis [22.035287788330663]
学習軌道に基づくサンプル再重み付けとシャッフルに基づく特徴選択を利用したアンサンブルフレームワークであるDoubleEnsembleを提案する。
我々のモデルは、複雑なパターンを抽出できる幅広い基盤モデルに適用でき、金融市場の予測に過度に適合し、不安定な問題を緩和できる。
論文 参考訳(メタデータ) (2020-10-03T02:57:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。