論文の概要: Why Large Language Models Fail at Tabular Prediction
- arxiv url: http://arxiv.org/abs/2608.02412v1
- Date: Mon, 03 Aug 2026 15:52:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.685828
- Title: Why Large Language Models Fail at Tabular Prediction
- Title(参考訳): 語彙予測で大言語モデルが機能しない理由
- Abstract要約: 大規模言語モデル(LLM)は、目覚ましいタスクのデフォルトツールとなっている。
しかし彼らは、最も一般的な機械学習ワークロードの1つで、目立ってあまり成功していない。
- 参考スコア(独自算出の注目度): 1.1908340728628395
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have become the default tool for a remarkable range of tasks, yet they have had conspicuously little success at one of the most common machine learning workloads: predictive analytics over tabular data. This gap is the founding premise of the fast-growing field of tabular foundation models, but the question of why generic LLMs fail has remained open. We study a frontier LLM in its purest inference regime - a single generation pass over a prompt containing the full training and test data, with no tools, no agentic scaffolding, and no fine-tuning - and systematically evaluate five hypotheses for the failure: (a) an inability to handle noisy or non-linearly-separable data; (b) the linearised CSV format obscuring column structure; (c) the tokenisation of numeric values; (d) the number of test points classified per query; and (e) the dimensionality of the input. Controlled experiments falsify (a)-(d). Dimensionality, in contrast, is decisive: sweeping random linear projections of thirty-one benchmark datasets, the LLM is the only method among nine whose accuracy decreases as dimensionality grows, while every classical baseline stays flat or improves. A behavioural comparison against 252 configured classical models finds that in two dimensions the LLM predicts like a local, distance-based method (up to 91.6% grid agreement), but in higher dimensions no classical model - even when augmented with tuned, dimension-dependent noise - reproduces its predictions. We do not claim to have identified the internal mechanism; our results show, more modestly, that the LLM's capability dissolves with dimension in a way no noise-corrupted classical learner mimics - which explains why LLMs, so capable elsewhere, keep losing to fifty-year-old baselines on tables, while leaving the mechanism of the prediction as an open question.
- Abstract(参考訳): 大きな言語モデル(LLM)は、目覚ましいタスクのデフォルトツールとなっているが、最も一般的な機械学習ワークロードの1つで顕著にはほとんど成功していない。
このギャップは急速に成長する表層基盤モデルの前提となっているが、なぜジェネリックLLMが失敗するのかという問題は未解決のままである。
フルトレーニングとテストデータを含むプロンプトを1世代でパスし、ツールがなく、エージェントの足場がなく、微調整もせず、失敗の5つの仮説を体系的に評価する。
a) ノイズ又は非線形分離データを扱うことができないこと
b) 列構造を隠蔽する線形化CSV形式
(c) 数値のトークン化
(d)クエリ毎に分類されたテストポイントの数、及び
e)入力の次元性
微粒化制御実験
(a)
(d)。
一方、次元性は決定的であり、301のベンチマークデータセットのランダムな線形射影を網羅し、LCMは次元が大きくなるにつれて精度が低下する9つの方法の中で唯一の方法であり、古典的なベースラインはすべて平坦または改善されている。
252個の構成された古典的モデルと比較して、LLMは2次元で局所的距離に基づく手法(最大91.6%のグリッド合意)のように予測できるが、高次元では古典的モデル(たとえ調整された次元依存ノイズで拡張されたとしても)は予測を再現しない。
より控えめに言うと、LLMの能力は、騒音による古典的な学習者が模倣しない方法で次元で溶解し、なぜLLMは、他の場所では機能し、テーブル上の50年前の基準線を失い続けるのかを説明しながら、予測のメカニズムをオープンな疑問として残している。
関連論文リスト
- From Residuals to Reasons: LLM-Guided Mechanism Inference from Tabular Data [10.795877029195845]
科学的応用のための機械学習における永続的な課題は、予測と理解を共同で達成することである。
マルチエージェント残差文脈学習(MARICL)を導入する。
MARICLは、すべてのデータセットのベースモデルに対して一貫して改善されている。
論文 参考訳(メタデータ) (2026-05-21T15:34:08Z) - FORESTLLM: Large Language Models Make Random Forest Great on Few-shot Tabular Learning [20.27406245916013]
本稿では,大規模言語モデル(LLM)の意味的推論能力を用いて,決定林の構造的帰納バイアスを統一する枠組みを提案する。
まずLLMがラベル付きデータとラベルなしデータの両方の一貫性に基づいて候補分割を評価するセマンティックスプリッティング基準を導入し、より堅牢で一般化可能な木構造を数発の監視下で実現する。
第2に,LLMが決定経路とその支持例を簡潔で決定論的な予測に蒸留し,雑音の多い経験的推定を意味的インフォームドアウトプットに置き換える,葉ノード安定化のためのワンタイムインコンテキスト推論機構を提案する。
論文 参考訳(メタデータ) (2026-01-16T14:08:51Z) - An Empirical Investigation of Robustness in Large Language Models under Tabular Distortions [8.023379679609151]
大規模言語モデル(LLM)は、他の標準表現の表計算データが意味的および構造的歪みを受けると失敗する。
システムプロンプトを通じて明示的な事前情報を提供する場合のみ、モデルは推論戦略を部分的に調整し、いくつかの歪みを修正する。
論文 参考訳(メタデータ) (2026-01-08T15:10:32Z) - Predicting Emergent Capabilities by Finetuning [98.9684114851891]
微調整された言語モデルでは,出現頻度の低いモデルに展開するスケーリングのポイントをシフトできることがわかった。
提案手法は4つの標準NLPベンチマークを用いて検証する。
いくつかのケースでは、最大4倍の計算でトレーニングされたモデルが出現したかどうかを正確に予測できる。
論文 参考訳(メタデータ) (2024-11-25T01:48:09Z) - Can adversarial attacks by large language models be attributed? [1.2289361708127877]
本研究では,Large Language Models (LLM) のクラスは,出力のみから識別できないことを示す。
近年では, 与えられた出力に対して, 可算モデル起源数の爆発を定量化している。
論文 参考訳(メタデータ) (2024-11-12T18:28:57Z) - Large Language Models Must Be Taught to Know What They Don't Know [97.90008709512921]
正解と誤解の小さなデータセットを微調整すると、高い一般化と計算オーバーヘッドの少ない不確実性推定が得られることを示す。
また,確実な不確実性推定を可能にする機構についても検討し,多くのモデルを汎用的不確実性推定器として利用することができることを示した。
論文 参考訳(メタデータ) (2024-06-12T16:41:31Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Characterizing Truthfulness in Large Language Model Generations with
Local Intrinsic Dimension [63.330262740414646]
大規模言語モデル(LLM)から生成されたテキストの真偽を特徴付ける方法と予測法について検討する。
モデルアクティベーションの局所固有次元 (LID) を用いて, 内部アクティベーションを調査し, LLMの真偽を定量化する。
論文 参考訳(メタデータ) (2024-02-28T04:56:21Z) - Imputation-Free Learning from Incomplete Observations [73.15386629370111]
本稿では,不備な値を含む入力からの推論をインプットなしでトレーニングするIGSGD法の重要性について紹介する。
バックプロパゲーションによるモデルのトレーニングに使用する勾配の調整には強化学習(RL)を用いる。
我々の計算自由予測は、最先端の計算手法を用いて従来の2段階の計算自由予測よりも優れている。
論文 参考訳(メタデータ) (2021-07-05T12:44:39Z) - Meta-Learned Confidence for Few-shot Learning [60.6086305523402]
数ショットのメトリックベースのアプローチのための一般的なトランスダクティブ推論手法は、最も確実なクエリ例の平均で、各クラスのプロトタイプを更新することである。
本稿では,各クエリの信頼度をメタラーニングして,ラベルのないクエリに最適な重みを割り当てる手法を提案する。
4つのベンチマークデータセットに対してメタ学習の信頼度で、少数ショットの学習モデルを検証した。
論文 参考訳(メタデータ) (2020-02-27T10:22:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。