論文の概要: Enhancing Tabular Learners with Context-Aware Semantic Embeddings
- arxiv url: http://arxiv.org/abs/2608.03565v1
- Date: Tue, 04 Aug 2026 12:29:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.186171
- Title: Enhancing Tabular Learners with Context-Aware Semantic Embeddings
- Title(参考訳): 文脈対応セマンティック埋め込みによる単語学習者の促進
- Authors: Günther Schindler, Maximilian Schambach, Johannes Höhne,
- Abstract要約: 本稿では,Large Language Models (LLM) の意味的理解と表型学習者の統計的能力のギャップを埋める新しいフレームワークを提案する。
カスタムトレーニングされたGemma 3ベースのタブラル言語モデルのKVキャッシュに行の代表的なサンプルを埋めて、データセットのセマンティクスの永続的なアンカーを確立する。
- 参考スコア(独自算出の注目度): 1.6381263995389714
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While modern tabular learners excel at capturing statistical patterns, they frequently operate in a semantic vacuum, treating textual features as discrete symbols, ignoring the rich semantics inherent in feature names or cell entries. We propose CASE (Context-Aware Semantic Embeddings), a novel framework that bridges the gap between the semantic understanding of Large Language Models (LLMs) and the statistical capabilities of tabular learners. Unlike existing methods that embed rows in isolation, CASE utilizes a contextualization strategy: we pre-fill the KV cache of a custom-trained Gemma 3-based Tabular Language Model with a representative sample of rows to establish a persistent anchor of the dataset's semantics. This ensures that generated row embeddings are dynamically contextualized, resolving semantic ambiguities and anchoring representations in domain-specific context. Our experiments across several benchmarks (CARTE, TextTab, and TabArena) demonstrate that CASE substantially improves the performance of tabular learners on semantically rich datasets, particularly in low-data regimes.
- Abstract(参考訳): 現代の表型学習者は統計パターンの取得に長けているが、しばしばセマンティック・掃除機で動作し、テキストの特徴を個別のシンボルとして扱い、特徴名やセルエントリに固有の豊富な意味を無視する。
CASE(Context-Aware Semantic Embeddings)は,大規模言語モデル(LLM)の意味的理解と,表型学習者の統計的能力のギャップを埋める新しいフレームワークである。
カスタムトレーニングされたGemma 3ベースのTarbular Language ModelのKVキャッシュに、行の代表的なサンプルを埋め込んで、データセットの意味論の永続的なアンカーを確立する。
これにより、生成された行の埋め込みが動的にコンテキスト化され、セマンティックな曖昧さを解消し、ドメイン固有のコンテキストで表現をアンカーする。
いくつかのベンチマーク(CARTE, TextTab, TabArena)による実験により,CASEは意味豊かなデータセット上での表型学習者の性能を大幅に向上することが示された。
関連論文リスト
- MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image [52.47434184153733]
MulTaBenchは40のデータセットのベンチマークで、画像-タブラルタスクとテキスト-タブラルタスクを等しく分割する。
テキストと画像のモダリティにまたがって、ターゲット認識表現のチューニングによる利得が一般化されることを示す。
論文 参考訳(メタデータ) (2026-05-11T14:12:05Z) - Beyond Statistical Co-occurrence: Unlocking Intrinsic Semantics for Tabular Data Clustering [52.97486694817375]
本稿では,TagCC(Tabular-Augmented Contrastive Clustering)を提案する。
TagCCは、セマンティック・アウェア・トランスフォーメーションを通じて、基礎となるデータセマンティクスをテキストアンカーに蒸留する。
クラスタリングの目的と共同で最適化されており、学習した表現がセマンティックに一貫性があり、クラスタリングに親しみやすいことを保証する。
論文 参考訳(メタデータ) (2026-04-13T00:25:22Z) - Bridging the Semantic Gap for Categorical Data Clustering via Large Language Models [64.58262227709842]
ARISE(Attention-weighted Representation with Integrated Semantic Embeddings)が紹介される。
正確なクラスタリングのためにカテゴリデータのメトリック空間を補完するセマンティックアウェア表現を構築する。
8つのベンチマークデータセットの実験では、7つの代表的なデータセットよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-01-03T11:37:46Z) - ConTextTab: A Semantics-Aware Tabular In-Context Learner [1.0999592665107414]
ConTextTabを導入し、セマンティック理解とアライメントをテーブルネイティブなICLフレームワークに統合する。
我々のモデルは、意味的にリッチなCARTEベンチマークで新しい標準を設定しながら、幅広いベンチマークでSOTAと競合する。
論文 参考訳(メタデータ) (2025-06-12T13:57:29Z) - Make Still Further Progress: Chain of Thoughts for Tabular Data Leaderboard [27.224577475861214]
機械学習の基本的なデータフォーマットであるタブラルデータは、競争や現実世界のアプリケーションで主に利用されている。
本研究では,大規模言語モデルを活用したテキスト内アンサンブルフレームワークを提案する。
提案手法は,各テストインスタンスの周囲のコンテキストを,その近傍と外部モデルのプールからの予測を用いて構築する。
論文 参考訳(メタデータ) (2025-05-19T17:52:58Z) - Language Models As Semantic Indexers [78.83425357657026]
本稿では,ジェネレーティブ言語モデルを用いてセマンティックIDを学習するための自己教師型フレームワークLMIndexerを紹介する。
学習したIDの質を検証し,推奨,製品検索,文書検索の3つの課題において有効性を示す。
論文 参考訳(メタデータ) (2023-10-11T18:56:15Z) - Preserving Modality Structure Improves Multi-Modal Learning [64.10085674834252]
大規模マルチモーダルデータセットによる自己教師付き学習は、人間のアノテーションに頼ることなく、意味的に意味のある埋め込みを学ぶことができる。
これらの手法は、モダリティ固有の埋め込みに存在する意味構造を無視して、ドメイン外のデータをうまく一般化するのに苦労することが多い。
共同埋め込み空間におけるモダリティ特異的な関係を保ち, 一般化性を向上させるためのセマンティック・構造保存整合性アプローチを提案する。
論文 参考訳(メタデータ) (2023-08-24T20:46:48Z) - SubTab: Subsetting Features of Tabular Data for Self-Supervised
Representation Learning [5.5616364225463055]
私たちはTabular Data(SubTab)のサブセット機能である新しいフレームワークを紹介します。
本稿では,タブラルデータ(SubTab)のサブセット機能である新しいフレームワークを提案する。
我々は、自動エンコーダ設定で、その機能の一部分からデータを再構成することで、その基盤となる表現をよりよく捉えることができると論じている。
論文 参考訳(メタデータ) (2021-10-08T20:11:09Z) - GraPPa: Grammar-Augmented Pre-Training for Table Semantic Parsing [117.98107557103877]
テーブルセマンティック解析のための効果的な事前学習手法GraPPaを提案する。
我々は、同期文脈自由文法を用いて、高自由度テーブル上に合成質問ペアを構築する。
実世界のデータを表現できるモデルの能力を維持するため、マスキング言語モデリングも含んでいる。
論文 参考訳(メタデータ) (2020-09-29T08:17:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。