論文の概要: Solving In-Table Prediction Problems by Deep Neural Networks with Performance Evaluation Using Synthetic Data
- arxiv url: http://arxiv.org/abs/2609.01262v1
- Date: Tue, 01 Sep 2026 13:53:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.718588
- Title: Solving In-Table Prediction Problems by Deep Neural Networks with Performance Evaluation Using Synthetic Data
- Title(参考訳): 合成データを用いた性能評価を伴うディープニューラルネットワークによる端末内予測問題の解法
- Authors: Xiao Zhao, Daniela Oelke,
- Abstract要約: 本研究では、ディープNNを用いて、与えられたテーブル内の個々の列間の関係を学習する。
NNが与えられたテーブル内の任意の選択された列の値を、残りの列に基づいて予測できるかどうかを検討する。
マスクアウトする列をランダムに選択し,学習対象として利用することにより,この問題に対処する自己教師型学習手法を適用する。
- 参考スコア(独自算出の注目度): 4.657670532006343
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Tabular deep learning (TDL) leverages neural networks (NN) to extract patterns from tabular data. Traditional TDL methods follow a supervised learning paradigm, where a target feature is explicitly given. In this work, however, we explore a different approach by employing deep NNs to learn relationships among individual columns within a given table. We investigate whether NNs can predict the values of arbitrarily selected columns in a given table based on the remaining known columns. We call this problem In-Table Prediction (ITB), which is slightly different from table imputation methods and the pretraining task of TDL. Three potential usage scenarios are identified, which, to our best knowledge, have not been extensively studied in the literature. A self-supervised learning approach is applied to address this problem by randomly selecting columns to be masked out and used as learning targets. This work focuses on tabular datasets containing only continuous features. To handle missing values in continuous features, a novel neural layer is proposed to embed both numerical and empty values. Synthetic data is generated based on predefined column relationships, with empty values inserted using two distinct mechanisms. Additionally, an adapted masking strategy is employed to create test data. Performances of three NN architectures, namely MLP, Resnet and Transformer, are evaluated using the generated synthetic data. We conclude that, the attention-based structure outperforms the other two networks, when a sufficiently large number of training examples is available and a relatively large embedding length is chosen. We stress that these findings are obtained under controlled, synthetic conditions with a small number of columns and it should therefore be regarded as an initial, narrowly-scoped investigation rather than a general characterization of ITP on real-world tabular data.
- Abstract(参考訳): タブラルディープラーニング(TDL)は、ニューラルネットワーク(NN)を活用して、表データからパターンを抽出する。
従来のTDLメソッドは、対象の機能を明示的に指定した教師付き学習パラダイムに従っている。
しかし、本研究では、ディープNNを用いて、与えられたテーブル内の個々の列間の関係を学習することで、異なるアプローチを探求する。
NNが与えられたテーブル内の任意の選択された列の値を、残りの列に基づいて予測できるかどうかを検討する。
我々は、テーブル計算法とTDLの事前学習タスクとは若干異なるITB(In-Table Prediction)と呼ぶ。
3つの潜在的利用シナリオが特定され、私たちの知る限り、文献では広く研究されていない。
マスクアウトした列をランダムに選択し,学習対象として利用することにより,この問題に対処する自己教師型学習手法を適用する。
この研究は、連続的な機能のみを含む表形式のデータセットに焦点を当てている。
連続的な特徴の欠落値を扱うために、数値と空の値の両方を埋め込む新しいニューラルネットワーク層が提案されている。
合成データは、あらかじめ定義された列関係に基づいて生成され、2つの異なるメカニズムを用いて空の値が挿入される。
さらに、テストデータを作成するために適応的なマスキング戦略が採用されている。
MLP, Resnet, Transformerの3つのNNアーキテクチャの性能を, 生成した合成データを用いて評価した。
注意に基づく構造が他の2つのネットワークより優れており、十分な数のトレーニング例が利用可能であり、比較的大きな埋め込み長が選択できる。
本研究は, 少ない列数で制御された合成条件下で得られた知見を強調し, 実世界の表層データ上でのIPPの一般的な特徴よりも, 初期的, 狭く観察された調査とみなすべきである。
関連論文リスト
- TabINR: An Implicit Neural Representation Framework for Tabular Data Imputation [0.6407815281667869]
本稿では,テーブルをニューラルネットワークとしてモデル化する自動デコーダベースのImplicit Neural RepresentationフレームワークであるTabINRを紹介する。
我々は、現実世界の12のデータセットと複数の欠落メカニズムにまたがって、我々のフレームワークを評価した。
論文 参考訳(メタデータ) (2025-10-01T17:24:35Z) - Revisiting Nearest Neighbor for Tabular Data: A Deep Tabular Baseline Two Decades Later [76.66498833720411]
K$-nearest neighbors (KNN) はもともと,インスタンス間のセマンティックな類似性を捉えるために線形投影を学習するために設計されたものだ。
意外なことに、SGDを用いたNAAの実装と次元減少のない実装は、表データの良好な性能をすでに達成しています。
本稿では、損失関数、予測戦略、深いアーキテクチャなど、これらの改善の背景にある要因を分析して、論文を締めくくる。
論文 参考訳(メタデータ) (2024-07-03T16:38:57Z) - Making Pre-trained Language Models Great on Tabular Prediction [50.70574370855663]
ディープニューラルネットワーク(DNN)の転送性は、画像および言語処理において著しく進歩している。
本稿では,表型データ予測のための訓練済みLMであるTP-BERTaを提案する。
新たな相対等級トークン化では、スカラー数値の特徴値を細分化した高次元トークンに変換し、特徴値と対応する特徴名を統合する。
論文 参考訳(メタデータ) (2024-03-04T08:38:56Z) - Minimally Supervised Learning using Topological Projections in
Self-Organizing Maps [55.31182147885694]
自己組織化マップ(SOM)におけるトポロジカルプロジェクションに基づく半教師付き学習手法を提案する。
提案手法は,まずラベル付きデータ上でSOMを訓練し,最小限のラベル付きデータポイントをキーベストマッチングユニット(BMU)に割り当てる。
提案した最小教師付きモデルが従来の回帰手法を大幅に上回ることを示す。
論文 参考訳(メタデータ) (2024-01-12T22:51:48Z) - Prompt Based Tri-Channel Graph Convolution Neural Network for Aspect
Sentiment Triplet Extraction [63.0205418944714]
Aspect Sentiment Triplet extract (ASTE)は、ある文の三つ子を抽出する新しいタスクである。
近年の研究では、単語関係を二次元テーブルにエンコードするテーブル充填パラダイムを用いてこの問題に対処する傾向にある。
本稿では, 関係表をグラフに変換し, より包括的な関係情報を探索する, Prompt-based Tri-Channel Graph Convolution Neural Network (PT-GCN) と呼ばれるASTEタスクの新しいモデルを提案する。
論文 参考訳(メタデータ) (2023-12-18T12:46:09Z) - Between-Sample Relationship in Learning Tabular Data Using Graph and
Attention Networks [0.0]
本論文は, サンプル間の関係を組み込むことで表型データ表現を学習するi.d仮定を緩和する。
いくつかのGNNとSOTA(State-of-the-art attention model)を用いた仮説について検討する。
その結果,5つのデータセット上での従来の機械学習と,3つのデータセット上でのSOTA深層表型学習よりも注目度の高いGNN手法が優れていることがわかった。
論文 参考訳(メタデータ) (2023-06-11T20:56:21Z) - SUN: Exploring Intrinsic Uncertainties in Text-to-SQL Parsers [61.48159785138462]
本稿では,ニューラルネットワークに基づくアプローチ(SUN)における本質的な不確かさを探索することにより,テキストから依存への変換性能を向上させることを目的とする。
5つのベンチマークデータセットの大規模な実験により、我々の手法は競合より大幅に優れ、新しい最先端の結果が得られた。
論文 参考訳(メタデータ) (2022-09-14T06:27:51Z) - TabularNet: A Neural Network Architecture for Understanding Semantic
Structures of Tabular Data [30.479822289380255]
本稿では,テーブルから空間情報と関係情報を同時に抽出する新しいニューラルネットワークアーキテクチャであるTabularNetを提案する。
リレーショナル情報のために,WordNet木に基づく新しいグラフ構築法を設計し,GCNベースのエンコーダを採用する。
私たちのニューラルネットワークアーキテクチャは、さまざまな理解タスクのための統一されたニューラルネットワークバックボーンであり、マルチタスクシナリオで利用できます。
論文 参考訳(メタデータ) (2021-06-06T11:48:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。