論文の概要: SemStruct: Contextualizing Semantic Embeddings with Structural Information for Schema Matching
- arxiv url: http://arxiv.org/abs/2605.30729v1
- Date: Fri, 29 May 2026 01:45:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.331909
- Title: SemStruct: Contextualizing Semantic Embeddings with Structural Information for Schema Matching
- Title(参考訳): SemStruct:スキーママッチングのための構造情報付きセマンティック埋め込みの文脈化
- Abstract要約: グラフニューラルネットワーク(GNN)の構造帰納バイアスと冷凍PLMのセマンティックパワーを結合するフレームワークであるSemStructを提案する。
テーブルを、列と値が列で連結されたノードである異種グラフとしてモデル化し、GNNが構造全体にわたってあいまいなコンテキストを伝播できるようにする。
- 参考スコア(独自算出の注目度): 20.959946127503354
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Schema matching is a fundamental step in integrating heterogeneous data sources. While Pre-trained Language Models (PLMs) have revolutionized this task by capturing linguistic semantics, they typically process tabular data as serialized text sequences of standalone column descriptions. This serialization discards critical structural information -- specifically, the row-level co-occurrences, i.e. the relational context -- forcing models to rely solely on column header semantics or standalone distributions. To bridge this gap, we propose SemStruct, a framework that joins the semantic power of frozen PLMs with the structural inductive bias of Graph Neural Networks (GNNs). We model the table as a heterogeneous graph where columns and values are nodes connected by rows, allowing the GNN to propagate disambiguating context across the structure. Unlike other state-of-the-art methods that require proprietary LLM access and fine-tuning of language models, SemStruct keeps the language model frozen and trains only a lightweight structural encoder. Extensive experiments on the Valentine and SOTAB-SM benchmarks demonstrate that SemStruct achieves state-of-the-art performance, outperforming fully fine-tuned baselines on complex, semantically joinable datasets. Furthermore, our ablation studies reveal that row representations serve primarily as topological conduits rather than semantic entities, validating the necessity of explicit structural modeling in schema matching.
- Abstract(参考訳): スキーママッチングは異種データソースを統合するための基本的なステップである。
事前訓練された言語モデル(PLM)は言語意味論をキャプチャすることでこのタスクに革命をもたらしたが、それらは通常、スタンドアローンの列記述のシリアライズされたテキストシーケンスとして表形式のデータを処理している。
このシリアライゼーションは、重要な構造情報、具体的には行レベルの共起(リレーショナルコンテキスト)を捨て、モデルが列ヘッダのセマンティクスやスタンドアローンの分布にのみ依存せざるを得なくなる。
このギャップを埋めるために、グラフニューラルネットワーク(GNN)の構造的帰納バイアスと冷凍PLMのセマンティックパワーを結合するフレームワークSemStructを提案する。
テーブルを、列と値が列で連結されたノードである異種グラフとしてモデル化し、GNNが構造全体にわたってあいまいなコンテキストを伝播できるようにする。
プロプライエタリなLLMアクセスと言語モデルの微調整を必要とする他の最先端の手法とは異なり、SemStructは言語モデルを凍結させ、軽量な構造エンコーダのみを訓練する。
ValentineとSOTAB-SMベンチマークの大規模な実験は、SemStructが最先端のパフォーマンスを達成し、複雑なセマンティック結合可能なデータセット上で完全に微調整されたベースラインよりも優れていることを示している。
さらに,本研究では,行表現が意味的エンティティよりもトポロジ的コンデュットとして機能することを明らかにし,スキーママッチングにおける明示的構造モデリングの必要性を検証した。
関連論文リスト
- Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - TERGAD: Structure-Aware Text-Enhanced Representations for Graph Anomaly Detection [15.051477921035264]
Graph Anomaly Detection (GAD) は、ノード、エッジ、サブ構造などの非定型的なグラフエンティティを、多数派から大きく逸脱することを目的としている。
既存のテキストリッチアプローチは通常、生のテキスト機能を使って構造的コンテキストをデータ表現パイプラインに統合する。
本稿では,大規模言語モデルの意味論的推論機能を通じてGADの構造的意味論を充実させる新しいデータ拡張フレームワークであるTERGADを提案する。
論文 参考訳(メタデータ) (2026-05-19T12:09:36Z) - TabEmb: Joint Semantic-Structure Embedding for Table Annotation [3.03279900330493]
テーブルアノテーションは、下流のNLPアプリケーションで使えるWebおよびエンタープライズテーブルを作るのに不可欠である。
既存のモデルは、2Dテーブルを1Dトークンシーケンスに線形化し、事前訓練された言語モデルでエンコードすることで学習する。
本研究では,構造モデリングからセマンティックエンコーディングを分離することで,これらの制約を直接ターゲットとするTabEmbを提案する。
論文 参考訳(メタデータ) (2026-04-21T00:25:49Z) - ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question Answering [55.55968342644846]
テーブルのシリアライゼーションは、複雑なテーブル質問応答において、LLM(Large Language Models)にとって重要なボトルネックであり続けている。
既存のシリアライゼーションメソッドは明示的な階層をキャプチャできず、スキーマの柔軟性が欠如している。
本稿では,AdaSTRとDuTRの2つの主要モジュールを含むASTRA(Adaptive Semantic Tree Reasoning Architecture)を提案する。
複雑なテーブルベンチマーク実験により,本手法がSOTA(State-of-the-art)性能を実現することを示す。
論文 参考訳(メタデータ) (2026-04-10T06:09:41Z) - NAG: A Unified Native Architecture for Encoder-free Text-Graph Modeling in Language Models [33.49410203951687]
このアプローチはテキストグラフに最適である,と我々は主張する。
NAG(Native Architecture for Graphs)は、言語モデル内でグラフ処理を内部化する統合フレームワークである。
NAGは外部エンコーダのオーバーヘッドなしに堅牢なグラフ理解を実現する。
論文 参考訳(メタデータ) (2026-01-30T07:22:11Z) - Improving LLM Reasoning with Homophily-aware Structural and Semantic Text-Attributed Graph Compression [55.51959317490934]
大規模言語モデル(LLM)は、テキスト分散グラフ(TAG)理解において有望な能力を示している。
グラフは本来、構造情報や意味情報を豊富に含むものであり、それらの有効利用はLLMの推論性能の潜在的な利益を解放する可能性があると論じる。
グラフホモフィリーの活用を目的としたフレームワーク LLMs (HS2C) のホモフィリー対応構造とセマンティック圧縮を提案する。
論文 参考訳(メタデータ) (2026-01-13T03:35:18Z) - Large Language Models are Good Relational Learners [55.40941576497973]
本稿では,グラフニューラルネットワーク(GNN)に基づくエンコーダを用いて,大規模言語モデル(LLM)のための構造化リレーショナルプロンプトを生成する新しいアーキテクチャであるRel-LLMを紹介する。
従来のテキストベースのシリアライズ手法とは異なり,本手法はデータベース固有の関係構造を保ちながら,LLMが複雑なエンティティ関係を処理・推論することを可能にする。
論文 参考訳(メタデータ) (2025-06-06T04:07:55Z) - RelDiff: Relational Data Generative Modeling with Graph-Based Diffusion Models [83.6013616017646]
RelDiffは、外部キーグラフ構造を明示的にモデル化することによって完全な関係データベースを合成する新しい拡散生成モデルである。
RelDiffは、現実的で一貫性のある合成リレーショナルデータベースの作成において、従来手法よりも一貫して優れている。
論文 参考訳(メタデータ) (2025-05-31T21:01:02Z) - On Linearizing Structured Data in Encoder-Decoder Language Models: Insights from Text-to-SQL [8.57550491437633]
本研究では,エンコーダ-デコーダ言語モデル,特にT5における構造化データの線形処理について検討する。
この結果から,スキーマリンクや構文予測など,人間設計プロセスの模倣が可能であることが判明した。
また、構造ノードエンコーディングのエゴ中心の性質を含む、モデルの内部メカニズムに関する洞察を明らかにした。
論文 参考訳(メタデータ) (2024-04-03T01:16:20Z) - Proton: Probing Schema Linking Information from Pre-trained Language
Models for Text-to-SQL Parsing [66.55478402233399]
本稿では,ポアンカー距離測定に基づく探索手法を用いて,関係構造を抽出する枠組みを提案する。
スキーマリンクの一般的なルールベース手法と比較して,探索関係は意味的対応をしっかりと捉えることができることがわかった。
我々のフレームワークは3つのベンチマークで最先端のパフォーマンスを新たに設定する。
論文 参考訳(メタデータ) (2022-06-28T14:05:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。