論文の概要: PluRel-to-RDB-PFN: Schema-Guided Synthetic Relational Pretraining
- arxiv url: http://arxiv.org/abs/2607.29129v1
- Date: Fri, 31 Jul 2026 07:59:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.650127
- Title: PluRel-to-RDB-PFN: Schema-Guided Synthetic Relational Pretraining
- Title(参考訳): PluRel-to-RDB-PFN:Schema-Guided Synthetic Relational Pretraining
- Abstract要約: ファンデーションモデル(RFM)は、事前訓練のために大規模な合成データベースを必要とする。
汎用合成関係データベースであるPluRelが,RDB-PFNの外部データソースとして機能するかどうかを検討した。
我々はPluRel生成リレーショナルデータベースをRDB-PFNトレーニングフォーマットにマッピングする変換パイプラインを構築した。
- 参考スコア(独自算出の注目度): 0.7211865874649033
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Relational Foundation Models (RFMs) require large-scale synthetic relational databases for pretraining, but existing approaches tightly couple data generation with the model training pipeline. We study whether PluRel, a general-purpose synthetic relational database generator, can serve as an external data source for RDB-PFN, a relational in-context learner originally pretrained with a 600K-task single-table warm-up followed by an approximately 1.8M-task adaptation stage. We build a conversion pipeline that maps PluRel-generated databases, including externally constructed binary prediction tasks, into the RDB-PFN training format and evaluate three curriculum strategies: SCHEMA-GUIDED FIRST (real-world schema then fully synthetic), FULLY SYNTHETIC (diverse synthetic schemas throughout), and SCHEMA-GUIDED LAST (fully synthetic then real-world schema). Using only approximately 5,500 relational databases (approximately 33K tasks), roughly 55x fewer tasks than the original protocol, and no single-table warm-up, our best curriculum (SCHEMA-GUIDED FIRST) achieves 0.6346 average ROC-AUC across 19 real benchmark tasks at 1024-shot context, recovering 87.6% of the published RDB-PFN performance (0.7245). At 64-shot context, the gap narrows to 93.8% (0.6116 vs. 0.6517). Our results demonstrate that external synthetic generators can provide useful pretraining signals for RFMs when combined with appropriate curriculum design and that exposure to a real-world schema early in training is substantially more effective than late-stage schema adaptation.
- Abstract(参考訳): リレーショナル・ファンデーション・モデル(RFM)は、事前トレーニングのために大規模な合成リレーショナル・データベースを必要とするが、既存のアプローチでは、モデルトレーニング・パイプラインとデータ生成を密に結合している。
汎用合成リレーショナルデータベース生成装置であるPluRelが,600K-task単一テーブルウォームアップと約1.8M-task適応ステージで事前訓練されたRDB-PFNの外部データソースとして機能するかどうかを検討した。
我々は、外部構築されたバイナリ予測タスクを含むPluRel生成データベースをRDB-PFNトレーニングフォーマットにマッピングし、3つのカリキュラム戦略を評価する変換パイプラインを構築した。
約5,500のリレーショナルデータベース(約33Kタスク)、元のプロトコルの約55倍のタスク、シングルテーブルウォームアップがないため、最高のカリキュラム(SCHEMA-GUIDED FIRST)は1024ショットのコンテキストで19の実際のベンチマークタスクに対して平均0.6346のROC-AUCを達成し、公表されたRDB-PFNパフォーマンス(0.7245)の87.6%を回復した。
64ショットの文脈では、ギャップは93.8%(0.6116対0.6517)に狭まる。
その結果, 外部合成発電機は, 適切なカリキュラム設計と組み合わせることで, RFMに対して有用な事前学習信号を提供できること, 訓練の初期段階における実世界のスキーマへの露出は, 後期のスキーマ適応よりもかなり効果的であることを実証した。
関連論文リスト
- Advancing Open and Reproducible Relational Learning: RelArena-$α$, TabPFN-Rel and RPI [93.1293239420285]
私たちは3つのソフトウェアをオープンソースとして公開しています。
RelArena-$は、RelBench v1のベースラインを実行および比較するための統一されたフレームワークを提供する。
我々はTabPFN-3用のリレーショナルハーネスであるTabPFN-Relの初期バージョンをリリースする。
論文 参考訳(メタデータ) (2026-08-17T09:25:05Z) - Curriculum Matters: Data-Efficient Relational PFN Pretraining with Synthetic Data [0.7211865874649033]
我々は、RDB-PFNに代えて、構造的に異なる合成発電機Pluelを代替するかどうか検討する。
カリキュラム設計と合成の多様性は, 特定の関係生成器や生合成スケールのみよりも, 関係PFNの事前学習に重要である可能性が示唆された。
論文 参考訳(メタデータ) (2026-07-31T07:50:00Z) - RelPrism: A Multi-Faceted Pre-training Framework with Self-Generated Tasks for Relational Databases [49.47033473074821]
RDBのための多面的自己教師型学習フレームワークであるRelPrismを提案する。
RDBタスクは、しばしば異なる視点と粒度の多面的な情報を必要とする。
以上の結果から,RelPrismはROC-AUCを4.15%改善し,MAEを10.75%削減した。
論文 参考訳(メタデータ) (2026-05-22T05:19:58Z) - Towards Foundation Models for Relational Databases with Language Models and Graph Neural Networks [14.51793414693779]
本稿では,リレーショナルREG上でのBARTアーキテクチャとGraphSベースのGNNを組み合わせたハイブリッドアーキテクチャを提案する。
実験の結果、GNNはBARTの行注入コンテキストを大幅に強化し、rel-f1データセットからドライバdnfタスクにROC-埋め込み67.40を達成している。
これらの結果は、軽量なハイブリッドLM-GNNアーキテクチャが、リレーショナルデータベースの基礎モデルへの有望かつ資源効率のよい経路を提供することを示唆している。
論文 参考訳(メタデータ) (2026-05-15T15:46:38Z) - Concordia: Self-Improving Synthetic Tables for Federated LLMs [80.03837595689608]
フェデレートラーニングは、生データを共有することなく、大きな言語モデル(LLM)をトレーニングすることを可能にする。
合成データ生成とフェデレートされた検証ユーティリティを連携させるフレームワークであるConcordiaを提案する。
論文 参考訳(メタデータ) (2026-05-11T01:17:58Z) - Relational In-Context Learning via Synthetic Pre-training with Structural Prior [60.404256960057545]
RDB-PFNは、$textbfsynthetic$で純粋にトレーニングされた最初のリレーショナルファンデーションモデルである。
構造因果モデル(Structure Causal Models, SCM)から生成された合成データが単一のテーブル上の推論を可能にするPFN(Presideed-Data Fitted Networks)にインスパイアされた。
RDB-PFNは、19の現実世界の予測タスクにおいて、強い数ショットのパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-04T07:30:54Z) - PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models [51.42043158297229]
マルチタブラルリレーショナルデータベースをスクラッチから合成するフレームワークであるPluelを紹介する。
ステップバイステップの方法では,(1)有向グラフのスキーマ,(2)二部グラフのテーブル間一次外部キー接続,(3)条件因果機構によるテーブル内の特徴分布をモデル化する。
論文 参考訳(メタデータ) (2026-02-03T21:35:18Z) - Relational Transformer: Toward Zero-Shot Foundation Models for Relational Data [38.656987194921854]
Transformer (RT) アーキテクチャは、様々なリレーショナルデータベース上で事前トレーニングすることができる。
RTは強いゼロショットを破り、バイナリ分類タスクにおいて、完全に教師されたAUROCの93%を平均化する。
論文 参考訳(メタデータ) (2025-10-07T18:51:51Z) - Think Inside the JSON: Reinforcement Strategy for Strict LLM Schema Adherence [0.0]
本稿では,大規模言語モデル(LLM)生成における厳密なスキーマ順守を推論能力を活用することによる課題に対処する。
我々のアプローチは、新しいパイプラインを通して1.5Bパラメータモデルの構造的推論スキルを訓練する。
我々はThinkJSONのアプローチを、オリジナルのDeepSeek R1 (671B)、DeepSeek R1 (Qwen-1.5BとQwen-7B)、Gemini 2.0 Flash (70B)の蒸留版と比較する。
論文 参考訳(メタデータ) (2025-02-18T16:44:55Z) - RelBench: A Benchmark for Deep Learning on Relational Databases [78.52438155603781]
本稿では,グラフニューラルネットワークを用いたデータベース上でタスクを解くための公開ベンチマークであるRelBenchを紹介する。
私たちはRelBenchを使って、ディープラーニングインフラストラクチャに関する初の総合的な研究を行っています。
RDLは、人間の作業量を1桁以上削減しながら、より良く学習する。
論文 参考訳(メタデータ) (2024-07-29T14:46:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。