論文の概要: FALCON: A Model and Dataset Agnostic Framework for Synthetic Data Generation for NL2SQL Pairs
- arxiv url: http://arxiv.org/abs/2610.03625v1
- Date: Fri, 02 Oct 2026 17:19:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.512771
- Title: FALCON: A Model and Dataset Agnostic Framework for Synthetic Data Generation for NL2SQL Pairs
- Title(参考訳): FALCON:NL2SQLペアのための合成データ生成のためのモデルとデータセットに依存しないフレームワーク
- Abstract要約: 既存の合成NL-to-スキーマは、実世界の構造化知識アクセスの複雑さのモデルを作成することができない。
FCONALは、現実のベンチマークの複雑さにマッチした、現実的なあいまいさを意識したデータを生成するフレームワークである。
- 参考スコア(独自算出の注目度): 23.381635030521892
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Relational databases are among the most widely deployed forms of structured knowledge, and natural language access to them requires grounding language onto schema entities and relations while handling the ambiguity inherent in how people phrase requests. Existing synthetic NL-to-SQL data generation methods largely ignore this ambiguity and produce oversimplified queries that fail to prepare models for the complexity of real-world structured knowledge access. We present FALCON, a framework that generates realistic, ambiguity-aware NL-to-SQL data matching the complexity of challenging real-world benchmarks, at low cost using compact open models. Our approach combines reserved-word SQL seeding and persona-based prompting to generate structurally complex queries, while alignment-based filtering preserves difficulty by distinguishing genuinely incorrect examples from complex but valid queries. Human evaluation confirms consistent high quality across model sizes, and our generated data exceeds existing benchmarks in both SQL complexity and natural language richness. Difficulty-stratified analysis shows models trained on FALCON data increasingly outperform baseline-trained models as query complexity increases, validating our pipeline's success in generating challenging training data. When combined with a small proportion of existing benchmark data, mixed training recovers performance on simpler queries while preserving these advantages on complex ones. The model- and database-agnostic design enables organizations to generate high-complexity NL-to-SQL training data locally without external APIs.
- Abstract(参考訳): リレーショナルデータベースは、最も広くデプロイされた構造化された知識のひとつであり、自然言語アクセスには、人々が要求を言い換える方法に固有の曖昧さを扱いながら、スキーマエンティティとリレーショナルに言語を基盤付ける必要がある。
既存の合成NL-to-SQLデータ生成手法はこの曖昧さをほとんど無視し、現実の構造化知識アクセスの複雑さのモデルを作成するのに失敗する単純化されたクエリを生成する。
提案するFALCONは,現実的であいまいなNL-to-SQLデータを生成するフレームワークである。
提案手法では,リザーブドワードSQLのシードとペルソナベースのプロンプトを組み合わせて構造的に複雑なクエリを生成する。
人間の評価は、モデルサイズ間で一貫した高品質を確認でき、生成したデータは、SQLの複雑さと自然言語の豊かさの両面で、既存のベンチマークを上回っます。
FALCONデータに基づいてトレーニングされたモデルは、クエリの複雑さが増大するにつれて、ベースライントレーニングされたモデルよりもパフォーマンスが向上し、難しいトレーニングデータを生成するパイプラインの成功を検証する。
既存のベンチマークデータのごく一部と組み合わせることで、複雑なクエリでこれらの利点を保ちながら、より単純なクエリのパフォーマンスを回復する。
モデルおよびデータベースに依存しない設計により、組織は外部APIなしで、ローカルで高精度なNL-SQLトレーニングデータを生成することができる。
関連論文リスト
- PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models [51.42043158297229]
マルチタブラルリレーショナルデータベースをスクラッチから合成するフレームワークであるPluelを紹介する。
ステップバイステップの方法では,(1)有向グラフのスキーマ,(2)二部グラフのテーブル間一次外部キー接続,(3)条件因果機構によるテーブル内の特徴分布をモデル化する。
論文 参考訳(メタデータ) (2026-02-03T21:35:18Z) - Text-to-SQL as Dual-State Reasoning: Integrating Adaptive Context and Progressive Generation [54.53145282349042]
DSR-sourced, textbfDual-textbfS textbfReasoning frameworkを導入する。
ポストトレーニングやインコンテキストの例がなければ、DSR-sourcedは競合性能を達成し、スパイダー2.0-Snowで35.28%、BIRD開発で68.32%に達する。
論文 参考訳(メタデータ) (2025-11-26T13:52:50Z) - Large Language Models are Good Relational Learners [55.40941576497973]
本稿では,グラフニューラルネットワーク(GNN)に基づくエンコーダを用いて,大規模言語モデル(LLM)のための構造化リレーショナルプロンプトを生成する新しいアーキテクチャであるRel-LLMを紹介する。
従来のテキストベースのシリアライズ手法とは異なり,本手法はデータベース固有の関係構造を保ちながら,LLMが複雑なエンティティ関係を処理・推論することを可能にする。
論文 参考訳(メタデータ) (2025-06-06T04:07:55Z) - RelDiff: Relational Data Generative Modeling with Graph-Based Diffusion Models [83.6013616017646]
RelDiffは、外部キーグラフ構造を明示的にモデル化することによって完全な関係データベースを合成する新しい拡散生成モデルである。
RelDiffは、現実的で一貫性のある合成リレーショナルデータベースの作成において、従来手法よりも一貫して優れている。
論文 参考訳(メタデータ) (2025-05-31T21:01:02Z) - High-Fidelity And Complex Test Data Generation For Google SQL Code Generation Services [0.8177323519057186]
高忠実度テストデータの需要は、生産データへのアクセスがほとんど制限されている産業環境で最重要である。
従来のデータ生成手法は、しばしば不足し、低忠実さと複雑なデータ構造とセマンティックな関係をモデル化する能力に悩まされる。
我々は,Large Language Models(LLM)を活用して,戦略的前処理と後処理のステップを取り入れることで,構文的に正確で意味的に関連する高忠実性テストデータを生成することを実証した。
論文 参考訳(メタデータ) (2025-04-24T02:27:17Z) - EpiCoder: Encompassing Diversity and Complexity in Code Generation [66.43738008739555]
既存のコード生成方法はシードデータとしてコードスニペットを使用する。
階層的なコード機能を中心に展開する,新しい機能ツリーベースの合成フレームワークを提案する。
我々のフレームワークは、生成されたコードの複雑さを正確に制御し、関数レベルの操作からマルチファイルのシナリオまで幅広い機能を実現する。
論文 参考訳(メタデータ) (2025-01-08T18:58:15Z) - Synthesizing Text-to-SQL Data from Weak and Strong LLMs [68.69270834311259]
オープンソースとクローズドソースの大規模言語モデル(LLM)の能力ギャップは、テキスト・トゥ・タスクにおいて依然として課題である。
より大規模で強力なモデルによって生成されたデータと、より小さく、不整合なモデルによって生成されたエラー情報データを組み合わせた合成データアプローチを導入する。
論文 参考訳(メタデータ) (2024-08-06T15:40:32Z) - CHESS: Contextual Harnessing for Efficient SQL Synthesis [1.9506402593665235]
効率的でスケーラブルなテキスト・ツー・クエリのためのフレームワークであるCHESSを紹介します。
特殊エージェントは4つあり、それぞれが上記の課題の1つをターゲットにしている。
私たちのフレームワークは、さまざまなデプロイメント制約に適応する機能を提供する。
論文 参考訳(メタデータ) (2024-05-27T01:54:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。