論文の概要: SQLMorph: Query Mutation and Fine-Grained Metrics for Text-to-SQL Evaluation
- arxiv url: http://arxiv.org/abs/2609.08950v1
- Date: Tue, 08 Sep 2026 16:08:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.691098
- Title: SQLMorph: Query Mutation and Fine-Grained Metrics for Text-to-SQL Evaluation
- Title(参考訳): SQLMorph:SQL-to-SQL評価のためのクエリ変異と細粒度メトリクス
- Abstract要約: 問合せ突然変異によるテキスト・ツー・アセスメントのためのフレームワークを提案する。
評価セットを自動生成・拡張する2つの手法を提案する。
また、現在のバイナリ尺度の制限に対処する実行レベルメトリクスのファミリも導入します。
- 参考スコア(独自算出の注目度): 2.7053998141316455
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-SQL systems translate natural language queries into executable SQL, democratizing access to structured data. Despite recent advances driven by large language models (LLMs), evaluation remains a major bottleneck: public benchmarks fail to capture the complexity of enterprise schema, while building private evaluation sets is costly and nondeterministic, making evaluation results difficult to reproduce. To address this issue, we present SQLMorph, a framework for Text-to-SQL evaluation via query mutation. SQLMorph introduces two techniques to automatically generate and expand evaluation sets: Join Query Expansion (JQE), which systematically increases structural complexity through valid join additions, and Textual Query Augmentation (TQA), which generates controlled natural language perturbations to assess robustness to linguistic variation. JQE and TQA create targeted choke points to challenge specific system components. When applied to state-of-the-art systems, JQE increases query coverage and reveals accuracy degradation as the number of joins grows. Meanwhile, TQA shows that linguistic brittleness induced by heavy abbreviation can reduce accuracy by up to 17%. Beyond evaluation sets, SQLMorph introduces a family of execution-level metrics that address the limitations of current binary measures, such as Execution Accuracy. We define Execution Precision (EXP) and Execution Recall (EXR) to quantify the fraction of correct and recovered results, respectively, and combine them via F1 for unified scoring. Our experiments show that these relaxed metrics enable fine-grained analysis of over- and under-prediction, revealing differences across systems that binary metrics obscure. Together, SQLMorph's query mutation and fine-grained metrics support debugging and better align Text-to-SQL evaluation practices with real-world deployments.
- Abstract(参考訳): テキストからSQLへのシステムは、自然言語クエリを実行可能なSQLに変換し、構造化データへのアクセスを民主化する。
公開ベンチマークはエンタープライズスキーマの複雑さを捉えるのに失敗する一方で、プライベート評価セットの構築はコストが高く非決定論的であり、評価結果の再現が困難である。
この問題に対処するために、クエリー突然変異によるテキストからSQLへの評価のためのフレームワークであるSQLMorphを提案する。
ジョインクエリ拡張(JQE)は、有効なジョイン追加によって構造的な複雑さを体系的に増加させ、テキストクエリ拡張(TQA)は、制御された自然言語摂動を生成し、言語的変動に対する堅牢性を評価する。
JQEとTQAは特定のシステムコンポーネントに挑戦するためにターゲットのチョークポイントを作成する。
最先端システムに適用すると、クエリカバレッジが増加し、ジョイン数が増加するにつれて精度が低下する。
一方、TQAは、重度の省略によって引き起こされる言語的脆度が最大17%の精度で低下することを示した。
評価セット以外にも、SQLMorphは実行レベルメトリクスのファミリを導入し、実行精度などの現在のバイナリ対策の制限に対処する。
実行精度 (EXP) と実行リコール (EXR) を定義し、それぞれ正しい結果と回復結果の比率を定量化し、それらを統一スコアリングのためにF1を介して組み合わせる。
実験により、これらの緩和されたメトリクスは、過剰な予測と過小評価のきめ細かい分析を可能にし、バイナリメトリクスが不明瞭なシステム間での差異を明らかにした。
SQLMorphのクエリ変異と詳細なメトリクスは、デバッグをサポートし、Text-to-SQL評価プラクティスを現実のデプロイメントと整合させる。
関連論文リスト
- Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems [2.051598597332424]
運用環境におけるテキストからネイティブ(T2native)評価は、既存のベンチマークが対処しない根本的な課題を生じさせる。
本稿では,自然言語入力のみで動作する生産評価システムSTEFを提案する。
STEFは、フィルタアライメント、セマンティック検証、評価器の信頼性を含む合成計量を用いて、解釈可能な0から100の精度スコアを生成する。
論文 参考訳(メタデータ) (2026-04-30T15:59:28Z) - Text-to-SQL as Dual-State Reasoning: Integrating Adaptive Context and Progressive Generation [54.53145282349042]
DSR-sourced, textbfDual-textbfS textbfReasoning frameworkを導入する。
ポストトレーニングやインコンテキストの例がなければ、DSR-sourcedは競合性能を達成し、スパイダー2.0-Snowで35.28%、BIRD開発で68.32%に達する。
論文 参考訳(メタデータ) (2025-11-26T13:52:50Z) - HES-SQL: Hybrid Reasoning for Efficient Text-to-SQL with Structural Skeleton Guidance [6.653834890554154]
HES-は、思考モード融合型教師あり微調整の統合により、テキストからレイテンシ生成を進化させる新しいハイブリッドトレーニングフレームワークである。
このフレームワークは、クエリの精度と実行効率を改善しながら、推論モードと非推論モードの切り替えを可能にする。
論文 参考訳(メタデータ) (2025-10-10T01:15:57Z) - RAISE: Reasoning Agent for Interactive SQL Exploration [47.77323087050061]
本稿では,スキーマリンク,クエリ生成,反復的改善を1つのエンドツーエンドコンポーネントに統一する新しいフレームワークを提案する。
本手法は、不慣れなデータベースを扱う際に、人間がどう答えるかをエミュレートする。
論文 参考訳(メタデータ) (2025-06-02T03:07:08Z) - E-SQL: Direct Schema Linking via Question Enrichment in Text-to-SQL [1.187832944550453]
E-Seekは、直接スキーマリンクと候補述語拡張を通じてこれらの課題に対処するように設計された、新しいパイプラインである。
E-Seekは、関連するデータベース項目(テーブル、列、値)と条件を直接質問とsql構築計画に組み込むことで、自然言語クエリを強化し、クエリとデータベース構造の間のギャップを埋める。
総合的な評価は、E-Seekが競争性能、特に66.29%の実行精度で複雑なクエリに優れていることを示している。
論文 参考訳(メタデータ) (2024-09-25T09:02:48Z) - DAC: Decomposed Automation Correction for Text-to-SQL [51.48239006107272]
De Automation Correction (DAC)を導入し、エンティティリンクとスケルトン解析を分解することでテキストから合成を補正する。
また,本手法では,ベースライン法と比較して,スパイダー,バード,カグルDBQAの平均値が平均3.7%向上することを示した。
論文 参考訳(メタデータ) (2024-08-16T14:43:15Z) - ETM: Modern Insights into Perspective on Text-to-SQL Evaluation in the Age of Large Language Models [8.618945530676614]
Execution Accuracy (EXE) と Exact Set Matching Accuracy (ESM) は、パフォーマンスを誤って表現できる固有の制限に悩まされている。
我々は,構文的要素と意味的要素の両方を用いてクエリを比較することで,これらの問題を緩和する新しい指標ETM(Enhanced Tree Matching)を導入する。
ETM と ESM は23.0% と 28.9% の偽陽性と負の比率を産出でき、EMM はそれぞれ 0.3% と 2.7% に減少する。
論文 参考訳(メタデータ) (2024-07-10T02:20:19Z) - SQL-PaLM: Improved Large Language Model Adaptation for Text-to-SQL (extended) [53.95151604061761]
本稿では,大規模言語モデル(LLM)を用いたテキスト・ツー・フィルタリングのフレームワークを提案する。
数発のプロンプトで、実行ベースのエラー解析による一貫性復号化の有効性について検討する。
命令の微調整により、チューニングされたLLMの性能に影響を及ぼす重要なパラダイムの理解を深める。
論文 参考訳(メタデータ) (2023-05-26T21:39:05Z) - UNITE: A Unified Benchmark for Text-to-SQL Evaluation [72.72040379293718]
テキスト・ツー・ドメイン・システムのためのUNIfiedベンチマークを導入する。
公開されているテキストからドメインへのデータセットと29Kデータベースで構成されている。
広く使われているSpiderベンチマークと比較すると、SQLパターンの3倍の増加が紹介されている。
論文 参考訳(メタデータ) (2023-05-25T17:19:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。