論文の概要: TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification
- arxiv url: http://arxiv.org/abs/2608.17795v2
- Date: Mon, 24 Aug 2026 06:50:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.89057
- Title: TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification
- Title(参考訳): TraceSQL: 参照なしのテキスト間検証のためのトレーサビリティ推定
- Abstract要約: ユーザ質問、データベースコンテキスト、および生成sqlだけを考えると、システムが生成したクエリが問題に正しく答えるかどうかを見積もることができるだろうか?
近年のアプローチでは、ジェネレーションsqlを検査するためにLLMを判断または特殊エージェントとして用いているが、その決定は追跡が困難である。
明示的な診断機能に基づく軽量かつトレーサブルな検証モデルであるTraceを提案する。
Traceは66.47% F1と64.48% ROC-AUCを61.87% F1と5826% ROC-AUCで達成している。
- 参考スコア(独自算出の注目度): 0.14658400971135652
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-SQL systems are commonly evaluated using ground-truth SQL queries or reference execution results, but such supervision is unavailable at inference time in real-world deployments. This creates a critical verification problem: given only a user question, database context, and generated SQL, can a system estimate whether the generated query is likely to correctly answer the question? Recent approaches use LLMs as judge or specialized agents to inspect generated SQL, but their decisions can be difficult to trace. Outcome Reward Models (ORMs) address this by learning from execution-labeled candidate SQLs and assigning correctness scores to unseen queries, yet they still provide limited visibility into the signals behind each verification. To address this limitation, we propose TraceSQL, a lightweight and traceable verification model built on explicit diagnostic features. TraceSQL combines 67 features capturing question ambiguity, question requirements, question-schema-SQL consistency, SQL structure, and intent alignment. These signals remain available for examining which factors influence each prediction and for tracing decisions back to diagnostic evidence. On BIRD development databases, TraceSQL achieves 66.47% F1 and 64.48% ROC-AUC, compared with 61.87% F1 and 58.26% ROC-AUC for the GradeSQL-7B ORM baseline on the same generated-SQL evaluation. Feature attribution further shows that the model relies on both semantic grounding and deterministic SQL-structure signals. These results show that SQL verification can be performed with a lightweight learned model while retaining feature-level evidence for inspecting and diagnosing its predictions.
- Abstract(参考訳): Text-to-SQLシステムは、地上のSQLクエリやリファレンス実行結果を使って一般的に評価されるが、実際のデプロイメントでは推論時にそのような監視は利用できない。
ユーザ質問、データベースコンテキスト、および生成されたSQLのみを考慮すれば、システムは、生成されたクエリがその質問に正しく答えるかどうかを見積もることができるだろうか?
近年のアプローチでは、LLMを判断または特殊なエージェントとして、生成されたSQLを検査するが、その決定は追跡するのが困難である。
Outcome Reward Models(ORM)は、実行ラベル付き候補SQLから学び、未確認クエリに正確性スコアを割り当てることによって、この問題に対処する。
この制限に対処するために、明示的な診断機能に基づいて構築された軽量でトレース可能な検証モデルであるTraceSQLを提案する。
TraceSQLは67の機能を組み合わせて、質問のあいまいさ、質問要件、質問スキーマ-SQL一貫性、SQL構造、インテントアライメントをキャプチャする。
これらの信号は、どの因子がそれぞれの予測に影響を与えるかを調べ、診断証拠に遡る決定をトレースするために引き続き利用可能である。
BIRD 開発データベースでは、TraceSQL は 61.87% F1 と 58.26% ROC-AUC に対して 66.47% F1 と 64.48% ROC-AUC を達成している。
特徴の帰結は、モデルがセマンティックグラウンドと決定論的SQL構造信号の両方に依存していることを示している。
これらの結果は,SQLの検証を軽量な学習モデルで行うことができ,その予測を検査・診断するための特徴レベルの証拠を保持できることを示している。
関連論文リスト
- Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows [54.49251107006261]
我々はSpider 2.0-AIFuncを紹介した。これは、Snowflakeプラットフォーム上の6種類のAI機能をカバーする125の現実世界データベースにわたる465の検証済みインスタンスのベンチマークである。
最強のプロプライエタリモデルは67-70%の精度で実行でき、最高のオープンソースモデルは58.1%に達する。
論文 参考訳(メタデータ) (2026-07-07T12:54:08Z) - ProSPy: A Profiling-Driven SQL-Python Agentic Framework for Enterprise Text-to-SQL [51.98164069124653]
ProSPyは、エンタープライズスケールのテキスト-非依存分析のためのプロファイリング駆動フレームワークである。
ProSPyは推論プロセスを4段階に構成する。
まず、自動プロファイリングにより、きめ細かいデータ証拠を抽出する。
大規模なスキーマをタスク関連コンテキストに抽出する。
論文 参考訳(メタデータ) (2026-06-04T08:13:05Z) - CAPER: Clause-Aligned Process Supervision for Text-to-SQL [11.286563956844946]
本稿では,SQL 抽象構文木への反実的介入を通じて,自動的に節レベルの監視を導出する CAPER を提案する。
得られたデータは、ポリシー最適化と候補検証のための軽量なクロース境界フィードバックであるCAPER-9Bのトレーニングに使用される。
BIRDとスパイダーの実験では、節順の監督は実行精度を向上するだけでなく、GPT-5.4よりも15.3%の改善を達成し、障害局所化能力を強化し、84.53%の精度と90.60%のMRRを達成した。
論文 参考訳(メタデータ) (2026-06-02T08:35:40Z) - ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement [57.98138819417949]
テキスト・ツー・クエリを明示的にモデル化するフレームワークであるErrorLLMを提案する。
ErrorLLMは、バックボーンの初期生成よりも大幅に改善されていることを示す。
ErrorLLMは、精錬効率を維持しつつ、高い検出F1スコアで両面に対処する。
論文 参考訳(メタデータ) (2026-03-04T05:27:20Z) - Query Carefully: Detecting the Unanswerables in Text-to-SQL Tasks [1.7781743265224403]
テキスト・ツー・システムでは、専門家以外の者が自然言語を使ってデータベースと対話できる。
あいまいな、スコープ外、あるいは解決不可能なクエリに対して実行可能なsqlを生成する傾向は、出力が正しいと誤解される可能性があるため、隠れたリスクをもたらす。
クエリは、sql生成を明示的なあいまいさと不可解な入力の処理と統合するパイプラインである。
論文 参考訳(メタデータ) (2025-12-19T12:22:27Z) - STaR-SQL: Self-Taught Reasoner for Text-to-SQL [20.719165038519744]
チェーンオブ思考」の理論的根拠は、複雑な推論タスクにおける大規模言語モデルの性能向上に有効であることが証明されている。
テキスト駆動のような構造化されたタスクにそのようなテクニックを適用することは、ほとんど探索されていない。
本稿では、クエリ生成を推論プロセスとして再編成する新しいアプローチである、テキスト駆動型セルフトレーサ(STaR-)を提案する。
挑戦的なスパイダーベンチマークの実験結果によると、STaR-はテキストからパフォーマンスを大幅に改善し、86.6%の精度を実現している。
これらの知見は、推論強化トレーニングの可能性を強調している。
論文 参考訳(メタデータ) (2025-02-19T08:58:44Z) - Can the Rookies Cut the Tough Cookie? Exploring the Use of LLMs for SQL Equivalence Checking [15.42143912008553]
クエリ等価性チェックのためのSQLEquiQuestという,新しい,現実的で,十分に複雑なベンチマークを導入する。
我々は,様々なプロンプト戦略とテキスト内学習例を用いて,最先端のLLMを評価した。
解析の結果,LLMは等価性予測に強いバイアスを示し,非等価性対に対する性能は一貫して劣っていることがわかった。
論文 参考訳(メタデータ) (2024-12-07T06:50:12Z) - RSL-SQL: Robust Schema Linking in Text-to-SQL Generation [51.00761167842468]
本稿では、双方向スキーマリンク、コンテキスト情報拡張、バイナリ選択戦略、マルチターン自己補正を組み合わせたRSLと呼ばれる新しいフレームワークを提案する。
ベンチマークの結果,オープンソースのソリューション間でのSOTA実行精度は67.2%,BIRDは87.9%,GPT-4オクルージョンは87.9%であった。
提案手法は,DeepSeekを同一のプロンプトで適用した場合,GPT-4ベースのテキスト・ツー・シークシステムよりも優れている。
論文 参考訳(メタデータ) (2024-10-31T16:22:26Z) - E-SQL: Direct Schema Linking via Question Enrichment in Text-to-SQL [1.187832944550453]
E-Seekは、直接スキーマリンクと候補述語拡張を通じてこれらの課題に対処するように設計された、新しいパイプラインである。
E-Seekは、関連するデータベース項目(テーブル、列、値)と条件を直接質問とsql構築計画に組み込むことで、自然言語クエリを強化し、クエリとデータベース構造の間のギャップを埋める。
総合的な評価は、E-Seekが競争性能、特に66.29%の実行精度で複雑なクエリに優れていることを示している。
論文 参考訳(メタデータ) (2024-09-25T09:02:48Z) - DAC: Decomposed Automation Correction for Text-to-SQL [51.48239006107272]
De Automation Correction (DAC)を導入し、エンティティリンクとスケルトン解析を分解することでテキストから合成を補正する。
また,本手法では,ベースライン法と比較して,スパイダー,バード,カグルDBQAの平均値が平均3.7%向上することを示した。
論文 参考訳(メタデータ) (2024-08-16T14:43:15Z) - Weakly Supervised Text-to-SQL Parsing through Question Decomposition [53.22128541030441]
我々は最近提案されたQDMR(QDMR)という意味表現を活用している。
質問やQDMR構造(非専門家によって注釈付けされたり、自動予測されたりする)、回答が与えられたら、我々は自動的にsqlクエリを合成できる。
本結果は,NL-ベンチマークデータを用いて訓練したモデルと,弱い教師付きモデルが競合することを示す。
論文 参考訳(メタデータ) (2021-12-12T20:02:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。