論文の概要: A Semantic-Layer-Mediated Agent for Natural Language to SQL over Heterogeneous Enterprise Databases
- arxiv url: http://arxiv.org/abs/2606.31041v1
- Date: Tue, 30 Jun 2026 02:22:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.042533
- Title: A Semantic-Layer-Mediated Agent for Natural Language to SQL over Heterogeneous Enterprise Databases
- Title(参考訳): 異種エンタープライズデータベース上での自然言語からSQLへのセマンティック層媒介エージェント
- Abstract要約: そこで本研究では,意味的意図を物理スコール実行から切り離す意味的層を介するNL2エージェントを提案する。
このシステムは制約付きシンクアクトループを採用し、BigQueryとSnowflakeバックエンドをサポートし、エンドツーエンド評価フレームワークに統合されている。
Gemini 3 Pro は 547-task Spider2-snow ベンチマークで94.15% の精度で実行され、公式のリーダーボードで3位にランクインし、スキーマのみのアプローチを大幅に上回った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Natural language-to-SQL (NL2SQL) over real-world enterprise databases remains significantly more challenging than on academic benchmarks. Enterprise schemas often contain hundreds of physical tables with cryptic column names, heterogeneous SQL dialects, and complex analytical workloads requiring nested aggregations, temporal reasoning, and multi-table joins. We present a semantic-layer-mediated NL2SQL agent that decouples semantic intent from physical SQL execution. Rather than generating SQL directly over raw schemas, the agent reasons over a curated semantic layer through a compact intermediate representation called the Semantic Model Query (SMQ). A deterministic compiler translates each SMQ into dialect-specific SQL, providing verified building blocks that the agent composes into the final query. The system employs a constrained think-act loop, supports SQLite, BigQuery, and Snowflake backends, and is integrated into an end-to-end evaluation framework. Using Gemini 3 Pro, the system achieves 94.15% execution accuracy on the 547-task Spider2-snow benchmark, ranking third on the official leaderboard and substantially outperforming schema-only approaches. We describe the system architecture, SMQ representation, agent workflow, evaluation results, and discuss semantic-layer quality and the trade-off between improved grounding and overfitting.
- Abstract(参考訳): 実世界のエンタープライズデータベース上の自然言語からSQL(NL2SQL)は、学術ベンチマークよりもはるかに難しい。
エンタープライズスキーマは、秘密の列名、異種SQL方言、ネスト集約、時間的推論、マルチテーブル結合を必要とする複雑な分析ワークロードを備えた数百の物理テーブルを含むことが多い。
我々は,意味的意図を物理的SQL実行から切り離す意味的層を介するNL2SQLエージェントを提案する。
生のスキーマ上でSQLを直接生成するのではなく、エージェントは、Semantic Model Query (SMQ)と呼ばれるコンパクトな中間表現を通じて、キュレートされたセマンティックレイヤ上でSQLを生成する。
決定論的コンパイラは、各SMQを方言固有のSQLに変換し、エージェントが最終クエリに構成する検証されたビルディングブロックを提供する。
システムは制約付きシンクアクトループを採用し、SQLite、BigQuery、Snowflakeバックエンドをサポートし、エンドツーエンド評価フレームワークに統合されている。
Gemini 3 Proを使用すると、547タスクのSpider2-snowベンチマークで94.15%の実行精度が達成され、公式のリーダーボードで3位にランクインし、スキーマのみのアプローチを大幅に上回っている。
本稿では,システムアーキテクチャ,SMQ表現,エージェントワークフロー,評価結果について述べる。
関連論文リスト
- Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows [54.49251107006261]
我々はSpider 2.0-AIFuncを紹介した。これは、Snowflakeプラットフォーム上の6種類のAI機能をカバーする125の現実世界データベースにわたる465の検証済みインスタンスのベンチマークである。
最強のプロプライエタリモデルは67-70%の精度で実行でき、最高のオープンソースモデルは58.1%に達する。
論文 参考訳(メタデータ) (2026-07-07T12:54:08Z) - ProSPy: A Profiling-Driven SQL-Python Agentic Framework for Enterprise Text-to-SQL [51.98164069124653]
ProSPyは、エンタープライズスケールのテキスト-非依存分析のためのプロファイリング駆動フレームワークである。
ProSPyは推論プロセスを4段階に構成する。
まず、自動プロファイリングにより、きめ細かいデータ証拠を抽出する。
大規模なスキーマをタスク関連コンテキストに抽出する。
論文 参考訳(メタデータ) (2026-06-04T08:13:05Z) - AV-SQL: Decomposing Complex Text-to-SQL Queries with Agentic Views [40.813123705793764]
AV-は複雑なテキストからLLMを特殊エージェントに分解するフレームワークである。
AV-は、(1)リライターエージェントが入力クエリを圧縮して明確化し、(2)ビューエージェントがチャンクを処理してエージェントビューを生成し、(3)プランナー、ジェネレータ、およびリバイザエージェントが最終クエリへのビューを協調的に生成する。
論文 参考訳(メタデータ) (2026-04-08T12:56:13Z) - Bridging Global Intent with Local Details: A Hierarchical Representation Approach for Semantic Validation in Text-to-SQL [30.78817492504152]
HEROは、グローバルな意図と局所的な詳細を統合する階層的な表現アプローチである。
我々はNested Message Passing Neural Network (NMPNN) を用いて、関係スキーマ誘導セマンティクスにおける固有情報をキャプチャする。
提案手法は既存の最先端手法よりも優れており,AUPRCの9.40%,AUROCの12.35%が意味的不整合を識別している。
きめ細かいセマンティックエラーを検出し、よりきめ細かいフィードバックで大きな言語モデルを提供し、最終的にはデータクエリプラットフォームの信頼性と解釈性を高めます。
論文 参考訳(メタデータ) (2025-12-28T02:25:33Z) - Text-to-SQL as Dual-State Reasoning: Integrating Adaptive Context and Progressive Generation [54.53145282349042]
DSR-sourced, textbfDual-textbfS textbfReasoning frameworkを導入する。
ポストトレーニングやインコンテキストの例がなければ、DSR-sourcedは競合性能を達成し、スパイダー2.0-Snowで35.28%、BIRD開発で68.32%に達する。
論文 参考訳(メタデータ) (2025-11-26T13:52:50Z) - From Queries to Insights: Agentic LLM Pipelines for Spatio-Temporal Text-to-SQL [8.496933324334167]
本研究では,MistralをベースとしたRellama-sqlcoder-8bによるオーケストレーションにより,簡単なテキストからActまでのベースライン(Rellama-sqlcoder-8b)を提案する。
ニューヨークと東京のチェックインで35の自然言語クエリを評価し,空間的・時間的マルチデータセット推論について検討した。
このエージェントは、データセット 91.4% 対 28.6% よりもかなり精度が高く、地図によるユーザビリティを高め、自然言語の要約を構造化する。
論文 参考訳(メタデータ) (2025-10-29T22:18:57Z) - Falcon: A Comprehensive Chinese Text-to-SQL Benchmark for Enterprise-Grade Evaluation [14.191844670418568]
Falconは、企業互換の方言(Max/Hive)をベースとした、中国のクロスドメインテキスト・コンパレータベンチマークである。
28のデータベースに600の中国の質問が含まれており、77%はマルチテーブルの推論と4つのテーブルの半分以上のタッチを必要としている。
評価のために、ロバストな実行コンパレータと自動評価パイプラインをリリースする。
論文 参考訳(メタデータ) (2025-10-23T03:35:00Z) - UNJOIN: Enhancing Multi-Table Text-to-SQL Generation via Schema Simplification [50.59009084277447]
論理生成からスキーマ要素の検索を分離するフレームワークUNJOINを紹介する。
最初の段階では、各列をテーブル名でプレフィックスすることで、データベース内のすべてのテーブルの列名を単一のテーブル表現にマージします。
第2段階では、クエリは、この単純化されたスキーマに基づいて生成され、JOIN、UNION、リレーショナルロジックを再構築することで、元のスキーマにマップされる。
論文 参考訳(メタデータ) (2025-05-23T17:28:43Z) - ReFoRCE: A Text-to-SQL Agent with Self-Refinement, Consensus Enforcement, and Column Exploration [32.83579488224367]
ReFoRCEは、スパイダー2.0のリーダーボードのトップのテキスト・トゥ・信頼のエージェントです。
ReFoRCEは35.83のスパイダー2.0-Snowと36.56のスコアで最先端の結果を得た。
論文 参考訳(メタデータ) (2025-02-02T05:25:03Z) - Cooperative SQL Generation for Segmented Databases By Using Multi-functional LLM Agents [48.25853644159186]
多機能エージェント(CSMA)に基づく協調sql生成フレームワークを提案する。
人間のチームワークにおけるコラボレーションに触発されて、CSMAは3つのステージから構成される。
スパイダーとバードのベックマークの実験では、CSMAは最先端技術に匹敵する高いパフォーマンスを達成している。
論文 参考訳(メタデータ) (2024-12-08T08:16:19Z) - Improving Text-to-SQL Semantic Parsing with Fine-grained Query
Understanding [84.04706075621013]
トークンレベルのきめ細かいクエリ理解に基づく汎用的モジュール型ニューラルネットワーク解析フレームワークを提案する。
我々のフレームワークは、名前付きエンティティ認識(NER)、ニューラルエンティティリンカ(NEL)、ニューラルエンティティリンカ(NSP)の3つのモジュールから構成されている。
論文 参考訳(メタデータ) (2022-09-28T21:00:30Z) - Bridging Textual and Tabular Data for Cross-Domain Text-to-SQL Semantic
Parsing [110.97778888305506]
BRIDGEは、フィールドのサブセットが質問に言及されたセル値で拡張されるタグ付きシーケンスの質問とDBスキーマを表します。
BRIDGEは、人気のクロスDBテキスト-リレーショナルベンチマークで最先端のパフォーマンスを達成しました。
本分析は,BRIDGEが望まれる相互依存を効果的に捕捉し,さらにテキストDB関連タスクに一般化する可能性を示唆している。
論文 参考訳(メタデータ) (2020-12-23T12:33:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。