論文の概要: The Stochastic Shift: A New Evaluation Paradigm for Text-to-SQL with AI Operators
- arxiv url: http://arxiv.org/abs/2609.21133v1
- Date: Thu, 17 Sep 2026 22:37:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.791299
- Title: The Stochastic Shift: A New Evaluation Paradigm for Text-to-SQL with AI Operators
- Title(参考訳): 確率的シフト:AIオペレータによるテキストからSQLへの新たな評価パラダイム
- Abstract要約: 正確なクエリ結果と決定論的実行に依存する現在のメトリクスは、AIオペレータの柔軟な非決定論的出力に対して体系的に失敗する。
我々は、決定論的データベースロジックを柔軟なAIセマンティクスから分離する多層評価フレームワークを導入する。
我々のフレームワークは、両方のプラットフォーム(最大97.2%)にわたる最先端の全体的な精度を実現する。
- 参考スコア(独自算出の注目度): 1.7649403688732195
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: SQL has been augmented with AI operators, enabling modern data analytics platforms to derive insights from both structured and unstructured data. We observe that while current Text-to-SQL systems can successfully generate these AI-augmented queries, reliably evaluating their correctness remains a critical open challenge. Current metrics, which rely on exact query results and deterministic execution, systematically fail against the flexible, non-deterministic outputs of AI operators. In this paper, we formalize these unique evaluation failure modes and introduce a Multilayered Evaluation Framework that decouples deterministic database logic from flexible AI semantics. We test our approach across both industry (BigQuery) and academic (ThalamusDB) systems. We demonstrate that traditional Execution Accuracy severely penalizes valid queries, achieving as low as a 25% detection rate for correct translations. Furthermore, even a state-of-the-art LLM-based autorater falsely rejects 32% of accurate queries due to the complexity of judging both relational and AI components simultaneously. By validating the standard relational logic and the AI operations separately, our framework achieves state-of-the-art overall accuracy across both platforms (up to 97.2%), proposing a reliable standard for benchmarking AI-powered SQL generators.
- Abstract(参考訳): SQLはAIオペレータで拡張されており、モダンなデータ分析プラットフォームが構造化データと非構造化データの両方から洞察を引き出すことができる。
現在のText-to-SQLシステムは、これらのAI拡張クエリをうまく生成できるが、それらの正確性を確実に評価することは、依然として重要な課題である。
正確なクエリ結果と決定論的実行に依存する現在のメトリクスは、AIオペレータの柔軟な非決定論的出力に対して体系的に失敗する。
本稿では、これらのユニークな評価失敗モードを形式化し、決定論的データベース論理をフレキシブルAIセマンティクスから分離する多層評価フレームワークを導入する。
私たちは、業界(BigQuery)と学術(ThalamusDB)システムの両方でアプローチをテストしています。
従来の実行精度は、有効なクエリを極端に罰し、正しい翻訳に対する25%の検出率で達成できることを実証する。
さらに、最先端のLDMベースのオートラッターでさえ、リレーショナルコンポーネントとAIコンポーネントの両方を同時に判断する複雑さのため、正確なクエリの32%を誤って拒否する。
標準リレーショナルロジックとAI操作を別々に検証することにより、私たちのフレームワークは、両方のプラットフォーム(最大97.2%)にわたる最先端の全体的な精度を実現し、AI駆動のSQLジェネレータをベンチマークするための信頼性の高い標準を提案します。
関連論文リスト
- Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows [54.49251107006261]
我々はSpider 2.0-AIFuncを紹介した。これは、Snowflakeプラットフォーム上の6種類のAI機能をカバーする125の現実世界データベースにわたる465の検証済みインスタンスのベンチマークである。
最強のプロプライエタリモデルは67-70%の精度で実行でき、最高のオープンソースモデルは58.1%に達する。
論文 参考訳(メタデータ) (2026-07-07T12:54:08Z) - APEX-SQL: Talking to the data via Agentic Exploration for Text-to-SQL [39.76924093980244]
APEX-動詞化は、パラダイムを受動的翻訳からエージェント探索に移行するフレームワークである。
提案フレームワークでは,実データにおける基底モデル推論に仮説検証ループを用いる。
論文 参考訳(メタデータ) (2026-02-11T07:50:47Z) - OrLog: Resolving Complex Queries with LLMs and Probabilistic Reasoning [51.58235452818926]
そこで我々は,論理的推論から述語レベルの妥当性推定を分離するニューロシンボリック検索フレームワークOrLogを紹介する。
大規模言語モデル (LLM) は1つの復号のない前方通過において原子述語に対する可視性スコアを提供し、確率論的推論エンジンはクエリ満足度の後方確率を導出する。
論文 参考訳(メタデータ) (2026-01-30T15:31:58Z) - RAISE: Reasoning Agent for Interactive SQL Exploration [47.77323087050061]
本稿では,スキーマリンク,クエリ生成,反復的改善を1つのエンドツーエンドコンポーネントに統一する新しいフレームワークを提案する。
本手法は、不慣れなデータベースを扱う際に、人間がどう答えるかをエミュレートする。
論文 参考訳(メタデータ) (2025-06-02T03:07:08Z) - Fact-Consistency Evaluation of Text-to-SQL Generation for Business Intelligence Using Exaone 3.5 [0.0]
大規模言語モデル(LLM)は、テキスト・ツー・ジェネレーションによる構造化データクエリーのための自然言語インタフェースの実現を約束している。
本稿では,Exaone 3.5 を用いて LLM 生成したsql 出力の意味的精度を評価するためのFact-Consistency Evaluation Framework を提案する。
本稿では,LG Electronicsの内部BigQuery環境における実際の販売データから抽出した219の自然言語ビジネス質問からなるドメイン固有ベンチマークを構築した。
我々は,応答精度,実行成功率,意味的誤り率,非応答率を用いてモデル性能を評価する。
論文 参考訳(メタデータ) (2025-04-30T14:42:18Z) - AnDB: Breaking Boundaries with an AI-Native Database for Universal Semantic Analysis [11.419119182421964]
AnDBはAIネイティブデータベースで、従来のOワークロードとAI駆動タスクをサポートする。
AnDBでは、AIの専門知識を必要とせずに、直感的なステートメントを使用してセマンティッククエリを実行することができる。
AnDBは将来的なデータ管理インフラストラクチャを保護し、スクラッチから始めることなく、すべての種類のデータの全潜在能力を効果的かつ効率的に活用することを可能にする。
論文 参考訳(メタデータ) (2025-02-19T15:15:59Z) - Reliable Text-to-SQL with Adaptive Abstention [21.07332675929629]
本稿では,提案手法を組み込むことにより,クエリ生成の信頼性を向上させる新しいフレームワークを提案する。
我々はBIRDベンチマークの総合的な実験を通じてアプローチを検証するとともに、堅牢性と信頼性の大幅な向上を実証した。
論文 参考訳(メタデータ) (2025-01-18T19:36:37Z) - Improving Text Matching in E-Commerce Search with A Rationalizable,
Intervenable and Fast Entity-Based Relevance Model [78.80174696043021]
エンティティベース関連モデル(EBRM)と呼ばれる新しいモデルを提案する。
この分解により、高精度にクロスエンコーダQE関連モジュールを使用できる。
また、ユーザログから自動生成されたQEデータによるQEモジュールの事前トレーニングにより、全体的なパフォーマンスが向上することを示す。
論文 参考訳(メタデータ) (2023-07-01T15:44:53Z) - SUN: Exploring Intrinsic Uncertainties in Text-to-SQL Parsers [61.48159785138462]
本稿では,ニューラルネットワークに基づくアプローチ(SUN)における本質的な不確かさを探索することにより,テキストから依存への変換性能を向上させることを目的とする。
5つのベンチマークデータセットの大規模な実験により、我々の手法は競合より大幅に優れ、新しい最先端の結果が得られた。
論文 参考訳(メタデータ) (2022-09-14T06:27:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。