Fugu-MT 論文翻訳(概要): ScienceBenchmark: A Complex Real-World Benchmark for Evaluating Natural Language to SQL Systems

論文の概要: ScienceBenchmark: A Complex Real-World Benchmark for Evaluating Natural Language to SQL Systems

arxiv url: http://arxiv.org/abs/2306.04743v2
Date: Tue, 5 Dec 2023 15:05:58 GMT
ステータス: 翻訳完了
システム内更新日: 2023-12-06 19:53:21.330072
Title: ScienceBenchmark: A Complex Real-World Benchmark for Evaluating Natural Language to SQL Systems
Title（参考訳）: sciencebenchmark:sqlシステムへの自然言語評価のための複雑な実世界ベンチマーク
Authors: Yi Zhang, Jan Deriu, George Katsogiannis-Meimarakis, Catherine Kosten, Georgia Koutrika, Kurt Stockinger
Abstract要約: 我々はScienceBenchmarkを紹介した。これは3つの現実世界、ドメイン固有のデータベースのための、新しい複雑なNL-to-ベンチマークである。 Spiderの上位パフォーマンスシステムがベンチマークで非常に低いパフォーマンスを達成するため、我々のベンチマークは非常に難しいことを示しています。
参考スコア（独自算出の注目度）: 16.33799752421288
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Natural Language to SQL systems (NL-to-SQL) have recently shown a significant increase in accuracy for natural language to SQL query translation. This improvement is due to the emergence of transformer-based language models, and the popularity of the Spider benchmark - the de-facto standard for evaluating NL-to-SQL systems. The top NL-to-SQL systems reach accuracies of up to 85\%. However, Spider mainly contains simple databases with few tables, columns, and entries, which does not reflect a realistic setting. Moreover, complex real-world databases with domain-specific content have little to no training data available in the form of NL/SQL-pairs leading to poor performance of existing NL-to-SQL systems. In this paper, we introduce ScienceBenchmark, a new complex NL-to-SQL benchmark for three real-world, highly domain-specific databases. For this new benchmark, SQL experts and domain experts created high-quality NL/SQL-pairs for each domain. To garner more data, we extended the small amount of human-generated data with synthetic data generated using GPT-3. We show that our benchmark is highly challenging, as the top performing systems on Spider achieve a very low performance on our benchmark. Thus, the challenge is many-fold: creating NL-to-SQL systems for highly complex domains with a small amount of hand-made training data augmented with synthetic data. To our knowledge, ScienceBenchmark is the first NL-to-SQL benchmark designed with complex real-world scientific databases, containing challenging training and test data carefully validated by domain experts.
Abstract（参考訳）: natural language to sql systems (nl-to-sql) は最近、自然言語からsqlへのクエリ変換の精度が大幅に向上していることを示した。この改善は、トランスフォーマーベースの言語モデルの出現と、NL-to-SQLシステムを評価するデファクト標準であるSpiderベンチマークの人気によるものだ。上位nl-to-sqlシステムは最大85\%のアキュラシーに達する。しかし、スパイダーは主にテーブル、列、エントリがほとんどない単純なデータベースを含んでおり、現実的な設定を反映していない。さらに、ドメイン固有のコンテンツを持つ複雑な実世界のデータベースは、nl/sql-pair形式で利用可能なトレーニングデータが少なく、既存のnl-sqlシステムのパフォーマンスが低下する。本稿では,3つの実世界の高ドメイン固有データベースを対象とした複雑なNL-to-SQLベンチマークであるScienceBenchmarkを紹介する。この新しいベンチマークでは、SQLの専門家とドメインの専門家が、各ドメインに高品質なNL/SQLペアを作成した。さらに,GPT-3を用いて生成した合成データを用いて,少ない量の人為的データを拡張した。 Spiderの上位パフォーマンスシステムがベンチマークで非常に低いパフォーマンスを達成するため、我々のベンチマークは非常に難しいことを示しています。複雑なドメイン向けにnl-to-sqlシステムを作成し、合成データを付加した、少量の手作りのトレーニングデータを持つ。私たちの知る限り、sciencebenchmarkは複雑な実世界の科学データベースで設計された最初のnl-to-sqlベンチマークであり、ドメインの専門家によって慎重に検証されたトレーニングとテストデータを含んでいる。

関連論文リスト

Text-to-SQL Domain Adaptation via Human-LLM Collaborative Data Annotation [26.834687657847454]
テキスト-to-sqlモデルは、現実世界のアプリケーションでますます採用されている。このようなモデルを現実世界にデプロイするには、特定のアプリケーションで使用される高度に専門化されたデータベーススキーマにそれらを適用する必要があることが多い。既存のtext-to-sqlモデルは、新しいスキーマに適用した場合、大幅なパフォーマンス低下を経験する。スキーマの進化のための高品質なテキスト間データを継続的に取得することは、現実世界のシナリオでは違法に高価である。
論文参考訳（メタデータ） (2025-02-21T22:32:35Z)
Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows [64.94146689665628]
Spider 2.0は、エンタープライズレベルのデータベースのユースケースから派生した、現実のテキストからsqlの問題に対する評価フレームワークである。 Spider 2.0のデータベースは、実際のデータアプリケーションからソースされ、1,000以上の列を含み、BigQueryやSnowflakeなどのローカルまたはクラウドデータベースシステムに格納されることが多い。 Spider 2.0の問題解決には、データベースメタデータ、方言文書、さらにはプロジェクトレベルの理解と検索が頻繁に必要であることを示す。
論文参考訳（メタデータ） (2024-11-12T12:52:17Z)
CodeS: Towards Building Open-source Language Models for Text-to-SQL [42.11113113574589]
1Bから15Bまでのパラメータを持つ事前学習言語モデルであるCodeSを紹介する。 CodeSは完全にオープンな言語モデルであり、パラメータサイズをはるかに小さくすることで精度が向上する。我々は、広く使われているスパイダーベンチマークを含む、複数のデータセットの包括的な評価を行う。
論文参考訳（メタデータ） (2024-02-26T07:00:58Z)
Evaluating the Data Model Robustness of Text-to-SQL Systems Based on Real User Queries [4.141402725050671]
本論文は,テキスト・ツー・システムのデータモデルロバスト性について,実際に評価した最初の事例である。サッカーDBはFIFAワールドカップ2022の文脈で9ヶ月にわたって展開されたシステムである。データはすべて、システムにライブで質問された実際のユーザ質問に基づいています。これらの質問のサブセットを手動でラベル付けし、3つの異なるデータモデルに翻訳しました。
論文参考訳（メタデータ） (2024-02-13T10:28:57Z)
SQL-PaLM: Improved Large Language Model Adaptation for Text-to-SQL (extended) [53.95151604061761]
本稿では,大規模言語モデル(LLM)を用いたテキスト・ツー・フィルタリングのフレームワークを提案する。数発のプロンプトで、実行ベースのエラー解析による一貫性復号化の有効性について検討する。命令の微調整により、チューニングされたLLMの性能に影響を及ぼす重要なパラダイムの理解を深める。
論文参考訳（メタデータ） (2023-05-26T21:39:05Z)
UNITE: A Unified Benchmark for Text-to-SQL Evaluation [72.72040379293718]
テキスト・ツー・ドメイン・システムのためのUNIfiedベンチマークを導入する。公開されているテキストからドメインへのデータセットと29Kデータベースで構成されている。広く使われているSpiderベンチマークと比較すると、SQLパターンの3倍の増加が紹介されている。
論文参考訳（メタデータ） (2023-05-25T17:19:52Z)
Can LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs [89.68522473384522]
テキストから効率のよいタスクをベースとした大規模データベースのための大規模なベンチマークであるBirdを紹介します。データベースの値に重点を置いていると、汚いデータベースコンテンツに対する新たな課題が浮き彫りになる。最も効果的なテキストから効率のよいモデルであるChatGPTでさえ、実行精度はわずか40.08%である。
論文参考訳（メタデータ） (2023-05-04T19:02:29Z)
Weakly Supervised Text-to-SQL Parsing through Question Decomposition [53.22128541030441]
我々は最近提案されたQDMR(QDMR)という意味表現を活用している。質問やQDMR構造(非専門家によって注釈付けされたり、自動予測されたりする)、回答が与えられたら、我々は自動的にsqlクエリを合成できる。本結果は,NL-ベンチマークデータを用いて訓練したモデルと,弱い教師付きモデルが競合することを示す。
論文参考訳（メタデータ） (2021-12-12T20:02:42Z)
"What Do You Mean by That?" A Parser-Independent Interactive Approach for Enhancing Text-to-SQL [49.85635994436742]
ループ内に人間を包含し,複数質問を用いてユーザと対話する,新規非依存型対話型アプローチ(PIIA)を提案する。 PIIAは、シミュレーションと人的評価の両方を用いて、限られたインタラクションターンでテキストとドメインのパフォーマンスを向上させることができる。
論文参考訳（メタデータ） (2020-11-09T02:14:33Z)
ValueNet: A Natural Language-to-SQL System that Learns from Database Information [4.788755317132195]
データベースの自然言語インターフェースの構築は、長年にわたる課題だった。最近の研究は、スパイダーのような複雑なデータセットにこの課題に取り組むニューラルネットワークに焦点を当てている。そこで本研究では,この課題を生かした2つのNL-to-endシステムを提案する。
論文参考訳（メタデータ） (2020-05-29T15:43:39Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。