論文の概要: ScienceBenchmark: A Complex Real-World Benchmark for Evaluating Natural
Language to SQL Systems
- arxiv url: http://arxiv.org/abs/2306.04743v2
- Date: Tue, 5 Dec 2023 15:05:58 GMT
- ステータス: 処理完了
- システム内更新日: 2023-12-06 19:53:21.330072
- Title: ScienceBenchmark: A Complex Real-World Benchmark for Evaluating Natural
Language to SQL Systems
- Title(参考訳): sciencebenchmark:sqlシステムへの自然言語評価のための複雑な実世界ベンチマーク
- Authors: Yi Zhang, Jan Deriu, George Katsogiannis-Meimarakis, Catherine Kosten,
Georgia Koutrika, Kurt Stockinger
- Abstract要約: 我々はScienceBenchmarkを紹介した。これは3つの現実世界、ドメイン固有のデータベースのための、新しい複雑なNL-to-ベンチマークである。
Spiderの上位パフォーマンスシステムがベンチマークで非常に低いパフォーマンスを達成するため、我々のベンチマークは非常に難しいことを示しています。
- 参考スコア(独自算出の注目度): 16.33799752421288
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Natural Language to SQL systems (NL-to-SQL) have recently shown a significant
increase in accuracy for natural language to SQL query translation. This
improvement is due to the emergence of transformer-based language models, and
the popularity of the Spider benchmark - the de-facto standard for evaluating
NL-to-SQL systems. The top NL-to-SQL systems reach accuracies of up to 85\%.
However, Spider mainly contains simple databases with few tables, columns, and
entries, which does not reflect a realistic setting. Moreover, complex
real-world databases with domain-specific content have little to no training
data available in the form of NL/SQL-pairs leading to poor performance of
existing NL-to-SQL systems.
In this paper, we introduce ScienceBenchmark, a new complex NL-to-SQL
benchmark for three real-world, highly domain-specific databases. For this new
benchmark, SQL experts and domain experts created high-quality NL/SQL-pairs for
each domain. To garner more data, we extended the small amount of
human-generated data with synthetic data generated using GPT-3. We show that
our benchmark is highly challenging, as the top performing systems on Spider
achieve a very low performance on our benchmark. Thus, the challenge is
many-fold: creating NL-to-SQL systems for highly complex domains with a small
amount of hand-made training data augmented with synthetic data. To our
knowledge, ScienceBenchmark is the first NL-to-SQL benchmark designed with
complex real-world scientific databases, containing challenging training and
test data carefully validated by domain experts.
- Abstract(参考訳): natural language to sql systems (nl-to-sql) は最近、自然言語からsqlへのクエリ変換の精度が大幅に向上していることを示した。
この改善は、トランスフォーマーベースの言語モデルの出現と、NL-to-SQLシステムを評価するデファクト標準であるSpiderベンチマークの人気によるものだ。
上位nl-to-sqlシステムは最大85\%のアキュラシーに達する。
しかし、スパイダーは主にテーブル、列、エントリがほとんどない単純なデータベースを含んでおり、現実的な設定を反映していない。
さらに、ドメイン固有のコンテンツを持つ複雑な実世界のデータベースは、nl/sql-pair形式で利用可能なトレーニングデータが少なく、既存のnl-sqlシステムのパフォーマンスが低下する。
本稿では,3つの実世界の高ドメイン固有データベースを対象とした複雑なNL-to-SQLベンチマークであるScienceBenchmarkを紹介する。
この新しいベンチマークでは、SQLの専門家とドメインの専門家が、各ドメインに高品質なNL/SQLペアを作成した。
さらに,GPT-3を用いて生成した合成データを用いて,少ない量の人為的データを拡張した。
Spiderの上位パフォーマンスシステムがベンチマークで非常に低いパフォーマンスを達成するため、我々のベンチマークは非常に難しいことを示しています。
複雑なドメイン向けにnl-to-sqlシステムを作成し、合成データを付加した、少量の手作りのトレーニングデータを持つ。
私たちの知る限り、sciencebenchmarkは複雑な実世界の科学データベースで設計された最初のnl-to-sqlベンチマークであり、ドメインの専門家によって慎重に検証されたトレーニングとテストデータを含んでいる。
関連論文リスト
- CodeS: Towards Building Open-source Language Models for Text-to-SQL [42.11113113574589]
1Bから15Bまでのパラメータを持つ事前学習言語モデルであるCodeSを紹介する。
CodeSは完全にオープンな言語モデルであり、パラメータサイズをはるかに小さくすることで精度が向上する。
我々は、広く使われているスパイダーベンチマークを含む、複数のデータセットの包括的な評価を行う。
論文 参考訳(メタデータ) (2024-02-26T07:00:58Z) - Evaluating the Data Model Robustness of Text-to-SQL Systems Based on
Real User Queries [4.343983685049737]
本論文は,テキスト・ツー・システムのデータモデルロバスト性について,実際に評価した最初の事例である。
サッカーDBはFIFAワールドカップ2022の文脈で9ヶ月にわたって展開されたシステムである。
データはすべて、システムにライブで質問された実際のユーザ質問に基づいています。これらの質問のサブセットを手動でラベル付けし、3つの異なるデータモデルに翻訳しました。
論文 参考訳(メタデータ) (2024-02-13T10:28:57Z) - DBCopilot: Scaling Natural Language Querying to Massive Databases [49.366970974952125]
既存の方法は、大規模で動的に変化するデータベースを扱う際に、スケーラビリティの課題に直面します。
本稿では,DBCopilotについて紹介する。DBCopilotは,大規模データベース間のルーティングにコンパクトで柔軟なコピロットモデルを用いるフレームワークである。
論文 参考訳(メタデータ) (2023-12-06T12:37:28Z) - UNITE: A Unified Benchmark for Text-to-SQL Evaluation [72.72040379293718]
テキスト・ツー・ドメイン・システムのためのUNIfiedベンチマークを導入する。
公開されているテキストからドメインへのデータセットと29Kデータベースで構成されている。
広く使われているSpiderベンチマークと比較すると、SQLパターンの3倍の増加が紹介されている。
論文 参考訳(メタデータ) (2023-05-25T17:19:52Z) - Can LLM Already Serve as A Database Interface? A BIg Bench for
Large-Scale Database Grounded Text-to-SQLs [89.68522473384522]
テキストから効率のよいタスクをベースとした大規模データベースのための大規模なベンチマークであるBirdを紹介します。
データベースの値に重点を置いていると、汚いデータベースコンテンツに対する新たな課題が浮き彫りになる。
最も効果的なテキストから効率のよいモデルであるChatGPTでさえ、実行精度はわずか40.08%である。
論文 参考訳(メタデータ) (2023-05-04T19:02:29Z) - Importance of Synthesizing High-quality Data for Text-to-SQL Parsing [71.02856634369174]
最先端のテキストから重み付けアルゴリズムは、強化された合成データでトレーニングされた場合、一般的なベンチマークでは改善されなかった。
本稿では,スキーマから重要な関係を取り入れ,強い型付けを課し,スキーマ重み付きカラムサンプリングを行う新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2022-12-17T02:53:21Z) - A Survey on Text-to-SQL Parsing: Concepts, Methods, and Future
Directions [102.8606542189429]
テキストからコーパスへのパースの目的は、自然言語(NL)質問をデータベースが提供するエビデンスに基づいて、対応する構造化クエリ言語()に変換することである。
ディープニューラルネットワークは、入力NL質問から出力クエリへのマッピング関数を自動的に学習するニューラルジェネレーションモデルによって、このタスクを大幅に進歩させた。
論文 参考訳(メタデータ) (2022-08-29T14:24:13Z) - "What Do You Mean by That?" A Parser-Independent Interactive Approach
for Enhancing Text-to-SQL [49.85635994436742]
ループ内に人間を包含し,複数質問を用いてユーザと対話する,新規非依存型対話型アプローチ(PIIA)を提案する。
PIIAは、シミュレーションと人的評価の両方を用いて、限られたインタラクションターンでテキストとドメインのパフォーマンスを向上させることができる。
論文 参考訳(メタデータ) (2020-11-09T02:14:33Z) - ValueNet: A Natural Language-to-SQL System that Learns from Database
Information [4.788755317132195]
データベースの自然言語インターフェースの構築は、長年にわたる課題だった。
最近の研究は、スパイダーのような複雑なデータセットにこの課題に取り組むニューラルネットワークに焦点を当てている。
そこで本研究では,この課題を生かした2つのNL-to-endシステムを提案する。
論文 参考訳(メタデータ) (2020-05-29T15:43:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。