論文の概要: BIS: NL2SQL Service Evaluation Benchmark for Business Intelligence Scenarios
- arxiv url: http://arxiv.org/abs/2410.22925v1
- Date: Wed, 30 Oct 2024 11:33:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-10-31 14:28:02.400438
- Title: BIS: NL2SQL Service Evaluation Benchmark for Business Intelligence Scenarios
- Title(参考訳): BIS:ビジネスインテリジェンスシナリオのためのNL2SQLサービス評価ベンチマーク
- Authors: Bora Caglayan, Mingxue Wang, John D. Kelleher, Shen Fei, Gui Tong, Jiandong Ding, Puchao Zhang,
- Abstract要約: 既存のNL2ベンチマークは、プロダクションBIシナリオには適していない。
産業用BIシナリオにおける典型的なNL問題に焦点をあてた新しいベンチマークを開発した。
- 参考スコア(独自算出の注目度): 3.5078637813733473
- License:
- Abstract: NL2SQL (Natural Language to Structured Query Language) transformation has seen wide adoption in Business Intelligence (BI) applications in recent years. However, existing NL2SQL benchmarks are not suitable for production BI scenarios, as they are not designed for common business intelligence questions. To address this gap, we have developed a new benchmark focused on typical NL questions in industrial BI scenarios. We discuss the challenges of constructing a BI-focused benchmark and the shortcomings of existing benchmarks. Additionally, we introduce question categories in our benchmark that reflect common BI inquiries. Lastly, we propose two novel semantic similarity evaluation metrics for assessing NL2SQL capabilities in BI applications and services.
- Abstract(参考訳): NL2SQL(Natural Language to Structured Query Language)変換は、近年、ビジネスインテリジェンス(BI)アプリケーションに広く採用されている。
しかし、既存のNL2SQLベンチマークは、一般的なビジネスインテリジェンスの問題のために設計されていないため、プロダクションBIシナリオには適していない。
このギャップに対処するため、産業用BIシナリオにおける典型的なNL問題に焦点を当てた新しいベンチマークを開発した。
BIに焦点を当てたベンチマークを構築する際の課題と既存のベンチマークの欠点について論じる。
さらに、一般的なBI問い合わせを反映した質問カテゴリをベンチマークに導入する。
最後に,BIアプリケーションおよびサービスにおけるNL2SQL機能評価のための2つの新しい意味類似性評価指標を提案する。
関連論文リスト
- Fundamental Challenges in Evaluating Text2SQL Solutions and Detecting Their Limitations [9.363953429870007]
予測と評価の誤りを生じる可能性のあるすべてのText2制限を統一した分類法を提案する。
本稿では,実例による制限の原因について述べるとともに,分類学における各カテゴリーに対する潜在的な緩和ソリューションを提案する。
論文 参考訳(メタデータ) (2025-01-30T08:31:09Z) - Scenario-Wise Rec: A Multi-Scenario Recommendation Benchmark [54.93461228053298]
6つの公開データセットと12のベンチマークモデルと、トレーニングと評価パイプラインで構成されるベンチマークである textbfScenario-Wise Rec を紹介します。
このベンチマークは、研究者に先行研究から貴重な洞察を提供することを目的としており、新しいモデルの開発を可能にしている。
論文 参考訳(メタデータ) (2024-12-23T08:15:34Z) - A Survey of NL2SQL with Large Language Models: Where are we, and where are we going? [32.84561352339466]
我々は,Large Language Models (LLM) を用いたNL2手法のレビューを行う。
LLM時代におけるNL2の研究課題とオープン問題について論じる。
論文 参考訳(メタデータ) (2024-08-09T14:59:36Z) - AMBROSIA: A Benchmark for Parsing Ambiguous Questions into Database Queries [56.82807063333088]
我々は,新たなベンチマークであるAMBROSIAを導入し,テキスト・ツー・オープン・プログラムの開発を促進することを期待する。
私たちのデータセットには、3種類のあいまいさ(スコープのあいまいさ、アタッチメントのあいまいさ、あいまいさ)を示す質問が含まれている。
いずれの場合も、データベースのコンテキストが提供されてもあいまいさは持続する。
これは、スクラッチからデータベースを制御して生成する、新しいアプローチによって実現される。
論文 参考訳(メタデータ) (2024-06-27T10:43:04Z) - Enhancing Text-to-SQL Translation for Financial System Design [5.248014305403357]
様々なNLPタスクの最先端技術を実現したLarge Language Models (LLMs) について検討する。
本稿では,関係クエリ間の類似性を適切に測定する2つの新しい指標を提案する。
論文 参考訳(メタデータ) (2023-12-22T14:34:19Z) - Controlled Natural Languages for Specifying Business Intelligence
Applications [0.0]
2種類のCNL, CNL-BI, ITLingo ASLが用いられた。
仮説的BIアプリケーションであるMEDBuddy-BIは、National Health Serviceのために開発された。
論文 参考訳(メタデータ) (2023-11-20T16:30:12Z) - Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation [76.76046657162306]
大規模言語モデル(LLM)はテキスト・ツー・タスクの新しいパラダイムとして登場した。
大規模言語モデル(LLM)はテキスト・ツー・タスクの新しいパラダイムとして登場した。
論文 参考訳(メタデータ) (2023-08-29T14:59:54Z) - UNITE: A Unified Benchmark for Text-to-SQL Evaluation [72.72040379293718]
テキスト・ツー・ドメイン・システムのためのUNIfiedベンチマークを導入する。
公開されているテキストからドメインへのデータセットと29Kデータベースで構成されている。
広く使われているSpiderベンチマークと比較すると、SQLパターンの3倍の増加が紹介されている。
論文 参考訳(メタデータ) (2023-05-25T17:19:52Z) - STAR: SQL Guided Pre-Training for Context-dependent Text-to-SQL Parsing [64.80483736666123]
文脈依存型テキスト・ツー・パースのための新しい事前学習フレームワークSTARを提案する。
さらに,STARを事前学習するための大規模コンテキスト依存型テキスト対話コーパスを構築した。
大規模な実験により、STARは2つの下流ベンチマークで新しい最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2022-10-21T11:30:07Z) - CUGE: A Chinese Language Understanding and Generation Evaluation
Benchmark [144.05723617401674]
汎用言語インテリジェンス評価は、自然言語処理の長年の目標である。
汎用言語インテリジェンス評価には,ベンチマーク自体が包括的で体系的なものである必要がある,と我々は主張する。
以下に示す機能を備えた中国語理解・生成評価ベンチマークであるCUGEを提案する。
論文 参考訳(メタデータ) (2021-12-27T11:08:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。