論文の概要: Evaluating LLMs in Database Scenarios: A Lifecycle Benchmark for Assessing Their Potential in Core Database Tasks
- arxiv url: http://arxiv.org/abs/2608.03794v1
- Date: Tue, 04 Aug 2026 15:10:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.263583
- Title: Evaluating LLMs in Database Scenarios: A Lifecycle Benchmark for Assessing Their Potential in Core Database Tasks
- Title(参考訳): データベースシナリオにおけるLCMの評価:コアデータベースタスクにおけるその可能性を評価するライフサイクルベンチマーク
- Authors: Shunfan Zheng, Dongsheng Shi, Yue Li, Xin Yi, Linlin Wang, Gerard de Melo,
- Abstract要約: 大規模言語モデル(LLM)はデータベースのインタラクションパラダイムを変革し、クエリトランスレータをDBAに進化させています。
我々はDBLifeBenchを紹介します。これは、設計、実装、運用、保守という5つの重要なライフサイクルフェーズでLCMを評価する最初のベンチマークです。
- 参考スコア(独自算出の注目度): 29.600030491146175
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are transforming database interaction paradigms, evolving from simple query translators to autonomous database administrators (DBAs). However, current evaluation benchmarks remain disproportionately fixated on Text-to-SQL tasks, neglecting the holistic Database Lifecycle-from initial schema design to post-deployment maintenance. This narrow focus fails to capture the diverse capabilities required for real-world database management. To bridge this gap, we introduce DBLifeBench, the first benchmark to evaluate LLMs across five critical lifecycle phases: Design, Implementation, Operation, Debugging, and Maintenance. Furthermore, addressing the cognitive mismatch between ambiguous natural language and complex SQL logic, we propose Progressive-Text2SQL, a novel task utilizing structured reasoning graphs to mimic human iterative problem-solving. Our extensive evaluation reveals a critical insight: while general-purpose models demonstrate balanced performance, specialized Text-to-SQL models suffer from ``catastrophic forgetting'' in non-coding phases like design and maintenance. DBLifeBench serves as a foundational step toward evaluating and building true full-stack database intelligence.
- Abstract(参考訳): 大規模言語モデル(LLM)は、単純なクエリトランスレータから自律型データベース管理者(DBA)へと進化するデータベースインタラクションパラダイムを変革している。
しかしながら、現在の評価ベンチマークは、初期スキーマ設計からデプロイ後のメンテナンスまで、全体的なデータベースライフサイクルを無視して、Text-to-SQLタスクに相変わらず固定されている。
この狭い焦点は、現実世界のデータベース管理に必要な多様な機能を捉えることに失敗する。
このギャップを埋めるために、DBLifeBenchを紹介します。DBLifeBenchは、設計、実装、運用、デバッグ、メンテナンスの5つの重要なライフサイクルフェーズでLCMを評価する最初のベンチマークです。
さらに,不明瞭な自然言語と複雑なSQL論理の認識ミスマッチに対処し,構造化推論グラフを用いた人間の反復的問題解決を模倣する新しいタスクであるProgressive-Text2SQLを提案する。
汎用モデルでは、バランスの取れたパフォーマンスを示す一方で、設計や保守といった非コーディングフェーズでは、特殊なText-to-SQLモデルは‘破滅的忘れ’に悩まされる。
DBLifeBenchは、真のフルスタックデータベースインテリジェンスを評価し、構築するための基本的なステップとして機能する。
関連論文リスト
- RASL: Retrieval Augmented Schema Linking for Massive Database Text-to-SQL [1.3654846342364308]
本稿では,データベーススキーマとメタデータを個別のセマンティック単位に分解するコンポーネントベースの検索アーキテクチャを提案する。
我々のソリューションは、高度な微調整をせずに、多様なエンタープライズ環境にまたがる実用的なテキスト・インタフェースを実現する。
論文 参考訳(メタデータ) (2025-07-30T21:09:47Z) - LLM-Symbolic Integration for Robust Temporal Tabular Reasoning [69.27153114778748]
本研究では,システムおよび制御された評価のための合成データセットであるTempTabQA-Cを紹介する。
この構造化アプローチにより、LLM(Large Language Models)はsqlクエリの生成と実行を可能にし、一般化とバイアス軽減の強化を行う。
論文 参考訳(メタデータ) (2025-06-06T05:14:04Z) - IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis [60.32962597618861]
IDA-Benchは、多ラウンドの対話シナリオで大規模言語モデルを評価する新しいベンチマークである。
エージェント性能は、最終的な数値出力と人間由来のベースラインを比較して判断する。
最先端のコーディングエージェント(Claude-3.7-thinkingなど)でさえ50%のタスクを成功させ、シングルターンテストでは明らかでない制限を強調している。
論文 参考訳(メタデータ) (2025-05-23T09:37:52Z) - DB-Explore: Automated Database Exploration and Instruction Synthesis for Text-to-SQL [18.915121803834698]
大規模言語モデルとデータベースの知識を体系的に整合させる新しいフレームワークであるDB-Exploreを提案する。
我々のフレームワークは、多様なサンプリング戦略と自動命令生成を通じて、包括的なデータベース理解を可能にする。
論文 参考訳(メタデータ) (2025-03-06T20:46:43Z) - Can Language Models Enable In-Context Database? [3.675766365690372]
大型言語モデル (LLM) は、様々なタスクを処理できる数ショットの学習者として登場している。
軽量で人間が読めるインコンテキストデータベースの特徴は、従来のデータベースの代替となる可能性がある。
論文 参考訳(メタデータ) (2024-11-04T05:25:39Z) - Improving Retrieval-augmented Text-to-SQL with AST-based Ranking and Schema Pruning [10.731045939849125]
本稿では,テキストからセマンティックへの解析に注目する。
商用データベースのスキーマのサイズとビジネスインテリジェンスソリューションのデプロイ可能性に関する課題から,入力データベース情報を動的に取得する $textASTReS$ を提案する。
論文 参考訳(メタデータ) (2024-07-03T15:55:14Z) - Can Long-Context Language Models Subsume Retrieval, RAG, SQL, and More? [54.667202878390526]
長文言語モデル(LCLM)は、従来、検索システムやデータベースといった外部ツールに依存していたタスクへのアプローチに革命をもたらす可能性がある。
実世界のタスクのベンチマークであるLOFTを導入し、文脈内検索と推論においてLCLMの性能を評価するために設計された数百万のトークンを出力する。
以上の結果からLCLMは,これらのタスクを明示的に訓練したことがないにも関わらず,最先端の検索システムやRAGシステムと競合する驚くべき能力を示した。
論文 参考訳(メタデータ) (2024-06-19T00:28:58Z) - On Evaluating the Integration of Reasoning and Action in LLM Agents with
Database Question Answering [25.57202500348071]
本研究では、大規模言語モデルがデータベースとどのように相互作用するかを評価するために設計された、新しい長文データベース質問応答データセットを提案する。
このタスクでは、LLMが戦略的に複数のクエリを生成し、データベースから十分なデータを取得し、取得したコンテキストを推論し、それらを総合的な分析的な物語に合成する必要がある。
本稿では2つのインタラクション戦略を提案し評価し、インタラクション内の個々のステージを詳細に分析する。
論文 参考訳(メタデータ) (2023-11-16T09:55:07Z) - Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation [76.76046657162306]
大規模言語モデル(LLM)はテキスト・ツー・タスクの新しいパラダイムとして登場した。
大規模言語モデル(LLM)はテキスト・ツー・タスクの新しいパラダイムとして登場した。
論文 参考訳(メタデータ) (2023-08-29T14:59:54Z) - SQL-PaLM: Improved Large Language Model Adaptation for Text-to-SQL (extended) [53.95151604061761]
本稿では,大規模言語モデル(LLM)を用いたテキスト・ツー・フィルタリングのフレームワークを提案する。
数発のプロンプトで、実行ベースのエラー解析による一貫性復号化の有効性について検討する。
命令の微調整により、チューニングされたLLMの性能に影響を及ぼす重要なパラダイムの理解を深める。
論文 参考訳(メタデータ) (2023-05-26T21:39:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。