論文の概要: Database Context Compression for Text-to-SQL on Real-World Large Databases
- arxiv url: http://arxiv.org/abs/2606.28601v1
- Date: Fri, 26 Jun 2026 20:49:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.616814
- Title: Database Context Compression for Text-to-SQL on Real-World Large Databases
- Title(参考訳): 実世界大規模データベースにおけるテキストからSQLへのデータベースコンテキスト圧縮
- Abstract要約: 我々は、主要なボトルネックは推論ではなく、データベース表現であると主張している。
実際のデータベースには、繰り返し行われる監査列、類似したテーブルの大規模なグループ、ドキュメントにのみ格納される不透明な識別子、クエリ関連の情報が少ない広範なデータ辞書が含まれる。
我々は、スキーマ、セマンティック記述、外部文書をコンパクトな表現に書き換えるクエリアリンク変換であるデータベースコンテキスト圧縮として問題を再構築する。
- 参考スコア(独自算出の注目度): 23.20528827913883
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent progress in Text-to-SQL has been driven by stronger language models and prompting strategies, yet performance on real enterprise benchmarks such as Spider 2.0 and BIRD remains far below that on classical academic datasets. We argue that the main bottleneck is no longer reasoning, but database representation. Real databases contain repeated audit columns, large groups of similar tables, opaque identifiers whose meanings are stored only in documentation, and extensive data dictionaries with little query-relevant information. Existing query-aware methods, including schema linking and retrieval-based schema selection, filter this raw context but still operate on redundant and verbose representations. We reformulate the problem as database context compression, a query-agnostic transformation that rewrites schemas, semantic descriptions, and external documentation into a compact representation. We formalize this transformation with the SGCF (Support-Gain Component Factorization) principle, which unifies repeated column extraction, isomorphic table templating, semantic componentization, and evidence purification under a single coverage objective. Based on SGCF, we propose DBCC, a database-side middleware that performs offline structural and semantic compression together with lightweight online evidence purification. DBCC is model-agnostic and can be integrated into existing Text-to-SQL pipelines. On Spider 2.0-Snow and BIRD, DBCC reduces input context by up to two orders of magnitude (from 2.6M to 34.7K tokens on the largest Spider 2.0-Snow subset), improves schema-linking strict recall from 0% to 56.5% under DeepSeek-V3.2 (63.1% under Claude Opus 4.7), and consistently increases end-to-end execution accuracy by 1.8-1.9% over three recent Text-to-SQL systems. Our code is open-sourced at https://github.com/MrBlankness/SchemaCompression.
- Abstract(参考訳): Text-to-SQLの最近の進歩は、より強力な言語モデルと戦略の推進によって推進されているが、スパイダー2.0やBIRDのような実際のエンタープライズベンチマークのパフォーマンスは、古典的な学術的データセットよりもはるかに低いままである。
我々は、主要なボトルネックは推論ではなく、データベース表現であると主張している。
実際のデータベースには、繰り返し行われる監査列、類似したテーブルの大規模なグループ、ドキュメントにのみ格納される不透明な識別子、クエリ関連の情報が少ない広範なデータ辞書が含まれている。
スキーマリンクや検索ベースのスキーマ選択など、既存のクエリ対応メソッドは、この生のコンテキストをフィルタリングするが、冗長で冗長な表現で操作する。
我々は、スキーマ、セマンティック記述、外部文書をコンパクトな表現に書き換えるクエリ非依存の変換であるデータベースコンテキスト圧縮として問題を再構築する。
我々は,この変換をSGCF(Support-Gain Component Factorization)原則で定式化し,繰り返し列抽出,同型テーブルのテンプレート化,意味的成分化,エビデンス清浄を単一対象下で統一する。
SGCFに基づくデータベースサイドミドルウェアDBCCを提案する。これはオフラインで構造的および意味的圧縮を行い、軽量なオンラインエビデンスを浄化する。
DBCCはモデルに依存しず、既存のText-to-SQLパイプラインに統合できる。
スパイダー2.0-SnowとBIRDでは、DBCCは入力コンテキストを最大2桁(最大のスパイダー2.0-Snowサブセットの2.6Mから34.7Kトークン)に減らし、スキーマリンクの厳密なリコールをDeepSeek-V3.2で0%から56.5%に改善し(Crude Opus 4.7で63.1%)、最新の3つのText-to-SQLシステムでエンドツーエンドの実行精度を1.8-1.9%向上した。
私たちのコードはhttps://github.com/MrBlankness/SchemaCompression.comでオープンソース化されています。
関連論文リスト
- A Semantic-Layer-Mediated Agent for Natural Language to SQL over Heterogeneous Enterprise Databases [0.0]
そこで本研究では,意味的意図を物理スコール実行から切り離す意味的層を介するNL2エージェントを提案する。
このシステムは制約付きシンクアクトループを採用し、BigQueryとSnowflakeバックエンドをサポートし、エンドツーエンド評価フレームワークに統合されている。
Gemini 3 Pro は 547-task Spider2-snow ベンチマークで94.15% の精度で実行され、公式のリーダーボードで3位にランクインし、スキーマのみのアプローチを大幅に上回った。
論文 参考訳(メタデータ) (2026-06-30T02:22:39Z) - DecoSearch: Complexity-Aware Routing and Plan-Level Repair for Text-to-SQL [21.568773170643084]
DecoSearchはトレーニング不要のフレームワークで、各クエリを適切な推論レベルにルーティングする。
BIRDは70.53%、Spiderは88.31%、DeepSeekのバックボーンは88.31%である。
論文 参考訳(メタデータ) (2026-06-16T11:48:50Z) - ProSPy: A Profiling-Driven SQL-Python Agentic Framework for Enterprise Text-to-SQL [51.98164069124653]
ProSPyは、エンタープライズスケールのテキスト-非依存分析のためのプロファイリング駆動フレームワークである。
ProSPyは推論プロセスを4段階に構成する。
まず、自動プロファイリングにより、きめ細かいデータ証拠を抽出する。
大規模なスキーマをタスク関連コンテキストに抽出する。
論文 参考訳(メタデータ) (2026-06-04T08:13:05Z) - Text-to-SQL as Dual-State Reasoning: Integrating Adaptive Context and Progressive Generation [54.53145282349042]
DSR-sourced, textbfDual-textbfS textbfReasoning frameworkを導入する。
ポストトレーニングやインコンテキストの例がなければ、DSR-sourcedは競合性能を達成し、スパイダー2.0-Snowで35.28%、BIRD開発で68.32%に達する。
論文 参考訳(メタデータ) (2025-11-26T13:52:50Z) - AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale [68.29002818359844]
既存の方法は違法なコストを発生させ、リコールとノイズのトレードオフに苦労し、大規模データベースに不利なスケーリングを行う。
我々は、反復的エージェント駆動プロセスとしてスキーマリンクを再構成する、自律的なエージェントフレームワークであるtextbfAutoLinkを提案する。
実験ではAutoLinkの優れたパフォーマンスを示し、最先端の厳密なスキーマリンクのリコール、すなわち textbf68.7% EX on Bird-Dev (CHESSより優れている)、 textbf34.9% EX on Spider-2.0-Lite (第2位)を実現している。
論文 参考訳(メタデータ) (2025-11-21T12:12:17Z) - UNJOIN: Enhancing Multi-Table Text-to-SQL Generation via Schema Simplification [50.59009084277447]
論理生成からスキーマ要素の検索を分離するフレームワークUNJOINを紹介する。
最初の段階では、各列をテーブル名でプレフィックスすることで、データベース内のすべてのテーブルの列名を単一のテーブル表現にマージします。
第2段階では、クエリは、この単純化されたスキーマに基づいて生成され、JOIN、UNION、リレーショナルロジックを再構築することで、元のスキーマにマップされる。
論文 参考訳(メタデータ) (2025-05-23T17:28:43Z) - LinkAlign: Scalable Schema Linking for Real-World Large-Scale Multi-Database Text-to-SQL [24.740161980003652]
LinkAlignは、数千のフィールドを持つ大規模データベースに適した、新しいフレームワークである。
LinkAlignは、すべてのスキーマリンクメトリクスにおいて、既存のベースラインを一貫して上回る。
これは、Spider 2.0-Liteベンチマークで33.09%の新しい最先端スコアを達成した。
論文 参考訳(メタデータ) (2025-03-24T11:53:06Z) - ReFoRCE: A Text-to-SQL Agent with Self-Refinement, Consensus Enforcement, and Column Exploration [32.83579488224367]
ReFoRCEは、スパイダー2.0のリーダーボードのトップのテキスト・トゥ・信頼のエージェントです。
ReFoRCEは35.83のスパイダー2.0-Snowと36.56のスコアで最先端の結果を得た。
論文 参考訳(メタデータ) (2025-02-02T05:25:03Z) - RSL-SQL: Robust Schema Linking in Text-to-SQL Generation [51.00761167842468]
本稿では、双方向スキーマリンク、コンテキスト情報拡張、バイナリ選択戦略、マルチターン自己補正を組み合わせたRSLと呼ばれる新しいフレームワークを提案する。
ベンチマークの結果,オープンソースのソリューション間でのSOTA実行精度は67.2%,BIRDは87.9%,GPT-4オクルージョンは87.9%であった。
提案手法は,DeepSeekを同一のプロンプトで適用した場合,GPT-4ベースのテキスト・ツー・シークシステムよりも優れている。
論文 参考訳(メタデータ) (2024-10-31T16:22:26Z) - Bridging Textual and Tabular Data for Cross-Domain Text-to-SQL Semantic
Parsing [110.97778888305506]
BRIDGEは、フィールドのサブセットが質問に言及されたセル値で拡張されるタグ付きシーケンスの質問とDBスキーマを表します。
BRIDGEは、人気のクロスDBテキスト-リレーショナルベンチマークで最先端のパフォーマンスを達成しました。
本分析は,BRIDGEが望まれる相互依存を効果的に捕捉し,さらにテキストDB関連タスクに一般化する可能性を示唆している。
論文 参考訳(メタデータ) (2020-12-23T12:33:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。