論文の概要: BudgetSchemaBench: A Budget-Swept Diagnostic for Schema Context in Text-to-SQL
- arxiv url: http://arxiv.org/abs/2610.00092v1
- Date: Tue, 08 Sep 2026 03:38:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.361552
- Title: BudgetSchemaBench: A Budget-Swept Diagnostic for Schema Context in Text-to-SQL
- Title(参考訳): BudgetSchemaBench: テキストからSQLへのスキーマコンテキストのバジェット検出
- Abstract要約: 構造化されたソース上のデータエージェントは、データベーススキーマをモデルのコンテキストウィンドウに適合させなければなりません。
大規模なカタログは多くのデータベースと数千の列にまたがる可能性があるため、コスト制約はテーブルのカバレッジとシリアライズの詳細を選択する必要がある。
本稿では,BudgetBenchについて紹介する。
- 参考スコア(独自算出の注目度): 1.6558929815405155
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Data agents over structured sources must fit database schema into the model's context window. Large catalogs can span many databases and thousands of columns, so cost constraints may require choosing between table coverage and serialization detail well before the context window is full. We introduce BudgetSchemaBench, an execution-grounded diagnostic for this setting. Its construction derives relevance labels mechanically from gold SQL, without human- or LLM-authored ground truth. Using a pooled 80-database catalog, we sweep four schema-context budgets and compare three representations while keeping each retriever's table ranking fixed. A source-namespace check rejects queries that obtain the correct result from the wrong database. The evaluation covers three conditions: end-to-end retrieval; frozen-gold, in which the required tables are guaranteed; and a probe that removes those tables. For the primary solver with raw serialization, raising the budget from 2.5% to 50% of the catalog improves execution accuracy on 1,279 held-out questions by 18 percentage points under lexical retrieval but only 3 under dense retrieval; the dense retriever already finds most required tables at the smallest budget. When the required tables are removed, 94.6% of correct predictions name one of them exactly, consistent with reconstruction of absent schema from parametric knowledge. For the two main solvers in the frozen-gold condition, the three representations differ by at most 2 percentage points, and the widest paired 95% confidence interval bounds the difference within +/-4 points. We observe the same qualitative patterns with one reasoning model from a different family. When retrieval is coverage-limited, execution accuracy is more sensitive to the schema budget than to the tested serializations. The diagnostic and the code used to construct and evaluate it are publicly available.
- Abstract(参考訳): 構造化されたソース上のデータエージェントは、データベーススキーマをモデルのコンテキストウィンドウに適合させなければなりません。
大規模なカタログは多くのデータベースと数千の列にまたがる可能性があるため、コスト制約はコンテキストウィンドウが満杯になるずっと前に、テーブルカバレッジとシリアライズの詳細を選択する必要があるかもしれない。
私たちはBudgetSchemaBenchを紹介します。
その構造は、人間やLLMが認可した真実なしに、金のSQLから機械的に関連性ラベルを導き出す。
プール化された80データベースカタログを使用して、4つのスキーマコンテキスト予算を整理し、3つの表現を比較し、各レトリバーのテーブルランクを固定したままにします。
source-namespaceチェックは、間違ったデータベースから正しい結果を得るクエリを拒否する。
評価には、エンドツーエンドの検索、必要なテーブルが保証されているフリーズゴールド、これらのテーブルを削除するプローブの3つの条件が含まれている。
生の直列化による主解法では,2.5%から50%の予算引き上げにより,語彙検索では179問の保留質問に対する実行精度が18ポイント向上するが,厳密検索では3点に留まる。
必要なテーブルが取り除かれた場合、94.6%の正確な予測が、パラメトリック知識から欠落したスキーマの再構築と整合して、それらのうちの1つを正確に名付ける。
凍結金型状態の2つの主要な解法について、3つの表現は少なくとも2パーセントの点で異なり、最も広いペアの95%信頼区間は+/-4ポイントの範囲内での差を束縛する。
異なる家系の1つの推論モデルを用いて、同じ定性的パターンを観察する。
検索がカバレッジに制限されている場合、実行精度はテストされたシリアライゼーションよりもスキーマ予算に敏感である。
構築および評価に使用される診断とコードは、公開されている。
関連論文リスト
- From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing [50.70862449978062]
最近の文書では OmniDocBench v1.6 の 93 以上の TEDS スコアが達成されている。
このギャップを定量化するために、916の現実世界のテーブルの診断ベンチマークであるTableParseMapを紹介します。
論文 参考訳(メタデータ) (2026-08-10T16:59:30Z) - Finding the Right Tables and Columns: A Benchmark and Corpus-Adaptive Embeddings for SQL Schema Retrieval [9.741583305127994]
我々は5つのテキストから言語へのデータセットをテーブルと列の粒度の両方で検索タスクとして再キャストした。
オフザシェルフテキストとコード埋め込みは、この設定に不十分に転送されることを示す。
本稿では,対象コーパスから直接自然言語クエリを合成するコーパス適応微調整を提案する。
論文 参考訳(メタデータ) (2026-07-14T22:31:55Z) - ProSPy: A Profiling-Driven SQL-Python Agentic Framework for Enterprise Text-to-SQL [51.98164069124653]
ProSPyは、エンタープライズスケールのテキスト-非依存分析のためのプロファイリング駆動フレームワークである。
ProSPyは推論プロセスを4段階に構成する。
まず、自動プロファイリングにより、きめ細かいデータ証拠を抽出する。
大規模なスキーマをタスク関連コンテキストに抽出する。
論文 参考訳(メタデータ) (2026-06-04T08:13:05Z) - EviLink: Multi-Path Schema Linking with Uncertainty-Guided Evidence Acquisition for Large-Scale Text-to-SQL [53.116276478707626]
EviLinkは、マルチハイプセシススキーマと不確実性誘導されたエビデンス獲得を組み合わせている。
Spider2-Snowでは、EviLinkは90.15%のフィールドレベルの厳格なリコールレートを獲得し、平均トークン123.30Kを使用し、固定ジェネレータによる下流SQL生成を改善している。
論文 参考訳(メタデータ) (2026-05-28T09:32:38Z) - EGREFINE: An Execution-Grounded Optimization Framework for Text-to-SQL Schema Refinement [10.675982676332941]
既存のアプローチでは、スキーマを固定として扱い、下流でエラーに対処する。
我々は、制約付き最適化問題としてスキーマの洗練を枠組み化した。
この問題の計算硬度を解析し、カラムワイドグリーディ分解を動機付ける。
論文 参考訳(メタデータ) (2026-05-01T13:01:59Z) - Retrieve Only Relevant Tables Whether Few or Many: Adaptive Table Retrieval Method [49.38787814788666]
既存のテーブル検索アプローチでは、クエリに最も近いkテーブルの事前決定セットを選択する。
必要なテーブルの数はクエリによって異なり、事前に知ることはできない。
本稿では,各クエリの要求に応じて検索されたテーブル数を調整する適応テーブル検索手法を提案する。
論文 参考訳(メタデータ) (2026-04-12T14:53:56Z) - CORE-T: COherent REtrieval of Tables for Text-to-SQL [91.76918495375384]
CORE-Tはスケーラブルでトレーニング不要なフレームワークで、テーブルに目的のメタデータを付加し、軽量なテーブル互換キャッシュをプリコンプリートする。
バード、スパイダー、MMQAを越えて、CORE-Tはテーブル選択F1を最大22.7ポイント改善し、最大42%のテーブルを検索する。
論文 参考訳(メタデータ) (2026-01-19T14:51:23Z) - Companion Agents: A Table-Information Mining Paradigm for Text-to-SQL [8.159121916366727]
BIRDのような大規模テキスト・ツー・キュレートのベンチマークは通常、利用可能な外部知識だけでなく、完全で正確なデータベースアノテーションを前提としている。
このミスマッチはドメイン・オブ・ザ・ドメイン・テキスト・トゥ・アーティファクトシステムの現実的な適用性を著しく制限する。
本稿では,関係データベースに内在する固有できめ細かな情報を活用するデータベース中心の手法を提案する。
論文 参考訳(メタデータ) (2025-12-17T07:11:55Z) - Chain-of-Query: Unleashing the Power of LLMs in SQL-Aided Table Understanding via Multi-Agent Collaboration [22.351384833450567]
Chain-of-Query (CoQ)は、テーブル理解のための新しいマルチエージェントフレームワークである。
CoQは、構造的ノイズを抽象化し、理解を深めるために、テーブルスキーマの自然言語スタイルの表現を採用する。
4つのモデルと5つの広く使用されているベンチマークによる実験は、CoQが相当な精度改善を実現していることを示している。
論文 参考訳(メタデータ) (2025-08-14T19:46:46Z) - UNJOIN: Enhancing Multi-Table Text-to-SQL Generation via Schema Simplification [50.59009084277447]
論理生成からスキーマ要素の検索を分離するフレームワークUNJOINを紹介する。
最初の段階では、各列をテーブル名でプレフィックスすることで、データベース内のすべてのテーブルの列名を単一のテーブル表現にマージします。
第2段階では、クエリは、この単純化されたスキーマに基づいて生成され、JOIN、UNION、リレーショナルロジックを再構築することで、元のスキーマにマップされる。
論文 参考訳(メタデータ) (2025-05-23T17:28:43Z) - CHESS: Contextual Harnessing for Efficient SQL Synthesis [1.9506402593665235]
効率的でスケーラブルなテキスト・ツー・クエリのためのフレームワークであるCHESSを紹介します。
特殊エージェントは4つあり、それぞれが上記の課題の1つをターゲットにしている。
私たちのフレームワークは、さまざまなデプロイメント制約に適応する機能を提供する。
論文 参考訳(メタデータ) (2024-05-27T01:54:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。