論文の概要: Replacing Training with Memory: Listwise Selection for Text-to-SQL
- arxiv url: http://arxiv.org/abs/2609.00834v1
- Date: Tue, 01 Sep 2026 07:35:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.436446
- Title: Replacing Training with Memory: Listwise Selection for Text-to-SQL
- Title(参考訳): メモリによるトレーニングのリプレース: テキストからSQLへのリスト選択
- Authors: Yeonseok Jeong, Soyoung Yoon, Seongjun Lee, Seung-won Hwang,
- Abstract要約: モデルパラメータとして選択行動を学ぶのではなく、再利用可能な構造化メモリを構築する。
複数の入力順列にまたがってランキングを集計し、実行結果とポイントワイズスコアによって推論コストを最適化する。
Text-to-ベンチマーク全体では、既存の方法よりも微調整や不要な比較を伴わずに、より安定した選択を生成する。
- 参考スコア(独自算出の注目度): 34.25214572225323
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern Text-to-SQL systems often follow generate-execute-select pipelines, generating multiple candidate queries then selecting the best one. Listwise selection, by jointly comparing multiple candidates, has been widely adopted, but fine-tuning listwise selectors is costly. We thus propose a fine-tuning-free listwise selector. We replace two major fine-tuning objectives with inference-time strategies: (1) learning selection criteria as ordering and (2) mitigating positional bias. First, we build reusable structured memories instead of learning selection behavior as model parameters. Given a question, MaP-SQL retrieves memories distilled from training data that encode how natural language maps to schema elements, SQL operations, and expected outputs. These memories serve as explicit decision criteria for evaluating candidates in a listwise manner. Second, to mitigate ordering bias of listwise selectors, we aggregate rankings across multiple input permutations, with inference cost optimized by execution results and pointwise scoring. Our approach improves selection accuracy while maintaining efficiency and compatibility with existing large language models. Across Text-to-SQL benchmarks, it produces more stable selection without fine-tuning and fewer unnecessary comparisons than existing methods. On BIRD-dev, it outperforms the previous state-of-the-art selector-based method R^3-SQL by 2.02 execution accuracy points on average using the same candidate sets, with 2.92x fewer tokens.
- Abstract(参考訳): 現代のText-to-SQLシステムは、ジェネレータ-エグゼキュート-セレクトパイプラインに従って、複数の候補クエリを生成し、最適なクエリを選択する。
リストワイズ選択は、複数の候補を共同で比較することで広く採用されているが、微調整されたリストワイズセレクタはコストがかかる。
そこで我々は、微調整不要なリストワイズセレクタを提案する。
我々は,(1)順序付けによる学習選択基準と(2)位置偏見の緩和という,2つの主要な微調整目標を推論時戦略に置き換える。
まず、モデルパラメータとして選択行動を学ぶのではなく、再利用可能な構造化メモリを構築する。
質問に対して、MaP-SQLは、自然言語がスキーマ要素やSQL操作、期待される出力にどのようにマッピングするかを符号化するトレーニングデータから抽出された記憶を検索する。
これらの記憶は、候補者をリストワイズに評価するための明確な決定基準として機能する。
第2に、リストワイドセレクタの順序バイアスを軽減するために、複数の入力順でランキングを集計し、実行結果とポイントワイズスコアによって推論コストを最適化する。
提案手法は,既存の大規模言語モデルとの効率性と互換性を維持しつつ,選択精度を向上させる。
Text-to-SQLベンチマーク全体では、微調整なしでより安定した選択が可能で、既存のメソッドよりも不要な比較が少ない。
BIRD-devでは、以前の最先端セレクタベースのメソッドR^3-SQLを2.92倍のトークンで平均2.02実行精度で上回っている。
関連論文リスト
- R$^3$-SQL: Ranking Reward and Resampling for Text-to-SQL [55.967050404665606]
R$3$-はBIRD-devで75.03の精度を達成した。
論文 参考訳(メタデータ) (2026-04-28T07:40:50Z) - JudgeSQL: Reasoning over SQL Candidates with Weighted Consensus Tournament [26.476304887882133]
審査員は、構造化された推論と重み付けされたコンセンサストーナメント機構を通じて候補者の選択を再定義する原則的な枠組みである。
審査員は優れた判断能力と優れたクロススケール一般化とジェネレータ能力を示す。
論文 参考訳(メタデータ) (2025-10-17T11:46:38Z) - A Preview of XiYan-SQL: A Multi-Generator Ensemble Framework for Text-to-SQL [20.010431872384714]
XiYanは、マルチコンテキストアンサンブル戦略を用いて、候補生成を改善する革新的なフレームワークである。
本稿では,データベース構造を理解するための半構造化表現手法であるM-スキーマを紹介する。
全体として、提案したXiYan-the-artフレームワークは、Birdデータセットベンチマークで75.63%の最先端実行精度を実現する。
論文 参考訳(メタデータ) (2024-11-13T13:30:21Z) - CHASE-SQL: Multi-Path Reasoning and Preference Optimized Candidate Selection in Text-to-SQL [9.47170756607886]
CHASE-は、マルチエージェントモデリングにおけるテスト時間計算を用いて、候補生成と選択を改善する革新的な戦略を利用する新しいフレームワークである。
最適な候補を特定するために、選別エージェントを用いて、微調整された二項候補選択LLMとのペア比較により候補をランク付けする。
提案したCHASE-は、BIRD Text-to- datasetベンチマークのテストセットと開発セットにおいて、73.0%と73.01%の最先端実行精度を実現している。
論文 参考訳(メタデータ) (2024-10-02T18:41:35Z) - SQLPrompt: In-Context Text-to-SQL with Minimal Labeled Data [54.69489315952524]
Prompt"は、Text-to-LLMのいくつかのショットプロンプト機能を改善するように設計されている。
Prompt"は、ラベル付きデータが少なく、テキスト内学習における従来のアプローチよりも大きなマージンで優れている。
emphPromptはテキスト内学習における従来の手法よりも優れており,ラベル付きデータはほとんどない。
論文 参考訳(メタデータ) (2023-11-06T05:24:06Z) - Wav2SQL: Direct Generalizable Speech-To-SQL Parsing [55.10009651476589]
Speech-to-Spider (S2Spider) は、与えられたデータベースに対する音声質問をsqlクエリに変換することを目的としている。
ケースドシステム間の誤り合成を回避した,最初の直接音声-話者パーシングモデルWav2を提案する。
実験結果から,Wav2は誤差混成を回避し,ベースラインの精度を最大2.5%向上させることで最先端の結果が得られることがわかった。
論文 参考訳(メタデータ) (2023-05-21T19:26:46Z) - Learning to Select from Multiple Options [48.59962245388264]
テクストエンテーメント(TE)は、選択問題に対する最先端(SOTA)アプローチとして示されている。
この研究は、現在の(P, H)モデリングのコンテキストとして、他のkオプションを追加することで、コンテキスト化されたTEモデル(Context-TE)を提案する。
次に、複数のオプションの判断を同時に学習するParallel-TEを導入することで、Context-TEを高速化します。
論文 参考訳(メタデータ) (2022-12-01T06:14:57Z) - Photon: A Robust Cross-Domain Text-to-SQL System [189.1405317853752]
私たちは、マッピングを即座に決定できない自然言語入力にフラグを付けることができる、堅牢でモジュール化されたクロスドメインなNLIDBPhotonを紹介します。
提案手法は,翻訳不能なユーザ入力に対して,テキストからネイティブシステムへのロバストさを効果的に向上させる。
論文 参考訳(メタデータ) (2020-07-30T07:44:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。