論文の概要: Are These Modules Worth Their Cost? A Paradigm-Level Accuracy-Cost Analysis of In-context Learning Text-to-SQL
- arxiv url: http://arxiv.org/abs/2608.28432v1
- Date: Fri, 28 Aug 2026 15:13:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.378534
- Title: Are These Modules Worth Their Cost? A Paradigm-Level Accuracy-Cost Analysis of In-context Learning Text-to-SQL
- Title(参考訳): これらのモジュールはコストが高いか? テキストからSQLへのテキスト学習のパラダイムレベル精度-コスト分析
- Authors: Jiayan Lin, Yujia Liu, Zijin Hong, Zheng Yuan, Yilin Xiao, Hao Chen, Qinggang Zhang, Xiao Huang, Feiran Huang,
- Abstract要約: In-context Learning (ICL) text-to-feedbackは、公開ベンチマークの実行精度を大幅に改善した。
既存の研究では、個々の設計選択の限界精度とコストの貢献を定量化することなく、集約的なエンドツーエンドの精度を報告している。
ICLテキストフィードバックパイプラインの5つの繰り返しモジュールに対して、17のパラダイムレベルの設定をインスタンス化する。
- 参考スコア(独自算出の注目度): 24.607416994480683
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in in-context learning (ICL) text-to-SQL have substantially improved execution accuracy on public benchmarks by assembling increasingly elaborate pipelines around the base generator, yet existing studies typically report aggregate end-to-end accuracy, without quantifying the marginal accuracy-cost contribution of individual design choices. Consequently, providing a unified, paradigm-level cost-accuracy quantification remains a critical challenge for understanding and configuring modern text-to-SQL. To address this, we instantiate 17 paradigm-level configurations across five recurring modules of the ICL text-to-SQL pipeline under a single controlled implementation, and attribute each paradigm's marginal contribution and incurred cost across all four backbones spanning diverse capability levels and reasoning styles. Our analysis reveals that execution-feedback refinement is the only paradigm whose benefit holds universally at consistently low cost, while most other modules help only under backbone-dependent conditions. Token accounting shows that input demand is more closely tied to pipeline structure, whereas output demand is more sensitive to backbone generation behavior. Cross-module analysis further shows that stacking improves accuracy on most backbones, although how the gains compose varies with backbone capability. We also find that a fixed budget is often better spent engineering a more elaborate pipeline over a mid-tier backbone than upgrading to a frontier model with a lean pipeline. These findings distill into an actionable, cost-aware tiered guideline that transfers to five additional backbones without per-paradigm search.
- Abstract(参考訳): In-context Learning (ICL) テキスト・トゥ・SQLの最近の進歩は、ベースジェネレータの周囲の精巧なパイプラインを組み立てることで、公開ベンチマークでの実行精度を大幅に向上させたが、既存の研究では、個々の設計選択の限界精度とコストの寄与を定量化することなく、一般に、集約的なエンドツーエンドの精度を報告している。
したがって、統一的でパラダイムレベルのコスト精度の定量化を提供することは、現代テキストからSQLへの理解と設定において重要な課題である。
この問題に対処するため、ICLのテキスト-SQLパイプラインの5つの繰り返しモジュールにわたる17のパラダイムレベルの構成を単一の制御実装でインスタンス化し、各パラダイムの限界的なコントリビューションと、さまざまな能力レベルと推論スタイルにまたがる4つのバックボーン全体のコストを考慮します。
我々の分析によると、実行フィードバックの改良は、バックボーンに依存した条件下でしか役に立たないのに対して、一貫したコストで普遍的に利益を保っている唯一のパラダイムである。
トークン会計は、入力要求がパイプライン構造とより密接な関係にあることを示しているが、出力要求はバックボーン生成の振る舞いに敏感である。
クロスモジュール解析により、ほとんどのバックボーンの積み重ねによって精度が向上するが、ゲインがどのように構成されるかはバックボーンの機能によって異なる。
また、固定予算は、リーンパイプラインでフロンティアモデルにアップグレードするよりも、中層のバックボーン上でより精巧なパイプラインを構築するのによく使われることもあります。
これらの知見は, パラダイムサーチを使わずに5つのバックボーンに転移する, 動作可能な, コストを意識したタイレッドガイドラインへと抽出される。
関連論文リスト
- An Exploratory Evaluation of LLM-Assisted Rewriting of Moderate-Complexity Financial Sentences for DisCoCat-Based Sentiment Analysis [0.0]
量子自然言語処理(QNLP)はテキストモデリングのための文法を意識したフレームワークであり、分散構成分類(DisCoCat)はその理論上の基礎となる定式化の1つである。
金融感情分析に関する以前の研究は、感度、高いシミュレーションコスト、長文処理の難しさなど、DisCoCatの実用的限界を特定してきた。
金融感情文の圧縮, 簡易化, 分解に制御書き直しを利用する LLM 支援前処理ワークフローについて検討する。
論文 参考訳(メタデータ) (2026-08-07T17:23:01Z) - Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval [0.0]
Retrieval-Augmented Generation (RAG) は、言語モデル(LLM)を拡張し、その応答を外部知識に基盤付ける。
本稿では,動的クエリ分解,反復検索,および有界自己回帰評価ループを導入したエージェントオーケストレーション適応型RAGフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-04T03:38:46Z) - Every Step Counts: Step-Level Credit Assignment for Tool-Integrated Text-to-SQL [13.130554329857496]
ツール拡張テキストにおけるステップレベルクレジット代入のための新しいフレームワークであるFineStepを提案する。
FineStepは4BスケールでGRPOよりも平均3.25%向上し,最先端のパフォーマンスを実現し,冗長なツールインタラクションを低減する。
論文 参考訳(メタデータ) (2026-05-06T10:10:31Z) - PARM: Pipeline-Adapted Reward Model [60.769414637325326]
リワードモデル(RM)は、大規模言語モデル(LLM)を人間の好みと整合させることの中心であり、高度な復号化戦略を推進している。
これまでの作業はシングルステップ生成に重点を置いていたが、現実のアプリケーションはますますマルチステージパイプラインを採用するようになっている。
我々は、最適化のためのコード生成を通じてこれを調査し、報酬モデルを定式化とソリューション段階の両方に統合するパイプラインを構築する。
論文 参考訳(メタデータ) (2026-04-20T14:29:08Z) - Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning [79.88942231770629]
強化学習(RL)は、大規模言語モデル(LLM)の推論能力を向上させるための訓練後の中心的なツールとなっている。
統一表記によるロールアウトパイプラインの形式化とGenerate-Filter-Control-Replay(GFCR)の導入
検証可能な報酬、プロセスの監督、判断に基づくゲーティング、ガイドとツリー/セグメントのロールアウト、アダプティブな計算割り当て、早期終了と部分的なロールアウト、スループット最適化、自己改善のための再生/再配置でRLにまたがる手法を合成する。
論文 参考訳(メタデータ) (2026-04-08T00:53:29Z) - General learned delegation by clones [55.144380092379976]
シリアル推論や非協調並列サンプリングは、固定された推論予算の下では計算非効率である。
本研究では,SELFCESTを提案する。SELFCESTは,同じクローンを異なる並列コンテキストで生成する機能を備えたベースモデルである。
論文 参考訳(メタデータ) (2026-02-03T15:53:35Z) - BRIDGE: Building Representations In Domain Guided Program Verification [67.36686119518441]
BRIDGEは、検証をコード、仕様、証明の3つの相互接続ドメインに分解する。
提案手法は, 標準誤差フィードバック法よりも精度と効率を著しく向上することを示す。
論文 参考訳(メタデータ) (2025-11-26T06:39:19Z) - ComposeRAG: A Modular and Composable RAG for Corpus-Grounded Multi-Hop Question Answering [42.238086712267396]
ComposeRAGは、RAGパイプラインをアトミックで構成可能なモジュールに分解する、新しいモジュラー抽象化である。
精度と接地忠実性の両方において、一貫して強いベースラインを上回ります。
検証ファーストの設計は、低品質の検索設定において、未解決の回答を10%以上削減する。
論文 参考訳(メタデータ) (2025-05-30T21:10:30Z) - Scalable Chain of Thoughts via Elastic Reasoning [61.75753924952059]
Elastic Reasoningは、スケーラブルな思考の連鎖のための新しいフレームワークである。
推論は、独立して割り当てられた予算で、思考と解決の2つのフェーズに分けられる。
我々のアプローチは、制約のない設定でもより簡潔で効率的な推論をもたらす。
論文 参考訳(メタデータ) (2025-05-08T15:01:06Z) - Learning to Decompose: Hypothetical Question Decomposition Based on
Comparable Texts [65.84370471189676]
本研究は,分解型変圧器の大規模中間訓練について,比較テキストから遠ざかって検討する。
このような中間的事前学習により、多様なタスクのための堅牢な分解ベースモデルの開発がより実現可能であることを示す。
論文 参考訳(メタデータ) (2022-10-30T15:38:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。