論文の概要: SERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic Learning
- arxiv url: http://arxiv.org/abs/2608.00485v2
- Date: Tue, 04 Aug 2026 08:32:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.418424
- Title: SERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic Learning
- Title(参考訳): SERL-SQL: テキスト・トゥ・SQL強化エージェント学習のための選択的直視蒸留
- Abstract要約: SERL-はマルチターンテキスト・ツー・エージェントのための選択的実行基盤強化学習フレームワークである。
トレーニングのみの教師を使用して、実行フィードバックで生徒のアクションを再スコアする。
実験の結果、SERL-は競争力があり、76.56%の精度でスパイダーテストを行うことができた。
- 参考スコア(独自算出の注目度): 11.822926017805024
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent Text-to-SQL systems increasingly rely on multi-turn interaction, execution feedback, and reinforcement learning. However, most existing methods use execution correctness only as a trajectory-level reward, which provides limited guidance for identifying the SQL decisions responsible for success or failure. We propose SERL-SQL, a selective execution-grounded reinforcement learning framework for multi-turn Text-to-SQL agents. SERL-SQL samples on-policy SQL interaction trajectories and uses a training-only teacher to re-score student actions with execution feedback. The resulting teacher--student likelihood gap is converted into bounded, masked weights that reweight GRPO advantages only on SQL and tool-action tokens. In this way, task rewards preserve the optimization direction, while execution hindsight provides localized credit assignment. Experiments on BIRD, Spider, and cross-domain benchmarks show that SERL-SQL achieves competitive performance, reaching 76.56% execution accuracy on BIRD-Dev and 89.92% on Spider-Test. Moreover, our reward-based selection strategy closely approaches the oracle Best-of-N upper bound and consistently outperforms consistency-based selection, showing that SERL-SQL produces high-quality candidates that can be reliably identified by lightweight execution-grounded rewards. Our code will be released at https://github.com/Ffunkytao/SERL-SQL.
- Abstract(参考訳): 最近のText-to-SQLシステムは、多ターンインタラクション、実行フィードバック、強化学習にますます依存している。
しかし、既存のほとんどのメソッドは、実行の正確さを軌道レベルの報酬としてのみ使用しており、成功や失敗の原因となるSQLの決定を特定するための限られたガイダンスを提供する。
本稿では,SERL-SQLを提案する。
SERL-SQLは、オンプレミスのSQLインタラクショントラジェクトリをサンプリングし、トレーニング専用の教師を使用して、実行フィードバックで学生のアクションを再スコアする。
結果として得られた教師の確率ギャップは、SQLとツールアクショントークンのみでGRPOのアドバンテージを優先する、有界でマスキングされた重みに変換される。
このようにタスク報酬は最適化方向を保ち、実行後見はローカライズされたクレジット代入を提供する。
BIRD、スパイダー、クロスドメインベンチマークの実験では、SERL-SQLは競争力を発揮し、BIRD-Devでは76.56%、スパイダーテストでは89.92%に達した。
さらに、報酬に基づく選択戦略は、オラクルのベスト・オブ・N上限に近づき、一貫性に基づく選択よりも一貫して優れており、SERL-SQLは軽量な実行グラウンドの報酬によって確実に識別できる高品質な候補を生成することを示す。
私たちのコードはhttps://github.com/Ffunkytao/SERL-SQLでリリースされます。
関連論文リスト
- FINER-SQL: Boosting Small Language Models for Text-to-SQL [40.19592881059662]
大規模言語モデルは、高い計算コスト、長いレイテンシ、データプライバシの懸念に悩まされる。
自然な代替手段は、効率的でプライベートなオンプレミスデプロイメントを可能にする、小さな言語モデルを使用することだ。
スケーラブルで再利用可能な強化学習フレームワークであるFINER-sqlを提案する。
論文 参考訳(メタデータ) (2026-05-05T07:51:29Z) - EXPO-SQL: Execution-based Clause-level Policy Optimization for Text-to-SQL [30.5119607116771]
テキスト・ツー・クエリにより、ユーザは自然言語を使ってデータベースをクエリできる。
既存の大規模言語モデルに基づく強化学習手法は、正しい節と間違った節を等しく扱う。
文問合せのためのEXPO-(Execution-based clause-level Policy Optimization for Text-to- querying)を提案する。
論文 参考訳(メタデータ) (2026-04-29T10:33:16Z) - R$^3$-SQL: Ranking Reward and Resampling for Text-to-SQL [55.967050404665606]
R$3$-はBIRD-devで75.03の精度を達成した。
論文 参考訳(メタデータ) (2026-04-28T07:40:50Z) - Text-to-SQL as Dual-State Reasoning: Integrating Adaptive Context and Progressive Generation [54.53145282349042]
DSR-sourced, textbfDual-textbfS textbfReasoning frameworkを導入する。
ポストトレーニングやインコンテキストの例がなければ、DSR-sourcedは競合性能を達成し、スパイダー2.0-Snowで35.28%、BIRD開発で68.32%に達する。
論文 参考訳(メタデータ) (2025-11-26T13:52:50Z) - MARS-SQL: A multi-agent reinforcement learning framework for Text-to-SQL [22.59453421744114]
基本的タスク分解と対話型強化学習(RL)を組み合わせた新しいマルチエージェントフレームワークMARS-を紹介する。
実験の結果、MARS-はBIRDセットで77.84%、スパイダーテストセットで89.84%の最先端の実行精度を達成した。
論文 参考訳(メタデータ) (2025-11-02T16:55:30Z) - Arctic-Text2SQL-R1: Simple Rewards, Strong Reasoning in Text-to-SQL [35.21185734929167]
提案するArctic-Text2-R1は、RLフレームワークとモデルファミリで、正確で実行可能なsqlを生成するように設計されている。
提案手法は、調整された中間監督と複雑な報酬形成を回避し、安定したトレーニングと最終課題との整合性を促進する。
特に、私たちの7Bモデルは70Bクラスのシステムよりも優れており、フレームワークのスケーラビリティと効率性を強調しています。
論文 参考訳(メタデータ) (2025-05-22T23:33:47Z) - Graph-Reward-SQL: Execution-Free Reinforcement Learning for Text-to-SQL via Graph Matching and Stepwise Reward [16.47355258999193]
テキスト・ツー・タスクにおける大規模言語モデル(LLM)の性能向上のために,強化学習(RL)が広く採用されている。
既存の方法は、実行ベースやLLMベースのBradley-Terry報酬モデルに依存していることが多い。
本稿では,RLをベースとしたテキスト・ツー・スコア(Graph-Reward-RTM)のための新たな報酬モデルフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-18T11:53:01Z) - RSL-SQL: Robust Schema Linking in Text-to-SQL Generation [51.00761167842468]
本稿では、双方向スキーマリンク、コンテキスト情報拡張、バイナリ選択戦略、マルチターン自己補正を組み合わせたRSLと呼ばれる新しいフレームワークを提案する。
ベンチマークの結果,オープンソースのソリューション間でのSOTA実行精度は67.2%,BIRDは87.9%,GPT-4オクルージョンは87.9%であった。
提案手法は,DeepSeekを同一のプロンプトで適用した場合,GPT-4ベースのテキスト・ツー・シークシステムよりも優れている。
論文 参考訳(メタデータ) (2024-10-31T16:22:26Z) - RB-SQL: A Retrieval-based LLM Framework for Text-to-SQL [48.516004807486745]
文脈内学習を伴う大規模言語モデル(LLM)は、テキスト・ツー・タスクの性能を大幅に改善した。
In-context prompt Engineering のための新しい検索ベースフレームワーク RB- を提案する。
実験により,我々のモデルは,公開データセットのBIRDとSpiderの競合ベースラインよりも優れた性能が得られることが示された。
論文 参考訳(メタデータ) (2024-07-11T08:19:58Z) - Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation [76.76046657162306]
大規模言語モデル(LLM)はテキスト・ツー・タスクの新しいパラダイムとして登場した。
大規模言語モデル(LLM)はテキスト・ツー・タスクの新しいパラダイムとして登場した。
論文 参考訳(メタデータ) (2023-08-29T14:59:54Z) - SQL-PaLM: Improved Large Language Model Adaptation for Text-to-SQL (extended) [53.95151604061761]
本稿では,大規模言語モデル(LLM)を用いたテキスト・ツー・フィルタリングのフレームワークを提案する。
数発のプロンプトで、実行ベースのエラー解析による一貫性復号化の有効性について検討する。
命令の微調整により、チューニングされたLLMの性能に影響を及ぼす重要なパラダイムの理解を深める。
論文 参考訳(メタデータ) (2023-05-26T21:39:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。