論文の概要: DRL: A Deterministic Relational Middleware Layer for Transaction-Safe Enterprise NL2SQL Under Schema-Graph Scaling
- arxiv url: http://arxiv.org/abs/2608.26172v1
- Date: Thu, 23 Jul 2026 18:01:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 05:49:59.251502
- Title: DRL: A Deterministic Relational Middleware Layer for Transaction-Safe Enterprise NL2SQL Under Schema-Graph Scaling
- Title(参考訳): DRL: スキーマグラフスケーリングによるトランザクションセーフなエンタープライズNL2SQLのための決定論的リレーショナルミドルウェアレイヤ
- Authors: Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik,
- Abstract要約: エンタープライズOに自然言語インターフェースをデプロイするのはスケールに失敗する。
本稿では,フロントエンドバックエンド間の安全なパイプラインであるDRLを紹介する。
DRLオノップ,1000のスケーリングモデル,およびエンタープライズスキーマにリンクしたNL2分類について検討した。
GPT-4o, Claude Sonnet 4.5, Gemini 2.5 Flash は52.9%, 54.5%, 52.1% 実行一致を達成した。
- 参考スコア(独自算出の注目度): 0.19116784879310023
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deploying natural-language interfaces over enterprise OLTP catalogs fails at scale because semantic parsers collapse under schema-graph scaling, inflating context beyond stable LLM attention budgets. We present DRL (Deterministic Relational Middleware Layer), a safe pipeline interposing between front-ends and SQL backends. DRL comprises dynamic context pruning, relational AST typing, and transactional safeguard verification (EXPLAIN gating and NULL guards) to bound context and flag operational silent divergence (SDop). We evaluate DRL on PostgreSQL and MySQL, contributing (i) an OLTP schema-graph scaling model, (ii) a 1,000-pair Workload Verification Suite, (iii) baselines B0-B3, and (iv) an enterprise NL2SQL failure taxonomy. On PostgreSQL, schema-linked hints (B1) yield a 76% context reduction over naive full-catalog prompting (B0); DRL's dynamic router (B2) reaches a 92% reduction at pruning p95 = 0.58 ms and middleware p95 = 4.6 ms. GPT-4o, Claude Sonnet 4.5, and Gemini 2.5 Flash achieve 52.9%, 52.8%, and 52.1% execution match under a corrected evaluation harness; SDop flags 89-100% of false-positive EX-passing queries. GPT-4o failures are dominated by semantic/filter errors (254/471), while column hallucination is a minor factor (47/471). Crucially, a single regex defect in our evaluation post-processor silently suppressed accuracy and manufactured a false 4-10% cross-vendor gap that vanished when corrected, showing that benchmark code deserves the same scrutiny as the models it scores. DRL reframes enterprise NL2SQL as systems engineering - context bounding, verification, and plan-aware admission - not a leaderboard exercise.
- Abstract(参考訳): エンタープライズOLTPカタログに自然言語インターフェースをデプロイするのは、セマンティックパーザがスキーマグラフのスケーリングで崩壊するため、安定したLCMアテンション予算を超えてコンテキストを膨らませるため、大規模に失敗する。
本稿では、フロントエンドとSQLバックエンド間の安全なパイプラインであるDRL(Deterministic Relational Middleware Layer)を紹介する。
DRLは動的コンテキストプルーニング、リレーショナルASTタイピング、トランザクションセーフガード検証(EXPLAIN ゲーティングとNULLガード)でコンテキストをバウンドし、オペレーショナルサイレント分岐(SDop)をフラグとする。
私たちはPostgreSQLとMySQLでDRLを評価し、貢献します。
(i)OLTPスキーマグラフスケーリングモデル
(二)1000対の作業負荷検証スイート
(iii)ベースラインB0-B3、及び
(iv)NL2SQL障害分類の企業。
PostgreSQL上では、スキーマリンクされたヒント(B1)は、単純で完全な触媒プロンプト(B0),DRLの動的ルータ(B2)は、p95 = 0.58 ms、ミドルウェア p95 = 4.6 ms、GPT-4o、Claude Sonnet 4.5、Gemini 2.5 Flashは、修正された評価ハーネスの下で52.9%、52.8%、52.1%の実行マッチを達成し、SDopフラグは89-100%の偽陽性のEx-passingクエリを達成した。
GPT-4oの故障はセマンティック/フィルタエラー(254/471)に支配され、カラム幻覚はマイナーファクター(47/471)である。
重要なことに、我々の評価後プロセッサの単一のRegex欠陥は、正確さを静かに抑制し、修正時に消える偽の4-10%のクロスベンダギャップを作成し、ベンチマークコードがスコアのモデルと同じ精査に値することを示した。
DRLは、エンタープライズNL2SQLをシステムエンジニアリング - コンテキスト境界、検証、計画認識の受け入れ - として再編成する。
関連論文リスト
- From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing [50.70862449978062]
最近の文書では OmniDocBench v1.6 の 93 以上の TEDS スコアが達成されている。
このギャップを定量化するために、916の現実世界のテーブルの診断ベンチマークであるTableParseMapを紹介します。
論文 参考訳(メタデータ) (2026-08-10T16:59:30Z) - CYGNET: Cypher Gate for Neural Execution Triage and Cost Containment [0.0]
クエリ生成と運用用Neo4jデータベースの間に,事前実行ゲートを設置する。
ゲートは、ミラーグラフに対する実行が5.6msの中央遅延で終わる4つのバックチェーンを通して構造を検証する。
7つのCypherBenchスキーマ(2348の質問、ACL 2025)では、パイプラインはテスト対象のモデル毎に生成精度を維持し、安全な防御層として動作することを確認した。
論文 参考訳(メタデータ) (2026-06-03T09:13:05Z) - Schema-Aware Localisation (SAL): Live Schema Grounding and Hallucination Validation for Oracle NL2SQL [0.19116784879310023]
カラムとエイリアスは幻覚化され、方言固有の構文が欠落し、ORA-00904の無効識別エラーが発生する。
本稿では,Oracle NL2 の軽量レイヤである-Aware Localisation (SAL) を紹介する。
我々は、生のOracle Autonomous Database 23cインスタンスに対して実行される500のTPC-H自然言語質問に対してSALを評価した。
論文 参考訳(メタデータ) (2026-06-03T03:12:18Z) - CAPER: Clause-Aligned Process Supervision for Text-to-SQL [11.286563956844946]
本稿では,SQL 抽象構文木への反実的介入を通じて,自動的に節レベルの監視を導出する CAPER を提案する。
得られたデータは、ポリシー最適化と候補検証のための軽量なクロース境界フィードバックであるCAPER-9Bのトレーニングに使用される。
BIRDとスパイダーの実験では、節順の監督は実行精度を向上するだけでなく、GPT-5.4よりも15.3%の改善を達成し、障害局所化能力を強化し、84.53%の精度と90.60%のMRRを達成した。
論文 参考訳(メタデータ) (2026-06-02T08:35:40Z) - The Constraint Tax: Measuring Validity-Correctness Tradeoffs in Structured Outputs for Small Language Models [0.5482532589225553]
本稿では、デバイス上および低コストのSLM(Small Language Model)デプロイメントを対象としている。
出力制約が根底にある答えを変えることなく信頼性を向上させることを示す。
我々は,回答と実行可能精度損失を分離するための測定プロトコルであるEmphconstraint Taxを導入する。
論文 参考訳(メタデータ) (2026-05-20T07:11:32Z) - SQL-ASTRA: Alleviating Sparse Feedback in Agentic SQL via Column-Set Matching and Trajectory Aggregation [51.696027315573296]
本稿では,効率的な軌道レベル評価と高密度ステップレベル信号の提供を目的とした,普遍的な2層報酬機構を特徴とするフレームワークを提案する。
伝統的なパラダイムでは、報酬は最終ターンのフィードバックによってのみ決定され、中間プロセスを無視し、曖昧な信用評価をもたらす。
提案手法は,同一モデルを用いてBIRD 2.0上でのSOTA Arctic-Text2-R1-7Bより優れており,頑健なマルチターンエージェントのパラダイムに向けてテキストから逆収束を推進していることを示す。
論文 参考訳(メタデータ) (2026-03-17T06:26:36Z) - ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement [57.98138819417949]
テキスト・ツー・クエリを明示的にモデル化するフレームワークであるErrorLLMを提案する。
ErrorLLMは、バックボーンの初期生成よりも大幅に改善されていることを示す。
ErrorLLMは、精錬効率を維持しつつ、高い検出F1スコアで両面に対処する。
論文 参考訳(メタデータ) (2026-03-04T05:27:20Z) - OpenSanctions Pairs: Large-Scale Entity Matching with LLMs [0.9131359219276399]
我々は,実世界の国際制裁アグリゲーションとアナリストの重複から派生した,大規模エンティティマッチングベンチマークOpenSanctions Pairsをリリースした。
データセットには、31か国で293の異種源にまたがる755,540のラベル付きペアが含まれている。
オフザシェルフ LLM は生産ルールベースのベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2026-02-24T06:25:49Z) - Evaluating NL2SQL via SQL2NL [45.88028371034407]
新しいフレームワークは意味論的に等価で語彙的に多様なクエリを生成する。
最先端のモデルは、標準ベンチマークが示すよりもはるかに脆弱だ。
論文 参考訳(メタデータ) (2025-09-04T21:03:59Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - RSL-SQL: Robust Schema Linking in Text-to-SQL Generation [51.00761167842468]
本稿では、双方向スキーマリンク、コンテキスト情報拡張、バイナリ選択戦略、マルチターン自己補正を組み合わせたRSLと呼ばれる新しいフレームワークを提案する。
ベンチマークの結果,オープンソースのソリューション間でのSOTA実行精度は67.2%,BIRDは87.9%,GPT-4オクルージョンは87.9%であった。
提案手法は,DeepSeekを同一のプロンプトで適用した場合,GPT-4ベースのテキスト・ツー・シークシステムよりも優れている。
論文 参考訳(メタデータ) (2024-10-31T16:22:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。