論文の概要: Schema-Aware Localisation (SAL): Live Schema Grounding and Hallucination Validation for Oracle NL2SQL
- arxiv url: http://arxiv.org/abs/2607.22572v1
- Date: Wed, 03 Jun 2026 03:12:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.972239
- Title: Schema-Aware Localisation (SAL): Live Schema Grounding and Hallucination Validation for Oracle NL2SQL
- Title(参考訳): Schema-Aware Localization (SAL) - Oracle NL2SQLのライブスキーマグラウンディングと幻覚検証
- Authors: Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik,
- Abstract要約: カラムとエイリアスは幻覚化され、方言固有の構文が欠落し、ORA-00904の無効識別エラーが発生する。
本稿では,Oracle NL2 の軽量レイヤである-Aware Localisation (SAL) を紹介する。
我々は、生のOracle Autonomous Database 23cインスタンスに対して実行される500のTPC-H自然言語質問に対してSALを評価した。
- 参考スコア(独自算出の注目度): 0.19116784879310023
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models can generate fluent SQL from natural language, but on real enterprise Oracle databases they frequently fail at execution time: columns and aliases are hallucinated and dialect-specific syntax is missed, leading to ORA-00904 invalid-identifier errors. In this setting, failures are primarily due to missing schema grounding: the model cannot know which tables and columns actually exist. This paper introduces Schema-Aware Localisation (SAL), a lightweight middleware layer for Oracle NL2SQL that requires no model retraining. SAL queries Oracle's USER_TAB_COLUMNS catalog to build a live schema map, selects a relevant table subset for each question (falling back to the full schema for multi-table queries), and injects this ground-truth context into the LLM prompt. Generated SQL is then checked by the Hallucination Index (Hidx), which validates every alias.column reference against the live catalog, automatically rewrites predictable prefix errors, and otherwise triggers a structured retry with itemised corrections. We evaluate SAL on 500 TPC-H natural language questions executed against a live Oracle Autonomous Database 23c instance using GPT-4o-mini. Without any schema grounding, execution-grounded truth (EGT; executes and matches the reference result set) is 2.2% (12/500). A hand-written static schema hint brings EGT to 62.0%. SAL, with no manual schema curation, achieves 62.6% EGT (96% simple, 95% medium, 40.7% complex) while reducing execution failures from 97.6% to 2.6%.
- Abstract(参考訳): 大規模な言語モデルは自然言語から流動的なSQLを生成することができるが、実際のエンタープライズOracleデータベースでは、しばしば実行時に失敗する:列とエイリアスは幻覚され、方言固有の構文が欠落し、ORA-00904の無効識別エラーが発生する。
この設定では、失敗は主にスキーマの基盤が欠けているためである。
本稿では,Oracle NL2SQL 用の軽量ミドルウェア層である Schema-Aware Localisation (SAL) を紹介する。
SALはOracleのUSER_TAB_COLUMNSカタログに問い合わせて、生のスキーママップを構築し、質問ごとに関連するテーブルサブセットを選択し(マルチテーブルクエリの完全なスキーマにフォールバックする)、LLMプロンプトにこの地味なコンテキストを注入する。
生成されたSQLはHalucination Index(Hidx)によってチェックされ、ライブカタログに対するすべてのエイリアス・カラム参照を検証し、予測可能なプレフィックスエラーを自動的に書き換える。
GPT-4o-miniを用いて,実稼働中のOracleautonomous Database 23cインスタンスに対して実行された500のTPC-H自然言語質問に対してSALを評価する。
スキーマの根拠がなければ、実行ベース真理(EGT; executions and matches the reference result set)は2.2%(12/500)である。
手書きの静的スキーマヒントにより、EGTは62.0%になる。
SALは手動でスキーマをキュレーションせずに62.6%のEGT(96%が単純、95%が中、40.7%が複雑)を達成し、実行障害を97.6%から2.6%に減らした。
関連論文リスト
- Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows [54.49251107006261]
我々はSpider 2.0-AIFuncを紹介した。これは、Snowflakeプラットフォーム上の6種類のAI機能をカバーする125の現実世界データベースにわたる465の検証済みインスタンスのベンチマークである。
最強のプロプライエタリモデルは67-70%の精度で実行でき、最高のオープンソースモデルは58.1%に達する。
論文 参考訳(メタデータ) (2026-07-07T12:54:08Z) - Schema-First Retrieval: Embedding Catalogs for Natural Language Analytics [0.10210859604701106]
現代の倉庫には、数千のテーブル、短縮された列、非公式なメトリクス、隠れた結合規約、および生のテーブル名によってキャプチャされない許可境界が含まれている。
倉庫の行ではなくカタログメタデータを埋め込んだ検索層であるEnterprise-First Retrievalを紹介します。
このシステムは、オブジェクト固有のテキストテンプレートを使用して、5つの型付きカタログオブジェクト、テーブル、列、メトリクス、リレーションシップ、クエリ履歴をインデックスする。
論文 参考訳(メタデータ) (2026-06-23T02:20:36Z) - EviLink: Multi-Path Schema Linking with Uncertainty-Guided Evidence Acquisition for Large-Scale Text-to-SQL [53.116276478707626]
EviLinkは、マルチハイプセシススキーマと不確実性誘導されたエビデンス獲得を組み合わせている。
Spider2-Snowでは、EviLinkは90.15%のフィールドレベルの厳格なリコールレートを獲得し、平均トークン123.30Kを使用し、固定ジェネレータによる下流SQL生成を改善している。
論文 参考訳(メタデータ) (2026-05-28T09:32:38Z) - ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement [57.98138819417949]
テキスト・ツー・クエリを明示的にモデル化するフレームワークであるErrorLLMを提案する。
ErrorLLMは、バックボーンの初期生成よりも大幅に改善されていることを示す。
ErrorLLMは、精錬効率を維持しつつ、高い検出F1スコアで両面に対処する。
論文 参考訳(メタデータ) (2026-03-04T05:27:20Z) - AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale [68.29002818359844]
既存の方法は違法なコストを発生させ、リコールとノイズのトレードオフに苦労し、大規模データベースに不利なスケーリングを行う。
我々は、反復的エージェント駆動プロセスとしてスキーマリンクを再構成する、自律的なエージェントフレームワークであるtextbfAutoLinkを提案する。
実験ではAutoLinkの優れたパフォーマンスを示し、最先端の厳密なスキーマリンクのリコール、すなわち textbf68.7% EX on Bird-Dev (CHESSより優れている)、 textbf34.9% EX on Spider-2.0-Lite (第2位)を実現している。
論文 参考訳(メタデータ) (2025-11-21T12:12:17Z) - UNJOIN: Enhancing Multi-Table Text-to-SQL Generation via Schema Simplification [50.59009084277447]
論理生成からスキーマ要素の検索を分離するフレームワークUNJOINを紹介する。
最初の段階では、各列をテーブル名でプレフィックスすることで、データベース内のすべてのテーブルの列名を単一のテーブル表現にマージします。
第2段階では、クエリは、この単純化されたスキーマに基づいて生成され、JOIN、UNION、リレーショナルロジックを再構築することで、元のスキーマにマップされる。
論文 参考訳(メタデータ) (2025-05-23T17:28:43Z) - Extractive Schema Linking for Text-to-SQL [17.757832644216446]
テキスト・トゥ・ワンは、現実世界のデータベースの実用的なインターフェースとして現れつつある。
本稿では,デコーダのみのLLMをスキーマリンクに適用するための新しいアプローチを提案する。
論文 参考訳(メタデータ) (2025-01-23T19:57:08Z) - RSL-SQL: Robust Schema Linking in Text-to-SQL Generation [51.00761167842468]
本稿では、双方向スキーマリンク、コンテキスト情報拡張、バイナリ選択戦略、マルチターン自己補正を組み合わせたRSLと呼ばれる新しいフレームワークを提案する。
ベンチマークの結果,オープンソースのソリューション間でのSOTA実行精度は67.2%,BIRDは87.9%,GPT-4オクルージョンは87.9%であった。
提案手法は,DeepSeekを同一のプロンプトで適用した場合,GPT-4ベースのテキスト・ツー・シークシステムよりも優れている。
論文 参考訳(メタデータ) (2024-10-31T16:22:26Z) - The Death of Schema Linking? Text-to-SQL in the Age of Well-Reasoned Language Models [0.9149661171430259]
次世代の大規模言語モデル(LLM)を使用する場合のスキーマリンクを再検討する。
より新しいモデルでは,無関係なモデルが多数存在する場合でも,生成時に関連するスキーマ要素を利用することが可能であることが実証的に判明した。
文脈情報をフィルタリングする代わりに、拡張、選択、修正などのテクニックを強調し、テキストからBIRDパイプラインの精度を向上させるためにそれらを採用する。
論文 参考訳(メタデータ) (2024-08-14T17:59:04Z) - SQL-to-Schema Enhances Schema Linking in Text-to-SQL [15.6857201570992]
テキストから音声へのメソッドでは、不要なテーブルや列をフィルタリングする必要がある。
これまでのアプローチでは、テーブルや列のソートが問題との関連性に基づいて行われてきた。
提案手法は,2段階に分けて提案するスキーマリンク方式である。
論文 参考訳(メタデータ) (2024-05-15T12:22:48Z) - Analyzing the Effectiveness of Large Language Models on Text-to-SQL
Synthesis [4.412170175171256]
本研究では,大規模言語モデルを用いたテキスト・ツー・プログラム合成における様々なアプローチについて検討する。
目標は、データベーススキーマと共に自然言語の質問を入力し、正しいSELECTクエリを出力することであった。
論文 参考訳(メタデータ) (2024-01-22T22:05:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。