論文の概要: LatentRefusal: Latent-Signal Refusal for Unanswerable Text-to-SQL Queries
- arxiv url: http://arxiv.org/abs/2601.10398v2
- Date: Fri, 16 Jan 2026 03:19:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-19 14:30:44.06375
- Title: LatentRefusal: Latent-Signal Refusal for Unanswerable Text-to-SQL Queries
- Title(参考訳): LatentRefusal: 未解決のText-to-SQLクエリに対する遅延署名の拒否
- Abstract要約: 問合せ不能なユーザクエリとユーザクエリは、テキストから特定システムへの安全なデプロイにおいて、大きな障壁となる。
LatentRefusalは、大きな言語モデルの隠れアクティベーションから応答可能性を予測する潜在信号の拒絶メカニズムである。
latentRefusalは、両方の背骨で平均F1から88.5%改善し、約2ミリ秒のプローブオーバヘッドを追加します。
- 参考スコア(独自算出の注目度): 6.5781226398371615
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In LLM-based text-to-SQL systems, unanswerable and underspecified user queries may generate not only incorrect text but also executable programs that yield misleading results or violate safety constraints, posing a major barrier to safe deployment. Existing refusal strategies for such queries either rely on output-level instruction following, which is brittle due to model hallucinations, or estimate output uncertainty, which adds complexity and overhead. To address this challenge, we formalize safe refusal in text-to-SQL systems as an answerability-gating problem and propose LatentRefusal, a latent-signal refusal mechanism that predicts query answerability from intermediate hidden activations of a large language model. We introduce the Tri-Residual Gated Encoder, a lightweight probing architecture, to suppress schema noise and amplify sparse, localized cues of question-schema mismatch that indicate unanswerability. Extensive empirical evaluations across diverse ambiguous and unanswerable settings, together with ablation studies and interpretability analyses, demonstrate the effectiveness of the proposed approach and show that LatentRefusal provides an attachable and efficient safety layer for text-to-SQL systems. Across four benchmarks, LatentRefusal improves average F1 to 88.5 percent on both backbones while adding approximately 2 milliseconds of probe overhead.
- Abstract(参考訳): LLMベースのテキスト-SQLシステムでは、未確認のユーザクエリは不正なテキストを生成するだけでなく、誤解を招く結果や安全性の制約に反する実行可能プログラムを生成し、安全なデプロイメントにとって大きな障壁となる可能性がある。
このようなクエリに対する既存の拒否戦略は、モデル幻覚による不安定な出力レベルの命令に従うか、複雑さとオーバーヘッドを増す出力の不確実性を見積もる。
この課題に対処するため,テキストからSQLへの安全な拒絶を解答可能性向上問題として定式化し,大規模言語モデルの中間的隠れアクティベーションからクエリ応答性を予測する遅延信号拒否機構であるLatentRefusalを提案する。
本稿では,軽量な探索アーキテクチャであるTri-Residual Gated Encoderを提案する。
様々な不明瞭で解決不可能な環境における広範囲にわたる実験的評価と、アブレーション研究と解釈可能性分析は、提案手法の有効性を実証し、LatentRefusalがテキストからSQLシステムへのアタッチブルで効率的な安全層を提供することを示す。
4つのベンチマークで、LatentRefusalは両方のバックボーンで平均F1から88.5%改善し、プローブのオーバーヘッドを約2ミリ秒増やした。
関連論文リスト
- Evaluating LLMs on Conversational Text-to-SQL under Chain Ambiguity and Intent Drift [25.734705706735443]
TIDE-Benchは、チェーンのあいまいさと意図のドリフト評価の下での対話型テキストから特定要素のベンチマークである。
1,542のサンプルからなり、実行精度を超えるチェーン識別とドリフト認識のための専用メトリクスを導入している。
論文 参考訳(メタデータ) (2026-08-30T04:24:08Z) - Never the Number: Structural Abstention for AI Systems Whose Answers Are Consumed as Fact [0.0]
大規模言語モデルは、データベースに対する自然言語インターフェースを新たに信頼できるものにしたが、キャリブレーションされたテキストから集約されたシステムは、デプロイメントにおいて重要な方法で失敗している。
本稿では、生成シェルを持つ信頼カーネルである、そのようなシステムのためのアーキテクチャパターンを1つの不変量に基づいて提案する。
生成シェルは入力とフレーズの応答を解釈し、決定論的カーネルは、完全に指定された質問と解答可能な質問形状の有界集合とを一致させる。
この2つは、ユーザが何らかの値が計算される前に読む確認で一致し、カーネルが表現できない要求は、近似されるよりも減少する。
論文 参考訳(メタデータ) (2026-08-14T03:53:21Z) - CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement [50.91045324738942]
CLAIMは、オープンドメイン環境でのアクティブな明確化学習のための不確実性駆動フレームワークである。
本研究では,不確実性推定とセマンティッククラスタリングと推論に基づく判断を統合したエントロピー駆動型合成データ生成パイプラインを提案する。
実験の結果,手動でラベル付けしたデータに頼ることなく,CLAIMが安定かつ一般化可能な明確化戦略を学習できることが確認された。
論文 参考訳(メタデータ) (2026-08-12T04:27:45Z) - Robust Active Learning for Few-Shot Example Selection in Text-to-SQL [0.0]
サンプル検索は大規模言語モデルの基盤となる主要なパラダイムである。
我々はこれらの例のアクティブな選択を制約付き実験設計問題として定式化する。
標準的なアクティブな学習フレームワークとは異なり、私たちの設定には3つの重要な課題があります。
論文 参考訳(メタデータ) (2026-06-08T19:56:24Z) - Disentangling Ambiguity from Instability in Large Language Models: A Clinical Text-to-SQL Case Study [0.3437656066916039]
テキストから言語までを2段階のプロセスとしてモデル化するフレームワークであるCLUESを提案する。
意味的不確実性を曖昧性スコアと不安定性スコアに分解する。
CLUESは最先端のカーネルエントロピー行列の故障予測を改善する。
論文 参考訳(メタデータ) (2026-02-12T14:46:20Z) - APEX-SQL: Talking to the data via Agentic Exploration for Text-to-SQL [39.76924093980244]
APEX-動詞化は、パラダイムを受動的翻訳からエージェント探索に移行するフレームワークである。
提案フレームワークでは,実データにおける基底モデル推論に仮説検証ループを用いる。
論文 参考訳(メタデータ) (2026-02-11T07:50:47Z) - Task-Awareness Improves LLM Generations and Uncertainty [48.857040212979484]
ベイズ最適応答は、ビームサーチのような標準的な復号法より一貫して優れている。
我々の決定論的なフレームワークは、潜在応答構造を持つあらゆる問題に適用できる。
論文 参考訳(メタデータ) (2026-01-29T10:16:23Z) - Learning to Extract Context for Context-Aware LLM Inference [60.376872353918394]
大型言語モデル(LLM)へのユーザープロンプトは曖昧か不明確であることが多い。
ユーザの意図、事前知識、リスク要因によって形成されるコンテキスト的手がかりは、適切な応答を構成するものに影響を与える。
本稿では,ユーザプロンプト自体からコンテキスト情報を抽出し,活用するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-12T19:10:08Z) - KBQA-R1: Reinforcing Large Language Models for Knowledge Base Question Answering [64.62317305868264]
テキスト模倣から強化学習によるインタラクション最適化へパラダイムをシフトするフレームワークである textbfKBQA-R1 を提案する。
KBQAを多ターン決定プロセスとして扱うことで,行動のリストを用いて知識ベースをナビゲートすることを学ぶ。
WebQSP、GrailQA、GraphQuestionsの実験では、KBQA-R1が最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-12-10T17:45:42Z) - Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs [10.896368527058714]
大きな言語モデル(LLM)は、しばしば偽の拒絶を発生させ、安全でないクエリに似た用語を含む良質な要求を減少させる。
単一ターンプロンプトに対するXSB(Exaggerated Safety Benchmark)、リファイン誘導トリガを識別する"Focus"キーワードのアノテーション、マルチターンシナリオベースのExaggerated Safety Benchmark(MS-XSB)の2つの総合ベンチマークを紹介した。
ベンチマークの結果,近年の多種多様なLCMにおいて過大な拒絶が持続し,特に複雑なマルチターンシナリオで顕著であることが判明した。
論文 参考訳(メタデータ) (2025-10-09T12:38:16Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - LLM-Symbolic Integration for Robust Temporal Tabular Reasoning [69.27153114778748]
本研究では,システムおよび制御された評価のための合成データセットであるTempTabQA-Cを紹介する。
この構造化アプローチにより、LLM(Large Language Models)はsqlクエリの生成と実行を可能にし、一般化とバイアス軽減の強化を行う。
論文 参考訳(メタデータ) (2025-06-06T05:14:04Z) - DIESEL -- Dynamic Inference-Guidance via Evasion of Semantic Embeddings in LLMs [23.441711206966914]
ディーゼルは軽量な推論誘導技術であり、あらゆる自己回帰式LLMにシームレスに統合することができる。
これは、望ましくない概念を応答から意味的にフィルタリングする。
本評価は,現在最先端の対話モデルにおけるディーゼルの有効性を示すものである。
論文 参考訳(メタデータ) (2024-11-28T10:33:11Z) - On the Worst Prompt Performance of Large Language Models [93.13542053835542]
大規模言語モデル(LLM)の性能は,プロンプトの表現に非常に敏感である。
セマンティックに等価なケースレベルのクエリで構成される新しいベンチマークであるRobustAlpacaEvalを紹介する。
RobustAlpacaEvalとChatGPT、およびLlama、Mistral、Gemmaファミリーの6つのオープンソースLLMによる実験により、モデル性能のかなりのばらつきが明らかになった。
論文 参考訳(メタデータ) (2024-06-08T13:40:38Z) - SUN: Exploring Intrinsic Uncertainties in Text-to-SQL Parsers [61.48159785138462]
本稿では,ニューラルネットワークに基づくアプローチ(SUN)における本質的な不確かさを探索することにより,テキストから依存への変換性能を向上させることを目的とする。
5つのベンチマークデータセットの大規模な実験により、我々の手法は競合より大幅に優れ、新しい最先端の結果が得られた。
論文 参考訳(メタデータ) (2022-09-14T06:27:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。