論文の概要: Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Prompted 32B Baseline
- arxiv url: http://arxiv.org/abs/2608.09254v1
- Date: Mon, 10 Aug 2026 08:14:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.141769
- Title: Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Prompted 32B Baseline
- Title(参考訳): SQLの正確さではなくビジネスの真実:ルール付き7B分析エージェントが直接プロンプトされた32Bベースラインを上回る
- Authors: Morris Lee,
- Abstract要約: 本稿では,2つの合成倉庫における400の凍結作業であるWarehouseBenchについて紹介する。
7BエージェントであるQueryProofは、セマンティックレイヤと物理カタログから派生したルールを使用して、その振る舞いを決定する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM analytics agents are evaluated on SQL syntax accuracy, but production failures look different: questions with two valid business definitions, questions the warehouse cannot answer, deprecated columns after a schema change, and queries that execute successfully while returning the wrong business number. No execution-match metric can score them. This paper introduces WarehouseReliabilityBench, 400 frozen tasks over two synthetic warehouses in which roughly half the correct responses are a clarification, an abstention or a refusal, with pinned denominators and a pre-registered paired bootstrap fixing each claim verb before the numbers existed. QueryProof, a 7B agent, uses rules derived from a semantic layer and physical catalog to determine its behaviour, and gates every answer on deterministic post-execution checks. On an 80-task synthetic test split evaluated once, QueryProof outperforms a direct-prompted 32B baseline by +0.237 [+0.112, +0.375] Business Truth Rate at 71.0% lower cost per correct answer; against a cost-matched few-shot baseline the accuracy gain holds but the cost difference does not resolve. This compares systems rather than model sizes: the 32B baseline receives none of the scaffolding. False success falls from 0.754 to 0.351 of returned answers, and no wrong number was returned on an answerable task (0 of 24), though 13 answers went to questions requiring clarification or abstention. Removing the routing layer changes little (0.562 against 0.537), so the result does not depend on escalation. Routing tuned on validation over-abstains on test, and the fitted confidence model loses to the heuristic it replaced. Resampling template families rather than tasks widens both accuracy intervals to include zero, so the effect's direction is better supported than its magnitude. The gain tracks the deterministic layer, though no component ablation was run.
- Abstract(参考訳): LLM分析エージェントはSQLの構文の精度に基づいて評価されるが、運用上の失敗は異なるように見える。2つの有効なビジネス定義を持つ質問、ウェアハウスが答えられない質問、スキーマ変更後のカラムの非推奨化、間違ったビジネス番号を返却しながら正常に実行されるクエリ。
実行マッチのメトリクスはスコア付けできない。
本稿では, 約半数の正解が明確化, 棄却, 拒絶である2つの合成倉庫における400個の冷凍作業について紹介する。
7BエージェントであるQueryProofは、セマンティックレイヤと物理カタログから派生したルールを使用して、その振る舞いを決定し、決定論的ポスト実行チェックに関するすべての回答をゲートする。
一度評価された80タスクの合成テストスプリットでは、QueryProofは、直接プロンプトされた32Bベースラインを+0.237[+0.112, +0.375]ビジネストラスレートで、正解当たり71.0%低いコストでパフォーマンスする。
これはモデルのサイズではなくシステムを比較します。32Bベースラインは足場を一切受け取りません。
偽りの成功は、返却された回答の0.754から0.351に減少し、答え可能なタスク(24の0)では間違った番号が返されることはなかったが、13の回答は、明確化や棄却を必要とする質問に向けられた。
ルーティング層の除去は (0.562 対 0.537) ほとんど変化しないため、結果はエスカレーションに依存しない。
検証に過度に調整されたルーティングがテストされ、適合した信頼性モデルは、置き換えられたヒューリスティックに負ける。
タスクではなくテンプレートファミリーのリサンプリングは、両方の精度間隔を0を含むように拡張するので、効果の方向はその大きさよりも良く支持される。
利得は決定論的層を追跡するが、コンポーネントのアブレーションは実行されなかった。
関連論文リスト
- Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains [15.723674503598948]
モデルは、新しい回答に到達したり、既に到達範囲内にあった回答を生成できる。
我々は,一定の予算,温度,回答形式の下で質問レベルの監査を行う。
まず、推論時層ルーティングが到達可能性を高めるかどうかを検証する。
論文 参考訳(メタデータ) (2026-08-04T06:52:27Z) - Test-time reasoning effort and unauthorized tool use in language-model agents: a prespecified equivalence study [1.6787220460106658]
ツールコールを通じて実行される言語モデルエージェントは、各ロールが実行する操作を制限するアクセス制御ポリシーの下で動作します。
TRIO-20の14の確認シナリオにおいて, GPT-5.6内の推論の努力(低, 最大)が異なる。
840の軌道と2つのモデル層にまたがって、認可されていないツールコールは発生しなかった。
論文 参考訳(メタデータ) (2026-08-04T06:01:14Z) - Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z) - Where Does Agent Reliability Come From? A Cross-Benchmark Decomposition of Verification Loops, Specialist Models, and Scaffolding in a Production Enterprise Agent [0.0]
アーキテクチャが検証ループをインストールする1つのプロダクションシステムについて検討する。
ループの端から端までを計測し、経験的検証器混同行列を生成する。
論文 参考訳(メタデータ) (2026-07-19T03:20:33Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - What Predicts Correctness in Text-to-SQL? A Selective-Prediction Study [0.0]
我々はAUROCを用いて、各クエリがいかに正確かを測定する。
BIRDとスパイダーでは、文字列、構造、実行の自己整合性、スキーマ関連スコア、クエリ実行性といったブラックボックス信号はすべて0.61から0.68AUROCに該当する。
検証器をトレーニングできるかどうかを問う。符号化器と生成器の両方で、約0.77~0.79 AUROCの非分布に到達するが、未知のスキーマでは約0.66に低下する。
論文 参考訳(メタデータ) (2026-07-07T20:52:58Z) - CYGNET: Cypher Gate for Neural Execution Triage and Cost Containment [0.0]
クエリ生成と運用用Neo4jデータベースの間に,事前実行ゲートを設置する。
ゲートは、ミラーグラフに対する実行が5.6msの中央遅延で終わる4つのバックチェーンを通して構造を検証する。
7つのCypherBenchスキーマ(2348の質問、ACL 2025)では、パイプラインはテスト対象のモデル毎に生成精度を維持し、安全な防御層として動作することを確認した。
論文 参考訳(メタデータ) (2026-06-03T09:13:05Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents [52.20768003832476]
我々は$$-Bench (Airline/Retail) および SWE-Bench Verified 上での実行トレースを分析する。
成功を失敗に戻すための、先進的な逸脱、最初期の行動、レベル分岐を形式化する。
モデルに依存しない,勾配のない,テスト時のセーフガードである cm を導入します。
論文 参考訳(メタデータ) (2025-11-26T01:28:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。