論文の概要: Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline
- arxiv url: http://arxiv.org/abs/2609.30290v1
- Date: Wed, 09 Sep 2026 20:17:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.127283
- Title: Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline
- Title(参考訳): 生産用テキスト-SQLパイプラインにおけるLCM-as-Judge障害の検査と修復
- Abstract要約: 本誌が確認したところ、デプロイされた4o-mini判事は、Cohen's kappa = 0.04で2人の著者の金と一致した。
オーバーフラッグのほとんどは、GRADE-HALLUCINATIONと呼ばれる単一のメカニズムに遡る。
- 参考スコア(独自算出の注目度): 14.75087653041195
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human annotators has never actually been measured. When we checked ours, the deployed gpt-4o-mini judge agreed with two-author gold at only Cohen's kappa = 0.04 on a disagreement-enriched set and 0.42 on a uniform-random spot-check, over-flagging 77.1% of the human-FAITHFUL cases in the enriched set. Most of its over-flags trace back to a single mechanism we call GRADE-HALLUCINATION. A self-hosted Qwen3.6-27B replacement (kappa = 0.72) lands in the same range as Claude Opus 4.7 (kappa = 0.71); the head-to-head is underpowered at n = 96, but for the deployment decision that hardly matters, since Qwen costs roughly 1/300 as much per call. Ensembling does not help for free. Pairing the weak judge with a stronger one degrades agreement, whereas three strong judges under unanimity routing reach kappa = 0.79 at 89.7% auto-coverage. Applied out-of-domain, the same audit recipe flags 25.5% of BIRD-financial's expert-authored gold SQLs as candidate gold-SQL issues under our annotation protocol. Code and pre-registration are at https://github.com/JamesL404/synca-audit.
- Abstract(参考訳): テキストからSQLへのパイプラインの生成は、人間のアノテータとの合意が実際に測定されたことがないLCM-as-judgeで終わることが多い。
調査を行ったところ、gpt-4o-miniの審査員はCohen's kappa = 0.04で、不一致に富んだセットでは0.42で、一様ランダムなスポットチェックでは77.1%で、人間-FAITHFULのケースでは77.1%で一致した。
オーバーフラッグのほとんどは、GRADE-HALLUCINATIONと呼ばれる単一のメカニズムに遡る。
自己ホスト型のQwen3.6-27B代替機(kappa = 0.72)は、Claude Opus 4.7(kappa = 0.71)と同じ範囲に着陸し、ヘッド・ツー・ヘッドはn = 96で過小評価されているが、Qwenは1コールあたり約1/300の費用がかかるため、配置上の決定はほとんど重要ではない。
組み立ては無料では役に立たない。
弱い判事と強い判事が合意を下す一方、一律にルーティングする3人の強い判事は89.7%でカッパ=0.79に達する。
ドメイン外に適用された同じ監査レシピは、BIRD-financialの専門家によるゴールドSQLの25.5%を、私たちのアノテーションプロトコルの下での候補ゴールドSQL問題として採用している。
コードと事前登録はhttps://github.com/JamesL404/synca-audit.comにある。
関連論文リスト
- Frozen Judges, Moving Agents: Version-Dependent LLM-Judge Error and the Limits of Judge-Assisted Agent Evaluation [7.504639516424482]
言語モデル審査員はエージェントのアップグレードを前任者と比較するが、固定された審査員はバージョンに依存した誤りを犯すことがある。
公開コーディングエージェント35件、カスタマーサービスエージェント2件、専門家ラベル付きエージェントRewardBenchトラジェクトリ1,106件を分析した。
論文 参考訳(メタデータ) (2026-09-28T03:10:18Z) - The Missing Complement: State-Conditioned Minimal Sufficient Evidence for Coding Agents [26.90440158198578]
捕獲されたエージェントの状態が与えられた場合、次の決定を支援するためのコンパクトなエビデンスの組み合わせは依然として欠落している。
SERBenchは45のリポジトリから保持された500の状態を計測し、エージェントが見たことを記録し、現在の決定が要求されるすべての事実をカバーするセットのみをクレジットする。
キャリブレーションデータに固定された1つの構成では、これらの状態の73.0%が5つの項目で、80.6%が8つの項目で、61.4%と72.4%が再ランク付けされたQwen3埋め込みである。
論文 参考訳(メタデータ) (2026-09-17T10:56:47Z) - What Drives Recovery in Agentic Text-to-Cypher? LAST-CQ: An LLM Agent Self-Refinement Framework [0.0]
LAST-CQは5エージェント、トレーニング不要、実行ベースとしたText-to-Cypherフレームワークである。
私たちは2,471件のライブデータベースクエリと3つのベンダースケール層にまたがる6つのバックボーンで3つのカウンタファクトを実行しています。
論文 参考訳(メタデータ) (2026-09-11T11:47:42Z) - PRIMUS: Identity, Governance, and Verification for Multi-Agent Federations [0.0]
マルチエージェント・フェデレーションは、敵対的な条件下での3つの質問に答えるガバナンスを必要とする。
本稿では,BLSアグリゲートシグネチャと主パワーIDを結合したPRIMUSについて述べる。
PRIMAのバイナリアーティファクト-忠実性判定は、グレード付きフィットネス信号に変換できるかどうかを問う。
論文 参考訳(メタデータ) (2026-09-07T19:21:49Z) - Measuring the Checker: Mutation Analysis for GPU-Kernel Benchmark Oracles [86.41218924166775]
LLM生成のGPUカーネルのベンチマークは、ランダムな入力とゆるやかな浮動小数点耐性で正確性を決定する。
最近の研究は、これらのチェッカーは弱く、手動でパッチを当てることに同意している。
本稿では,カーネルベンチマークの精度指標として突然変異解析を導入する。
論文 参考訳(メタデータ) (2026-09-02T10:30:05Z) - Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context [45.88028371034407]
コード修復における制御ケーススタディを報告し,新しい現象ではない。
私たちは、同じスタック上の1つのフラグ(1チャンク毎の重複)を切り替えます。
BM25(3.2pp、重要なパラダイム間相互作用)を逆転させる。
厳格な固定予算では、ファイルごとのハードダイドプリケートや、タスクに対するA/Bパッケージングポリシは、メトリックフラグを調整しないことが示されます。
論文 参考訳(メタデータ) (2026-08-14T19:22:50Z) - What Predicts Correctness in Text-to-SQL? A Selective-Prediction Study [0.0]
我々はAUROCを用いて、各クエリがいかに正確かを測定する。
BIRDとスパイダーでは、文字列、構造、実行の自己整合性、スキーマ関連スコア、クエリ実行性といったブラックボックス信号はすべて0.61から0.68AUROCに該当する。
検証器をトレーニングできるかどうかを問う。符号化器と生成器の両方で、約0.77~0.79 AUROCの非分布に到達するが、未知のスキーマでは約0.66に低下する。
論文 参考訳(メタデータ) (2026-07-07T20:52:58Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - When Corrective Hints Hurt: Prompt Design in Reasoner-Guided Repair of LLM Overcaution on Entailed Negations under OWL~2~DL [10.675009214407185]
OWL2DL コンプライアンスクエリにおいて GPT-5.4 で再現可能なエラーパターンを報告した。
emphFunctionalProperty closure または class emphdisjointness' の下で、理性に満ちた答えが no''' である場合、モデルは「未知」を頻繁に答える。
論文 参考訳(メタデータ) (2026-04-25T18:11:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。