論文の概要: ReliableTableQA:How Much Supervision Does Reliability Annotation Need?
- arxiv url: http://arxiv.org/abs/2607.20537v1
- Date: Fri, 10 Jul 2026 16:57:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.223257
- Title: ReliableTableQA:How Much Supervision Does Reliability Annotation Need?
- Title(参考訳): ReliableTableQA:どの程度のスーパービジョンが必要か?
- Authors: Huei-Chung Hu, Hsin-Tai Wu, Koyo Kobayashi,
- Abstract要約: 本稿では,LCMをトレーニングするフレームワークであるReliableTableQAを紹介し,QA結果の統計的信頼性について解説する。
我々は信頼できない信頼回答率(UCAR)を定量化し、信頼できない信頼回答率(UCAR)として定量化する。
本研究は, 信頼性アノテーションをデータ効率問題として再設定し, 強化微調整を行ない, 返済しない場合に正確に記述する。
- 参考スコア(独自算出の注目度): 1.3152347996965301
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We introduce ReliableTableQA, a framework for training an LLM to annotate the statistical reliability of tabular QA results, not whether the query is answerable, but whether the computed answer is statistically meaningful. In real enterprise analytics, a syntactically correct SQL query can return a value that is based on too small a sample, has an excessively wide confidence interval, or is too confounded to support action. Existing systems answer confidently in all such cases, a failure we quantify as the Unreliable Confident Answer Rate (UCAR). We contribute (1) a ten-category reliability taxonomy (R1-R10) covering hazards such as small-sample aggregates, multiple-comparison inflation, and distribution-tail mismatch; (2) a program-first data pipeline that generates 50,000 reliability-labeled training examples from a context-free grammar over public retail schemas, with schema-stratified SFT/GRPO splits; and (3) a controlled study of how much supervision calibrated reliability annotation actually requires. We find that a small, schema-stratified SFT set is remarkably sufficient: 200 examples raise reliability-flag F1 from 0.61 to 0.98 and parse rate from 0.52 to 1.00, drive UCAR to zero, and yield a model that generalizes to an unseen retail domain (Rel-F1 0.997 on held-out H&M). Against this strong SFT baseline, GRPO, commonly assumed to be essential, helps only when SFT is under-trained (+0.06-0.16 exact-flag-set match at 100 examples, in- and out-of-distribution) and provides no measurable benefit once SFT is adequate, a null result we confirm across a hard compound-flag slice, a strict exact-match metric, and out-of-distribution evaluation. Our findings reframe reliability annotation as a data-efficiency problem and delineate precisely when reinforcement fine-tuning does and does not pay off.
- Abstract(参考訳): ReliableTableQAは、クエリが応答可能かどうかではなく、計算された回答が統計的に意味があるかどうかに関わらず、表形式QA結果の統計的信頼性をアノテートするためにLLMを訓練するフレームワークである。
実際のエンタープライズ分析では、構文的に正しいSQLクエリは、サンプルが小さすぎること、過度に広範囲な信頼区間を持つこと、あるいはアクションをサポートするには不十分な値を返すことができる。
既存のシステムは、すべてのケースにおいて自信を持って答えることができず、信頼できない回答率(UCAR)として定量化できます。
本研究は,(1)小冊子集約,多重比較インフレーション,分散テールミスマッチなどのハザードをカバーした10カテゴリの信頼性分類(R1-R10),(2)SFT/GRPO分割による公共小売スキーマ上の文脈自由文法から,5万の信頼性ラベル付きトレーニング例を生成するプログラムファーストデータパイプライン,(3)調整された信頼性アノテーションが実際に要求されるかの制御研究である。
200例は信頼性フラグF1を0.61から0.98に引き上げ、パースレートを0.52から1.00に引き上げ、UCARを0に駆動し、未確認の小売ドメインに一般化するモデルを生成する(Rel-F1 0.997 on held-out H&M)。
この強いSFTベースラインに対して、GRPOは一般に必須であると考えられており、SFTが未訓練(100の例で+0.06-0.16の正確なフラッグセットマッチング、in-とout-of-distribution)である場合にのみ有効であり、SFTが適切であれば測定可能な利益が得られない。
本研究は, 信頼性アノテーションをデータ効率問題として再設定し, 強化微調整を行ない, 返済しない場合に正確に記述する。
関連論文リスト
- The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes of Contamination Detection [4.921591758479804]
トレーニングデータメンバーシップを検出する統計ツールは存在するが、ほとんど制御された学術体制でのみ検証されている。
分散シフトとスケール制約という,未調査の2つの障害モードを特定します。
335点中199点しか正しい結果が得られていない。
論文 参考訳(メタデータ) (2026-06-02T08:21:22Z) - Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks [45.86413490112477]
大規模言語モデル(LLM)は信頼性に敏感なアプリケーションで使用される。
厳密な信頼境界を持つ稀な失敗確率を推定するには、違法に大きなLSM推論サイズが必要である。
そこで本研究では,クロスエントロピー手法を用いて,故障確率入力に集中したサンプリング分布を学習する。
論文 参考訳(メタデータ) (2026-05-11T20:23:44Z) - Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection [0.0]
大規模言語モデル(LLM)は、ますます重要な意思決定システムにデプロイされている。
出力アンカートークン確率に基づく正規化信頼スコアを導入する。
これにより、最小限のオーバーヘッドでエラーや幻覚を直接検出できる。
論文 参考訳(メタデータ) (2026-02-18T07:05:12Z) - The GT-Score: A Robust Objective Function for Reducing Overfitting in Data-Driven Trading Strategies [51.56484100374058]
GT-Scoreは、パフォーマンス、統計的重要性、一貫性、ダウンサイドリスクを統合する複合目的関数である。
GT-Scoreは、歩行前向きの検証において、ベースライン目的関数に対して、一般化比を98%改善する。
これらの結果から, 抗オーバーフィッティング構造を組み込むことにより, 定量的研究におけるバックテストの信頼性を向上させることが示唆された。
論文 参考訳(メタデータ) (2026-01-22T05:16:47Z) - Replayable Financial Agents: A Determinism-Faithfulness Assurance Harness for Tool-Using LLM Agents [0.7699235580548228]
LLMエージェントは、規制監査のリプレイに苦労する: トランザクションフラグ付き決定を同じ入力で再現するように要求された場合、ほとんどのデプロイメントは一貫性のある結果を返すことができません。
本稿では,金融サービスに展開するツール利用エージェントにおけるトラジェクティブ決定性およびエビデンス条件の忠実度を測定するためのフレームワークであるDFAHを紹介する。
論文 参考訳(メタデータ) (2026-01-17T19:47:55Z) - Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions [50.1404916337174]
大規模言語モデル(LLM)における母国語の確率的サンプリングの大規模,統計的に活用された最初の監査について述べる。
バッチ生成は, ほぼ完全に崩壊する一方, 中央値のパスレートが13%であり, 統計的妥当性はわずかであることがわかった。
現在のLCMには機能的な内部サンプルが欠如しており、統計的保証を必要とするアプリケーションに外部ツールを使う必要があると結論付けている。
論文 参考訳(メタデータ) (2026-01-08T22:33:12Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - From Embeddings to Equations: Genetic-Programming Surrogates for Interpretable Transformer Classification [9.17282078449475]
本研究では, 冷凍トランスフォーマー埋め込みのシンボル代理モデルを用いて, キャリブレーションされた確率を持つコンパクトで監査可能な分類器について検討する。
5つのベンチマーク(SST2G、20NG、MNIST、CIFAR10、MSC17)では、ModernBERT、DINOv2、SigLIPの埋め込みがトレーニングセットに分割され、情報保存ビューに分割される。
協調型多集団遺伝プログラム(MEGP)は、これらの観点から付加的でクローズドなロジットプログラムを学ぶ。
論文 参考訳(メタデータ) (2025-09-16T02:17:04Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - Conservative Prediction via Data-Driven Confidence Minimization [70.93946578046003]
機械学習の安全性クリティカルな応用においては、モデルが保守的であることが望ましいことが多い。
本研究では,不確実性データセットに対する信頼性を最小化するデータ駆動信頼性最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:05:36Z) - Adversarial Training with Rectified Rejection [114.83821848791206]
本稿では,信頼度(T-Con)を確実性オラクルとして利用し,信頼度を補正してT-Conを予測することを提案する。
軽度の条件下では、正当性(R-Con)拒絶器と信頼性(R-Con)拒絶器を結合して、不正に分類された入力と正しく分類された入力を区別できることを示す。
論文 参考訳(メタデータ) (2021-05-31T08:24:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。