論文の概要: Calibrating Small Language Models for Claim Check-Worthiness Detection
- arxiv url: http://arxiv.org/abs/2608.30731v2
- Date: Tue, 01 Sep 2026 08:12:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 14:14:26.04293
- Title: Calibrating Small Language Models for Claim Check-Worthiness Detection
- Title(参考訳): クレームチェックウェアネス検出のための小さな言語モデルの校正
- Authors: Pratuat Amatya, V Venktesh, Vinay Setty,
- Abstract要約: NN-PPIは予測パワー推論のポイントワイド拡張であり、推論時にモデル予測を軽量なポストホック層として校正する。
NN-PPIはベースラインモデルのサイズと性能に応じて12%から33.80%の重み付けF1ゲインを達成する。
- 参考スコア(独自算出の注目度): 7.856998585396422
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Assessing claim check-worthiness is an essential first step in automated fact-checking pipelines. This work is motivated by a real deployment challenge at an early-stage startup: running large language models (LLMs) over every incoming claim is cost- and latency-prohibitive, yet smaller models sacrifice accuracy. We propose NN-PPI, a pointwise extension of Prediction-Powered Inference (PPI) that calibrates model predictions at inference time as a lightweight post-hoc layer, without re-training the underlying model. NN-PPI achieves weighted F1 gains ranging from 12% to 33.80% depending on the size and performance of the baseline model, bringing SLMs on par with larger LLMs. Beyond few-shot SLMs, NN-PPI further improves a production-deployed fine-tuned model, demonstrating that residual calibration is complementary to supervised fine-tuning. By recovering LLM-level accuracy from models that are an order of magnitude cheaper to serve, it makes accurate check-worthiness detection substantially cheaper to operate at scale. Our code and data can be found at https://anonymous.4open.science/r/arr-claim-worthiness-F237.
- Abstract(参考訳): クレームチェックの信頼性を評価することは、自動ファクトチェックパイプラインにおける重要な第一歩です。
大規模言語モデル(LLM)をすべてのクレームに対して実行することは、コストがかかり、レイテンシが抑えられるが、より小さなモデルでは精度が犠牲になる。
本稿では,予測パワー推論(PPI)のポイントワイド拡張であるNN-PPIを提案する。
NN-PPIはベースラインモデルのサイズと性能に応じて12%から33.80%の重み付けF1ゲインを達成する。
NN-PPIは、数発のSLM以外にも、生産段階の微調整モデルをさらに改善し、残留キャリブレーションが監督された微調整の補完となることを示した。
LLMレベルの精度を最高級に安価に提供できるモデルから回復させることで、大規模に運用する上で、精度の高いチェック可視性検出を極めて安価に行うことができる。
コードとデータはhttps://anonymous.4open.science/r/arr-claim-worthiness-F237で確認できます。
関連論文リスト
- S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activations [30.145244497712792]
大規模変圧器モデルにおける活性化アウトレイアは、量子化をモデル化するための根本的な課題である。
本稿では,最大特異値に対応する重量成分のみを外科的に正規化する幾何学的条件付け法であるS2D$(Selective Spectral Decay)を提案する。
我々は、S2D$がアクティベーションアウトリーを著しく減らし、本質的に量子化に親しみやすい条件付き表現を生成することを示した。
論文 参考訳(メタデータ) (2026-02-16T03:41:06Z) - An Extra RMSNorm is All You Need for Fine Tuning to 1.58 Bits [0.0]
トレーニング後の量子化はメモリと計算を減少させるが、しばしば精度を低下させる。
三進法(2ビット)に量子化をプッシュすると、さらに大きな貯蓄が得られるが、非常に不安定である。
私たちのアプローチは、標準的な言語モデリングベンチマークにおいて、より精巧な知識蒸留パイプラインに適合するか、超越しています。
論文 参考訳(メタデータ) (2025-05-12T21:14:29Z) - S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning [51.84977135926156]
S$2$Rはモデルに推論時の自己検証と自己正当性を教えることによってLLM推論を強化する効率的なフレームワークである。
以上の結果から,Qwen2.5-math-7Bの精度は51.0%から81.6%に向上した。
論文 参考訳(メタデータ) (2025-02-18T13:40:22Z) - RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models [53.571195477043496]
本稿では,RoSTE (Rotated Straight-Through-Estimator) というアルゴリズムを提案する。
RoSTEは、量子化を意識した微調整(QA-SFT)と適応的な回転戦略を組み合わせることで、アクティベーションアウトリーを減少させる。
その結果, 予測誤差は収束重みの量子化誤差と直接比例し, 最適化された回転構成により効果的に管理できることが判明した。
論文 参考訳(メタデータ) (2025-02-13T06:44:33Z) - Low-rank finetuning for LLMs: A fairness perspective [54.13240282850982]
低ランク近似技術は、微調整された大規模言語モデルのデファクトスタンダードとなっている。
本稿では,これらの手法が初期訓練済みデータ分布から微調整データセットのシフトを捉える上での有効性について検討する。
低ランク微調整は好ましくない偏見や有害な振る舞いを必然的に保存することを示す。
論文 参考訳(メタデータ) (2024-05-28T20:43:53Z) - LitCab: Lightweight Language Model Calibration over Short- and Long-form
Responses [14.77013588561901]
本稿では,入力テキストの表現とバイアス項の予測を行う単一線形層からなる軽量キャリブレーション機構LitCabを提案する。
評価のために、8つのテキスト生成タスクからなるベンチマークであるCaTを構築し、短いフレーズから段落までの応答をカバーする。
Llama2-7BでLitCabをテストし、すべてのタスクのキャリブレーションを改善し、平均ECEスコアを最大30%削減する。
論文 参考訳(メタデータ) (2023-10-30T00:30:34Z) - nanoLM: an Affordable LLM Pre-training Benchmark via Accurate Loss Prediction across Scales [65.01417261415833]
我々は,最大更新パラメトリゼーション(muP)がスケーリング法則の正確な適合を可能にするという観測に基づいて,事前学習損失を予測する手法を提案する。
トレーニング前コストの約14%で、52Bまでのモデルの損失を正確に予測できる。
NanoLMのゴールは、限られた資源を持つ研究者が大きなモデルで有意義な結論に達することを可能にすることです。
論文 参考訳(メタデータ) (2023-04-14T00:45:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。