論文の概要: Assessing and Mitigating Miscalibration in LLM-Based Social Science Measurement
- arxiv url: http://arxiv.org/abs/2605.11954v1
- Date: Tue, 12 May 2026 11:06:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.811538
- Title: Assessing and Mitigating Miscalibration in LLM-Based Social Science Measurement
- Title(参考訳): LLMを用いた社会科学計測におけるミススキャリブレーションの評価と緩和
- Authors: Jinyuan Wang, Ningyuan Deng, Yi Yang,
- Abstract要約: 大規模言語モデル(LLM)は、スケーラブルな測定ツールとして社会科学でますます使われている。
本稿では, LLMを用いた社会科学測定におけるモデル誤校正について検討する。
- 参考スコア(独自算出の注目度): 10.552494876804511
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly used in social science as scalable measurement tools for converting unstructured text into variables that can enter standard empirical designs. Measurement validity demands more than high average accuracy, which requires well calibrated confidence that faithfully reflects the empirical probability of each measurement being correct. This paper studies the model miscalibration in LLM-based social science measurement. We begin with a case study on FOMC and show that confidence based filtering can change downstream regression estimates when LLM confidence is miscalibrated. We then audit calibration across 14 social science constructs covering both proprietary models, including GPT-5-mini, DeepSeek-V3.2, and open source models. Across tasks and model families, reported confidence is poorly aligned with tolerance-based correctness. As a simple mitigation, we propose a soft label distillation pipeline for calibrating Bert with LLM. The method converts an LLM score and its verbalized confidence into a soft target distribution, then trains a smaller discriminative classifier on encoder models for these targets. Averaged across datasets, this approach reduces ECE by 43.2\% and Brier by 34.0\%. These results suggest that LLM-based social science pipelines should treat calibration as part of measurement validity, rather than as an optional post-processing concern.
- Abstract(参考訳): 大規模言語モデル (LLM) は、非構造化テキストを標準的な経験的設計を入力可能な変数に変換するためのスケーラブルな測定ツールとして、社会科学でますます使われている。
測定精度は高い平均的精度以上のものを必要としており、それぞれの測定が正しいという経験的確率を忠実に反映する精度を十分に調整する必要がある。
本稿では, LLMを用いた社会科学測定におけるモデル誤校正について検討する。
FOMCのケーススタディから始め,LDM信頼度が誤校正された場合,信頼度に基づくフィルタリングが下流回帰推定を変化させることを示す。
次に、GPT-5-mini、DeepSeek-V3.2、オープンソースモデルなど、プロプライエタリモデルの両方をカバーする14の社会科学構成の校正を監査する。
タスクやモデルファミリー全体において、報告された信頼度は、寛容に基づく正しさと不一致である。
簡便な緩和法として, ベルトをLSMで校正するための軟質ラベル蒸留パイプラインを提案する。
LLMスコアとその言語化された信頼度をソフトターゲット分布に変換し、これらのターゲットに対するエンコーダモデル上でより小さな識別的分類器を訓練する。
データセット全体で平均されるこのアプローチは、ECEを43.2\%、Brierを34.0\%削減する。
これらの結果から, LLMを用いた社会科学パイプラインは, 任意の処理後問題としてではなく, キャリブレーションを測定精度の一部として扱うことが示唆された。
関連論文リスト
- On Calibration of Large Language Models: From Response To Capability [66.59139960234326]
大規模言語モデル(LLM)は汎用的な問題解決手段として広くデプロイされている。
本稿では,クエリ上でモデルが期待する精度を目標とするキャリブレーションを提案する。
我々の結果は、キャパシティ校正された信頼度がpass@$k$予測と推論予算割り当てを改善することを示している。
論文 参考訳(メタデータ) (2026-02-14T01:07:45Z) - Generalized Correctness Models: Learning Calibrated and Model-Agnostic Correctness Predictors from Historical Patterns [67.24756301536617]
本稿では,正確で校正された信頼度を推定する一般化精度モデル(GCM)を提案する。
まず,多くのLCMの正当性データに基づいてGCMをトレーニングできることを示す。
次に,CMをレンズとして,補正予測能力の源泉とその一般化について検討する。
論文 参考訳(メタデータ) (2025-09-29T16:19:01Z) - Large Language Model Hacking: Quantifying the Hidden Risks of Using LLMs for Text Annotation [66.84286617519258]
大規模言語モデルは、データアノテーションやテキスト分析といった労働集約的なタスクの自動化を可能にすることで、社会科学の研究を変革している。
このような変異は、系統的なバイアスやランダムなエラーを導入し、下流の分析に伝播し、タイプI(偽陽性)、タイプII(偽陰性)、タイプS(重み付け効果)、タイプM(誇張効果)のエラーを引き起こす。
意図的なLSMハッキングは驚くほど単純であることがわかった。21の社会科学研究から37のデータアノテーションタスクを複製することで、ほんのわずかのプロンプトの言い回しで、事実上何であれ統計的に重要なものとして表現できることがわかりました。
論文 参考訳(メタデータ) (2025-09-10T17:58:53Z) - MetaFaith: Faithful Natural Language Uncertainty Expression in LLMs [66.14178164421794]
メタファイト(MetaFaith)は、ヒトのメタ認知に触発された新規なプロンプトベースのキャリブレーション手法である。
MetaFaithは多種多様なモデルやタスク領域における忠実なキャリブレーションを強力に改善し、忠実度を最大61%向上させることができることを示す。
論文 参考訳(メタデータ) (2025-05-30T17:54:08Z) - Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator [20.81467363927836]
ポストトレーニングされた言語モデル(PoLM)は、しばしば過剰な自信に悩まされ、正しい出力と間違った出力の両方に高い信頼を割り当てる。
PoLMの校正における大きな障害は、個々の下流タスクのためのラベル付きデータの不足である。
本稿では,時間後信頼度校正におけるパラメータを最適化するために,DACA(Disagreement-Aware Confidence Alignment)を提案する。
論文 参考訳(メタデータ) (2025-05-22T13:55:39Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Calibrating Long-form Generations from Large Language Models [34.72041258464477]
大きな言語モデル(LLM)の信頼性スコアは、その応答が正しいという実際の可能性と一致すべきである。
現在の信頼性評価手法とキャリブレーション基準は、応答の正しさを2値の真/偽評価に頼っている。
本稿では,LLMの応答の正しさと関連する信頼度の両方を,様々なスコアの分布として扱う統一校正フレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-09T17:00:32Z) - Localized Calibration: Metrics and Recalibration [133.07044916594361]
完全大域キャリブレーションと完全個別化キャリブレーションのギャップにまたがる細粒度キャリブレーション指標を提案する。
次に,局所再校正法であるLoReを導入し,既存の校正法よりもLCEを改善する。
論文 参考訳(メタデータ) (2021-02-22T07:22:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。