論文の概要: Evaluating Decision Models for Text Annotation in Computational Social Science
- arxiv url: http://arxiv.org/abs/2609.24574v2
- Date: Wed, 23 Sep 2026 08:36:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.669177
- Title: Evaluating Decision Models for Text Annotation in Computational Social Science
- Title(参考訳): 計算社会科学におけるテキストアノテーション決定モデルの評価
- Abstract要約: 決定モデルは、選択された型付き質問、ラベルセット上の確率分布、自由テキストよりも信頼スコアに答える。
最初の商用決定モデルと2つのオープンウェイトな決定モデルと、19のフロンティアとオープンウェイトな言語モデルを比較します。
我々の結果は、決定モデルがアノテーションパイプラインの第一歩として有用であることを示唆している。
- 参考スコア(独自算出の注目度): 0.7792020418343021
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computational social science increasingly relies on large language models for text annotation, and the validity of published findings now rests on the labels generated by such models. Decision models, a new model class built for categorical question answering, answer typed questions with a choice, a probability distribution over the label set, and a confidence score rather than free text, at a small fraction of frontier inference prices. Whether their answers are accurate, and whether that stated confidence can be trusted on social science constructs, are unknown. Here, we mirror the evaluation of Ziems et al. (2024) on 18 computational social science classification tasks (7,977 items), comparing the first commercial decision model and two open-weight counterparts against 19 frontier and open-weight language models under the same zero-shot protocol, and extending the decision-model comparison to eleven open-weight systems released in the week after it. The decision model trails the per-task best LLM on 14 of 15 evaluation tasks, with a median deficit of 11.6 macro-F1 points, at a median 44 times lower measured cost. Its confidence is better calibrated than the verbalized confidence of 16 of the 19 LLMs, yet three frontier models show lower median calibration error (0.157 against 0.066). While items above 0.9 confidence are typically labeled accurately (median accuracy 0.815), on one task, empathy in peer-support dialogues, the model reports high confidence while performing near chance. Nonetheless, our results suggest that decision models are useful as a first step in the annotation pipeline: routing low-confidence items to an LLM matches or exceeds the LLM alone at a quarter to half of its cost.
- Abstract(参考訳): 計算社会科学は、テキストアノテーションのための大きな言語モデルにますます依存しており、公表された発見の妥当性は、そのようなモデルによって生成されたラベルに依存している。
決定モデル(Decision model)は、カテゴリー的質問応答のために構築された新しいモデルクラスで、選択された型付き質問に答え、ラベルセット上の確率分布、自由テキストよりも信頼度スコアを、フロンティア推論価格のごく一部で答える。
彼らの答えが正確かどうか、そして、その自信が社会科学の構成要素に信頼できるかどうかは不明である。
ここでは、Ziems et al (2024) を18個の計算社会科学分類タスク (7,977項目) で評価し、第1の商用決定モデルと第2のオープンウェイト決定モデルを比較し、第19のフロンティアおよびオープンウェイト言語モデルとを同一のゼロショットプロトコルで比較し、決定モデルの比較を、その1週間後にリリースされた11のオープンウェイトシステムに拡張する。
この決定モデルは15のタスクのうち14のタスクにおいて、平均44倍のコストで11.6マクロF1ポイントの損失を被る。
信頼度は19のLLMのうち16の言語化信頼度よりも高いが、3つのフロンティアモデルでは中央値のキャリブレーション誤差が低い(0.066対0.157対0.066)。
0.9の信頼度以上の項目は、通常、正確にラベル付けされるが(中間精度0.815)、一方のタスクでは、ピアサポート対話に共感するが、モデルでは、近い確率で実行しながら高い信頼度を報告している。
しかしながら,本研究の結果から,低信頼度項目をLLMにルーティングする,あるいはLPMを1/4から半分のコストで超過するという,アノテーションパイプラインの第一歩として決定モデルが有用であることが示唆された。
関連論文リスト
- Pinocchio: Fast Uncertainty Estimates for Black-Box Language Models [73.50370994588927]
ブラックボックスAPIモデルから応答の正しさを推定する外部キャリブレータであるPinocchioを紹介する。
我々のモデルは、不確実な推定を生成するために1つのフォワードパスしか必要とせず、ターゲットモデルのロジット、重み、または内部状態へのアクセスを必要としない。
論文 参考訳(メタデータ) (2026-09-21T16:48:50Z) - The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads [0.9743693761871391]
ステレオタイプ,反ステレオタイプ,中立プロファイル間でバランスの取れた150人の人物からなるMirrageBenchを紹介した。
オーバー推論は広範に行われており、12モデルのうち1モデルがオーバー推論の35%から49%を占めている。
MirageBenchは、信頼性の高い個人化のための信頼性の高い基盤として、モデル自己報告ではなく、外部検証を位置付けている。
論文 参考訳(メタデータ) (2026-08-05T08:00:54Z) - Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models [0.0]
15の家系にまたがる41のオープンウェイト言語モデルと135M--9Bパラメータ範囲の体系的ゼロショット評価を行った。
我々は,信頼性キャリブレーション,現実的な入力摂動に対する堅牢性,モデルランキングの統計的信頼性,デプロイメント効率,ベンチマーク飽和度を分析した。
これらの知見は、意図分類のためのオープンウェイト言語モデルの選択と評価のための実践的なガイダンスを提供する。
論文 参考訳(メタデータ) (2026-07-29T19:42:33Z) - The Score Granularity Gap in Black-Box LLM Classification: A Comparative Study of Confidence Constructions [2.5613469613039075]
単発の言語化された信頼度は驚くほど高いが、いくつかの異なる価値しか持たないことを示す。
どの構造がこのギャップを広げるか、どの推論コスト、ランキングにどのような影響があるかを示す。
これらのトレードオフを具体的なデプロイメントガイダンスに変換します。
論文 参考訳(メタデータ) (2026-06-20T18:20:43Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - Reliable Decision Support with LLMs: A Framework for Evaluating Consistency in Binary Text Classification Applications [0.7124971549479361]
本研究では,大言語モデル(LLM)のバイナリテキスト分類における一貫性を評価するフレームワークを提案する。
我々は,サンプルサイズ要件を定め,不適切な応答の指標を開発し,レータ内およびレータ間信頼性を評価する。
論文 参考訳(メタデータ) (2025-05-20T21:12:58Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Llamas Know What GPTs Don't Show: Surrogate Models for Confidence
Estimation [70.27452774899189]
大規模言語モデル(LLM)は、ユーザを誤解させるのではなく、不正な例に対して低い信頼を示さなければならない。
2023年11月現在、最先端のLLMはこれらの確率へのアクセスを提供していない。
言語的信頼度と代理モデル確率を構成する最良の方法は、12データセットすべてに対して最先端の信頼度推定を与える。
論文 参考訳(メタデータ) (2023-11-15T11:27:44Z) - Holistic Evaluation of Language Models [183.94891340168175]
言語モデル(LM)は、ほとんどすべての主要言語技術の基盤となっているが、その能力、制限、リスクはよく理解されていない。
本稿では,言語モデルの透明性を向上させるために,言語モデルの完全性評価(HELM)を提案する。
論文 参考訳(メタデータ) (2022-11-16T18:51:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。