論文の概要: A Repeated-Measurement Study for Cultural Analytics of English Song Lyrics Using Five Large Language Models
- arxiv url: http://arxiv.org/abs/2609.04428v1
- Date: Thu, 03 Sep 2026 19:49:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.806806
- Title: A Repeated-Measurement Study for Cultural Analytics of English Song Lyrics Using Five Large Language Models
- Title(参考訳): 五大言語モデルを用いた英語歌詞の文化分析の繰り返し測定
- Abstract要約: 本研究は,5つの大言語モデル (LLM) を,英語の歌詞で表される4つの社会的構成要素のゼロショットアノテータとして評価する。
LLM測定の3つの特性について検討し, 繰り返し実行間の一貫性, モデル間の収束, 教師付き分類へのコンセンサスラベルの転送可能性について検討した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used to annotate cultural texts at scales that are impractical for human coders. However, before their outputs are treated as measurements of latent social constructs, it is necessary to establish whether those measurements are reliable. This study evaluates five LLMs as zero-shot annotators of four social constructs expressed in English song lyrics: self-esteem, self-control, seeking belonging, and seeking recognition. Using repeated annotations of a large lyric corpus, we examine three properties of LLM-based measurement: consistency across repeated runs, convergence across models, and transferability of consensus labels to supervised classification. The findings show that LLM-based measurement is not uniformly reliable across constructs. Self-esteem exhibits the strongest repeated-measurement reliability across models, while seeking recognition is generally less stable; self-control and seeking belonging show intermediate but model-dependent reliability. Downstream classification further indicates that consensus LLM labels contain learnable signal, although transferability does not itself establish construct validity. Repeated-measurement stability and cross-model convergence should therefore be reported before LLM annotations are treated as scalable measurements in cultural analytics.
- Abstract(参考訳): 大規模言語モデル(LLM)は、人間のプログラマにとって実用的でない規模の文化的テキストに注釈をつけるために、ますます使われてきている。
しかし,そのアウトプットが潜伏する社会構造の測定として扱われる前に,これらの測定が信頼できるかどうかを確かめる必要がある。
本研究は, 自尊心, 自制心, 自尊心, 自尊心, 認識を求める4つの社会的構成要素のゼロショットアノテータとして, 5つのLDMを評価した。
大規模歌詞コーパスの繰り返しアノテーションを用いて,LLM測定の3つの特性について検討した。
以上の結果から,LLMによる測定は構造全体にわたって均一に信頼性が低いことが示唆された。
自己評価は、モデル間で最も高い繰り返し測定信頼性を示す一方で、認識を求めることは一般的には安定ではない。
下流分類では、LLMラベルには学習可能な信号が含まれているが、転送可能性自体が構成妥当性を確立するわけではない。
したがって、LCMアノテーションを文化的分析におけるスケーラブルな測定として扱う前に、繰り返し測定安定性とクロスモデル収束を報告すべきである。
関連論文リスト
- Evaluation of Contextual Understanding in Large Language Models [0.8150815269284862]
大規模言語モデル(LLM)は多様なNLPタスクにまたがって優れた性能を示すが、実際の文脈理解を示す能力は未だ不明である。
パープレキシティ(perplexity)やバイリンガル評価(BiLingual Evaluation Understudy、BLEU)、表面レベルの精度といった従来の評価指標では、LLMが文脈情報をどのように抽出し、統合し、推論するかは明らかになっていない。
KGのセマンティック構造類似性を導入した知識グラフに基づく新しい評価フレームワーク(S3KG)を提案する。
論文 参考訳(メタデータ) (2026-09-08T16:41:50Z) - Can LLMs Use Linguistic Uncertainty Markers to Reliably Reflect Intrinsic Confidence? [50.17126900886782]
モデルが、安定かつ一般化可能な方法でマーカーと特定の信頼レベルを関連付けるために、独自の言語的信頼フレームワークを適用できるかどうかは不明である。
我々は,与えられたタスク領域において,モデルが特定のてんかんマーカーと関連付ける内在的信頼度として,_marker internal confidence_(MIC)を定式化する。
分析フレームワークを多種多様なモデルやタスクに適用すると、LLMはマーカーの意味のモデル中心の解釈の下でも、忠実に誤解される。
論文 参考訳(メタデータ) (2026-05-27T17:38:00Z) - Learning to Judge: LLMs Designing and Applying Evaluation Rubrics [18.936553687978087]
大規模言語モデル (LLM) は、自然言語生成のための評価器としてますます使われている。
GER-Evalを導入し,LLMが独自の評価ルーブリックを設計および適用できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-02-09T13:56:06Z) - A Critical Study of Automatic Evaluation in Sign Language Translation [17.083206782232185]
テキストベースのメトリクスが手話変換(SLT)の出力の質を確実に捉えることができるかは、まだ不明である。
BLEU, chrF, ROUGE, BLEURT, G-Eval や GEMBA などの大規模言語モデルに基づく評価器の6つの指標を解析した。
論文 参考訳(メタデータ) (2025-10-29T11:57:03Z) - Reranking-based Generation for Unbiased Perspective Summarization [10.71668103641552]
我々は,人間のアノテーションを用いて,計量信頼性をベンチマークするテストセットを開発した。
従来の指標は言語モデルに基づく指標に比べて性能が低いことが示され、強力な評価指標であることが証明された。
本研究の目的は,視点要約手法の信頼性評価と開発に寄与することである。
論文 参考訳(メタデータ) (2025-06-19T00:01:43Z) - MetaFaith: Faithful Natural Language Uncertainty Expression in LLMs [66.14178164421794]
メタファイト(MetaFaith)は、ヒトのメタ認知に触発された新規なプロンプトベースのキャリブレーション手法である。
MetaFaithは多種多様なモデルやタスク領域における忠実なキャリブレーションを強力に改善し、忠実度を最大61%向上させることができることを示す。
論文 参考訳(メタデータ) (2025-05-30T17:54:08Z) - Value Compass Benchmarks: A Platform for Fundamental and Validated Evaluation of LLMs Values [76.70893269183684]
大きな言語モデル(LLM)は驚くべきブレークスルーを達成する。
価値を人間に合わせることは 責任ある開発に欠かせないものになっています
3つの望ましい目標を達成するLLMの評価はいまだに欠けている。
論文 参考訳(メタデータ) (2025-01-13T05:53:56Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Evaluation of Faithfulness Using the Longest Supported Subsequence [52.27522262537075]
本稿では,文脈によって支持される請求項の最長不連続性を計算し,機械生成テキストの忠実さを評価する新しい手法を提案する。
新しい人間アノテーション付きデータセットを使用して、モデルを微調整してLongest Supported Subsequence(LSS)を生成する。
提案手法は,我々のデータセットの忠実度に対する最先端のメトリクスよりも18%向上していることを示す。
論文 参考訳(メタデータ) (2023-08-23T14:18:44Z) - Semantic Consistency for Assuring Reliability of Large Language Models [9.040736633675136]
大規模言語モデル(LLM)は、様々な自然言語タスクに対して顕著な流布と能力を示す。
セマンティック一貫性の一般的な尺度を導入し、様々なLLMの性能を評価するために、この指標の複数バージョンを定式化する。
本稿では,Ask-to-Choose (A2C) と呼ばれる新しいプロンプト戦略を提案する。
論文 参考訳(メタデータ) (2023-08-17T18:11:33Z) - Bring Your Own Data! Self-Supervised Evaluation for Large Language
Models [52.15056231665816]
大規模言語モデル(LLM)の自己教師型評価のためのフレームワークを提案する。
閉書知識,毒性,長期文脈依存性を測定するための自己指導型評価戦略を実証する。
自己監督評価と人監督評価との間には強い相関関係が認められた。
論文 参考訳(メタデータ) (2023-06-23T17:59:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。