論文の概要: Simulating Meaning, Nevermore! Introducing ICR: A Semiotic-Hermeneutic Metric for Evaluating Meaning in LLM Text Summaries
- arxiv url: http://arxiv.org/abs/2603.04413v1
- Date: Tue, 03 Feb 2026 18:05:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-09 01:20:08.190456
- Title: Simulating Meaning, Nevermore! Introducing ICR: A Semiotic-Hermeneutic Metric for Evaluating Meaning in LLM Text Summaries
- Title(参考訳): 意味をシミュレートする! ICRの導入
- Authors: Natalie Perez, Sreyoshi Bhaduri, Aman Chadha,
- Abstract要約: 本稿では,大言語モデル(LLM)生成言語における意味を研究するための学際的枠組みを提案する。
本稿では,言語記号が静的および文脈的埋め込みモデルにおいて,ベクトル化表現にどのように変換されるかを検討する。
次に、LCM出力における意味的精度と意味的アライメントを評価するために設計されたICR(Inductive Conceptual Rating)メトリクスを紹介する。
- 参考スコア(独自算出の注目度): 13.104408059072457
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Meaning in human language is relational, context dependent, and emergent, arising from dynamic systems of signs rather than fixed word-concept mappings. In computational settings, this semiotic and interpretive complexity complicates the generation and evaluation of meaning. This article proposes an interdisciplinary framework for studying meaning in large language model (LLM) generated language by integrating semiotics and hermeneutics with qualitative research methods. We review prior scholarship on meaning and machines, examining how linguistic signs are transformed into vectorized representations in static and contextualized embedding models, and identify gaps between statistical approximation and human interpretive meaning. We then introduce the Inductive Conceptual Rating (ICR) metric, a qualitative evaluation approach grounded in inductive content analysis and reflexive thematic analysis, designed to assess semantic accuracy and meaning alignment in LLM-outputs beyond lexical similarity metrics. We apply ICR in an empirical comparison of LLM generated and human generated thematic summaries across five datasets (N = 50 to 800). While LLMs achieve high linguistic similarity, they underperform on semantic accuracy, particularly in capturing contextually grounded meanings. Performance improves with larger datasets but remains variable across models, potentially reflecting differences in the frequency and coherence of recurring concepts and meanings. We conclude by arguing for evaluation frameworks that leverage systematic qualitative interpretation practices when assessing meaning in LLM-generated outputs from reference texts.
- Abstract(参考訳): 人間の言語における意味は、関係性、文脈依存、創発的であり、固定された単語概念マッピングではなく、記号の動的なシステムから生じる。
計算環境において、この半論理的・解釈的複雑性は意味の生成と評価を複雑にする。
本稿では,セミオティックスとヘミニューティクスを質的研究手法に統合することにより,大規模言語モデル(LLM)生成言語における意味を研究するための学際的枠組みを提案する。
本稿では,言語記号が静的および文脈的埋め込みモデルにおけるベクトル化表現にどのように変換されるか,および統計的近似と人間の解釈的意味のギャップを明らかにする。
次に,帰納的概念レーティング(ICR)尺度,帰納的内容分析と回帰的テーマ解析に基づく質的評価手法を導入し,語彙的類似性指標を超えてLLM出力の意味的精度と意味的アライメントを評価する。
ICRを5つのデータセット(N = 50 - 800)にわたるLLM生成と人間生成のテーマ要約の実証的な比較に応用する。
LLMは高い言語的類似性を達成する一方で、意味的正確性、特に文脈的に基礎付けられた意味を捉える際には、性能が劣る。
より大きなデータセットではパフォーマンスが向上するが、モデル間では変わらず、繰り返し発生する概念と意味の頻度と一貫性の違いを反映している可能性がある。
我々は,LLM生成した参照テキストからの意味を評価する際に,体系的な定性的解釈の実践を活用する評価フレームワークについて論じる。
関連論文リスト
- SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation [55.26111461168754]
本稿では,文レベルの意味理解とキーワードレベルの意味理解と簡単なキーワードマッチングを組み合わせた新しいアプローチであるSemantic Metric Integrating Lexical Exactnessを紹介する。
人間の判断と計算学的に軽量であり、語彙的評価と意味的評価のギャップを埋める。
論文 参考訳(メタデータ) (2025-11-21T17:30:18Z) - Framework for Machine Evaluation of Reasoning Completeness in Large Language Models For Classification Tasks [0.0]
本稿では、説明の完全性のためのRAS-Reasoning Alignmentを紹介する。
我々は,広く使用されている4つのテキスト分類データセット,WIKI ONTOLOGY, AG NEWS, IMDB, GOEMOTIONSを分析した。
正解予測はサポート特徴のカバレッジが高く,正解予測は矛盾する特徴のカバレッジの増大と関連していることを示す。
論文 参考訳(メタデータ) (2025-10-23T20:22:22Z) - Evaluating book summaries from internal knowledge in Large Language Models: a cross-model and semantic consistency approach [0.0]
本研究では,大規模言語モデル(LLM)を用いて,包括的かつ正確な書籍要約を生成する能力について検討する。
これらのモデルが、確立された人間の解釈と一致した有意義な物語を合成できるかどうかを検討する。
論文 参考訳(メタデータ) (2025-03-27T15:36:24Z) - Categorical Syllogisms Revisited: A Review of the Logical Reasoning Abilities of LLMs for Analyzing Categorical Syllogism [62.571419297164645]
本稿では,分類的シロジズムを解析するための大規模言語モデルの論理的推論能力に関する先行研究を体系的に概説する。
まず、純粋に論理的な観点から分類的シロジズムの可能なバリエーションについて検討する。
次に、既存のデータセットでテストされた基本的な設定(ムードとフィギュア)を調べます。
論文 参考訳(メタデータ) (2024-06-26T21:17:20Z) - Vocabulary-Defined Semantics: Latent Space Clustering for Improving In-Context Learning [32.178931149612644]
コンテキスト内学習により、言語モデルは下流のデータに適応したり、プロンプト内のデモとして少数のサンプルでタスクを組み込むことができる。
しかし、文脈内学習のパフォーマンスは、実演の質、形式、順序によって不安定である可能性がある。
語彙定義意味論(vocabulary-defined semantics)を提案する。
論文 参考訳(メタデータ) (2024-01-29T14:29:48Z) - Bias and Fairness in Large Language Models: A Survey [73.87651986156006]
本稿では,大規模言語モデル(LLM)のバイアス評価と緩和手法に関する総合的な調査を行う。
まず、自然言語処理における社会的偏見と公平性の概念を統合し、形式化し、拡張する。
次に,3つの直感的な2つのバイアス評価法と1つの緩和法を提案し,文献を統一する。
論文 参考訳(メタデータ) (2023-09-02T00:32:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。