論文の概要: Quantifying the Affective Gap: A Zero-Shot Evaluation of LLMs on Fine-Grained Emotion Taxonomies
- arxiv url: http://arxiv.org/abs/2607.00968v1
- Date: Wed, 01 Jul 2026 14:04:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.927244
- Title: Quantifying the Affective Gap: A Zero-Shot Evaluation of LLMs on Fine-Grained Emotion Taxonomies
- Title(参考訳): 感情ギャップの定量化:微粒な感情分類におけるLDMのゼロショット評価
- Authors: Lawrence Obiuwevwi, Krzysztof J. Rechowicz, Jessica M. Johnson, Vikas Ashok, Sachin Shetty, Sampath Jayarathna,
- Abstract要約: 本稿では、3つの主要な商用大言語モデルの厳密で統一的なゼロショット評価について述べる。
ジェミニは最高精度(39.9%)、マクロF1スコア(0.363)、続いてGPT-5.4(38.8%、マクロF1 = 0.291)、クロード(38.0%、マクロF1 = 0.159)を達成している。
すべてのモデルは、愛、混乱、恥に一貫して失敗しながら、皮肉と欲求に長けている。
- 参考スコア(独自算出の注目度): 6.312490225874122
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Emotion recognition in natural language is a foundational challenge in affective computing, with critical implications for human-computer interaction, mental health support, and conversational AI. This paper presents a rigorous, unified zero-shot evaluation of three leading commercial large language models: Claude (claude-sonnet-4-6), ChatGPT (GPT-5.4), and Gemini (gemini-2.5-flash). The models were queried through their respective production APIs as of April 2026 on a fine-grained 13-class emotion classification task. Using a stratified 1,000-sentence sample from the boltuix/emotions dataset, which comprises 131,306 sentences across 13 categories, a single uniform prompt with no exemplars was applied identically across all models. Gemini achieves the highest accuracy (39.9%) and macro-F1 score (0.363), followed by GPT-5.4 (38.8%, macro-F1 = 0.291) and Claude (38.0%, macro-F1 = 0.159). All models excel on sarcasm and desire while consistently failing on love, confusion, and shame. McNemar tests reveal no statistically significant pairwise differences (p > 0.10), suggesting convergence at a shared zero-shot ceiling. Claude's markedly lower macro-F1 score exposes a class-imbalance prediction bias. These findings highlight the current limitations of frontier AI systems in zero-shot fine-grained emotion classification.
- Abstract(参考訳): 自然言語における感情認識は、人間とコンピュータの相互作用、メンタルヘルスサポート、会話型AIに重要な意味を持つ、感情的コンピューティングにおける基礎的な課題である。
本稿では,Claude (Claude-sonnet-4-6), ChatGPT (GPT-5.4), Gemini (gemini-2.5-flash) の3つの主要な商用大言語モデルの厳密で統一的なゼロショット評価について述べる。
モデルは2026年4月時点でそれぞれのプロダクションAPIを通じて、きめ細かい13クラスの感情分類タスクでクエリされた。
13のカテゴリーにまたがる131,306文からなるボルトゥイクス/感情データセットから成層化1000文のサンプルを用いて、すべてのモデルで前例のない単一の一様プロンプトを同一に適用した。
ジェミニは最高精度(39.9%)、マクロF1スコア(0.363)、GPT-5.4スコア(38.8%、マクロF1 = 0.291)、クロード(38.0%、マクロF1 = 0.159)を達成している。
すべてのモデルは、愛、混乱、恥に一貫して失敗しながら、皮肉と欲求に長けている。
マクネマール試験では統計的に有意な対差は示さず(p > 0.10)、共有ゼロショット天井での収束を示唆している。
ClaudeのマクロF1スコアが著しく低いことは、クラス不均衡予測バイアスを露呈する。
これらの結果は、ゼロショットのきめ細かい感情分類におけるフロンティアAIシステムの現在の限界を浮き彫りにしている。
関連論文リスト
- Benchmarking Frontier LLMs on Arabic Cultural and Sociolinguistic Knowledge: A Cross-Evaluation Framework with Human SME Ground Truth [0.34797121357690153]
クロス評価フレームワークは、エジプト語とイラク語という2つの未表現のアラビア語方言のコミュニティをインスタンス化した。
提案手法は,母国語話者が作成した103組のプロンプト・ルブリックペアをコントリビュートする。
1,307人の審査員: GPT-5.4は最も信頼できる裁判官(MADj = 10.21 pp, Signed Error = -1.12%)である。
論文 参考訳(メタデータ) (2026-06-30T20:18:32Z) - Majority Vote Silences Minority Values: Annotator Disagreement at the Hate/Offensive Boundary in HateXplain [0.0]
ヘイトスピーチアノテーションパイプラインは、アノテータの不一致をトレーニング前に多数投票ラベルに分解する。
この集合が中立ではないことを示す。
高度化のための下流3つの介入は、すべて境界精度の回復に失敗する。
論文 参考訳(メタデータ) (2026-06-27T06:56:07Z) - Long Live Fine-Tuning: Task-Specific Transformers Outperform Zero-Shot LLMs for Misinformation Response Classification on Reddit [5.437038443632133]
我々は,誤情報談話の微妙な分類にスケールと一般能力が十分であるという暗黙の仮定を検証した。
BART-MNLI、3つのLlama変種、3つの商用フロンティアLLM、微調整されたDistilBERTとRoBERTaの9つのモデルを比較した。
検証のコンテキストでは、欠落した信念がコストの低いエラーである場合、タスク固有の微調整の方がより信頼性の高い選択である。
論文 参考訳(メタデータ) (2026-06-02T22:58:59Z) - Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality? [74.69723255239663]
グラウンドド・パーソナリティ・推論は、MLLMがそれぞれのビッグファイブ・格付けを、評価、推論、根拠の連鎖を通じて観察可能な証拠に固定することを要求する。
MM-OCEANは、人間の検証によるマルチエージェントパイプラインによって生成され、タイムスタンプによる行動観察、エビデンスに基づく特性分析、およびキューグラウンドMCQの7つのカテゴリがある。
この分析では、フィールド全体にわたって、正しい評価の51%が取得された手がかりに基づかず、ホリスティック・ギャラリング・レートは0-33.5%にしか達していないという顕著な偏見のギャップが明らかになった。
論文 参考訳(メタデータ) (2026-05-21T07:42:47Z) - The Rise of Verbal Tics in Large Language Models: A Systematic Analysis Across Frontier Models [12.320824168302908]
本研究では,8つの言語モデル(LLM)の言語性現象を体系的に解析する。
本研究は,VTI (Verbal Tic Index) を用いて, 梅毒の有病率を定量化し, 梅毒, 語彙の多様性, 人間の知覚する自然性との相関を解析した。
論文 参考訳(メタデータ) (2026-04-21T06:43:01Z) - BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models [4.264192013842096]
大きな言語モデル(LLM)は、標準ベンチマークで印象的なスコアを得るが、人間が数秒で正しく答えられるような質問を日常的に失敗する。
BrainBenchは、慎重に設計された20のカテゴリにまたがる100のブレインティーザー質問のベンチマークです。
論文 参考訳(メタデータ) (2026-03-16T02:50:43Z) - Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models [81.62767292169225]
我々は,その一般化に着目して,大規模言語モデルにおける知識の忘れについて検討する。
確率摂動に基づく新しいアンラーニングパラダイムであるPerMUを提案する。
TOFU、Harry Potter、ZsRE、WMDP、MUSEなど、さまざまなデータセットで実験が行われている。
論文 参考訳(メタデータ) (2025-02-27T11:03:33Z) - CausalDiff: Causality-Inspired Disentanglement via Diffusion Model for Adversarial Defense [61.78357530675446]
人間は、本質的な要因のみに基づいて判断するので、微妙な操作によって騙されるのは難しい。
この観察に触発されて、本質的なラベル因果因子を用いたラベル生成をモデル化し、ラベル非因果因子を組み込んでデータ生成を支援する。
逆の例では、摂動を非因果因子として識別し、ラベル因果因子のみに基づいて予測することを目的としている。
論文 参考訳(メタデータ) (2024-10-30T15:06:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。