論文の概要: Beyond Acoustic Emotion Recognition: Multimodal Pathos Analysis in Political Speech Using LLM-Based and Acoustic Emotion Models
- arxiv url: http://arxiv.org/abs/2605.22732v1
- Date: Thu, 21 May 2026 17:03:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.361039
- Title: Beyond Acoustic Emotion Recognition: Multimodal Pathos Analysis in Political Speech Using LLM-Based and Acoustic Emotion Models
- Title(参考訳): 音響的感情認識を超えて:LLMモデルと音響的感情モデルを用いた政治音声のマルチモーダルパス解析
- Authors: Juergen Dietrich,
- Abstract要約: 政治音声分析において,音響的感情認識モデルがパス次元のプロキシとして機能するかどうかを検討する。
本稿ではFelix Banaszak による Bundestag plenary speech をケーススタディとして用いた。
以上の結果から,LLMに基づくマルチモーダル分析は,音響モデル単独よりも意味論的に定義された政治的感情を効果的に捉えることが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We investigate whether acoustic emotion recognition models can serve as proxies for the Pathos dimension in political speech analysis, as operationalised by the TRUST multi-agent large language model (LLM) pipeline. Using a Bundestag plenary speech by Felix Banaszak (51 segments, 245 s) as a case study, we compare three analysis modalities: (1) emotion2vec_plus_large, an acoustic speech emotion recognition (SER) model whose continuous Arousal and Valence values are derived via post-hoc Russell Circumplex projection; (2) Gemini 2.5 Flash, an LLM analysing the full speech audio together with its transcript in an open-ended, context-aware fashion; and (3) TRUST-Pathos scores from a three-advocate LLM supervisor ensemble. Spearman rank correlations reveal that Gemini Valence correlates strongly with TRUST-Pathos (rho = +0.664, p < 0.001), whereas emotion2vec Valence does not (rho = +0.097, p = 0.499). We further demonstrate, via a systematic quality evaluation of the Berlin Database of Emotional Speech (EMO-DB) using Gemini in an open-ended annotation paradigm, that standard SER benchmark corpora suffer from acted speech, cultural bias, and category incompatibility. Our results suggest that LLM-based multimodal analysis captures semantically defined political emotion substantially better than acoustic models alone, while acoustic features remain informative for low-level Arousal estimation. Future work will extend this approach to video-based analysis incorporating facial expression and gaze.
- Abstract(参考訳): 本稿では,TRUST多エージェント大言語モデル(LLM)パイプラインを用いて,音声感情認識モデルが政治音声分析におけるパス次元のプロキシとして機能するかどうかを検討する。
本稿では,Felix Banaszak(51セグメント,245秒)によるBundestag Plenary Speech(51セグメント),(1)感情2vec_plus_large(SER)モデル,(2)ArousalおよびValence値がポストホックRussell Circumplex projectionによって導出される音響的感情認識(SER)モデル,(2)Gemini 2.5 Flash(LLM)モデル,(3)TRUST-Pathosスコア(LLM)モデル,の3つを比較した。
スピアマンのランク相関は、ジェミニ・ヴァレンスがTRUST-Pathos(rho = +0.664, p < 0.001)と強く相関しているのに対し、感情2ベック・ヴァレンス(rho = +0.097, p = 0.499)は相関しないことを示している。
さらに、Geminiを用いたベルリン感情音声データベース(EMO-DB)のオープンアノテーションパラダイムによる体系的品質評価を通じて、標準SERベンチマークコーパスは、行動音声、文化バイアス、カテゴリー非互換性に悩まされていることを実証した。
以上の結果から,LLMに基づくマルチモーダル分析は音響モデル単独よりも意味論的に定義された政治的感情を捉え,低レベルの覚醒度推定には音響的特徴が有用であることが示唆された。
今後の研究は、このアプローチを、表情と視線を取り入れたビデオベースの分析に拡張する予定である。
関連論文リスト
- ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools -- From Consensus Learning to Ambiguity-Driven Emotion Reasoning [67.22219034602514]
ADEPT(Agentic Decoding of Emotion via Evidence Probing Tools)は,感情認識をマルチターン探索プロセスとして再構成するフレームワークである。
ADEPTはSLLMを進化する候補感情を維持するエージェントに変換し、専用のセマンティックおよび音響探査ツールを適応的に呼び出す。
ADEPTは、ほとんどの設定において主感情の精度を向上し、微妙な感情の特徴を著しく改善することを示した。
論文 参考訳(メタデータ) (2026-02-13T08:33:37Z) - Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play [68.54773980519457]
Speech-DRAMEは3つのレベルで貢献する統合フレームワークである。
音声ロールプレイを評価するための、最初の包括的で再現可能な基盤を提供する。
論文 参考訳(メタデータ) (2025-11-03T06:12:40Z) - Benchmarking Contextual and Paralinguistic Reasoning in Speech-LLMs: A Case Study with In-the-Wild Data [46.12417789276609]
音声-LLMは、書き起こしや翻訳といったタスクにおいて顕著なパフォーマンスを示してきたが、社会的および感情的な知性に不可欠な音声のパラ言語的側面を理解することにはまだ限界がある。
文脈パラ言語推論における音声LLMの評価のためのベンチマークであるCP-Benchを提案する。
論文 参考訳(メタデータ) (2025-09-20T09:26:40Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement [74.51476422119457]
音声音声合成(S2S)大規模言語モデル(LLM)は、人間とコンピュータの自然な相互作用の基礎となる。
包括的S2S LLM評価のためのエンドツーエンド・マルチアスペクト・説明可能な音声LLMである textttSageLM を提案する。
論文 参考訳(メタデータ) (2025-08-28T15:47:37Z) - Semantic Matters: Multimodal Features for Affective Analysis [5.691287789660795]
本研究では,情緒的ミミリティ・インテンシティ・アセスメント・チャレンジ(EMI)と行動的あいまいさ・ヘシデンシー・アセスメント・チャレンジ(BAH)の2つの課題について提案する。
我々は,大規模なポッドキャストデータセット上で事前学習したWav2Vec 2.0モデルを用いて,様々な音声特徴を抽出する。
テキストと視覚のモダリティを分析に統合し、意味的コンテンツが貴重な文脈的手がかりを提供すると認識する。
論文 参考訳(メタデータ) (2025-03-16T11:30:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。