論文の概要: Looking for Affect in Spontaneous Finnish Speech through Linguistic Interpretability
- arxiv url: http://arxiv.org/abs/2607.24155v1
- Date: Mon, 27 Jul 2026 08:32:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.363608
- Title: Looking for Affect in Spontaneous Finnish Speech through Linguistic Interpretability
- Title(参考訳): 言語学的解釈可能性による自然フィンランド語音声への影響を探る
- Authors: Kalle Lahtinen, Liisa Mustanoja, Okko Räsänen,
- Abstract要約: そこで本研究では,テキストと音声を併用することで,各モーダルの精度を向上できることを示す。
結果は、他の言語からの先行的な発見をサポートし、自然発語に関する新しいデータと知識を提供する。
- 参考スコア(独自算出の注目度): 4.94997283141601
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing research on affect in speech has shown how acoustic surface characteristics and content-related linguistic aspects of speech both relate to perceived emotional arousal and valence. However, it is not clear what the relative contributions of these two factors are in the perceptual process. This is especially true for Finnish, for which most existing studies focus on either acoustic-phonetic or text analysis. This paper presents a study where we systematically explore the combinatory role of text- and audio-based features in modeling the human perception of valence and arousal using a newly released affective speech corpus for spontaneous Finnish. We show that the combination of text- and audio-based features improves valence regression results over the individual modalities, whereas for arousal regression the complementary effect is not substantial. The results support prior findings from other languages, providing new data and knowledge on spontaneous Finnish speech.
- Abstract(参考訳): 音声における影響に関する既存の研究は、音声の音響的表面特性と内容関連言語的側面が、感情的覚醒と有価感にどのように関連しているかを示した。
しかし、これらの2つの要因の相対的な寄与が知覚過程にあるかは明らかでない。
これはフィンランドでは特に当てはまり、既存の研究は音声・音声・テキスト分析に重点を置いている。
本稿では,フィンランドの自然発語に対する感情音声コーパスを用いて,人間の原子価と覚醒の知覚をモデル化する上で,テキストと音声による特徴の結合的役割を体系的に探求する。
テキストと音声をベースとした特徴の組み合わせにより,個々のモーダルに対する価回帰が向上するのに対し,覚醒的回帰では相補的効果はそれほど大きくないことを示す。
その結果、他の言語からの事前発見をサポートし、自然発声フィンランド語の新たなデータと知識を提供する。
関連論文リスト
- iMiGUE-Speech: A Spontaneous Speech Dataset for Affective Analysis [7.298729249943839]
iMiGUE-Speech(iMiGUE-Speech)は、感情的および感情的状態を研究するための自発的な感情コーパスを提供するiMiGUEデータセットの拡張である。
iMiGUE-Speechは、実際の一致結果から自然に生じる自然影響をキャプチャする。
論文 参考訳(メタデータ) (2026-02-25T00:38:19Z) - Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio [52.859261069569165]
音声テキスト生成のための手話,唇の動き,音声の多様な組み合わせを扱える最初の統一フレームワークを提案する。
i)不均一な入力を効果的に処理できる統一されたモダリティ非依存アーキテクチャの設計、(ii)モダリティ間の過小評価された相乗効果の探索、特に手話理解における非手動的手がかりとしての唇運動の役割、(iii)個々のタスクに特化した最先端モデルと同等以上のパフォーマンスを達成すること、の3つの目的に焦点をあてる。
論文 参考訳(メタデータ) (2025-08-28T06:51:42Z) - On the Relationship between Accent Strength and Articulatory Features [26.865464238029748]
本稿では,アクセント強度と音響音声から推定される調音特徴との関係について検討する。
提案フレームワークは,近年の自己教師付き学習の調音反転手法を利用して,調音特徴を推定する。
その結果,舌の位置決めパターンは2つの方言を区別することが明らかとなった。
論文 参考訳(メタデータ) (2025-07-03T20:08:28Z) - Investigating Affect Mining Techniques for Annotation Sample Selection in the Creation of Finnish Affective Speech Corpus [8.008453432425364]
本稿では,フィンランドの3つの大規模音声コーパスから抽出した感情的覚醒と有能性のための12,000の発話をアノテートした最初のコーパスを提案する。
その結果、フィンランドの自発的な感情音声コーパスを導入し、他の言語やドメインで感情音声コーパスを作成するためのサンプリング戦略を通知する。
論文 参考訳(メタデータ) (2025-05-23T12:47:21Z) - Acoustic and linguistic representations for speech continuous emotion
recognition in call center conversations [2.0653090022137697]
本稿では,AlloSat corpus へのトランスファー学習の一形態として,事前学習した音声表現の利用について検討する。
実験により,事前学習した特徴を用いて得られた性能の大きな向上を確認した。
驚いたことに、言語内容が満足度予測の主要な要因であることは明らかでした。
論文 参考訳(メタデータ) (2023-10-06T10:22:51Z) - Measuring the Impact of Individual Domain Factors in Self-Supervised
Pre-Training [60.825471653739555]
音素領域因子は事前学習において重要な役割を担っているが,文法的・統語的要因はそれほど重要ではない。
本研究は,音声認識のための自己教師付き事前学習における事前学習セットのドメイン特性をよりよく理解するための最初の研究である。
論文 参考訳(メタデータ) (2022-03-01T17:40:51Z) - E-ffective: A Visual Analytic System for Exploring the Emotion and
Effectiveness of Inspirational Speeches [57.279044079196105]
E-ffective(エフェクティブ)は、音声の専門家や初心者が、音声要因の役割と効果的な音声への貢献の両方を分析することのできる視覚分析システムである。
E-spiral(音声の感情の変化を視覚的にコンパクトに表現する)とE-script(音声コンテンツを主要な音声配信情報に結びつける)の2つの新しい可視化技術がある。
論文 参考訳(メタデータ) (2021-10-28T06:14:27Z) - Perception Point: Identifying Critical Learning Periods in Speech for
Bilingual Networks [58.24134321728942]
ディープニューラルベース視覚唇読解モデルにおける認知的側面を比較し,識別する。
我々は、認知心理学におけるこれらの理論と独自のモデリングの間に強い相関関係を観察する。
論文 参考訳(メタデータ) (2021-10-13T05:30:50Z) - Decomposing lexical and compositional syntax and semantics with deep
language models [82.81964713263483]
GPT2のような言語変換器の活性化は、音声理解中の脳活動に線形にマップすることが示されている。
本稿では,言語モデルの高次元アクティベーションを,語彙,構成,構文,意味表現の4つのクラスに分類する分類法を提案する。
その結果は2つの結果が浮かび上がった。
まず、構成表現は、語彙よりも広範な皮質ネットワークを募集し、両側の側頭、頭頂、前頭前皮質を包含する。
論文 参考訳(メタデータ) (2021-03-02T10:24:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。