論文の概要: Learning to Predict Performance-induced Emotion Differences in Classical Piano Music
- arxiv url: http://arxiv.org/abs/2607.28876v1
- Date: Thu, 30 Jul 2026 22:42:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.496454
- Title: Learning to Predict Performance-induced Emotion Differences in Classical Piano Music
- Title(参考訳): クラシックピアノ音楽における演奏誘発感情差の予測学習
- Abstract要約: 我々は、バッハの『Well-Tempered Clavier Book I』の6つの商業録音を用いて、クラシック・ソロ・ピアノ音楽に焦点を当てた。
総合的な感情カテゴリーを支配する傾向にある構成自体の側面から、演奏情報を分離する。
- 参考スコア(独自算出の注目度): 7.281487567929003
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Music is often used as a medium for communicating emotion, with performers shaping perceived affect through interpretation. This study addresses the challenge of identifying and predicting subtle changes in perceived emotion that are exclusively due to differences in performance. We focus on classical solo piano music, using a set of 6 commercial recordings of Bach's Well-Tempered Clavier Book I, annotated in terms of valence and arousal. By encoding the recordings through performance-specific features only, we isolate performance information from aspects of the composition itself, which tend to dominate the overall perceived emotional category. A preliminary analysis validates that these features vary meaningfully across performers. We then propose a relative regression framework, Delta-VA, to predict deviations in valence-arousal relative to an ``average'' performance, thereby focusing on the changes in emotion brought about by a specific way of playing a piece. In addition to the standard $R^2$ regression score, we introduce geometric evaluation metrics to assess the preservation of pairwise differences between performances. Results indicate high directional consistency with the ground truth, but also a compression in prediction magnitude, indicating that the model tends to underestimate expressive performance effects.
- Abstract(参考訳): 音楽はしばしば感情を伝える媒体として使用され、パフォーマーは解釈を通じて知覚された感情を形作る。
本研究では,パフォーマンスの違いによる知覚的感情の微妙な変化を識別し,予測することの課題に対処する。
我々は、バッハの『Well-Tempered Clavier Book I』の6つの商業的録音を用いて、クラシック・ソロ・ピアノ音楽に焦点を当てた。
演奏特化機能のみを通じて録音を符号化することにより、全体の知覚的感情カテゴリーを支配する傾向にある構成自体の側面から、演奏情報を分離する。
予備的な分析は、これらの特徴がパフォーマー間で有意に異なることを検証する。
そこで我々は,「平均」演奏に対する原子価刺激の偏差を予測するための相対回帰フレームワーク Delta-VA を提案し,曲の特定の演奏方法による感情の変化に着目した。
標準の$R^2$レグレッションスコアに加えて,性能の相互差の保存を評価するための幾何評価指標を導入する。
その結果, モデルが表現性能に与える影響を過小評価する傾向にあることを示すとともに, 予測精度の圧縮も行った。
関連論文リスト
- Integrating Contextual Embeddings into Evaluation of Expressive MIDI Piano Performances [0.00746020873338928]
生成的応用において、多種多様な表現的属性は、モデルを選択するための単一の計量にまとめるのを難しくする。
そこで本研究では,属性スコープ計測値を再検討し,自己教師付きシンボリック音楽モデルであるAriaとCLaMP3のコンテキスト埋め込みの知覚特性について検討する。
ピアソン相関や再構成誤差とは異なり、文脈埋め込みにおけるカーネルベースの手法はメモアライメントを必要とせず、文脈摂動に敏感である。
論文 参考訳(メタデータ) (2026-07-30T09:22:54Z) - FACE-net: Factual Calibration and Emotion Augmentation for Retrieval-enhanced Emotional Video Captioning [81.33341786837974]
Emotional Video Captioning (EVC) は、ビデオで表現される本質的な感情で事実を記述することを目的とした、新たなタスクである。
FActual and Emotion Augmentation (FACE-net) を用いた検索強化フレームワークを提案する。
FACE-netは、事実と感情のセマンティクスを協調的にマイニングし、生成のための適応的で正確なガイダンスを提供する。
論文 参考訳(メタデータ) (2026-03-18T07:53:15Z) - Let the Model Learn to Feel: Mode-Guided Tonality Injection for Symbolic Music Emotion Recognition [11.051812953517521]
音楽の感情認識は、象徴的な音楽理解において重要な課題である。
近年のアプローチでは、音楽の意味を感情ラベルにマッピングする微調整モデルによる有望な結果が示されている。
モデルにモードに関する心理的洞察を取り入れたモードガイド強化(MoGE)戦略を提案する。
論文 参考訳(メタデータ) (2025-12-15T03:27:35Z) - Seeking Subjectivity in Visual Emotion Distribution Learning [93.96205258496697]
視覚感情分析(VEA)は、人々の感情を異なる視覚刺激に向けて予測することを目的としている。
既存の手法では、集団投票プロセスにおいて固有の主観性を無視して、統合されたネットワークにおける視覚的感情分布を予測することが多い。
視覚的感情分布の主観性を調べるために,新しいテキストサブジェクティビティ評価ネットワーク(SAMNet)を提案する。
論文 参考訳(メタデータ) (2022-07-25T02:20:03Z) - A Perceptual Measure for Evaluating the Resynthesis of Automatic Music
Transcriptions [10.957528713294874]
本研究では,室内音響や楽器などの環境要因が変化した場合の演奏の知覚に焦点を当てた。
我々は「演出」の概念と「芸術的意図」を表現する「解釈」の概念を区別することを提案する。
論文 参考訳(メタデータ) (2022-02-24T18:09:22Z) - Tracing Back Music Emotion Predictions to Sound Sources and Intuitive
Perceptual Qualities [6.832341432995627]
音楽感情認識は,音楽情報検索研究において重要な課題である。
より良いモデルに向けた重要なステップの1つは、モデルが実際にデータから学んでいるものを理解することである。
本研究では,高レベルの感情予測に結びつくスペクトル画像セグメントを用いて,モデル予測の説明を導出する方法を示す。
論文 参考訳(メタデータ) (2021-06-14T22:49:19Z) - Musical Prosody-Driven Emotion Classification: Interpreting Vocalists
Portrayal of Emotions Through Machine Learning [0.0]
音楽の韻律の役割は、いくつかの研究が韻律と感情の強い結びつきを示しているにもかかわらず、まだ解明されていない。
本研究では,従来の機械学習アルゴリズムの入力を音楽韻律の特徴に限定する。
我々は,ボーカリストの個人データ収集手法と,アーティスト自身による個人的根拠的真理ラベル付け手法を利用する。
論文 参考訳(メタデータ) (2021-06-04T15:40:19Z) - Affect2MM: Affective Analysis of Multimedia Content Using Emotion
Causality [84.69595956853908]
本稿では,マルチメディアコンテンツを対象とした時系列感情予測学習手法であるAffect2MMを提案する。
私たちの目標は、現実の人間中心の状況や行動でキャラクターが描く様々な感情を自動的に捉えることです。
論文 参考訳(メタデータ) (2021-03-11T09:07:25Z) - Modality-Transferable Emotion Embeddings for Low-Resource Multimodal
Emotion Recognition [55.44502358463217]
本稿では、上記の問題に対処するため、感情を埋め込んだモダリティ変換可能なモデルを提案する。
我々のモデルは感情カテゴリーのほとんどで最先端のパフォーマンスを達成する。
私たちのモデルは、目に見えない感情に対するゼロショットと少数ショットのシナリオにおいて、既存のベースラインよりも優れています。
論文 参考訳(メタデータ) (2020-09-21T06:10:39Z) - Music Gesture for Visual Sound Separation [121.36275456396075]
ミュージック・ジェスチャ(Music Gesture)は、音楽演奏時の演奏者の身体と指の動きを明示的にモデル化するキーポイントに基づく構造化表現である。
まず、コンテキスト対応グラフネットワークを用いて、視覚的コンテキストと身体力学を統合し、その後、身体の動きと対応する音声信号とを関連付けるために、音声-視覚融合モデルを適用する。
論文 参考訳(メタデータ) (2020-04-20T17:53:46Z) - Audio Impairment Recognition Using a Correlation-Based Feature
Representation [85.08880949780894]
本稿では,特徴対の相関に基づく手作り特徴の新しい表現を提案する。
実験段階において,コンパクトな特徴次元と計算速度の向上の観点から,優れた性能を示す。
論文 参考訳(メタデータ) (2020-03-22T13:34:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。