論文の概要: Integrating Contextual Embeddings into Evaluation of Expressive MIDI Piano Performances
- arxiv url: http://arxiv.org/abs/2607.27909v1
- Date: Thu, 30 Jul 2026 09:22:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.484946
- Title: Integrating Contextual Embeddings into Evaluation of Expressive MIDI Piano Performances
- Title(参考訳): 表現型MIDIピアノ性能評価における文脈埋め込みの統合
- Authors: Dmitrii Gavrilev, Ilya Borovik, Vladimir Viro,
- Abstract要約: 生成的応用において、多種多様な表現的属性は、モデルを選択するための単一の計量にまとめるのを難しくする。
そこで本研究では,属性スコープ計測値を再検討し,自己教師付きシンボリック音楽モデルであるAriaとCLaMP3のコンテキスト埋め込みの知覚特性について検討する。
ピアソン相関や再構成誤差とは異なり、文脈埋め込みにおけるカーネルベースの手法はメモアライメントを必要とせず、文脈摂動に敏感である。
- 参考スコア(独自算出の注目度): 0.00746020873338928
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Objective evaluation of expressive MIDI piano performances typically relies on attribute statistics such as timing, velocity, and duration of individual notes. However, these methods often disregard dependencies between notes, which poses a potential limitation in assessing the similarity between two sets of performances. In generative applications, the wide variety of expressive attributes makes it difficult to aggregate them into a single scalar metric for model selection. In this work, we reexamine attribute-scoped metrics and explore the perceptual properties of contextual embeddings from self-supervised symbolic music models, Aria and CLaMP3. Results from our listening study indicate that these models can be used as perceptual proxies, showing agreement with per-sample human ratings on par with traditional metrics. To measure conditional distributional similarity, we adapt Kernel Audio Distance to the symbolic music domain. Unlike Pearson correlation and reconstruction error, kernel-based methods on contextual embeddings do not require note alignment and are sensitive to contextual perturbations. To facilitate reproducibility, we release Pereval, an open-source library that integrates performance evaluation utilities, including both attribute-scoped and deep feature metrics.
- Abstract(参考訳): 表現力のあるMIDIピアノ演奏の客観的評価は、典型的には個々の音符のタイミング、速度、持続時間などの属性統計に依存する。
しかし、これらの手法はノート間の依存関係を無視することが多く、これは2つのパフォーマンスのセット間の類似性を評価するのに潜在的に制限を与える。
生成的応用において、多種多様な表現的属性は、モデルを選択するための単一のスカラー計量にまとめるのを難しくする。
そこで本研究では,属性スコープ計測値を再検討し,自己教師付きシンボリック音楽モデルであるAriaとCLaMP3のコンテキスト埋め込みの知覚特性について検討する。
聴取実験の結果,これらのモデルは知覚プロキシとして利用でき,従来の指標と同等のサンプルごとの人格評価と一致していることが明らかとなった。
条件分布の類似性を測定するために,Kernel Audio Distanceをシンボリック・ミュージック・ドメインに適応させる。
ピアソン相関や再構成誤差とは異なり、文脈埋め込みにおけるカーネルベースの手法はメモアライメントを必要とせず、文脈摂動に敏感である。
再現性を高めるため、属性スコープと機能メトリクスの両方を含むパフォーマンス評価ユーティリティを統合するオープンソースのライブラリであるPerevalをリリースする。
関連論文リスト
- SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification [4.791940743080381]
FSC(Few-shot Classification)は限られたラベル付きデータから学習するために広く用いられているが、ほとんどの評価では、ターゲット概念は文脈的手がかりとは無関係であると暗黙的に仮定している。
実世界の設定では、サンプルはリッチなコンテキストにしばしば現れ、モデルが前景のコンテンツと背景の信号の間の刺激的な相関を活用できる。
SpurAudioは、音声における前景イベントと背景環境の自然な分離性を利用して、サポートとクエリセット間のコンテキストシフトの制御されたマルチレベル評価を可能にするベンチマークである。
論文 参考訳(メタデータ) (2026-05-13T15:32:57Z) - AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering [97.52852990265136]
音声対応大規模言語モデルの推論機能を活用するバックボーン非依存評価フレームワークであるAQAScoreを紹介する。
AQAScoreは人格関連性、ペア比較、構成推論タスクを含む複数のベンチマークで評価する。
論文 参考訳(メタデータ) (2026-01-21T07:35:36Z) - VocSim: A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio [1.0791267046450075]
VocSimは、凍結埋め込みの固有の幾何学的アライメントを探索するトレーニング不要のベンチマークである。
VocSimは、人間のスピーチ、動物の発声、環境音にまたがる19のコーパスから125万のソースクリップを集約する。
論文 参考訳(メタデータ) (2025-12-10T22:13:12Z) - From Discord to Harmony: Decomposed Consonance-based Training for Improved Audio Chord Estimation [9.584152437544974]
本稿では,従来の二分法を超えて拡張されたメトリクスを用いて,コードアノテーションにおけるアノテーション間合意の評価を行う。
共振器を用いたラベル平滑化により、共振器の概念をモデルに統合する新しいACEコンバータモデルを提案する。
論文 参考訳(メタデータ) (2025-09-01T16:20:47Z) - Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering [0.0]
そこで本研究では,YouTube上の音楽カバーの音声サンプルと,オリジナル曲の音声とユーザコメントからの感情スコアを含むデータセットを構築した。
我々のアプローチは、広範囲な事前処理、音声信号を30秒のウィンドウに分割し、高次元の特徴表現を抽出することである。
回帰モデルを用いて感情スコアを0-100スケールで予測し,それぞれ3.420,5.482,2.783,4.212の根平均二乗誤差(RMSE)値を達成する。
論文 参考訳(メタデータ) (2024-10-31T20:26:26Z) - Stem-JEPA: A Joint-Embedding Predictive Architecture for Musical Stem Compatibility Estimation [3.8570045844185237]
マルチトラックデータセットでトレーニングした新しいJEPA(Joint-Embedding Predictive Architecture)であるStem-JEPAを紹介する。
本モデルでは, エンコーダと予測器の2つのネットワークから構成される。
MUSDB18データセットの検索タスクにおいて、本モデルの性能を評価し、ミキシングから欠落した茎を見つける能力を検証した。
論文 参考訳(メタデータ) (2024-08-05T14:34:40Z) - Cobra Effect in Reference-Free Image Captioning Metrics [58.438648377314436]
視覚言語事前学習モデル(VLM)を活用した参照フリー手法の普及が出現している。
本稿では,基準自由度に欠陥があるかどうかを考察する。
GPT-4Vは生成した文を評価するための評価ツールであり,提案手法がSOTA(State-of-the-art)の性能を達成することを示す。
論文 参考訳(メタデータ) (2024-02-18T12:36:23Z) - What You Hear Is What You See: Audio Quality Metrics From Image Quality
Metrics [44.659718609385315]
そこで本研究では,音声信号の評価に最先端画像知覚メトリクスを応用し,スペクトログラムとして表現することの実現可能性について検討する。
我々は、音響信号の特異性を考慮するために、精神音響学的に妥当なアーキテクチャを持つメトリクスの1つをカスタマイズする。
提案手法の有効性を音楽データセットを用いて評価した。
論文 参考訳(メタデータ) (2023-05-19T10:43:57Z) - On the Intrinsic and Extrinsic Fairness Evaluation Metrics for
Contextualized Language Representations [74.70957445600936]
様々な自然言語処理タスクの公平度を測定するために、複数のメトリクスが導入された。
これらの指標は,(1)下流アプリケーションにおけるフェアネスを評価する遠因性指標と,(2)上流言語表現モデルにおけるフェアネスを推定する遠因性指標の2つのカテゴリに大別することができる。
論文 参考訳(メタデータ) (2022-03-25T22:17:43Z) - Score-informed Networks for Music Performance Assessment [64.12728872707446]
MPAモデルにスコア情報を組み込んだディープニューラルネットワークに基づく手法はまだ研究されていない。
スコアインフォームド性能評価が可能な3つのモデルを提案する。
論文 参考訳(メタデータ) (2020-08-01T07:46:24Z) - Audio Impairment Recognition Using a Correlation-Based Feature
Representation [85.08880949780894]
本稿では,特徴対の相関に基づく手作り特徴の新しい表現を提案する。
実験段階において,コンパクトな特徴次元と計算速度の向上の観点から,優れた性能を示す。
論文 参考訳(メタデータ) (2020-03-22T13:34:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。