論文の概要: Taste-aware music retrieval from audio embeddings
- arxiv url: http://arxiv.org/abs/2607.03296v1
- Date: Fri, 03 Jul 2026 13:06:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.571083
- Title: Taste-aware music retrieval from audio embeddings
- Title(参考訳): オーディオ埋め込みによる味覚情報検索
- Abstract要約: 音と味の相互対応は心理学や神経科学において確立されている。
我々は、コンテンツに基づく音楽情報検索ベンチマークとして味覚予測を定式化する。
- 参考スコア(独自算出の注目度): 1.2031796234206136
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Crossmodal correspondences between sound and taste are well established in psychology and neuroscience, but largely absent from content-based multimedia retrieval. We formalise taste-from-audio prediction as a content-based music information retrieval benchmark over a perceptually validated multi-source corpus, comparing ten frozen audio encoders from the four HEAR families under a shared multi-task regression head, with gated late-fusion as a configurable variant. In order to assess the effectiveness of the models, we compute absolute error and rank correlation. The strongest systems predict the five tastes within a macro RMSE of 0.134; on held-out real music their error is less than half a single rater's deviation from the consensus (RMSE 0.13 vs. 0.28), so the model tracks the group consensus more closely than an average human rater, and well below the previous state of the art baseline (0.219). On absolute error the encoders are statistically flat, with a single VGGish matching the best fusion, but gated late-fusion's advantage is confined to rank correlation (macro Pearson r 0.724 vs. 0.666). Operationalised as a content-based retrieval index, the predicted taste space ranks a 309-item pool far more faithfully than a CLAP-text baseline, which sits at chance; ridge probes and an audio-bandstop knockout read the strongest representations against documented sound-taste correspondences.
- Abstract(参考訳): 音と味の相互対応は心理学と神経科学においてよく確立されているが、内容に基づくマルチメディア検索は殆ど欠落している。
HEARファミリーの10個の冷凍オーディオエンコーダを共有マルチタスクレグレッションヘッドで比較し,遅延融合を構成可能な変種とした。
モデルの有効性を評価するために,絶対誤差とランク相関を計算する。
最強のシステムは、マクロRMSEの0.134の5つの味を予測し、ホールドアウトされた実音楽では、その誤差はコンセンサスからの偏差(RMSE 0.13 対 0.28 対 RMSE 0.13 対 RMSE 0.28)の半分以下である。
絶対誤差ではエンコーダは統計的に平坦であり、単一のVGGishが最良の融合と一致するが、後期融合の利点はランク相関に制限される(macro Pearson r 0.724 vs. 0.666)。
コンテンツベースの検索インデックスとして運用され、予測された味空間はCLAPテキストベースラインよりもずっと忠実に309tmのプールをランク付けする。
関連論文リスト
- ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge [30.520810407664072]
ParaPairAudioBenchは、5つのパラ言語的次元(スタイル、レート、強調、年齢、ジェンダー)にわたる5,175のオーディオペアのペアベンチマークである。
実験によると、現在のLALMの審査員は平均で32%の差で人間の判断に遅れており、厳しい校正の失敗を示している。
論文 参考訳(メタデータ) (2026-06-23T14:43:43Z) - How Well Can We Decode Vowels from Auditory EEG -- A Rigorous Cross-Subject Benchmark with Honest Assessment [3.942402228954563]
そこで我々は,OpenNeuro ds006104を用いて,聴覚脳波から5種類の母音復号(a,e,i,o,u)を抽出した。
最高のフル機能モデル(XGBoost)は24.5パーセントの精度(20パーセント以下)で、LightGBMの差分エントロピー機能は25.5%である。
論文 参考訳(メタデータ) (2026-04-22T05:50:59Z) - Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment [53.72927532626824]
わずか50個のサンプル(0.3%のデータ)のサブセットは、完全なベンチマークスコアと0.93以上のピアソン相関を達成可能であることを示す。
選好をより良く予測するために、選択したサブセットの回帰モデルを訓練し、0.98の相関を達成した。
これは回帰モデリングにおいて、よく計算されたサブセットが完全なベンチマークを予測し、量を超える品質を示すことを示している。
論文 参考訳(メタデータ) (2026-04-20T00:57:31Z) - Membership Inference Attacks against Large Audio Language Models [50.84901010528239]
大規模音声言語モデル(LALM)のMIA評価について述べる。
テキスト,スペクトル,韻律的特徴に基づくマルチモーダルブラインドベースラインを用いて,一般的な音声データセットがほぼ完璧な列車/テスト分離性を示すことを示す。
以上の結果から, LALM検査の基準基準が確立された。
論文 参考訳(メタデータ) (2026-03-30T12:45:28Z) - Adaptive Evidence Weighting for Audio-Spatiotemporal Fusion [0.0]
生物音響分類では、音波信号と、位置と季節としての文脈の両方から種識別が推測される。
本稿では,事前学習したテキスト音声分類器と時間的予測器を統合した適応型対数線形エビデンス融合フレームワークFINCHを紹介する。
FINCHは固定重融合とオーディオのみのベースラインを一貫して上回り、堅牢性とエラーのトレードオフを改善している。
論文 参考訳(メタデータ) (2026-02-03T18:21:13Z) - Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment [5.380078543698624]
マルチチャンネルオーディオアライメントは、生体音響モニタリング、空間オーディオシステム、音響ローカライゼーションにおいて重要な要件である。
マルチチャンネル音声同期を改善するために,クロスアテンション機構と信頼度重み付けスコアリングを組み合わせた手法を提案する。
提案手法は,BioDCASE 2025 Task 1 チャレンジにおいて,ディープラーニングベースラインの 0.58 に対して,テストデータセットの平均 0.30 MSE で1位となった。
論文 参考訳(メタデータ) (2025-09-21T05:14:06Z) - Aligning Text-to-Music Evaluation with Human Preferences [63.08368388389259]
本稿では,TTM(生成音響テキスト・ツー・ミュージック)モデルの評価のための基準ベース分散指標の設計空間について検討する。
私たちは、合成データと人間の嗜好データの両方に標準のFAD設定が矛盾しているだけでなく、既存の指標のほとんどすべてがデシデラタを効果的に捉えていないことに気付きました。
我々は,自己教師型音声埋め込みモデルから表現に基づいて計算したMAUVE Audio Divergence(MAD)を提案する。
論文 参考訳(メタデータ) (2025-03-20T19:31:04Z) - Mind the Gap! Static and Interactive Evaluations of Large Audio Models [55.87220295533817]
大型オーディオモデル(LAM)は、音声ネイティブな体験をパワーアップするために設計されている。
本研究は,484名の参加者から,LAMを評価し,7,500名のLAMインタラクションを収集する対話的アプローチを提案する。
論文 参考訳(メタデータ) (2025-02-21T20:29:02Z) - Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering [0.0]
そこで本研究では,YouTube上の音楽カバーの音声サンプルと,オリジナル曲の音声とユーザコメントからの感情スコアを含むデータセットを構築した。
我々のアプローチは、広範囲な事前処理、音声信号を30秒のウィンドウに分割し、高次元の特徴表現を抽出することである。
回帰モデルを用いて感情スコアを0-100スケールで予測し,それぞれ3.420,5.482,2.783,4.212の根平均二乗誤差(RMSE)値を達成する。
論文 参考訳(メタデータ) (2024-10-31T20:26:26Z) - Disentangled Noisy Correspondence Learning [56.06801962154915]
クロスモーダル検索は、モダリティ間の潜在対応を理解する上で重要である。
DisNCLはノイズ対応学習における特徴分散のための新しい情報理論フレームワークである。
論文 参考訳(メタデータ) (2024-08-10T09:49:55Z) - Low-complexity deep learning frameworks for acoustic scene
classification [64.22762153453175]
音響シーン分類(ASC)のための低複雑さ深層学習フレームワークを提案する。
提案するフレームワークは、フロントエンドのスペクトログラム抽出、オンラインデータ拡張、バックエンドの分類、予測される確率の後期融合の4つの主要なステップに分けることができる。
DCASE 2022 Task 1 Development データセットで実施した実験は,低複雑さの要求を十分に満たし,最も高い分類精度を 60.1% で達成した。
論文 参考訳(メタデータ) (2022-06-13T11:41:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。