論文の概要: Project Qualia: Recovering Experiential Music Structure from Session Co-occurrence Data
- arxiv url: http://arxiv.org/abs/2609.10862v1
- Date: Wed, 09 Sep 2026 21:59:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.14465
- Title: Project Qualia: Recovering Experiential Music Structure from Session Co-occurrence Data
- Title(参考訳): Project Qualia:セッション共起データから経験的音楽構造を復元する
- Abstract要約: 本報告では、実際の聴取行動から、曲間の経験的類似性を回復できるかどうかを判定するためのプロジェクトQualiaの結果を提示する。
我々は、Last.fm APIを通じて9,396人のユーザから収集された29億のスクローブルからなる大規模なリスニングセッションデータセットを構築し、前処理パイプラインを通じて2860万セッションにわたって531.6万のトレーニングスクローブルに削減した。
- 参考スコア(独自算出の注目度): 0.5024983453990064
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This report presents results from Project Qualia, an ongoing effort to determine whether experiential similarity between songs, a structure not captured by genre or metadata taxonomies, can be recovered from real listening behavior. We constructed a large-scale dataset of listening sessions, comprising 1.29 billion scrobbles collected from 9,396 users via the Last.fm API and reduced through a preprocessing pipeline to 531.6 million training scrobbles across 28.6 million sessions. On this corpus, we trained a skip-gram Word2Vec model (Song2Vec), treating each session as a sentence and each track as a token. As anticipated, the resulting embedding space was dominated by artist identity, a consequence of single-artist runs within sessions. To test for a subtler, artist-independent signal, we developed an artist-residual procedure: subtracting each artist's centroid from its tracks' embeddings and evaluating whether the remainder retained structure. Mean cross-artist cosine similarity fell from 0.2487 in raw embedding space to 0.0005 in residual space, yet 4,577 cross-artist track pairs retained cosine similarity $\ge 0.70$ in residual space, forming coherent genre- and era-based clusters, including trip-hop, 1990s grunge, 2020 mainstream pop, and cross-composer classical piano pairs at cosine similarity up to 0.95. These results confirm that the training data contains experiential structure independent of artist identity, establishing an empirical basis for an architecture designed to learn this experiential layer directly.
- Abstract(参考訳): 本報告では, 楽曲間の経験的類似性, ジャンルやメタデータの分類で捉えない構造が, 実際の聴取行動から回復できるかどうかを検証するためのプロジェクトQualiaの結果を報告する。
我々は、Last.fm APIを通じて9,396人のユーザから収集された29億のスクローブルからなる大規模なリスニングセッションデータセットを構築し、前処理パイプラインを通じて2860万セッションにわたって531.6万のトレーニングスクローブルに削減した。
このコーパスでは、スキップグラムのWord2Vecモデル(Song2Vec)をトレーニングし、各セッションを文として扱い、各トラックをトークンとして扱いました。
予想通り、埋め込みスペースはアーティストのアイデンティティによって支配され、セッション内で1人のアーティストが実行される結果となった。
アーティストに依存しない微妙な信号をテストするために,各アーティストのセントロイドをトラックの埋め込みから取り除き,残余の構造が保持されているかどうかを評価する方法を開発した。
平均的なクロスアーティストのコサインの類似性は、生の埋め込みスペースで0.2487ドルから、残留スペースで0.0005ドルに低下したが、4,577本のクロスアーティストのトラックペアがコサインの類似性を保持し、トリップホップ、1990年代のグランゲ、2020年のメインストリームポップ、そしてコサインの類似性でクロスコンポーザーのピアノペアを最大0.95ドルまで、一貫性のあるジャンルと時代ベースのクラスタを形成した。
これらの結果から,これらのトレーニングデータにはアーティストのアイデンティティに依存しない経験的構造が含まれており,この経験的レイヤを直接学習するように設計されたアーキテクチャの実証的基盤が確立された。
関連論文リスト
- On the Human and Computer Alignment of Attribute-Based Music Matches [38.92033810619237]
我々は、メロディ、ハーモニー、リズム、声、音色という5つの音楽特性に焦点を当てている。
我々は,三重項に基づく強制選択タスクを,盗作例,カバー曲,AI生成音楽を含む300件のケースで設計する。
この実験から,83名の専門家による属性に基づく音楽マッチングの知覚的評価のコレクションであるMATCHAデータセットを紹介した。
論文 参考訳(メタデータ) (2026-09-01T09:41:29Z) - Recovering Expert Critic-Sourced Network Adjacency between Musical Artists from Acoustic Distributions: A Construct-Validity Approach [0.0]
音楽レコメンデーションは、ユーザとイテムの相互作用と本質的な音楽コンテンツという2つのシグナルに依存している。
第3の、ほとんど利用されていない信号は、より豊かで、より原則的だ、と我々は主張する。
提案手法は, 構成妥当性の1つとして, 音響コンテンツに対して検証する。
論文 参考訳(メタデータ) (2026-08-27T15:59:21Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - FIGMA: Towards FIne-Grained Music retrievAl [65.98380295254817]
自然言語記述による音楽の検索はCLAPのような対照的な音声テキストモデルで改善されているが、現在のシステムはいまだに大まかなセマンティッククエリに限られている。
この制限は、長いキャプションで訓練されているにもかかわらず、CLAPベースのモデルは、最初の数個のトークンのみを効果的に活用する。
本研究では,グローバルな音声テキストアライメントとフレームレベルのトークンアライメントを共同で最適化することで,この制限に対処するマルチビューコントラストアーキテクチャであるFIGMAを提案する。
論文 参考訳(メタデータ) (2026-06-04T18:05:39Z) - Discovering "Words" in Music: Unsupervised Learning of Compositional Sparse Code for Symbolic Music [50.87225308217594]
本稿では,記号的音楽データから「音楽単語」と呼ばれる繰り返しパターンを識別する教師なし機械学習アルゴリズムを提案する。
本稿では,音楽単語発見の課題を統計的最適化問題として定式化し,二段階予測最大化(EM)に基づく学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-29T11:10:57Z) - Zero-shot Musical Stem Retrieval with Joint-Embedding Predictive Architectures [3.463789345862036]
本稿では,コンテキストの潜在表現を生成するために,エンコーダと予測器を協調訓練する,結合埋め込み予測アーキテクチャに基づく新しい手法を提案する。
特に,任意の楽器に条件付けした予測器を設計し,ゼロショットステム検索を行えるようにした。
MUSDB18とMoisesDBデータセットを用いて,本モデルの検索性能を検証する。
論文 参考訳(メタデータ) (2024-11-29T16:11:47Z) - Self-Supervised Contrastive Learning for Robust Audio-Sheet Music
Retrieval Systems [3.997809845676912]
自己指導型コントラスト学習は、実際の音楽コンテンツからの注釈付きデータの不足を軽減することができることを示す。
クロスモーダルなピース識別の高レベルなタスクにスニペットを埋め込む。
本研究では,実際の音楽データが存在する場合,検索品質が30%から100%に向上することが観察された。
論文 参考訳(メタデータ) (2023-09-21T14:54:48Z) - SeCo: Separating Unknown Musical Visual Sounds with Consistency Guidance [88.0355290619761]
この作品は未知の楽器の分離に焦点を当てている。
本稿では,未知のカテゴリを分離できるセコ(SeCo)フレームワークを提案する。
本手法は,新たな楽曲カテゴリに適応する能力を示し,基本手法を顕著なマージンで上回る性能を示す。
論文 参考訳(メタデータ) (2022-03-25T09:42:11Z) - Artist Similarity with Graph Neural Networks [1.160208922584163]
本稿では,三重項損失を学習したグラフニューラルネットワークを用いて,アーティスト間の類似性を計算するためのハイブリッドアプローチを提案する。
グラフニューラルネットワークアーキテクチャの新規性は、アーティスト接続のグラフのトポロジとコンテンツ機能を組み合わせて、アーティストを類似性を符号化したベクトル空間に埋め込むことである。
17,673人のアーティストを擁するこのデータセットは、これまでで最大の学術的アーティスト類似性データセットであり、コンテンツベースの機能を含んでいる。
論文 参考訳(メタデータ) (2021-07-30T10:44:31Z) - Chest x-ray automated triage: a semiologic approach designed for
clinical implementation, exploiting different types of labels through a
combination of four Deep Learning architectures [83.48996461770017]
本研究では,異なる畳み込みアーキテクチャの後期融合に基づく深層学習手法を提案する。
公開胸部x線画像と機関アーカイブを組み合わせたトレーニングデータセットを4つ構築した。
4つの異なるディープラーニングアーキテクチャをトレーニングし、それらのアウトプットとレイトフュージョン戦略を組み合わせることで、統一されたツールを得ました。
論文 参考訳(メタデータ) (2020-12-23T14:38:35Z) - dMelodies: A Music Dataset for Disentanglement Learning [70.90415511736089]
我々は、研究者が様々な領域でアルゴリズムの有効性を実証するのに役立つ新しいシンボリック・ミュージック・データセットを提案する。
これはまた、音楽用に特別に設計されたアルゴリズムを評価する手段を提供する。
データセットは、遠絡学習のためのディープネットワークのトレーニングとテストに十分な大きさ(約13万データポイント)である。
論文 参考訳(メタデータ) (2020-07-29T19:20:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。