論文の概要: MeloBottleneck: Self-Supervised Melody Skeleton Extraction with a Latent Subsequence Bottleneck
- arxiv url: http://arxiv.org/abs/2607.10233v1
- Date: Sat, 11 Jul 2026 09:44:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.345031
- Title: MeloBottleneck: Self-Supervised Melody Skeleton Extraction with a Latent Subsequence Bottleneck
- Title(参考訳): MeloBottleneck:潜伏潜航船による自監督メロディ骨格抽出
- Authors: Fan Bu, Rongfeng Li, Linfeng Fan,
- Abstract要約: メロディ骨格抽出は、装飾を除去しながら構造音を保存する短いメロディを導出することを目的としている。
我々はMeloBottleneckを紹介した。MeloBottleneckは、スケルトンを長さ制御、順序保存、潜伏列として表現する自己教師型フレームワークである。
我々は, 合成アウト・オブ・ディストリビューション・オーディション・トゥ・スケルトン, TAN変異・ツー・テーマ, ジュゴン装飾・ツー・チェの3つのレジームを評価する。
- 参考スコア(独自算出の注目度): 0.9676508741349296
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Melody skeleton extraction aims to derive a shorter melody that preserves structural notes while removing ornaments. Prior methods rely on hand-crafted reduction rules or note-wise salience classifiers trained with heuristically or procedurally generated pseudo-labels. Such supervision can inherit generator bias and does not explicitly optimize a coherent reduced melody. We introduce MeloBottleneck, a self-supervised framework that represents a skeleton as a length-controlled, order-preserving latent subsequence. A hard-bottleneck extractor selects note events, a rhythmic-closure operator produces a self-consistent skeleton, and a re-ornamentation decoder reconstructs the input melody. Training combines reconstruction, a frozen autoregressive melody prior, ornament-invariant consistency across procedurally ornamented views, and ornament exclusion. We evaluate three regimes: synthetic out-of-distribution ornament-to-skeleton, TAVERN variation-to-theme, and Jiugong ornamented-to-gongche. A matched pseudo-label classifier excels on the synthetic benchmark, while MeloBottleneck transfers better, achieving competitive selection quality on TAVERN and Jiugong. Skeletonized melodies also improve BM25-based fragment retrieval, boosting Recall@K and MRR while reducing query time. Overall, the results suggest that learning skeletons as latent subsequences yields more robust transfer than pseudo-label imitation.
- Abstract(参考訳): メロディ骨格抽出は、装飾を除去しながら構造音を保存する短いメロディを導出することを目的としている。
従来の手法は手作りの還元規則や、ヒューリスティックまたは手続き的に生成された擬似ラベルで訓練されたノートワイズ・サリエンス分類器に依存していた。
このような監督はジェネレータバイアスを継承することができ、コヒーレントな還元メロディを明示的に最適化することはない。
我々はMeloBottleneckを紹介した。MeloBottleneckは、スケルトンを長さ制御、順序保存、潜伏列として表現する自己教師型フレームワークである。
ハードボトルネック抽出器はメモイベントを選択し、リズミカル閉鎖オペレーターは自己一貫性のある骨格を生成し、再編成復号器は入力メロディを再構成する。
トレーニングは、復元、凍結した自己回帰的なメロディ、手続き的に装飾されたビューを横断する装飾的不変の一貫性、および装飾的排除を組み合わせている。
合成アウト・オブ・ディストリビューション・オーディション・トゥ・スケルトン, タヴァーン・トゥ・ザム, ジュゴン・トゥ・ゴンシュの3つのレジームを評価した。
一致する擬似ラベル分類器は、合成ベンチマークで排他的であり、MeloBottleneck は、TAVERN と Jiugong の競合選択品質を達成する。
Skeletonized MelodiesはBM25ベースのフラグメント検索を改善し、クエリ時間を削減するとともにRecall@KとMRRを向上する。
全体としては、潜在サブシーケンスとしての学習骨格は擬似ラベルの模倣よりも頑健な移行をもたらすことが示唆された。
関連論文リスト
- Pay (Cross) Attention to the Melody: Curriculum Masking for Single-Encoder Melodic Harmonization [2.087792589220897]
我々は,複数のトレーニングステップにおいて,すべての調和トークンを隠蔽する訓練カリキュラムFF(Full-to-Full)を導入する。
複数の実験軸にまたがる事前カリキュラムに対して,本手法を系統的に評価した。
その結果、提案するFFカリキュラムは、ほぼすべての指標において、ベースラインを一貫して上回ることを示した。
論文 参考訳(メタデータ) (2026-01-22T17:46:31Z) - YingMusic-Singer: Zero-shot Singing Voice Synthesis and Editing with Annotation-free Melody Guidance [16.462715982402884]
SVS(Singing Voice Synthesis)は、音素レベルの正確なアライメントに強く依存しているため、実際の展開には制約が残っている。
メロディに追従した任意の歌詞を合成できるメロディ駆動のSVSフレームワークを提案する。
提案手法は,Diffusion Transformer (DiT) アーキテクチャ上に構築され,メロディ抽出モジュールに拡張されている。
論文 参考訳(メタデータ) (2025-12-04T13:25:33Z) - CoMelSinger: Discrete Token-Based Zero-Shot Singing Synthesis With Structured Melody Control and Guidance [6.797243060589937]
歌声合成(SVS)は、歌詞やピッチシーケンスなどの構造化された音楽入力から、表現力のある音声演奏を生成することを目的としている。
本稿では,離散音色モデリングパラダイム内でのメロディ構造制御を実現するフレームワークであるCoMelSingerを提案する。
我々は,CoMelSingerが,競争ベースラインよりもピッチ精度,一貫性,ゼロショット転送性において顕著な改善を実現していることを示す。
論文 参考訳(メタデータ) (2025-09-24T08:34:19Z) - Scaling Self-Supervised Representation Learning for Symbolic Piano Performance [52.661197827466886]
本研究では,多量のシンボリック・ピアノ転写を訓練した自己回帰型トランスフォーマモデルの能力について検討した。
比較的小型で高品質なサブセットをファインチューンモデルに使い、音楽の継続を生成、シンボリックな分類タスクを実行し、汎用的なコントラストMIDI埋め込みを生成する。
論文 参考訳(メタデータ) (2025-06-30T14:00:14Z) - Adaptive Accompaniment with ReaLchords [60.690020661819055]
ユーザのメロディに合わせてコード伴奏を即興するオンライン生成モデルであるReaLchordsを提案する。
まず、最大で事前訓練されたオンラインモデルから始め、強化学習を使用して、オンライン使用のためのモデルを微調整します。
論文 参考訳(メタデータ) (2025-06-17T16:59:05Z) - A correlation-permutation approach for speech-music encoders model merging [80.83944654755022]
本稿では,音楽エンコーダの内部層を音声エンコーダと整合させる相関置換手法を提案する。
この方法は、モデルの特徴的相互相関層を層単位で最大化する置換行列を計算する。
この作業により、独立に訓練されたエンコーダから統一されたオーディオモデルを作成することができる。
論文 参考訳(メタデータ) (2025-06-13T02:04:33Z) - Yin-Yang: Developing Motifs With Long-Term Structure And Controllability [2.8293595093932953]
Yin-Yangは、フレーズジェネレータ、フレーズリファインダ、フレーズセレクタモデルで構成されるフレームワークである。
そこで本稿では,モチーフがいかにスムーズであるかを定量化するための,新たな客観的評価指標を提案する。
論文 参考訳(メタデータ) (2025-01-29T16:50:09Z) - Neighbour Consistency Guided Pseudo-Label Refinement for Unsupervised
Person Re-Identification [80.98291772215154]
教師なしの人物再識別(ReID)は、アノテーションを使わずに人物検索のための識別的アイデンティティの特徴を学習することを目的としている。
近年の進歩はクラスタリングに基づく擬似ラベルを活用することで実現されている。
本稿では, Pseudo Label Refinement フレームワークを提案する。
論文 参考訳(メタデータ) (2022-11-30T09:39:57Z) - SimMC: Simple Masked Contrastive Learning of Skeleton Representations
for Unsupervised Person Re-Identification [63.903237777588316]
SimMC(Simple Masked Contrastive Learning)フレームワークを提案する。
具体的には、各骨格配列内の骨格の特徴を完全に活用するために、まずマスク付きプロトタイプコントラスト学習(MPC)方式を考案する。
そこで我々は,サブシーケンス間のシーケンス内パターンの整合性を捉えるために,マスク付きシーケンス内コントラスト学習(MIC)を提案する。
論文 参考訳(メタデータ) (2022-04-21T00:19:38Z) - Time-Frequency Scattering Accurately Models Auditory Similarities
Between Instrumental Playing Techniques [5.923588533979649]
音色知覚は楽器や演奏技術だけで提供されるものよりも柔軟な分類法で機能することを示す。
本稿では,楽器,ミュート,技法間の類似性のクラスタグラフを復元するマシンリスニングモデルを提案する。
論文 参考訳(メタデータ) (2020-07-21T16:37:15Z) - Skeleton-Aware Networks for Deep Motion Retargeting [83.65593033474384]
骨格間のデータ駆動動作のための新しいディープラーニングフレームワークを提案する。
我々の手法は、トレーニングセットの運動間の明確なペアリングを必要とせずに、再ターゲティングの仕方を学ぶ。
論文 参考訳(メタデータ) (2020-05-12T12:51:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。