論文の概要: MPEcho: A Melody and Phoneme-Aware Generative Framework for Controllable Cover Song Generation
- arxiv url: http://arxiv.org/abs/2607.26698v1
- Date: Wed, 29 Jul 2026 09:45:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.613825
- Title: MPEcho: A Melody and Phoneme-Aware Generative Framework for Controllable Cover Song Generation
- Title(参考訳): MPEcho:制御可能なカバーソング生成のためのメロディ・音素認識生成フレームワーク
- Authors: Wei-Jaw Lee, Hsuan-Yu Yeh, Ting-Yi Hu, Chih-Pin Tan, Fang-Duo Tsai, Yi-Hsuan Yang,
- Abstract要約: カバー・ソング・ジェネレーション(CSG)は、残りの楽曲を再生しながら、レファレンス・ソングのメロディ的・言語的内容を保存するべきである。
最先端モデルのSongEchoは、条件付けに$F_0$シーケンスとV/UVタグを使用する。
我々は,SongEchoフレームワークに音素エンコーダと長さ調整器を統合したMPEchoを提案する。
- 参考スコア(独自算出の注目度): 5.1453729726764825
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cover song generation (CSG) should preserve the melodic and linguistic content of a reference song while recreating the remaining musical components. The state-of-the-art model SongEcho utilizes $F_0$ sequences and voiced/unvoiced (V/UV) tags for conditioning; however, implicit linguistic information from V/UV tags cannot guarantee lyric accuracy, leading to a high phoneme error rate (PER). Inspired by singing voice synthesis (SVS), we propose MPEcho, which integrates a phoneme encoder and a length regulator (LR) into the SongEcho framework. By providing explicit phoneme-level conditioning and precise temporal boundaries, MPEcho significantly reduces PER. To enable this, we developed Phonsa, a Whisper-based automatic transcription model that provides high-precision phoneme-level annotations for singing voices, overcoming the scarcity of high-quality audio-phoneme pairs. Experimental results validate the effectiveness of Phonsa for alignment and MPEcho for end-to-end CSG. The audio samples, code and weights can be accessed from https://lonian6.github.io/MPEcho.github.io/.
- Abstract(参考訳): カバー・ソング・ジェネレーション(CSG)は、残りの楽曲を再生しながら、レファレンス・ソングのメロディ的・言語的内容を保存するべきである。
最先端モデルのSongEchoは、条件付けに$F_0$シーケンスとV/UVタグを使用するが、V/UVタグからの暗黙的な言語情報は歌詞の精度を保証できず、高い音素誤り率(PER)をもたらす。
歌唱音声合成(SVS)にインスパイアされたMPEchoは,音素エンコーダと長レギュレータ(LR)をSongEchoフレームワークに統合する。
明示的な音素レベルの条件付けと正確な時間境界を提供することで、MPEchoはPERを大幅に削減する。
これを実現するため,Whisper をベースとした音声合成モデル Phonsa を開発した。
終末CSGにおけるPhonsaとMPEchoの有効性を実験的に検証した。
オーディオサンプル、コード、ウェイトはhttps://lonian6.github.io/MPEcho.github.io/からアクセスすることができる。
関連論文リスト
- Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering [36.032642952445414]
本稿では,歌詞,テキスト記述,音楽属性から高品質なフル長楽曲を生成できる統一的な楽曲生成フレームワークを提案する。
提案フレームワークは,歌詞・歌詞・音楽属性から完全曲を生成するLyrics-to-Song Generation,ボーカルのない音楽を生成するInstrumental Music Generation,メロディックコンテンツを保存しながら既存の歌を異なるスタイルで再解釈するCover Song Generationの3つのタスクをサポートする。
論文 参考訳(メタデータ) (2026-07-22T15:11:46Z) - VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models [45.70355425430011]
LALM(Large Audio Language Model)上に構築されたSVTモデルであるVocalParseについて述べる。
我々の新しい貢献は、歌詞、メロディ、音符対応を共同でモデル化し、構造化された楽譜に直接マッピングする生成シーケンスを生成するインターリーブ・プロンプト・フォーミュレーションの導入である。
実験では、VocalParseが複数の歌唱データセット上で最先端のSVTパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2026-05-06T08:03:31Z) - Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control [66.46754271097555]
我々は, きめ細かなスタイル条件付き長大な楽曲生成のための, 完全オープンソースシステムをリリースする。
データセットは116kの完全ライセンスの合成曲で構成され、自動生成の歌詞とスタイル記述がある。
我々は、個別の音声トークンで拡張されたQwenベースの言語モデルの単一ステージ教師付き微調整によりMuseを訓練する。
論文 参考訳(メタデータ) (2026-01-07T14:40:48Z) - An End-to-End Approach for Chord-Conditioned Song Generation [14.951089833579063]
歌唱課題は、歌詞から声楽と伴奏からなる音楽を合成することを目的としている。
この問題を軽減するため,コードから曲生成ネットワークまで,音楽作曲から重要な概念を導入する。
そこで本研究では,CSG(Chord-Conditioned Song Generator)と呼ばれる新しいモデルを提案する。
論文 参考訳(メタデータ) (2024-09-10T08:07:43Z) - Arrange, Inpaint, and Refine: Steerable Long-term Music Audio Generation and Editing via Content-based Controls [6.176747724853209]
LLM(Large Language Models)は、高品質な音楽を生成する上で有望であるが、自動回帰生成に焦点をあてることで、音楽編集タスクにおける有用性を制限している。
本稿では,パラメータ効率の高いヘテロジニアスアダプタとマスキングトレーニングスキームを組み合わせた新しいアプローチを提案する。
提案手法は, フレームレベルのコンテンツベース制御を統合し, トラックコンディショニングとスコアコンディショニングによる音楽アレンジメントを容易にする。
論文 参考訳(メタデータ) (2024-02-14T19:00:01Z) - LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT [48.28624219567131]
リリックウィズ(LyricWhiz)は、頑健で、多言語で、ゼロショットの自動歌詞書き起こし方式である。
我々は、弱教師付き頑健な音声認識モデルであるWhisperと、今日の最もパフォーマンスの高いチャットベースの大規模言語モデルであるGPT-4を使用している。
実験の結果,LyricWhizは英語の既存手法に比べて単語誤り率を大幅に低下させることがわかった。
論文 参考訳(メタデータ) (2023-06-29T17:01:51Z) - Melody-Conditioned Lyrics Generation with SeqGANs [81.2302502902865]
本稿では,SeqGAN(Sequence Generative Adversarial Networks)に基づく,エンドツーエンドのメロディ条件付き歌詞生成システムを提案する。
入力条件が評価指標に悪影響を及ぼすことなく,ネットワークがより有意義な結果が得られることを示す。
論文 参考訳(メタデータ) (2020-10-28T02:35:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。