論文の概要: Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering
- arxiv url: http://arxiv.org/abs/2607.20253v2
- Date: Thu, 23 Jul 2026 14:43:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 14:12:06.75622
- Title: Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering
- Title(参考訳): フルソン・ジェネレーションの最前線:階層的自己回帰計画とフローマッチング・レンダリング
- Authors: Junyu Dai, Xinyue Fan, Weiqin Li, Xiangang Li, Yunjia Li, Bin Ma, Yukun Ma, Chongjia Ni, Yufei Shi, Biao Tian, Haoxu Wang, Menglin Wu, Jianwei Yu, Huaicheng Zhang, Han Zhao, Shengkui Zhao, Haina Zhu,
- Abstract要約: 本稿では,歌詞,テキスト記述,音楽属性から高品質なフル長楽曲を生成できる統一的な楽曲生成フレームワークを提案する。
提案フレームワークは,歌詞・歌詞・音楽属性から完全曲を生成するLyrics-to-Song Generation,ボーカルのない音楽を生成するInstrumental Music Generation,メロディックコンテンツを保存しながら既存の歌を異なるスタイルで再解釈するCover Song Generationの3つのタスクをサポートする。
- 参考スコア(独自算出の注目度): 36.032642952445414
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: In this report, we present a unified song generation framework capable of producing high-quality full-length music from lyrics, text descriptions, and musical attributes. The proposed framework supports three tasks: Lyrics-to-Song Generation, which generates complete songs from text descriptions, lyrics, and musical attributes; Instrumental Music Generation, which creates music without vocals; and Cover Song Generation, which reinterprets existing songs with different styles while preserving their melodic content. Architecturally, our system consists of four main components: a semantic-aware tokenizer, hybird-LM, FullDiT, and a two-level melody module. The tokenizer encodes audio into 8-codebook RVQ tokens for efficient discrete music representation. Based on these tokens, hybird-LM performs hierarchical autoregressive audio-token modeling for full-song generation. To improve audio fidelity, FullDiT performs full-song flow matching in a continuous VAE latent space conditioned on codec tokens, lyrics, and text captions. For cover song generation, the melody module extracts and discretizes melody cues from reference audio to guide generation while preserving the original melodic content. Finally, we investigate DPO, GRPO, and OPD as reward-based post-training strategies for hybird-LM and apply flow-based GRPO to FullDiT to improve musicality and rendering quality. Experimental results on a multilingual automatic benchmark, complemented by the Artificial Analysis Music with Vocals leaderboard, show that the proposed framework achieves competitive performance in the evaluated settings.
- Abstract(参考訳): 本稿では,歌詞,テキスト記述,音楽属性から高品質なフル長楽曲を生成できる統一的な楽曲生成フレームワークを提案する。
提案フレームワークは,歌詞・歌詞・音楽属性から完全曲を生成するLyrics-to-Song Generation,ボーカルのない音楽を生成するInstrumental Music Generation,メロディ的コンテンツを保存しながら,既存の曲を異なるスタイルで再解釈するCover Song Generationの3つのタスクをサポートする。
アーキテクチャ上,本システムはセマンティック・アウェア・トークンー,ハイバード・LM,FullDiT,および2レベルメロディモジュールの4つの主要コンポーネントから構成される。
トークン化器は、8コードブックのRVQトークンに音声を符号化し、効率的な離散音楽表現を行う。
これらのトークンに基づいて,Hybird-LMは実歌生成のための階層的自己回帰型オーディオトケンモデリングを行う。
音声の忠実性を改善するため、FullDiTは、コーデックトークン、歌詞、テキストキャプションに条件付された連続VAEラテント空間で全音フローマッチングを実行する。
カバーソング生成のために、メロディモジュールは、オリジナルのメロディコンテンツを保持しつつ、基準音声からガイド生成へメロディキューを抽出し、識別する。
最後に,Hybird-LMの報酬ベースポストトレーニング戦略としてDPO,GRPO,OPDについて検討し,フローベースGRPOをFullDiTに適用して音楽性およびレンダリング品質を向上させる。
The Artificial Analysis Music with Vocals Leaderboardによって補完された多言語自動ベンチマークの実験結果から,提案手法が評価設定において競合性能を達成することを示す。
関連論文リスト
- Libretto: Giving LLM Agents a Sense of Musical Structure [4.144744763257738]
シンボリック音楽生成とリビジョンのためのフレームワークであるLibrettoを紹介する。
リブレットは、リズム、ハーモニー、メロディ、テクスチャ、フォーム、変奏に関するコーパス校正された統計空間で各曲を評価する。
ギャップフィリング、参照誘導フルピース生成、漸進的なモーフィング、教育音楽生成など、Librettoは、シンボル音楽を生のトークンシーケンスから言語モデルエージェントの計測可能で編集可能なオブジェクトに変換する。
論文 参考訳(メタデータ) (2026-06-21T22:56:07Z) - FIGMA: Towards FIne-Grained Music retrievAl [65.98380295254817]
自然言語記述による音楽の検索はCLAPのような対照的な音声テキストモデルで改善されているが、現在のシステムはいまだに大まかなセマンティッククエリに限られている。
この制限は、長いキャプションで訓練されているにもかかわらず、CLAPベースのモデルは、最初の数個のトークンのみを効果的に活用する。
本研究では,グローバルな音声テキストアライメントとフレームレベルのトークンアライメントを共同で最適化することで,この制限に対処するマルチビューコントラストアーキテクチャであるFIGMAを提案する。
論文 参考訳(メタデータ) (2026-06-04T18:05:39Z) - LeVo: High-Quality Song Generation with Multi-Preference Alignment [47.965028296133426]
我々はLeLMとMusic Codecで構成される言語モデルベースのフレームワークであるLeVoを紹介する。
LeVoは2種類のトークンを並列にモデリングすることができる。
2つのデコーダのみのトランスフォーマーと、異なるトークンタイプ間の干渉を防ぐためのモジュール拡張トレーニング戦略を採用している。
論文 参考訳(メタデータ) (2025-06-09T07:57:24Z) - SongComposer: A Large Language Model for Lyric and Melody Generation in Song Composition [82.38021790213752]
SongComposerは、音楽専門の大規模言語モデル(LLM)である。
3つの重要なイノベーションを活用することで、メロディーをLLMに同時に構成する能力を統合する。
歌詞からメロディへの生成、メロディから歌詞への生成、歌の継続、テキストから歌への生成といったタスクにおいて、高度なLLMよりも優れています。
SongComposeは大規模なトレーニング用データセットで、中国語と英語の歌詞とメロディのペアを含む。
論文 参考訳(メタデータ) (2024-02-27T16:15:28Z) - Simple and Controllable Music Generation [94.61958781346176]
MusicGenは単一の言語モデル(LM)であり、圧縮された離散的な音楽表現、すなわちトークンの複数のストリームで動作する。
以前の作業とは異なり、MusicGenはシングルステージのトランスフォーマーLMと効率的なトークンインターリービングパターンで構成されている。
論文 参考訳(メタデータ) (2023-06-08T15:31:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。