論文の概要: LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training
- arxiv url: http://arxiv.org/abs/2606.30642v1
- Date: Mon, 29 Jun 2026 17:59:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.376101
- Title: LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training
- Title(参考訳): LeVo 2:階層的表現モデルと漸進的ポストトライニングによる安定メロディーの歌生成
- Authors: Shun Lei, Huaicheng Zhang, Dapeng Wu, Yaoxun Xu, Lishi Zuo, Wei Tan, Hangting Chen, Guangzheng Li, Jianwei Yu, Zhiyong Wu, Dong Yu,
- Abstract要約: 完全長の曲生成は、コヒーレンスと音楽性を保ち、詳細なボーカルと伴奏の音響を描画し、歌詞とプロンプトに従う必要がある。
本稿ではLLM-DiffusionフレームワークであるLeVo 2について述べる。
- 参考スコア(独自算出の注目度): 42.48917906211788
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Full-length song generation must preserve coherence and musicality, render detailed vocal and accompaniment acoustics, and follow lyrics and prompts. Existing language model-based systems face a structural trade-off: mixed-token modeling preserves vocal-instrument coordination but obscures track-specific details, whereas dual-track prediction improves acoustics but requires longer sequences and weakens global planning. We present LeVo 2, a hybrid LLM-Diffusion framework for controllable full-length song generation. LeVo 2 formulates this trade-off as hierarchical modeling: LeLM first predicts mixed tokens for semantic planning, then predicts vocal and accompaniment tokens in parallel for track-specific refinement, while a diffusion-based Music Codec reconstructs full-length waveforms. A central contribution of this extended version is an aesthetics-guided training schedule for alignment. During pre-training, an automated music aesthetic evaluation framework assigns musicality-tier conditions to large-scale data, providing musicality priors before preference alignment. Progressive post-training applies SFT, large-scale offline DPO, and closed-loop semi-online DPO to separately improve generation quality, controllability, and musicality. Modular extension then trains the Track-Specific LM for acoustic refinement while preserving the aligned semantic planner. This schedule separates musicality learning, controllability alignment, and acoustic refinement, mitigating optimization conflict and the limitations of static offline preference pairs. Expert listening tests and objective evaluations show that LeVo 2 outperforms open-source baselines across six subjective dimensions, and approaches leading commercial systems on several listening metrics. Ablations validate the effects of the training strategy, aesthetics guidance, scaling, and hierarchical architecture.
- Abstract(参考訳): 完全長の曲生成は、コヒーレンスと音楽性を保ち、詳細なボーカルと伴奏の音響を描画し、歌詞とプロンプトに従う必要がある。
既存の言語モデルに基づくシステムは、構造的なトレードオフに直面している: 混合トーケンモデリングは、声道構成の調整を保ちながら、トラック固有の詳細を隠蔽するが、二重トラック予測は音響性を改善するが、より長いシーケンスを必要とし、グローバルプランニングを弱める。
本稿ではLLM-DiffusionフレームワークであるLeVo 2について述べる。
LeLMはまずセマンティックプランニングのための混合トークンを予測し、次にトラック固有の洗練のために声帯と伴奏のトークンを並列に予測し、拡散ベースのミュージックコーデックはフル長の波形を再構成する。
この拡張バージョンの中心的な貢献は、アライメントのための美学誘導トレーニングスケジュールである。
事前学習中、自動的な音楽美観評価フレームワークは、音楽性レベル条件を大規模データに割り当て、好みのアライメントの前に音楽性を優先する。
プログレッシブポストトレーニングでは、SFT、大規模オフラインDPO、クローズループセミオンラインDPOを適用して、生成品質、制御性、音楽性を別々に改善する。
モジュール拡張は、アライメントされたセマンティックプランナーを保持しながら、音質改善のためにトラック特化LMを訓練する。
このスケジュールは、音楽性学習、制御可能性アライメント、音響改善、最適化競合の緩和、静的なオフライン選好ペアの制限を分離する。
専門家のリスニングテストと客観的評価によると、LeVo 2は6つの主観的な次元でオープンソースベースラインを上回り、複数のリスニングメトリクスで商用システムをリードしている。
アブレーションは、トレーニング戦略、美学指導、スケーリング、階層アーキテクチャの効果を検証する。
関連論文リスト
- FIGMA: Towards FIne-Grained Music retrievAl [65.98380295254817]
自然言語記述による音楽の検索はCLAPのような対照的な音声テキストモデルで改善されているが、現在のシステムはいまだに大まかなセマンティッククエリに限られている。
この制限は、長いキャプションで訓練されているにもかかわらず、CLAPベースのモデルは、最初の数個のトークンのみを効果的に活用する。
本研究では,グローバルな音声テキストアライメントとフレームレベルのトークンアライメントを共同で最適化することで,この制限に対処するマルチビューコントラストアーキテクチャであるFIGMAを提案する。
論文 参考訳(メタデータ) (2026-06-04T18:05:39Z) - LeVo: High-Quality Song Generation with Multi-Preference Alignment [47.965028296133426]
我々はLeLMとMusic Codecで構成される言語モデルベースのフレームワークであるLeVoを紹介する。
LeVoは2種類のトークンを並列にモデリングすることができる。
2つのデコーダのみのトランスフォーマーと、異なるトークンタイプ間の干渉を防ぐためのモジュール拡張トレーニング戦略を採用している。
論文 参考訳(メタデータ) (2025-06-09T07:57:24Z) - FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing [81.3306413498174]
Movie Dubbingは、スクリプトを、時間的および感情的な両方の面において、所定の映画クリップと整合するスピーチに変換することを目的としている。
既存の手法は、リップシンクと音響品質の重要性を無視しながら、単語エラー率の低減に重点を置いている。
ダビングのための大規模言語モデル(LLM)に基づくフローマッチングアーキテクチャであるFlowDubberを提案する。
論文 参考訳(メタデータ) (2025-05-02T13:30:19Z) - Unifying Symbolic Music Arrangement: Track-Aware Reconstruction and Structured Tokenization [19.27890803128116]
自動マルチトラック音楽アレンジメントのための統合フレームワークを提案する。
中心となるのは、トークンレベルのアンタングルされたコンテンツとスタイルで動作するセグメントレベルの再構築目標である。
トラックワイズ・モデリングを支援するため,マルチトラック・シンボリック・ミュージックのための構造化トークン化手法であるREMI-zを導入する。
論文 参考訳(メタデータ) (2024-08-27T16:18:51Z) - Continuous Melody Generation via Disentangled Short-Term Representations
and Structural Conditions [14.786601824794369]
ユーザが指定したシンボリックシナリオと過去の音楽コンテキストを組み合わせることで,メロディーを構成するモデルを提案する。
本モデルでは,8拍子の音符列を基本単位として長い旋律を生成でき,一貫したリズムパターン構造を他の特定の歌と共有することができる。
その結果,本モデルが生成する音楽は,顕著な繰り返し構造,豊かな動機,安定したリズムパターンを有する傾向が示唆された。
論文 参考訳(メタデータ) (2020-02-05T06:23:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。