論文の概要: WanSong v1.0 Technical Report
- arxiv url: http://arxiv.org/abs/2607.14749v2
- Date: Wed, 22 Jul 2026 07:28:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 16:42:31.471638
- Title: WanSong v1.0 Technical Report
- Title(参考訳): WanSong v1.0テクニカルレポート
- Authors: Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou,
- Abstract要約: textbfWanSongは、単一の実行で最大5分までの高忠実で多言語的な歌を直接生成する、純粋な拡散ベースのモデルである。
我々の拡散フレームワークは、ステップ蒸留による高速な推論を可能にし、下流編集タスクをサポートするための微調整とカスタマイズのための効率的な経路を提供する。
- 参考スコア(独自算出の注目度): 34.242124400018625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Music generation foundation models have recently attracted significant industry attention. However, achieving efficient generation and high-fidelity long-form audio while supporting controllability remains challenging. To address these needs, we present \textbf{WanSong}, a simple yet powerful approach for long-form, commercial-grade song generation. Unlike autoregressive (AR) and cascaded multi-stage pipelines (\eg, AR followed by diffusion), \textbf{WanSong} is a pure diffusion-based model that directly generates high-fidelity, multilingual songs up to 5 minutes and outputs dual stems (vocals and background music) in a single run. In addition, our diffusion framework enables faster inference through step-distillation, and offers an efficient pathway for fine-tuning and customization to support downstream editing tasks.
- Abstract(参考訳): 音楽制作の基礎モデルは近年、産業的に大きな注目を集めている。
しかし、制御性をサポートしながら、効率的な生成と高忠実度長大音声を実現することは依然として困難である。
これらのニーズに対処するために、長い形式の商用曲生成のためのシンプルで強力なアプローチである \textbf{WanSong} を提示する。
オートレグレッシブ(AR)やカスケードされたマルチステージパイプライン(\eg, AR)とは異なり、 \textbf{WanSong} は完全な拡散ベースモデルであり、高忠実で多言語的な歌を直接生成し、1回の実行で2つの茎(ボーカルとバックグラウンド音楽)を出力する。
さらに,我々の拡散フレームワークは,ステップ蒸留による推論を高速化し,下流編集タスクをサポートするための微調整やカスタマイズを行うための効率的な経路を提供する。
関連論文リスト
- Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length [57.458450695137664]
提案するLive Avatarは,効率的,高忠実,無限長アバター生成のためのアルゴリズム設計のフレームワークである。
ライブアバターは、このスケールで実用的でリアルタイムで高忠実なアバター生成を実現するのが最初である。
論文 参考訳(メタデータ) (2025-12-04T11:11:24Z) - StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation [91.45910771331741]
オーディオ駆動型アバタービデオ生成のための現在の拡散モデルでは、自然な音声同期とアイデンティティの整合性を備えた長ビデオの合成が困難である。
本稿では,無限長高画質映像を後処理なしで合成する最初のエンドツーエンドビデオ拡散変換器であるStableAvatarについて述べる。
論文 参考訳(メタデータ) (2025-08-11T17:58:24Z) - SAMUeL: Efficient Vocal-Conditioned Music Generation via Soft Alignment Attention and Latent Diffusion [0.0]
声調伴奏生成のための軽量潜時拡散モデルを提案する。
このモデルは、52倍高速な推論を実現しつつ、最先端システムと比較して220倍のパラメータ削減を実現している。
超軽量アーキテクチャは、コンシューマハードウェアへのリアルタイムデプロイメントを可能にし、対話型アプリケーションやリソース制約のある環境に対してAI支援音楽の作成を可能にする。
論文 参考訳(メタデータ) (2025-07-26T16:00:26Z) - Diff-A-Riff: Musical Accompaniment Co-creation via Latent Diffusion Models [0.0]
ディフ・A・リフ(Diff-A-Riff)は、あらゆる音楽的文脈に適応する高品質な楽器を生成するために設計された潜在拡散モデルである。
48kHzの擬似ステレオオーディオを生成し、推論時間とメモリ使用量を大幅に削減する。
論文 参考訳(メタデータ) (2024-06-12T16:34:26Z) - DITTO: Diffusion Inference-Time T-Optimization for Music Generation [49.90109850026932]
Diffusion Inference-Time T-Optimization (DITTO) は、事前訓練されたテキストから音楽への拡散モデルを推論時に制御するためのフレームワークである。
我々は、インペイント、アウトペイント、ループ化、強度、メロディ、音楽構造制御など、驚くほど幅広い音楽生成応用を実証する。
論文 参考訳(メタデータ) (2024-01-22T18:10:10Z) - JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation [18.979064278674276]
JEN-1 Composerは、マルチトラック音楽上での限界分布、条件分布、共同分布を効率的にモデル化するように設計されている。
本研究では、段階的なカリキュラム学習戦略を導入し、段階的に訓練作業の難しさを増大させる。
提案手法は,制御可能かつ高忠実なマルチトラック音楽合成における最先端性能を示す。
論文 参考訳(メタデータ) (2023-10-29T22:51:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。