論文の概要: Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators
- arxiv url: http://arxiv.org/abs/2605.22717v1
- Date: Thu, 21 May 2026 16:54:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.354945
- Title: Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators
- Title(参考訳): ライブ音楽拡散モデル:インタラクティブ・ディフュージョン・ミュージック・ジェネレータの効率的な微調整とポスト・トレーニング
- Authors: Zachary Novack, Stephen Brade, Haven Kim, Hugo Flores García, Nithya Shikarpur, Chinmay Talegaonkar, Suwan Kim, Valerie K. Chen, Julian McAuley, Taylor Berg-Kirkpatrick, Cheng-Zhi Anna Huang,
- Abstract要約: 消費者ハードウェア上でアクセス可能な対話型モデルに音声拡散モデルを効率的に再利用できるかどうかを検討する。
本稿では,再生した再生拡散過程を簡易に修正したLive Music Diffusion Models (LMDMs)を提案する。
本稿では,テキスト条件付き生成,スケッチベース音楽合成,ジャミングなど,多くの創造領域におけるLMDMの適用例を示す。
- 参考スコア(独自算出の注目度): 36.60063502881073
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Interactive streaming music generation promises the use of generative models for live performance and co-creation that is impossible with offline models. However, SOTA models exist in the discrete-AR regime, requiring industrial levels of compute for both training and inference. In this work, we investigate whether audio diffusion models, with their wide support in the open-source community but non-streaming bidirectional nature, can be repurposed efficiently into interactive models accessible on consumer hardware. By taking a critical look at the modern pipeline for block-wise outpainting diffusion, we identify critical inefficiencies during inference that result in strictly worse computational efficiency than their discrete-AR counterparts. We propose Live Music Diffusion Models (LMDMs), a simple modification of the generative diffusion process that recovers, and then outperforms, the inference complexity of the discrete Live Music Models (LMMs) through block-wise KV Caching. Unlike LMMs, LMDMs further enable stable post-training alignment through our novel ARC-Forcing paradigm, reducing error accumulation without any explicit RL or reward models. We demonstrate the application of LMDMs in a number of creative domains, including text-conditioned generation, sketch-based music synthesis, and jamming. We finally show how LMDMs can be used as a generative instrument in a real artist-AI collaboration, utilizing LMDMs as a "generative delay" to transform musicians' improvisation live for variable timbral effects while running locally on a consumer gaming laptop.
- Abstract(参考訳): インタラクティブなストリーミング音楽生成は、オフラインモデルでは不可能なライブパフォーマンスとコクリエーションに生成モデルを使用することを約束する。
しかし、SOTAモデルは離散ARシステムに存在し、トレーニングと推論の両方に産業レベルの計算を必要とする。
本研究では,オープンソースコミュニティで広くサポートされている音声拡散モデルと非ストリーミング双方向特性を,コンシューマハードウェア上でアクセス可能な対話型モデルに効率的に再利用できるかどうかを検討する。
ブロックワイズ拡散に対する現代のパイプラインを批判的に見ていくことで、予測中の重要な非効率性を同定し、離散ARよりも計算効率が著しく悪いことを示す。
ブロックワイドKVキャッシングによる離散的音楽モデル (LMM) の推論複雑性を回復し, 性能を向上する, 生成拡散過程の簡易な修正であるLive Music Diffusion Models (LMDMs) を提案する。
LMMと異なり、LMDMは、新しいARC-Forcingパラダイムにより、より安定したトレーニング後アライメントを可能にし、明示的なRLや報酬モデルなしでエラーの蓄積を低減する。
本稿では,テキスト条件付き生成,スケッチベース音楽合成,ジャミングなど,多くの創造領域におけるLMDMの適用例を示す。
最終的に、LMDMが実際のアーティストとAIのコラボレーションにおいて生成器としてどのように使用できるかを示し、LMDMを「生成遅延」として利用して、ミュージシャンの即興的なライブを、コンシューマーゲームラップトップ上でローカルに実行しながら、様々な鼓動効果のために変換する。
関連論文リスト
- Towards Real-Time Human-AI Musical Co-Performance: Accompaniment Generation with Latent Diffusion Models and MAX/MSP [10.7598634894472]
本稿では,リアルタイムな人間-AI音楽の協調演奏のための枠組みについて述べる。
このシステムは、MAX/MSPのフロントエンド処理によるリアルタイムオーディオ入力、バッファリング、再生を、OSC/UDPメッセージを介して通信する生成モデルを実行するPython推論サーバと組み合わせる。
論文 参考訳(メタデータ) (2026-04-08T21:30:05Z) - Causal Autoregressive Diffusion Language Model [70.7353007255797]
CARDは厳密な因果注意マスク内の拡散過程を再構成し、単一の前方通過で密集した1対1の監視を可能にする。
我々の結果は,CARDが並列生成のレイテンシの利点を解放しつつ,ARMレベルのデータ効率を実現することを示す。
論文 参考訳(メタデータ) (2026-01-29T17:38:29Z) - Hybrid Autoregressive-Diffusion Model for Real-Time Sign Language Production [0.0]
我々は手話生成のための自己回帰モデルと拡散モデルを組み合わせたハイブリッドアプローチを開発する。
微粒な体の動きを捉えるため,異なる音節から細かな特徴を別々に抽出するマルチスケール・ポース表現モジュールを設計した。
ポーズ生成過程を動的に導くために,共同レベルの信頼度スコアを利用する信頼度対応型因果注意機構を導入する。
論文 参考訳(メタデータ) (2025-07-12T01:34:50Z) - ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer [95.80384464922147]
ACDiTはブロックワイド条件拡散変換器である。
トークン単位の自己回帰とフルシーケンス拡散のフレキシブルな関係を提供する。
本稿では,映像生成タスクにおける自己回帰ベースラインの中で,ACDiTが最良であることを示す。
論文 参考訳(メタデータ) (2024-12-10T18:13:20Z) - Energy-Based Diffusion Language Models for Text Generation [126.23425882687195]
エネルギーベース拡散言語モデル(Energy-based Diffusion Language Model, EDLM)は、拡散ステップごとに全シーケンスレベルで動作するエネルギーベースモデルである。
我々のフレームワークは、既存の拡散モデルよりも1.3$times$のサンプリングスピードアップを提供する。
論文 参考訳(メタデータ) (2024-10-28T17:25:56Z) - Efficient Neural Music Generation [42.39082326446739]
本稿では,最先端品質の音楽オーディオを生成するLM誘導拡散モデルであるMeLoDy(音楽用M,LM用L,拡散用D)を提案する。
MeLoDyは、マンティックモデリングのためにMusicLMから最高レベルのLMを継承し、新しいデュアルパス拡散(DPD)モデルとオーディオVAE-GANを適用して、条件付きセマンティックトークンを波形に効率的に復号する。
論文 参考訳(メタデータ) (2023-05-25T05:02:35Z) - Diffusion Recommender Model [85.9640416600725]
そこで我々は,DiffRecと呼ばれる新しい拡散レコメンダモデルを提案し,その生成過程を認知的に学習する。
ユーザインタラクションにおけるパーソナライズされた情報を維持するため、DiffRecは追加のノイズを低減し、画像合成のような純粋なノイズに対するユーザのインタラクションを損なうことを避ける。
論文 参考訳(メタデータ) (2023-04-11T04:31:00Z) - A Cheaper and Better Diffusion Language Model with Soft-Masked Noise [62.719656543880596]
Masked-Diffuse LMは言語モデリングのための新しい拡散モデルであり、言語の言語的特徴に触発されている。
具体的には,テキストデータのノイズを改善するために,戦略的ソフトマスキングによってテキストに劣化を加える言語情報処理を設計する。
我々は,我々のMasked-Diffuse LMが,高効率の最先端拡散モデルよりも優れた生成品質を達成できることを実証した。
論文 参考訳(メタデータ) (2023-04-10T17:58:42Z) - Streamable Neural Audio Synthesis With Non-Causal Convolutions [1.8275108630751844]
非因果的ストリーミングモデルを生成するための新しい手法を提案する。
これにより、任意の畳み込みモデルをリアルタイムバッファベースの処理と互換性を持たせることができる。
並列ブランチで複雑なアーキテクチャに適合させる方法を示す。
論文 参考訳(メタデータ) (2022-04-14T16:00:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。