論文の概要: Pitch-class Steering for Diffusion-based Music Generation via Latent-space Probes
- arxiv url: http://arxiv.org/abs/2609.04516v1
- Date: Thu, 03 Sep 2026 22:07:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.839873
- Title: Pitch-class Steering for Diffusion-based Music Generation via Latent-space Probes
- Title(参考訳): 潜時空間プローブによる拡散型音楽生成のためのピッチクラスステアリング
- Abstract要約: 本稿では,音楽合成のための潜時拡散モデルであるStable Audio Open が生み出した音声のピッチ内容の操り方について述べる。
約125kのパラメータを含む小さな畳み込みプローブを用いてフレームレベルのピッチクラスのアクティベーションをデコードする。
9つのテキストプロンプトと3つのターゲットメロディにまたがる27回にわたる評価試験では、プローブ誘導生成は無誘導ベースライン上でメロディコヒーレンスを2.4倍増加させる。
- 参考スコア(独自算出の注目度): 3.7490738507789043
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent work on controllable music generation has focused on autoregressive models, leaving diffusion-based systems comparatively underexplored. We present a lightweight method for steering the pitch content of audio produced by Stable Audio Open, a latent diffusion model for music synthesis. A small convolutional probe containing approximately 125k parameters is trained to decode frame-level pitch-class activations from the model's variational autoencoder latent space, using paired audio and MIDI data. At inference time, the frozen probe serves as a differentiable loss function: its gradient with respect to the denoising latent is used to nudge generation toward a user-specified pitch-class sequence, requiring no retraining or architectural modification of the base model. Across 27 evaluation trials spanning 9 text prompts and 3 target melodies, probe-guided generation increases melodic coherence by 2.4x over the unguided baseline (p < 1e-5, Wilcoxon signed-rank test), demonstrating that musically meaningful structure is both recoverable and steerable in diffusion-based music latent spaces.
- Abstract(参考訳): 制御可能な音楽生成に関する最近の研究は自己回帰モデルに重点を置いており、拡散に基づくシステムは比較的過小評価されている。
本稿では,音楽合成のための潜時拡散モデルであるStable Audio Open が生み出した音声のピッチコンテンツを簡易に操る手法を提案する。
約125kのパラメータを含む小さな畳み込みプローブをトレーニングし、ペアオーディオとMIDIデータを用いてモデルの変動オートエンコーダ潜在空間からフレームレベルのピッチクラスのアクティベーションをデコードする。
推論時に、凍結プローブは、識別可能な損失関数として機能し、その偏極性に対する勾配は、ユーザが指定したピッチクラスのシーケンスに対して生成するために使用され、ベースモデルのリトレーニングやアーキテクチャの変更は不要である。
9つのテキストプロンプトと3つのターゲットメロディにまたがる27回にわたる評価試験では、プローブ誘導生成は、未ガイドベースライン(p < 1e-5, Wilcoxon sign-rank test)上でのメロディコヒーレンスを2.4倍に増加させ、音楽的に意味のある構造は、拡散ベース音楽の潜在空間において回復可能かつ操舵可能であることを示した。
関連論文リスト
- Efficient and Fast Generative-Based Singing Voice Separation using a Latent Diffusion Model [12.393086516044866]
本研究では, このギャップを埋めるための拡散モデルの可能性について検討する。
本研究は,声帯と混合音の対に依存する歌唱音声の分離に焦点をあてる。
システムは、コンパクトなラテント空間に符号化されたサンプルを生成し、その後、それらをオーディオに復号する。
論文 参考訳(メタデータ) (2025-11-25T16:34:07Z) - Bass Accompaniment Generation via Latent Diffusion [0.0]
任意の長さのミキシングに付随する単一茎を生成する制御可能なシステムを提案する。
本手法のコアとなるのは、音声波形サンプルを効率よく非可逆な潜在表現に圧縮するオーディオオートエンコーダである。
制御可能な条件付きオーディオ生成フレームワークは、音楽制作においてミュージシャンを支援するための生成AIツールを作成する上で、大きな前進となる。
論文 参考訳(メタデータ) (2024-02-02T13:44:47Z) - SpecDiff-GAN: A Spectrally-Shaped Noise Diffusion GAN for Speech and
Music Synthesis [0.0]
本稿では,HiFi-GANに基づくニューラルボコーダSpecDiff-GANを紹介する。
いくつかのデータセットに対して,提案モデルによる音声合成と音楽合成の利点を示す。
論文 参考訳(メタデータ) (2024-01-30T09:17:57Z) - Synthia's Melody: A Benchmark Framework for Unsupervised Domain
Adaptation in Audio [4.537310370334197]
無限の4秒のメロディをシミュレートできる新しい音声データ生成フレームワークであるSynthiaのメロディを提示する。
観測条件下で収集された既存のデータセットとは異なり、シンシアのメロディには観測されていないバイアスがない。
評価の結果,Synthia のメロディは,これらのモデルの様々な分布シフトに対する感受性を検証するための頑健なテストベッドを提供することがわかった。
論文 参考訳(メタデータ) (2023-09-26T15:46:06Z) - From Discrete Tokens to High-Fidelity Audio Using Multi-Band Diffusion [84.138804145918]
深層生成モデルは、様々な種類の表現で条件付けられた高忠実度オーディオを生成することができる。
これらのモデルは、条件付けに欠陥がある場合や不完全な場合、可聴アーチファクトを生成する傾向がある。
低ビットレート離散表現から任意の種類のオーディオモダリティを生成する高忠実度マルチバンド拡散ベースフレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-02T22:14:29Z) - DiffusionAD: Norm-guided One-step Denoising Diffusion for Anomaly Detection [80.20339155618612]
DiffusionADは、再構成サブネットワークとセグメンテーションサブネットワークからなる、新しい異常検出パイプラインである。
高速なワンステップデノゲーションパラダイムは、同等の再現品質を維持しながら、数百倍の加速を達成する。
異常の出現の多様性を考慮し、複数のノイズスケールの利点を統合するためのノルム誘導パラダイムを提案する。
論文 参考訳(メタデータ) (2023-03-15T16:14:06Z) - High Fidelity Neural Audio Compression [92.4812002532009]
我々は、ニューラルネットワークを利用した最先端のリアルタイム、高忠実、オーディオを導入する。
ストリーミングエンコーダ-デコーダアーキテクチャと、エンドツーエンドでトレーニングされた量子化潜在空間で構成されている。
単一マルチスケール・スペクトログラム・アドバイザリーを用いて、トレーニングを簡素化し、高速化する。
論文 参考訳(メタデータ) (2022-10-24T17:52:02Z) - BinauralGrad: A Two-Stage Conditional Diffusion Probabilistic Model for
Binaural Audio Synthesis [129.86743102915986]
我々は、音声を共通部分へ分解することで、異なる視点から合成プロセスを定式化する。
拡散モデルを備えた新しい2段階フレームワークであるBinauralGradを提案する。
実験結果から,BinauralGradは対象評価指標と対象評価指標の両方において,既存のベースラインよりも高い性能を示した。
論文 参考訳(メタデータ) (2022-05-30T02:09:26Z) - SpecGrad: Diffusion Probabilistic Model based Neural Vocoder with
Adaptive Noise Spectral Shaping [51.698273019061645]
SpecGradは拡散雑音に適応し、その時間変化スペクトル包絡が条件付き対数メル分光器に近づく。
時間周波数領域で処理され、計算コストは従来のDDPMベースのニューラルボコーダとほぼ同じである。
論文 参考訳(メタデータ) (2022-03-31T02:08:27Z) - DiffSinger: Diffusion Acoustic Model for Singing Voice Synthesis [53.19363127760314]
DiffSingerは、音楽スコアで調整されたメログラムにノイズを反復的に変換するパラメータ化されたマルコフチェーンです。
中国の歌唱データセットで行った評価は、DiffSingerが最先端のSVSワークを顕著な差で上回っていることを示している。
論文 参考訳(メタデータ) (2021-05-06T05:21:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。