論文の概要: ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models
- arxiv url: http://arxiv.org/abs/2607.09134v1
- Date: Fri, 10 Jul 2026 06:44:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.800838
- Title: ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models
- Title(参考訳): ReGen:効率的な波形拡散モデルのための階層型マルチプロンプト表現生成
- Abstract要約: 単一拡散モデルにおける両表現データに対して複数のベクトル場を共同で推定するReGenを提案する。
ReGenVoiceも提案する。LDM(Latent diffusion model)ベースのテキスト音声合成モデルで,強い音声の明瞭さを実現する。
- 参考スコア(独自算出の注目度): 22.63266813055847
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Representation alignment (REPA) has been investigated to accelerate diffusion training, but we observe that regularizing intermediate representations in diffusion Transformers (DiT) may implicitly entangle latents and limit generative capacity. To address this issue, we propose ReGen, a hierarchical multi-prompt representation generation framework that jointly estimates multiple vector fields for both representations and data within a single diffusion model. We further introduce generalized flow matching (GFM) to improve the generalization of conditional flow matching (CFM). We validate ReGen on single-stage waveform diffusion models including neural audio codec and Wave-VAE. ReGen significantly improves waveform generation quality from highly compressed latent representations at 12.5 Hz. We also present ReGenVoice, a latent diffusion model (LDM)-based text-to-speech model that achieves strong speech intelligibility (WER) and speaker similarity (SIM) with a small dataset. Moreover, operating the LDM at 6.25 Hz with rich semantic and acoustic latent representation enables efficient training and sampling, requiring only 1 day of training on 4 GPUs and fast inference with an RTF of 0.08. Audio samples are available at https://regenvoice.github.io/demo/.
- Abstract(参考訳): 表現アライメント(REPA)は拡散訓練を加速するために研究されているが,拡散トランスフォーマー(DiT)における中間表現の正規化は,暗黙的に潜伏し,生成能力を制限する可能性がある。
この問題に対処するために,1つの拡散モデル内の表現とデータの両方に対して,複数のベクトル場を共同で推定する階層的マルチプロンプト表現生成フレームワークReGenを提案する。
さらに、条件付きフローマッチング(CFM)の一般化を改善するために、一般化フローマッチング(GFM)を導入する。
ニューラルオーディオコーデックやWave-VAEを含む単一ステージ波形拡散モデル上でReGenを検証する。
ReGenは12.5Hzで高度に圧縮された潜在表現から波形生成品質を著しく改善する。
ReGenVoiceも提案する。LDM(Latent diffusion model)ベースのテキスト音声合成モデルで,音声の高信頼度(WER)と話者類似度(SIM)を小さなデータセットで実現している。
さらに、リッチなセマンティクスと音響潜在表現で6.25Hzで動作すると、効率的なトレーニングとサンプリングが可能になり、4つのGPUで1日間のトレーニングしか必要とせず、RTF 0.08で高速な推論が可能である。
オーディオサンプルはhttps://regenvoice.github.io/demo/で入手できる。
関連論文リスト
- DiffusionGemma Technical Report [72.10570774996219]
DiffusionGemma(ディフュージョン・ジェマ)は、離散拡散を用いてテキストを生成する言語モデルである。
DiffusionGemmaは、一度に1つのトークンをデコードする代わりに、256個のトークンのブロックを並列に繰り返し洗練する。
私たちの計算効率の良い2段階トレーニングパイプラインは、開始したARモデルの総トレーニングトークン予算の10%未満を使用します。
論文 参考訳(メタデータ) (2026-07-31T16:11:46Z) - An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation [63.50393485685279]
音声の理解と生成を統一する vLLM ベースの推論パイプラインを提案する。
共有直観自由誘導(CFG)のスループットを克服する。
連続バッチ内でペア条件と非条件要求を共スケジューリングすることにより、CFGの実装は、非CFGスループットの80%を維持できます。
論文 参考訳(メタデータ) (2026-07-02T12:55:11Z) - Improving Progressive Generation with Decomposable Flow Matching [50.63174319509629]
Decomposable Flow Matching (DFM)は、ビジュアルメディアのプログレッシブな生成のためのシンプルで効果的なフレームワークである。
Imagenet-1k 512pxでは、DFMはベースアーキテクチャよりも35.2%改善され、ベースラインは26.4%向上した。
論文 参考訳(メタデータ) (2025-06-24T17:58:02Z) - 6G WavesFM: A Foundation Model for Sensing, Communication, and Localization [6.70088826174291]
本稿では,無線基礎モデル(WFM)フレームワークについて紹介する。
提案アーキテクチャでは,共有ビジョントランスフォーマー(ViT)バックボーンとタスク固有の多層パーセプトロンヘッドを組み合わせるとともに,パラメータ効率の良い微調整のためのローランド適応(LoRA)を組み込む。
我々は、統一WFMが多様なタスクをサポートし、性能と効率の両方において大きな利益をもたらすことを示す。
論文 参考訳(メタデータ) (2025-04-18T22:51:35Z) - Accelerating High-Fidelity Waveform Generation via Adversarial Flow Matching Optimization [37.35829410807451]
本稿では,逆流マッチング最適化による高忠実かつ高効率な波形生成モデルである PeriodWave-Turbo を提案する。
さまざまな客観的メトリクスで最先端のパフォーマンスを達成するには、1,000ステップの微調整しか必要ありません。
PeriodWave のバックボーンを 29M から 70M のパラメータにスケールアップすることで、一般化を改善することで、 PeriodWave-Turbo は前例のない性能を実現している。
論文 参考訳(メタデータ) (2024-08-15T08:34:00Z) - Diffusion-Driven Semantic Communication for Generative Models with Bandwidth Constraints [66.63250537475973]
本稿では,帯域制限付き生成モデルのための,高度なVAEベースの圧縮を用いた拡散駆動型セマンティック通信フレームワークを提案する。
実験の結果,ピーク信号対雑音比 (PSNR) などの画素レベルの指標と,LPIPS (Learning Perceptual Image patch similarity) のような意味的指標が大幅に改善された。
論文 参考訳(メタデータ) (2024-07-26T02:34:25Z) - Adversarial Training of Denoising Diffusion Model Using Dual
Discriminators for High-Fidelity Multi-Speaker TTS [0.0]
拡散モデルは確率論的アプローチにより高品質なデータを生成することができる。
これは、多くの時間ステップを必要とするため、生成速度が遅くなるという欠点に悩まされる。
本稿では、逆過程の分布を学習する拡散判別器と、生成されたデータの分布を学習するスペクトログラム判別器の2つの識別器を用いた音声合成モデルを提案する。
論文 参考訳(メタデータ) (2023-08-03T07:22:04Z) - From Discrete Tokens to High-Fidelity Audio Using Multi-Band Diffusion [84.138804145918]
深層生成モデルは、様々な種類の表現で条件付けられた高忠実度オーディオを生成することができる。
これらのモデルは、条件付けに欠陥がある場合や不完全な場合、可聴アーチファクトを生成する傾向がある。
低ビットレート離散表現から任意の種類のオーディオモダリティを生成する高忠実度マルチバンド拡散ベースフレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-02T22:14:29Z) - Boosting Fast and High-Quality Speech Synthesis with Linear Diffusion [85.54515118077825]
本稿では, 常微分方程式に基づく線形拡散モデル(LinDiff)を提案する。
計算複雑性を低減するため、LinDiffでは、入力信号を小さなパッチに分割するパッチベースの処理アプローチを採用している。
我々のモデルは、より高速な合成速度で自己回帰モデルに匹敵する品質の音声を合成することができる。
論文 参考訳(メタデータ) (2023-06-09T07:02:43Z) - Single Channel Speech Enhancement Using Temporal Convolutional Recurrent
Neural Networks [23.88788382262305]
時間畳み込みリカレントネットワーク(TCRN)は、ノイズ波形を直接クリーン波形にマッピングするエンドツーエンドモデルである。
既存の畳み込みリカレントネットワークと比較して,本モデルではモデルの性能を向上させることができることを示す。
論文 参考訳(メタデータ) (2020-02-02T04:26:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。