論文の概要: WavFlow: Audio Generation in Waveform Space
- arxiv url: http://arxiv.org/abs/2605.18749v1
- Date: Mon, 18 May 2026 17:59:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:50.231775
- Title: WavFlow: Audio Generation in Waveform Space
- Title(参考訳): WavFlow: 波形空間におけるオーディオ生成
- Authors: Feiyan Zhou, Luyuan Wang, Shoufa Chen, Zhe Wang, Zhiheng Liu, Yuren Cong, Xiaohui Zhang, Fanny Yang, Belinda Zeng,
- Abstract要約: WavFlowは、中間表現なしで生波形空間で直接高忠実なオーディオを生成するフレームワークである。
自動データパイプラインを活用して、500万の高品質のビデオテキストオーディオトリプルをキュレートします。
WavFlowは、VGGSound (FD_PaSST: 59.98, IS_PANNs: 17.40, DeSync: 0.44)とAudioCaps (FD_PANNs: 10.63, IS_PANNs: 12.62)の競合性能を達成した。
- 参考スコア(独自算出の注目度): 25.62432990858879
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern audio generation predominantly relies on latent-space compression, introducing additional complexity and potential information loss. In this work, we challenge this paradigm with WavFlow, a framework that generates high-fidelity audio directly in raw waveform space without intermediate representations. To overcome the inherent difficulties of modeling high-dimensional and low-energy signals, we reshape audio into 2D token grids through waveform patchify and introduce amplitude lifting to align signal scales, enabling stable optimization via direct x-prediction in flow matching. To capture complex semantic alignment and temporal synchronization, we leverage an automated data pipeline to curate 5 million high-quality video-text-audio triplets, allowing the model to learn fine-grained acoustic patterns from scratch. Experimental results show that WavFlow achieves competitive performance on the video-to-audio benchmark VGGSound (FD_PaSST: 59.98, IS_PANNs: 17.40, DeSync: 0.44) and the text-to-audio benchmark AudioCaps (FD_PANNs: 10.63, IS_PANNs: 12.62), matching or exceeding the performance of established latent-based methods. Our work demonstrates that intermediate compression is not a prerequisite for high-quality synthesis, offering a simpler and more scalable alternative for multimodal audio generation.
- Abstract(参考訳): 現代のオーディオ生成は主に遅延空間圧縮に依存しており、さらなる複雑さと潜在的な情報損失をもたらす。
本研究では,中間表現なしで生波形空間で直接高忠実度音声を生成するフレームワークであるWavFlowを用いて,このパラダイムに挑戦する。
高次元・低エネルギー信号のモデリングの難しさを克服するため、波形パッチ化により2次元トークングリッドにオーディオを変換し、振幅リフトを導入して信号スケールを調整し、フローマッチングにおける直接x-述語による安定した最適化を可能にする。
複雑なセマンティックアライメントと時間同期をキャプチャするために、自動データパイプラインを活用して、500万の高品質なビデオテキストオーディオトレーレットをキュレートし、モデルがスクラッチからきめ細かい音響パターンを学習できるようにする。
実験の結果、WavFlowはVGGSound(FD_PaSST:59.98、IS_PANNs:17.40、DeSync:0.44)とテキスト-オーディオベンチマークAudioCaps(FD_PANNs:10.63、IS_PANNs:12.62)の競合性能を達成し、確立された潜伏型メソッドのパフォーマンスをマッチングまたは超えた。
我々の研究は、中間圧縮が高品質な合成の前提条件ではないことを示し、マルチモーダルオーディオ生成のよりシンプルでスケーラブルな代替手段を提供する。
関連論文リスト
- Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows [75.44753202066171]
ビデオ入力に基づくコーディネートオーディオ生成は、通常、厳格なオーディオ・ビジュアル・アライメント(AV)を必要とする。
マスク付きモデリングトレーニングにより,まずFoleyFlowを用いて非モード型AVエンコーダのアライメントを行う。
トレーニング後、単調データのみを用いて個別に事前訓練されたAVエンコーダは、意味的およびリズム的整合性に整合する。
論文 参考訳(メタデータ) (2026-03-09T09:06:25Z) - UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow Matching [20.92242470770289]
本稿では,複雑なスペクトル係数の条件分布を捉えるために,フローマッチング生成モデルを用いた超解像の超解像化フレームワークを提案する。
実験により,我々のモデルは様々なアップサンプリング要因にまたがる高忠実度48kHzのオーディオを連続的に生成することがわかった。
論文 参考訳(メタデータ) (2025-10-01T11:04:53Z) - MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis [56.01110988816489]
マルチモーダル・ジョイント・トレーニング・フレームワークであるMMAudioを用いて、高品質で同期化された音声、ビデオ、オプションのテキスト条件を合成することを提案する。
MMAudioは大規模で手軽に利用できるテキストオーディオデータを共同でトレーニングし、セマンティックに整合した高品質なオーディオサンプルを生成する。
MMAudioはテキスト・オーディオ・ジェネレーションにおいて驚くほどの競争力を発揮し、ジョイントトレーニングが単一モダリティのパフォーマンスを妨げないことを示す。
論文 参考訳(メタデータ) (2024-12-19T18:59:55Z) - Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching [51.70360630470263]
Video-to-audio (V2A) は、サイレントビデオからコンテンツマッチング音声を合成することを目的としている。
本稿では,修正フローマッチングに基づくV2AモデルであるFrierenを提案する。
実験により、フリーレンは世代品質と時間的アライメントの両方で最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2024-06-01T06:40:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。