論文の概要: Efficient Text-to-Audio Generation via Pruning
- arxiv url: http://arxiv.org/abs/2607.13330v1
- Date: Tue, 14 Jul 2026 23:22:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.604032
- Title: Efficient Text-to-Audio Generation via Pruning
- Title(参考訳): プルーニングによる効率的なテキスト・ツー・オーディオ生成
- Abstract要約: プルーニングは標準基準でガイドされ、続いて軽量な微調整によって性能損失を回復する。
プルーニングは、銃声、サイレン、爆発などの安全クリティカルな音を含む特定の音を発生させるAudioLDMの能力に影響を及ぼす。
- 参考スコア(独自算出の注目度): 25.43908075335463
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion-based text-to-audio generative models such as AudioLDM achieve high perceptual quality and strong semantic consistency; however, their practical deployment is hindered by the substantial computational cost of the U-Net denoising backbone. In this work, we apply model pruning to improve the computational efficiency of AudioLDM, a U-Net-based text-conditioned audio latent diffusion model. We analyse parameter redundancy across U-Net convolutional blocks and evaluate a filter-pruning strategy. Pruning is guided by norm-based criteria and followed by lightweight finetuning to recover performance losses. Experimental results demonstrate that up to 83% of the parameters and 39% of the multiply-accumulate operations of U-Net have been reduced while maintaining, and in some cases improving, generation quality compared to the baseline unpruned network. We find that pruning affects AudioLDM's ability to generate certain sound events including safety-critical sounds such as gunshots, sirens, and explosions, as well as mechanical sounds such as drills and sewing machines, and other sounds such as sprays and tick-tocks, which are mostly recovered by lightweight finetuning of the pruned model.
- Abstract(参考訳): 拡散に基づくオーディオ合成モデルであるAudioLDMは、高い知覚品質と強力なセマンティック一貫性を実現するが、実際の展開はU-Netのバックボーンの相当な計算コストによって妨げられる。
本研究では,U-Netベースのテキスト条件付き音声潜在拡散モデルであるAudioLDMの計算効率を向上させるために,モデルプルーニングを適用した。
我々は,U-Net畳み込みブロック間のパラメータの冗長性を解析し,フィルタプルーニング戦略を評価する。
プルーニングは標準基準でガイドされ、続いて軽量な微調整によって性能損失を回復する。
実験結果から,U-Netのパラメータの83%,乗算累積演算の39%が維持中に減少し,いくつかの場合において,ベースライン未実行ネットワークと比較して生成品質が向上していることがわかった。
プルーニングは, ガンショット, サイレン, 爆発などの安全クリティカルな音, ドリルやミシンなどの機械的音, スプレーやチクタックなどの機械的音, 主にプルーニングモデルの軽量な微調整によって復元される, 特定の音響イベントを生成する能力に影響を及ぼすことがわかった。
関連論文リスト
- DropoutTS: Sample-Adaptive Dropout for Robust Time Series Forecasting [59.868414584142336]
DropoutTS はモデルに依存しないプラグインで、パラダイムを "What" から "How much" にシフトします。
ノイズを適応的なドロップアウト率にマッピングする - きめ細かい忠実さを維持しながら、急激な変動を選択的に抑制する。
論文 参考訳(メタデータ) (2026-01-29T13:49:20Z) - Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine [16.046905753937384]
本研究では、すでに訓練済みの音声/オーディオ下流モデルの任意の中間特徴表現を圧縮・定量化できる効率的なACoM法を提案する。
提案手法では,残差ベクトル量子化(RVQ)損失とともにタスク固有の損失ガイダンスを採用し,ダウンストリームモデルの性能を最小限に抑えた超低コーデック(200bps未満)を提供する。
論文 参考訳(メタデータ) (2025-07-17T00:32:07Z) - Do we really have to filter out random noise in pre-training data for language models? [38.30911856420568]
インターネットから収集された事前学習されたテキストデータは、必然的にデコードエラーや規制されていないウェブコンテンツに起因するランダムノイズを含む。
その結果, モデルが2.7Bにスケールアップされた場合でも, NTPの損失はランダムノイズの比率よりも有意に低かった。
モデルパラメータの知識を必要とせず,通常の特徴と摂動特徴の勾配を整列させることにより,下流タスクヘッドの認知能力を明確に向上する。
論文 参考訳(メタデータ) (2025-02-10T16:01:55Z) - A Real-Time Voice Activity Detection Based On Lightweight Neural [4.589472292598182]
音声活動検出(Voice Activity Detection, VAD)は、音声ストリーム中の音声を検出するタスクである。
最近のニューラルネットワークベースのVADでは、パフォーマンスの低下がある程度軽減されている。
我々は,カジュアルかつ深さ分離可能な1次元畳み込みとGRUを利用するMagicNetという,軽量でリアルタイムなニューラルネットワークを提案する。
論文 参考訳(メタデータ) (2024-05-27T03:31:16Z) - CheapNET: Improving Light-weight speech enhancement network by projected
loss function [0.8192907805418583]
我々は,MSEから分岐した新しい投射損失関数を導入し,雑音抑制を向上する。
エコーキャンセリングのために、この関数はLAEC事前処理された出力の直接予測を可能にする。
ノイズ抑制モデルは,3.1Mパラメータと0.4GFlops/s計算負荷のみを用いて,ほぼ最先端の結果が得られる。
論文 参考訳(メタデータ) (2023-11-27T16:03:42Z) - Improving the Robustness of Summarization Models by Detecting and
Removing Input Noise [50.27105057899601]
本研究では,様々な種類の入力ノイズから,様々なデータセットやモデルサイズに対する性能損失を定量化する大規模な実験的検討を行った。
本稿では,モデル推論中の入力中のそのようなノイズを検出し,除去するための軽量な手法を提案する。
論文 参考訳(メタデータ) (2022-12-20T00:33:11Z) - Simple Pooling Front-ends For Efficient Audio Classification [56.59107110017436]
入力音声特徴量における時間的冗長性を排除することは,効率的な音声分類に有効な方法である可能性が示唆された。
本稿では、単純な非パラメトリックプーリング操作を用いて冗長な情報を削減する単純なプールフロントエンド(SimPFs)のファミリーを提案する。
SimPFは、市販オーディオニューラルネットワークの浮動小数点演算数の半数以上を削減できる。
論文 参考訳(メタデータ) (2022-10-03T14:00:41Z) - A Study of Designing Compact Audio-Visual Wake Word Spotting System
Based on Iterative Fine-Tuning in Neural Network Pruning [57.28467469709369]
視覚情報を利用した小型音声覚醒単語スポッティング(WWS)システムの設計について検討する。
繰り返し微調整方式(LTH-IF)で抽選券仮説を通したニューラルネットワークプルーニング戦略を導入する。
提案システムでは,ノイズ条件の異なる単一モード(オーディオのみ,ビデオのみ)システムに対して,大幅な性能向上を実現している。
論文 参考訳(メタデータ) (2022-02-17T08:26:25Z) - Improving Noise Robustness of Contrastive Speech Representation Learning
with Speech Reconstruction [109.44933866397123]
実環境における音声認識システムの実現には,雑音の堅牢性が不可欠である。
雑音認識のための自己教師型フレームワークにより学習したノイズロスト表現を用いる。
ラベル付きデータのわずか16%で報告された最高の教師付きアプローチに匹敵するパフォーマンスを実現した。
論文 参考訳(メタデータ) (2021-10-28T20:39:02Z) - Bridging the Gap Between Clean Data Training and Real-World Inference
for Spoken Language Understanding [76.89426311082927]
既存のモデルはクリーンデータに基づいてトレーニングされ、クリーンデータトレーニングと現実世界の推論の間にtextitgapが発生する。
本稿では,良質なサンプルと低品質のサンプルの両方が類似ベクトル空間に埋め込まれた領域適応法を提案する。
広く使用されているデータセット、スニップス、および大規模な社内データセット(1000万のトレーニング例)に関する実験では、この方法は実世界の(騒々しい)コーパスのベースラインモデルを上回るだけでなく、堅牢性、すなわち、騒々しい環境下で高品質の結果を生み出すことを実証しています。
論文 参考訳(メタデータ) (2021-04-13T17:54:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。