論文の概要: Stage-adaptive audio diffusion modeling
- arxiv url: http://arxiv.org/abs/2605.04547v1
- Date: Wed, 06 May 2026 06:54:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.679897
- Title: Stage-adaptive audio diffusion modeling
- Title(参考訳): ステージ適応型音声拡散モデル
- Authors: Xuanhao Zhang, Chang Li,
- Abstract要約: 我々は、セマンティックな獲得と世代指向の洗練のバランスの進化に、非効率の主な源泉があると主張している。
本研究では,初期セマンティックブートストラップのためのSSLガイダンス,状態変数によって駆動される自己適応時間ステップサンプリング,パラメータ空間内の収束群組織から活性化される構造認識正規化の3つの段階認識機構を開発する。
- 参考スコア(独自算出の注目度): 3.3115063666033167
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent progress in diffusion-based audio generation and restoration has substantially improved performance across heterogeneous conditioning regimes, including text-conditioned audio generation and audio-conditioned super-resolution. However, training audio diffusion models remains computationally expensive, and most existing pipelines still rely on static optimization recipes that treat the relative importance of training signals as fixed throughout learning. In this work, we argue that a major source of inefficiency lies in the evolving balance between semantic acquisition and generation-oriented refinement. Early training places stronger emphasis on acquiring condition-aligned semantic structure and coarse global organization, whereas later training increasingly emphasizes temporal consistency, perceptual fidelity, and fine-detail refinement. To characterize this evolving balance, we introduce a progress-based regime variable derived from the training-time slope of an SSL-space discrepancy, which measures semantic progress during training. Based on this signal, we develop three complementary stage-aware mechanisms: decayed SSL guidance for early semantic bootstrapping, self-adaptive timestep sampling driven by the regime variable, and structure-aware regularization activated from convergent grouped organization in parameter space. We evaluate these mechanisms on text-conditioned audio generation and audio-conditioned super-resolution. Across both settings, the proposed stage-aware strategies improve convergence behavior and yield gains on the primary generation and spectral reconstruction metrics over standard static baselines. These results support the view that efficient audio diffusion training can benefit from treating external guidance, internal organization, and optimization emphasis as stage-dependent components rather than fixed ingredients.
- Abstract(参考訳): 拡散型音声生成と再生の最近の進歩は、テキスト条件付き音声生成やオーディオ条件付き超解像など、異種条件付きシステムにおける性能を大幅に改善している。
しかしながら、オーディオ拡散モデルのトレーニングは計算コストがかかるままであり、既存のパイプラインの多くは、トレーニング信号の相対的重要性を学習を通して固定する静的な最適化レシピに依存している。
本研究では, セマンティックな獲得と世代指向の洗練のバランスの進化に, 不効率の主な原因があると主張している。
初期の訓練は、条件に整合したセマンティック構造と粗いグローバルな組織を取得することに強く重点を置いているが、後期の訓練は、時間的一貫性、知覚的忠実性、細かな精細化をますます強調している。
このバランスを特徴付けるために,SSL空間の差分をトレーニング時間勾配から導いた進行型状態変数を導入し,トレーニング中の意味的進行を計測する。
この信号に基づいて、早期のセマンティックブートストラップのためのSSL誘導の減衰、状態変数によって駆動される自己適応タイムステップサンプリング、パラメータ空間内の収束グループ組織から活性化される構造認識正規化の3つの相補的なステージアウェア機構を開発する。
テキスト条件付き音声生成と音声条件付き超解像について,これらのメカニズムを評価する。
いずれの設定においても,提案したステージアウェア戦略は収束挙動を改善し,標準の静的ベースライン上での一次生成とスペクトル再構成の指標に対して利得を得る。
これらの結果は, 外部指導, 内部組織, 最適化を固定材料ではなくステージ依存コンポーネントとして重視することで, 効果的な音声拡散訓練が有用である,という見解を支持する。
関連論文リスト
- A Systematic Post-Train Framework for Video Generation [76.26555417456773]
大規模ビデオ拡散モデルでは、高解像度でセマンティックにリッチなコンテンツを生成できることが顕著に示されている。
迅速な感度、時間的不整合、禁止的推論コストといった重要な問題のために、事前訓練されたパフォーマンスと実際のデプロイメント要件の間には、大きなギャップが残っている。
本研究では,事前学習されたモデルとユーザの意図を4つの相乗的段階を通して体系的に整合させる総合的なポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-28T09:34:51Z) - Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs [17.167595029948576]
学習パラダイムが音声エンコーダとLLM間のエントロピー削減をどのように割り当てるかを特徴付けるための3つの指標を提案する。
本稿では,パラメータ効率とロバストネス幻覚を最適化した,能力境界認識に基づく多段階学習戦略を提案する。
マンダリンと英語のベンチマーク実験により,2.3Bパラメータのみを用いた最先端モデルとの競合性能が得られた。
論文 参考訳(メタデータ) (2026-04-09T09:07:52Z) - PACE: Pretrained Audio Continual Learning [27.605574463021693]
事前学習モデル(PTM)を用いた音声連続学習(CL)のための最初の体系的ベンチマークを提案する。
さらに、スペクトルに基づく境界認識摂動を導入し、表現の重なりを緩和し、安定性を向上させる。
6つの多様なオーディオCLベンチマークの実験は、PACEが最先端のベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-02-03T10:28:35Z) - AURORA: Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation [113.75682363364004]
AURORAは、参照音声視覚セグメント化における真の推論と言語理解を強化するために設計されたフレームワークである。
AURORAはRef-AVSベンチマークの最先端性能を達成し、非参照セグメンテーションに効果的に一般化する。
論文 参考訳(メタデータ) (2025-08-04T07:47:38Z) - Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining [55.262510814326035]
既存のリウェイト戦略は主にグループレベルのデータの重要性に焦点を当てている。
動的・インスタンスレベルのデータ再重み付けのための新しいアルゴリズムを提案する。
当社のフレームワークでは,冗長データや非形式データを優先的に再重み付けする戦略を考案することが可能です。
論文 参考訳(メタデータ) (2025-02-10T17:57:15Z) - Latent Convergence Modulation in Large Language Models: A Novel Approach to Iterative Contextual Realignment [0.0]
隠れ状態遷移を制御する構造変調機構が導入された。
格子調整は、パープレキシティ変動、エントロピー分散、および語彙不安定の低減に寄与した。
論文 参考訳(メタデータ) (2025-02-10T09:46:33Z) - Denoising as Adaptation: Noise-Space Domain Adaptation for Image Restoration [64.84134880709625]
拡散モデルを用いて,雑音空間を介して領域適応を行うことが可能であることを示す。
特に、補助的な条件入力が多段階の復調過程にどのように影響するかというユニークな性質を活用することにより、有意義な拡散損失を導出する。
拡散モデルにおけるチャネルシャッフル層や残留スワッピング型コントラスト学習などの重要な戦略を提案する。
論文 参考訳(メタデータ) (2024-06-26T17:40:30Z) - Optimization-Derived Learning with Essential Convergence Analysis of
Training and Hyper-training [52.39882976848064]
固定点反復に基づく一般化クラスノセルスキーマンスキースキーム(GKM)を基本ODLモジュールとして設計する。
GKMスキームでは、最適トレーニングとハイパートレーニング変数を同時に解くために、バイレベルメタ最適化(BMO)アルゴリズムフレームワークを構築している。
論文 参考訳(メタデータ) (2022-06-16T01:50:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。