論文の概要: Music Restoration via Latent Operator Optimization and Diffusion Model Priors
- arxiv url: http://arxiv.org/abs/2608.01972v1
- Date: Mon, 03 Aug 2026 09:36:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.471813
- Title: Music Restoration via Latent Operator Optimization and Diffusion Model Priors
- Title(参考訳): 潜在演算子最適化と拡散モデルによる音楽再生
- Abstract要約: 音楽の復元は、未知の効果、歪み、腐敗によって劣化した観察記録からクリーンな信号を回復しようとする。
本稿では,事前訓練されたオーディオオートエンコーダの潜時空間で動作する汎用的復元法であるLOUDARを提案する。
劣化した入力よりも常に改善され、波形および潜伏領域における教師なしおよび教師なしのベースラインと競合することを示す。
- 参考スコア(独自算出の注目度): 15.43777154891635
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Music restoration seeks to recover a clean signal from an observed recording degraded by an unknown effect, distortion, or corruption. Existing systems often rely on paired training data and distortion-specific supervision, which limits their use when the forward process is not known in advance. We propose LOUDAR (Latent-space Optimization of Unknown Distortion for Audio Restoration) a general-purpose restoration method that operates in the latent space of a pretrained audio autoencoder and models the unknown distortion as a learnable latent operator. At inference time, LOUDAR alternates between estimating the clean latent variable and updating the latent operator parameters. An unconditional latent diffusion model provides a prior over clean audio and regularizes this inference by steering the latent estimate toward the manifold of clean recordings. Because the degradation model is adapted per input, the approach is broadly applicable across diverse restoration problems. We evaluate LOUDAR on singing voice effect removal and restoration, as well as guitar distortion removal, and show that it consistently improves over degraded inputs and is competitive with supervised and unsupervised baselines in waveform and latent domains.
- Abstract(参考訳): 音楽の復元は、未知の効果、歪み、腐敗によって劣化した観察記録からクリーンな信号を回復しようとする。
既存のシステムは、しばしばペア化されたトレーニングデータと歪み特異的な監視に依存しており、前処理が事前に分かっていない場合に使用を制限する。
本稿では,事前学習したオーディオオートエンコーダの潜時空間で動作し,未知の歪みを学習可能な潜時演算子としてモデル化する汎用的復元法であるLOUDARを提案する。
推測時、LOUDARはクリーン潜時変数の推定と潜時演算子パラメータの更新を交互に行う。
非条件潜在拡散モデルは、クリーンなオーディオを先行して提供し、この推論を、クリーンな録音の多様体に対して遅延推定を操り、規則化する。
劣化モデルは入力毎に適応されるため、様々な復元問題に広く適用できる。
歌唱音声効果の除去と復元、およびギターの歪み除去についてLOUDARを評価し、劣化した入力よりも一貫して改善し、波形および潜伏領域における教師なしベースラインと競合することを示す。
関連論文リスト
- Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification [28.964205712747255]
Vorch-Directorはノイズレベルの残留補正戦略である。
残差を元のノイズレベルに関連付け、トレーニング中に一致したノイズレジームから残差を注入する。
より現実的な自己回帰の歴史を生み出し、効率的な教師強制訓練を継続する。
論文 参考訳(メタデータ) (2026-08-06T09:09:49Z) - Next-Acceleration-Scale Prediction for Autoregressive MRI Reconstruction [52.32112533846212]
MRI再建は本質的に不完全な逆問題である。
この制限は、再構成を離散的なマルチスケールの潜在空間に移動させ、自己回帰的次加速スケールの予測として機能させることによって解決する。
提案手法は,過度のアンサンプ下での多種多様なサンプリングパターンの再構成性能の向上を図っている。
論文 参考訳(メタデータ) (2026-05-19T04:40:50Z) - Your Pre-trained Diffusion Model Secretly Knows Restoration [55.7186754179308]
本研究では,事前学習した拡散モデルが本質的に復元動作を有しており,即時埋め込みを直接学習することで解錠可能であることを示す。
トレーニング済みのWANビデオモデルとFLUX画像モデルに軽量な学習プロンプトを導入し、それらを高性能な復元モデルに変換する。
論文 参考訳(メタデータ) (2026-04-06T17:59:04Z) - Conditional Flow Matching for Visually-Guided Acoustic Highlighting [10.241097929338366]
視覚的に誘導された音響ハイライトは、付随するビデオとオーディオのバランスを調整し、一貫性のあるオーディオ視覚体験を作り出す。
既存のアプローチでは、オーディオリミックスの本来の曖昧さに苦しむ差別モデルを使用している。
この制限に対処するために、条件付きフローマッチング(CFM)フレームワークを導入します。
論文 参考訳(メタデータ) (2026-02-03T17:24:47Z) - CAPTAIN: Semantic Feature Injection for Memorization Mitigation in Text-to-Image Diffusion Models [60.610268549138375]
拡散モデルは意図せずトレーニング例を再現し、プライバシーと著作権の懸念を高めることができる。
CAPTAINはトレーニング不要のフレームワークで,聴覚障害時に潜伏した特徴を直接修正することで記憶を緩和する。
論文 参考訳(メタデータ) (2025-12-11T14:01:47Z) - Latent Harmony: Synergistic Unified UHD Image Restoration via Latent Space Regularization and Controllable Refinement [89.99237142387655]
LH-VAEを導入し、視覚的意味的制約や進行的劣化による意味的堅牢性を高める。
Latent Harmonyは、UHD修復のためのVAEを再定義する2段階のフレームワークである。
実験により、Latent HarmonyはUHDおよび標準解像度タスクにまたがって最先端のパフォーマンスを実現し、効率、知覚品質、再現精度を効果的にバランスさせることが示されている。
論文 参考訳(メタデータ) (2025-10-09T08:54:26Z) - Denoising as Adaptation: Noise-Space Domain Adaptation for Image Restoration [64.84134880709625]
拡散モデルを用いて,雑音空間を介して領域適応を行うことが可能であることを示す。
特に、補助的な条件入力が多段階の復調過程にどのように影響するかというユニークな性質を活用することにより、有意義な拡散損失を導出する。
拡散モデルにおけるチャネルシャッフル層や残留スワッピング型コントラスト学習などの重要な戦略を提案する。
論文 参考訳(メタデータ) (2024-06-26T17:40:30Z) - Blind Audio Bandwidth Extension: A Diffusion-Based Zero-Shot Approach [4.030910640265943]
過去の音声記録の復元など、低域劣化が不明な場合には、盲点となる。
本稿では,ゼロショット設定におけるブラインド問題に対処するBABEという新しい手法を提案する。
BABEは、実際の歴史的記録を強化する際に、堅牢な一般化能力を示す。
論文 参考訳(メタデータ) (2023-06-02T10:47:15Z) - DiffusionAD: Norm-guided One-step Denoising Diffusion for Anomaly Detection [80.20339155618612]
DiffusionADは、再構成サブネットワークとセグメンテーションサブネットワークからなる、新しい異常検出パイプラインである。
高速なワンステップデノゲーションパラダイムは、同等の再現品質を維持しながら、数百倍の加速を達成する。
異常の出現の多様性を考慮し、複数のノイズスケールの利点を統合するためのノルム誘導パラダイムを提案する。
論文 参考訳(メタデータ) (2023-03-15T16:14:06Z) - Unsupervised vocal dereverberation with diffusion-based generative
models [12.713895991763867]
そこで本稿では,学習にデータペアを必要とすることなく,一般的な音楽用人工残響を除去するための教師なし手法を提案する。
提案手法は,従来の有声弁別評価基準より優れており,客観的および知覚的評価が優れていることを示す。
論文 参考訳(メタデータ) (2022-11-08T09:43:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。