論文の概要: Feature Encoding in VAE-based Audio Decoders: Effects of Input, Depth and Distribution
- arxiv url: http://arxiv.org/abs/2610.07966v1
- Date: Tue, 06 Oct 2026 08:32:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.899287
- Title: Feature Encoding in VAE-based Audio Decoders: Effects of Input, Depth and Distribution
- Title(参考訳): VAEを用いたオーディオデコーダの特徴符号化:入力,深さ,分布の影響
- Abstract要約: RAVE(Realtime Audio Variational AutoEncoder)のようなニューラルオーディオモデルは、優れた生成品質を実現しています。
異なる音楽領域で訓練された3つのモデルに対して,RAVEデコーダアクティベーションの系統的・層横断的解析を行い,これらを4種類の刺激タイプで検証した。
RAVE の場合、合成刺激はモデルやオーディオ機能(pitch |rho=0.45, 5.1x the null, BPM |rho| = 0.76, 8.6x the null)でよく符号化されている。
これらの結果は減少するが、まだ残っている。
- 参考スコア(独自算出の注目度): 0.03437656066916039
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Neural audio synthesis models like the Realtime Audio Variational autoEncoder (RAVE) achieve impressive genera tion quality, yet how their internal representations encode musical features remains poorly understood. We present a systematic layer-wise and cross-layer cluster analysis of RAVE decoder activations across three models trained on different musical domains, tested with four stimulus types. We then evaluate architectural generalization with a general purpose EnCodec model. For RAVE, we find that synthetic stimuli are encoded well across models and audio features (pitch |\r{ho}|=0.45, 5.1x the null, BPM |\r{ho}| = 0.76, 8.6x the null). These results are reduced but still substantively apparent when using natural audio (mean across features |\r{ho}|=0.25, 2.8x the null). Natural audio sees a stronger encoding when nonlinear probes are used (mean across features R2=0.56, 18x the null, +0.152 nonlinear gain over the linear probe R2). Encoding strength varies throughout the layers of the decoder and an increased ability to joint-encode in the middle layers is seen across all audio features (\b{eta}2 all negative, p < 0.05). The general purpose EnCodec decoder also sees similar strong synthetic responses across audio features, similar nonlinear gains for natural audio joint encoding and similar depth profiles. We find the best cross-layer cluster improves the strength (r = 0.65, p = 0.006) and prevalence (r = 0.75, p = 0.001) of BPM encoding when compared against the best whole layers within the same section, with no effect for joint encoding. These findings advance the interpretability of neural audio models and inform targeted control strategies for neural synthesis.
- Abstract(参考訳): RAVE(Realtime Audio Variational AutoEncoder)のようなニューラルオーディオ合成モデルは、優れたジェネラ音質を実現しています。
4種類の刺激型で実験し,異なる音楽領域で訓練された3つのモデルに対して,RAVEデコーダアクティベーションの系統的・層間クラスタ解析を行った。
次に,汎用EnCodecモデルを用いてアーキテクチャの一般化を評価する。
RAVE の場合、合成刺激はモデルやオーディオ特徴(pitch |\r{ho}|=0.45, 5.1x the null, BPM |\r{ho}| = 0.76, 8.6x the null)でよく符号化されている。
これらの結果は減少するが、自然な音声を使用する場合(つまり |\r{ho}|=0.25, 2.8x は null である)、実質的に明らかである。
自然なオーディオは、非線形プローブを使用する場合(R2=0.56, 18xはヌル、+0.152は線型プローブR2)に強く符号化される。
エンコード強度はデコーダの層によって異なり、中層でのジョイントエンコード能力の増大は全てのオーディオ特徴(全ての負、p < 0.05)にわたって見られる。
汎用的なEnCodecデコーダは、オーディオ機能間で同様の強力な合成応答、自然なオーディオジョイントエンコーディングにおける同様の非線形ゲイン、および同様の深さプロファイルも見られる。
最適クロス層クラスタは、同一セクション内の最高の全層と比較すると、強度(r = 0.65, p = 0.006)とBPMエンコーディングの精度(r = 0.75, p = 0.001)が向上し、ジョイントエンコーディングには影響しない。
これらの知見は、ニューラルオーディオモデルの解釈可能性を促進し、ニューラル合成のためのターゲット制御戦略を通知する。
関連論文リスト
- How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection [60.88800374832363]
最近のスプーフ検出研究では、ボコーダとニューラルオーディオコーデックの合成波形を用いて攻撃者をシミュレートしている。
ラベル付け選択の違いが検出性能にどのように影響するかを調べ,ラベル付け戦略に対する洞察を提供する。
論文 参考訳(メタデータ) (2026-02-18T10:29:07Z) - FlowDec: A flow-based full-band general audio codec with high perceptual quality [90.05968801459524]
FlowDecは、48kHzでサンプリングされた一般的なオーディオのためのニューラルフルバンドオーディオコーデックである。
音声から一般的な音声へ一般化し、24kbit/sから4kbit/sまで移行する。
論文 参考訳(メタデータ) (2025-03-03T12:49:09Z) - A Closer Look at Neural Codec Resynthesis: Bridging the Gap between Codec and Waveform Generation [65.05719674893999]
トークン予測と回帰に基づく2つの戦略について検討し,Schr"odinger Bridgeに基づく新しい手法を提案する。
異なるデザイン選択が機械と人間の知覚にどのように影響するかを検討する。
論文 参考訳(メタデータ) (2024-10-29T18:29:39Z) - Hold Me Tight: Stable Encoder-Decoder Design for Speech Enhancement [1.4037575966075835]
生のオーディオの1Dフィルターは訓練が困難で、しばしば不安定に悩まされる。
これらの問題は、理論駆動とデータ駆動のアプローチを組み合わせたハイブリッドソリューションによって解決される。
論文 参考訳(メタデータ) (2024-08-30T15:49:31Z) - High-Fidelity Audio Compression with Improved RVQGAN [49.7859037103693]
44.1KHzの音声をたった8kbpsの帯域でトークンに90倍圧縮する,高忠実なユニバーサルニューラルオーディオ圧縮アルゴリズムを提案する。
我々は、すべてのドメイン(音声、環境、音楽など)を単一の普遍モデルで圧縮し、全てのオーディオの生成モデルに広く適用する。
論文 参考訳(メタデータ) (2023-06-11T00:13:00Z) - VocBench: A Neural Vocoder Benchmark for Speech Synthesis [36.94062576597112]
本稿では,最先端のニューラルボコーダの性能をベンチマークするフレームワークであるVocBenchを紹介する。
VocBenchは、共有環境で異なる神経ボコーダを評価するために、体系的な研究を使用している。
以上の結果から, このフレームワークは, 各ボコーダに対して, 合成試料の競争効率と品質を示すことができることがわかった。
論文 参考訳(メタデータ) (2021-12-06T15:09:57Z) - SoundStream: An End-to-End Neural Audio Codec [78.94923131038682]
本稿では,音声,音楽,一般音声を効率よく圧縮できる新しいニューラルオーディオシステムSoundStreamを紹介する。
SoundStreamは完全な畳み込みエンコーダ/デコーダネットワークと残留ベクトル量子化器に頼っている。
エンコーダまたはデコーダ側で、追加のレイテンシなしで、共同圧縮と拡張を行うことができます。
論文 参考訳(メタデータ) (2021-07-07T15:45:42Z) - Psychoacoustic Calibration of Loss Functions for Efficient End-to-End
Neural Audio Coding [30.307627653506756]
ニューラルオーディオ符号化システムの損失関数を再定義するための心理音響校正方式を提案する。
提案手法では、わずか0.9万パラメータの軽量ニューラルネットワークが、商用mpeg-1オーディオ層iiiに匹敵するほぼ透過的なオーディオ符号化を112kbpsで実行する。
論文 参考訳(メタデータ) (2020-12-31T19:46:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。