論文の概要: Structural Bottlenecks on Frequency Representation in End-to-End Audio Models
- arxiv url: http://arxiv.org/abs/2607.08545v1
- Date: Thu, 09 Jul 2026 14:38:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.568846
- Title: Structural Bottlenecks on Frequency Representation in End-to-End Audio Models
- Title(参考訳): エンド・ツー・エンド音声モデルにおける周波数表現に関する構造ボトムネック
- Abstract要約: 本稿では,現在最先端の畳み込みエンコーダが周波数局所化プリミティブへのアクセスに2つの構造的ボトルネックを課していることを示す。
本稿では、エンコーダ遅延を周波数局所的に表現する軽量な介入であるGLRF(Gabor Latent Refactorization)を紹介する。
これらの結果から,疑わしいエンコーダは周波数局所化プリミティブへのアクセスを予測的に低下させ,それらに依存する特徴を包含することを示した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: End-to-end neural audio models achieve high-fidelity compression and generation. We might read that performance as evidence they directly represent interpretable features such as pitch and timbre, but a model can produce plausible outputs without doing so. A model may encode these features in any reachable basis, but regardless of which, the features are well described as compositions of time-frequency-localized primitives. Whether state-of-the-art encoders preserve access to these primitives, and thus to compositions of them, remains unclear. Through theoretical analysis and controlled experiments, we show that several state-of-the-art strided convolutional encoders impose two structural bottlenecks, both predictable from architecture and signal structure, on access to these primitives: (1) they collapse primitives into alias equivalence classes, establishing a bound on representational capacity, and (2) they limit the frequency resolution available to learned filters, restricting separability. For well structured data, we find collapse rates of 31-35% and filter bandwidths 10-35x above the theoretical resolution bound, confirming that both bottlenecks arise under realistic signal conditions. We then introduce Gabor Latent Refactorization (GLRF), a lightweight post-hoc intervention that re-expresses encoder latents in a frequency-localized basis, reducing filter bandwidths from 10-35x to 1.5-3x of the theoretical resolution bound while preserving reconstruction fidelity and improving control over attributes like pitch. These results show that the encoders in question predictably degrade access to frequency-localized primitives, entangling the features that depend on them, and that a lightweight, retraining-free intervention can recover much of that access, improving steerability and interpretability.
- Abstract(参考訳): エンドツーエンドのニューラルオーディオモデルは高忠実度圧縮と生成を実現する。
その性能は、ピッチや音色などの解釈可能な特徴を直接表現する証拠として読むことができるが、モデルがそれを行なわずに可算な出力を生成することができる。
モデルはこれらの特徴を任意の到達可能なベースで符号化することができるが、それにかかわらず、これらの特徴は時間周波数局所化プリミティブの合成としてよく記述される。
最先端のエンコーダがこれらのプリミティブへのアクセスを保ち、したがってそれらの構成を保っているかどうかは、まだ不明である。
理論的解析と制御実験により,(1)プリミティブをエイリアス同値クラスに分解し,表現能力に制限を設け,(2)学習フィルタに利用可能な周波数分解能を制限し,分離性を制限するという,アーキテクチャと信号構造の両方から予測可能な2つの構造的ボトルネックを課していることを示す。
十分に構造化されたデータでは、31~35%の崩壊率と10~35倍のフィルタ帯域が理論分解限界より高くなり、両方のボトルネックが現実的な信号条件下で発生することを確認する。
次に,周波数局所的にエンコーダラプタントを再表現する軽量なポストホック介入であるGabor Latent Refactorization (GLRF)を導入し,フィルタ帯域幅を理論的解像度境界の10-35xから1.5-3xに削減し,再構成の忠実さを維持し,ピッチなどの特性の制御を改善した。
これらの結果は,周波数局所化プリミティブへのアクセスを予測的に低下させ,それらに依存する機能を絡み合わせるとともに,軽量でリトレーニング不要な介入により,そのアクセスの多くを回復し,ステアビリティと解釈性の向上を図っている。
関連論文リスト
- Survey of Novel Deep Learning Architectures for Denoising Gravitational-wave Signals [0.0]
重力波デノジングのための5つのニューラルネットワークアーキテクチャの制御された最初の比較について述べる。
我々は、全天体物理学的に動機づけられた回転二乗ブラックホールパラメータ空間を同時に訓練する。
ネットワーク構造とコリケーションのスペクトル解剖との整合性は、ブルートフォースモデルスケーリングよりも優れる。
論文 参考訳(メタデータ) (2026-09-07T18:00:10Z) - ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers [7.879917783645986]
Diffusion Transformers (DiTs) は高忠実度ビデオ生成に革命をもたらしたが、3Dフルアテンションに依存しているため、二次的な計算ボトルネックが生じる。
動的プルーニングは禁止されたランタイムのオーバーヘッドとメモリの断片化に悩まされ、静的はきめ細かい依存関係をキャプチャできない。
本研究では,重要な帰納バイアスに基づくトレーニングフリーフレームワークであるScalingAttentionを提案する。
Wan2.1の実験では、1.90倍のエンドツーエンドのスピードアップが達成され、最先端のベースラインに対する新たなフロンティアが確立された。
論文 参考訳(メタデータ) (2026-06-22T08:32:07Z) - Parameter-efficient Dual-encoder Architecture with Differentiable Choquet Integral Fusion for Underwater Acoustic Classification [43.92337343771302]
本稿では、音響波形とスペクトログラムを同時に処理するデュアルエンコーダニューラルアーキテクチャを提案する。
潜在的な非対称なチャネル歪みによって最小に劣化した表現に動的に注意を移すことにより、提案したゲーティング機構は水中環境の非定常的課題を緩和する。
論文 参考訳(メタデータ) (2026-06-01T14:49:38Z) - Physics from Video: Identifiability of Time-Invariant Second-Order ODEs under Minimal Trajectory Conditions [60.2784641643737]
ビジュアルリアリズムと物理的な理解のギャップを埋めることは、ビデオベースの世界モデルにとって重要な課題である。
原画素からの連続時間物理法則の構造識別可能性について検討した。
レベルセットの傾斜被覆条件は、学習された潜伏空間が真の物理的状態に局所的に親和的であることを証明する。
論文 参考訳(メタデータ) (2026-05-27T13:22:29Z) - DINO-SAE: DINO Spherical Autoencoder for High-Fidelity Image Reconstruction and Generation [47.409626500688866]
本稿では,DINO Spherical Autoencoder(DINO-SAE)について述べる。
提案手法は, 既修のVFMと強いセマンティックアライメントを維持しつつ, 0.37 rFID と 26.2 dB PSNR に到達し, 最先端の再現性を実現する。
論文 参考訳(メタデータ) (2026-01-30T12:25:34Z) - FLaTEC: Frequency-Disentangled Latent Triplanes for Efficient Compression of LiDAR Point Clouds [52.997038111673966]
FLaTECは、圧縮率の高いフルスキャンの圧縮を可能にする周波数対応圧縮モデルである。
ボキセル化埋め込みを三面体表現に変換することで、空間性、計算コスト、ストレージ要件を低減する。
提案手法は,最先端の速度歪み性能を実現し,標準コーデックのBDレートを78%,94%向上させる。
論文 参考訳(メタデータ) (2025-11-25T08:37:49Z) - ECHO: Frequency-aware Hierarchical Encoding for Variable-length Signals [8.411477071838592]
本稿では,周波数位置埋め込みと高度なバンド分割アーキテクチャを組み合わせた新しい基礎モデルECHOを提案する。
本手法は,様々な種類の機械信号データセットを用いて評価する。
論文 参考訳(メタデータ) (2025-08-20T13:10:44Z) - Re-Bottleneck: Latent Re-Structuring for Neural Audio Autoencoders [14.777092647088756]
本稿では,事前学習したオートエンコーダのボトルネックを修正するための,シンプルなポストホックフレームワークを提案する。
提案手法では,ユーザ定義構造を組み込むために,遅延空間損失を専門にトレーニングした内部ボトルネックである"Re-Bottleneck"を導入する。
最終的に、我々のRe-Bottleneckフレームワークは、ニューラルオーディオモデルの表現をカスタマイズするための柔軟で効率的な方法を提供する。
論文 参考訳(メタデータ) (2025-07-10T15:47:43Z) - Fundamental Limits of Two-layer Autoencoders, and Achieving Them with
Gradient Methods [91.54785981649228]
本稿では,非線形二層型オートエンコーダについて述べる。
本結果は,人口リスクの最小化要因を特徴付け,その最小化要因が勾配法によって達成されることを示す。
符号アクティベーション関数の特別な場合において、この解析は、シャローオートエンコーダによるガウス音源の損失圧縮の基本的な限界を確立する。
論文 参考訳(メタデータ) (2022-12-27T12:37:34Z) - High Fidelity Neural Audio Compression [92.4812002532009]
我々は、ニューラルネットワークを利用した最先端のリアルタイム、高忠実、オーディオを導入する。
ストリーミングエンコーダ-デコーダアーキテクチャと、エンドツーエンドでトレーニングされた量子化潜在空間で構成されている。
単一マルチスケール・スペクトログラム・アドバイザリーを用いて、トレーニングを簡素化し、高速化する。
論文 参考訳(メタデータ) (2022-10-24T17:52:02Z) - Conditioning Trick for Training Stable GANs [70.15099665710336]
本稿では,GANトレーニング中の不安定性問題に対応するため,ジェネレータネットワークに正規性から逸脱する条件付け手法を提案する。
我々は、生成元をシュア分解のスペクトル領域で計算された実サンプルの正規化関数から逸脱するように強制する。
論文 参考訳(メタデータ) (2020-10-12T16:50:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。