論文の概要: Probing Low Frame Rate Degradation in Neural Audio Codecs
- arxiv url: http://arxiv.org/abs/2606.16969v1
- Date: Mon, 15 Jun 2026 17:06:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 18:36:05.086393
- Title: Probing Low Frame Rate Degradation in Neural Audio Codecs
- Title(参考訳): ニューラルオーディオコーデックにおける低フレーム速度劣化の探索
- Authors: Alex Gichamba, Moise Busogi,
- Abstract要約: ニューラルオーディオコーデックにおける低フレームレート劣化のメカニズムについて検討する。
過去の研究で報告された6.25Hzの高品質な崖を再現し、候補説明を評価する。
トレーニング中の一定のクリップ持続時間は、フレームレートの低いトークンが多すぎることを示し、トークン間コンテキストのデコーダを飢えさせます。
- 参考スコア(独自算出の注目度): 0.3342165620612816
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Low frame rates in neural audio codecs are attractive for autoregressive speech synthesis, where the generation cost scales linearly with the sequence length. Recent work has demonstrated that codecs can operate at 12.5 Hz and below, but the mechanisms underlying low frame rate degradation remain insufficiently understood. We investigate these mechanisms through a controlled frame rate ablation. We reproduce a quality cliff at 6.25 Hz reported in previous works and evaluate candidate explanations: phonemic collisions and codebook saturation, neither of which shows evidence of a fundamental barrier. The cliff is instead caused by suboptimal training configuration: fixed clip duration during training yields too few tokens at low frame rates, starving the decoder of inter-token context. Once corrected, WER degrades smoothly with phonemic load down to 3.1 Hz and 1.6 Hz, suggesting the inference-time efficiency gains of low frame rate codecs are more accessible than previously assumed.
- Abstract(参考訳): ニューラルオーディオコーデックの低フレームレートは、生成コストがシーケンス長と線形にスケールする自己回帰音声合成にとって魅力的なものである。
近年の研究では、コーデックは12.5Hz以下で動作可能であることが示されているが、低フレームレート劣化のメカニズムはまだ十分に理解されていない。
フレームレートアブレーションの制御により,これらのメカニズムを解明する。
我々は,従来の研究で報告された6.25Hzの高品質な崖を再現し,音素衝突やコードブック飽和など,基本的な障壁の証拠は示さない。
訓練中の固定されたクリップ持続時間は、低いフレームレートでトークンを多く獲得し、トキン間のコンテキストのデコーダを飢えさせる。
一度修正されると、WERは音素の負荷を3.1Hzと1.6Hzに減らしてスムーズに劣化し、低フレームレートコーデックの推論時間効率の向上は、以前想定されていたよりもアクセスしやすいことを示唆する。
関連論文リスト
- Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models [56.91801348360746]
大規模な音声言語モデル(LALM)は、音声、音声、音楽にまたがって一般化される。
統一デコーダは 時空間のスムーズなバイアスを示します
LALMの学習自由復号法であるemphTemporal Contrastive Decoding (TCD)を提案する。
論文 参考訳(メタデータ) (2026-04-16T02:30:41Z) - NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference [19.201753265782685]
大規模言語モデル(LLM)は、音声コーデックを利用して音声をトークンに識別することで、かなり高度なオーディオ処理を行う。
既存のオーディオコーデックは高いフレームレートで動作し、特に自己回帰モデルにおいてトレーニングと推論が遅くなる。
我々は,12.5フレーム/秒(FPS)で高品質な圧縮を実現する,最先端オーディオであるNanoCodecを紹介する。
論文 参考訳(メタデータ) (2025-08-07T20:20:32Z) - Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate [14.03590336780589]
本稿では,ニューラル音声コーデックに可変フレームレート(VFR)を初めて導入する,TFC(Temporally Flexible Coding)手法を提案する。
TFCはフレームレートをシームレスに平均化し、時間エントロピーに基づいてフレームレートを動的に割り当てる。
実験結果から,TFCを用いた神経再建は高い柔軟性で最適品質を達成し,低フレームレートでも競争性能を維持することが示された。
論文 参考訳(メタデータ) (2025-05-22T16:10:01Z) - High Fidelity Neural Audio Compression [92.4812002532009]
我々は、ニューラルネットワークを利用した最先端のリアルタイム、高忠実、オーディオを導入する。
ストリーミングエンコーダ-デコーダアーキテクチャと、エンドツーエンドでトレーニングされた量子化潜在空間で構成されている。
単一マルチスケール・スペクトログラム・アドバイザリーを用いて、トレーニングを簡素化し、高速化する。
論文 参考訳(メタデータ) (2022-10-24T17:52:02Z) - On Compressing Sequences for Self-Supervised Speech Models [78.62210521316081]
自己教師型学習における時間軸に沿った固定長と可変長のサブサンプリングについて検討した。
可変長サブサンプリングは,低フレームレートで特に良好に動作することがわかった。
音素境界にアクセスできる場合、平均フレームレートが10Hz以下の場合、性能の劣化は見つからない。
論文 参考訳(メタデータ) (2022-10-13T17:10:02Z) - Latent-Domain Predictive Neural Speech Coding [33.458968443594415]
本稿では,VQ-VAEフレームワークに潜在ドメイン予測符号化を導入する。
本稿では,低レイテンシなニューラル音声符号化のためのTF-Codecをエンドツーエンドで提案する。
音声データセットの主観的な結果は、低レイテンシでは、提案したTF-Codecは1kbpsで9kbpsよりも大幅に品質が向上することを示している。
論文 参考訳(メタデータ) (2022-07-18T03:18:08Z) - FastLTS: Non-Autoregressive End-to-End Unconstrained Lip-to-Speech
Synthesis [77.06890315052563]
我々は、低レイテンシで非拘束音声から高品質な音声を直接合成できる非自己回帰的エンドツーエンドモデルであるFastLTSを提案する。
実験により,本モデルは3秒の入力シーケンスにおける現在の自己回帰モデルと比較して,音声生成の19.76倍の高速化を実現していることがわかった。
論文 参考訳(メタデータ) (2022-07-08T10:10:39Z) - SoundStream: An End-to-End Neural Audio Codec [78.94923131038682]
本稿では,音声,音楽,一般音声を効率よく圧縮できる新しいニューラルオーディオシステムSoundStreamを紹介する。
SoundStreamは完全な畳み込みエンコーダ/デコーダネットワークと残留ベクトル量子化器に頼っている。
エンコーダまたはデコーダ側で、追加のレイテンシなしで、共同圧縮と拡張を行うことができます。
論文 参考訳(メタデータ) (2021-07-07T15:45:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。