論文の概要: ZipCodec: Ultra-Low-Frame-Rate Streaming Speech Coding
- arxiv url: http://arxiv.org/abs/2609.11642v1
- Date: Thu, 10 Sep 2026 14:49:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.406054
- Title: ZipCodec: Ultra-Low-Frame-Rate Streaming Speech Coding
- Title(参考訳): ZipCodec:超低フレームレート音声符号化
- Abstract要約: ZipCodecは6.25Hzと0.80kbpsで動作し、理論的遅延は160msである。
提案手法は,大規模なWavLM蒸留と再設計されたトランスベースアーキテクチャを組み合わせたものである。
ZipCodecは、コンシューマグレードのCPU上でリアルタイムのシングルストリーム推論を実現する。
- 参考スコア(独自算出の注目度): 27.32235541083431
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Neural audio codecs are a fundamental component of modern speech generation systems. While recent codecs achieve increasingly low bitrates, reducing frame rate remains challenging, as each token must preserve more information while maintaining reconstruction quality. We present ZipCodec, a streaming neural speech codec operating at 6.25 Hz and 0.80 kbps with a theoretical latency of 160 ms. Our approach combines large-scale WavLM distillation with a redesigned transformer-based architecture, a scalar spherical quantizer, and a latency-aware streaming decoder. Experiments show that ZipCodec substantially outperforms existing streaming codecs at comparable bitrates in both reconstruction and downstream tasks, while operating at a significantly lower frame rate. Despite its 842M parameters, ZipCodec achieves real-time single-stream inference on a consumer-grade CPU. Demo samples, code and checkpoints are available at https://lucadellalib.github.io/zipcodec-web/.
- Abstract(参考訳): ニューラルオーディオコーデックは現代の音声生成システムの基本コンポーネントである。
近年のコーデックではビットレートが低下する傾向にあるが、フレームレートの低減は依然として困難であり、各トークンは復元品質を維持しながらより多くの情報を保持する必要がある。
ZipCodecは6.25Hzと0.80kbpsのストリーミングニューラル音声コーデックで,160msの理論的レイテンシを持つ。我々は,大規模なWavLM蒸留と再設計されたトランスフォーマベースアーキテクチャ,スカラー球面量子化器,遅延対応ストリーミングデコーダを組み合わせる。
ZipCodecは、リコンストラクションとダウンストリームの両方のタスクにおいて、既存のストリーミングコーデックを大幅に上回っており、フレームレートは大幅に低い。
842Mパラメータにもかかわらず、ZipCodecはコンシューマグレードのCPU上でリアルタイムのシングルストリーム推論を実現する。
デモサンプル、コード、チェックポイントはhttps://lucadellalib.github.io/zipcodec-web/.comで入手できる。
関連論文リスト
- PIC: Revisiting INR for Image Coding with Fast Encoding and Sub-Millisecond Decoding [74.2282307661978]
Inlicit Neural representation (INR)は、近年、新しいビュー合成と画像/ビデオ符号化において顕著な進歩を遂げている。
本研究では,フィードフォワードINR画像符号化アーキテクチャであるPractical INR Image Codec (PIC)を提案する。
論文 参考訳(メタデータ) (2026-09-08T16:52:00Z) - Reconstruct! Don't Encode: Self-Supervised Representation Reconstruction Loss for High-Intelligibility and Low-Latency Streaming Neural Audio Codec [55.40419731151658]
メル-スペクトログラム再構成に最適化されたニューラルオーディオコーデックは、しばしばインテリジェンスを維持することができない。
本研究では,自己教師付き再建(SSRR)の喪失がトレーニングとパフォーマンスを根本的に改善することを示す。
我々のJHCodecは、最小のレイテンシとトレーニングコストの削減を維持しながら、最先端のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2026-03-06T04:13:06Z) - U-Codec: Ultra Low Frame-rate Neural Speech Codec for Fast High-fidelity Speech Generation [71.59514998928833]
U-Codecは5Hzの超低フレームレートで高忠実度再構成と高速音声生成を実現する。
U-Codecを大規模言語モデル(LLM)ベースの自動回帰TSモデルに適用する。
論文 参考訳(メタデータ) (2025-10-19T05:09:20Z) - FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation [27.32235541083431]
FocalCodec-Streamは、音声を1つのバイナリコードブックに0.55から0.80kbpsで圧縮し、理論的な遅延は80msである。
実験によると、FocalCodec-Streamは既存のストリーム可能なコーデックを同等の性能で上回っている。
論文 参考訳(メタデータ) (2025-09-19T17:57:13Z) - NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference [19.201753265782685]
大規模言語モデル(LLM)は、音声コーデックを利用して音声をトークンに識別することで、かなり高度なオーディオ処理を行う。
既存のオーディオコーデックは高いフレームレートで動作し、特に自己回帰モデルにおいてトレーニングと推論が遅くなる。
我々は,12.5フレーム/秒(FPS)で高品質な圧縮を実現する,最先端オーディオであるNanoCodecを紹介する。
論文 参考訳(メタデータ) (2025-08-07T20:20:32Z) - Embedding Compression Distortion in Video Coding for Machines [67.97469042910855]
現在、ビデオ伝送は人間の視覚システム(HVS)だけでなく、分析のための機械認識にも役立っている。
本稿では,機械知覚関連歪み表現を抽出し,下流モデルに埋め込む圧縮歪埋め込み(CDRE)フレームワークを提案する。
我々のフレームワークは,実行時間,パラメータ数といったオーバーヘッドを最小限に抑えて,既存のコーデックのレートタスク性能を効果的に向上させることができる。
論文 参考訳(メタデータ) (2025-03-27T13:01:53Z) - SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound [40.810505707522324]
SemantiCodecは、様々なオーディオタイプで毎秒100トークン未満にオーディオを圧縮するように設計されている。
本稿では,セマンティコーデックが再現性に関する最先端の記述を著しく上回っていることを示す。
また,SemantiCodecは,評価されたすべての最先端オーディオコーデックよりもはるかにリッチな意味情報を含んでいることも示唆した。
論文 参考訳(メタデータ) (2024-04-30T22:51:36Z) - High Fidelity Neural Audio Compression [92.4812002532009]
我々は、ニューラルネットワークを利用した最先端のリアルタイム、高忠実、オーディオを導入する。
ストリーミングエンコーダ-デコーダアーキテクチャと、エンドツーエンドでトレーニングされた量子化潜在空間で構成されている。
単一マルチスケール・スペクトログラム・アドバイザリーを用いて、トレーニングを簡素化し、高速化する。
論文 参考訳(メタデータ) (2022-10-24T17:52:02Z) - SoundStream: An End-to-End Neural Audio Codec [78.94923131038682]
本稿では,音声,音楽,一般音声を効率よく圧縮できる新しいニューラルオーディオシステムSoundStreamを紹介する。
SoundStreamは完全な畳み込みエンコーダ/デコーダネットワークと残留ベクトル量子化器に頼っている。
エンコーダまたはデコーダ側で、追加のレイテンシなしで、共同圧縮と拡張を行うことができます。
論文 参考訳(メタデータ) (2021-07-07T15:45:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。