論文の概要: Language-Statistical Analysis of Neural Audio Codec Tokens Across Architectures, Corpora, and Noise Conditions
- arxiv url: http://arxiv.org/abs/2608.31037v1
- Date: Mon, 31 Aug 2026 16:15:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.50234
- Title: Language-Statistical Analysis of Neural Audio Codec Tokens Across Architectures, Corpora, and Noise Conditions
- Title(参考訳): アーキテクチャ, コーパス, 騒音条件を考慮したニューラルオーディオコーデックの言語統計的解析
- Authors: Joonyong Park, Shinnosuke Takamichi, David M. Chan, Shunsuke Kando, Yuki Saito, Hiroshi Saruwatari,
- Abstract要約: ニューラルオーディオコーデック(NAC)は、音声を離散トークンシーケンスに変換する。
本稿では,マルチコードブック残差ベクトル量子化(RVQ),シングルコードブックVQ,非VQ設計にまたがる13個のNACのトークン統計を解析する。
- 参考スコア(独自算出の注目度): 40.627503339237116
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Neural audio codecs (NACs) convert speech into discrete token sequences, and prior work has reported that these sequences follow language-like statistical laws. This paper analyzes the token statistics of 13 NACs spanning multi-codebook residual vector quantization (RVQ), single-codebook VQ, and non-VQ designs, evaluated on three corpora under clean, white-noise, and real-world DEMAND-noise conditions. Zipf and Heaps parameters, unigram entropy, codebook occupancy, and Jensen-Shannon divergence (JSD) are estimated from matched token samples with explicit fit-validity safeguards and family-conditional $n$-gram orders. Corpus identity explains little variance in any metric, whereas acoustic condition and quantizer meta-category dominate in a metric-dependent way, and unigram entropy is the metric most strongly associated with meta-category. Clean-to-noise JSD computed at a common unigram order is associated with mel-cepstral distortion most clearly under DEMAND noise. The collapse and explosion degradation signatures previously reported for RVQ codecs concentrate in RVQ cells under white and DEMAND noise, respectively; explosion also occurs in non-VQ codecs, and single-codebook VQ codecs shift in occupancy and distribution shape without either signature. These results provide architecture-conditioned conventions for applying language-statistical analysis to NAC tokens.
- Abstract(参考訳): ニューラルオーディオコーデック(NAC)は、音声を離散トークンシーケンスに変換する。
本稿では,マルチコードブック残差ベクトル量子化(RVQ),シングルコードブックVQ,およびVQ設計にまたがる13個のNACのトークン統計を分析し,クリーン,ホワイトノイズ,現実のDEMANDノイズ条件下での3つのコーパスで評価した。
一致したトークンサンプルからZipfとHeapsパラメータ、ユニグラムエントロピー、コードブック占有率、Jensen-Shannon発散率(JSD)を推定する。
コーパス・アイデンティティ(英語版)は、任意の計量においてほとんどばらつきを説明できないが、音響条件と量子化器メタカテゴリーは、計量依存的な方法で支配的であり、ユニグラムエントロピーは、メタカテゴリに最も強く結びついている計量である。
共通のユニグラム順序で計算されるクリーン・ツー・ノイズJSDは、DEMANDノイズの下で最も明確にメル・ケプストラム歪みと関連付けられる。
RVQコーデックに報告されている崩壊と爆発分解の署名は、それぞれ白とDEMANDノイズの下でRVQ細胞に集中しており、爆発はVQコーデック内でも起こり、シングルコードブックのVQコーデックは、いずれのシグネチャも持たず占有状態と分布形態に変化する。
これらの結果はNACトークンに言語統計解析を適用するためのアーキテクチャ条件付き規約を提供する。
関連論文リスト
- Geometric Iterative Retrieval for Neural Audio Codec Resynthesis [35.61634772862795]
この二分法は不完全であり、コードブック空間における自然な反復分解としてRVQ層階層自体を用いるパラダイムである幾何反復探索を導入していると論じる。
本研究では,音声・音楽間の復元作業について評価し,シングルパストークン予測とワンステップ回帰ベースラインの改善点を示す。
論文 参考訳(メタデータ) (2026-08-19T17:29:56Z) - Evaluation of Variational Quantum Classifiers (VQC) for Cyberattack Detection in the NISQ Era [0.0]
変分量子(VQC)は、ノイズ中間スケール量子(NISQ)時代のネットワーク異常を検出することができる。
モデルは22種類のNSL-KDD攻撃カテゴリにまたがるクラスバランスセットで訓練され、表現能力の調査として評価された。
我々はこの挙動を過度な圧縮によって引き起こされる線形分離性の喪失と一致すると解釈する。
論文 参考訳(メタデータ) (2026-06-19T20:00:48Z) - Exploiting Discriminative Codebook Prior for Autoregressive Image Generation [54.14166700058777]
トークンベースの自己回帰画像生成システムは、まずトークンインデックスのシーケンスをコードブックでトークン化し、次にこれらのシーケンスを自己回帰パラダイムでモデル化する。
自己回帰生成モデルはインデックス値のみに基づいて訓練されるが、豊富なトークン類似性情報を含むコードブックにエンコードされた前者は利用されない。
近年の研究では、トークン上に単純なk平均クラスタリングを行い、コードブックを減らした生成モデルのトレーニングを容易にすることで、これを先に組み込もうとしている。
k-meansの代替として、差別的コードブック先駆者(DCPE)を提案する。
論文 参考訳(メタデータ) (2025-08-14T15:00:00Z) - Alleviating Distribution Shift in Synthetic Data for Machine Translation Quality Estimation [55.73341401764367]
合成QEデータの分散シフトを緩和する新しいフレームワークであるDCSQEを紹介する。
DCSQEは、参照、すなわち翻訳監督信号を使用して、生成プロセスとアノテーションプロセスの両方をガイドする。
実験により、DCSQEは教師なし設定と教師なし設定の両方でSOTAベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2025-02-27T10:11:53Z) - Autoregressive Speech Synthesis without Vector Quantization [135.4776759536272]
We present MELLE, a novel continuous-valued token based language modeling approach for text-to-speech synthesis (TTS)。
MELLEはテキスト条件から直接連続メル-スペクトログラムフレームを自動回帰生成する。
MELLEは、サンプリングベクトル量子化符号の固有の欠陥を回避し、ロバスト性問題を緩和する。
論文 参考訳(メタデータ) (2024-07-11T14:36:53Z) - An Independence-promoting Loss for Music Generation with Language Models [64.95095558672996]
音楽生成方式は音声トークンの語彙に依存しており、一般にオートエンコーダによって学習された離散潜在空間の符号として提供される。
本稿では,音楽生成のための言語モデルにおけるトークン化器として使用されるオートエンコーダを正規化するために,独立性向上の損失を導入する。
論文 参考訳(メタデータ) (2024-06-04T13:44:39Z) - CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement [5.766499647507758]
さらに、時間周波数(TF)領域における音声強調(SE)のためのコンバータベース計量生成逆ネットワーク(CMGAN)モデルを開発した。
以上の結果から,CMGANは3つの主要な音声強調課題において,既存の最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2022-09-22T15:50:21Z) - Single-Shot Decoding of Linear Rate LDPC Quantum Codes with High
Performance [5.33024001730262]
我々は、線形符号化率、スケーリング距離、効率的な復号方式を用いて、低密度パリティチェック(LDPC)量子コード群を構築し、解析する。
コードファミリーは、Guth と Lubotzky が最初に示唆したように、閉じた4次元の双曲型のテッセルレーションに基づいている。
論文 参考訳(メタデータ) (2020-01-10T17:21:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。