論文の概要: EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement
- arxiv url: http://arxiv.org/abs/2606.02739v1
- Date: Mon, 01 Jun 2026 18:05:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-03 22:00:04.523932
- Title: EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement
- Title(参考訳): EntangleCodec: 意味的・音響的絡み合いを利用した離散型オーディオトケナイザ
- Authors: Hui Li, Yangfan Gao, Junlin Shang, Changhao Jiang, Tao Gui, Qi Zhang, Xuanjing Huang,
- Abstract要約: EntangleCodecは、量子化の前にキャプションに沿った意味音響表現を学習する独立したオーディオトークンである。
コンパクトなトークンストリーム内に言語内容、話者識別、感情、韻律、音響シーンをキャプチャする。
特殊なコーデックと競合する再構成品質を実現し、統合されたフレームワークでTSとTTAの生成をサポートする。
- 参考スコア(独自算出の注目度): 54.95940885045993
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Audio tokenizers serve as the discrete interface between continuous audio and Audio Language Models (ALMs), but existing tokenizers often struggle to support both understanding and generation. Reconstruction-oriented codecs preserve acoustic fidelity but lack rich semantics, while semantic-aware tokenizers typically rely on separate semantic and acoustic streams, introducing redundancy or misalignment. We propose \textbf{EntangleCodec}, a unified discrete audio tokenizer that learns caption-aligned semantic-acoustic representations before quantization. By aligning audio with rich captions rather than ASR transcripts, EntangleCodec captures linguistic content, speaker identity, emotion, prosody, and acoustic scenes within a compact token stream. A flow-matching diffusion decoder further enables high-quality reconstruction across speech, music, and general audio. EntangleCodec achieves reconstruction quality competitive with specialized codecs, outperforms all codec-based baselines on audio understanding by up to \textbf{+7.4\%} on MMAR, and supports both TTS and TTA generation in a unified framework. Furthermore, EntangleCodec-based audio language models demonstrate strong scaling behavior: even at \textit{0.6B} parameters, the model surpasses specialized continuous-representation LLMs with over \textit{13B} parameters across three benchmarks using \textbf{22$\times$} fewer parameters; scaling to \textit{8B} further establishes new state-of-the-art results on MMAR, highlighting that representation quality is as critical as model scale in audio language modeling. Code and model weights are available at https://github.com/luckyerr/EntangleCodec.
- Abstract(参考訳): オーディオトークンーザは、連続音声と音声言語モデル(ALM)の分離インターフェースとして機能するが、既存のトークンーザは理解と生成の両方をサポートするのに苦労することが多い。
レコンストラクション指向のコーデックは音の忠実さを保っているが、リッチなセマンティクスを欠いている。
量子化に先立ってキャプションに整合した意味音響表現を学習する個別オーディオトークンである。
音声をASRの文字起こしではなくリッチな字幕に合わせることで、EntangleCodecはコンパクトなトークンストリーム内で言語内容、話者のアイデンティティ、感情、韻律、音響シーンをキャプチャする。
フローマッチング拡散復号器は、さらに音声、音楽、一般音声の高品質な再構成を可能にする。
EntangleCodecは、特殊なコーデックと競合する再構成品質を実現し、MMAR上でのtextbf{+7.4\%} までのオーディオ理解におけるコーデックベースのベースラインを上回り、統一されたフレームワークでTSとTTAの生成をサポートする。
さらに、EntangleCodecベースのオーディオ言語モデルは、強いスケーリングの振る舞いを示している: \textit{0.6B} パラメータでさえ、モデルは、 \textbf{22$\times$} のパラメータを使用して3つのベンチマークで、特別な連続表現 LLM を超越している。
コードとモデルの重み付けはhttps://github.com/luckyerr/EntangleCodec.comで確認できる。
関連論文リスト
- MOSS-Audio Technical Report [79.99038866101354]
MOSS-Audioは、音声、環境音、音楽理解のための統一された音声言語モデルである。
音声キャプション、タイムアウェアな質問応答、タイムスタンプによる書き起こし、音声による推論をサポートする。
論文 参考訳(メタデータ) (2026-06-01T07:19:22Z) - AudioMosaic: Contrastive Masked Audio Representation Learning [53.52371029884106]
一般的な音声理解のためのコントラスト学習型オーディオエンコーダであるtextbfAudioMosaic を紹介する。
AudioMosaicは、構造化された時間周波数マスキングをスペクトログラムパッチに適用することで、正のペアを構成する。
実験によると、AudioMosaicはいくつかの標準オーディオベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-14T00:56:51Z) - SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec [83.61175662066364]
音声コーデックは、音声とテキスト言語モデルを統一するための重要なブリッジとして機能する。
既存の手法はセマンティックエンコーディングにおいていくつかの課題に直面している。
本稿では,クロスモーダルな低ビットレートストリーミング音声コーデックSecoustiCodecを提案する。
論文 参考訳(メタデータ) (2025-08-04T19:22:14Z) - XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs [45.655747597751706]
既存の音声コーデックは、高品質な音声再構成と言語モデルによるモデリングの容易さのバランスをとるのに苦労している。
XY-Tokenizerは,多段階マルチタスク学習による意味的能力と音響的能力の対立を緩和する小説である。
論文 参考訳(メタデータ) (2025-06-29T16:51:50Z) - Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model [36.61105228468503]
X-Codecは、Residual Vector Quantizationステージの前に、事前訓練されたセマンティックエンコーダのセマンティック機能を組み込んでいる。
X-Codecは音声合成タスクのWERを大幅に削減し、これらの利点を非音声アプリケーションに拡張する。
音声合成における意味情報の統合は,音声生成における言語モデル全体の性能を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2024-08-30T10:24:07Z) - AudioLM: a Language Modeling Approach to Audio Generation [59.19364975706805]
本稿では,長期的整合性を有する高品質オーディオ生成フレームワークであるAudioLMを紹介する。
本稿では,既存の音声トークンが,再建品質と長期構造との間に異なるトレードオフをもたらすことを示す。
我々は,コヒーレントピアノ音楽の継続を生成することによって,我々のアプローチが音声を超えてどのように拡張されるかを実証する。
論文 参考訳(メタデータ) (2022-09-07T13:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。