論文の概要: KVAE: Family of Tokenizers for Multimodal Generative Models
- arxiv url: http://arxiv.org/abs/2608.05798v1
- Date: Thu, 06 Aug 2026 09:34:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.734647
- Title: KVAE: Family of Tokenizers for Multimodal Generative Models
- Title(参考訳): KVAE:マルチモーダル生成モデルのための tokenizers ファミリー
- Authors: Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov, Ilia Vasiliev, Ilia Trushkin, Valeriya Kobenko, David Chikovani, Alexander Ivanov, Azat Saginbaev, Egor Silvestrov, Ivan Mikheev, Konstantin Zakharov,
- Abstract要約: 本報告では、オーディオ、画像、ビデオのための一連のKVAEトークンを提示する。
KVAE-Audioは、連続フルバンド48kHzのトークンであり、50Hzのラテント64チャンネルを持つ。
KVAE-3Dは4x16x16と4x8x8圧縮のための2つの因果的ビデオトークンである。
KVAE-2Dは画像モデルであり、入力を8の係数で32チャンネルで圧縮する。
- 参考スコア(独自算出の注目度): 28.838493078938125
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Latent diffusion modeling (LDM), a prominent paradigm, utilizes tokenizers to map input signal to compressed representation. This dependency positions tokenizer as an integral part of generation process itself, since it affects learning speed, quality of synthesized samples and lay foundation for later applications. This report presents series of KVAE tokenizers for audio, image and video, all designed for subsequent text-conditioned generation: KVAE-Audio, a continuous full-band 48 kHz tokenizer with a 50 Hz latent of 64 channels; KVAE-3D -- two causal video tokenizers for 4x16x16 and 4x8x8 compression; KVAE-2D, an image model, compressing input by factor of 8 with 32 channels. We demonstrate that reconstruction (PSNR, LPIPS, PESQ, etc.) and generation results on objective (Frechet Distance, CLIP score, CLAP score, etc.) and subjective (side-by-side evaluation) metrics matches or surpasses frontier opensource tokenizers, such as VAEs from Wan-2.2, HunyuanVideo-1.5, FLUX.2, MovieGen, StableAudio and MMAudio. Considering difficulty of development, we share with community training details, model selection method and ablation on design choices. The code is publicly available at https://github.com/kandinskylab/kvae and https://github.com/kandinskylab/kvae-audio.
- Abstract(参考訳): 遅延拡散モデリング(LDM)は、トークン化器を用いて入力信号を圧縮表現にマッピングする。
この依存性は、学習速度、合成サンプルの品質、およびその後の応用の基礎となるため、生成プロセス自体の不可欠な部分としてトークン化剤を位置づけている。
KVAE-3D - 4x16x16および4x8x8圧縮用の2つの因果的ビデオトークン化器 KVAE-2D - 画像モデル KVAE-2D - 8と32チャンネルの入力を圧縮する。
我々は,Wan-2.2, HunyuanVideo-1.5, FLUX.2, MovieGen, StableAudio, MMAudioのVAE, VAE, LPIPS, FLUX.2, MovieGen, StableAudio, MMAudio などのフロンティア・オープン・ソース・トークン・カウンタと, 目的値(Frechet Distance, CLIP score, CLAP score, CLAP score など)と主観的(サイド・バイ・サイド・アセスメント)の測定値が一致するか,あるいは超えることを示す。
開発が難しいことを考えると、我々はコミュニティのトレーニングの詳細、モデル選択方法、設計選択の合理化について共有する。
コードはhttps://github.com/kandinskylab/kvaeとhttps://github.com/kandinskylab/kvae-audioで公開されている。
関連論文リスト
- TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling [13.05578634768109]
テキスト対応拡散変換器音声コーデック(TaDiCodec)について紹介する。
TaDiCodecは拡散オートエンコーダによる量子化と再構成にエンドツーエンドの最適化を採用している。
フレームレートは6.25Hzで、それに対応する圧縮は0.0875kbpsで、1層コードブックで24kHzの音声を処理できる。
論文 参考訳(メタデータ) (2025-08-22T20:45:03Z) - WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling [63.8735398698683]
言語モデルの重要な構成要素は、高次元の自然信号を低次元の離散トークンに圧縮するトークン化器である。
本稿では,従来の音響領域におけるSOTA音響モデルよりもいくつかの利点があるWavTokenizerを紹介する。
WavTokenizerは、優れたUTMOSスコアを持つ最先端の再構築品質を実現し、本質的によりリッチなセマンティック情報を含んでいる。
論文 参考訳(メタデータ) (2024-08-29T13:43:36Z) - High-Fidelity Audio Compression with Improved RVQGAN [49.7859037103693]
44.1KHzの音声をたった8kbpsの帯域でトークンに90倍圧縮する,高忠実なユニバーサルニューラルオーディオ圧縮アルゴリズムを提案する。
我々は、すべてのドメイン(音声、環境、音楽など)を単一の普遍モデルで圧縮し、全てのオーディオの生成モデルに広く適用する。
論文 参考訳(メタデータ) (2023-06-11T00:13:00Z) - High Fidelity Neural Audio Compression [92.4812002532009]
我々は、ニューラルネットワークを利用した最先端のリアルタイム、高忠実、オーディオを導入する。
ストリーミングエンコーダ-デコーダアーキテクチャと、エンドツーエンドでトレーニングされた量子化潜在空間で構成されている。
単一マルチスケール・スペクトログラム・アドバイザリーを用いて、トレーニングを簡素化し、高速化する。
論文 参考訳(メタデータ) (2022-10-24T17:52:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。