論文の概要: Mitigating Premature Discretization with Progressive Quantization for Robust Vector Tokenization
- arxiv url: http://arxiv.org/abs/2603.22304v1
- Date: Tue, 17 Mar 2026 18:03:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.039496
- Title: Mitigating Premature Discretization with Progressive Quantization for Robust Vector Tokenization
- Title(参考訳): ロバストベクトルトークン化のためのプログレッシブ量子化による初期離散化の緩和
- Authors: Wenhao Zhao, Qiran Zou, Zhouhan Lin, Dianbo Liu,
- Abstract要約: 本稿では,VQトレーニングにおいて,量子化硬度の力学を基本的かつ以前は見過ごされていた軸として組み込んだプログレッシブ量子化(ProVQ)を提案する。
本稿では,ImageNet-1KとImageNet-100ベンチマークの再構築と生成性能の改善について報告する。
ProVQは複雑な生物学的配列をモデル化し、StrutTokenBenchのリーダーボード上でタンパク質構造のトークン化のための新しいパフォーマンス天井を確立するのに非常に効果的である。
- 参考スコア(独自算出の注目度): 17.805458929887894
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vector Quantization (VQ) has become the cornerstone of tokenization for many multimodal Large Language Models and diffusion synthesis. However, existing VQ paradigms suffer from a fundamental conflict: they enforce discretization before the encoder has captured the underlying data manifold. We term this phenomenon Premature Discretization. To resolve this, we propose Progressive Quantization (ProVQ), which incorporates the dynamics of quantization hardness as a fundamental yet previously overlooked axis in VQ training. By treating quantization as a curriculum that smoothly anneals from a continuous latent space to a discrete one, ProVQ effectively guides the codebook toward the well-expanded manifolds. Extensive experimental results demonstrate the broad effectiveness of ProVQ across diverse modalities. We report improved reconstruction and generative performance on the ImageNet-1K and ImageNet-100 benchmarks, highlighting the ProVQ's boost for generative modeling. Furthermore, ProVQ proves highly effective for modeling complex biological sequences, establishing a new performance ceiling for protein structure tokenization on the StrutTokenBench leaderboard.
- Abstract(参考訳): ベクトル量子化(VQ)は多くの多モード大言語モデルのトークン化と拡散合成の基盤となっている。
しかし、既存のVQパラダイムは基本的な対立に悩まされ、エンコーダが基礎となるデータ多様体をキャプチャする前に、離散化を強制する。
この現象を早生離散化と呼ぶ。
これを解決するために,VQトレーニングにおいて,量子化硬度のダイナミクスを基本的かつ以前は見過ごされていた軸として組み込んだプログレッシブ量子化(ProVQ)を提案する。
量子化を連続潜在空間から離散空間へ滑らかにアニールするカリキュラムとして扱うことにより、ProVQはコードブックを十分に拡張された多様体へ誘導する。
広範囲にわたる実験結果から,ProVQの多種多様性に対する効果が示された。
本稿では,ImageNet-1KとImageNet-100ベンチマークの再構築と生成性能の改善について報告する。
さらに、ProVQは複雑な生物学的配列のモデリングに非常に効果的であることが証明され、StrutTokenBenchのリーダーボード上でタンパク質構造トークン化のための新しいパフォーマンス天井が確立された。
関連論文リスト
- VP-VAE: Rethinking Vector Quantization via Adaptive Vector Perturbation [16.334397444253266]
ベクトル量子変分オートエンコーダ(VQ-VAE)は現代の生成モデルの基礎であるが、しばしばトレーニング不安定性と「コードブック崩壊」に悩まされる。
本稿では,学習中に明示的なコードブックを不要にすることで,表現学習を識別から切り離す新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-19T07:12:43Z) - LSGQuant: Layer-Sensitivity Guided Quantization for One-Step Diffusion Real-World Video Super-Resolution [52.627063566555194]
本稿では,一段階拡散に基づく実世界VSRのための層感度誘導量子化手法LSGQuantを紹介する。
本手法は,ビデオトークンのアクティベーションに適合する動的レンジ適応量子化器 (DRAQ) を備える。
提案手法は,完全精度のオリジンモデルに対してほぼ性能が良く,既存の量子化手法をはるかに上回っている。
論文 参考訳(メタデータ) (2026-02-03T06:53:19Z) - VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction [83.50898344094153]
VQRAEは、イメージ理解のための連続的セマンティック機能と、統一トークン化器内での視覚生成のためのトークンを生成する。
デザインは、多モーダル理解、離散トークンの能力を維持するために、無視可能な意味情報を可能にする。
VQRAEは、視覚的理解、生成、再構築のベンチマークで競合性能を示す。
論文 参考訳(メタデータ) (2025-11-28T17:26:34Z) - VAEVQ: Enhancing Discrete Visual Tokenization through Variational Modeling [22.005420177236804]
VAEVQは,(1)変分潜時量子化(VLQ),AEを量子化用VOEに置き換えて構造的かつスムーズな潜時空間を活用し,より効率的なコーデックアクティベーションを促進する,(2)表現コヒーレンス戦略(RCS),(2)先行および後列化特徴間のアライメント強度を適応的に調整して整合性を高め,ノイズへの過度適合を防止する,(3)分布整合性正規化(DCR),といった3つの重要なコンポーネントから構成される。
論文 参考訳(メタデータ) (2025-11-10T09:07:23Z) - Product-Quantised Image Representation for High-Quality Image Synthesis [11.644579863841434]
本稿では、VQGANのよく知られたベクトル量子化フレームワークにPQを統合する量子化イメージオートエンコーダであるPQGANを紹介する。
PQGANは再建性能の点で最先端の手法よりも顕著な改善を実現している。
論文 参考訳(メタデータ) (2025-10-03T17:17:38Z) - FIMA-Q: Post-Training Quantization for Vision Transformers by Fisher Information Matrix Approximation [55.12070409045766]
ポストトレーニング量子化(PTQ)は近年,費用対効果と有望なモデル圧縮パラダイムとして注目されている。
ビジョン変換器(ViT)の現在のPTQ法は、特に低ビット量子化において、精度が著しく低下している。
論文 参考訳(メタデータ) (2025-06-13T07:57:38Z) - XQ-GAN: An Open-source Image Tokenization Framework for Autoregressive Generation [54.2574228021317]
XQ-GANは画像再構成と生成の両方のために設計された画像トークン化フレームワークである。
我々のフレームワークは、ベクトル量子化(VQ)、残留量子化(RQ)、マルチスケール残留量子化(MSVQ)、製品量子化(PQ)、バイナリ球面量子化(BSQ)など、最先端の量子化技術を統合する。
標準の ImageNet 256x256 ベンチマークでは,本モデルが MAGVIT-v2 (0.9 rFID) と VAR (0.9 rFID) を大幅に上回り,0.64 の rFID を達成した。
論文 参考訳(メタデータ) (2024-12-02T17:58:06Z) - HyperVQ: MLR-based Vector Quantization in Hyperbolic Space [56.4245885674567]
一般的な解決策は、VQ変分オートエンコーダ(VQVAE)にベクトル量子化(VQ)を採用することである。
本稿では,双曲型多相ロジスティック回帰(MLR)問題としてVQを定式化する新しい手法であるHyperVQを紹介する。
本実験は,HyperVQが従来のVQに比較し,識別性能を上回りながら,生成・再構成タスクに適合することを示した。
論文 参考訳(メタデータ) (2024-03-18T03:17:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。