論文の概要: A Unified Rate-Distortion Perspective on Vector, Product, and Scalar Quantization
- arxiv url: http://arxiv.org/abs/2609.02107v1
- Date: Wed, 02 Sep 2026 04:50:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.08827
- Title: A Unified Rate-Distortion Perspective on Vector, Product, and Scalar Quantization
- Title(参考訳): ベクトル, 積, スカラー量子化に関する一元的速度歪みの考察
- Abstract要約: コードブックの利用を最大化するよりも、歪みを最小限に抑えることが、再構築の本質的な目的であることを示す。
固有量子化比較のための2つの重要なフェアネス条件を確立する:潜在特徴統計を制御し、同一の符号化速度を強制する。
- 参考スコア(独自算出の注目度): 16.767376343576974
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Discrete visual tokenization, predominantly driven by vector, scalar, and product quantization, lacks a unified conceptual framework for understanding quantization tradeoffs. In this paper, we propose a unified rate--distortion perspective on modern discrete visual tokenization. By viewing quantization as lossy compression, we characterize the nominal fixed-length coding rate through token count and codebook size, and quantization error as the distortion. Within this framework, we resolve three central questions. First, we theoretically and empirically show that minimizing distortion, rather than maximizing codebook utilization, is the primary intrinsic objective for reconstruction fidelity, with a direct connection to the STE-induced gradient discrepancy. Second, we establish two critical fairness conditions for intrinsic quantization comparison: controlling latent feature statistics and enforcing identical coding rates. Third, under these conditions, we recover the VQ--PQ--SQ distortion hierarchy in modern visual tokenization and show empirically that modern VQ methods achieve the lowest distortion. This work provides a foundational rate--distortion reframing of modern discrete visual tokenization, resolves ambiguities in quantizer evaluation, and provides a controlled framework for isolating intrinsic quantization effectiveness under fixed-rate constraints.
- Abstract(参考訳): 離散的な視覚的トークン化は、主にベクトル、スカラー、および製品量子化によって駆動され、量子化トレードオフを理解するための統一された概念的枠組みが欠如している。
本稿では、現代の離散的視覚的トークン化における統合されたレート・歪みの視点を提案する。
量子化を損失圧縮と見なすことにより、トークンカウントとコードブックサイズによる名目固定長符号化率と量子化誤差を歪みとして特徴付ける。
この枠組みでは、3つの中心的な疑問を解決します。
まず、コードブックの利用を最大化するよりも、歪みを最小化する方が、STEによる勾配ずれに直接関連して、復元の本質的な目的であることを示す。
第二に、本質的な量子化比較のための2つの臨界フェアネス条件を確立し、潜在特徴統計を制御し、同一の符号化速度を強制する。
第三に、これらの条件下では、現代の視覚トークン化におけるVQ--PQ-SQ歪み階層を復元し、現代のVQ法が最低歪みを達成することを実証的に示す。
この研究は、現代の離散的な視覚的トークン化の基本的な速度-歪み再フレーミングを提供し、量子化器の評価におけるあいまいさを解消し、固定レート制約の下で固有の量子化効率を分離するための制御されたフレームワークを提供する。
関連論文リスト
- Distributional Matching for Vector Quantization: A Unified Theoretical and Empirical Framework [19.918485811165425]
本稿では,ベクトル量子化のための分布マッチングフレームワークを提案する。
どちらの問題も特徴ベクトルとコードベクトルの分布の基本的なミスマッチに追従できることを示す。
論文 参考訳(メタデータ) (2026-07-17T13:18:23Z) - MPQ-DMv2: Flexible Residual Mixed Precision Quantization for Low-Bit Diffusion Models with Temporal Distillation [74.34220141721231]
我々は,textbfMixed textbfPrecision textbfQuantizationフレームワークを改良したMPQ-DMv2を提案する。
論文 参考訳(メタデータ) (2025-07-06T08:16:50Z) - FIMA-Q: Post-Training Quantization for Vision Transformers by Fisher Information Matrix Approximation [55.12070409045766]
ポストトレーニング量子化(PTQ)は近年,費用対効果と有望なモデル圧縮パラダイムとして注目されている。
ビジョン変換器(ViT)の現在のPTQ法は、特に低ビット量子化において、精度が著しく低下している。
論文 参考訳(メタデータ) (2025-06-13T07:57:38Z) - Quantitative Error Feedback for Quantization Noise Reduction of Filtering over Graphs [14.837260348082953]
本稿では,分散グラフフィルタリングにおける量子化雑音の低減を目的とした,革新的な誤りフィードバックフレームワークを提案する。
これは状態空間デジタルフィルタの誤差スペクトル形成技術に由来するため、異なる領域にわたる量子化フィルタリングプロセス間の接続を確立する。
論文 参考訳(メタデータ) (2025-06-02T07:57:04Z) - Oscillations Make Neural Networks Robust to Quantization [0.16385815610837165]
量子化アウェアトレーニング(QAT)における振動は,STE(Straight-Through Estimator)によって引き起こされる望ましくない人工物であることを示す。
量子化を改善するために振動を誘導する新しい正則化法を提案する。
論文 参考訳(メタデータ) (2025-02-01T16:39:58Z) - QuEST: Low-bit Diffusion Model Quantization via Efficient Selective Finetuning [52.157939524815866]
本稿では,不均衡な活性化分布を量子化困難の原因として同定する。
我々は,これらの分布を,より量子化しやすいように微調整することで調整することを提案する。
本手法は3つの高解像度画像生成タスクに対して有効性を示す。
論文 参考訳(メタデータ) (2024-02-06T03:39:44Z) - Towards Accurate Post-Training Quantization for Vision Transformer [48.779346466374406]
既存のトレーニング後の量子化手法は依然として深刻な性能低下を引き起こしている。
APQ-ViTは、既存のトレーニング後の量子化手法を証明マージンによって超越している。
論文 参考訳(メタデータ) (2023-03-25T03:05:26Z) - Regularized Vector Quantization for Tokenized Image Synthesis [126.96880843754066]
画像の離散表現への量子化は、統合生成モデリングにおける根本的な問題である。
決定論的量子化は、厳しいコードブックの崩壊と推論段階の誤調整に悩まされ、一方、量子化は、コードブックの利用率の低下と再構築の目的に悩まされる。
本稿では、2つの視点から正規化を適用することにより、上記の問題を効果的に緩和できる正規化ベクトル量子化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-11T15:20:54Z) - Neural Networks with Quantization Constraints [111.42313650830248]
量子化学習における制約付き学習手法を提案する。
結果の問題は強い双対であり、勾配推定は不要であることを示す。
提案手法は画像分類タスクにおける競合性能を示す。
論文 参考訳(メタデータ) (2022-10-27T17:12:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。