論文の概要: MicroQonv: Reshaping Convolution Tensors for Efficient Microscaling in Training and Inference
- arxiv url: http://arxiv.org/abs/2609.28358v1
- Date: Wed, 23 Sep 2026 16:30:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.121341
- Title: MicroQonv: Reshaping Convolution Tensors for Efficient Microscaling in Training and Inference
- Title(参考訳): MicroQonv: トレーニングと推論における効率的なマイクロスケーリングのための変換コンボリューションテンソル
- Abstract要約: MicroQonvは、マイクロスケーリングと畳み込みレイヤの前方および後方操作を組み合わせる方法である。
メモリの移動とストレージの容量は、フル精度のストレージに比べて最大で7.53ドル削減される。
- 参考スコア(独自算出の注目度): 1.3668501188706672
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Microscaling quantization techniques are increasingly used to represent neural network parameters with 8 bits or fewer while preserving near-full precision accuracy. However, applying these methods efficiently in convolutional layers is not straightforward. A naive approach transfers full-precision weights and activations to processing units and quantizes each tensor twice, resulting in much more memory movement than expected. Additional overhead comes from the activation tensors, whose sizes grow substantially because of the im2col transformation applied before quantization. We propose MicroQonv, a way to combine microscaling with convolutional layers' forward and backward operations by quantizing each tensor only once and quantizing the activation tensor before applying a modified version of im2col: channel-batch-first im2col. MicroQonv reduces the quantization cost by a factor of $\times2$ for weights and gradients, and by up to $\times9$ for activations, at a negligible accuracy cost. It reduces memory movement and storage by up to $\times7.53$ compared to their full-precision counterparts. This way, MicroQonv reduces microscaling-quantized activation memory movement by $\times3.5$ for state-of-the-art object detection models YOLOV8nano and $\times2.2$ for YOLOV26nano. It also enables 4-bit microscaling in a quantized latent replay strategy for continual learning at the edge, improving accuracy by +5.7% to +11%.
- Abstract(参考訳): マイクロスケーリング量子化技術は、ほぼ正確な精度を維持しながら、8ビット以下のニューラルネットワークパラメータを表現するために、ますます使われている。
しかし、これらの手法を畳み込み層に効率的に適用することは容易ではない。
ナイーブアプローチでは、フル精度の重みとアクティベーションを処理ユニットに転送し、各テンソルを2倍に定量化することで、予想よりもはるかに多くのメモリ移動を実現する。
追加のオーバーヘッドはアクティベーションテンソルから生じ、そのサイズは量子化の前に適用されたim2col変換によって大きく成長する。
マイクロクォンフ(MicroQonv)は、マイクロスケーリングと畳み込み層の前方・後方操作を結合し、各テンソルを1回だけ量子化し、アクティベーションテンソルを量子化する手法である。
MicroQonvは、量子化コストを重量と勾配で$\times2$、アクティベーションで$\times9$、無視できる精度で最大$\times9$に削減する。
メモリの移動とストレージは、フル精度のストレージに比べて最大$\times7.53ドル削減される。
これによりMicroQonvは、最先端オブジェクト検出モデル YOLOV8nano の $\times3.5$ と YOLOV26nano の $\times2.2$ のマイクロスケーリング量子化アクティベーションメモリ運動を削減した。
また、エッジでの連続学習のための量子化潜在リプレイ戦略で4ビットのマイクロスケーリングを可能にし、精度を+5.7%から+11%向上させた。
関連論文リスト
- KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers [42.11461757540461]
拡散変圧器(DiT)からW4A4への後処理量子化は出力品質を著しく低下させる。
KroQuantは、学習されたKronecker構造を持つ可逆変換をアクティベーションの各32要素ブロックに適用するPTQ手法である。
論文 参考訳(メタデータ) (2026-07-23T15:52:20Z) - Towards Accurate and Efficient Sub-8-Bit Integer Training [24.853958178296587]
量子化は、ニューラルネットワークトレーニングにおける低ビット幅フォーマットを可能にする。
最近の手法では、量子化器上での新しいデータフォーマットと追加の事前処理操作が開発されている。
高い精度と効率を同時に達成することは、依然として非常に難しい。
論文 参考訳(メタデータ) (2024-11-17T03:32:36Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z) - KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization [67.74400574357472]
LLMは、大きなコンテキストウィンドウを必要とするアプリケーションでの利用が増えており、この大きなコンテキストウィンドウでは、KVキャッシュのアクティベーションが推論時のメモリ消費の主要な要因として表面化している。
量子化はKVキャッシュのアクティベーションを圧縮する上で有望な手法であるが、既存のソリューションは4ビット以下の精度でアクティベーションを正確に表現できない。
我々の研究であるKVQuantは、いくつかの新しい手法を取り入れることで、低精度のKVキャッシュ量子化を容易にする。
論文 参考訳(メタデータ) (2024-01-31T18:58:14Z) - MINT: Multiplier-less INTeger Quantization for Energy Efficient Spiking
Neural Networks [20.473852621915956]
スパイキングニューラルネットワーク(SNN)における重みと膜電位を効率よく圧縮する一様量子化手法を提案する。
MINTは膜電位を非常に低い精度(2ビット)に量子化し、メモリフットプリントを大幅に減少させる。
実験結果から,本手法は実精度モデルや他の最先端SNN量子化手法の精度と一致していることがわかった。
論文 参考訳(メタデータ) (2023-05-16T23:38:35Z) - ActNN: Reducing Training Memory Footprint via 2-Bit Activation
Compressed Training [68.63354877166756]
ActNNは、バック伝搬のためのランダムに量子化されたアクティベーションを格納するメモリ効率のトレーニングフレームワークである。
ActNNはアクティベーションのメモリフットプリントを12倍に削減し、6.6倍から14倍のバッチサイズでトレーニングを可能にする。
論文 参考訳(メタデータ) (2021-04-29T05:50:54Z) - VS-Quant: Per-vector Scaled Quantization for Accurate Low-Precision
Neural Network Inference [7.886868529510128]
量子化は、訓練されたモデルの浮動小数点重みとアクティベーションをスケールファクターを用いて低ビット幅整数値にマッピングする。
過剰な量子化、過度に精度を低下させると、精度が低下する。
ベクトル単位のスケールファクタは、2レベル量子化スキームを使用する場合、低ビット幅の整数で実装できる。
論文 参考訳(メタデータ) (2021-02-08T19:56:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。