論文の概要: ShatterQuant: Breaking Uniform Precision with Block-Wise Mixed-Precision on a Systolic Transformer Hardware Accelerator
- arxiv url: http://arxiv.org/abs/2610.00207v1
- Date: Sun, 20 Sep 2026 20:01:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.403677
- Title: ShatterQuant: Breaking Uniform Precision with Block-Wise Mixed-Precision on a Systolic Transformer Hardware Accelerator
- Title(参考訳): ShatterQuant:Systolic Transformerハードウェアアクセラレータのブロックワイズ混合精度で一様精度を破る
- Abstract要約: 本稿では,各テンソル内における混合精度量子化を実現するハードウェア・ソフトウェア共同設計フレームワークShatterQuantを提案する。
本稿では,ブロックレベルの標準偏差と重み感度に基づいて,テンソル内精度を割り当てるハードウェア・アウェア・ポストトレーニング手法を提案する。
ハードウェア・ソフトウェア共同設計により,微細なテンソル内混合精度を実現することができることを示す。
- 参考スコア(独自算出の注目度): 3.488119146348504
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Due to limited support for intra-tensor heterogeneous precision in conventional accelerators, neural network quantization remains largely restricted to per-tensor precision assignment. We present ShatterQuant, a hardware-software co-designed framework enabling mixed-precision quantization within each tensor by assigning independent bit-widths to blocks of a weight projection. ShatterQuant couples precision granularity with PE configuration, such that each precision determines an effective block height. We introduce (1) a hardware-aware post-training method that assigns intra-tensor precision based on block-level standard deviation and weight sensitivity; (2) the ShatterQuant Transformer Accelerator supporting 1/2/4/8-bit weight precision, precision-dependent PE configuration, block rescaling, and integrated softmax and piecewise-linear nonlinearities; and (3) an evaluation of model-hardware tradeoffs using an implementation in the TSMC 16nm PDK operating at 1 GHz, achieving 1.5 TOPS, 760 GOPS/$mm^2$ area efficiency, and 2.8 TOPS/W energy efficiency. On DeiT and ImageNet-1K, ShatterQuant achieves accuracy within $3.3\%$ of state-of-the-art mixed-precision techniques while using a 2 bit lower effective bitwidth, while for PixelDiT demonstrates comparable generation quality. ShatterQuant demonstrates how fine-grained intra-tensor mixed-precision can be realized through hardware-software co-design.
- Abstract(参考訳): 従来の加速器では、テンソル内不均一な精度が制限されているため、ニューラルネットワークの量子化は、テンソル毎の精度の割り当てに大きく制限されている。
重み投影のブロックに独立ビット幅を割り当てることで、各テンソル内で混合精度の量子化を可能にするハードウェア・ソフトウェア共同設計フレームワークShatterQuantを提案する。
ShatterQuantは、PEの構成と精度の粒度を結合し、各精度が有効ブロック高さを決定する。
1)ブロックレベルの標準偏差と重量感度に基づいてテンソル内精度を割り当てるハードウェア・アウェア・ポストトレーニング手法,(2) 1/2/4/8ビットのウェイト精度, 精度依存PE構成, ブロック再スケーリング, 一体化ソフトマックス, ピースワイド非線形性をサポートするShatterQuant Transformer Accelerator, (3) 1GHzで動作するTSMC 16nm PDKの実装によるモデルハードウエアトレードオフの評価, 1.5 TOPS, 760 GOPS/$mm^2$領域効率, 2.8 TOPS/Wエネルギー効率について紹介する。
DeiT と ImageNet-1K では、ShatterQuant は2ビット以下の有効ビット幅を使用しながら、最先端の混合精度の 3.3 % の精度で精度を達成している。
ShatterQuantは、ハードウェアとソフトウェアの共同設計によって、いかに微細なテンソル内混合精度を実現するかを示す。
関連論文リスト
- BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - ScaleBITS: Scalable Bitwidth Search for Hardware-Aligned Mixed-Precision LLMs [14.073708409982705]
学習後重み量子化は,大規模言語モデル(LLM)のメモリと推論コストの低減に不可欠である
本研究では,メモリ予算下でのビット幅の自動割り当てを実現する混合精度量子化フレームワークであるScaleBITSを提案する。
実験により、ScaleBITSは均一精度の量子化(+36%)よりも大幅に改善し、超低ビット状態における最先端の感度認識ベースライン(+13%)よりも優れていた。
論文 参考訳(メタデータ) (2026-02-06T18:11:16Z) - FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference [25.6644057021512]
量子化は、大きな言語モデル(LLM)推論効率を改善する強力なツールである。
LLM重みとアクティベーションを高精度に定量化することは、モデルの精度を劣化させることなく困難である。
ハードウェア-ソフトウェア共設計手法であるFGMP量子化法を提案する。
論文 参考訳(メタデータ) (2025-04-19T02:51:45Z) - On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks [52.97107229149988]
エッジデバイス上でハードウェア対応の混合精度量子化を行うOn-Chipハードウェア・アウェア量子化フレームワークを提案する。
このパイプラインは、量子化プロセスが量子化演算子の実際のハードウェア効率を知覚することを可能にする。
精度測定のために,マルチチップシナリオにおける演算子の精度への影響を効果的に推定するMask-Guided Quantization Estimation技術を提案する。
論文 参考訳(メタデータ) (2023-09-05T04:39:34Z) - Power-of-Two Quantization for Low Bitwidth and Hardware Compliant Neural
Networks [1.398698203665363]
本稿では,低ビット精度を利用する非線形量子化手法について検討する。
我々は,低ビット幅のPower-of-Two(PoT)ネットワークのトレーニングを可能にするQATアルゴリズムを開発した。
同時に、PoT量子化はニューラルネットワークの計算複雑性を大幅に減らす。
論文 参考訳(メタデータ) (2022-03-09T19:57:14Z) - Mixed Precision of Quantization of Transformer Language Models for
Speech Recognition [67.95996816744251]
トランスフォーマーが表現する最先端のニューラルネットワークモデルは、実用アプリケーションにとってますます複雑で高価なものになりつつある。
現在の低ビット量子化法は、均一な精度に基づいており、量子化エラーに対するシステムの異なる部分での様々な性能感度を考慮できない。
最適局所精度設定は2つの手法を用いて自動的に学習される。
Penn Treebank (PTB)とSwitchboard corpusによるLF-MMI TDNNシステムの試験を行った。
論文 参考訳(メタデータ) (2021-11-29T09:57:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。