論文の概要: PTQ4SNN: Membrane-Aware Post-Training Quantization for Spiking Neural Networks
- arxiv url: http://arxiv.org/abs/2608.07066v1
- Date: Fri, 07 Aug 2026 10:16:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.46199
- Title: PTQ4SNN: Membrane-Aware Post-Training Quantization for Spiking Neural Networks
- Title(参考訳): PTQ4SNN:スパイクニューラルネットワークのための膜対応ポストトレーニング量子化
- Abstract要約: スパイキングニューラルネットワーク(SNN)はスパースとイベント駆動の計算を可能にするが、その低ビット展開は不完全である。
本稿では,小さなキャリブレーションセットのみを用いて,重みと繰り返し膜状態の同時定量化を行う膜認識後量子化フレームワークPTQ4SNNを提案する。
静的および事象に基づく分類とセマンティックセグメンテーションの実験により、PTQ4SNNはW4量子化と約4ビットの膜精度の下でモデル精度を効果的に保存することを示した。
- 参考スコア(独自算出の注目度): 51.21235018272886
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Spiking neural networks (SNNs) enable sparse and event-driven computation, but their low-bit deployment remains incomplete because recurrent membrane states are commonly retained in floating point even after weight quantization. Quantizing these states is challenging because their distributions differ across channels and from the preceding weights, while small perturbations near the firing threshold may alter spike decisions and accumulate over time. We propose PTQ4SNN, a membrane-aware post-training quantization framework that jointly quantizes weights and recurrent membrane states using only a small calibration set. First, a channel-wise Unified Scale Bridge constrains the membrane scale as s_mem,c = s_w,c * 2^k_c, adapting to membrane distributions while enabling shift-compatible scale conversion. Second, Mixed-Precision Bit Allocation assigns 2/4/8-bit precision to membrane channels according to firing activity and quantization sensitivity under an average-bit budget. The framework operates on reusable projection-LIF pairs and supports both convolutional SNNs and spike-driven Transformers without backbone retraining. Experiments on static and event-based classification and semantic segmentation show that PTQ4SNN effectively preserves model accuracy under W4 quantization and approximately 4-bit membrane precision.
- Abstract(参考訳): スパイキングニューラルネットワーク(SNN)はスパースとイベント駆動の計算を可能にするが、リカレント膜状態は重量量子化後も浮動小数点に保持されるため、その低ビット展開は不完全なままである。
これらの状態の量子化は、チャネルや以前の重みと異なるため困難であり、一方、発射しきい値に近い小さな摂動はスパイク決定を変化させ、時間とともに蓄積する可能性がある。
本稿では,小さなキャリブレーションセットのみを用いて,重みと繰り返し膜状態の同時定量化を行う膜認識後量子化フレームワークPTQ4SNNを提案する。
まず, チャネルワイド統一スケールブリッジは膜径をs_mem,c = s_w,c * 2^k_cとして制限し, シフト互換のスケール変換を実現する。
第2に、Mixed-Precision Bit Allocationは平均ビット予算の下で、発射活動と量子化感度に応じて2/4/8ビットの精度を膜チャネルに割り当てる。
このフレームワークは再利用可能なプロジェクション-LIFペアで動作し、バックボーンの再トレーニングなしで畳み込みSNNとスパイク駆動トランスフォーマーの両方をサポートする。
静的および事象に基づく分類とセマンティックセグメンテーションの実験により、PTQ4SNNはW4量子化と約4ビットの膜精度の下でモデル精度を効果的に保存することを示した。
関連論文リスト
- BASC : Behavior-Aligned Quantization and Pruning for Low-Bit Spiking Neural Networks [6.5713207503171285]
スパイキングニューラルネットワーク(SNN)はバイナリスパイクを通じて情報をエンコードし、イベント駆動方式で計算する。
高性能なSNNは、リソース制約のあるデバイスへのデプロイメントを妨げる、メモリとタイムステップのコストをかなり発生させる。
本稿では,2つの軽量モジュールを持つ統一フレームワークである行動適応型SNN圧縮(BASC)を提案する。
論文 参考訳(メタデータ) (2026-08-12T03:39:24Z) - Uncertainty-Preserving QBNNs: Multi-Level Quantization of SVI-Based Bayesian Neural Networks for Image Classification [9.160739594332036]
変分推論に基づくBNNのための体系的マルチレベル量子化フレームワークを提案する。
分類精度と不確かさの両面を保ちながら,BNNを4ビット精度まで量子化できることを実証した。
論文 参考訳(メタデータ) (2025-12-11T12:51:42Z) - MergeQuant: Accurate 4-bit Static Quantization of Large Language Models by Channel-wise Calibration [23.752021919501207]
本稿では,チャネルごとの静的量子化フレームワークであるMergeQuantを提案する。
MergeQuantは、量子化ステップマイグレーション(QSM)メソッドを通じて、チャネルごとの量子化ステップと対応するスケーリングと線形マッピングを統合する。
Llama-2-7Bモデルでは、MergeQuantはFP16ベースラインと比較してデコードで最大1.77倍、エンドツーエンドで最大2.06倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2025-03-07T04:52:28Z) - MPQ-DM: Mixed Precision Quantization for Extremely Low Bit Diffusion Models [37.061975191553]
本稿では,拡散モデルのための混合精度量子化法MPQ-DMを提案する。
重み付き外周波による量子化誤差を軽減するために,外周波混合量子化手法を提案する。
時間ステップを横断する表現を頑健に学習するために,時間-平滑な関係蒸留方式を構築した。
論文 参考訳(メタデータ) (2024-12-16T08:31:55Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z) - Mitigating the Impact of Outlier Channels for Language Model Quantization with Activation Regularization [62.15918574997175]
言語モデルには、平均値が他のチャネルよりも桁違いに高い外れ値チャネルが含まれていることが知られている。
本稿では,QAT(Quantization-Aware Training)とアクティベーション・カルトシス・正規化(Activation Kurtosis regularization)によって,レイヤの入力を正規化する戦略を提案する。
入力と出力の両方を正規化することは、入力量子化の難しさを重みに"移行"するのを防ぐために重要であることを示す。
論文 参考訳(メタデータ) (2024-04-04T17:25:30Z) - Q-Diffusion: Quantizing Diffusion Models [52.978047249670276]
ポストトレーニング量子化(PTQ)は、他のタスクに対するゴーツー圧縮法であると考えられている。
本稿では,一意なマルチステップパイプラインとモデルアーキテクチャに適した新しいPTQ手法を提案する。
提案手法は,完全精度の非条件拡散モデルを同等の性能を維持しつつ4ビットに定量化できることを示す。
論文 参考訳(メタデータ) (2023-02-08T19:38:59Z) - Automatic Network Adaptation for Ultra-Low Uniform-Precision
Quantization [6.1664476076961146]
一様精度ニューラルネットワーク量子化は、高計算能力のために高密度に充填された演算ユニットを単純化したため、人気を集めている。
層間の量子化誤差の影響に対して不均一な感度を無視し、結果として準最適推論をもたらす。
本研究は,超低精度量子化による精度劣化を軽減するために,ニューラルネットワーク構造を調整するニューラルチャネル拡張と呼ばれる新しいニューラルアーキテクチャ探索を提案する。
論文 参考訳(メタデータ) (2022-12-21T09:41:25Z) - Mixed Precision Low-bit Quantization of Neural Network Language Models
for Speech Recognition [67.95996816744251]
長期間のメモリリカレントニューラルネットワーク(LSTM-RNN)とトランスフォーマーで表される最先端言語モデル(LM)は、実用アプリケーションではますます複雑で高価なものになりつつある。
現在の量子化法は、均一な精度に基づいており、量子化誤差に対するLMの異なる部分での様々な性能感度を考慮できない。
本稿では,新しい混合精度ニューラルネットワークLM量子化法を提案する。
論文 参考訳(メタデータ) (2021-11-29T12:24:02Z) - Compact representations of convolutional neural networks via weight
pruning and quantization [63.417651529192014]
本稿では、音源符号化に基づく畳み込みニューラルネットワーク(CNN)の新しいストレージフォーマットを提案し、重み付けと量子化の両方を活用する。
我々は、全接続層で0.6%、ネットワーク全体で5.44%のスペース占有率を削減し、最低でもベースラインと同じくらいの競争力を発揮する。
論文 参考訳(メタデータ) (2021-08-28T20:39:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。