論文の概要: Beyond Masked Sparsity: SNACK Enables Truly Sparse Neural Networks on GPU
- arxiv url: http://arxiv.org/abs/2610.04093v1
- Date: Fri, 02 Oct 2026 22:01:32 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:23:52.698049
- Title: Beyond Masked Sparsity: SNACK Enables Truly Sparse Neural Networks on GPU
- Title(参考訳): Masked Sparsityを超えて、SNACKはGPU上で完全にスパースなニューラルネットワークを可能にする
- Abstract要約: SNACKは,非ゼロ接続のみを格納し,計算する,真にスパースなGPU層である。
SNACKは単純なPyTorch APIを公開し、接続を再構築し、スパースパラダイムを完全にバックプロパゲートする。
カーネルレベルでは、SNACKはマスクされた高密度ベースラインよりも最大7倍高速である。
- 参考スコア(独自算出の注目度): 3.684623737023585
- License:
- Abstract: Deep neural networks continue to grow in parameter count, driving up training and inference cost on GPUs. Sparse neural networks and Dynamic Sparse Training (DST) promise to reduce these costs, but most implementations rely on binary masks over dense tensors and recover little of the theoretical compute, memory, or energy savings. We propose SNACK, a truly sparse GPU layer that stores and computes only non-zero connections. SNACK exposes a simple PyTorch API for restructuring connections and backpropagating gradients entirely in the sparse paradigm, and ships SNACK-COO, a custom COO-format SpMM CUDA kernel with a batch-to-Streaming-Multiprocessor mapping tuned for the small-batch, high-sparsity regime typical of large-model training and single-stream inference. At the kernel level, SNACK is up to 7x faster than the masked dense baseline (Dense+Mask) and competitive with cuSPARSE, Sputnik, and FlashSparse at 95% sparsity. At 90% sparsity, a single SNACK layer accelerates training by 8x and 3.7x, and inference by 4x and 2x, over Dense+Mask and fully dense layers, respectively, while using 72% less memory than dense and substantially less energy. End-to-end, SNACK reduces GPT-2 peak training memory by up to 40% and graph-style inference latency by 4.8x over Dense+Mask at 99% sparsity.
- Abstract(参考訳): ディープニューラルネットワークは、パラメータカウントが増加し続けており、GPUのトレーニングと推論コストが上昇している。
スパースニューラルネットワークと動的スパーストレーニング(DST)はこれらのコスト削減を約束するが、ほとんどの実装は高密度テンソル上のバイナリマスクに依存し、理論計算、メモリ、エネルギー節約のほとんどを回復しない。
SNACKは,非ゼロ接続のみを格納し,計算する,真にスパースなGPU層である。
SNACKは単純なPyTorch APIを公開し、接続を再構築し、完全にスパースパラダイムで勾配をバックプロパゲートする。SNACK-COOは、大容量モデルのトレーニングやシングルストリーム推論に典型的な、バッチからストリーミングまでのマルチプロセッサマッピングを備えたカスタムCOOフォーマットのSpMM CUDAカーネルである。
カーネルレベルでは、SNACKはマスク付き高密度ベースライン(Dense+Mask)よりも最大7倍高速で、cuSPARSE、Sputnik、FlashSparseと95%の間隔で競合する。
90%の間隔で、1つのSNACK層が8xと3.7xのトレーニングを加速し、4xと2xの推論をそれぞれDense+Maskと完全に密度の高いレイヤ上で行う。
エンドツーエンドでは、SNACKはGPT-2ピークトレーニングメモリを最大40%、グラフスタイルの推論遅延を99%の間隔でDense+Maskの4.8倍削減する。
関連論文リスト
- Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices [18.428868416628017]
本稿では,中程度間隔の大規模言語モデル(LLM)に対する効率的な推論手法を提案する。
SpInferで最大1.64倍のスピードアップを実現し、FlashLLMで最大1.41倍のエンドツーエンドスピードアップを実現している。
論文 参考訳(メタデータ) (2026-06-13T13:38:27Z) - Weight Block Sparsity: Training, Compilation, and AI Engine Accelerators [0.0]
Deep Neural Networks(DNN)が開発、トレーニング、利用され、高度なデバイスと限られたデバイスの両方に負担がかかっている。
私たちのソリューションは、ハードウェアに親しみやすい構造化された空間であるエムの重みブロック間隔を実装することです。
本稿では,Resnet50,Inception V3,VGG16を用いて,AIE2構成セット(AMD Versal FPGA)の正確かつ完全なコード生成による性能評価を行う。
論文 参考訳(メタデータ) (2024-07-12T17:37:49Z) - Training Your Sparse Neural Network Better with Any Mask [106.134361318518]
高品質で独立したトレーニング可能なスパースマスクを作成するために、大規模なニューラルネットワークをプルーニングすることが望ましい。
本稿では、デフォルトの高密度ネットワークトレーニングプロトコルから逸脱するためにスパーストレーニングテクニックをカスタマイズできる別の機会を示す。
我々の新しいスパーストレーニングレシピは、スクラッチから様々なスパースマスクでトレーニングを改善するために一般的に適用されます。
論文 参考訳(メタデータ) (2022-06-26T00:37:33Z) - MCUNetV2: Memory-Efficient Patch-based Inference for Tiny Deep Learning [72.80896338009579]
メモリボトルネックは畳み込みニューラルネットワーク(CNN)の設計における不均衡なメモリ分布に起因する。
本稿では,ピークメモリを大幅に削減するパッチ・バイ・パッチ・推論スケジューリングを提案する。
ニューラルアーキテクチャサーチによるプロセスを自動化し、ニューラルアーキテクチャと推論スケジューリングを共同で最適化し、MCUNetV2に導いた。
論文 参考訳(メタデータ) (2021-10-28T17:58:45Z) - DistGNN: Scalable Distributed Training for Large-Scale Graph Neural
Networks [58.48833325238537]
大規模グラフの構造を学ぶためにGNN(Graph Neural Networks)のフルバッチトレーニングは、実現可能な数百の計算ノードにスケールする必要がある重要な問題です。
本稿では,CPUクラスタ上でのフルバッチトレーニングのためのDGL(Deep Graph Library)を最適化したGNNについて述べる。
4つの一般的なGNNベンチマークデータセットの結果は、1つのCPUソケットを使用して最大3.7倍のスピードアップ、128のCPUソケットを使用して最大97倍のスピードアップを示す。
論文 参考訳(メタデータ) (2021-04-14T08:46:35Z) - Learning N:M Fine-grained Structured Sparse Neural Networks From Scratch [75.69506249886622]
ディープニューラルネットワーク(DNN)におけるスパーシティは、資源制約された環境でモデルを圧縮し、加速するために広く研究されている。
本稿では,N:M細粒構造スパースネットワークのスクラッチからトレーニングを初めて行う。
論文 参考訳(メタデータ) (2021-02-08T05:55:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。