論文の概要: Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices
- arxiv url: http://arxiv.org/abs/2607.08786v1
- Date: Sat, 13 Jun 2026 13:38:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.35785
- Title: Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices
- Title(参考訳): 適度に構造化されていないスパース重み行列を持つ大言語モデルのGPU推論の高速化
- Abstract要約: 本稿では,中程度間隔の大規模言語モデル(LLM)に対する効率的な推論手法を提案する。
SpInferで最大1.64倍のスピードアップを実現し、FlashLLMで最大1.41倍のエンドツーエンドスピードアップを実現している。
- 参考スコア(独自算出の注目度): 18.428868416628017
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: With the growing deployment of large language models (LLMs), LLM inference cost has become a key challenge. Pruning techniques that introduce sparsity into weight matrices can accelerate inference. However, maintaining model quality typically limits pruning to moderate unstructured sparsity (around 50\%). At these sparsity levels, none of the existing GPU kernels for sparse matrix multiplication (SpMM) can outperform their dense counterparts. This paper proposes an efficient GPU inference method for LLMs with moderate sparsity. We propose a three-layer matrix storage format comprising: (i) a Sparse-TC layer enabling sparse tensor cores to accelerate SpMM; (ii) a Slot-Filling layer using parallel differential distance for matrix compression while supporting low-cost on-chip decoding; (iii) a lightweight Residual Layer ensuring correct SpMM computation. Building on this format, we design a SpMM kernel that jointly utilizes sparse tensor cores and CUDA cores. This design enables an efficient execution pipeline and overlaps on-chip computation with memory access. Evaluations show that our work is the first to outperform dense matrix multiplication on modern GPUs equipped with high-bandwidth memory (HBM). It achieves up to 1.64x kernel-level speedup over SpInfer (EuroSys'25, Best paper) and up to 1.41x end-to-end speedups over FlashLLM (VLDB'24). Our source code: https://github.com/moui0/cudac.
- Abstract(参考訳): 大規模言語モデル(LLM)の展開が増加する中、LLM推論コストは重要な課題となっている。
重量行列にスパーシティを導入するプルーニング技術は推論を加速することができる。
しかしながら、モデル品質の維持は典型的にプルーニングを適度な非構造的間隔(約50%)に制限する。
これらの疎度レベルにおいて、スパース行列乗算(SpMM)のための既存のGPUカーネルは、その密度の高いカーネルよりも優れているものはない。
本稿では,中程度間隔のLLMに対する効率的なGPU推論手法を提案する。
本稿では,以下の3層マトリックスストレージフォーマットを提案する。
i)スパーステンソルコアがSpMMを加速できるスパースTC層
(II)低コストオンチップ復号をサポートしながら,行列圧縮のための並列差分距離を用いたスロットフィリング層
(iii) 正しい SpMM 計算を保証する軽量な残留層。
このフォーマットに基づいて、スパーステンソルコアとCUDAコアを併用したSpMMカーネルを設計する。
この設計は効率的な実行パイプラインを可能にし、オンチップ計算とメモリアクセスを重複させる。
高帯域メモリ(HBM)を備えた最近のGPUにおいて,我々の研究は初めて高密度行列乗算を上回る結果となった。
SpInfer (EuroSys'25, Best Paper) 上で最大 1.64 倍のカーネルレベルのスピードアップを実現し、FlashLLM (VLDB'24) 上で最大 1.41 倍のエンドツーエンドのスピードアップを実現している。
ソースコードはhttps://github.com/moui0/cudac。
関連論文リスト
- FluxBin: Flexible LUT-based Ultra-low-bit LLM Inference by Algorithm-Kernel Synergy [32.21687694159134]
FluxBinは高度に最適化されたカーネルとバイナリ量子化を合成するアルゴリズムである。
FluxBinは最大5.92ドルのスピードアップと10.19ドルの省エネを達成する。
これにより、70Bスケールのモデルを1つのA100ベースにデプロイし、メモリを4倍に削減できる。
論文 参考訳(メタデータ) (2026-08-16T08:01:06Z) - SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System [45.52961410486319]
本稿では,各行列,演算子,ターゲットGPU用のGPUカーネルを構築するLLMベースのシステムであるSparseDittoを提案する。
SparseDittoは、統一設計フレームワークでSpMV、SpMM、SpGEMMをサポートする。
生成されたSpMMカーネルは、最大3.39倍のフルバッチGCNトレーニングを加速する。
論文 参考訳(メタデータ) (2026-08-05T16:41:03Z) - Spava: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention [63.69228529380251]
Spavaはシーケンス並列フレームワークで、ロングビデオ推論に最適化されている。
Spavaは、FlashAttn、ZigZagRing、APBで12.72x、1.70x、1.18xのスピードアップを提供する。
論文 参考訳(メタデータ) (2026-01-29T09:23:13Z) - Space Filling Curves is All You Need: Communication-Avoiding Matrix Multiplication Made Simple [42.09057806159106]
一般行列乗算はディープラーニングとHPCワークロードの基盤である。
行列乗算アクセラレータを持つ現代のプラットフォームは高いFLOP/Byteマシンバランスを示す。
この作業では、この面倒なチューニングの問題を緩和するために、空間充填曲線 (SFC) を再検討する。
我々は,データ局所性を本質的に高次に示す,プラットフォーム指向および形状指向の行列乗算スキームを得る。
論文 参考訳(メタデータ) (2026-01-22T19:56:16Z) - Memory-Efficient Acceleration of Block Low-Rank Foundation Models on Resource Constrained GPUs [11.45717904490388]
トランスフォーマーベースの基盤モデルの最近の進歩は、多くのタスクのデフォルト選択となった。
その急速に成長するサイズは、単一のGPUに完全なモデルを適合させることがますます難しくなり、計算コストが禁じられる。
ブロック低ランク(BLR)圧縮技術は、重み行列のコンパクト表現を学習することでこの問題に対処する。
論文 参考訳(メタデータ) (2025-12-24T00:41:13Z) - Libra: Synergizing CUDA and Tensor Cores for High-Performance Sparse Matrix Multiplication [6.557224606759151]
現代の加速器は一般にスパース演算子を加速するコアとコアを備えている。
資源を1つだけ利用すれば,それぞれの制限のため,スパース行列乗算の性能が劣ることを示す。
本稿では,2.9コアの高性能とコアの低冗長性を両立させて,タスクマッピング演算子のスイートポイントを求める2D対応のワークロード計算戦略を提案する。
論文 参考訳(メタデータ) (2025-06-28T01:50:13Z) - 70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float [52.079202872069835]
大規模言語モデル(LLM)や拡散モデル(DM)といった大規模AIモデルは急速に成長している。
圧縮フレームワークであるDynamic-Length Float (DFloat11) を導入し, LLM と DM サイズを30%削減した。
論文 参考訳(メタデータ) (2025-04-15T22:38:38Z) - Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss [59.835032408496545]
本稿では, コントラスト損失計算を任意の小ブロックに分割するタイルベースの戦略を提案する。
分散システムの階層構造を活用するためのマルチレベルタイリング戦略も導入する。
SOTAメモリ効率のソリューションと比較すると、同等の速度を維持しながら、メモリの2桁の削減を実現している。
論文 参考訳(メタデータ) (2024-10-22T17:59:30Z) - MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models [58.3342517278868]
本稿では,Mixed-precision AutoRegressive LINearカーネルの設計について述べる。
バッチサイズは16-32までサポートでき、量子化のスピードアップが最大 (4times$) になる。
MarLINは非同期メモリアクセス、複雑なタスクスケジューリング、パイプライン化といったテクニックを組み合わせてこれを実現している。
論文 参考訳(メタデータ) (2024-08-21T16:10:41Z) - Hardware-Aware Parallel Prompt Decoding for Memory-Efficient Acceleration of LLM Inference [23.633481089469836]
LLM(Large Language Models)の自動回帰デコーディングは、ハードウェアの性能に大きなオーバーヘッドをもたらす。
トレーニング可能なパラメータを0.0002$%しか必要とせず,A100-40GBのGPUをたった16時間で効率的にトレーニングできる並列プロンプトデコーディングを提案する。
我々のアプローチでは、最大2.49$times$ スピードアップを示し、最小のメモリオーバーヘッドは0.0004$%である。
論文 参考訳(メタデータ) (2024-05-28T22:19:30Z) - Enabling High-Sparsity Foundational Llama Models with Efficient Pretraining and Deployment [56.44025052765861]
大規模言語モデル(LLM)は自然言語処理(NLP)に革命をもたらしたが、そのサイズは計算のボトルネックを生み出している。
そこで本研究では,高性能LLMの高精度かつ疎結合な基本バージョンを作成するための新しいアプローチを提案する。
スパース量子化LLaMAの最大8.6倍のCPU上での総高速化を示す。
論文 参考訳(メタデータ) (2024-05-06T16:03:32Z) - Distributed Out-of-Memory NMF on CPU/GPU Architectures [1.0051474951635875]
本稿では,HPCシステムに対する非負行列分解(NMF)アルゴリズムのメモリ外実装を提案する。
ベンチマークの結果、CPUベースのNMFkよりもGPUを使用した新しい実装により、32Xから76倍のスピードアップが大幅に改善された。
論文 参考訳(メタデータ) (2022-02-19T03:49:21Z) - Efficient and Generic 1D Dilated Convolution Layer for Deep Learning [52.899995651639436]
幅広いパラメータをカバーする汎用的な1D畳み込み層の効率的な実装を紹介します。
特にIntel AVX-512とAVX-512 BFloat16命令を含むアーキテクチャ向けに最適化されている。
本稿では,最適化された1次元畳み込み層の性能を,実際のゲノミクスデータセットを用いたエンドツーエンドニューラルネットワークトレーニングで実証する。
論文 参考訳(メタデータ) (2021-04-16T09:54:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。