論文の概要: Celty: SpMspV GPU Kernel and SIMT Co-Design for Efficient Dual-Sparse LLM Inference
- arxiv url: http://arxiv.org/abs/2608.01536v1
- Date: Sun, 02 Aug 2026 23:10:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.268965
- Title: Celty: SpMspV GPU Kernel and SIMT Co-Design for Efficient Dual-Sparse LLM Inference
- Title(参考訳): Celty: 効率の良いデュアルスパースLPM推論のためのSpMspV GPUカーネルとSIMT共設計
- Abstract要約: Celtyは、LLM推論における効率的なspMspVのための、共設計のスパースフォーマット、GPUカーネル、SIMTマイクロアーキテクチャである。
Celty GPUカーネルはcuBLASを最大2.8倍、Flash-LLMを2.4倍高速化する。
Sparse SIMT Coreでは、cuBLAS上でのスピードアップは最大5.3倍、デュアルスパーシティは70%に達する。
- 参考スコア(独自算出の注目度): 10.864469045553117
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) increasingly rely on sparsity to reduce inference cost, but most prior work targets a single sparsity source-either weight or activation-and optimizes for batched multi-user inference. Dual-sparsity, which combines unstructured weight pruning with runtime activation sparsity, offers a compelling tradeoff among model size, accuracy, and latency for single-user decoding, but formulates as a Sparse Matrix-Sparse Vector (spMspV) workload that existing GPU kernels handle poorly. We propose Celty, a co-designed sparse format, GPU kernel, and SIMT microarchitecture for efficient spMspV in LLM inference. At the kernel level, Celty introduces a Run-Length Compressed CSC (RLC-CSC) format that enables vectorized loading of compressed weight columns and exploits both sparsity sources to skip unnecessary memory accesses, with shared memory used for scattered partial-product accumulation. At the microarchitecture level, the Celty Sparse SIMT Core integrates a pipelined RLC decoder to eliminate software-level index reconstruction and repurposes local register files for conflict-free accumulation-operating directly on the same RLC-CSC format without data layout changes. The Celty GPU kernel achieves up to 2.8x speedup over cuBLAS and 2.4x over Flash-LLM. With the Sparse SIMT Core, speedups reach up to 5.3x over cuBLAS at 70% dual-sparsity.
- Abstract(参考訳): 大規模言語モデル(LLM)は、推論コストを削減するためにスパーシティに依存していることが多いが、以前の作業のほとんどは、単一のスパーシティソース、重み、アクティベーション、バッチ化されたマルチユーザ推論のための最適化のいずれかをターゲットにしている。
Dual-Sparsityは、非構造化のウェイトプルーニングと実行時のアクティベーション間隔を組み合わせたもので、モデルサイズ、精度、単一ユーザ復号のレイテンシ間で魅力的なトレードオフを提供するが、既存のGPUカーネルが処理するスパースマトリックススパースベクトル(spMspV)のワークロードとして定式化されている。
LLM推論において効率的なspMspVを実現するために,共設計のスパースフォーマット,GPUカーネル,SIMTマイクロアーキテクチャであるCeltyを提案する。
カーネルレベルでは、CeltyはRun-Length Compressed CSC (RLC-CSC)フォーマットを導入し、圧縮された重み列のベクトル化ロードを可能にし、両方のスパーシティソースを利用して不要なメモリアクセスを省略する。
マイクロアーキテクチャレベルでは、Celty Sparse SIMT Coreはパイプライン化されたRCCデコーダを統合し、ソフトウェアレベルのインデックス再構築を排除し、データレイアウトの変更なしに同じRCC-CSCフォーマットで競合のない蓄積操作を行うローカルレジスタファイルを再利用する。
Celty GPUカーネルはcuBLASを最大2.8倍、Flash-LLMを2.4倍高速化する。
Sparse SIMT Coreでは、cuBLAS上でのスピードアップは最大5.3倍、デュアルスパーシティは70%に達する。
関連論文リスト
- Unified Static-Dynamic Pruning for Efficient LLM Inference [6.752566603284781]
本稿では,統一型適応推論フレームワークSPDPを提案する。
非構造化SPとGPUの入力スケール推論を統合している。
大規模な計算に相当なスループットとパフォーマンスの効率を提供する。
論文 参考訳(メタデータ) (2026-07-24T05:19:41Z) - Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices [18.428868416628017]
本稿では,中程度間隔の大規模言語モデル(LLM)に対する効率的な推論手法を提案する。
SpInferで最大1.64倍のスピードアップを実現し、FlashLLMで最大1.41倍のエンドツーエンドスピードアップを実現している。
論文 参考訳(メタデータ) (2026-06-13T13:38:27Z) - Compiling Code LLMs into Lightweight Executables [18.677096682203697]
Dittoは、コードLLMのモデルサイズと推論プログラムの両方を最適化する新しい方法である。
私たちは、Dittoを3つの人気のあるコードLLMで評価し、元の推論パイプラインと比較して最大10.5$times$低いメモリ使用量を達成しました。
論文 参考訳(メタデータ) (2026-03-31T14:40:19Z) - ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression [19.538318240352424]
ロスレスモデル圧縮は、ビットエクササイズ大言語モデル(LLM)サービスにおけるメモリと帯域幅のボトルネックを軽減するために、非常に有望である。
既存のアプローチは、GPUアーキテクチャと基本的な設計ミスマッチのため、かなり推論が遅くなることが多い。
我々は、効率的なLLM推論のために共同設計されたロスレス圧縮フレームワークZipServを提案する。
論文 参考訳(メタデータ) (2026-03-18T07:21:21Z) - PAPI: Exploiting Dynamic Parallelism in Large Language Model Decoding with a Processing-In-Memory-Enabled Computing System [13.678531084541666]
PAPI は PIM 対応のヘテロジニアスアーキテクチャで,計算バウンドカーネルやメモリバウンドカーネルを適切なハードウェアユニットに動的にスケジューリングする。
PAPIは最先端の異種加速器と最先端のPIM専用加速器で1.8$times$と11.1$times$を達成している。
論文 参考訳(メタデータ) (2025-02-21T13:52:31Z) - A Universal Framework for Compressing Embeddings in CTR Prediction [68.27582084015044]
本稿では,事前学習した埋め込みを定量化することにより,埋め込みテーブルを圧縮するモデル非依存型埋め込み圧縮(MEC)フレームワークを提案する。
まず、高頻度特徴と低周波特徴のバランスをとるために、人気重み付け正規化を適用します。
3つのデータセットの実験により,提案手法はメモリ使用量を50倍以上削減し,レコメンデーション性能を維持・改善する。
論文 参考訳(メタデータ) (2025-02-21T10:12:34Z) - Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss [59.835032408496545]
本稿では, コントラスト損失計算を任意の小ブロックに分割するタイルベースの戦略を提案する。
分散システムの階層構造を活用するためのマルチレベルタイリング戦略も導入する。
SOTAメモリ効率のソリューションと比較すると、同等の速度を維持しながら、メモリの2桁の削減を実現している。
論文 参考訳(メタデータ) (2024-10-22T17:59:30Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models [58.3342517278868]
本稿では,Mixed-precision AutoRegressive LINearカーネルの設計について述べる。
バッチサイズは16-32までサポートでき、量子化のスピードアップが最大 (4times$) になる。
MarLINは非同期メモリアクセス、複雑なタスクスケジューリング、パイプライン化といったテクニックを組み合わせてこれを実現している。
論文 参考訳(メタデータ) (2024-08-21T16:10:41Z) - vTensor: Flexible Virtual Tensor Management for Efficient LLM Serving [53.972175896814505]
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
論文 参考訳(メタデータ) (2024-07-22T14:37:58Z) - Fast Matrix Multiplications for Lookup Table-Quantized LLMs [58.11584672945781]
FLUTEはLUT量子化LLM用のフレキシブルなルックアップテーブルエンジンである。
バッチサイズ32と量子化グループサイズ128では、FLUTEカーネルは既存のGEMMカーネルよりも2〜4倍高速である。
論文 参考訳(メタデータ) (2024-07-15T17:55:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。