論文の概要: SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System
- arxiv url: http://arxiv.org/abs/2608.05033v1
- Date: Wed, 05 Aug 2026 16:41:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.998118
- Title: SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System
- Title(参考訳): SparseDitto: LLMベースのエージェントシステムによる異なるスパーシパターンのためのGPUカーネルのカスタマイズ
- Authors: Shiyang Li, Guangyan Sun, Jinwei Tang, Yanzhi Wang, Mingyi Hong, Caiwen Ding,
- Abstract要約: 本稿では,各行列,演算子,ターゲットGPU用のGPUカーネルを構築するLLMベースのシステムであるSparseDittoを提案する。
SparseDittoは、統一設計フレームワークでSpMV、SpMM、SpGEMMをサポートする。
生成されたSpMMカーネルは、最大3.39倍のフルバッチGCNトレーニングを加速する。
- 参考スコア(独自算出の注目度): 45.52961410486319
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Sparse matrix kernels are fundamental to scientific computing, graph analytics, and machine learning. Their GPU performance depends strongly on the input sparsity pattern and execution strategy. For the same SpMM on the same matrix, cuSPARSE exhibits a 350x performance gap between CSR and Blocked-ELL. Our study of multiple data formats, specialized systems, and sparse compilers shows that no single implementation consistently dominates across sparsity patterns and operators. This motivates a system that can adapt its representation, execution strategy, and hardware mapping to each workload and target GPU. We present SparseDitto, an LLM-based system that constructs a GPU kernel for each matrix, operator, and target GPU. SparseDitto supports SpMV, SpMM, and SpGEMM within a unified design framework. A lightweight additive model ranks established strategies using structural features of the input matrix. An architecture-aware planner then proposes several candidate designs. Coding and verification agents implement and refine them using measurements from the target GPU. Across three sparse operators and a diverse set of matrices, SparseDitto achieves a geometric-mean speedup of 2.68x over cuSPARSE on an NVIDIA RTX PRO 6000 GPU, with a maximum of 146.61x. On an NVIDIA H200 GPU, it achieves 2.79x, with a maximum of 78.5x. Its generated SpMM kernels also accelerate full-batch GCN training by up to 3.39x.
- Abstract(参考訳): スパースマトリックスカーネルは科学計算、グラフ分析、機械学習の基礎である。
そのGPU性能は入力空間パターンと実行戦略に強く依存する。
同じ行列上の同じSpMMの場合、cuSPARSEはCSRとBlocked-ELLの350倍の性能差を示す。
本稿では,複数のデータ形式,特殊なシステム,スパースコンパイラについて検討した。
これは、その表現、実行戦略、ハードウェアマッピングを各ワークロードとターゲットGPUに適応できるシステムへのモチベーションである。
本稿では,各行列,演算子,ターゲットGPU用のGPUカーネルを構築するLLMベースのシステムであるSparseDittoを提案する。
SparseDittoは、統一設計フレームワークでSpMV、SpMM、SpGEMMをサポートする。
軽量加法モデルでは、入力行列の構造的特徴を用いた定式化戦略を定式化している。
アーキテクチャを意識したプランナーがいくつかの候補設計を提案する。
コーディングと検証エージェントは、ターゲットGPUの測定を使用してそれらを実装し、洗練する。
3つのスパース演算子と多種多様な行列からなるSparseDittoは、最大146.61xのNVIDIA RTX PRO 6000 GPU上でcuSPARSE上の2.68倍の幾何平均速度を達成する。
NVIDIA H200 GPUでは2.79倍、最大78.5倍となる。
生成されたSpMMカーネルは、最大3.39倍のフルバッチGCNトレーニングを加速する。
関連論文リスト
- GPUSparse: GPU-Accelerated Learned Sparse Retrieval with Parallel Inverted Indices [3.3723515662362265]
本稿では,GPUを高速化した正確なスパース検索システムであるGPUSparseを提案する。
ブロック整列されたワープ対応のポストリストを持つGPU並列逆インデックスを使用する。
Batched scatter-add スコアリングアルゴリズムは数百のクエリを同時に処理する。
論文 参考訳(メタデータ) (2026-06-24T23:07:57Z) - Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices [18.428868416628017]
本稿では,中程度間隔の大規模言語モデル(LLM)に対する効率的な推論手法を提案する。
SpInferで最大1.64倍のスピードアップを実現し、FlashLLMで最大1.41倍のエンドツーエンドスピードアップを実現している。
論文 参考訳(メタデータ) (2026-06-13T13:38:27Z) - Libra: Synergizing CUDA and Tensor Cores for High-Performance Sparse Matrix Multiplication [6.557224606759151]
現代の加速器は一般にスパース演算子を加速するコアとコアを備えている。
資源を1つだけ利用すれば,それぞれの制限のため,スパース行列乗算の性能が劣ることを示す。
本稿では,2.9コアの高性能とコアの低冗長性を両立させて,タスクマッピング演算子のスイートポイントを求める2D対応のワークロード計算戦略を提案する。
論文 参考訳(メタデータ) (2025-06-28T01:50:13Z) - NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding [54.88765757043535]
この研究は、統計的なn-gram言語モデルのデータ構造を再考し、GPU最適化推論の高速かつ並列な操作を可能にする。
我々のアプローチは NGPU-LM と呼ばれ、7% 未満の計算オーバーヘッドを持つ全ての主要な ASR モデルに対して、カスタマイズ可能なgreedy decoding を導入している。
提案手法は,ビーム探索による顕著な遅延を回避しつつ,greedy と beam search の精度ギャップの50%以上を排除できる。
論文 参考訳(メタデータ) (2025-05-28T20:43:10Z) - TorchSparse++: Efficient Training and Inference Framework for Sparse
Convolution on GPUs [20.4238781638402]
スパース畳み込みは、AR/VRにおけるポイントクラウド処理、自動運転、レコメンデーションシステムにおけるグラフ理解など、新興ワークロードにおいて重要な役割を果たす。
既存のGPUライブラリはスパース畳み込みのための2つのデータフロー型を提供する。
TorchSparse++は、両方の世界のベストを達成するための新しいGPUライブラリです。
論文 参考訳(メタデータ) (2023-10-25T21:02:38Z) - INR-Arch: A Dataflow Architecture and Compiler for Arbitrary-Order
Gradient Computations in Implicit Neural Representation Processing [66.00729477511219]
計算グラフとして表される関数を考えると、従来のアーキテクチャはn階勾配を効率的に計算する上で困難に直面している。
InR-Archは,n階勾配の計算グラフをハードウェア最適化データフローアーキテクチャに変換するフレームワークである。
1.8-4.8x と 1.5-3.6x の高速化を CPU と GPU のベースラインと比較した結果を示す。
論文 参考訳(メタデータ) (2023-08-11T04:24:39Z) - Batch-efficient EigenDecomposition for Small and Medium Matrices [65.67315418971688]
EigenDecomposition (ED)は多くのコンピュータビジョンアルゴリズムとアプリケーションの中心にある。
本稿では,コンピュータビジョンの応用シナリオに特化したQRベースのED手法を提案する。
論文 参考訳(メタデータ) (2022-07-09T09:14:12Z) - Adaptive Elastic Training for Sparse Deep Learning on Heterogeneous
Multi-GPU Servers [65.60007071024629]
本稿では,Adaptive SGDが4つの最先端ソリューションよりも精度が高いことを示す。
本稿では,Adaptive SGDが時間と精度で4つの最先端ソリューションより優れていることを示す。
論文 参考訳(メタデータ) (2021-10-13T20:58:15Z) - Efficient and Generic 1D Dilated Convolution Layer for Deep Learning [52.899995651639436]
幅広いパラメータをカバーする汎用的な1D畳み込み層の効率的な実装を紹介します。
特にIntel AVX-512とAVX-512 BFloat16命令を含むアーキテクチャ向けに最適化されている。
本稿では,最適化された1次元畳み込み層の性能を,実際のゲノミクスデータセットを用いたエンドツーエンドニューラルネットワークトレーニングで実証する。
論文 参考訳(メタデータ) (2021-04-16T09:54:30Z) - Systolic Computing on GPUs for Productive Performance [2.8064596842326575]
我々は,GPU上で動作する高性能なシストリックアレイを生産的に構築する言語とコンパイラを提案する。
プログラマは、データフローのプロジェクションを線形シストリック配列に指定し、プロジェクションの詳細な実装はコンパイラに任せる。
コンパイラは指定されたプロジェクションを実装し、リニアシストリックアレイをGPUのSIMD実行ユニットとベクトルレジスタにマッピングする。
論文 参考訳(メタデータ) (2020-10-29T18:49:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。