論文の概要: At-the-Roofline Sparse Tensor Contractions on Vector Processors for Transformer Inference
- arxiv url: http://arxiv.org/abs/2607.25504v1
- Date: Tue, 28 Jul 2026 09:38:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.789352
- Title: At-the-Roofline Sparse Tensor Contractions on Vector Processors for Transformer Inference
- Title(参考訳): 変圧器推論のためのベクトルプロセッサ上のアット・ザ・ルーフラインスパーステンソル収縮
- Abstract要約: 本稿では,ランタイム設定可能なスパース実行ユニットであるVentaglioとRVV ISA拡張について紹介する。
Ventaglio はスパーステンソル収縮カーネルを 6.9text--7.4times$ over optimization RVV baselines で高速化する。
我々はDuoGPTで処理されたLLaMA-3-8Bモデルで40text--60%の2重間隔を実現し、Ventaglioは2.40text--5.25times$と2.06text--3.16times$プリフィルとオートで高密度ベースラインを高速化する。
- 参考スコア(独自算出の注目度): 24.053341462715107
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fine-grained weight pruning and activation sparsification have emerged as effective approaches for reducing the compute and memory cost of inference for Transformer models. In the moderate-sparsity regime, Gustavson's dataflow provides a natural execution model for exploiting both activation and weight sparsity on vector processors through metadata-driven indexed accumulation. However, existing RVV architectures lack native support for this pattern, forcing kernels to rely on software index decoding and L1-backed indexed memory operations that keep sparse tensor contractions far below their roofline performance bound. We present Ventaglio, a runtime-configurable sparse execution unit coupled with RVV ISA extensions that drives sparse tensor contractions toward their roofline through indexed gather-accumulate-scatter support. Integrated into an open-source vector processing cluster and implemented in 12nm FinFET, Ventaglio accelerates sparse tensor contraction kernels by $6.9\text{--}7.4\times$ over optimized RVV baselines, with only $3.1\%$ area overhead for a cluster of tightly-L1 coupled vector processing elements. We build a performance-accurate instruction-level model of the Ventaglio extension, calibrate it against RTL implementation, and leverage it for scale-out performance analysis on a large $4\times4$ multi-cluster system. Using a DuoGPT-pruned LLaMA-3-8B model with practical $40\text{--}60\%$ dual sparsity, Ventaglio achieves $2.40\text{--}5.25\times$ and $2.06\text{--}3.16\times$ speedup over dense baselines during prefill and autoregressive decoding, respectively.
- Abstract(参考訳): トランスフォーマーモデルにおける推論の計算コストとメモリコストの削減に有効な手法として、微粒度プルーニングとアクティベーションスペーシフィケーションが出現している。
中程度のスパーシリティ体制では、Gustavsonのデータフローはメタデータ駆動のインデックス化蓄積を通じてベクトルプロセッサ上でのアクティベーションとウェイトスパシティの両方を利用する自然な実行モデルを提供する。
しかし、既存のRVVアーキテクチャは、このパターンをネイティブにサポートしていないため、カーネルはソフトウェアインデックスの復号化とL1ベースのインデックスメモリ操作に頼らざるを得なかった。
本稿では,実行時設定可能なスパース実行ユニットであるVentaglioとRVV ISA拡張を結合し,インデックス付きアグリゲーション・クラスタリング・スキャッタのサポートを通じて,スパーステンソル収縮を屋根線に向けて駆動する。
オープンソースのベクトル処理クラスタに統合され、12nm FinFETで実装され、Ventaglioはスパーステンソル収縮カーネルを6.9\text{--}7.4\times$最適化RVVベースラインで加速する。
我々は、Ventaglio拡張の性能精度の高い命令レベルモデルを構築し、それをRTL実装に対して校正し、大規模な4/times4$マルチクラスタシステム上でのスケールアウト性能解析に活用する。
実用的$40\text{--}60\%$2.40\text{--}5.25\times$と$2.06\text{--}3.16\times$2.06\text{--}3.16\times$高密度ベースラインよりも高速なプリフィルと自己回帰デコードを実現している。
関連論文リスト
- FluxBin: Flexible LUT-based Ultra-low-bit LLM Inference by Algorithm-Kernel Synergy [32.21687694159134]
FluxBinは高度に最適化されたカーネルとバイナリ量子化を合成するアルゴリズムである。
FluxBinは最大5.92ドルのスピードアップと10.19ドルの省エネを達成する。
これにより、70Bスケールのモデルを1つのA100ベースにデプロイし、メモリを4倍に削減できる。
論文 参考訳(メタデータ) (2026-08-16T08:01:06Z) - Unified Static-Dynamic Pruning for Efficient LLM Inference [6.752566603284781]
本稿では,統一型適応推論フレームワークSPDPを提案する。
非構造化SPとGPUの入力スケール推論を統合している。
大規模な計算に相当なスループットとパフォーマンスの効率を提供する。
論文 参考訳(メタデータ) (2026-07-24T05:19:41Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model [112.9420001646428]
VLA(Vision-Language-Action)モデルは、オープンワールドロボット操作の強力なパラダイムとして登場したが、実際の展開はコストに制約されることが多い。
我々は、低コストで高スループットな推論のために設計された、完全にオープンソースで透明なVLAフレームワークであるA1を提示する。
A1は最先端の成功率を達成すると同時に、推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-04-07T10:18:40Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization [84.25316984309725]
動的スパース構造とパラメータ効率のよいアダプタ(例えばLoRA)の統合は、大規模言語モデル(LLM)を拡張するための強力な技術である。
計算負荷は最小限に抑えられるが、計算のレイテンシが急上昇し、復号速度が2.5倍以上遅くなる。
AdaFuseはアルゴリズムと基盤となるハードウェアシステムとの緊密な協調設計に基づいて構築されたフレームワークで、効率的な動的アダプタ実行を実現する。
論文 参考訳(メタデータ) (2026-03-12T12:46:42Z) - FPGA Co-Design for Efficient N:M Sparse and Quantized Model Inference [0.8749675983608171]
大規模言語モデル(LLM)は、幅広い言語処理タスクにおいて顕著な性能を示している。
この研究は、ウェイトプルーニングと低ビット量子化を活用する自動化フレームワークを導入している。
本研究では,FPGA(Field-Programmable Gate Array)プラットフォーム上でアクセラレータを生成するハードウェア・ソフトウェア共同設計手法を提案する。
論文 参考訳(メタデータ) (2025-12-31T08:27:40Z) - Eliminating Multi-GPU Performance Taxes: A Systems Approach to Efficient Distributed LLMs [61.953548065938385]
分析フレームワークとして'3つの税'(バルク同期、カーネル間データローカリティ、カーネルローンチオーバーヘッド)を紹介した。
我々は、分散GPU実行におけるキー非効率に対処するために、厳密なBSPモデルを超えて移動することを提案する。
BSPベースのアプローチによるエンドツーエンドのレイテンシの10-20%の高速化を観察する。
論文 参考訳(メタデータ) (2025-11-04T01:15:44Z) - FedSVD: Adaptive Orthogonalization for Private Federated Learning with LoRA [68.44043212834204]
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
論文 参考訳(メタデータ) (2025-05-19T07:32:56Z) - VEXP: A Low-Cost RISC-V ISA Extension for Accelerated Softmax Computation in Transformers [13.984340807378457]
ソフトマックスの加速は、非ポイント、非線形の性質のために困難であり、指数が最も要求されるステップである。
シュラウドルフ法に基づく新しい近似アルゴリズムを用いて, Bfloat16指数の算術ブロックを設計する。
我々は162.7$times$低レイテンシと74.3$times$低エネルギーでSoftmaxを実行する。
論文 参考訳(メタデータ) (2025-04-15T14:28:48Z) - CORDIC Is All You Need [0.18184027690235535]
線形MAC計算と非線形反復活性化関数のためのCORDICブロックを用いたパイプラインアーキテクチャを提案する。
このアプローチでは、Reconfigurable Processing Engine(RPE)ベースのsystolic配列に重点を置いている。
FPGAの実装により、リソースの節約に2.5ドル、以前の作業に比較して3ドルまで削減できる。
論文 参考訳(メタデータ) (2025-03-04T12:23:27Z) - LUT-DLA: Lookup Table as Efficient Extreme Low-Bit Deep Learning Accelerator [11.167930856636161]
本稿では、ベクトル量子化を利用してニューラルネットワークモデルをLUTに変換するLUT-DLA(Look-Up Table (LUT) Deep Learning Accelerator Framework)を紹介する。
LUT-DLAは、それぞれ$1.4$$7.0times$と$1.5$$$146.1times$で、電力効率と面積効率の改善を実現していることを示す。
論文 参考訳(メタデータ) (2025-01-18T05:27:25Z) - HiRE: High Recall Approximate Top-$k$ Estimation for Efficient LLM
Inference [68.59839755875252]
HiREは2つの新しいコンポーネントから構成される: (i) (i) (i) (i) (i) (i) (i) (i) (i) (i) (ii) DA-TOP-$k$: 効率的なマルチデバイス近似トップ-k$演算子) (i) (i) (i) (i) (i) (i) (i) DA-TOP-$k$演算子) 。
我々は、10億のパラメータモデルにおいて、HiREがソフトマックスとフィードフォワード層の両方に適用され、ほぼ一致した事前学習と下流の精度を実現し、1台のTPUv5eデバイスで1.47Times$の推論遅延を高速化することを示した。
論文 参考訳(メタデータ) (2024-02-14T18:04:36Z) - 1$\times$N Block Pattern for Network Sparsity [90.43191747596491]
我々は,この制限を破るために,ブロック間隔パターン(ブロックプルーニング)を1時間で定義する新しい概念を提案する。
このパターンはMobileNet-V2の上位1の精度でフィルタプルーニングよりも約3.0%改善されている。
また、重み付けによるCortex-A7 CPUの56.04msの推論も得る。
論文 参考訳(メタデータ) (2021-05-31T05:50:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。