論文の概要: SSR: Sparse Segment Reduction for Ternary GEMM Acceleration
- arxiv url: http://arxiv.org/abs/2610.08403v1
- Date: Tue, 06 Oct 2026 14:15:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.025241
- Title: SSR: Sparse Segment Reduction for Ternary GEMM Acceleration
- Title(参考訳): SSR: 3次GEMM高速化のためのスパースセグメント削減
- Abstract要約: 大規模言語モデル(LLM)は、リソースに制約のあるハードウェアへの展開を制限し、かなりの計算資源を必要とする。
既存のアプローチには制限がある。BitNetのような三次重みに最適化されたメソッドは、スパーシティ構造を利用しない。
3次LLMと3次重みネットワーク(TWN)の推論を高速化する3次行列乗算法であるスパースセグメント削減(SSR)を導入する。
- 参考スコア(独自算出の注目度): 3.815661340933621
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) require substantial computational resources, limiting their deployment on resource-constrained hardware. Ternary LLMs mitigate these demands through weight quantization via ternary values, achieving significant compression often with 50-90% sparsity. However, existing approaches have limitations: methods optimized for ternary weights, such as BitNet, redundant segment reduction (RSR), and its improved version RSR++, do not exploit sparsity structures, while conventional sparse formats neglect ternary characteristics, foregoing dual optimization opportunities. In this paper, we introduce Sparse Segment Reduction (SSR), a ternary matrix multiplication method designed to accelerate the inference of ternary LLMs and general Ternary Weight Networks (TWNs). SSR has a dedicated optimized ternary data format and an algorithm that systematically exploits sparsity patterns through computation trees that scale with the sparsity. SSR provides theoretical gains with asymptotically faster inference than RSR++ for sparsity above 50%, while practical evaluations reveal performance improvements across all sparsity levels. Evaluation results show that SSR achieves 2.1-11.3x speedup over RSR++ on ternary GEMM with 45-95% sparsity. Furthermore, SSR achieves 3.5-6.3x end-to-end speedup and 4.9% of memory saving over RSR++ on the Llama-3 1B model inference.
- Abstract(参考訳): 大規模言語モデル(LLM)は、リソースに制約のあるハードウェアへの展開を制限し、かなりの計算資源を必要とする。
3次LLMは3次値による重み量子化によってこれらの要求を緩和し、しばしば50-90%の間隔で大きな圧縮を達成する。
しかし、既存のアプローチには制限がある: BitNetのような三次重みに最適化されたメソッド、冗長セグメント削減(RSR)、改良されたバージョンRSR++はスパーシティ構造を利用せず、従来のスパースフォーマットは三次的特性を無視し、二重最適化の機会を先導する。
本稿では,3次LLMと3次重みネットワーク(TWN)の推論を高速化する3次行列乗法であるスパースセグメント削減(SSR)を提案する。
SSRは、専用に最適化された3次データフォーマットと、スパーシティに合わせてスケールする計算ツリーを通じて、スパーシティパターンを体系的に活用するアルゴリズムを備えている。
SSRは、50パーセント以上のスパーシリティでRSR++よりも漸近的に高速な推論を持つ理論的なゲインを提供する。
評価の結果、SSRは3次GEMMでRSR++よりも2.1-11.3倍の速さで45-95%の間隔で高速化された。
さらに、SSRは、Llama-3 1Bモデル推論において、3.5-6.3xのエンドツーエンドのスピードアップとRSR++上のメモリの4.9%を達成している。
関連論文リスト
- QuantSR+: Pushing the Limit of Quantized Image Super-Resolution Networks [63.04549067734431]
低ビット量子化は超解像モデル(SR)の圧縮に広く用いられている。
しかし、SRモデルが超低精度(2-4ビット)にプッシュされると、性能は急激に低下する。
本稿では,量子化演算子,ネットワーク設計,トレーニング最適化を改善する統一フレームワークQuantSR+を提案する。
論文 参考訳(メタデータ) (2026-05-21T11:38:52Z) - Training Large Reasoning Models Efficiently via Progressive Thought Encoding [63.254758972725654]
大規模推論モデル(LRM)は複雑な問題に優れるが、効率にとって重要な障壁に直面している。
本稿では,パラメータ効率のよい微調整手法であるProgressive Thoughtを紹介する。
論文 参考訳(メタデータ) (2026-02-18T20:03:38Z) - Breaking the Simplification Bottleneck in Amortized Neural Symbolic Regression [8.351253396371686]
SimpliPyはルールベースの単純化エンジンで、SymPyよりも100倍のスピードアップを実現している。
この利点をFlash-ANSRフレームワークで示しています。
論文 参考訳(メタデータ) (2026-02-09T16:47:00Z) - SparseLoRA: Accelerating LLM Fine-Tuning with Contextual Sparsity [52.88892280536302]
SparseLoRAは,コンテキスト空間の空間的分散によって微調整を高速化する手法である。
SparseLoRAは計算コストを最大2.2倍、測定速度を最大1.6倍に削減する。
論文 参考訳(メタデータ) (2025-06-19T17:53:34Z) - AdaptSR: Low-Rank Adaptation for Efficient and Scalable Real-World Super-Resolution [50.584551250242235]
AdaptSRは、現実世界のタスクにバイキュービックトレーニングされたSRモデルを効率的に再利用する低ランク適応フレームワークである。
実験の結果,AdaptSRはPSNRで最大4dB,実際のSRベンチマークで2%,GAN法と拡散型SR法より優れていた。
論文 参考訳(メタデータ) (2025-03-10T18:03:18Z) - Bypass Back-propagation: Optimization-based Structural Pruning for Large Language Models via Policy Gradient [57.9629676017527]
本研究では,プルーンドモデルの損失を最適化することにより,確率空間におけるプルーニングマスクを直接学習する最適化に基づく構造的プルーニングを提案する。
我々は、基底となるベルヌーイ分布をサンプルのバイナリ・プルーニングマスクに学習することでこれを実現する。
LLaMA, LLaMA-2, LLaMA-3, Vicuna, Mistral モデルによる実験により, 本手法の有効性と有効性を示すことができた。
論文 参考訳(メタデータ) (2024-06-15T09:31:03Z) - Frequency-Assisted Mamba for Remote Sensing Image Super-Resolution [49.902047563260496]
我々は、リモートセンシング画像(RSI)の超高解像度化のために、視覚状態空間モデル(Mamba)を統合するための最初の試みを開発した。
より優れたSR再構築を実現するため,FMSRと呼ばれる周波数支援型Mambaフレームワークを考案した。
我々のFMSRは、周波数選択モジュール(FSM)、ビジョン状態空間モジュール(VSSM)、ハイブリッドゲートモジュール(HGM)を備えた多層融合アーキテクチャを備えている。
論文 参考訳(メタデータ) (2024-05-08T11:09:24Z) - Sparse Systolic Tensor Array for Efficient CNN Hardware Acceleration [14.958793135751149]
モバイルデバイス上の畳み込みニューラルネットワーク(CNN)推論は、低精度(INT8)汎用行列乗算(GEMM)の効率的なハードウェアアクセラレーションを必要とする
CNN推論のGEMMをさらに加速する一般的な手法であり、特に、構造的スパーシリティは予測可能な負荷分散と非常に低いインデックスオーバーヘッドの利点がある。
ハードウェアの高利用を保ちながら、さまざまな分散レベルのサポートを提供する方法について、構造的疎結合で重要なアーキテクチャ上の課題に対処する。
論文 参考訳(メタデータ) (2020-09-04T20:17:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。