論文の概要: RSR-core: A High-Performance Engine for Low-Bit Matrix-Vector Multiplication
- arxiv url: http://arxiv.org/abs/2603.27462v1
- Date: Sun, 29 Mar 2026 00:55:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:44.972929
- Title: RSR-core: A High-Performance Engine for Low-Bit Matrix-Vector Multiplication
- Title(参考訳): RSR-core:低ビット行列ベクトル乗算のための高性能エンジン
- Authors: Mohsen Dehghankar, Abolfazl Asudeh,
- Abstract要約: 行列ベクトル乗算(Matrix-vector multiplication)は、ニューラルネットワーク、ベクトルデータベース、および大規模言語モデルにおける基本的な構成要素である。
近年の研究では、モデルの重みの低ビット量子化について検討されており、活性化を高精度に保ちながら、行列は二進数(1ビット)または三進数1.58ビット)の値で表される。
並行して、冗長セグメント削減のようなアルゴリズムは、低ビット行列ベクトル乗算を加速する理論的保証を提供する。
- 参考スコア(独自算出の注目度): 11.676571773958145
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Matrix-vector multiplication is a fundamental building block in neural networks, vector databases, and large language models, particularly during inference. As a result, efficient matrix-vector multiplication engines directly translate into more efficient inference. Recent work has explored low-bit quantization of model weights, where matrices are represented using binary (1-bit) or ternary (1.58-bit) values while activation is kept in higher precision. These representations enable efficient hardware-level computation. In parallel, algorithms such as Redundant Segment Reduction (RSR) provide theoretical guarantees for accelerating low-bit matrix-vector multiplication. However, existing implementations operate at the application level and cannot be efficiently integrated into hardware kernels, limiting practical performance. To bridge this gap, we present RSR-core, a high-performance engine that implements the RSR algorithm as optimized low-level kernels for both CPU and CUDA environments. RSR-core supports efficient matrix-vector multiplication for binary and ternary weight matrices and general vectors while enabling practical deployment of RSR algorithm in real inference pipelines. RSR-core is provided as a production-ready engine with HuggingFace integration for preprocessing low-bit models and running accelerated inference. Experimental results demonstrate significant performance improvements over baseline HuggingFace PyTorch multiplication, achieving up to 62x speedup on CPU and up to 1.9x speedup for token generation on CUDA for popular ternary LLMs. The source code is publicly available at https://github.com/UIC-InDeXLab/RSR-core.
- Abstract(参考訳): 行列ベクトル乗算(Matrix-vector multiplication)は、ニューラルネットワーク、ベクトルデータベース、および大規模言語モデルにおける基本的な構成要素である。
その結果、効率的な行列ベクトル乗算エンジンは直接的により効率的な推論に変換される。
近年の研究では、モデルの重みの低ビット量子化について検討されており、活性化を高精度に保ちながら、行列は二進数(1ビット)または三進数1.58ビット)の値で表される。
これらの表現は効率的なハードウェアレベルの計算を可能にする。
並行して、冗長セグメント削減(RSR)のようなアルゴリズムは、低ビット行列ベクトル乗算を加速するための理論的保証を提供する。
しかし、既存の実装はアプリケーションレベルで動作しており、ハードウェアカーネルに効率的に統合できないため、実用的な性能が制限される。
このギャップを埋めるために、RSRアルゴリズムをCPUとCUDA環境の両方に最適化した低レベルカーネルとして実装した高性能エンジンRSR-coreを提案する。
RSRコアは、2進および3進の重み行列と一般ベクトルに対する効率的な行列ベクトル乗法をサポートし、実際の推論パイプラインにおけるRSRアルゴリズムの実践的展開を可能にする。
RSRコアはHuggingFaceを統合したプロダクション対応エンジンとして提供され、低ビットモデルの事前処理と高速化推論を実行する。
実験の結果、ベースラインのHuggingFace PyTorch乗算よりも大幅に性能が向上し、CPU上で最大62倍の高速化を実現し、人気のある3次LLM用のCUDA上でのトークン生成では最大1.9倍の高速化を実現した。
ソースコードはhttps://github.com/UIC-InDeXLab/RSR-coreで公開されている。
関連論文リスト
- Libra: Synergizing CUDA and Tensor Cores for High-Performance Sparse Matrix Multiplication [6.557224606759151]
現代の加速器は一般にスパース演算子を加速するコアとコアを備えている。
資源を1つだけ利用すれば,それぞれの制限のため,スパース行列乗算の性能が劣ることを示す。
本稿では,2.9コアの高性能とコアの低冗長性を両立させて,タスクマッピング演算子のスイートポイントを求める2D対応のワークロード計算戦略を提案する。
論文 参考訳(メタデータ) (2025-06-28T01:50:13Z) - Leveraging ASIC AI Chips for Homomorphic Encryption [12.209134343914537]
ホモモルフィック暗号化(HE)は強力なプライバシー保証を提供するが、平文での計算よりもはるかに多くのリソースを必要とする。
このレイテンシ問題を緩和するためにアクセラレータが登場したが、ASICのコストが高い。
HEプリミティブは、すでにクラウドに広くデプロイされているTPUのような既存のASIC AIアクセラレータ上で、AIオペレータに変換され、アクセラレーションされることを示す。
論文 参考訳(メタデータ) (2025-01-13T04:08:14Z) - An Efficient Matrix Multiplication Algorithm for Accelerating Inference in Binary and Ternary Neural Networks [8.779871128906787]
我々はディープニューラルネットワーク(DNN)の推論時間とメモリ効率を改善するアルゴリズムを提案する。
推論のボトルネック演算として行列乗法に着目する。
我々の実験は推論時間で5.24倍のスピードアップを示す。
論文 参考訳(メタデータ) (2024-11-10T04:56:14Z) - INR-Arch: A Dataflow Architecture and Compiler for Arbitrary-Order
Gradient Computations in Implicit Neural Representation Processing [66.00729477511219]
計算グラフとして表される関数を考えると、従来のアーキテクチャはn階勾配を効率的に計算する上で困難に直面している。
InR-Archは,n階勾配の計算グラフをハードウェア最適化データフローアーキテクチャに変換するフレームワークである。
1.8-4.8x と 1.5-3.6x の高速化を CPU と GPU のベースラインと比較した結果を示す。
論文 参考訳(メタデータ) (2023-08-11T04:24:39Z) - Rapid Person Re-Identification via Sub-space Consistency Regularization [51.76876061721556]
Person Re-Identification (ReID) は、歩行者を分離したカメラで識別する。
実値特徴記述子を用いた既存のReID法は精度が高いが、ユークリッド距離計算が遅いため効率が低い。
本稿では,ReID 処理を 0.25 倍高速化するサブスペース一貫性規則化 (SCR) アルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-07-13T02:44:05Z) - Batch-efficient EigenDecomposition for Small and Medium Matrices [65.67315418971688]
EigenDecomposition (ED)は多くのコンピュータビジョンアルゴリズムとアプリケーションの中心にある。
本稿では,コンピュータビジョンの応用シナリオに特化したQRベースのED手法を提案する。
論文 参考訳(メタデータ) (2022-07-09T09:14:12Z) - Fast matrix multiplication for binary and ternary CNNs on ARM CPU [0.9135092203041721]
ARMアーキテクチャを持つモバイルデバイスに対して, 3次, 3次, 2次行列乗算の高速アルゴリズムを提案する。
我々のアルゴリズムは、TNN、TBN、BNNの畳み込み層と完全に接続された層を推論するために利用できる。
ARM Cortex-A73 CPU上で実験的に評価し,その推論速度を実精度,8ビット,4ビットの量子化行列乗算の効率的な実装と比較した。
論文 参考訳(メタデータ) (2022-05-18T14:52:34Z) - Robust 1-bit Compressive Sensing with Partial Gaussian Circulant
Matrices and Generative Priors [54.936314353063494]
我々は,ロバストな1ビット圧縮センシングのための相関に基づく最適化アルゴリズムのリカバリ保証を提供する。
我々は,実用的な反復アルゴリズムを用いて,画像データセットの数値実験を行い,結果の相関付けを行う。
論文 参考訳(メタデータ) (2021-08-08T05:28:06Z) - Quantized Neural Networks via {-1, +1} Encoding Decomposition and
Acceleration [83.84684675841167]
本稿では,量子化されたニューラルネットワーク(QNN)をマルチブランチバイナリネットワークに分解するために,-1,+1を用いた新しい符号化方式を提案する。
本稿では,大規模画像分類,オブジェクト検出,セマンティックセグメンテーションにおける提案手法の有効性を検証する。
論文 参考訳(メタデータ) (2021-06-18T03:11:15Z) - PolyDL: Polyhedral Optimizations for Creation of High Performance DL
primitives [55.79741270235602]
本稿では,Deep Learningプリミティブの高性能実装を自動的に生成するコンパイラアルゴリズムを提案する。
我々は多面体モデルを用いた新しいデータ再利用分析アルゴリズムを開発した。
また、このようなハイブリッドコンパイラとライブラリ使用の最小限のアプローチが、最先端のパフォーマンスをもたらすことを示す。
論文 参考訳(メタデータ) (2020-06-02T06:44:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。