論文の概要: ExaGEMM: Exploration Framework for CPU-Driven ML Inference via Associative In-Register Computing for Low-Bit GEMM
- arxiv url: http://arxiv.org/abs/2607.14622v1
- Date: Thu, 16 Jul 2026 06:38:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.014036
- Title: ExaGEMM: Exploration Framework for CPU-Driven ML Inference via Associative In-Register Computing for Low-Bit GEMM
- Title(参考訳): ExaGEMM:低ビットGEMMのためのAssociative In-Register ComputingによるCPU駆動ML推論のための探索フレームワーク
- Authors: Hyunwoo Oh, Suyeon Jang, Hanning Chen, Sanggeon Yun, Ryozo Masukawa, Mohsen Imani,
- Abstract要約: 低ビットGEMMは効率的なML推論の中心であるが、非常に低ビットの実行は従来のCPUには適していない。
本稿では,低ビットGEMMのための作業負荷対応のコード署名・探索フレームワークであるExaGEMMについて述べる。
- 参考スコア(独自算出の注目度): 9.001947079273277
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Low-bit GEMM is increasingly central to efficient ML inference, yet very-low-bit execution remains a poor fit for conventional CPUs. Practical deployment spans fragmented regimes-from 1/2/4-bit weights to varying activation precision-whose feasibility, reuse opportunity, and support cost differ under fixed SIMD and register-file budgets, making lightweight CPU support selection a first-class design problem. We present ExaGEMM, a workload-aware codesign and exploration framework for CPU-native low-bit GEMM via register-resident LUT execution. The key insight is that existing SIMD datapaths already cover table generation and accumulation; the only new hardware is an in-register select/feed mechanism with explicitly modeled cost. ExaGEMM co-explores parameterized kernels and lightweight SIMD ISA support using analytical models of register feasibility, compute cost, memory traffic, and hardware overhead, pruning the candidate space by 99.2% before simulation. It then identifies non-dominated support points and generates ISA specs, gem5 patches, and GEMM kernels for validation. Across representative ML models and CPU targets, ExaGEMM improves latency by 13.29x over software-only baselines, while showing that workload-aware frontier selection is especially important for mixed-precision LLM workloads.
- Abstract(参考訳): 低ビットGEMMはより効率的なML推論の中心となっているが、非常に低ビットの実行は従来のCPUには適していない。
実際のデプロイメントは、1/2/4ビットの重みから、アクティベーションの正確性、再利用機会、サポートコストの変動まで、固定SIMDとレジスタファイルの予算によって異なり、軽量CPUサポートの選択を第一級の設計問題にしている。
本稿では,CPUネイティブな低ビットGEMMのための作業負荷対応のコード署名・探索フレームワークであるExaGEMMについて述べる。
鍵となる洞察は、既存のSIMDデータパスがテーブルの生成と蓄積をすでにカバーしているということだ。
ExaGEMMは、レジスタ実現可能性、計算コスト、メモリトラフィック、ハードウェアオーバーヘッドの分析モデルを用いて、パラメータ化されたカーネルと軽量SIMD ISAサポートを共同で探索し、シミュレーション前の候補空間を99.2%削減した。
そして、非支配的なサポートポイントを特定し、検証のためにISA仕様、gem5パッチ、GEMMカーネルを生成する。
ExaGEMMは、代表的MLモデルとCPUターゲット全体にわたって、ソフトウェアのみのベースラインよりも13.29倍のレイテンシ向上を実現している。
関連論文リスト
- Tiny Inference-Time Scaling with Latent Verifiers [56.696619768584675]
Verifier on Hidden States (VHS) は、Diffusion Transformer (DiT) の中間的な隠れ表現で動作する。
VHSは、画素空間に復号することなくジェネレータ機能を解析することにより、候補毎の検証コストを削減できる。
VHSは同じ推論時予算でGenEvalを+2.7%改善する。
論文 参考訳(メタデータ) (2026-03-23T19:00:02Z) - Beyond GEMM-Centric NPUs: Enabling Efficient Diffusion LLM Sampling [14.471123653746275]
Diffusion Large Language Models (dLLMs) は、並列トークン生成を可能にする反復型デノゲーションを導入している。
我々の設計では、軽量な非GEMMベクトルプリミティブ、インプレースメモリ再利用戦略、分離された混合精度メモリ階層を用いる。
論文 参考訳(メタデータ) (2026-01-28T15:37:50Z) - MNN-LLM: A Generic Inference Engine for Fast Large Language Model Deployment on Mobile Devices [4.385815629175844]
MNN-LLMは、モバイルデバイスへの大規模言語モデルのデプロイを加速するために設計されたフレームワークである。
モデル量子化とDRAM-FlashハイブリッドストレージによるLCMのランタイム特性に対処する。
特に、MNN-LLMは、現在のLLM固有のフレームワークと比較して8.6倍の速度向上を実現している。
論文 参考訳(メタデータ) (2025-06-12T07:45:29Z) - Tackling the Dynamicity in a Production LLM Serving System with SOTA Optimizations via Hybrid Prefill/Decode/Verify Scheduling on Efficient Meta-kernels [12.77187564450236]
本稿では,多機能なAscendネイティブ,エンドツーエンド生産型大規模言語モデル(LLM)サービスシステムであるXY-Serveを紹介する。
中心となる考え方は、計算をきめ細かいメタプリミティブに分解することで、ワークロードの変動を円滑にする抽象化メカニズムである。
GEMMでは,動的形状変化に適応する仮想パディング方式を導入し,高効率な固定タイルサイズGEMMプリミティブを用いた。
論文 参考訳(メタデータ) (2024-12-24T02:27:44Z) - LUT Tensor Core: A Software-Hardware Co-Design for LUT-Based Low-Bit LLM Inference [10.608817382813786]
混合精度行列(英: Mixed-precision matrix, mpGEMM)は、より高精度な活性化を伴う低精度重みの乗算を含む重要かつ未解明の演算である。
オフザシェルフハードウェアはこの操作をサポートしておらず、間接的、すなわち非効率な復号化ベースの実装に繋がる。
本稿では,mpGEMMのルックアップテーブル(LUT)に基づくアプローチについて検討し,従来のLUT実装では期待値の達成に失敗することを確認した。
論文 参考訳(メタデータ) (2024-08-12T08:52:14Z) - Fast Matrix Multiplications for Lookup Table-Quantized LLMs [58.11584672945781]
FLUTEはLUT量子化LLM用のフレキシブルなルックアップテーブルエンジンである。
バッチサイズ32と量子化グループサイズ128では、FLUTEカーネルは既存のGEMMカーネルよりも2〜4倍高速である。
論文 参考訳(メタデータ) (2024-07-15T17:55:42Z) - DeepGEMM: Accelerated Ultra Low-Precision Inference on CPU Architectures
using Lookup Tables [49.965024476651706]
DeepGEMMはSIMDハードウェア上で超高精度畳み込みニューラルネットワークを実行するためのルックアップテーブルベースのアプローチである。
実装は、x86プラットフォーム上で、対応する8ビット整数カーネルを最大1.74倍の性能で上回る。
論文 参考訳(メタデータ) (2023-04-18T15:13:10Z) - Energy-efficient Task Adaptation for NLP Edge Inference Leveraging
Heterogeneous Memory Architectures [68.91874045918112]
Adapter-ALBERTは、様々なタスクにわたる最大データ再利用のための効率的なモデル最適化である。
検証されたNLPエッジアクセラレータ上でシミュレーションを行うことにより、モデルを不均一なオンチップメモリアーキテクチャにマッピングする利点を実証する。
論文 参考訳(メタデータ) (2023-03-25T14:40:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。