論文の概要: PolyQ: Codesigning End-to-End Quantization Framework for Scalable Edge CPU LLM Inference
- arxiv url: http://arxiv.org/abs/2607.14618v1
- Date: Thu, 16 Jul 2026 06:31:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.013366
- Title: PolyQ: Codesigning End-to-End Quantization Framework for Scalable Edge CPU LLM Inference
- Title(参考訳): PolyQ: スケーラブルエッジCPU LLM推論のためのエンドツーエンド量子化フレームワークのコーディング
- Authors: Hyunwoo Oh, Suyeon Jang, Hanning Chen, KyungIn Nam, Sanggeon Yun, Ryozo Masukawa, Mohsen Imani,
- Abstract要約: PolyQは、アクティベーション対応のチャネルワイドビット割り当てのためのCPU指向コンパイラ/量子化共設計である。
3--6,bから安定した品質のスケーリングを提供し、3,bのターゲットで以前の手法よりも2.4-32.1%のパープレキシティを向上させる。
- 参考スコア(独自算出の注目度): 8.572093284101358
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: CPUs are the most universal target for on-device LLM inference, but existing low-bit quantization methods offer either coarse operating points or fine-grained mixed precision that is difficult to execute efficiently on CPUs. We present PolyQ, a CPU-oriented compiler/quantization co-design for activation-aware channel-wise bit allocation under a user-specified average-bit budget. PolyQ assigns per-channel bit-widths from $\{2,3,4,8,16\}$, then uses a compile-time model compiler to permute and cluster channels into bit-homogeneous blocks, generate SIMD- and LUT-compatible kernels, and merge compatible permutations across operators to keep layout regularization off the runtime path. This turns fine-grained budget fitting into a practical fractional-bit deployment method for CPU-only inference. Across Falcon-H1-3B, Llama2-13B, and Qwen3-32B on WikiText-2, PolyQ provides stable quality scaling from 3--6\,b and improves perplexity by 2.4--32.1\% over prior methods at a 3\,b target. End-to-end measurements on three representative CPUs -- workstation, laptop, and mobile -- show that compiler layout regularization reduces activation reorder traffic by up to 70.8\%, prefill latency and decode throughput scale nearly proportionally with the configured bit budget, and energy/token overhead stays below 2\% relative to an optimized LUT-based back-end. These results show that fractional-bit CPU deployment is practical, predictable, and energy-efficient across diverse edge targets.
- Abstract(参考訳): CPUはデバイス上でのLSM推論の最も普遍的なターゲットであるが、既存の低ビット量子化手法は、粗い演算点か、CPU上で効率よく実行できない微細な混合精度のいずれかを提供する。
本稿では,CPU指向コンパイラ/量子化の共同設計であるPolyQを提案する。
PolyQは$\{2,3,4,8,16\}$からチャネルごとのビット幅を割り当て、コンパイル時モデルコンパイラを使用して、チャネルをビット均一なブロックにパーミュートし、SIMDおよびLUT互換カーネルを生成し、演算子間で互換性のある置換をマージして、レイアウトをランタイムパスから切り離す。
これにより、きめ細かい予算フィッティングが、CPUのみの推論のための実用的な分数ビット配置方法になる。
WikiText-2上のFalcon-H1-3B、Llama2-13B、Qwen3-32B全体で、PolyQは3--6\,bから安定した品質のスケーリングを提供し、3-32.1\%の精度で従来の手法よりも2.4-32.1\%向上している。
3つの代表的なCPU(ワークステーション、ラップトップ、モバイル)のエンドツーエンドの測定によると、コンパイラレイアウトの正規化により、アクティベーションのリオーダトラフィックが最大70.8\%減少し、プリフィルレイテンシとデコードスループットが構成されたビット予算にほぼ比例する。
これらの結果は、様々なエッジターゲットに対して、分数ビットのCPUデプロイメントが実用的で、予測可能で、エネルギー効率が高いことを示している。
関連論文リスト
- Ascend-RaBitQ: Heterogeneous NPU-CPU Acceleration of Billion-Scale Similarity Search with 1-bit Quantization [18.17338809219932]
In this present Ascend-RaBitQ, a first heterogeneous NPU- CPU optimized IVF-RaBitQ system for billion-scale vector search。
3段階のヘテロジニアスパイプラインは、1ビット量子化されたベクトル上でのAI Coreアクセラレーション粗いランク付け、オンデバイスAI CPU Top-k処理、フル精度ベクトル上でのホストCPUファインランク付けを含む。
Ascend-RaBitQは、CPUベースラインよりも3.0*から62.8*高速なインデックス構築、最速のCPU IVF-RaBitQ実装よりも4.6*スループットの改善、数学的に等価なCPUより100*以上を実現している。
論文 参考訳(メタデータ) (2026-05-15T14:37:18Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - ELUTQ: Efficient LUT-Aware Quantization for Deploying Large Language Models on Edge Devices [3.465218658690795]
CPUベースのエッジデバイス上の大規模言語モデル(LLM)は、デバイス上のインテリジェンスの実現とAIアクセシビリティの拡大に不可欠である。
我々は,新しい量子化形式である階層線形量子化(HLQ)を導入した効率的な量子化フレームワークELUTQを提案する。
HLQは計算コストを増大させることなく、重量の統計特性をよりよく捉える。
LLaMA3-8Bの場合、HLQは3ビットで約8%、2ビット精度で約85%のパープレキシティを減少させる。
論文 参考訳(メタデータ) (2025-10-22T11:20:47Z) - Highly Optimized Kernels and Fine-Grained Codebooks for LLM Inference on Arm CPUs [0.8217552831952]
大きな言語モデル(LLM)は、言語理解と生成に関する考え方を変えました。
LLM量子化によく使われるグループ量子化形式は、計算上のオーバーヘッドとリソース集約型量子化プロセスを持つ。
本稿では,LLMの超低精度量子化のためのグループワイド非一様符号ブックに基づく量子化手法を提案する。
論文 参考訳(メタデータ) (2024-12-23T03:44:29Z) - SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models [63.118592279833656]
後学習量子化(PTQ)は,大規模言語モデル(LLM)の圧縮に有効な手法である
本稿では,SliM-LLMを提案する。SliM-LLMは,グループ単位でビット幅を割り当てるサリエンス駆動の混合精度量子化フレームワークである。
実験により、SliM-LLMは低ビット幅の様々なLLMにおいて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2024-05-23T16:21:48Z) - Extreme Compression of Large Language Models via Additive Quantization [59.3122859349777]
我々のアルゴリズムは、AQLMと呼ばれ、情報検索のための古典的な加算量子化(AQ)アプローチを一般化する。
トークン生成のためのAQLMの高速GPUおよびCPU実装を提供しており、最適化されたFP16実装を高速にマッチングまたは性能良くすることができる。
論文 参考訳(メタデータ) (2024-01-11T18:54:44Z) - An Adaptive Device-Edge Co-Inference Framework Based on Soft
Actor-Critic [72.35307086274912]
高次元パラメータモデルと大規模数学的計算は、特にIoT(Internet of Things)デバイスにおける実行効率を制限する。
本稿では,ソフトポリシーの繰り返しによるエフェキシット点,エフェキシット点,エンフェキシット点を生成する離散的(SAC-d)のための新しい深層強化学習(DRL)-ソフトアクタ批判法を提案する。
レイテンシと精度を意識した報酬設計に基づいて、そのような計算は動的無線チャンネルや任意の処理のような複雑な環境によく適応でき、5G URLをサポートすることができる。
論文 参考訳(メタデータ) (2022-01-09T09:31:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。