論文の概要: StagQ: Constraint-Driven Multi-Precision Weight Quantization for LLMs
- arxiv url: http://arxiv.org/abs/2610.05977v1
- Date: Mon, 05 Oct 2026 08:28:43 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:49:12.454759
- Title: StagQ: Constraint-Driven Multi-Precision Weight Quantization for LLMs
- Title(参考訳): StagQ: LLMの制約駆動型マルチ精度重み量子化
- Abstract要約: マルチ精度重み形式であるStagQを提案する。
サポートされているすべての精度は、アフィンマップでデコードされた読みやすいプレフィックスである。
グリッドが装着される前後に埋められたスパースサイドレコードは、グリッドが最悪に働く数少ない重みを排除している。
- 参考スコア(独自算出の注目度): 17.927674064115834
- License:
- Abstract: Serving a large language model (LLM) across a fleet of deployments requires several weight-precision operating points. Multi-precision formats serve them all from one stream whose prefixes are valid lower-precision codes, instead of storing multiple copies. We present StagQ, a multi-precision weight format whose main stream is a 2-bit group-wise affine base followed by a configurable number of 1-bit refinement planes on a dyadic step schedule. Every supported precision is a readable prefix, decoded by an affine map derived from metadata shared across all precisions, with no per-weight lookup. A sparse side record, filled both before and after the grid is fitted, holds out the few weights the grid serves worst. We report two configurations of the encoder. At two bits the cheaper one leads the strongest multi-precision baseline on Llama-3.1-8B, Phi-4, and OLMo-2-7B by 3.1 to 7.0 MMLU points, at a slightly lower logical rate. At three bits it leads on Llama-3.1-8B, leads on Phi-4 at a higher rate, and ties on OLMo-2-7B. At four bits it ties on all three, at a higher rate. In a batch-one matrix-vector product on an NVIDIA A100 GPU, timed on synthetic weights, our kernel is faster than the two baseline kernels in most shape-precision cases.
- Abstract(参考訳): 大規模言語モデル(LLM)をデプロイ群で実行するには、いくつかの重み付け操作ポイントが必要である。
多精度フォーマットは、複数のコピーを格納する代わりに、プレフィックスが有効な低精度コードである1つのストリームからそれらすべてを提供する。
本稿では,主ストリームが2ビットのグループワイドアフィンベースであるマルチ精度重み形式であるStagQについて述べる。
サポートされているすべての精度は読みやすいプレフィックスであり、全ての精度で共有されるメタデータから派生したアフィンマップによってデコードされる。
グリッドが装着される前後に埋められたスパースサイドレコードは、グリッドが最悪に働く数少ない重みを排除している。
エンコーダの構成を2つ報告する。
2ビットでは、Llama-3.1-8B、Phi-4、OLMo-2-7Bの3.1から7.0MMLUポイントで最強のマルチ精度ベースラインをわずかに低い論理速度で導く。
3ビットでLlama-3.1-8Bに、Phi-4に、OLMo-2-7Bに結合する。
4ビットで3つすべてに結びつき、より高いレートで結びつく。
NVIDIA A100 GPU上のバッチ1行列ベクトル製品では、ほとんどの形状精度の場合、カーネルは2つのベースラインカーネルよりも高速です。
関連論文リスト
- Disaggregated Quantization: Specializing LLM Prefill and Decode [40.01359064188211]
両相の計算形式,重み,ストレージ配置を専門とする分散量子化(DQ)を提案する。
Qwen 3 と Gemma 3 では、デコードに特化してアクティベーション量子化を取り除くことで、推論コストを増大させることなく、デコード重タスクの精度が向上する。
Qwen3.8B GGUFデコーダのリリースにより、NVFP4プリフィルのトレーニングでは、デコードチェックポイントを変更することなくMMLU-Proで32.5点、MMMU-Proで35.3点の精度が向上した。
論文 参考訳(メタデータ) (2026-09-22T12:44:16Z) - Scale-QLoRA: Code-Invariant Adapter Merging for Native 4-bit Microscaling LLMs [2.1102551867513646]
Scale-QLoRAは、ネイティブなブロック単位のスケールフィールドのみを適応し、デプロイメントグリッド上でスケールをトレーニングし、すべてのE2M1コードを凍結する。
4つのモデルと4つのタスクで、Scale-QLoRAとマージ対応のQAT-LoRAはどちらも正確さに欠ける。
論文 参考訳(メタデータ) (2026-09-03T22:29:37Z) - Unfolding the Leech Lattice: Fused Multi-Shell Decoding and VRAM Layouts for 2-Bit LLM Weights [8.550323073861415]
リーチ格子ベクトル量子化は、最強の報告された2ビット品質を独自の評価プロトコルで保持する。
本報告では, バッチ1におけるデコード相GEMVの供用コストを計測する。
論文 参考訳(メタデータ) (2026-09-02T14:26:06Z) - Tied Trit-Planes: Constraining PTQTP to a Uniform Nine-Level Quantizer, with a Persistent Folded Format for Disk-Streamed Mixture-of-Experts Serving [0.28304882054363123]
この研究はPTQTPの解法に制約としてそのアイデンティティを課した最初のものである。
我々は、284B-A13B混合エキスパートモデルであるDeepSeek-V4-Flash-0731のルートエキスパートに適用する。
すべてのコード、フォーマット、評価アーティファクトは、fucina推論スタックでオープンソースである。
論文 参考訳(メタデータ) (2026-08-09T20:53:47Z) - AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs [14.922926621722235]
ハードウェアフレンドリーなBinary-Coded Quantization(BCQ)のマルチ精度拡張であるAnyBCQを提案する。
我々のプログレッシブな精度拡張メカニズムは、予め割り当てられたバイナリコードを再利用しながら、段階的にスケーリング要素を洗練します。
実験により、AnyBCQは低ビット状態における精度低下を著しく制限することが示された。
論文 参考訳(メタデータ) (2025-10-12T06:20:38Z) - OverFill: Two-Stage Models for Efficient Language Model Decoding [68.68408155020568]
大規模言語モデル(LLM)は多様なタスクにまたがって優れていますが、高い推論コストのため、デプロイメント上の大きな課題に直面しています。
プリフィルとデコードステージを分離し,精度と効率のトレードオフを最適化するOverFillを提案する。
我々の3B-to-1B OverFill構成は1Bプルーニングモデルを83.2%上回り、8B-to-3B構成は3Bプルーニングモデルを79.2%上回った。
論文 参考訳(メタデータ) (2025-08-11T20:07:34Z) - Extreme Compression of Large Language Models via Additive Quantization [59.3122859349777]
我々のアルゴリズムは、AQLMと呼ばれ、情報検索のための古典的な加算量子化(AQ)アプローチを一般化する。
トークン生成のためのAQLMの高速GPUおよびCPU実装を提供しており、最適化されたFP16実装を高速にマッチングまたは性能良くすることができる。
論文 参考訳(メタデータ) (2024-01-11T18:54:44Z) - SqueezeLLM: Dense-and-Sparse Quantization [80.32162537942138]
LLMにおける生成推論の主なボトルネックは、単一のバッチ推論のための計算ではなく、メモリ帯域幅である。
学習後量子化フレームワークであるSqueezeLLMを導入し、最大3ビットの超低精度でのロスレス圧縮を実現する。
本フレームワークは,2次情報に基づく最適ビット精度割当を探索する感度ベース非一様量子化法と,2次情報に基づくDense-and-Sparse分解法と,2次情報量割当値と感度重み値を効率的にスパース形式で格納するDense-and-Sparse分解法である。
論文 参考訳(メタデータ) (2023-06-13T08:57:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。