論文の概要: Recurrent Residual Quantization: A Progressive Multi-Precision Representation for LLMs
- arxiv url: http://arxiv.org/abs/2608.04048v1
- Date: Tue, 04 Aug 2026 08:32:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.436744
- Title: Recurrent Residual Quantization: A Progressive Multi-Precision Representation for LLMs
- Title(参考訳): リカレント残差量子化:LLMのプログレッシブ・マルチ精度表現
- Authors: Yu Luo, Bo Dong, Wenhua Cheng, Haihao Shen,
- Abstract要約: 本稿では,学習後の量子化フレームワークであるRecurrent Residual Quantization (RRQ)を紹介する。
RRQは、重みを低ビットの量子化された基底として表し、量子化された残差補正の列を表わす。
Qwen3-8Bでは,全RTN 2-/4-/6-/8-bitパッケージを1,293秒で構築した。
- 参考スコア(独自算出の注目度): 9.68624792431081
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Serving large language models (LLMs) under diverse deployment constraints requires flexible trade-offs between accuracy, memory footprint, and throughput. However, conventional quantization methods typically require a separate checkpoint for each target bit-width. We introduce Recurrent Residual Quantization (RRQ), a post-training quantization (PTQ) framework that represents weights as a low-bit quantized base together with a sequence of quantized residual corrections, enabling multiple effective precisions from a single checkpoint. Starting from a 2-bit model obtained via post-training quantization (PTQ) or round-to-nearest (RTN), RRQ progressively adds lightweight 2-bit residuals generated via RTN to construct 4-, 6-, and 8-bit representations. The method is calibration-free and avoids joint multi-bit optimization. In our Qwen3-8B setup, the full all-RTN 2-/4-/6-/8-bit package is constructed in 1,293 seconds, 3.3 times faster than the measured MatGPTQ construction. Experiments on six recent LLMs show competitive accuracy at 6 and 8 bits, with model-dependent behavior at 4 bits. The code will be made publicly available upon publication.
- Abstract(参考訳): さまざまなデプロイメント制約の下で大きな言語モデル(LLM)を実行するには、正確性、メモリフットプリント、スループットのトレードオフが柔軟である必要がある。
しかし、従来の量子化法は、通常、ターゲットビット幅ごとに個別のチェックポイントを必要とする。
本稿では,ポストトレーニング量子化(PTQ)フレームワークであるRecurrent Residual Quantization(RRQ)を紹介する。
トレーニング後量子化(PTQ)またはラウンド・トゥ・アネレスト(RTN)によって得られた2ビットモデルから始めて、RRQは4ビット、6ビット、8ビット表現を構築するためにRTNによって生成される軽量な2ビット残差を徐々に追加する。
この方法はキャリブレーションフリーであり、共同マルチビット最適化を避ける。
Qwen3-8Bでは,全RTN 2-/4-/6-/8-bitパッケージを1,293秒で構築した。
最近のLLMの6つの実験では、モデル依存の動作が4ビットである6ビットと8ビットの競合精度が示されている。
コードは公開時に公開される。
関連論文リスト
- RUQuant: Towards Refining Uniform Quantization for Large Language Models [17.258420059228808]
ポストトレーニング量子化(PTQ)は、再トレーニングを必要とせずにモデルを圧縮することで、実用的なソリューションとして登場した。
既存の方法は、アクティベーション分布の非一様性により、かなりの精度の劣化に悩まされることが多い。
本研究では,ロイド-マックス最適条件に基づく理論的な観点から,活性化量子化問題を再考する。
論文 参考訳(メタデータ) (2026-04-05T08:04:39Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - LoPRo: Enhancing Low-Rank Quantization via Permuted Block-Wise Rotation [6.797237769820339]
ポストトレーニング量子化(PTQ)は、比較的高い精度を維持しながら効果的なモデル圧縮を可能にする。
残留行列量子化を向上する新しい微調整不要なPTQアルゴリズムであるLoPRoを提案する。
実験により、LoPRoは2ビットおよび3ビットの量子化において既存の微調整不要のPTQ法より優れていることが示された。
論文 参考訳(メタデータ) (2026-01-27T14:56:04Z) - MergeQuant: Accurate 4-bit Static Quantization of Large Language Models by Channel-wise Calibration [23.752021919501207]
本稿では,チャネルごとの静的量子化フレームワークであるMergeQuantを提案する。
MergeQuantは、量子化ステップマイグレーション(QSM)メソッドを通じて、チャネルごとの量子化ステップと対応するスケーリングと線形マッピングを統合する。
Llama-2-7Bモデルでは、MergeQuantはFP16ベースラインと比較してデコードで最大1.77倍、エンドツーエンドで最大2.06倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2025-03-07T04:52:28Z) - ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization [73.60493264901359]
本稿では,1ビット,1.58ビット,2ビット,3ビット,4ビットの量子化設定に対して厳密な比較を行う統一フレームワークを提案する。
3次、2ビット、3ビット量子化は、サイズと精度のトレードオフにおいて同等のパフォーマンスを維持していることを示す。
ハードウェアの制約を考慮すると、2ビット量子化はメモリの削減とスピードアップに有望な可能性を秘めている。
論文 参考訳(メタデータ) (2025-02-04T18:59:26Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z) - HAWQV3: Dyadic Neural Network Quantization [73.11579145354801]
現在の低精度量子化アルゴリズムは、浮動小数点から量子化された整数値への変換の隠れコストを持つことが多い。
HAWQV3は、新しい混合精度整数のみの量子化フレームワークである。
論文 参考訳(メタデータ) (2020-11-20T23:51:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。