論文の概要: JARQ: Joint Alternating Refinement for Quantization
- arxiv url: http://arxiv.org/abs/2609.38599v2
- Date: Fri, 02 Oct 2026 04:51:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 19:20:54.736815
- Title: JARQ: Joint Alternating Refinement for Quantization
- Title(参考訳): JARQ:量子化のためのジョイント代替リファインメント
- Abstract要約: 大規模な言語モデルのためのグループ学習後の量子化器は、結果の整数符号に適合しない格子上に丸みを帯びる。
最高のグリッドはコードに依存し、入力相関は異なるグループのエラーと一致し、有用なコード変更は、しばしば一度に多くのコードを含む。
JARQは、任意のグループワイド量子化器から始まり、すべてのグループスケールの最小二乗整合を交換するプラグイン改良である。
- 参考スコア(独自算出の注目度): 4.367265720140609
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Group-wise post-training quantizers for large language models round weights onto a grid that is not refit to the resulting integer codes. We show that this leaves accuracy on the table: the best grid depends on the codes, input correlations couple the errors of different groups, and useful code changes often involve many codes at once. We propose JARQ , a plug-in refinement that starts from any group-wise quantizer and alternates a joint least-squares fit of all group scales with bounded Babai proposals that move many codes of a group together on the current grid. The problem is a bilinear box-constrained mixed-integer least-squares problem; the solver is backpropagation-free, does not increase the layer-wise objective under exact scale solves, and keeps the host's bit width, groups, zero points, and inference cost. Across Llama-2, Llama-3, and Qwen models with RTN, GPTQ, OmniQuant, and AWQ hosts, JARQ lowers perplexity in 90 of 96 comparisons, cuts three-bit RTN perplexity by up to 36%, raises mean multiple-choice accuracy in 23 of 24 configurations, and improves QEP, QuaRot, and OJBKQ outputs, at under a minute per 7B block.
- Abstract(参考訳): 大規模な言語モデルのためのグループ学習後の量子化器は、結果の整数符号に適合しない格子上に丸みを帯びる。
最高のグリッドはコードに依存し、入力相関は異なるグループのエラーと一致し、有用なコード変更は、しばしば一度に多くのコードを含む。
JARQ は、任意のグループワイド量子化器から始まり、すべてのグループスケールの最小二乗結合を、現在のグリッド上で群の多くのコードを動かす有界なババイ提案と交換するプラグイン改良である。
問題は、双線型ボックスに制約された混合整数最小二乗問題であり、解法はバックプロパゲーションフリーであり、正確なスケールの解法ではレイヤーワイドの目的を増やさず、ホストのビット幅、グループ、ゼロポイント、推論コストを維持する。
RTN、GPTQ、OmniQuant、AWQホストを備えたLlama-2、Llama-3、Qwenモデル全体で、JARQは96の比較の90分の1でパープレキシティを低下させ、3ビットRTNのパープレキシティを最大36%削減し、24の構成の23分の1で平均多重選択精度を高め、QEP、QuaRot、OBBKQ出力を1分未満で改善する。
関連論文リスト
- Quantum List Recovery and Decoding: Achievability and Limitations [76.18688806069522]
本研究では, 折り畳み量子リード・ソロモン符号とランダムなCSS符号について, 上下境界について検討した。
QLR下界に対しては、Chen と Zhang (STOC 2025) の折り畳み型 Reed-Solomon 構造に適応し、候補を安定化させる。
ランダムなCSSコードに対して、古典的な悪いリストは高い確率で安定化器の商を生き残ることを示す。
論文 参考訳(メタデータ) (2026-09-30T17:41:37Z) - SSTQ:Privacy-Preserving Vector Quantization via Subsampled Stochastic TurboQuant [79.24089819400126]
Subsampled TurboQuant (SSTQ) は、オーバーコンプリートな等幅のタイトフレーム、座標サブサンプリング、プライバシ対応量子化を組み合わせたフレームワークである。
SSTQは平均2乗誤差スケーリングを実現し、クライアントあたり$lceil log N il + b$ bitsを使用する。
また、コードブックに依存したMSEスケーリングを$O(4b)$から$O(2b)$に削減する、プライバシを意識したコードブックの目的も導出します。
論文 参考訳(メタデータ) (2026-08-05T17:51:25Z) - High-Rate Quantized Matrix Multiplication II [29.75700570685703]
我々は, 実用的なLCM量子化アルゴリズム(GPTQ)を改良するために, 給水をどのように利用できるかを示す。
スカラーINT量子化器のみを使用する最近のスキーム(WaterSIC')を解析し、そのハイレート性能をベースフリー(つまり、$_X$の行列式を特徴とする)として示す。
論文 参考訳(メタデータ) (2026-05-13T16:47:25Z) - Grid Games: The Power of Multiple Grids for Quantizing Large Language Models [50.885349461958384]
量子化の最近の大きな進歩は、NVFP4 や MXFP4 のようなマイクロスケールの4ビットフォーマットによって与えられ、値をスケールを共有する小さなグループに量子化する。
パワー・オブ・ツー・グライド(PO2)問題を定式化し、MXFPやNVFPのような実用的な小群フォーマットがPO2グリッドの恩恵を受けることを示す理論的結果を提供する。
Llama-like モデルの標準開模型のポストトレーニング量子化と事前学習の結果は、重みのみおよび重み+アクティベーションの両方の下で、適応格子が単一グリッド FP4 に対して常に精度を向上することを示している。
論文 参考訳(メタデータ) (2026-05-12T16:09:02Z) - GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling [36.47926569464477]
GSQ(Gumbel-Softmax Quantization)は,グループ単位のグリッド割り当てとグループ単位のスケールを協調的に学習する,学習後のスカラー量子化手法である。
標準のLlama-3.1-8B/70B-Instructモデルでは、GSQはスカラー量子化とQTIPフロンティアの差の大部分を2ビットと3ビットで閉じている。
GSQは,ベクトル量子化法の適用が困難なKim-K2.5のような1兆倍スケールのMixture-of-Expertsモデルにスケールすることを示す。
論文 参考訳(メタデータ) (2026-04-20T17:45:47Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - PCDVQ: Enhancing Vector Quantization for Large Language Models via Polar Coordinate Decoupling [53.91873442457923]
ベクトル量子化(VQ)は、非常に低ビット(2ビットでも)で精度の高いこの問題に対する一般的な解決策である。
本稿では,効率的なVQフレームワークであるPola Coordinate Decoupled Vector Quantization (PCDVQ)を提案する。
実験の結果、PCDVQは2ビットレベルのベースライン法を少なくとも1.5%ゼロショット精度で上回っていることがわかった。
論文 参考訳(メタデータ) (2025-06-05T08:58:58Z) - ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals [10.860081994662645]
大規模言語モデル(LLM)の学習後の量子化は、推論時の計算コストを抑えるという約束を果たす。
本稿では,最先端技術をさらに推し進めるPTQ手法であるResQを提案する。
ResQは、様々なベンチマークにおいて、最近の一様および混合精度のPTQ法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-12-18T22:01:55Z) - Distribution-Flexible Subset Quantization for Post-Quantizing
Super-Resolution Networks [68.83451203841624]
本稿では,超高分解能ネットワークのためのポストトレーニング量子化手法であるDFSQを提案する。
DFSQは活性化のチャネルワイド正規化を行い、分布フレキシブルなサブセット量子化(SQ)を適用する
6ビットの量子化と8ビットの量子化では完全精度に匹敵する性能を達成し、4ビットの量子化では0.1dBのPSNR低下しか生じない。
論文 参考訳(メタデータ) (2023-05-10T04:19:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。