論文の概要: TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization
- arxiv url: http://arxiv.org/abs/2605.19561v1
- Date: Tue, 19 May 2026 09:05:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 15:03:09.2205
- Title: TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization
- Title(参考訳): TORQ:MXFP4量子化のための二層直交回転
- Authors: Zukang Xu, Xing Hu, Dawei Yang,
- Abstract要約: トレーニング不要なポストトライニング量子化フレームワークとしてTORQ (Two-level Orthogonal Rotation for MXFP4 Quantization)を提案する。
既存の手法と比較して, TORQはMXFP4の活性化量子化の精度を著しく向上させることを示した。
- 参考スコア(独自算出の注目度): 13.984796236174331
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Large Language Models (LLMs) advance toward practical deployment, the Microscaling FP4 (MXFP4) format has emerged as a cornerstone for next-generation low-bit inference, owing to its ability to balance high dynamic range with hardware efficiency. However, directly applying MXFP4 to LLM activation quantization inevitably leads to significant accuracy degradation. In this paper, we theoretically analyze the error structure of MXFP4 activation quantization, revealing that the root cause of this performance drop lies in two structural imbalances between activation distributions and the MXFP4 block floating-point format: (1) extreme inter-block variance imbalance and (2) intra-block codebook utilization imbalance. To address these challenges, we propose TORQ (Two-level Orthogonal Rotation for MXFP4 Quantization), a training-free Post-Training Quantization (PTQ) framework designed to reshape the geometric properties of the activation space through optimal coordinate transformations. At the macroscopic level, TORQ leverages the Schur-Horn theorem to redistribute activation energy via inter-block orthogonal rotation, preventing high-variance blocks from driving up shared scaling factors and thereby preserving the precision of small-magnitude elements. At the microscopic level, TORQ employs maximum-entropy-guided intra-block rotation to alleviate codebook collapse and maximize the MXFP4 codebook's information capacity. Experiments on mainstream LLMs such as LLaMA3 and Qwen3 show that TORQ significantly improves the accuracy of MXFP4 activation quantization compared to existing methods: on Qwen3-32B, the perplexity on WikiText is reduced to 8.43 (vs. 7.61 for BF16), and the average accuracy increases from 38.40% with direct RTN to 73.63% (vs. 74.82% for BF16), substantially narrowing the gap between 4-bit floating-point quantization and full-precision inference.
- Abstract(参考訳): LLM(Large Language Models)が実用化に向けて進むにつれ、Microscaling FP4(MXFP4)フォーマットは、ハードウェア効率と高いダイナミックレンジのバランスをとる能力のために、次世代の低ビット推論の基礎として登場した。
しかし、MXFP4を直接LLMの活性化量子化に適用することは、必然的に相当な精度低下をもたらす。
本稿では,MXFP4アクティベーション量子化の誤差構造を理論的に解析し,その根本原因が活性化分布とMXFP4ブロック浮動小数点フォーマットの2つの構造的不均衡にあることを明らかにした。
これらの課題に対処するために、最適座標変換により活性化空間の幾何特性を再構成する訓練不要なポストトライニング量子化(PTQ)フレームワークであるTORQ(Two-level Orthogonal Rotation for MXFP4 Quantization)を提案する。
マクロレベルでは、TORQはシュル=ホルン定理を利用して、ブロック間の直交回転を通じて活性化エネルギーを再分配し、高分散ブロックが共有スケーリング因子を駆動するのを防止し、これにより小さなマグニチュード要素の精度を保つ。
顕微鏡レベルでは、TORQは最大エントロピー誘導ブロック内回転を使用して、コードブックの崩壊を緩和し、MXFP4コードブックの情報容量を最大化する。
LLaMA3 や Qwen3 のような主要な LLM の実験では、TORQ は既存の方法と比較してMXFP4 の活性化量子化の精度を著しく改善している: Qwen3-32B では、WikiText 上のパープレクティリティは 8.43 (vs. 7.61 for BF16) に低下し、平均精度は、直接RTN で 38.40% から 73.63% (vs. 74.82%) まで上昇し、4ビット浮動小数点量子化と完全精度推論のギャップを大幅に狭めている。
関連論文リスト
- DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers [3.0583214514538084]
Diffusion Transformer (DiTs) は最先端の画像生成品質を実現するが、推論時にかなりのメモリと計算コストを発生させる。
平滑化法、混合精度法、回転法、低ランク残差法などの既存の手法は、この問題を部分的に緩和するが、それでもFP16/BF16の性能に顕著なギャップを残している。
本稿では、回転認識型アクティベーション量子化による劣化を緩和するW4A4 PTQフレームワークであるDiRotQを紹介する。
論文 参考訳(メタデータ) (2026-05-16T00:52:00Z) - Multi-Scale Dequant: Eliminating Dequantization Bottleneck via Activation Decomposition for Efficient LLM Inference [12.249074183271743]
量子化は、効率的な大言語モデル(LLM)の推論に不可欠である。
行列乗算のための高精度な低ビット重みを復号化するためのステップ変換は、現代のAIアクセラレーターにとって重要なボトルネックとなっている。
本稿では,GEMM臨界経路から重み/KV重みを除去する量子化フレームワークであるMulti-Scale Dequant(MSD)を提案する。
論文 参考訳(メタデータ) (2026-05-13T09:49:56Z) - Pretraining large language models with MXFP4 on Native FP4 Hardware [6.139566055770847]
我々は,前向きのアクティベーションやアクティベーション勾配が安定している場合でも,大規模言語モデルのフルパイプFP4トレーニングがしばしば分岐する理由を考察する。
その結果,FP4トレーニングの不安定性は,過度な直感性ではなく,敏感な勾配経路に沿った構造的マイクロスケーリング誤差によって引き起こされることがわかった。
論文 参考訳(メタデータ) (2026-05-11T00:04:07Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs [4.431548809730958]
ARCQuantは、Augmented Residual Channelsを通じてNVFP4パフォーマンスを向上させるフレームワークである。
ARCQuantは、複雑なタスクや下流タスクにおいて、完全精度のベースラインに匹敵する、最先端の精度を実現する。
論文 参考訳(メタデータ) (2026-01-12T12:27:22Z) - Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization [77.67818998672516]
本研究は,MXFP4とNVFP4の学習後量子化に関する総合的研究である。
本稿では,従来のGPTQ量子化アルゴリズムの変種であるMicro-Rotated-GPTQ(MR-GPTQ)を紹介する。
MR-GPTQは最先端の精度で一致または性能が向上することを示す。
論文 参考訳(メタデータ) (2025-09-27T09:22:21Z) - Optimizing Large Language Model Training Using FP4 Quantization [73.55459961002371]
量子化トレーニングは、低ビット演算によるコスト削減を可能にすることで、有望なソリューションを提供する。
この研究は、大規模言語モデル(LLM)のための最初のFP4トレーニングフレームワークを紹介します。
論文 参考訳(メタデータ) (2025-01-28T18:04:50Z) - AMXFP4: Taming Activation Outliers with Asymmetric Microscaling Floating-Point for 4-bit LLM Inference [6.699442219974261]
AMXFP4は4ビットの非対称なFPフォーマットで、どちらも非対称な共有スケールで処理する。
AMXFP4はVQAでMXFP4を3%上回り、CSQAで1.6%上回る。
論文 参考訳(メタデータ) (2024-11-15T03:11:19Z) - AffineQuant: Affine Transformation Quantization for Large Language Models [58.45460102764]
ポストトレーニング量子化(PTQ)は、その圧縮効率とトレーニングの文脈における費用対効果により、かなりの関心を集めている。
既存の大規模言語モデル(LLM)のPTQ手法は、事前量子化重みと後量子化重みの間の変換のスケーリングに最適化範囲を制限している。
本稿では,PTQ(AffineQuant)における等価アフィン変換を用いた直接最適化を提唱する。
論文 参考訳(メタデータ) (2024-03-19T08:40:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。