論文の概要: Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM
- arxiv url: http://arxiv.org/abs/2609.04098v1
- Date: Thu, 03 Sep 2026 17:04:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.162952
- Title: Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM
- Title(参考訳): デルタネットが4ビット量子化で生き残る理由:ハイブリッド27B LLMのリカレントハーフにNVFP4 W4A4
- Authors: Sergii Kozyrev, Davyd Maiboroda,
- Abstract要約: ミニマ: NVFP4 W4A4は、GDNを含む496のリニア層である。
NVFP4の16要素ブロックのスケーリングが残ストリームの極端な外れ値の局所化の原因を説明する4つのメカニズムの研究がある。
ハイブリッド LLM の繰り返し半分が量子化し易い理由に関する力学的な説明。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hybrid LLMs pair softmax attention with linear-attention layers such as Gated DeltaNet (GDN), whose recurrent state summarizes the context in fixed size. Early community 4-bit quantizations of Qwen3.8-27B (48 GDN layers, 16 attention layers) left the GDN block in 8- or 16-bit precision -- especially its decay and write-strength gates -- on the intuition that errors in a recurrence accumulate over long contexts. We test that intuition by building Minima: NVFP4 W4A4 on all 496 linear layers, GDN included. Across perplexity at 4K/32K, MMLU-Pro, GSM8K, AIME'25, GPQA-Diamond, LiveCodeBench, and RULER retrieval to 64K, Minima matches BF16 within seed noise (5-task average -0.52) while being the smallest (17.5 GiB) and fastest-prefill (+14-19%) recipe we compare, and its 32K perplexity gap shrinks with position. A four-part mechanism study explains why: (i) NVFP4's 16-element block scaling localizes the residual stream's extreme outliers, equalizing activation error across layer roles; (ii) the supposedly fragile gate projections are the least sensitive -- softplus/exponential and sigmoid parameterizations compress ~11% GEMM error to ~2% output error; (iii) the delta-rule recurrence holds injected noise at a flat plateau over 32K tokens and forgets a state impulse within hundreds of steps, because each write overwrites the state along the current key direction; (iv) the per-token quantization cost washes out with context instead of compounding. We also repair a global-scale mismatch that arises when per-module-calibrated NVFP4 checkpoints are served by kernels that fuse those modules into one GEMM, and show calibrated FP8 KV-cache scales are performance-free. The result: a practical recipe -- quantize everything, ship KV scales -- and a mechanistic account of why the recurrent half of a hybrid LLM is the easy half to quantize. Checkpoint: https://huggingface.co/minima-ai/mnma_qwen3.8_27b_nvfp4
- Abstract(参考訳): ハイブリッドLLMは、Gated DeltaNet (GDN)のような線形アテンション層とソフトマックスの注意をペアリングする。
Qwen3.8-27Bの初期の4ビット量子化(48のGDN層、16の注意層)は、8ビットまたは16ビットの精度でGDNブロックを残した。
我々は、Minima: NVFP4 W4A4を、GDNを含む496の線形層上に構築することで、その直観をテストする。
4K/32K, MMLU-Pro, GSM8K, AIME'25, GPQA-Diamond, LiveCodeBench, RULERの64Kへの検索では, 最小の17.5 GiB, 最速のレシピ(+14-19%)でBF16をシードノイズ(平均0.52)でマッチングし, 32Kのパープレキシティギャップは位置によって減少する。
4つのメカニズムの研究は、その理由を説明している。
(i)NVFP4の16要素ブロックスケーリングは、残ストリームの極端な異常値をローカライズし、層の役割間でのアクティベーションエラーを等化させる。
(ii) 脆弱なゲート投影が最も感度が低いと思われる - ソフトプラス/指数およびシグモイドパラメータ化は11%のGEMM誤差を約2%の出力誤差に圧縮する。
三 デルタルールの再発は、平らな台地において32Kのトークンに注入されたノイズを保持し、各書き込みが現在のキー方向に沿って状態を上書きするため、数百ステップ以内に状態のインパルスを忘れる。
(四)単価の量子化コストは、コンプレックスではなく文脈で洗浄する。
また、モジュール単位のNVFP4チェックポイントが1つのGEMMに融合するカーネルによって提供される場合に発生するグローバルスケールのミスマッチを修復し、キャリブレーションされたFP8 KV-cacheスケールがパフォーマンスのないことを示す。
その結果、実践的なレシピ -- すべてを定量化し、KVスケールを出荷する -- と、ハイブリッドLLMのリカレント半減期が、量子化しやすい半減期であることのメカニスティックな説明です。
チェックポイント:https://huggingface.co/minima-ai/mnma_qwen3.8_27b_nvfp4
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - RDQ: Residual Distribution Quantization for Large Language Models [3.7323766833175718]
大規模言語モデルの学習後の量子化は、4ビット精度以下で急激に低下する。
本稿では、カスケード誤差補償を中心とするPTQフレームワークRDQ(Residual Distribution Quantization)を提案する。
全ての出力は標準グループ-128非対称量子化であり、Qualcomm AIMET、GGUF、およびランタイムオーバーヘッドゼロの標準推論スタックにデプロイ可能である。
論文 参考訳(メタデータ) (2026-07-11T05:54:00Z) - SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference [4.219937026460372]
SharQは、オンラインスパース-デンス分解による活性化空間とFP4量子化を橋渡しする。
スパースFP4 GEMMはバックボーンを処理し、密度の高いFP4 GEMMはマスク誘起活性化損失とスパースパス量子化誤差の両方を補償する。
論文 参考訳(メタデータ) (2026-06-25T04:19:04Z) - MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization [27.433770037419624]
大規模言語モデル(LLM)のための統一的な4ビット量子化パラダイムを提案する。
MosaicQuantは、全重量行列を高密度な4ビット基底成分に量子化し、不純物は忠実に捕獲され、不純物は必然的に定量化される。
LLaMA3とQwen3の実験では、MosaicQuantはFP16に近い精度を維持し、W16A16ベースライン上で最大1.24タイムのスピードアップを実現している。
論文 参考訳(メタデータ) (2026-06-14T07:43:43Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals [10.860081994662645]
大規模言語モデル(LLM)の学習後の量子化は、推論時の計算コストを抑えるという約束を果たす。
本稿では,最先端技術をさらに推し進めるPTQ手法であるResQを提案する。
ResQは、様々なベンチマークにおいて、最近の一様および混合精度のPTQ法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-12-18T22:01:55Z) - SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models [61.474101404805545]
拡散モデルは高品質なイメージを生成することができるが、スケールするにつれて、メモリ要求が増加し、より高いレイテンシがデプロイメント上の課題を引き起こす。
この制限を克服する新しい4ビット量子化パラダイムであるSVDQuantを提案する。
We reduce the memory usage for the 12B FLUX.1 models by 3.5$times$, achieved 3.0$times$ speedup over the 4-bit weight-only Quantization (W4A16) baseline。
論文 参考訳(メタデータ) (2024-11-07T18:59:58Z) - HAWQV3: Dyadic Neural Network Quantization [73.11579145354801]
現在の低精度量子化アルゴリズムは、浮動小数点から量子化された整数値への変換の隠れコストを持つことが多い。
HAWQV3は、新しい混合精度整数のみの量子化フレームワークである。
論文 参考訳(メタデータ) (2020-11-20T23:51:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。