論文の概要: RotaryQuant: Fitting 120B MoE Models on Consumer Hardware via Fused Compressed-Space Attention
- arxiv url: http://arxiv.org/abs/2608.08081v1
- Date: Sat, 08 Aug 2026 11:58:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.654329
- Title: RotaryQuant: Fitting 120B MoE Models on Consumer Hardware via Fused Compressed-Space Attention
- Title(参考訳): RotaryQuant:圧縮圧縮空間の注意を通した消費者向けハードウェアのMoEモデル120億台
- Abstract要約: 26-120億のパラメータを持つ大規模混合専門家言語モデル(MoE)は、3つの同時圧力によってコンシューマデバイスのメモリ容量を超過する。
3つすべてに対処する3軸圧縮システムであるRotaryQuantを紹介する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large mixture-of-experts (MoE) language models with 26--120 billion parameters exceed the memory capacity of consumer devices through three simultaneous pressures: resident weight matrices, key-value (KV) cache state that grows linearly with context, and dozens of expert sublayers that must be paged on demand. We present RotaryQuant, a three-axis compression system that addresses all three. Mixed-precision weight quantization assigns bit-widths by architectural role: 4-bit for dense layers, 2-bit for routed experts, and 8-bit for the shared expert whose high activation kurtosis resists aggressive compression. LRU expert offloading pages non-resident experts to disk under genuine memory pressure. The novel axis is IsoQuant, a KV cache compression method that applies a Walsh--Hadamard transform followed by block-diagonal SO(4) rotations to isotropize activation distributions before 3-bit scalar quantization, requiring $O(d \log d)$ operations and 256 stored parameters per head versus $O(d^2)$ and 16{,}384 for dense rotation methods. A fused four-kernel Metal GPU pipeline performs attention directly on packed 3-bit tensors without materializing full-precision KV state---a different execution model, not just a quantization scheme. The combined system fits Gemma 4-26B-A4B and Qwen3-30B-A3B within a 16\,GB budget and Nemotron-H 120B within 32\,GB, running interactively at 9--19 tok/s with near-zero perplexity degradation ($Δ$PPL $\leq +0.0012$) and 100\% retrieval accuracy at 32K context.
- Abstract(参考訳): 26-120億のパラメータを持つ大規模混合専門家(MoE)言語モデルは、居住重量行列、コンテキストに合わせて線形に成長するキー値(KV)キャッシュ状態、要求に応じてページングしなければならない数十のエキスパートサブレイヤという3つの同時圧によって、コンシューマデバイスのメモリ容量を超える。
3つすべてに対処する3軸圧縮システムであるRotaryQuantを紹介する。
混合精度重み量子化は、アーキテクチャ上の役割によってビット幅を割り当てる:密度の高い層は4ビット、ルーティングされた専門家は2ビット、共有専門家は8ビット。
LRUの専門家は、真のメモリプレッシャーの下で、非居住者の専門家をディスクにオフロードする。
新たな軸は、Walsh-Hadamard変換とブロック対角SO(4)回転を適用したKVキャッシュ圧縮法であるIsoQuantで、3ビットスカラー量子化前の活性化分布を等方化するためには、高密度回転法では$O(d \log d)$演算と256の記憶パラメータを必要とするが、$O(d^2)$および16{,}384に対して$O(d,log d)$演算を必要とする。
融合した4カーネルのMetal GPUパイプラインは、量子化スキームだけでなく、別の実行モデルである完全精度のKV状態を具現化せずに、充填された3ビットテンソルに直接注意を向ける。
組み合わせシステムは16GBの予算でGemma 4-26B-A4BとQwen3-30B-A3B、32GBの予算でNemotron-H 120Bに収まる。
関連論文リスト
- A JoLT for the KV Cache: Near-Lossless KV Cache Compression via Joint Tucker and JL-Residual Allocation for LLMs [0.0]
キー値(KV)キャッシュは、トランスフォーマー推論の主要なメモリコストとなっている。
低ランク法はキャッシュの2次元スライス、またはヘッド当たり行列またはクロス層特徴ブロックを分解し、量子化法は各エントリのビット幅を下げる。
提案手法は,トークンと特徴軸のみを圧縮し,頭部と層軸をそのまま残す部分的タッカー分解法である。
ランダム化されたSVDの派生型であるFlashJoLTは、1024のコンテキストで5-13倍の圧縮時間のスピードアップと品質の一致を提供する。
論文 参考訳(メタデータ) (2026-07-14T09:23:20Z) - RoPE-Aware Bit Allocation for KV-Cache Quantization [52.099459337231345]
Block-GTQはTurboQuant-MSE上に構築されたキーキャッシュ量子化のためのビットアロケータである。
これは、RoPEクエリキーのロジットを10モデル診断パネルに保存する。
128Kコンテキストでfp16 FlashAttention2より1.34倍高速で動作する。
論文 参考訳(メタデータ) (2026-06-23T00:17:48Z) - HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models [0.0]
HyperQuantは、大きな言語と拡散トランスフォーマーの重みとKVキャッシュのための、トレーニング後の統一的な量子化パイプラインである。
最近のHIGGS方式は、重量でスカラー(bps)あたり3ビットから5ビットに上回り、KV量子化でTurboQuantとOCTOPUSを1.7bpsに上回ります。
線形重み 3.9x と KV キャッシュ 3.79x をほぼロスレス品質で圧縮する。
論文 参考訳(メタデータ) (2026-06-22T14:30:47Z) - XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference [0.0]
XFPはコードブックのサイズ、アウトリーチ予算、レイヤごとのパッケージを自動的に決定する。
XFPはワークステーションハードウェア上で128 tok/sのシングルストリームデコードに達する。
対象メモリエンベロープに収まらないモデルに対しては、H-Processを示す。
論文 参考訳(メタデータ) (2026-05-14T13:52:31Z) - FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression [5.385515135626162]
FASQ(Flexible Accelerated Subspace Quantization)は,大規模言語モデルに製品量化を適用するキャリブレーションフリーフレームワークである。
Meta-Llama-3-8Bでは、FASQは4ビット GPTQ と AWQ の精度(67-42%モデルサイズ)を37-42%モデルサイズで上回っている。
論文 参考訳(メタデータ) (2026-04-22T20:03:36Z) - Open-TQ-Metal: Fused Compressed-Domain Attention for Long-Context LLM Inference on Apple Silicon [0.0]
我々は、Apple Siliconに融合圧縮ドメインアテンションの最初の実装であるOpen-TQ-Metalを紹介する。
Llama 3.1 70Bの128Kコンテクスト推論を可能にする。
Open-TQ-MetalはKVキャッシュをオンザフライでInt4に量子化し、圧縮された表現に直接注意を計算する。
論文 参考訳(メタデータ) (2026-04-18T10:39:28Z) - ITQ3_S: High-Fidelity 3-bit LLM Inference via Interleaved Ternary Quantization with Rotation-Domain Smoothing [0.0]
我々は,TurboQuant(TQ)を統合したLLMのための新しい3ビット重み量子化フォーマットであるITQ3_S(Interleaved Ternary Quantization -- Specialized)を提案する。
従来の3ビット法では、重み付き重み分布とチャネル間外周による精度の低下が見られた。
ITQ3_Sは、量子化の前にFWHTを介して重み空間を前回転させ、ベクトルにエネルギーを分散させ、ガウス近傍の分布を誘導する。
論文 参考訳(メタデータ) (2026-03-30T00:03:22Z) - Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels [83.99688944263843]
DoRA(Weight-De Low-Rank Adaptation)は、LoRAを方向から分離することで拡張する。
d_in = 8192 とランク r = 384 では、単一のモジュールのノルムは bf16 で512MB の過渡的なワーキングメモリを必要とする。
因子ノルムは、二乗ノルムを O(d_out r + r2) 中間体を通して計算可能な基底、交差、およびグラマー項に分解し、密積を除去する。
論文 参考訳(メタデータ) (2026-03-23T17:57:24Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - Quantized Visual Geometry Grounded Transformer [67.15451442018258]
本稿では,VGGTの最初の量子化フレームワーク,すなわちQuantVGGTを提案する。
球状前アダマール回転と局所流路平滑化を統合したDual-Smoothed Fine-Grained Quantizationを導入する。
また、重層統計量を用いて外周をフィルタするノイズフィルタディバースサンプリングを設計する。
論文 参考訳(メタデータ) (2025-09-25T15:17:11Z) - SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models [61.474101404805545]
拡散モデルは高品質なイメージを生成することができるが、スケールするにつれて、メモリ要求が増加し、より高いレイテンシがデプロイメント上の課題を引き起こす。
この制限を克服する新しい4ビット量子化パラダイムであるSVDQuantを提案する。
We reduce the memory usage for the 12B FLUX.1 models by 3.5$times$, achieved 3.0$times$ speedup over the 4-bit weight-only Quantization (W4A16) baseline。
論文 参考訳(メタデータ) (2024-11-07T18:59:58Z) - KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization [67.74400574357472]
LLMは、大きなコンテキストウィンドウを必要とするアプリケーションでの利用が増えており、この大きなコンテキストウィンドウでは、KVキャッシュのアクティベーションが推論時のメモリ消費の主要な要因として表面化している。
量子化はKVキャッシュのアクティベーションを圧縮する上で有望な手法であるが、既存のソリューションは4ビット以下の精度でアクティベーションを正確に表現できない。
我々の研究であるKVQuantは、いくつかの新しい手法を取り入れることで、低精度のKVキャッシュ量子化を容易にする。
論文 参考訳(メタデータ) (2024-01-31T18:58:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。