論文の概要: Variable Bit-width Quantization: Learning Per-Group Precision for "Bigger-but-Smaller" Language Models
- arxiv url: http://arxiv.org/abs/2607.02893v1
- Date: Fri, 03 Jul 2026 02:42:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.446909
- Title: Variable Bit-width Quantization: Learning Per-Group Precision for "Bigger-but-Smaller" Language Models
- Title(参考訳): 可変ビット幅量子化:"大文字だがスマラー"言語モデルのグループごとの精度を学習する
- Abstract要約: 可変ビット幅量子化(VBQ)を導入する。
64重みの連続した群が1,2,4,8ビットから独自の分解能を学習する訓練時間法である。
バイト単位の品質では、VBQはFP16よりも3.9-8.4倍効率が高い。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Low-bit quantization shrinks language models but treats precision as a single global hyper-parameter: every weight uses the same bit-width. We introduce Variable Bit-width Quantization (VBQ), a training-time method in which each contiguous group of 64 weights learns its own resolution from {1,2,4,8} bits via a Gumbel-Softmax relaxation, trained jointly by an alternating optimization that gives the precision logits a clean, task-aligned signal. VBQ discovers a consistent, strongly heterogeneous allocation within individual projection types, not merely across layers, impossible to express with per-layer methods: 69% of groups collapse to 1 bit, the LM head averages 1.09 bits, while the first MLP block keeps ~2.5 bits. This pattern is stable enough to freeze into a fixed recipe and reuse without further search. The recipe yields a "bigger-but-smaller" regime: a 131M model at 1.82 mean bits reaches perplexity 4.2 on TinyStories, beating a 55M FP16 model (PPL 4.4) at 3.8x less storage, and lets a 1.46B model on FineWeb-Edu match a 593M FP16 control at ~3.7x less storage with 2.5x more parameters. As quality-per-byte, VBQ is 3.9-8.4x more efficient than FP16. The recipe maps directly to packed low-bit storage, so it also accelerates inference: with custom fused dequantize-and-multiply kernels, memory-bandwidth-bound autoregressive decode is faster at equal output, and the speedup grows with scale (parity at 131M, 1.9x at 1.0B, 4.7x at 9B on Apple silicon). A distributional analysis (KL divergence and argmax-flip rate) reveals a striking mechanism: deeper layers progressively self-heal the quantization error injected by early layers. The win is a from-scratch, train-time phenomenon; scaling the search economically beyond 1.5B parameters remains open. VBQ reframes precision as a learnable, non-uniform resource and shows that spending a fixed bit budget unevenly beats spending it uniformly.
- Abstract(参考訳): 低ビット量子化は言語モデルを縮小するが、精度を単一のグローバルハイパーパラメータとして扱う。
可変ビット幅量子化(VBQ)は,64個の重みを持つ連続した群が,Gumbel-Softmax緩和により {1,2,4,8} ビットから自分自身の分解能を学習し,精度の高いロジットにクリーンなタスク整列信号を与える交代最適化によって共同で学習する訓練時間である。
VBQは、単層ではなく、個々の射影型内で一貫した強いヘテロジニアスなアロケーションを発見し、層ごとの手法で表現することは不可能である: 69%のグループは1ビットに崩壊し、LMヘッドは1.09ビット、最初のMLPブロックは2.5ビットである。
このパターンは固定されたレシピに凍結し、さらなる検索なしに再利用するのに十分な安定性がある。
131Mの1.82の平均ビットは、TinyStoriesの4.2に到達し、55MのFP16モデル(PPL 4.4)を3.8倍のストレージで上回り、1.46BのFP16モデルを593MのFP16コントロールに約3.7倍のパラメータで一致させる。
バイト単位の品質では、VBQはFP16よりも3.9-8.4倍効率が高い。
カスタムフューズされたdequantize-and-multiplyカーネルでは、メモリ帯域幅の自己回帰デコードは同じ出力で高速になり、スケールとともにスピードアップする(パーティは131M、1.0Bで1.9x、9Bで4.7x)。
分布解析(KL分散とargmax-flipレート)は、より深い層が初期層によって注入された量子化誤差を徐々に自己修復する、顕著なメカニズムを示す。
検索を1.5Bのパラメータを超えて経済的にスケールすることは、まだ未解決のままだ。
VBQは、正確さを学習可能な非一様リソースとして再設定し、固定ビットの予算を不均一に費やすことが、その費用を均一に上回ることを示す。
関連論文リスト
- Scaling Post-Training Ternarisation to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution [0.0]
本研究では,Qwen3-4BからQwen3-8Bへのアグレッシブ後変換パイプラインのスケールアップについて検討する。
この変換では、KOTMS回転、E2M-ATQ適応三元化、重量のみのA16構成でのGPTQスタイルの誤り補償が使用される。
論文 参考訳(メタデータ) (2026-09-08T06:21:44Z) - XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference [0.0]
XFPはコードブックのサイズ、アウトリーチ予算、レイヤごとのパッケージを自動的に決定する。
XFPはワークステーションハードウェア上で128 tok/sのシングルストリームデコードに達する。
対象メモリエンベロープに収まらないモデルに対しては、H-Processを示す。
論文 参考訳(メタデータ) (2026-05-14T13:52:31Z) - StateSMix: Online Lossless Compression via Mamba State Space Models and Sparse N-gram Context Mixing [0.0]
StateSMixはオンライントレーニングされたMambaスタイルのステートスペースモデル(SSM)で、スパース n-gram コンテキストの混合と算術符号を持つ。
SSMはBPEトークンに対して連続的に更新された確率推定を提供し、9つのスパースn-gramハッシュテーブルは正確な局所および長距離パターン記憶を付加する。
標準のenwik8ベンチマークでは、StateSMixは1MBで2.123bpb、3MBで2.149bpb、10MBで2.162bp、xz-9e(LZMA2)を8.7%、5.4%、そして2.162bpbを達成した。
論文 参考訳(メタデータ) (2026-04-05T19:28:11Z) - Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels [83.99688944263843]
DoRA(Weight-De Low-Rank Adaptation)は、LoRAを方向から分離することで拡張する。
d_in = 8192 とランク r = 384 では、単一のモジュールのノルムは bf16 で512MB の過渡的なワーキングメモリを必要とする。
因子ノルムは、二乗ノルムを O(d_out r + r2) 中間体を通して計算可能な基底、交差、およびグラマー項に分解し、密積を除去する。
論文 参考訳(メタデータ) (2026-03-23T17:57:24Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - Binary Quantization For LLMs Through Dynamic Grouping [13.578307208515819]
大規模言語モデル(LLM)は、幅広い自然言語処理(NLP)タスクで顕著なパフォーマンスを示している。
16ビットのBrain Floatから-1,1の1ビットの表現にモデル重みを圧縮するバイナリ量子化は、ストレージと推論コストを大幅に削減する。
本稿では,2値量子化に適した新しい最適化目標と,これを効果的に実現するための3つのアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-09-03T06:36:21Z) - ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization [73.60493264901359]
本稿では,1ビット,1.58ビット,2ビット,3ビット,4ビットの量子化設定に対して厳密な比較を行う統一フレームワークを提案する。
3次、2ビット、3ビット量子化は、サイズと精度のトレードオフにおいて同等のパフォーマンスを維持していることを示す。
ハードウェアの制約を考慮すると、2ビット量子化はメモリの削減とスピードアップに有望な可能性を秘めている。
論文 参考訳(メタデータ) (2025-02-04T18:59:26Z) - SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models [61.474101404805545]
拡散モデルは高品質なイメージを生成することができるが、スケールするにつれて、メモリ要求が増加し、より高いレイテンシがデプロイメント上の課題を引き起こす。
この制限を克服する新しい4ビット量子化パラダイムであるSVDQuantを提案する。
We reduce the memory usage for the 12B FLUX.1 models by 3.5$times$, achieved 3.0$times$ speedup over the 4-bit weight-only Quantization (W4A16) baseline。
論文 参考訳(メタデータ) (2024-11-07T18:59:58Z) - The case for 4-bit precision: k-bit Inference Scaling Laws [75.4335600212427]
量子化法は、モデル内の各パラメータを表すために必要なビット数を減少させる。
最終的なモデルサイズは、元のモデルのパラメータの数と圧縮率の両方に依存する。
我々は16ビットの入力とkビットのパラメータを持つ35,000以上のゼロショット実験を行い、どの量子化手法が3ビットから8ビットの精度でスケーリングを改善するかを検証した。
論文 参考訳(メタデータ) (2022-12-19T18:48:33Z) - 8-bit Optimizers via Block-wise Quantization [57.25800395197516]
ステートフルズは、例えば過去の値の指数的滑らかな和(運動量付きSGD)や2乗和(アダム)など、時間の経過とともに統計を維持している。
この状態は、通常の勾配降下よりも最適化を加速するために使用することができるが、そうでなければモデルパラメータに割り当てられる可能性のあるメモリを使用する。
本稿では,32ビットの勾配状態を用いた場合の性能レベルを維持しながら,8ビット統計を用いた第1次勾配法を開発する。
論文 参考訳(メタデータ) (2021-10-06T15:43:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。