論文の概要: CurveTQ: Rotation-Free Trellis Quantization of LLM Weights via Curvature-Weighted Search
- arxiv url: http://arxiv.org/abs/2610.09212v1
- Date: Tue, 06 Oct 2026 23:14:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.644159
- Title: CurveTQ: Rotation-Free Trellis Quantization of LLM Weights via Curvature-Weighted Search
- Title(参考訳): CurveTQ: 曲率重み探索によるLLM重みの回転フリートレリス量子化
- Abstract要約: CurveTQは回転のないトレリスで、重みの振幅と縁の形状を分解されたスケールフィールドと閉形式の量子テーブルで処理する。
2ビットでは、CurveTQは、QTIPとProteusの3つの4-8Bインストラクトモデルよりも平均下流精度が1-3ポイント高い。
また、35Bのエキスパートが混ざり合っていることから、このようなモデルで最初のトレリスコードによる結果が得られました。
- 参考スコア(独自算出の注目度): 3.5074113423203737
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The best two-bit weight quantizers for large language models, such as QTIP and Proteus, rotate each weight matrix by a random orthogonal transform, which must be undone at every decoding step, then encode it with a trellis or lattice code under a Euclidean search; the layer Hessian enters only through error feedback between coding blocks. We show that this leaves part of the Hessian unused. Error feedback turns the loss into a weighted sum of per-coordinate rounding errors whose weights, the diagonal of the Hessian's LDL factorization, existing quantizers compute but never read. We put these weights into the Viterbi branch metric, so the search follows the curvature within each coding block. This also explains the rotation: it removes this within-block variation, so weighting in the native basis and rotating are substitutes. On three models the weighted native search matches a full-dimension randomized Hadamard to within about one point of downstream accuracy, and weighting after the rotation gains little. Around this search we build CurveTQ, a trellis codec with no rotation, which handles the weights' amplitude and marginal shape with a factored scale field and a closed-form quantile table, and stores a start state per coding block so the trellis can adapt to the residual that error feedback carries into it. At two bits CurveTQ is 1-3 points higher in mean downstream accuracy than QTIP and Proteus on three 4-8B Instruct models, even after both are given our start state, which alone lifts either baseline by 1-3 points. It also leads on a 35B mixture of experts, to our knowledge the first trellis-coded result on such a model. With no rotation to undo, our decoder is the fastest of the three at all tested batch sizes and bit widths.
- Abstract(参考訳): QTIPやProteusのような大きな言語モデルのための最良の2ビットの重み量子化器は、各重み行列をランダムな直交変換で回転させる。
これはヘッセン語の一部が使われていないことを示している。
誤差フィードバックは、損失を重み付けした座標毎の丸め誤差の総和、ヘッセンのLCL分解の対角線、既存の量子化器は計算するが、読めない。
これらの重みをビタビ分岐計量に置き、探索は各符号化ブロック内の曲率に従う。
この回転はブロック内の変化を除去するので、ネイティブベースでの重み付けと回転は代用となる。
3つのモデルにおいて、重み付けされたネイティブサーチは、全次元のランダム化アダマールを下流の精度の約1ポイント以内まで一致させ、回転後の重み付けは少ない。
このサーチの周りには、回転のないトレリスコーデックであるCurveTQを構築する。これは、重みの振幅と辺形を係数スケールフィールドと閉形式量子テーブルで処理し、トレリスがエラーフィードバックがもたらす残差に適応できるように、符号化ブロック毎に開始状態を記憶する。
2ビットでCurveTQは、QTIPとProteusの3つの4-8Bインストラクトモデルよりも平均下流精度が1-3ポイント高い。
また、35Bのエキスパートが混ざり合っていることから、このようなモデルで最初のトレリスコードによる結果が得られました。
ローテーションなしでは、デコーダはテストされたバッチサイズとビット幅で3つの中で最速です。
関連論文リスト
- Scale Sensitivity in Low-Bit Post-Training Quantization: Curvature of the Quantization Error Landscape [15.425095447368962]
GPTQファミリーにおけるポストトレーニング量子化(PTQ)法は、スケールを選択しなければならない一様格子上の層次再構成誤差を最小限に抑える。
この目的がスケールに対してどれほど敏感か研究する。
ガウス重みと十分に大きな有効ランクのキャリブレーションアクティベートを持つ層に対して、幅が大きくなるにつれて正規化された円-熱損失は高い確率で収束することを示す。
論文 参考訳(メタデータ) (2026-09-29T12:46:41Z) - SPHQuant: Efficient extreme low bit weight quantization for Vision-Language Models [39.24504021613771]
視覚言語モデルのための回転自由球面量のみの量子化フレームワークを提案する。
カルテシアン座標に直接重みを量子化する代わりに、各8次元重みベクトルを座標記号、半径、正の単位方向に分解する。
実験により、最先端の極低ビット量子化法の性能と一致することが示された。
論文 参考訳(メタデータ) (2026-09-21T16:46:46Z) - OCTOPUS: Optimized KV Cache for Transformers via Octahedral Parametrization Under optimal Squared error quantization [13.284869342523095]
キー値(KV)は自己回帰推論におけるメモリ帯域幅とフットプリントを支配している。
最近の回転プリコンディショニングコーデック(TurboQuant, PolarQuant)は、KV圧縮のほぼ最適レシピである。
OCTOPUSはこのパラダイムを回転座標三重項の結合量子化によって前進させる。
論文 参考訳(メタデータ) (2026-05-20T14:19:51Z) - AXELRAM: Quantize Once, Never Dequantize [0.0]
AXELRAMは、量子化されたKVキャッシュインデックスから直接注目スコアを算出する。
我々は,根本原因をレイヤーワイド標準に追従し,ハードウェアコストゼロの破滅的なスパイクを排除した勾配のない符号パターン選択(200の候補,8のキャリブレーションサンプル,1回)を提案する。
論文 参考訳(メタデータ) (2026-04-03T02:03:38Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z) - SpinQuant: LLM quantization with learned rotations [49.07335692298487]
重み、アクティベーション、KVキャッシュに適用された後トレーニング量子化(PTQ)技術は、大規模言語モデル(LLM)のメモリ使用量、レイテンシ、消費電力を大幅に削減する。
我々は、量子化精度を高めつつ、完全精度のトランスフォーマーアーキテクチャにおいて同一の出力をもたらす、適用可能な回転パラメータ化の集合を同定する。
本研究では,学習した回転行列を最適な量子化ネットワーク精度に組み込む新しい手法であるSpinQuantを提案する。
論文 参考訳(メタデータ) (2024-05-26T02:15:49Z) - Rotated Binary Neural Network [138.89237044931937]
バイナリニューラルネットワーク(BNN)は、ディープニューラルネットワークの複雑さの低減において、その優位性を示している。
主要な障害の1つは、全精度重みベクトルとその二乗ベクトルの間の大きな量子化誤差である。
本稿では,全精度重みベクトルとバイナライズ版との角度アライメントを考慮した回転2成分ニューラルネットワーク(RBNN)を提案する。
論文 参考訳(メタデータ) (2020-09-28T04:22:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。