論文の概要: IsoQuant: Hardware-Aligned SO(4) Isoclinic Rotations for LLM KV Cache Compression
- arxiv url: http://arxiv.org/abs/2603.28430v1
- Date: Mon, 30 Mar 2026 13:37:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.422585
- Title: IsoQuant: Hardware-Aligned SO(4) Isoclinic Rotations for LLM KV Cache Compression
- Title(参考訳): IsoQuant: LLM KVキャッシュ圧縮のためのハードウェア対応SO(4)等クリニックローテーション
- Abstract要約: 四元数代数に基づくブロックワイズ回転フレームワークと、SO(4)$の等クリニック分解を提案する。
IsoQuantは、平均的なカーネルレベルのスピードアップを4.5times$--$4.7times$ over RotorQuantで達成し、ピーク時のスピードアップは6times$以上である。
- 参考スコア(独自算出の注目度): 0.4496256885343706
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Orthogonal feature decorrelation is effective for low-bit online vector quantization, but dense random orthogonal transforms incur prohibitive $O(d^2)$ storage and compute. RotorQuant reduces this cost with blockwise $3$D Clifford rotors, yet the resulting $3$D partition is poorly aligned with modern hardware and offers limited local mixing. We propose \textbf{IsoQuant}, a blockwise rotation framework based on quaternion algebra and the isoclinic decomposition of $SO(4)$. It represents each $4$D block as a quaternion and applies a closed-form transform $T(v)=q_L v \overline{q_R}$. This yields two main variants: \emph{IsoQuant-Full}, which realizes the full $SO(4)$ rotation, and \emph{IsoQuant-Fast}, which keeps only one isoclinic factor for lower cost; the framework also admits a lightweight $2$D special case. At $d=128$, IsoQuant-Full reduces forward rotation cost from about $2{,}408$ FMAs in RotorQuant to $1{,}024$, while IsoQuant-Fast further reduces it to $512$. Across $18$ fused CUDA settings with $d \in {128,256,512}$, bit widths ${2,3,4}$, and FP16/FP32 execution, IsoQuant achieves mean kernel-level speedups of about $4.5\times$--$4.7\times$ over RotorQuant while maintaining comparable reconstruction MSE, with peak speedups above $6\times$. Current validation is limited to the stage-1 quantize--dequantize path on synthetic normalized vectors; end-to-end KV-cache evaluation remains future work.
- Abstract(参考訳): 直交特徴デコリレーションは低ビットオンラインベクトル量子化に有効であるが、高密度なランダム直交変換は禁忌な$O(d^2)$ストレージと計算を行う。
RotorQuantはこのコストを3ドル(約3,300円)のクリフォード・ローターで削減するが、結果として3ドル(約3,300円)のパーティションは現代のハードウェアと不整合であり、限定的なローカルミキシングを提供する。
四元数代数に基づくブロックワイズ回転フレームワークである「textbf{IsoQuant}」と、SO(4)$の等クリニック分解を提案する。
4ドルのブロックを四元数として表し、閉じた変換を$T(v)=q_L v \overline{q_R}$とする。
これにより、完全な$SO(4)$回転を実現する \emph{IsoQuant-Full} と、低コストで1つのアイソクリニック因子を保持する \emph{IsoQuant-Fast} の2つの主要な変種が得られる。
IsoQuant-Fullは$d=128$で、RotorQuantのFMAを$${,}408$から${,}024$に下げ、IsoQuant-Fastは$512$に下げる。
128,256,512}$の$d \in {128,256,512}$、ビット幅${2,3,4}$、FP16/FP32の実行で、IsoQuantは平均的なカーネルレベルのスピードアップを約4.5\times$-$4.7\times$ over RotorQuantで達成している。
現在の検証は、合成正規化ベクトル上のステージ-1量子化-値化経路に限られている。
関連論文リスト
- Quantum Multi-Armed Bandits and Linear Bandits: Lower Bounds and Algorithms [42.57939149964391]
量子多重武装バンドイット(QMAB)と量子線形バンドイット(QLB)について検討する。
有限作用 QLB に対して、QMAB に対して $(Klog(T/K))$ および $(dlog(T/d))$ の最初のミニマックス下界を証明する。
論文 参考訳(メタデータ) (2026-08-14T14:04:21Z) - Quantum Speedups for Stochastic Optimization with Heavy-Tailed Noise [49.730496294398726]
重み付き確率変数に対する新しい量子平均推定器を開発した。
尾指数>4/3$のより強い下界を導出し、次元への非自明な依存が避けられないことを示す。
凸目的関数に対して,量子射影勾配降下法を提案する。
論文 参考訳(メタデータ) (2026-07-28T09:29:37Z) - KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers [42.11461757540461]
拡散変圧器(DiT)からW4A4への後処理量子化は出力品質を著しく低下させる。
KroQuantは、学習されたKronecker構造を持つ可逆変換をアクティベーションの各32要素ブロックに適用するPTQ手法である。
論文 参考訳(メタデータ) (2026-07-23T15:52:20Z) - Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence [54.59847568544922]
有限水平時間同質なマルコフ決定過程に対して、$A$状態、$A$アクション、hoighty $H$、および1ドルで有界なトラジェクティブ当たりの合計報酬について、地平自由な後悔について検討する。
失敗確率$$K$はエピソード数で$tilde O(sqrtSAK+S3K)$ hides $mathsfpolyである。
論文 参考訳(メタデータ) (2026-07-22T07:42:19Z) - Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression [19.924689669010117]
HQMQ は K または V の 4 つの要素チャンクを四元数として扱い、その単位方向をエフェクティブ $q_p cdot q_s$ に量子化する。
HQMQは最大5.05タイムのKV圧縮を提供し、Llama-3-70B 128kのコンテクストキャッシュを43GBから8.5GBに縮小する。
論文 参考訳(メタデータ) (2026-05-26T20:09:17Z) - When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon [0.0]
KVキャッシュ量子化は、品質-レイテンシトレードオフとしてフレーム化される。
Apple Siliconの統一メモリにインセンティブを与えています。
論文 参考訳(メタデータ) (2026-05-07T05:44:39Z) - Block-Wise Differentiable Sinkhorn Attention: Tail-Refinement Gradients with a Gap-Aware Dustbin Bridge [0.0]
本稿では,TPUハードウェア上での長期的コンテキストバランスによる最適輸送注意度を,停止ベース,固定深部テールリファインメントサロゲートを用いて検討する。
本稿では, 局所的代理バイアスバウンド, 後部バイアス証明書, および, 厳密な正の能動ブロックに対する射影収縮証明書を提供する。
合成マスク問題では、最適化された置換基の正確なオートディフは10〜5ドル-10〜10ドルである。
論文 参考訳(メタデータ) (2026-04-28T19:01:11Z) - A four-player potential game for barren-plateau-aware quantum ansatz design [0.0]
我々は、パラメータ化量子回路の設計を、状態が回路指向非巡回グラフ(DAG)である4プレーヤポテンシャルゲームとしてキャストした。
ブロックコーディネート $varepsilon-Nash 残留 $_textNash$ シングルプレイヤーが一方的に改善できないことを保証する。
論文 参考訳(メタデータ) (2026-04-23T07:58:46Z) - Toward Magnetic-Field-Free Quantum Computing and Quantum Reservoir Computing in Engineered Organic Materials: A Unified Framework from the 3-Layer Quantum Brain Hypothesis [0.0]
我々はスピン渦誘起ループ電流(SVILC)を印加磁場を使わずに作動する有機材料に拡張する。
4つの経路が提案されている: (P1) フラビン-一酸化窒素ラジカル対貯水池, (P2) ペルクロロトリフェニルメチル (PTM) ラジカル配列, (P4) トランスポリアセチレン上のSu-シュリーファー-ヘーガーソリトン。
論文 参考訳(メタデータ) (2026-04-22T09:12:12Z) - Universal Quantum Suppression in Frustrated Ising Magnets across the Quasi-1D to 2D Crossover via Quantum Annealing [0.0]
競合する強磁性と反強磁性のカップリングは、任意のシステムサイズで量子モンテカルロに対して証明可能な難題を生成する。
我々は、$g_cmathrmQPUin0.286,,0.210,,0.156,0.093$ for $in1.0,,0.7,0.5,0.3$で量子駆動遷移を測定する。
論文 参考訳(メタデータ) (2026-03-25T13:50:52Z) - Optimal Scalar Quantization for Matrix Multiplication: Closed-Form Density and Phase Transition [50.36362492608702]
乗算前の2つの行列のエントリーワイズスカラー量子化について検討した。
我々は、閉形式の最適点密度 [ star(u) propto exp!left(-fracu26right)bigl( (1-2)+2u22bigr), qquad u=fracx_X を求め、相関駆動相転移を証明した。
論文 参考訳(メタデータ) (2026-03-20T01:53:44Z) - ATLAS: Efficient Atom Rearrangement for Defect-Free Neutral-Atom Quantum Arrays Under Transport Loss [46.043413607980845]
ニュートラル原子量子コンピュータは、光学格子に配列された個別に閉じ込められた原子の量子ビットを符号化する。
アルゴリズムはランダムにロードされた$W times W$格子を欠陥のない$L times L$サブアレイに変換する。
アルゴリズムは, 対象次元の必要初期サイズの線形化と線形化を実現する。
論文 参考訳(メタデータ) (2025-11-20T12:32:35Z) - SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models [61.474101404805545]
拡散モデルは高品質なイメージを生成することができるが、スケールするにつれて、メモリ要求が増加し、より高いレイテンシがデプロイメント上の課題を引き起こす。
この制限を克服する新しい4ビット量子化パラダイムであるSVDQuantを提案する。
We reduce the memory usage for the 12B FLUX.1 models by 3.5$times$, achieved 3.0$times$ speedup over the 4-bit weight-only Quantization (W4A16) baseline。
論文 参考訳(メタデータ) (2024-11-07T18:59:58Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z) - Measuring quantum relative entropy with finite-size effect [53.64687146666141]
相対エントロピー$D(rho|sigma)$を$sigma$が知られているときに推定する。
我々の推定器は次元$d$が固定されたときにCram'er-Rao型境界に達する。
論文 参考訳(メタデータ) (2024-06-25T06:07:20Z) - Globally optimal interferometry with lossy twin Fock probes [0.0]
2つの二次スピンオブザーバ$J_z2$と$J_+2+J_-2$のモーメント読み出し法がディック状態プローブに対して大域的に最適であることを示す。
損失条件では、粒子損失が双子のフォック状態に与える影響を記述する時間的不均一マルコフ過程を導出する。
論文 参考訳(メタデータ) (2023-08-10T22:56:12Z) - Cost Function Dependent Barren Plateaus in Shallow Parametrized Quantum
Circuits [0.755972004983746]
変分量子アルゴリズム (VQA) はパラメタライズド量子回路のパラメータ $vectheta$ を最適化する。
我々は、$V(vectheta)$が局所的な2-デザインを形成するブロックからなる交互層状アンサッツであると仮定して、2つの結果を証明した。
量子オートエンコーダの実装において、これらのアイデアを最大100キュービットの大規模シミュレーションで説明する。
論文 参考訳(メタデータ) (2020-01-02T18:18:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。