論文の概要: XOR-Trellis: Ultra-Low-Complexity Dequantization and Curvature-Aware Hadamard-Free LLM Quantization
- arxiv url: http://arxiv.org/abs/2610.00432v1
- Date: Wed, 30 Sep 2026 17:05:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.656002
- Title: XOR-Trellis: Ultra-Low-Complexity Dequantization and Curvature-Aware Hadamard-Free LLM Quantization
- Title(参考訳): XOR-Trellis:超低複雑性量子化と曲率アダマールフリーLDM量子化
- Abstract要約: 我々は、構造化されたハードウェア効率のステート・ツー・バリュー・マッピングを利用する超低複雑さトレリス・デ量子化器を提案する。
モデル感度を元の座標空間に直接反映する曲率認識目標を用いて離散トレリスパス最適化を再構成する。
- 参考スコア(独自算出の注目度): 7.093305009259454
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Trellis-coded quantization enables high-dimensional compression of large language model (LLM) weights at ultra-low bit widths without the exponentially large codebooks required by conventional vector quantization. Practical deployment, however, presents two challenges: reconstructing compressed weights at sufficient parallel throughput to avoid making dequantization an inference bottleneck, and maintaining quantization accuracy without costly incoherence transformations. We address these challenges with two complementary techniques. First, we introduce an ultra-low-complexity trellis dequantizer that uses a structured, hardware-efficient state-to-value mapping while preserving diverse reconstruction choices for trellis search. Second, we reformulate discrete trellis path optimization with a curvature-aware objective that reflects model sensitivity directly in the original coordinate space. Together, these techniques enable high-quality ultra-low-bit trellis quantization with inexpensive, highly parallel runtime reconstruction and without relying on Hadamard-based incoherence processing.
- Abstract(参考訳): トレリス符号化量子化は、従来のベクトル量子化で要求される指数関数的に大きな符号ブックを使わずに、超低ビット幅の大規模言語モデル(LLM)重みの高次元圧縮を可能にする。
しかし、現実的な展開には2つの課題がある: 圧縮重みを十分な並列スループットで再構築し、重み付けを推論ボトルネックにするのを避けること、そしてコストのかかる不整合変換を伴わずに量子化の精度を維持すること。
これらの課題を2つの補完的手法で解決する。
まず,トレリス探索のための多種多様な再構成選択を保ちながら,構造化されたハードウェア効率のステート・ツー・バリューマッピングを用いた超低複雑さトレリス復号器を提案する。
第2に、モデル感度を直接元の座標空間に反映する曲率認識目標を用いて離散トレリスパス最適化を再構成する。
これらの技術により、アダマールベースの非コヒーレンス処理に頼ることなく、安価で高並列なランタイム再構成による高品質な超低ビットトレリス量子化が可能となる。
関連論文リスト
- High-Precision Variational Quantum SVD via Classical Orthogonality Correction [0.0]
バイパルタイト状態の部分特異値分解のためのハイブリッド量子-古典的変分フレームワークを提案する。
我々はデフレに基づく最適化手法を用いて、ターゲット状態の支配的および支配的なシュミット成分を逐次抽出する。
我々のフレームワークは、先進的な短期量子デバイス上での大規模絡み合いスペクトル推定のための堅牢な経路を提供する。
論文 参考訳(メタデータ) (2026-05-09T04:49:05Z) - Tail-Aware Post-Training Quantization for 3D Geometry Models [58.79500829118265]
ポストトレーニング量子化(PTQ)は、再トレーニングなしに効率的な推論を可能にする。
PTQは複雑な特徴分布と禁止キャリブレーションオーバーヘッドのために、3Dモデルに効果的に転送できない。
3次元幾何学学習のためのTail-Aware Post-Training Quantization PipelineであるTAPTQを提案する。
論文 参考訳(メタデータ) (2026-02-02T07:21:15Z) - WUSH: Near-Optimal Adaptive Transforms for LLM Quantization [52.77441224845925]
低ビット幅への量子化は、大きな言語モデルをデプロイするための標準的なアプローチである。
いくつかの極端な重みと活性化は、ダイナミックレンジを拡張し、量子化器の有効分解能を減少させる。
結合重みアクティベーション量子化のための閉形式最適線形ブロックワイズ変換を初めて導出する。
論文 参考訳(メタデータ) (2025-11-30T16:17:34Z) - MPQ-DMv2: Flexible Residual Mixed Precision Quantization for Low-Bit Diffusion Models with Temporal Distillation [74.34220141721231]
我々は,textbfMixed textbfPrecision textbfQuantizationフレームワークを改良したMPQ-DMv2を提案する。
論文 参考訳(メタデータ) (2025-07-06T08:16:50Z) - Variationally optimizing infinite projected entangled-pair states at large bond dimensions: A split corner transfer matrix renormalization group approach [0.2796197251957244]
本稿では,PEPS層を分離し,新しい環境テンソルを活用することで,精度を保ちながら計算複雑性を低減できる「スプリットCTMRG」アルゴリズムを提案する。
量子格子モデルのベンチマークでは、変動エネルギー最適化のためのかなりのスピードアップが示され、この手法は大規模PEPSシミュレーションに有用である。
論文 参考訳(メタデータ) (2025-02-14T16:59:33Z) - Pushing the Limits of Large Language Model Quantization via the Linearity Theorem [71.3332971315821]
本稿では,階層的$ell$再構成誤差と量子化によるモデルパープレキシティ増加との直接的な関係を確立する「線形定理」を提案する。
この知見は,(1)アダマール回転とHIGGSと呼ばれるMSE最適格子を用いた単純なデータフリーLCM量子化法,(2)非一様層ごとの量子化レベルを求める問題に対する最適解の2つの新しい応用を可能にする。
論文 参考訳(メタデータ) (2024-11-26T15:35:44Z) - RepQuant: Towards Accurate Post-Training Quantization of Large
Transformer Models via Scale Reparameterization [8.827794405944637]
ポストトレーニング量子化(PTQ)は、大きなトランスモデルを圧縮するための有望な解である。
既存のPTQメソッドは、通常、非自明な性能損失を示す。
本稿では、量子化推論デカップリングパラダイムを備えた新しいPTQフレームワークRepQuantを提案する。
論文 参考訳(メタデータ) (2024-02-08T12:35:41Z) - CBQ: Cross-Block Quantization for Large Language Models [66.82132832702895]
ポストトレーニング量子化(PTQ)は、超低コストで大規模言語モデル(LLM)を圧縮する上で重要な役割を果たしている。
LLMのためのクロスブロック再構成に基づくPTQ手法CBQを提案する。
CBQはリコンストラクションスキームを使用してクロスブロック依存関係を採用し、エラーの蓄積を最小限に抑えるために複数のブロックにまたがる長距離依存関係を確立する。
論文 参考訳(メタデータ) (2023-12-13T07:56:27Z) - RepQ-ViT: Scale Reparameterization for Post-Training Quantization of
Vision Transformers [2.114921680609289]
視覚変換器のための新しいPTQフレームワークRepQ-ViTを提案する。
RepQ-ViTは量子化と推論プロセスを分離する。
既存の強力なベースラインを上回り、ViTの4ビットPTQの精度を有効レベルまで向上させることができる。
論文 参考訳(メタデータ) (2022-12-16T02:52:37Z) - Variational Quantum Optimization with Multi-Basis Encodings [62.72309460291971]
マルチバスグラフ複雑性と非線形活性化関数の2つの革新の恩恵を受ける新しい変分量子アルゴリズムを導入する。
その結果,最適化性能が向上し,有効景観が2つ向上し,測定の進歩が減少した。
論文 参考訳(メタデータ) (2021-06-24T20:16:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。