論文の概要: BARQ: Balanced Codebook Refinement for Low-Bit LLM Quantization
- arxiv url: http://arxiv.org/abs/2610.04490v1
- Date: Sat, 03 Oct 2026 12:45:15 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:54:29.219054
- Title: BARQ: Balanced Codebook Refinement for Low-Bit LLM Quantization
- Title(参考訳): BARQ:低ビットLDM量子化のためのバランスの取れたコードブック
- Abstract要約: 本稿では,既存のコードブックの平衡フィッティングによる量子化品質の向上を目的とした,量子化のための平衡割当てリファインメントを提案する。
代入重み付けされたバリセントリックな更新によってコードワードを洗練し、固定された代入に適合する目的を最小化することを証明する。
複数の言語モデル全体で、BARQは評価されたベースラインよりも低いパープレキシティと平均ゼロショット精度を達成する。
- 参考スコア(独自算出の注目度): 46.64897508613697
- License:
- Abstract: As large language models (LLMs) grow in parameter count, model storage and parameter memory traffic have become major bottlenecks to efficient deployment. Codebook-based weight quantization reduces these costs, but imbalanced nearest-codeword assignments during fitting can leave some codewords insufficiently updated, limiting effective codebook utilization. To address this limitation, we propose Balanced Assignment Refinement for Quantization (BARQ), which improves quantization quality through balanced fitting of existing codebooks. Specifically, we first compute joint soft assignments between weight blocks and codewords through entropically regularized optimal transport with uniform marginals and curvature-weighted reconstruction costs, ensuring equal positive fitting mass for every codeword in the exact solution. We then refine the codewords through an assignment-weighted barycentric update, which we prove minimizes the fitting objective for fixed assignments. For finite Sinkhorn iterations, the implemented update retains this optimality provided all codeword masses exceed the denominator floor. Finally, we discard the soft assignments and use the refined codebook for standard hard nearest-codeword encoding, with our analysis establishing sufficient conditions for reducing hard-quantization distortion and evaluation loss. Across multiple LLMs, BARQ achieves lower perplexity and higher mean zero-shot accuracy than the evaluated baselines at comparable bit budgets. The code is available at https://github.com/chenhangcuisg-code/BARQ.
- Abstract(参考訳): 大規模言語モデル(LLM)のパラメータ数の増加に伴い、モデルストレージとパラメータメモリトラフィックは、効率的なデプロイメントにおいて大きなボトルネックとなっている。
コードブックベースの重み量子化は、これらのコストを削減するが、不均衡な最寄りのコードワード割り当ては、いくつかのコードワードを不十分に更新し、効果的なコードブックの利用を制限する。
この制限に対処するため、既存のコードブックの平衡フィッティングによる量子化品質の向上を目的とした、BARQ(Ba balanced Assignment Refinement for Quantization)を提案する。
具体的には、まず、一様辺縁と曲率重み付き再構成コストによるエントロピー正規化された最適輸送により、重みブロックとコードワード間の結合ソフト割当を計算する。
次に、代入重み付けされたバリセントリックな更新によってコードワードを洗練し、固定された代入に適合する目的を最小化することを証明する。
有限のシンクホーン反復に対して、実装された更新は、すべてのコードワード質量が分母フロアを超えると、この最適性を保っている。
最後に、ソフトな代入を廃止し、改良されたコードブックを標準ハード最寄り符号符号化に使用し、ハード量子化歪みの低減と評価損失の低減に十分な条件を定めている。
複数のLLMにわたって、BARQは、同等のビット予算で評価されたベースラインよりも低いパープレキシティと平均ゼロショット精度を達成する。
コードはhttps://github.com/chenhangcuisg-code/BARQで入手できる。
関連論文リスト
- Noisy Test-Time Reinforcement Learning for Code LLMs [49.18760234865557]
大規模言語モデル(LLM)は、様々なコード関連タスクで顕著なパフォーマンスを示している。
LLMは曖昧でエラーを起こしやすいため、コードLLMの堅牢性には重大な課題がある。
本稿では,NTRL-Code(Noisy Test-time Reinforcement Learning framework)を提案する。
論文 参考訳(メタデータ) (2026-09-26T02:50:47Z) - Fine-Tuning Low-Bit Models with Gradient in Quantized Code Space [78.05046281165885]
微調整の低ビットモデルは、最終配置されたチェックポイントを同じ低ビット形式に保ちながら、量子化されたモデルを適用することを目的としている。
GradCodesは、異なる量子化データタイプにわたる微調整の低ビットモデルを一貫して改善する。
論文 参考訳(メタデータ) (2026-08-31T14:54:30Z) - Multi-Bitwidth Quantization for LLMs Using Additive Codebooks [12.237109162791091]
大規模言語モデル(LLM)は、リソース制約の異なる異種ハードウェアに徐々に展開されている。
本研究では,1つのトレーニングモデルからLLM重みの推測時間精度制御を可能にする,新しい学習後量子化フレームワークであるDrop-by-Dropを提案する。
論文 参考訳(メタデータ) (2026-06-11T04:06:02Z) - Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression [57.54335545892155]
本稿では,各重みの群に独自の格子コードブックを割り当てるGLVQ(Grouped Lattice Vector Quantization)フレームワークを紹介する。
提案手法は,既存のトレーニング後の量子化ベースラインと比較して,モデルサイズと精度のトレードオフが良好である。
論文 参考訳(メタデータ) (2025-10-23T20:19:48Z) - Low-Weight High-Distance Error Correcting Fermionic Encodings [0.0]
誤り訂正特性を持つ実効的なフェルミオン・ツー・キュービット符号化を探索する。
安定化器と論理演算子の重みを著しく改善する有望な高距離符号化を複数報告する。
論文 参考訳(メタデータ) (2024-02-23T15:32:57Z) - Weight Reduced Stabilizer Codes with Lower Overhead [0.0]
安定化器コードはパリティチェック演算子によって定義され、これは発生した可能性のあるエラーに関する情報を推測するために測定される。
Hastings氏は安定化器コードのパリティチェックを減らす方法を提案した。
ここでは、量子コンピューティングハードウェアに適した小型から中級の符号の体系に焦点をあてる。
論文 参考訳(メタデータ) (2024-02-07T20:08:38Z) - QA-LoRA: Quantization-Aware Low-Rank Adaptation of Large Language Models [85.02796681773447]
量子化対応低ランク適応(QA-LoRA)アルゴリズムを提案する。
その動機は量子化と適応の自由の不均衡度にある。
QA-LoRAは数行のコードで簡単に実装できる。
論文 参考訳(メタデータ) (2023-09-26T07:22:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。