論文の概要: QuBLAST: A Framework for Quantizing Large Language Models with Block-Level Compression Approach and Activation Scaling Strategy
- arxiv url: http://arxiv.org/abs/2606.04620v1
- Date: Wed, 03 Jun 2026 08:55:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-04 20:44:18.641893
- Title: QuBLAST: A Framework for Quantizing Large Language Models with Block-Level Compression Approach and Activation Scaling Strategy
- Title(参考訳): QuBLAST:ブロックレベル圧縮アプローチとアクティベーションスケーリング戦略による大規模言語モデルの定量化フレームワーク
- Abstract要約: QuBLASTは、LCMのアクティベーションスケーリング戦略を備えたブロックレベルの圧縮手法である。
異なるモデルアーキテクチャでモデルサイズを40%から45.2%削減する。
WikiText-2とWikiText-103データセットのパフォーマンスは、5%のパープレキシティ向上で維持されている。
- 参考スコア(独自算出の注目度): 4.215434651178227
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLMs have become the state-of-the-art algorithms for solving NLP tasks. However, they typically come at huge computational and memory costs, thus making them difficult to deploy on embedded systems. Toward this, state-of-the-art methods typically employ uniform post-training quantization (PTQ) across attention blocks of the network, hence overlooking the potential of applying different quantization levels in the same network. They also employ complex operations to mitigate the negative impact of activation outliers, hence incurring high computational overheads. Moreover, they have not considered evaluation using emerging LLMs with non-conventional attention architectures (e.g., state-space models), which pose different challenges in applying quantization. To address these limitations, we propose QuBLAST, a novel PTQ methodology that employs block-level compression approach with activation scaling strategy for LLMs. Block-level compression approach enables mixed-precision quantization across blocks of the network, while activation scaling strategy efficiently mitigates the negative impact of activation outliers. Specifically, QuBLAST first analyzes the sensitivity of different attention blocks in the pre-trained model through the cross-entropy loss analysis. QuBLAST leverages this sensitivity analysis to determine the weight quantization level for each attention block in the model. Furthermore, QuBLAST employs the activation scaling map for each block to control the range of activation values and mitigate the negative impact of activation outliers, thereby enabling better quantization results. Experimental results show that, QuBLAST reduces model sizes by 40%-45.2% across different model architectures (i.e., Qwen3-8B, Llama3-8B, Mistral v0.1-8B, and Falcon H1R-7B), while maintaining the performance within 5% perplexity increase for the WikiText-2 and WikiText-103 datasets.
- Abstract(参考訳): LLMはNLPタスクを解くための最先端のアルゴリズムとなっている。
しかし、それらは一般的に計算とメモリのコストが大きいため、組み込みシステムへのデプロイが困難になる。
これに向けて、最先端の手法では、通常、ネットワークの注意ブロックをまたいだ均一なポストトレーニング量子化(PTQ)を用いるため、同じネットワークに異なる量子化レベルを適用する可能性を見越すことができる。
また、アクティベーション・アウトレイアの負の影響を軽減するために複雑な演算を用い、高い計算オーバーヘッドを発生させる。
さらに,非伝統的な注意アーキテクチャ(例えば状態空間モデル)を持つ新興LLMを用いた評価を考慮せず,量子化の適用において異なる課題を提起している。
これらの制約に対処するために,ブロックレベルの圧縮手法とLCMのアクティベーションスケーリング戦略を用いた新しいPTQ手法QuBLASTを提案する。
ブロックレベルの圧縮アプローチは、ネットワークのブロック間での混合精度量子化を可能にし、アクティベーションスケーリング戦略は、アクティベーションアウトリーの負の影響を効果的に軽減する。
具体的には、QuBLASTはまず、クロスエントロピー損失分析により、事前学習されたモデルにおける異なる注意ブロックの感度を分析する。
QuBLASTはこの感度分析を利用して、モデル内の各注目ブロックの重量量子化レベルを決定する。
さらに、QuBLASTでは、各ブロックに対してアクティベーションスケーリングマップを使用して、アクティベーション値の範囲を制御し、アクティベーションアウトリアの負の影響を軽減することにより、より優れた量子化結果を実現する。
実験の結果、QuBLASTは異なるモデルアーキテクチャ(Qwen3-8B、Llama3-8B、Mistral v0.1-8B、Falcon H1R-7B)でモデルサイズを40%-45.2%削減し、WikiText-2とWikiText-103データセットでは5%の複雑さで性能を向上した。
関連論文リスト
- Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors [11.27557330957057]
モデル量子化は、大規模言語モデルを実際にデプロイする際のストレージと推論コストを削減するための重要なテクニックである。
近年の研究では、量子化によって引き起こされる離散化と丸め誤差を敵に利用して、量子化条件付きバックドアアタックを構築することが示されている。
本手法では,有意なラウンドリング動作を微妙に制御するために,誤差誘導型ラウンドリングの反転制約,出力分布の整合性,および重み付き正規化を組み合わせたラウンドリング制御変数を導入する。
論文 参考訳(メタデータ) (2026-06-28T07:06:46Z) - OffQ: Taming Structured Outliers in LLM Quantization by Offsetting [46.325071880831445]
OffQは、新しいオフセット機構を通じて、低ビット量子化におけるアクティベーションアウトリーを緩和する。
OffQは、低ビット効率を維持しながら、モデルの精度を一貫して改善する。
論文 参考訳(メタデータ) (2026-06-05T10:11:34Z) - LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs [52.1276403258812]
ブロックワイドPTQの簡易かつ効果的な拡張であるLFQ(Logit-aware Final-block Quantization)を導入する。
LFQは、最先端のブロックワイドPTQよりも複雑な生成タスクの精度を一貫して改善する。
論文 参考訳(メタデータ) (2026-05-28T11:02:23Z) - Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients [36.01708036519368]
大規模視覚言語モデル (LVLM) は、マルチモーダル相互作用を必要とする下流タスクにおいて、顕著な成功を収めた。
既存のLVLM量子化法は、複雑なクロストークン相互作用を捉えるのに失敗するモダリティレベルでトークン感度を測定する。
機械的解釈可能性における公理的帰属に着想を得て、量子化対応統合勾配(QIG)の微粒化量子化戦略を導入する。
提案手法はLLaVA-onevision-7Bの平均精度を1.60%向上させ,LLaVA-onevision-7Bの完全精度とのギャップを1.33%に短縮する。
論文 参考訳(メタデータ) (2026-03-18T15:03:43Z) - Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs [78.09559830840595]
本稿では拡散に基づく言語モデルの定量化に関する最初の体系的研究について述べる。
異常に大きなアクティベーション値によって特徴付けられるアクティベーションアウトリーチの存在を同定する。
我々は最先端のPTQ手法を実装し、包括的な評価を行う。
論文 参考訳(メタデータ) (2025-08-20T17:59:51Z) - RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models [53.571195477043496]
本稿では,RoSTE (Rotated Straight-Through-Estimator) というアルゴリズムを提案する。
RoSTEは、量子化を意識した微調整(QA-SFT)と適応的な回転戦略を組み合わせることで、アクティベーションアウトリーを減少させる。
その結果, 予測誤差は収束重みの量子化誤差と直接比例し, 最適化された回転構成により効果的に管理できることが判明した。
論文 参考訳(メタデータ) (2025-02-13T06:44:33Z) - Interactions Across Blocks in Post-Training Quantization of Large Language Models [34.32577674735222]
トレーニング後の量子化は、ニューラルネットワークの計算要求を減らすために広く利用されている。
2つのマルチブロック微調整戦略を導入し、それらを微細調整単一変圧器ブロックのベースラインと比較する。
これらの手法の有効性は,特定のネットワークモデルに依存することが示唆された。
論文 参考訳(メタデータ) (2024-11-06T14:11:39Z) - Q-VLM: Post-training Quantization for Large Vision-Language Models [73.19871905102545]
本稿では,大規模視覚言語モデル(LVLM)の学習後量子化フレームワークを提案する。
視覚言語モデル全体の離散化誤差に大きな影響を及ぼす層間依存関係を抽出し、この依存関係を最適な量子化戦略に組み込む。
実験の結果,提案手法はメモリを2.78倍圧縮し,出力速度を約13B LLaVAモデルで1.44倍向上させることができた。
論文 参考訳(メタデータ) (2024-10-10T17:02:48Z) - ApiQ: Finetuning of 2-Bit Quantized Large Language Model [12.328293460903911]
ApiQは、LoRAコンポーネントを並列に初期化し、LLMの重みを定量化することで、失われた情報を量子化から復元するように設計されている。
様々なビット幅にわたって優れた微調整結果が得られる。
論文 参考訳(メタデータ) (2024-02-07T09:36:54Z) - CBQ: Cross-Block Quantization for Large Language Models [66.82132832702895]
ポストトレーニング量子化(PTQ)は、超低コストで大規模言語モデル(LLM)を圧縮する上で重要な役割を果たしている。
LLMのためのクロスブロック再構成に基づくPTQ手法CBQを提案する。
CBQはリコンストラクションスキームを使用してクロスブロック依存関係を採用し、エラーの蓄積を最小限に抑えるために複数のブロックにまたがる長距離依存関係を確立する。
論文 参考訳(メタデータ) (2023-12-13T07:56:27Z) - BiTAT: Neural Network Binarization with Task-dependent Aggregated
Transformation [116.26521375592759]
量子化は、与えられたニューラルネットワークの高精度ウェイトとアクティベーションを、メモリ使用量と計算量を減らすために、低精度ウェイト/アクティベーションに変換することを目的としている。
コンパクトに設計されたバックボーンアーキテクチャの極端量子化(1ビットの重み/1ビットのアクティベーション)は、深刻な性能劣化をもたらす。
本稿では,性能劣化を効果的に緩和する新しいQAT法を提案する。
論文 参考訳(メタデータ) (2022-07-04T13:25:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。