論文の概要: ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads
- arxiv url: http://arxiv.org/abs/2608.02703v1
- Date: Mon, 03 Aug 2026 14:40:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.903674
- Title: ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads
- Title(参考訳): ARCHead: 大規模言語モデル出力ヘッドのアクティベーション・メトリック残差補正
- Abstract要約: ARCHeadは、量子化された低ランクのコア、グループワイドのINT4残基、およびアクティベーション由来のメートル法に適合した低ランクの補正を組み合わせたLMヘッド圧縮機である。
密度の高いBF16ヘッドを格納せず、持続的なLMヘッドストレージを3.7-3.9倍削減する。
- 参考スコア(独自算出の注目度): 1.6385815610837167
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Weight-only quantization substantially reduces the storage of large language model (LLM) transformer blocks, but practical backends often retain the final language-modeling head (LM-head) in BF16 or FP16. Quantizing this projection naively can strongly perturb the vocabulary-logit distribution. We present ARCHead, a packed LM-head compressor that combines a quantized low-rank core, group-wise INT4 residuals, and a low-rank correction fitted in an activation-derived metric. ARCHead stores no dense BF16 head and reduces persistent LM-head storage by 3.7-3.9x. On Qwen3-8B-Base, it uses 25.6% of BF16 head storage while attaining 1.007 relative perplexity; storage-matched naive INT4 yields 1.14-1.16. Replacing the BF16 head left by AWQ or bitsandbytes adds only 0.006-0.007 cross-entropy, with less than 2% throughput change in our measurements. ARCHead therefore complements block quantizers by compressing the large output projection they can leave untouched. Code is available at https://github.com/suayptalha/archead.
- Abstract(参考訳): 重みのみの量子化は、大きな言語モデル(LLM)トランスフォーマーブロックの保存を大幅に削減するが、実用的なバックエンドはBF16やFP16の最終的な言語モデリングヘッド(LMヘッド)を保持することが多い。
この射影の量子化は語彙-論理分布を強く摂動させることができる。
本稿では,量子化低ランクコア,グループワイドINT4残差,およびアクティベーション法に基づく低ランク補正を組み合わせたLMヘッド圧縮機ARCHeadを提案する。
ARCHeadは密度の高いBF16ヘッドを格納せず、持続的なLMヘッドストレージを3.7-3.9倍削減する。
Qwen3-8Bベースでは、BF16ヘッドストレージの25.6%を使用し、1.007パープレキシティを実現している。
AWQやbitsandbytesが残したBF16ヘッドをリプレースすると、クロスエントロピーは0.006-0.007となり、スループットは2%以下になった。
したがってARCHeadはブロック量子化器を補完し、未接触で残せる大きな出力プロジェクションを圧縮する。
コードはhttps://github.com/suayptalha/archead.comから入手できる。
関連論文リスト
- What Makes an Efficient VLA? Navigating Action-Head Design, Scaling, and Latency [49.22866294900869]
Vision-Language-Action (VLA)モデルは、事前訓練されたビジョンエンコーダ、言語バックボーン、アクションヘッドを組み合わせたモデルである。
バックボーンファミリ(SigLIP2とQwen2.5)とトレーニングパイプライン、アクションヘッド設計とモジュールスケールを修正し、各構成をデバイス上のレイテンシの測定値とペアリングする。
論文 参考訳(メタデータ) (2026-09-12T14:55:15Z) - UE5M3 FP4 Block Scaling for Stable Language Model Pretraining [6.963061311516306]
NVIDIAのTransformer Engine nvレシピを使用して、約190億トークンのモデルを事前トレーニングします。
Transformer Engine nvと比較して、提案したブロック16レシピは、最終ウィンドウのトレーニング損失が低く、各量子化推論ポリシーの下で、保持された負のログライクな状態として測定された検証損失が低い。
RHTとBF16の最終ブロック免除を共同で除去するネイティブなnv実行アブレーションは、測定されたモデルボディトークンのスループットを21.2%向上させる。
論文 参考訳(メタデータ) (2026-09-02T17:32:07Z) - Variable Bit-width Quantization: Learning Per-Group Precision for "Bigger-but-Smaller" Language Models [0.0]
可変ビット幅量子化(VBQ)を導入する。
64重みの連続した群が1,2,4,8ビットから独自の分解能を学習する訓練時間法である。
バイト単位の品質では、VBQはFP16よりも3.9-8.4倍効率が高い。
論文 参考訳(メタデータ) (2026-07-03T02:42:04Z) - DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers [3.0583214514538084]
Diffusion Transformer (DiTs) は最先端の画像生成品質を実現するが、推論時にかなりのメモリと計算コストを発生させる。
平滑化法、混合精度法、回転法、低ランク残差法などの既存の手法は、この問題を部分的に緩和するが、それでもFP16/BF16の性能に顕著なギャップを残している。
本稿では、回転認識型アクティベーション量子化による劣化を緩和するW4A4 PTQフレームワークであるDiRotQを紹介する。
論文 参考訳(メタデータ) (2026-05-16T00:52:00Z) - LAQuant: A Simple Overhead-free Large Reasoning Model Quantization by Layer-wise Lookahead Loss [8.481133435038839]
大規模な推論モデルは、長い自己回帰復号によって競合レベルの数学と符号化精度に達する。
ウェイト量子化はアクセラレーションの標準ツールであるが、長復号推論ベンチマークでは、代表的なレシピが正確さを失う。
そこで我々はLookAhead Quantization (LAQuant) を提案する。
論文 参考訳(メタデータ) (2026-05-09T07:35:38Z) - FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression [5.385515135626162]
FASQ(Flexible Accelerated Subspace Quantization)は,大規模言語モデルに製品量化を適用するキャリブレーションフリーフレームワークである。
Meta-Llama-3-8Bでは、FASQは4ビット GPTQ と AWQ の精度(67-42%モデルサイズ)を37-42%モデルサイズで上回っている。
論文 参考訳(メタデータ) (2026-04-22T20:03:36Z) - DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression [56.68267606568949]
DiT-ICは画像圧縮用アライメント拡散変換器である。
U-NetをDiffusion Transformerに置き換え、32倍のダウンスケール解像度で遅延空間での拡散を可能にする。
16GBのラップトップGPUで2048x2048画像を再構成できる。
論文 参考訳(メタデータ) (2026-03-13T16:56:00Z) - HAS-VQ: Hessian-Adaptive Sparse Vector Quantization for High-Fidelity LLM Compression [0.0]
HAS-VQ (Hessian-Adaptive Sparse Vec-tor Quantization) は,高感度のアウトレーヤをバルク重量分布から厳密に分離する圧縮フレームワークである。
我々は, SmolLM2-1.7B上のHAS-VQを評価し, 2つの異なる優越性を証明した。
論文 参考訳(メタデータ) (2026-01-11T15:35:10Z) - HeadInfer: Memory-Efficient LLM Inference by Head-wise Offloading [79.38548165722229]
HEADINFERはKVキャッシュをCPURAMにオフロードするが、GPU上のトランスフォーマー層のKVキャッシュを完全に保存する必要はない。
HEADINFERはメモリフットプリントを大幅に削減し,計算効率を向上することを示した。
論文 参考訳(メタデータ) (2025-02-18T06:26:05Z) - SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models [61.474101404805545]
拡散モデルは高品質なイメージを生成することができるが、スケールするにつれて、メモリ要求が増加し、より高いレイテンシがデプロイメント上の課題を引き起こす。
この制限を克服する新しい4ビット量子化パラダイムであるSVDQuantを提案する。
We reduce the memory usage for the 12B FLUX.1 models by 3.5$times$, achieved 3.0$times$ speedup over the 4-bit weight-only Quantization (W4A16) baseline。
論文 参考訳(メタデータ) (2024-11-07T18:59:58Z) - HiRE: High Recall Approximate Top-$k$ Estimation for Efficient LLM
Inference [68.59839755875252]
HiREは2つの新しいコンポーネントから構成される: (i) (i) (i) (i) (i) (i) (i) (i) (i) (i) (ii) DA-TOP-$k$: 効率的なマルチデバイス近似トップ-k$演算子) (i) (i) (i) (i) (i) (i) (i) DA-TOP-$k$演算子) 。
我々は、10億のパラメータモデルにおいて、HiREがソフトマックスとフィードフォワード層の両方に適用され、ほぼ一致した事前学習と下流の精度を実現し、1台のTPUv5eデバイスで1.47Times$の推論遅延を高速化することを示した。
論文 参考訳(メタデータ) (2024-02-14T18:04:36Z) - Outlier Suppression: Pushing the Limit of Low-bit Transformer Language
Models [57.933500846742234]
最近の研究は、構造化された外れ値が量子化性能の重要なボトルネックであることを認識している。
本稿では,Gamma Migration と Token-Wise Clipping の2つのコンポーネントを含む外部抑制フレームワークを提案する。
このフレームワークは、アウトレイラを効果的に抑制し、プラグアンドプレイモードで使用することができる。
論文 参考訳(メタデータ) (2022-09-27T12:05:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。