論文の概要: From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression
- arxiv url: http://arxiv.org/abs/2606.02559v1
- Date: Mon, 01 Jun 2026 17:52:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:32.557469
- Title: From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression
- Title(参考訳): 層から部分加群へ:置換型LLM圧縮における粒度の再考
- Abstract要約: LLM(Large Language Models)のトレーニング後の圧縮は、アーキテクチャコンポーネント全体を削除します。
サブモジュールレベルでLLMを圧縮するSubFitを導入する。
評価されたスパーシリティレベル全体で最高の集合パープレキシティ-精度トレードオフを達成する。
- 参考スコア(独自算出の注目度): 6.667596224057802
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training compression of Large Language Models (LLMs) removes entire architectural components, either deleting them or replacing them with fitted modules. Existing replacement-based methods share two design constraints: full-layer granularity and contiguous selection. We argue that this is overly restrictive: in fact, redundancy in pretrained transformers is not confined to contiguous regions, nor does it evenly distribute between Attention and FeedForward outputs, implying that different strategies best approximate different submodule types and that removable components need not cluster within contiguous depth ranges. Based on this intuition, we introduce SubFit (Submodule-level Fitted residual replacement), which compresses LLMs at the submodule level: Attention and FeedForward submodules are selected non-contiguously, and each receives its own lightweight fitted residual bypass. SubFit operates post-training and requires only calibration data. Across ten LLMs (five base, five instruction-tuned), five sparsity levels from 12.5% to 37.5%, and four replacement-based baselines, SubFit achieves the best aggregate perplexity-accuracy trade-off across the evaluated sparsity levels, with larger gains under aggressive compression. At 25% sparsity, it retains 84.6% of dense downstream accuracy and incurs 2.42x perplexity degradation, against 81.6% and 4.34x for the strongest baselines, while delivering measurable inference speedup and KV-cache savings. Code is available at https://github.com/eliacunegatti/SubFit.
- Abstract(参考訳): LLM(Large Language Models)のトレーニング後の圧縮は、アーキテクチャコンポーネント全体を削除し、削除するか、モジュールに置き換える。
既存の置換法は、全層粒度と連続選択という2つの設計上の制約を共有している。
実際には、事前訓練されたトランスフォーマーの冗長性は連続した領域に限らず、注意とフィードフォワードの出力の間に均等に分散するわけでもなく、異なる戦略が異なるサブモジュールタイプに最も近いことを示唆し、除去可能なコンポーネントは連続した深さ範囲内でクラスタ化する必要がなくなる。
この直感に基づいて、サブモジュールレベルでLLMを圧縮するSubFit(submodule-level Fitted residual replacement)を導入します。
SubFitはトレーニング後に動作し、キャリブレーションデータのみを必要とする。
10個のLDM(5つのベース、5つの命令チューニング)、12.5%から37.5%までの5つのスパーシリティレベル、および4つの代替ベースライン、SubFitは評価されたスパーシティレベル全体で最高の集合パープレキシティ-精度トレードオフを達成し、アグレッシブな圧縮の下でより大きなゲインを得る。
25%の間隔で、密度の低い下流の精度の84.6%を保持し、2.42倍のパープレキシティ低下を発生させ、最強のベースラインでは81.6%と4.34倍、測定可能な推論スピードアップとKVキャッシュの節約をもたらす。
コードはhttps://github.com/eliacunegatti/SubFit.comで入手できる。
関連論文リスト
- Per-Matrix Optimality Is Not Enough: Three-Level Optimization for Low-Rank LLM Compression [8.890261387138215]
本稿では,各行列からトランスフォーマーブロックへ最適化範囲を広げる3レベルチェーンを提案する。
LLaMA-7Bの60%圧縮では、WikiText-2の難易度は42.1から19.1から11.4に減少する。
ブロックレベルのステージをスキップすると、オフラインの計算-データトレードオフが明らかになる。
論文 参考訳(メタデータ) (2026-09-14T16:36:46Z) - UE5M3 FP4 Block Scaling for Stable Language Model Pretraining [6.963061311516306]
NVIDIAのTransformer Engine nvレシピを使用して、約190億トークンのモデルを事前トレーニングします。
Transformer Engine nvと比較して、提案したブロック16レシピは、最終ウィンドウのトレーニング損失が低く、各量子化推論ポリシーの下で、保持された負のログライクな状態として測定された検証損失が低い。
RHTとBF16の最終ブロック免除を共同で除去するネイティブなnv実行アブレーションは、測定されたモデルボディトークンのスループットを21.2%向上させる。
論文 参考訳(メタデータ) (2026-09-02T17:32:07Z) - FourTune: Towards Fully 4-Bit Efficient Post-Training for Diffusion Models [50.66675248468456]
FourTuneは、エンドツーエンドのW4A4G4パラダイムに基づいた拡散モデルのための効率的な後トレーニングフレームワークである。
FourTuneはメモリオーバーヘッドを2.25$times$に減らし、エンドツーエンドのトレーニングスループットをBF16 LoRAと比較して2.27$times$にする。
論文 参考訳(メタデータ) (2026-07-07T00:34:30Z) - SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference [4.219937026460372]
SharQは、オンラインスパース-デンス分解による活性化空間とFP4量子化を橋渡しする。
スパースFP4 GEMMはバックボーンを処理し、密度の高いFP4 GEMMはマスク誘起活性化損失とスパースパス量子化誤差の両方を補償する。
論文 参考訳(メタデータ) (2026-06-25T04:19:04Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models [0.0]
Scaled Outer Productは、大規模言語モデルの重み付けのためのトレーニング後の量子化方法論である。
ハードウェア上では、層ごとのLUTデコードで4.5--6ビットでほぼロスレスの忠実さを提供する。
論文 参考訳(メタデータ) (2026-05-14T15:03:58Z) - RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization [5.0009109610311855]
ハイブリッドDPOを用いたRLearner-LLMを提案する。
RLearner-LLMはSFTよりも最大6倍NLI改善する。
Gemma 4 E4B-itでは、Hybrid-DPOは5つのドメインのうち4つのNLIを持ち上げる。
論文 参考訳(メタデータ) (2026-05-06T06:36:09Z) - ITQ3_S: High-Fidelity 3-bit LLM Inference via Interleaved Ternary Quantization with Rotation-Domain Smoothing [0.0]
我々は,TurboQuant(TQ)を統合したLLMのための新しい3ビット重み量子化フォーマットであるITQ3_S(Interleaved Ternary Quantization -- Specialized)を提案する。
従来の3ビット法では、重み付き重み分布とチャネル間外周による精度の低下が見られた。
ITQ3_Sは、量子化の前にFWHTを介して重み空間を前回転させ、ベクトルにエネルギーを分散させ、ガウス近傍の分布を誘導する。
論文 参考訳(メタデータ) (2026-03-30T00:03:22Z) - HAS-VQ: Hessian-Adaptive Sparse Vector Quantization for High-Fidelity LLM Compression [0.0]
HAS-VQ (Hessian-Adaptive Sparse Vec-tor Quantization) は,高感度のアウトレーヤをバルク重量分布から厳密に分離する圧縮フレームワークである。
我々は, SmolLM2-1.7B上のHAS-VQを評価し, 2つの異なる優越性を証明した。
論文 参考訳(メタデータ) (2026-01-11T15:35:10Z) - MLPMoE: Zero-Shot Architectural Metamorphosis of Dense LLM MLPs into Static Mixture-of-Experts [0.0]
大規模言語モデル(LLM)は、主に高密度トランスフォーマーとしてデプロイされ、すべてのトークンに対してフィードフォワードブロック内の全てのパラメータがアクティブになる。
MoEfication、CMoE、ToMoE、MoOREといった最近のアップサイクリング手法は、高密度フィードフォワードネットワーク内の疎小で半モジュラーなサブ構造に有用な計算の大部分が存在していることを明らかにしている。
本稿では,高密度の変圧器ブロックを静的な高心性混合体に再構成する学習自由変換であるMoE(MLP-Experts)を紹介する。
論文 参考訳(メタデータ) (2025-11-26T06:14:26Z) - SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models [61.474101404805545]
拡散モデルは高品質なイメージを生成することができるが、スケールするにつれて、メモリ要求が増加し、より高いレイテンシがデプロイメント上の課題を引き起こす。
この制限を克服する新しい4ビット量子化パラダイムであるSVDQuantを提案する。
We reduce the memory usage for the 12B FLUX.1 models by 3.5$times$, achieved 3.0$times$ speedup over the 4-bit weight-only Quantization (W4A16) baseline。
論文 参考訳(メタデータ) (2024-11-07T18:59:58Z) - MoDeGPT: Modular Decomposition for Large Language Model Compression [59.361006801465344]
本稿では,新しい構造化圧縮フレームワークである textbfModular bfDecomposition (MoDeGPT) を紹介する。
MoDeGPTはTransformerブロックを行列対からなるモジュールに分割し、隠れた次元を減らす。
本実験では, 後方伝播を伴わないMoDeGPTが, 従来の圧縮手法と一致するか, あるいは超えていることを示す。
論文 参考訳(メタデータ) (2024-08-19T01:30:14Z) - Mixture-of-Modules: Reinventing Transformers as Dynamic Assemblies of Modules [96.21649779507831]
そこで我々は,Mix-of-modules (MoM) と呼ばれる新しいアーキテクチャを提案する。
MoMは、任意の層がその位置に関係なくトークンを計算することができるという直感によって動機付けられている。
MoMはトランスフォーマーのための統一されたフレームワークを提供するだけでなく、冗長性を減らすための柔軟で学習可能なアプローチを提供する。
論文 参考訳(メタデータ) (2024-07-09T08:50:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。