論文の概要: GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models
- arxiv url: http://arxiv.org/abs/2604.19398v1
- Date: Tue, 21 Apr 2026 12:26:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-22 22:41:49.760507
- Title: GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models
- Title(参考訳): GRASPrune:大規模言語モデルの予算構造解析のためのグローバルゲーティング
- Authors: Ziyang Wang, Jiangfeng Xiao, Chuan Xiao, Ruoxiang Li, Rui Mao, Jianbin Qin,
- Abstract要約: 大規模言語モデル(LLM)は、モデルパラメータ、注意計算、KVキャッシュがかなりのメモリとレイテンシのコストを課しているため、費用がかかる。
GRASPruneは、FFNチャネルとKVヘッドグループを1つのグローバル予算の下で共同でプーンする事前訓練後に適用される構造化プルーニングフレームワークである。
LLaMA-2-7Bでは、GRASPruneはパラメータの50%を除去し、WikiText-2では12.18パープレクシリティを達成した。
- 参考スコア(独自算出の注目度): 17.662767323550135
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are expensive to serve because model parameters, attention computation, and KV caches impose substantial memory and latency costs. We present GRASPrune, a structured pruning framework applied after pretraining that jointly prunes FFN channels and KV head groups under a single global budget. Instead of learning importance scores without constraints and applying the budget only after training, GRASPrune learns lightweight gate scores with a projected straight-through estimator that enforces a hard mask satisfying the budget at every step while keeping the backbone weights frozen. After the mask is fixed, we calibrate scaling factors on the retained units to mitigate scale mismatch caused by pruning, and fold these factors into the pruned weights to obtain a smaller dense checkpoint with no extra parameters at inference. On LLaMA-2-7B, GRASPrune removes 50% of parameters and achieves 12.18 perplexity on WikiText-2 while maintaining competitive average zero-shot accuracy on five benchmarks, using four epochs on 512 unlabeled calibration sequences on a single NVIDIA A100 80GB GPU without any full model fine-tuning.
- Abstract(参考訳): 大規模言語モデル(LLM)は、モデルパラメータ、注意計算、KVキャッシュがかなりのメモリとレイテンシのコストを課しているため、費用がかかる。
GRASPruneは、FFNチャネルとKVヘッドグループを1つのグローバル予算の下で共同でプーンする事前訓練後に適用される構造化プルーニングフレームワークである。
GRASPruneは、制約なしで重要なスコアを学習し、トレーニング後にのみ予算を適用する代わりに、背骨の重量を凍結させながら、各ステップで予算を満たすハードマスクを強制する投影されたストレートスルー推定器で軽量ゲートスコアを学習する。
マスクを固定した後、保持ユニットのスケーリング因子を校正し、プルーニングによるスケールミスマッチを緩和し、これらの因子をプルーニング重みに折り畳み、推論時に余分なパラメータを含まないより小さな密度のチェックポイントを得る。
LLaMA-2-7Bでは、GRASPruneはパラメータの50%を除去し、WikiText-2で12.18パープレキシティを達成し、5つのベンチマークで競合平均ゼロショットの精度を維持し、完全なモデルを微調整することなく1つのNVIDIA A100 80GB GPU上の512の未ラベルキャリブレーションシーケンス上の4つのエポックを使用する。
関連論文リスト
- One-for-All: A Lightweight Stabilized and Parameter-Efficient Pre-trained LLM for Time Series Forecasting [4.364999214109123]
One-for-Allは、時系列分析のためにトレーニング済みの大規模言語モデルを適用するためのフレームワークである。
rsLoRAは、低いランクでの証明可能な勾配安定性を可能にする数学的に基底的なランク安定化機構を導入している。
One-for-Allは最先端の効率と精度のトレードオフを達成する。
論文 参考訳(メタデータ) (2026-03-31T13:54:43Z) - CORP: Closed-Form One-shot Representation-Preserving Structured Pruning for Vision Transformers [2.4851388650413866]
ビジョン変換器は高い精度を実現するが、高い計算とメモリコストを発生させる。
我々は、視覚変換器のためのクローズドフォームワンショット構造化プルーニングフレームワーク、textbfCORPを提案する。
論文 参考訳(メタデータ) (2026-02-05T03:03:17Z) - ECO: Quantized Training without Full-Precision Master Weights [58.97082407934466]
Error-Compensating (ECO)は、量子化されたパラメータに直接更新を適用することで、マスターウェイトを除去する。
ECO は最適値の定数半径近傍に収束するが、素早いマスターウェイト除去は学習率に逆比例する誤差を生じさせる。
論文 参考訳(メタデータ) (2026-01-29T18:35:01Z) - Kernelized Sparse Fine-Tuning with Bi-level Parameter Competition for Vision Models [80.50996301430108]
スパースチューニングは、下流タスクに最も関係のある重みだけを調整することで、顕著なパフォーマンスを達成する。
上述の制限を克服する一段法SNELLAを提案する。
SNELLAは低メモリ使用量でSOTA性能を達成する。
論文 参考訳(メタデータ) (2025-10-28T03:39:18Z) - DenoiseRotator: Enhance Pruning Robustness for LLMs via Importance Concentration [40.24224178891866]
プルーニングは、重要でない重みを取り除き、大きな言語モデル(LLM)を圧縮するのに広く用いられる技法である。
既存のプルーニング手法は主に、個々の重みの重要さを推定することに焦点を当てており、モデルの重要な能力を維持する能力を制限する。
プルーの重みを単に選択するのではなく、パラメータの重要度を再分配して、モデルがプルーニングに本質的に適するようにする、という新しい視点を提案する。
論文 参考訳(メタデータ) (2025-05-29T03:44:09Z) - Steering LLM Reasoning Through Bias-Only Adaptation [12.246105935814683]
基本重みの全てを凍結しながら、強化学習による1層あたりの1d$次元ステアリングベクトルのトレーニングは、数学的推論タスクにおいて完全にRLで調整された推論モデルの精度と一致することを示す。
論文 参考訳(メタデータ) (2025-05-24T13:55:38Z) - Tangent Model Composition for Ensembling and Continual Fine-tuning [69.92177580782929]
タンジェントモデル合成(Tangent Model composition, TMC)は、事前訓練された点を中心に微調整されたコンポーネントモデルを独立に結合する手法である。
TMCの精度は4.2%向上し、非線形微調整モデルの精度は4.2%向上した。
論文 参考訳(メタデータ) (2023-07-16T17:45:33Z) - LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning [56.88751562302793]
低ランク適応 (LoRA) が大型言語モデル (LLM) に登場した。
LoRAPruneは、高度にメモリ効率の良い正確な構造化プルーンドモデルを提供する新しいフレームワークである。
LoRAPruneはWikiText2では4.81、TBでは3.46、メモリ使用量は52.6%減少している。
論文 参考訳(メタデータ) (2023-05-28T15:15:48Z) - Gradient-Free Structured Pruning with Unlabeled Data [57.999191898036706]
ラベルのないデータのみを使用する勾配のない構造化プルーニングフレームワークを提案する。
元々のFLOPカウントの最大40%は、考慮されたすべてのタスクで4%未満の精度で削減できる。
論文 参考訳(メタデータ) (2023-03-07T19:12:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。