論文の概要: PALS: Percentile-Aware Layerwise Sparsity for LLM Pruning
- arxiv url: http://arxiv.org/abs/2607.07557v1
- Date: Wed, 08 Jul 2026 15:51:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.448761
- Title: PALS: Percentile-Aware Layerwise Sparsity for LLM Pruning
- Title(参考訳): PALS: LLMのパーセンタイル・アウェア・レイヤワイズ・スパシティ
- Authors: Yazdan Jamshidi, Alexey Shvets,
- Abstract要約: Wanda や SparseGPT のようなワンショットプルーニング法は、変圧器のすべての層に同じ間隔比を適用し、既知の層の重要性の変動を無視している。
本研究では, 活性化度99分の1の値に基づいて, 層間間隔を調整したPALSを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: One-shot pruning methods like Wanda and SparseGPT apply the same sparsity ratio to every layer of a transformer, ignoring known variation in layer importance. We propose PALS (Percentile-Aware Layerwise Sparsity), which adjusts per-layer sparsity based on the 99th percentile of activation magnitudes, bounded to $\pm 5\%$ around the target ratio. On LLaMA-2-7B at 50\% sparsity, PALS achieves 10.96 WikiText-2 perplexity versus 12.92 for uniform Wanda (mean over 9 runs, $p < 0.001$). The benefit is architecture-dependent: LLaMA-3-8B shows marginal gains and Mistral-7B shows none. We also find that gradient-based allocation -- the seemingly more principled approach -- produces results worse than random, suggesting that gradient magnitude does not predict the impact of discrete weight removal. PALS adds negligible cost to the pruning pipeline and requires no fine-tuning.
- Abstract(参考訳): WandaやSparseGPTのようなワンショットプルーニング法は、トランスのすべての層に同じ間隔比を適用し、既知の層の重要性の変動を無視している。
活性化度99分の1の度合いに基づいて層ごとの間隔を調整し,目標比あたりの$\pm 5\%$に制限するPALS(Percentile-Aware Layerwise Sparsity)を提案する。
LLaMA-2-7B では 50 % の間隔で、PALS は 10.96 WikiText-2 のパープレキシティを達成したが、均一な Wanda では 12.92 である(平均 9 回以上、$p < 0.001$)。
LLaMA-3-8Bは限界ゲインを示し、Mistral-7Bはノーである。
また、勾配に基づくアロケーションは、明らかにより原理化されたアプローチであり、ランダムよりも結果が悪く、勾配のマグニチュードが離散的な重量除去の影響を予測しないことが示唆されている。
PALSはプルーニングパイプラインに無視可能なコストを追加し、微調整を必要としない。
関連論文リスト
- ZEBRA: Zero-shot Budgeted Resource Allocation for LLM Orchestration [8.226365534099399]
連続非線形クナップサック問題に対する多相予算割当を低減するフレームワークであるZEBRAを提案する。
150ドルのAPPS符号化ベンチマークでは、ZEBRAの2つの変種は全ての集計基準においてLLM-directよりも優れていた。
我々は,自律型マルチエージェントシステムの経済行動を改善するために,推論時の軽量なアルゴリズムガイダンスを提案する。
論文 参考訳(メタデータ) (2026-05-19T20:50:05Z) - Determining Layer-wise Sparsity for Large Language Models Through a Theoretical Perspective [55.90119819642064]
本稿では,大規模言語モデル (LLM) の階層的疎度率を理論的観点から決定する上での課題に対処する。
これは、スペーサー化プロセス全体での再構成エラーの累積効果を指す。
この問題を緩和するレイヤワイド・スパシティ・アロケーションに対する、シンプルで効果的なアプローチを導出します。
論文 参考訳(メタデータ) (2025-02-20T17:51:10Z) - Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High Sparsity [88.62935593360162]
大規模言語モデル(LLM)は、様々な領域にわたる顕著なパフォーマンスで有名である。
本研究では,不均一層幅比の調整を施した新しいLCMプルーニング手法について紹介する。
OWL は、最先端の Wanda と SparseGPT を 61.22 で上回り、6.80 パープレキシティを 70% で上回っている。
論文 参考訳(メタデータ) (2023-10-08T14:22:58Z) - LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning [56.88751562302793]
低ランク適応 (LoRA) が大型言語モデル (LLM) に登場した。
LoRAPruneは、高度にメモリ効率の良い正確な構造化プルーンドモデルを提供する新しいフレームワークである。
LoRAPruneはWikiText2では4.81、TBでは3.46、メモリ使用量は52.6%減少している。
論文 参考訳(メタデータ) (2023-05-28T15:15:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。