論文の概要: Resource-Efficient Pruning for Transformer via Low-Rank Importance Estimation
- arxiv url: http://arxiv.org/abs/2608.24973v1
- Date: Tue, 25 Aug 2026 11:36:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.326778
- Title: Resource-Efficient Pruning for Transformer via Low-Rank Importance Estimation
- Title(参考訳): 低ランク重要性推定による変圧器の資源効率向上
- Abstract要約: REP-LIEは、微調整の過程で資源効率の高い刈り取りを可能にする新しいアプローチである。
重要度推定における固有のランダム性に対処するため、安定性スコアを導入する。
中規模エンコーダモデルと大規模生成モデル(LLaMA-7BとMistral-7B)の両方の実験は、REP-LIEが既存のアプローチと比較して競争性能を保っていることを示した。
- 参考スコア(独自算出の注目度): 20.409069904706346
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the rapid development of large-scale pre-trained language models based on Transformer architectures, their high computational and memory costs have become a major obstacle to deployment, especially in resource-constrained environments. Traditional pruning methods typically depend on full gradient-based importance estimation, and they necessitate prior finetuning of the model to achieve satisfactory performance. This process often results in intolerable resource consumption. This paper proposes REP-LIE, a new approach to enable resource-efficient pruning during the process of finetuning. REP-LIE leverages the gradients of LoRA low-rank matrices to estimate the importance of weights without requiring full gradient computation. To address the inherent randomness in importance estimation, a stability score is introduced, serving as the basis for iterative pruning of unimportant model parameters. The pruned model is further finetuned through lightweight updates, eliminating the need for full-parameter optimization in the process of finetuning. Extensive experiments on both medium-scale encoder models and large-scale generative models (LLaMA-7B and Mistral-7B) demonstrate that REP-LIE still achieves competitive performance compared to existing approaches.
- Abstract(参考訳): Transformerアーキテクチャに基づく大規模事前学習言語モデルの急速な開発により、特に資源制約のある環境では、高い計算とメモリコストがデプロイメントの大きな障害となっている。
従来のプルーニング法は通常、完全な勾配に基づく重要度推定に依存しており、良好な性能を達成するためには、モデルの事前微調整が必要である。
このプロセスは、しばしば耐え難い資源消費をもたらす。
本稿では,細粒化過程における資源効率向上のための新しい手法であるREP-LIEを提案する。
REP-LIEは、LoRA低ランク行列の勾配を利用して、全勾配計算を必要とせずに重みの重要性を推定する。
重要度推定における固有のランダム性に対処するため、不安定なモデルパラメータの反復的プルーニングの基礎となる安定性スコアが導入された。
プルーンドモデルは、軽量な更新によってさらに微調整され、微調整の過程でフルパラメータ最適化が不要になる。
中規模エンコーダモデルと大規模生成モデル(LLaMA-7BとMistral-7B)の双方に対する大規模な実験は、REP-LIEが既存のアプローチと比較して競争性能を保っていることを示した。
関連論文リスト
- Low-Rank Adaptation Redux for Large Models [41.28925127311434]
低ランク適応(LoRA)は、基礎モデルのパラメータ効率微調整(PEFT)のデファクトスタンダードとして登場した。
実証的な成功と変種の普及にもかかわらず、どのアーキテクチャの選択や最適化手法、デプロイの制約が実用的な方法の選択を導くべきかは、いまだ解明されていない。
この概要は、信号処理(SP)のレンズを通してLoRAを再検討し、古典的な低ランクモデリングツールと逆問題で近代的なアダプタ設計をブリッジする。
論文 参考訳(メタデータ) (2026-04-23T17:50:23Z) - High-Rank Structured Modulation for Parameter-Efficient Fine-Tuning [57.85676271833619]
低ランク適応 (LoRA) は、全パラメータの微調整をシミュレートするために低ランク更新法を用いる。
textbfStructured textbfMOdulation textbfAdapterは、より高いランクを維持しながらトレーニング可能なパラメータを少なくする。
論文 参考訳(メタデータ) (2026-01-12T13:06:17Z) - LARGO: Low-Rank Regulated Gradient Projection for Robust Parameter Efficient Fine-Tuning [39.56217775141507]
Low-rAnk Regulated Gradient Projection (LARGO)アルゴリズムは、動的制約を低ランク適応法に統合する。
LARGOは、ドメイン内および配布外のシナリオで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-06-14T08:19:11Z) - Reward-Guided Speculative Decoding for Efficient LLM Reasoning [80.55186052123196]
Reward-Guided Speculative Decoding (RSD)は,大規模言語モデル(LLM)における推論の効率向上を目的とした新しいフレームワークである。
RSDは、厳密な偏りを強制する既存の投機的復号法とは対照的に、制御されたバイアスをハイリワード出力の優先順位付けに取り入れている。
RSDは,対象モデルのみでの復号化に対して,高い効率向上を実現し,並列復号法よりも高い精度を実現している。
論文 参考訳(メタデータ) (2025-01-31T17:19:57Z) - QPruner: Probabilistic Decision Quantization for Structured Pruning in Large Language Models [3.093903491123962]
大規模言語モデル(LLM)は、様々な自然言語処理(NLP)タスクを大幅に進歩させた。
構造化プルーニングはモデルサイズの削減に有効な手法であるが、しばしば精度を著しく低下させる。
我々は、微調整と推論の両方でメモリ消費を減らすために、構造化プルーニングフレームワークに量子化を導入する。
モデルサイズの削減に構造化プルーニングを用いた新しいフレームワークQPrunerを提案する。
論文 参考訳(メタデータ) (2024-12-16T10:14:01Z) - Optimizing Sequential Recommendation Models with Scaling Laws and Approximate Entropy [104.48511402784763]
SRモデルの性能法則は,モデルの性能とデータ品質の関係を理論的に調査し,モデル化することを目的としている。
データ品質を評価するために、従来のデータ量メトリクスと比較して、より曖昧なアプローチを示すために、近似エントロピー(ApEn)を提案する。
論文 参考訳(メタデータ) (2024-11-30T10:56:30Z) - SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation [52.6922833948127]
本研究では,事前学習した拡散モデルにおけるパラメータの重要性について検討する。
本稿では,これらの非効率パラメータをフル活用するための新しいモデル微調整法を提案する。
本手法は,下流アプリケーションにおける事前学習モデルの生成能力を向上する。
論文 参考訳(メタデータ) (2024-09-10T16:44:47Z) - Consensus-Adaptive RANSAC [104.87576373187426]
本稿では,パラメータ空間の探索を学習する新しいRANSACフレームワークを提案する。
注意機構は、ポイント・ツー・モデル残差のバッチで動作し、軽量のワンステップ・トランスフォーマーで見いだされたコンセンサスを考慮するために、ポイント・ツー・モデル推定状態を更新する。
論文 参考訳(メタデータ) (2023-07-26T08:25:46Z) - Extrapolation for Large-batch Training in Deep Learning [72.61259487233214]
我々は、バリエーションのホストが、我々が提案する統一されたフレームワークでカバー可能であることを示す。
本稿では,この手法の収束性を証明し,ResNet,LSTM,Transformer上での経験的性能を厳格に評価する。
論文 参考訳(メタデータ) (2020-06-10T08:22:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。