論文の概要: Forward-Free LLM Depth Pruning via Weight Redundancy
- arxiv url: http://arxiv.org/abs/2609.09883v1
- Date: Wed, 09 Sep 2026 08:38:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.954153
- Title: Forward-Free LLM Depth Pruning via Weight Redundancy
- Title(参考訳): 軽量冗長性による前向きLLM深絞り加工
- Abstract要約: Depth pruningは、完全なTransformerブロックを削除することで、大きな言語モデル(LLM)推論コストを低減する。
Weight-Redundancy Pruning (WRP) は,チェックポイント重みから選択ブロックまでの層間冗長度を推定する,フォワードフリーなディープ・プルーニング手法である。
WRPは、既存のフォワードフリー・マグニチュード・プルーニングを一貫して上回り、アクティベーションベースの手法の性能にアプローチする。
- 参考スコア(独自算出の注目度): 0.08594140167290099
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Depth pruning reduces large language model (LLM) inference cost by removing complete Transformer blocks. Activation-based methods collect hidden states through forward passes on calibration data, while existing forward-free methods score each Transformer block separately without measuring similarity between blocks. We propose Weight-Redundancy Pruning (WRP), a forward-free depth-pruning method that estimates inter-layer redundancy from checkpoint weights to select blocks without calibration data or model forward passes. WRP compares attention output and MLP down-projection weights across layers and combines their pairwise similarities with relative projection-scale information. The resulting all-pairs similarity matrix guides layer grouping and block selection. Across multiple pruning settings, model families, and downstream tasks, WRP consistently outperforms existing forward-free magnitude pruning and approaches the performance of activation-based methods.
- Abstract(参考訳): Depth pruningは、完全なTransformerブロックを削除することで、大きな言語モデル(LLM)推論コストを低減する。
アクティベーションベースのメソッドは、キャリブレーションデータによるフォワードパスを通じて隠された状態を収集するが、既存のフォワードフリーメソッドはブロック間の類似性を測定することなく、各トランスフォーマーブロックを別々にスコアする。
Weight-Redundancy Pruning (WRP) は,チェックポイント重みから選択ブロックへの層間冗長度をキャリブレーションデータやモデルフォワードパスなしで推定する,フォワードフリーのDeep-Pruning法である。
WRPは、層間における注意出力とMLP下降重みを比較し、それらのペアワイズ類似度と相対射影スケール情報を組み合わせる。
結果として得られる全対類似性行列は、層のグループ化とブロック選択を導く。
複数のプルーニング設定、モデルファミリ、下流タスクにまたがって、WRPは既存のフォワードフリーグレードプルーニングを一貫して上回り、アクティベーションベースのメソッドのパフォーマンスにアプローチする。
関連論文リスト
- SHIFT-LLM: Distribution Shift Correction in Depth-Pruned LLMs [18.494055578192015]
本稿では,各プルーニングサイトに線形残差アダプタを挿入するトレーニング不要なポストプルーニング修正フレームワークShift-LLMを紹介する。
各LRAは元の残基の同一性経路を保持し、軽量なアフィン残基補正を追加する。
5つのモデルファミリ,6つの層選択基準,および7つのゼロショットベンチマーク実験により,ShiFT-LLMは深絞りによって失われる精度を常に回復することを示した。
論文 参考訳(メタデータ) (2026-08-25T19:01:58Z) - Dual Attention Residuals [34.183227979638595]
本稿では,歴史的検索にマルチストリームインタラクションをもたらすデュアルアテンション残差を提案する。
各ターゲットストリームに対して、DARは反対ストリームの正規化状態からの深さ重みを計算し、ターゲットストリーム自身の履歴から値に適用する。
DARは、標準の残差トランスフォーマーとアテンション残差に対するバリデーション損失を継続的に改善する。
論文 参考訳(メタデータ) (2026-07-21T05:42:55Z) - Exploring the Design Space of Reward Backpropagation for Flow Matching [47.80328464705813]
FlowBPは、後方軌道自体をデザインオブジェクトとして扱う統一的なサロゲート・トラジェクトリフレームワークである。
FlowBP-Sparse、FlowBP-Bridge、FlowBP-Lagrangeの3つの変種をインスタンス化する。
アクティブセットサイズと制限勾配連鎖による3つの有界メモリは、少なくとも1つのジャコビアン因子に連鎖する。
論文 参考訳(メタデータ) (2026-06-09T16:36:54Z) - Attention Residuals [38.59138244826294]
PreNorm との残余接続は現代の LLM では標準的なものであるが、固定単位重み付きで全ての層出力を蓄積する。
本稿では,アテンション残余(AttnRes)を提案する。
論文 参考訳(メタデータ) (2026-03-16T09:32:21Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - Distilling to Hybrid Attention Models via KL-Guided Layer Selection [66.06591032073744]
本稿では,テキストデータに対する少量のトレーニングから得られた重要度スコアを用いた,簡易かつ効率的な層選択法について述べる。
この手法は, 固定比に基づいて線形注意を均一に解き出す手法を含む, 従来の層選択手法よりも有効であることがわかった。
論文 参考訳(メタデータ) (2025-12-23T18:12:22Z) - MLPMoE: Zero-Shot Architectural Metamorphosis of Dense LLM MLPs into Static Mixture-of-Experts [0.0]
大規模言語モデル(LLM)は、主に高密度トランスフォーマーとしてデプロイされ、すべてのトークンに対してフィードフォワードブロック内の全てのパラメータがアクティブになる。
MoEfication、CMoE、ToMoE、MoOREといった最近のアップサイクリング手法は、高密度フィードフォワードネットワーク内の疎小で半モジュラーなサブ構造に有用な計算の大部分が存在していることを明らかにしている。
本稿では,高密度の変圧器ブロックを静的な高心性混合体に再構成する学習自由変換であるMoE(MLP-Experts)を紹介する。
論文 参考訳(メタデータ) (2025-11-26T06:14:26Z) - MultiPruner: Balanced Structure Removal in Foundation Models [1.8434042562191815]
近年,大規模な事前学習モデル (LPM) を刈り取るための最先端手法として,トランスフォーマーにおける非臨界残留ブロックの非臨界除去がモデルサイズ削減に有効であることを実証している。
我々はBlockPrunerを拡張し、MultiPrunerを提案する。
論文 参考訳(メタデータ) (2025-01-17T04:24:31Z) - Semi-Supervised Coupled Thin-Plate Spline Model for Rotation Correction and Beyond [84.56978780892783]
制御点が限られている複数のTPSを、より柔軟で強力な変換に繰り返し結合するCoupledTPSを提案する。
注記コストを考慮に入れた半教師付き学習手法を開発し、ラベルのないデータを活用することにより、ワープ品質を向上させる。
実験は、回転補正のための既存の最先端解よりもCoupledTPSの優位性と普遍性を示す。
論文 参考訳(メタデータ) (2024-01-24T13:03:28Z) - CBQ: Cross-Block Quantization for Large Language Models [66.82132832702895]
ポストトレーニング量子化(PTQ)は、超低コストで大規模言語モデル(LLM)を圧縮する上で重要な役割を果たしている。
LLMのためのクロスブロック再構成に基づくPTQ手法CBQを提案する。
CBQはリコンストラクションスキームを使用してクロスブロック依存関係を採用し、エラーの蓄積を最小限に抑えるために複数のブロックにまたがる長距離依存関係を確立する。
論文 参考訳(メタデータ) (2023-12-13T07:56:27Z) - Attentional-Biased Stochastic Gradient Descent [74.49926199036481]
深層学習におけるデータ不均衡やラベルノイズ問題に対処するための証明可能な手法(ABSGD)を提案する。
本手法は運動量SGDの簡易な修正であり,各試料に個別の重み付けを行う。
ABSGDは追加コストなしで他の堅牢な損失と組み合わせられるほど柔軟である。
論文 参考訳(メタデータ) (2020-12-13T03:41:52Z) - Progressively Guided Alternate Refinement Network for RGB-D Salient
Object Detection [63.18846475183332]
我々は,RGB-Dの高次物体検出のための効率的かつコンパクトなディープネットワークを開発することを目指している。
そこで本研究では,改良のための改良ネットワークを提案する。
我々のモデルは、既存の最先端のアプローチよりも大きなマージンで優れています。
論文 参考訳(メタデータ) (2020-08-17T02:55:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。