論文の概要: Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMs
- arxiv url: http://arxiv.org/abs/2607.27591v1
- Date: Thu, 30 Jul 2026 02:20:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.3638
- Title: Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMs
- Title(参考訳): プロックス : LLMにおける近似中間チャネルサリエンスを介する無トレーニングFFN活性化空間
- Abstract要約: emphProxはスパースSwiGLU FFNのための2段階のトレーニングフリーフレームワークである。
最大1.99タイムのエンドツーエンドデコードスピードアップを70%FFN間隔で達成する。
- 参考スコア(独自算出の注目度): 10.608163494702614
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Feed-forward networks (FFNs) dominate memory traffic and computation in large language model (LLM) inference, making them a primary target for activation sparsification. However, existing training-free methods suffer substantial model-quality degradation at high sparsity due to limitations in their channel-selection strategies. We observe that the SwiGLU intermediate state provides a highly effective channel-selection signal, but obtaining it requires costly dense computation. To address this, we present \emph{Prox}, a two-stage training-free framework for sparse SwiGLU FFNs. Prox hinges on the key insight: sparse execution requires only the channel mask induced by the intermediate state, which can be constructed from the magnitude ranking of its entries rather than their exact values. Specifically, Stage 1 uses input sparsity and quantized proxy weights to construct a shared mask; Stage 2 computes the selected channels exactly, enabling sparse execution of all three projections. Across ten LLMs from six model families, Prox outperforms training-free baselines at all sparsity levels, achieves up to a $1.99\times$ end-to-end decoding speedup at 70\% FFN sparsity, and is compatible with quantization and sparse attention.
- Abstract(参考訳): フィードフォワードネットワーク(FFN)は、大きな言語モデル(LLM)推論におけるメモリトラフィックと計算を支配しており、アクティベーション・スパシフィケーションの主要なターゲットとなっている。
しかし,既存のトレーニングフリー手法では,チャネル選択戦略の限界により,モデル品質が著しく低下する。
我々は、SwiGLU中間状態が高い効率のチャネル選択信号を提供するのを観察するが、それを得るためには高コストな計算が必要である。
これを解決するために,スパースSwiGLU FFNのための2段階のトレーニングフリーフレームワークである \emph{Prox} を提案する。
スパース実行は、中間状態によって誘導されるチャネルマスクのみを必要とする。
具体的には、ステージ1は入力空間と量子化されたプロキシウェイトを使用して共有マスクを構築し、ステージ2は選択したチャネルを正確に計算し、3つのプロジェクションのスパース実行を可能にする。
6つのモデルファミリーの10 LLMで、Proxはトレーニング不要のベースラインをあらゆるスペーシングレベルで上回り、最大1.99\times$ end-to-end decoding speedup at 70\% FFN sparsityで達成し、量子化とスパースアテンションと互換性がある。
関連論文リスト
- LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - SVD Contextual Sparsity Predictors for Fast LLM Inference [0.0]
本稿では,大規模言語モデル(LLM)におけるReGLUベースのフィードフォワードネットワーク(FFN)の推論を高速化するためのフレームワークを提案する。
実験では、複雑な数学やコード生成を含むタスクにおけるベンチマークスコアの1%未満の劣化を維持しながら、エンドツーエンドのデコーディング時間を1.8倍に削減した。
論文 参考訳(メタデータ) (2026-03-14T20:36:13Z) - WiSparse: Boosting LLM Inference Efficiency with Weight-Aware Mixed Activation Sparsity [32.61817486761883]
トレーニング不要なアクティベーション空間は、効率的な大規模言語モデル推論のための有望なアプローチである。
ウェイト・アウェア・ミックス・グラニュラリティ・トレーニングフリー・アクティベーション・スパシティ(WiSparse)を提案する。
We show that WiSparse maintains 97% of Llama3.1's dense performance。
論文 参考訳(メタデータ) (2026-02-16T04:18:36Z) - Fast Forward: Accelerating LLM Prefill with Predictive FFN Sparsity [5.223181756178433]
我々は,大規模言語モデル (LLM) のプレフィルをブロックワイドでコンテキスト対応のFFNスパシティによって高速化する,予測可能なスパシティフレームワークであるFastForwardを紹介した。
FastForwardは最大1.45$times$計算バウンド・スピードアップを50%FFN間隔で提供し、LongBenchの高密度ベースラインに比べて6%の精度で損失する。
論文 参考訳(メタデータ) (2026-01-30T23:23:40Z) - Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers [91.02299679350834]
Diffusion Transformer (DiTs) は最先端の生成性能を提供するが、シークエンス長の2次トレーニングコストは大規模な事前訓練を不当に高価にする。
本稿では,高効率拡散変換器のためのスパース-デンス残差核融合法を提案する。
論文 参考訳(メタデータ) (2025-10-24T19:29:55Z) - R-Sparse: Rank-Aware Activation Sparsity for Efficient LLM Inference [77.47238561728459]
R-スパース(R-Sparse)は、高度なLCMにおいて高い疎度を達成できる訓練不要なアクティベーション・スパシティ・アプローチである。
10種類のタスクにわたるLlama-2/3およびMistralモデルの実験は、R-Sparseが50%のモデルレベルの間隔で同等のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2025-04-28T03:30:32Z) - Q-Sparse: All Large Language Models can be Fully Sparsely-Activated [93.45300714803429]
Q-Sparseは、スパースアクティベートされた大規模言語モデル(LLM)を訓練するための、シンプルで効果的なアプローチである。
Q-Sparse は LLM における活性化の完全な分散を可能にし、推論においてかなりの効率向上をもたらす。
バッチトレーニングと推論のためのBlock Q-Sparseも導入しています。
論文 参考訳(メタデータ) (2024-07-15T17:59:29Z) - BiLLM: Pushing the Limit of Post-Training Quantization for LLMs [53.31402059062365]
BiLLMは、事前訓練された大規模言語モデルに適した1ビット後のトレーニング後の量子化スキームである。
LLaMA2-70Bの8.41パープレキシティは、様々なLLMファミリーで1.08ビットの重みしか持たない。
論文 参考訳(メタデータ) (2024-02-06T09:26:34Z) - QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models [44.515165695546614]
量子化アウェアトレーニング(QAT)はソリューションを提供するが、トレーニング後の量子化(PTQ)は大規模言語モデル(LLM)のより実践的なアプローチとなる。
LLM向けに設計された高精度かつ効率的な低ビット幅PTQ法QLLMを提案する。
論文 参考訳(メタデータ) (2023-10-12T05:25:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。