論文の概要: WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning
- arxiv url: http://arxiv.org/abs/2607.28418v1
- Date: Thu, 30 Jul 2026 16:01:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.648347
- Title: WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning
- Title(参考訳): WIDE:Token-level Dynamic Width Pruningによる適応LDM推論の高速化
- Authors: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen,
- Abstract要約: プリフィルとデコードの両方のシナリオに対して、最初のエンドツーエンドのトークンレベルの動的幅決定フレームワークを提示する。
本稿では,動的空間加速度をマスクリオーダー,ハードウェア非依存ブロックレベルスキップ,ハードウェア依存ブロック内スキップに分解するプルーニングカーネル共設計フレームワークを提案する。
- 参考スコア(独自算出の注目度): 12.767703956755751
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pruning is a promising approach for improving the efficiency of LLMs. Existing static structured pruning methods are hardware-friendly and can deliver practical throughput gains, but their input-agnostic computation allocation often causes substantial accuracy degradation under aggressive sparsity. Recent dynamic sparsity methods improve quality retention by adapting computation to individual inputs, yet they remain largely limited to coarse-grained structural decisions and their practical acceleration under real-world inference scenarios remains challenging. To address these challenges, we present WIDE, the first end-to-end differentiable token-level dynamic width pruning framework designed for both prefill and decode scenarios. WIDE enables fine-grained computation allocation by allowing each token to dynamically select attention-head groups and FFN-channel groups, extending dynamic pruning beyond layer-level decisions to neuron-block-level granularity. Through a two-stage training pipeline, WIDE learns effective token-wise sparse execution patterns and achieves substantially better quality retention than existing approaches. To make such fine-grained dynamic pruning practical, we further propose a pruning--kernel co-design framework that decomposes dynamic sparsity acceleration into mask reordering, hardware-agnostic block-level skipping, and hardware-dependent intra-block skipping, enabling efficient execution across different granularities. At 50% sparsity, WIDE provides 55.1% performance boost when compared to the state-of-the-art dynamic depth pruning under calibration-only settings. Under prefill and decoding inference workloads, WIDE achieves close-to-theoretical kernel-level speedups of up to 1.98x for prefill and 4.95x for decoding, as well as 1.68x and 1.55x end-to-end acceleration. Our code is available at https://github.com/EIT-NLP/LLM-Pruning/tree/main/WIDE.
- Abstract(参考訳): プルーニングはLLMの効率を改善するための有望なアプローチである。
既存の静的な定型プルーニング法はハードウェアフレンドリーであり、実際のスループット向上を実現することができるが、入力非依存の計算割り当ては、攻撃的な間隔でかなりの精度の劣化を引き起こすことが多い。
近年の動的疎水性法は個々の入力に計算を適用することによって品質保持を改善するが、大まかに微粒な構造決定に限られており、現実の推論シナリオ下での実際の加速は難しいままである。
これらの課題に対処するために、私たちは、プリフィルとデコードの両方のシナリオ用に設計された、最初のエンドツーエンドのトークンレベルの動的幅決定フレームワークであるWIDEを紹介します。
WIDEは、各トークンが動的にアテンションヘッドグループとFFNチャネルグループを選択できるようにし、層レベルの決定を越えて動的プルーニングをニューロンブロックレベルの粒度に拡張することで、きめ細かい計算割り当てを可能にする。
2段階のトレーニングパイプラインを通じて、WIDEは効果的なトークン単位のスパース実行パターンを学び、既存のアプローチよりもはるかに優れた品質維持を実現する。
このような細粒度ダイナミックプルーニングを実用化するために,マスクリオーダー,ハードウェア非依存ブロックレベルスキップ,ハードウェア依存ブロック内スキップに動的スペーシティアクセラレーションを分解するプルーニングカーネル共設計フレームワークを提案する。
50%の間隔で、WIDEはキャリブレーションのみの設定で最先端のダイナミックディープ・プルーニングと比較して55.1%の性能向上を提供する。
プリフィルとデコーディングのワークロードでは、WIDEはプリフィルの最大1.98倍、デコーディングの4.95倍、エンドツーエンドの1.68倍と1.55倍の高速化を実現している。
私たちのコードはhttps://github.com/EIT-NLP/LLM-Pruning/tree/main/WIDEで利用可能です。
関連論文リスト
- Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy [13.790557800221057]
プルーニングは、大規模言語モデル(LLM)推論を加速するための支配的なパラダイムとして現れている。
我々はGEMM中心の分類法を導入し、一般的な行列乗法における論理的textbfM, textbfN, textbfK次元に従って既存のプルーニング手法を再編成する。
論文 参考訳(メタデータ) (2026-06-08T06:26:18Z) - AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization [84.25316984309725]
動的スパース構造とパラメータ効率のよいアダプタ(例えばLoRA)の統合は、大規模言語モデル(LLM)を拡張するための強力な技術である。
計算負荷は最小限に抑えられるが、計算のレイテンシが急上昇し、復号速度が2.5倍以上遅くなる。
AdaFuseはアルゴリズムと基盤となるハードウェアシステムとの緊密な協調設計に基づいて構築されたフレームワークで、効率的な動的アダプタ実行を実現する。
論文 参考訳(メタデータ) (2026-03-12T12:46:42Z) - ADEPT: Adaptive Dynamic Early-Exit Process for Transformers [12.23755727319088]
早期の出口戦略は、推論を早期に停止することで計算要求を減らすのに有効であることが証明されている。
ADEPTは、この問題を克服し、プリフィルとジェネレーションの両方の段階で動的早期終了を可能にするために設計された新しいアプローチである。
ADEPTは、言語生成タスクの最大25%の効率向上を実現し、下流分類タスクの4倍の高速化を実現し、最大45%の性能向上を実現している。
論文 参考訳(メタデータ) (2026-01-07T08:34:41Z) - Training-free Context-adaptive Attention for Efficient Long Context Modeling [57.703159205740185]
トレーニングフリーコンテキスト適応注意(TCA-Attention)は、学習不要なスパースアテンション機構であり、効率的な長文推論のための情報トークンのみに選択的に参画する。
TCA-Attentionは2.8$times$のスピードアップを実現し、128Kのコンテキスト長でKVキャッシュを61%削減し、フルアテンションに匹敵するパフォーマンスを維持している。
論文 参考訳(メタデータ) (2025-12-10T01:54:57Z) - Inter2Former: Dynamic Hybrid Attention for Efficient High-Precision Interactive [58.0729162588429]
インタラクティブセグメンテーションは、ユーザプロンプトからターゲット領域をセグメンテーションすることで、アノテーション効率を向上させる。
現在のアプローチは重要なトレードオフに直面している。密度の高いメソッドは精度が向上するが、CPUデバイスでの処理が著しく遅くなる。
そこで我々は,高密度な処理における計算割り当てを最適化することで,この問題に対処するInter2Formerを提案する。
論文 参考訳(メタデータ) (2025-07-13T12:33:37Z) - SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling [16.742839354514512]
我々は,大規模言語モデルを最適化する動的層プルーニングフレームワークであるSkipGPTを紹介する。
また,SkipGPTはモデルパラメータの40%以上を削減できることを示す。
論文 参考訳(メタデータ) (2025-06-04T17:26:31Z) - EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference [49.94169109038806]
本稿では,既存の並列処理方式を超越したMoE用パイプラインスケジューラであるEPS-MoEを紹介する。
その結果,既存の並列推論手法と比較して,プリフィルスループットは52.4%向上した。
論文 参考訳(メタデータ) (2024-10-16T05:17:49Z) - PRANCE: Joint Token-Optimization and Structural Channel-Pruning for Adaptive ViT Inference [44.77064952091458]
PRANCEはVision Transformer圧縮フレームワークで、アクティベートされたチャネルを共同で最適化し、入力の特性に基づいてトークンを削減する。
本稿では,ViTの推論過程を逐次決定プロセスとしてモデル化する,新しい「結果と結果」学習機構を提案する。
我々のフレームワークは、プルーニング、マージング、プルーニングマージングといった様々なトークン最適化手法と互換性があることが示されている。
論文 参考訳(メタデータ) (2024-07-06T09:04:27Z) - Automatic Mapping of the Best-Suited DNN Pruning Schemes for Real-Time
Mobile Acceleration [71.80326738527734]
本稿では,汎用的,きめ細かな構造化プルーニング手法とコンパイラの最適化を提案する。
提案手法は,より微細な構造化プルーニング手法とともに,最先端のDNN最適化フレームワークよりも優れていることを示す。
論文 参考訳(メタデータ) (2021-11-22T23:53:14Z) - Dynamic Slimmable Network [105.74546828182834]
ダイナミックスリム化システム「ダイナミックスリム化ネットワーク(DS-Net)」を開発。
ds-netは,提案するダブルヘッド動的ゲートによる動的推論機能を備えている。
静的圧縮法と最先端の静的および動的モデル圧縮法を一貫して上回っている。
論文 参考訳(メタデータ) (2021-03-24T15:25:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。