論文の概要: Beyond Single-Dimensional Compression: The Compound Sparsity Frontier of Large Language Models
- arxiv url: http://arxiv.org/abs/2607.18280v1
- Date: Mon, 29 Jun 2026 01:33:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.103905
- Title: Beyond Single-Dimensional Compression: The Compound Sparsity Frontier of Large Language Models
- Title(参考訳): 単次元圧縮を超えて:大規模言語モデルの複合空間フロンティア
- Abstract要約: 大規模言語モデル(LLM)はしばしば静的パラメータのプルーニングや動的トークンレベルの計算によって圧縮される。
本稿では,まず低ランク近似とチャネルプルーニングを適用し,静的に圧縮されたバックボーンを得るミニマリスト複合スパーシリティフレームワークについて検討する。
- 参考スコア(独自算出の注目度): 6.94102129809152
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are often compressed through static parameter pruning or dynamic token-level computation, yet aggressive sparsification can trigger rapid performance degradation beyond an essential sparsity boundary. This work asks \emph{whether combining these two mechanisms can delay such degradation by distributing the compression burden}. We study a minimalist compound sparsity framework that first applies low-rank approximation and channel pruning to obtain a statically compressed backbone, and then introduces lightweight routers for per-token dynamic layer skipping. This design enables independent control of parameter sparsity and token-level computation sparsity. Experiments across language understanding and modeling benchmarks show that compound sparsity consistently outperforms single-mechanism compression under the same total sparsity, delaying the decay point on understanding tasks and preserving stronger modeling performance. Further analysis reveals cross-dimensional interference between parameter pruning and token skipping, and shows that near-balanced allocation is most effective under a fixed sparsity budget. These results demonstrate that compound compression provides a practical way to improve LLM compression, while revealing a broader cross-dimensional sparsity boundary that ultimately limits further compression. Code will be available at https://github.com/EIT-NLP/LLM-Pruning.
- Abstract(参考訳): 大規模言語モデル(LLM)は静的パラメータのプルーニングや動的トークンレベルの計算によってしばしば圧縮されるが、アグレッシブなスペーシフィケーションは本質的なスペーシティ境界を超えた高速な性能劣化を引き起こす。
この研究は、これらの2つのメカニズムを組み合わせることで、圧縮負荷を分散させることで、そのような劣化を遅らせることができるかどうかを \emph{w} に問う。
本稿では,まず低ランク近似とチャネルプルーニングを適用して静的に圧縮されたバックボーンを得るミニマリスト複合スペーシリティフレームワークについて検討し,次に動的層スキップのための軽量ルータを導入する。
この設計により、パラメータの空白度とトークンレベルの計算の空白度を独立に制御できる。
言語理解とモデリングのベンチマークによる実験では、複合スパーシリティは同じ全空間下で単一機構圧縮を一貫して上回り、理解タスクの減衰点を遅らせ、より強力なモデリング性能を維持することが示されている。
さらに解析により,パラメータプルーニングとトークンスキップの相互干渉が明らかになり,固定空間予算の下では,ほぼバランスの取れたアロケーションが最も効果的であることが示唆された。
これらの結果から,複合圧縮はLLM圧縮を改善する実用的な方法であり,さらに圧縮を制限した広い次元の空間境界を明らかにしている。
コードはhttps://github.com/EIT-NLP/LLM-Pruning.comから入手できる。
関連論文リスト
- MixCompress: Mixture of Experts for Variable Rate Learned Image Compression [6.773101031620122]
MixCompressは、スパース構造特化に基づく統一可変ビットレート(VBR)フレームワークである。
モデルキャパシティを動的にスケールするために,Mixture-of-Depths(MoD)拡張を導入する。
論文 参考訳(メタデータ) (2026-07-15T19:57:15Z) - Efficient Learned Image Compression without Entropy Coding [62.01837001379442]
エントロピー符号化自由学習画像圧縮(EF-LIC)を提案する。
EF-LICは、符号化レイテンシの低い統計的および相関的冗長性を排除し、コンパクトな表現を生成するマルチレートフレームワークである。
実験の結果、EF-LIC はコダックの MS-ILLM を LPIPS で67.86% 削減できることがわかった。
論文 参考訳(メタデータ) (2026-05-22T07:37:30Z) - PACE: Post-Causal Entropy Modeling for Learned LiDAR Point Cloud Compression [43.524231862354405]
LiDARポイントクラウド圧縮は、高解像度センサーから大量のデータを処理するために自律システムにとって不可欠である。
PACEは、祖先のコンテキストアグリゲーションを非因果バックボーンとして再構成し、因果関係を軽量でステージスケーラ可能な予測器に変換する新しいフレームワークである。
実験により、PACEは圧縮効率を新たな最先端に設定し、顕著なBD-BR節約を実現し、自動回帰モードで復号遅延を90%以上削減した。
論文 参考訳(メタデータ) (2026-05-02T08:36:11Z) - Density-aware Soft Context Compression with Semi-Dynamic Compression Ratio [19.375601589555327]
本稿では,Semi-Dynamic Context Compressionフレームワークを紹介する。
本手法では,固有情報密度に基づいて圧縮目標を予測する離散比セレクタを特徴とする。
私たちのフレームワークは、静的なベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-03-26T21:36:55Z) - Towards Practical Lossless Neural Compression for LiDAR Point Clouds [84.36825469211375]
高精度な幾何学的詳細の極端に広い範囲は、効率的な文脈モデリングを妨げる。
私たちのフレームワークは2つの軽量モジュールで構成されています。
実験では、リアルタイムに競争力のある圧縮性能を示す。
論文 参考訳(メタデータ) (2026-03-26T10:02:07Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - HPC: Hierarchical Point-based Latent Representation for Streaming Dynamic Gaussian Splatting Compression [14.759497852655047]
本稿では,新しいストリーミング動的ガウススプラッティング圧縮フレームワークであるHPCを提案する。
これは、非占有空間におけるパラメータ冗長性を避けるために、ガウス単位の階層的な点ベースの潜在表現を用いる。
高い復元率を維持しながら、ベースラインに対して67%のストレージ削減を実現している。
論文 参考訳(メタデータ) (2026-01-31T11:35:02Z) - Compressing Many-Shots in In-Context Learning [61.231471139896506]
マルチショットプロンプトを圧縮することにより,ICL推論のメモリと計算効率を向上させる手法を提案する。
まず,既存のプロンプト圧縮手法がマルチショット圧縮には有効でないことを示す。
本稿では,レイヤワイド圧縮手法であるMemComを提案する。
論文 参考訳(メタデータ) (2025-10-17T16:57:42Z) - Choose Your Model Size: Any Compression of Large Language Models Without Re-Computation [10.376875638696504]
本研究は, 圧縮性能トレードオフを決定するアルゴリズム手法であるACIP (Any Compression via Iterative Pruning) を提案する。
線形層をSVDで再パラメータ化し,その特異値をスペーサ性誘導ペナルティで反復的にプルーする。
本稿では,ACIPが共通量子化に基づく圧縮手法をシームレスに補完することを示す。
論文 参考訳(メタデータ) (2025-02-03T18:40:58Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - UNComp: Can Matrix Entropy Uncover Sparsity? -- A Compressor Design from an Uncertainty-Aware Perspective [85.08718140718707]
UNCompは不確実性を認識したフレームワークで、適応圧縮に使用できる空間パターンを明らかにする。
スパーシティパターンを詳細に分析する不確実性に注目して、UNCompはKVキャッシュサイズを4.74%に削減し、6%のプリフィルスピードアップを実現し、スループットを6.4倍改善した。
論文 参考訳(メタデータ) (2024-10-04T02:32:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。