論文の概要: Break Through the Compression Bottleneck: From Theory to Practice
- arxiv url: http://arxiv.org/abs/2607.20434v1
- Date: Mon, 11 May 2026 10:50:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.159444
- Title: Break Through the Compression Bottleneck: From Theory to Practice
- Title(参考訳): 圧縮ボトルネックを突破する:理論から実践へ
- Abstract要約: 低ランクの分解と量子化は、大規模言語モデルの計算とメモリの要求を著しく減らすことが証明されている。
本稿では、低ランク分解と量子化が非直交であることを示す最初の数学的証明を提供する。
本稿では,2つの手法を効果的に組み合わせ,性能損失を軽減できる新しいアプローチである対角接着法(DAM)を提案する。
- 参考スコア(独自算出の注目度): 30.01535056565781
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As the parameter size of language models continues to grow, effective model compression is required to reduce their computational and memory overhead. Existing compression methods suffer from bottleneck issues: when the compression ratio is increased, performance degrades significantly. Low-rank decomposition and quantization are two prominent compression methods that have been proven to significantly reduce the computational and memory requirements of Large Language Models (LLMs) while maintaining model accuracy. Evidently, combining these two methods will break through the existing compression bottleneck. However, how these two methods interact when combined remains a critical question for developers, as many assume they are orthogonal, meaning their combination would not introduce additional errors beyond those independently introduced by each method. This paper provides the first mathematical proof that low-rank decomposition and quantization are non-orthogonal. We validate these findings through a series of experiments on large language models. Our results demonstrate that these methods are non-orthogonal, and their combination leads to significant performance degradation. Importantly, we propose a novel approach Diagonal Adhesive Method (DAM), which can effectively combine the two methods and mitigate the performance loss. Our research provides deep insights into model compression and lays a solid theoretical and experimental foundation for future related studies.
- Abstract(参考訳): 言語モデルのパラメータサイズが大きくなるにつれて、効率的なモデル圧縮が計算とメモリのオーバーヘッドを軽減するために必要となる。
既存の圧縮手法では、圧縮比が大きくなると性能が著しく低下する。
低ランク分解と量子化は、モデル精度を維持しながら、LLM(Large Language Models)の計算およびメモリ要求を著しく低減することが証明された2つの顕著な圧縮手法である。
これらの2つの手法を組み合わせることは、既存の圧縮ボトルネックを突破する。
しかし、これらの2つのメソッドが組み合わさってどのように相互作用するかは、開発者にとって重要な問題であり、多くの人はそれらが直交的であると仮定している。
本稿では、低ランク分解と量子化が非直交であることを示す最初の数学的証明を提供する。
これらの知見は,大規模言語モデルに関する一連の実験を通じて検証する。
以上の結果から,これらの手法は非直交法であり,それらの組み合わせにより性能が著しく低下することが示唆された。
本稿では,2つの手法を効果的に組み合わせ,性能損失を軽減できる新しいアプローチである対角接着法(DAM)を提案する。
我々の研究はモデル圧縮に関する深い洞察を与え、将来的な研究のための理論的・実験的基礎を築き上げている。
関連論文リスト
- Hybrid Compression: Integrating Pruning and Quantization for Optimized Neural Networks [10.505297793600137]
本稿では,2段階のモデル圧縮手法を提案する。
まず, プルーニングや量子化などのモデル圧縮技術を用いて, モデルサイズを大幅に削減する。
次に、Mixture of Expertsを用いて、以前圧縮されたモデルをルーティングし、推論効率のバランスを維持しながら性能を向上させる。
論文 参考訳(メタデータ) (2026-06-22T07:11:52Z) - Prune-then-Quantize or Quantize-then-Prune? Understanding the Impact of Compression Order in Joint Model Compression [16.625053009148306]
連成モデル圧縮は、プルーニングや量子化といった複数の手法を組み合わせることで、より高い効率を達成するための強力な戦略である。
ジョイントモデル圧縮における中心的だが未探索の要素は、圧縮順序または圧縮パイプライン内の異なるメソッドのシーケンスである。
論文 参考訳(メタデータ) (2026-03-19T02:40:23Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - Gradually Compacting Large Language Models for Reasoning Like a Boiling Frog [72.4168434368873]
大きな言語モデル(LLM)は印象的な推論能力を示しているが、その相当なサイズは、しばしばかなりの計算資源を必要とする。
圧縮過程を細かな繰り返しに分割する段階的圧縮法を提案する。
この「沸騰するカエル」効果の反復的なアプローチは、急激な性能損失を伴わずに、モデルを段階的に圧縮することができる。
論文 参考訳(メタデータ) (2026-02-04T06:56:52Z) - On Information Geometry and Iterative Optimization in Model Compression: Operator Factorization [5.952537659103525]
我々は、多くのモデル圧縮手法が、この射影に対する情報分岐を暗黙的に近似するものとして理解することができると論じる。
ソフトランク制約を受けるニューラルネットワークのトレーニングにおける反復特異値しきい値の収束性を証明する。
論文 参考訳(メタデータ) (2025-07-12T23:39:14Z) - Choose Your Model Size: Any Compression of Large Language Models Without Re-Computation [10.376875638696504]
本研究は, 圧縮性能トレードオフを決定するアルゴリズム手法であるACIP (Any Compression via Iterative Pruning) を提案する。
線形層をSVDで再パラメータ化し,その特異値をスペーサ性誘導ペナルティで反復的にプルーする。
本稿では,ACIPが共通量子化に基づく圧縮手法をシームレスに補完することを示す。
論文 参考訳(メタデータ) (2025-02-03T18:40:58Z) - Effective Interplay between Sparsity and Quantization: From Theory to Practice [33.697590845745815]
組み合わせると、空間性と量子化がどう相互作用するかを示す。
仮に正しい順序で適用しても、スパーシリティと量子化の複合誤差は精度を著しく損なう可能性があることを示す。
我々の発見は、資源制約の計算プラットフォームにおける大規模モデルの効率的な展開にまで及んでいる。
論文 参考訳(メタデータ) (2024-05-31T15:34:13Z) - Activations and Gradients Compression for Model-Parallel Training [85.99744701008802]
モデル並列分散トレーニングセットアップにおけるアクティベーションと勾配の同時圧縮が収束に与える影響について検討する。
グラデーションはアクティベーションよりも軽度な圧縮速度を必要とする。
実験では、TopKでトレーニングされたモデルが、推論中に圧縮も適用された場合にのみ正常に動作することが示されている。
論文 参考訳(メタデータ) (2024-01-15T15:54:54Z) - Unified Multivariate Gaussian Mixture for Efficient Neural Image
Compression [151.3826781154146]
先行変数と超優先度を持つ潜伏変数は、変動画像圧縮において重要な問題である。
ベクトル化された視点で潜伏変数を観察する際、相関関係や相関関係は存在する。
当社のモデルでは、速度歪曲性能が向上し、圧縮速度が3.18倍に向上した。
論文 参考訳(メタデータ) (2022-03-21T11:44:17Z) - Compression of Generative Pre-trained Language Models via Quantization [62.80110048377957]
従来の量子化手法は, テクスモジニアス単語の埋め込みによって生成タスクに失敗することがわかった。
本稿では,区別可能な単語埋め込みを学習するためのトークンレベルのコントラスト蒸留法と,異なるモジュールに対して量子化器を適応させるモジュールワイドダイナミックスケーリングを提案する。
論文 参考訳(メタデータ) (2022-03-21T02:11:35Z) - What do Compressed Large Language Models Forget? Robustness Challenges
in Model Compression [68.82486784654817]
本稿では,知識蒸留とプルーニングを含む2つの一般的なモデル圧縮手法について検討する。
本研究では, 圧縮モデルが, 対向テストセット上のPLMモデルよりもはるかに頑健であることを示す。
サンプル不確実性に基づくモデル圧縮の正規化戦略を開発する。
論文 参考訳(メタデータ) (2021-10-16T00:20:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。