FuguReport

Benchmarking Composable Compression Techniques in Mixture-of-Experts LLMs

著者 Afsara Benazir, Chen Chen, Rongxiao Qu, Jiabo Huang, Jingtao Li, Lingjuan Lyu
所属 University of Virginia / Sony
カテゴリ Evaluation / Benchmarking / Composable compression quality assessment, Method / Model Compression / Pruning and quantization sensitivity, Application / ML Systems Deployment / Deployment workflow on commodity hardware
ライセンス CC BY 4.0

Abstractの概要

本論文では、Mixture-of-Experts(MoE)大規模言語モデルにおける圧縮技術を個別のステップとしてではなく、エンドツーエンドの展開ワークフローとして評価するベンチマーク「MoE-XBench」を提案しています。このベンチマークは、標準アテンション、ハイブリッド線形アテンション、スライディングウィンドウアテンションの各系統にわたる30Bから235BパラメータのMoEモデル10種を対象とし、7つのワークロードを評価しています。エキスパートプルーニング、重み量子化、KVキャッシュ圧縮を単独および組み合わせの両方で網羅し、品質維持、堅牢性、感度、展開効率を測定する8モジュールの評価スイートを備えています。本研究では、シングルバッチ展開環境下において、コモディティハードウェアおよびアクセラレータ上での精度、メモリ、レイテンシ、ハードウェア効率を比較しています。

新規性

主な貢献は、MoEモデルの圧縮を構成可能な展開パイプラインとして捉え、エキスパートプルーニング、重み量子化、KVキャッシュ圧縮の相互作用をベンチマークした点にあります。また、複数のMoEアーキテクチャ系統にわたり、モデル品質および感度と実際のハードウェア展開効率を系統的に分離する8モジュールの正規化スコアリングフレームワークを導入しています。

成果

実験の結果、名目上の圧縮率は品質低下を確実に予測できる指標ではないことが明らかになりました。エキスパートプルーニングが性能低下の主要な要因である一方、適度な重み量子化は平均的な品質をより効果的に維持します。さらに、長コンテキストでのKVキャッシュ圧縮や低ビットの逆量子化がデコードレイテンシの大幅なオーバーヘッドを生じさせる可能性があるため、メモリフットプリントの削減が必ずしもスループットの向上につながるとは限らず、平均精度がコーディングや知識系タスクでの顕著な性能低下やアーキテクチャ特有の感度を覆い隠してしまうことも示されました。

論文の注目点

  1. MoE-XBenchは、10種のMoEモデル、7つのワークロード、複数のハードウェアプラットフォームにおいて、プルーニング、量子化、KVキャッシュ圧縮を単独および複合的に評価する。
  2. 実証結果により、エキスパートプルーニングが品質低下の大部分を占める一方で、量子化やKVキャッシュ圧縮がモデル品質に与える影響はより小さく、コンテキスト依存的であることが示された。
  3. 効率面の向上は非単調であり、メモリ削減はハードウェア間で一貫しているものの、スループットの向上はコンテキスト長、ビット幅形式、バックエンドの逆量子化オーバーヘッドに大きく依存する。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。