Benchmarking Composable Compression Techniques in Mixture-of-Experts LLMs
Abstractの概要
本論文では、Mixture-of-Experts(MoE)大規模言語モデルにおける圧縮技術を個別のステップとしてではなく、エンドツーエンドの展開ワークフローとして評価するベンチマーク「MoE-XBench」を提案しています。このベンチマークは、標準アテンション、ハイブリッド線形アテンション、スライディングウィンドウアテンションの各系統にわたる30Bから235BパラメータのMoEモデル10種を対象とし、7つのワークロードを評価しています。エキスパートプルーニング、重み量子化、KVキャッシュ圧縮を単独および組み合わせの両方で網羅し、品質維持、堅牢性、感度、展開効率を測定する8モジュールの評価スイートを備えています。本研究では、シングルバッチ展開環境下において、コモディティハードウェアおよびアクセラレータ上での精度、メモリ、レイテンシ、ハードウェア効率を比較しています。
新規性
主な貢献は、MoEモデルの圧縮を構成可能な展開パイプラインとして捉え、エキスパートプルーニング、重み量子化、KVキャッシュ圧縮の相互作用をベンチマークした点にあります。また、複数のMoEアーキテクチャ系統にわたり、モデル品質および感度と実際のハードウェア展開効率を系統的に分離する8モジュールの正規化スコアリングフレームワークを導入しています。
成果
実験の結果、名目上の圧縮率は品質低下を確実に予測できる指標ではないことが明らかになりました。エキスパートプルーニングが性能低下の主要な要因である一方、適度な重み量子化は平均的な品質をより効果的に維持します。さらに、長コンテキストでのKVキャッシュ圧縮や低ビットの逆量子化がデコードレイテンシの大幅なオーバーヘッドを生じさせる可能性があるため、メモリフットプリントの削減が必ずしもスループットの向上につながるとは限らず、平均精度がコーディングや知識系タスクでの顕著な性能低下やアーキテクチャ特有の感度を覆い隠してしまうことも示されました。
論文の注目点
- MoE-XBenchは、10種のMoEモデル、7つのワークロード、複数のハードウェアプラットフォームにおいて、プルーニング、量子化、KVキャッシュ圧縮を単独および複合的に評価する。
- 実証結果により、エキスパートプルーニングが品質低下の大部分を占める一方で、量子化やKVキャッシュ圧縮がモデル品質に与える影響はより小さく、コンテキスト依存的であることが示された。
- 効率面の向上は非単調であり、メモリ削減はハードウェア間で一貫しているものの、スループットの向上はコンテキスト長、ビット幅形式、バックエンドの逆量子化オーバーヘッドに大きく依存する。