論文の概要: Full-Pipeline Inference Optimization for MiMo-V2.5 Series: Pushing Hybrid SWA Efficiency to the Limit
- arxiv url: http://arxiv.org/abs/2607.13095v1
- Date: Tue, 14 Jul 2026 03:38:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.531001
- Title: Full-Pipeline Inference Optimization for MiMo-V2.5 Series: Pushing Hybrid SWA Efficiency to the Limit
- Title(参考訳): MiMo-V2.5シリーズの完全パイプライン推論最適化:ハイブリッドSWA効率を限界まで押し上げる
- Abstract要約: そこで本研究では,MiMo-V2.5モデルファミリに対する全パイプライン推論最適化を提案する。
ハイブリッドSWAは、フルアテンションと比較して、注意計算とKVCacheストレージの両方を理想的に削減できる。
また、GPU画像前処理、並列ビデオデコーディング、マルチモーダルキャッシュ共有などのマルチモーダル入力を最適化する。
- 参考スコア(独自算出の注目度): 41.07781952455958
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present a full-pipeline inference optimization for the MiMo-V2.5 model family, which combines Hybrid Sliding Window Attention (Hybrid SWA), sparse Mixture-of-Experts (MoE), and multimodal encoders. While Hybrid SWA can ideally reduce both attention compute and KVCache storage significantly compared to Full Attention, realizing these gains in production requires substantial engineering effort. We systematically optimize the KVCache system with layerwise prefetch, SWA-aware prefix cache trees, and specialized placement strategies, achieving strict $O(W)$ SWA storage and high cache hit rates. We further build GCache, a high-performance distributed cache infrastructure with RDMA-optimized networking, and develop a KVCache-affinity router to reduce computation while preserving load balancing. We also optimize for multimodal inputs, including GPU image preprocessing, parallel video decoding, and multimodal cache sharing. Together, these optimizations constitute the first large-scale LLM serving system in production that efficiently covers the Hybrid SWA + MoE + multimodal composite architecture.
- Abstract(参考訳): ハイブリッド・スライディング・ウィンドウ・アテンション(Hybrid SWA)、スパース・ミックス・オブ・エグゼクティブ(MoE)、マルチモーダル・エンコーダを組み合わせたMiMo-V2.5モデルファミリに対する全パイプライン推論最適化を提案する。
ハイブリッドSWAは、フルアテンションと比較して、注意計算とKVCacheストレージの両方を理想的に削減できるが、本番環境でのこれらの向上を実現するには相当なエンジニアリング努力が必要である。
我々は,階層的なプリフェッチ,SWA対応プレフィックスキャッシュツリー,特別な配置戦略を用いて,KVCacheシステムを体系的に最適化し,厳格な$O(W)$SWAストレージと高いキャッシュヒット率を実現した。
さらに,RDMA最適化ネットワークを備えた高性能分散キャッシュインフラストラクチャであるGCacheを構築し,負荷分散を保ちながら計算量を削減するKVCacheアフィニティルータを開発した。
また、GPU画像前処理、並列ビデオデコーディング、マルチモーダルキャッシュ共有などのマルチモーダル入力を最適化する。
これらの最適化は、ハイブリッドSWA+MoE+マルチモーダル複合アーキテクチャを効率的にカバーする最初の大規模LCMサービスシステムである。
関連論文リスト
- OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond [50.440302567029654]
マルチモーダルインテリジェンスにより、Key-Valueキャッシュは効率的なデプロイメントのための主要なメモリボトルネックとなった。
本研究では、チャネルごとの量子化パラダイムの本質的な限界を再考する。
X-LLMのための高精度かつ軽量なKVキャッシュ圧縮フレームワークOScaRを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:53:03Z) - LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference [27.24239725255976]
LMCacheは、オープンソースのKVキャッシュソリューションとして、これまでで最も効率的です。
現代のLLMエンジンによって生成されたKVキャッシュを抽出し、格納し、エンジンとクエリ間でKVキャッシュを共有する。
LMCacheとvLLMを組み合わせることで,ワークロードのスループットが最大15倍向上することを示す。
論文 参考訳(メタデータ) (2025-10-08T00:15:04Z) - Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System [20.652641518700346]
大規模言語モデル(LLM)推論は、メモリ帯域幅によってますます制限される。
現代のAIハードウェアは、高速オフパッケージDRAMと高速帯域メモリ(HBM)を統合している。
本研究は,キャパシティ制約下での集積帯域利用を最大化するために,そのようなシステムにまたがる動的KVキャッシュ配置について検討する。
論文 参考訳(メタデータ) (2025-08-17T19:07:08Z) - Enhancing Large Multimodal Models with Adaptive Sparsity and KV Cache Compression [15.87033491172396]
大規模マルチモーダルモデル(LMM)は、視覚エンコーダと広範な言語モデルを統合することで、堅牢な推論機能を実現している。
エッジデバイスへの展開のためにLMMを圧縮することは、依然として重要な課題である。
本稿では,LMM効率を向上させるために,空間性とKVキャッシュ圧縮を最適化する適応探索アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-07-28T08:27:40Z) - LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models [52.56008278458534]
LaCacheは、大規模言語モデルの効率的かつ正確な生成推論のためのトレーニング不要の手法である。
LaCacheを使用することで、LLMは長期モデリングにおける重要な課題、すなわち堅牢な長距離機能と、メモリのアウト・オブ・メモリを走らせることなく連続的な生成の両方に対処できる。
論文 参考訳(メタデータ) (2025-07-14T19:09:57Z) - Accelerating LLM Inference Throughput via Asynchronous KV Cache Prefetching [16.6871758712011]
大規模言語モデル(LLM)は、高帯域メモリ(HBM)帯域幅の制約により、推論中に顕著なメモリバウンド特性を示す。
本稿では,L2キャッシュ指向の非同期KVキャッシュプリフェッチ手法を提案する。
論文 参考訳(メタデータ) (2025-04-08T09:17:35Z) - QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache [67.84112700032007]
大きな言語モデル(LLM)は、長いコンテキスト設定のためにエッジデバイスにデプロイされることが増えている。
これらのシナリオでは、キーバリュー(KV)キャッシュがGPUメモリとレイテンシの両方において主要なボトルネックとなっている。
そこで本研究では,ターゲットモデルのアーキテクチャを共有するが,階層的な4ビット量子化KVキャッシュと4ビット量子化重みを併用して高速化を行う,新たな自己推論型デコーディングフレームワークであるQuantSpecを提案する。
論文 参考訳(メタデータ) (2025-02-05T20:43:48Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z) - MiniCache: KV Cache Compression in Depth Dimension for Large Language Models [48.03117580340151]
キーバリュー(KV)キャッシュは、以前に生成されたトークンのキー値状態を格納する。
KVキャッシュのサイズはシーケンス長とともに線形に増加し、長いコンテキスト入力と広範囲なシーケンス生成を必要とするアプリケーションの課題を提起する。
レイヤ間のKVキャッシュを,新しい奥行きの観点から圧縮する,MiniCacheという,シンプルで効果的なアプローチを提案する。
論文 参考訳(メタデータ) (2024-05-23T09:43:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。