論文の概要: TopoCompress: Topology Aware Token Compression Algorithm for Distributed Edge MoE Inference
- arxiv url: http://arxiv.org/abs/2609.26061v2
- Date: Wed, 23 Sep 2026 05:12:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.851396
- Title: TopoCompress: Topology Aware Token Compression Algorithm for Distributed Edge MoE Inference
- Title(参考訳): TopoCompress: 分散エッジMoE推論のためのトポロジが意識する圧縮アルゴリズム
- Abstract要約: Mixture-of-experts(MoE)モデルは、トークンごとに専門家をわずかに活性化することで、キャパシティを適度なオーバーヘッドで改善する。
リソースに制約のあるエッジサーバにMoEをデプロイすると、サーバ間の通信が大幅に向上する。
TopoCompressは、通信効率の良いMoE推論のためのデプロイおよびトポロジ対応トークン圧縮フレームワークである。
- 参考スコア(独自算出の注目度): 42.410576475412654
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-experts (MoE) models improve capacity with moderate overhead by sparsely activating experts per token. However, deploying MoE across resource-constrained edge servers incurs substantial cross-server communication as experts are distributed across heterogeneous servers. Existing placement methods optimize for raw token traffic, while conventional compression considers semantics but ignores topology-dependent routing costs. Consequently, independent optimization leads to inefficient communication and resource utilization. This paper proposes TopoCompress, a deployment- and topology-aware token compression framework for communication-efficient distributed edge MoE inference. It jointly optimizes token compression, expert deployment/replication, GPU-CPU residency, and collaborative routing to balance cross-server transmission, quality, and resource use. To address the coupling between token-level compression and epoch-level deployment, TopoCompress employs a two-timescale alternating optimization. In the online fast loop, it identifies and compresses low-importance, high-routing-cost tokens and jointly routes surviving expert activations. In the offline slow loop, it updates expert placement, replication, and GPU-CPU residency according to post-compression traffic accumulated during online inference. We establish the feasibility, optimality, convergence, and computational complexity. Simulations demonstrate that TopoCompress effectively reduces cross-server traffic and deployment resource consumption while maintaining controllable inference quality, enabling efficient distributed MoE inference over bandwidth- and resource-constrained edge infrastructures.
- Abstract(参考訳): Mixture-of-experts(MoE)モデルは、トークンごとに専門家をわずかに活性化することで、キャパシティを適度なオーバーヘッドで改善する。
しかし、リソース制約のあるエッジサーバにMoEをデプロイすると、専門家が異種サーバに分散されるため、かなりのサーバ間通信が発生する。
既存の配置手法は生トークンのトラフィックを最適化するが、従来の圧縮では意味論は考慮するが、トポロジに依存したルーティングコストは無視する。
その結果、独立最適化は非効率な通信と資源利用につながる。
本稿では,通信効率のよい分散エッジMoE推論のためのトークン圧縮フレームワークであるTopoCompressを提案する。
トークン圧縮、専門家のデプロイメント/レプリケーション、GPU-CPU常駐、コラボレーティブルーティングを共同で最適化して、サーバ間のトランスミッション、品質、リソース使用のバランスを取る。
トークンレベルの圧縮とエポックレベルのデプロイメントの結合に対処するため、TopoCompressは2段階の交互最適化を採用している。
オンラインの高速ループでは、重要度が低く、高価なトークンを識別し、圧縮し、生き残った専門家のアクティベーションを共同でルーティングする。
オフラインのスローループでは、オンライン推論中に蓄積された圧縮後のトラフィックに応じて、専門家の配置、レプリケーション、GPU-CPU常駐を更新する。
実現可能性、最適性、収束性、計算複雑性を確立します。
TopoCompressは、制御可能な推論品質を維持しつつ、サーバ間トラフィックとデプロイメントリソースの消費を効果的に削減し、帯域幅とリソース制約のあるエッジインフラストラクチャ上で効率的な分散MoE推論を可能にすることをシミュレーションによって示している。
関連論文リスト
- Beyond Independent Optimization: Compression, MoE Routing, and Quantization Interactions in Multimodal Edge Intelligence [16.126063436694228]
効率的なマルチモーダル推論は、レイテンシ、メモリ、エネルギー制約の下でのマルチモーダル表現の保存、移動、ルーティング、キャッシュ、定量化のコストによって、ますます制限される。
本稿では、視覚トークン圧縮、ビデオトークン管理、KV-cache最適化、Mixture-of-Experts(MoE)ルーティング、低ビット量子化、エッジ展開、ハードウェア対応ベンチマークなど、効率的な視覚言語およびマルチモーダル大言語モデルの進歩について述べる。
論文 参考訳(メタデータ) (2026-07-23T07:03:33Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - BiCoLoR: Communication-Efficient Optimization with Bidirectional Compression and Local Training [50.334494587223304]
BiCoLoRは、ローカルトレーニングと圧縮という2つの広く使われている戦略を組み合わせた通信効率の最適化アルゴリズムである。
BiCoLoRは既存のアルゴリズムより優れており、通信効率の新たな標準を確立している。
論文 参考訳(メタデータ) (2026-01-18T13:23:27Z) - RAPID-Serve: Resource-efficient and Accelerated P/D Intra-GPU Disaggregation [0.605330409854044]
LLM推論サービスシステムに広く採用されている2つの技術は、ハイブリッドパーティショニングと分散サービスである。
ハイブリッドバッチは、異なるリクエストのプリフィルとデコードトークンを同じバッチに組み合わせて、トークン毎のレイテンシの増加によるリソース利用とスループットの向上を実現する。
これとは対照的に、リソースのアンダーユーティライゼーションとKV-cache転送オーバーヘッドを犠牲にして、サービスレベルの目的(SLO)を最適化するために、計算バウンドプリフィルと帯域幅バウンドデコードフェーズを分離する。
論文 参考訳(メタデータ) (2026-01-16T22:58:59Z) - Accelerating Distributed Deep Learning using Lossless Homomorphic
Compression [17.654138014999326]
本稿では,ワーカレベルの圧縮とネットワーク内アグリゲーションを効果的に融合する新しい圧縮アルゴリズムを提案する。
集約のスループットが6.33$times$改善され、イテレーションごとのトレーニング速度が3.74$times$アップします。
論文 参考訳(メタデータ) (2024-02-12T09:57:47Z) - Improving the Worst-Case Bidirectional Communication Complexity for Nonconvex Distributed Optimization under Function Similarity [92.1840862558718]
ダウンリンク圧縮のための新しい手法であるMARINA-Pを導入する。
置換圧縮機を用いたMARINA-Pは、作業者数に応じてサーバ間通信の複雑さを向上できることを示す。
本稿では,MARINA-Pとアップリンク圧縮とモーメントステップを組み合わせた手法であるM3を導入する。
論文 参考訳(メタデータ) (2024-02-09T13:58:33Z) - FrankenSplit: Efficient Neural Feature Compression with Shallow Variational Bottleneck Injection for Mobile Edge Computing [5.815300670677979]
資源依存型圧縮モデルのための新しいフレームワークを導入し,非対称環境下での手法を広範囲に評価する。
提案手法は精度を低下させることなく最先端のSC法よりも60%低く,既存の標準のオフロードよりも16倍高速である。
論文 参考訳(メタデータ) (2023-02-21T14:03:22Z) - Structured Sparsification with Joint Optimization of Group Convolution
and Channel Shuffle [117.95823660228537]
本稿では,効率的なネットワーク圧縮のための新しい構造空間分割法を提案する。
提案手法は, 畳み込み重みに対する構造的疎度を自動的に誘導する。
また,学習可能なチャネルシャッフル機構によるグループ間通信の問題にも対処する。
論文 参考訳(メタデータ) (2020-02-19T12:03:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。