論文の概要: HetRoute Heterogeneous and Cost-aware Collaborative Routing Framework for Distributed Edge MoE Inference
- arxiv url: http://arxiv.org/abs/2608.00577v1
- Date: Sat, 01 Aug 2026 10:30:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.784382
- Title: HetRoute Heterogeneous and Cost-aware Collaborative Routing Framework for Distributed Edge MoE Inference
- Title(参考訳): 分散エッジMOE推論のためのヘットルート不均一でコストを考慮した協調的ルーティングフレームワーク
- Authors: Xin Yuan, Ning Li, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang,
- Abstract要約: HetRouteは、分散エッジMoE推論のための異種コスト対応協調ルーティングフレームワークである。
HetRouteは平均推論遅延を59.0%、P99レイテンシを58.0%まで削減する。
- 参考スコア(独自算出の注目度): 47.0879800334801
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts (MoE) models have become a dominant architecture for large-scale AI services, yet deploying them over geo-distributed heterogeneous edge servers remains challenging. When the Top-k activated experts of a token are spread across multiple servers, the optimal routing depends jointly on cross-server link bandwidth, heterogeneous GPU computing capability, GPU-CPU expert loading delay, instantaneous queueing backlog, and replica-level quantization quality loss. Existing distributed inference and MoE serving methods address these factors separately and do not provide a unified framework for online multi-server collaborative routing. In this paper, we propose HetRoute, a heterogeneous-cost-aware collaborative routing framework for distributed edge MoE inference. HetRoute introduces a unified per-assignment cost model that explicitly captures four cost components: cross-server transmission, GPU-CPU offloading, GPU computation with queueing, and quantization-induced quality penalty. Guided by this model, the offline stage determines expert server placement, GPU-CPU residency, and replica precision through a routing-cost-coupled deployment algorithm, while the online stage routes the Top-k activated expert set as a whole by minimizing the bottleneck layer cost via exact enumeration or beam search. Theoretical analysis establishes fallback feasibility, a bound on the number of participating servers, per-layer optimality for small candidate domains, and online computational complexity. Trace-driven evaluation on three MoE models over a heterogeneous 10-server edge testbed shows that HetRoute reduces average inference latency by up to 59.0% and P99 latency by up to 58.0%, cuts cross-server traffic by up to 72.1%, and achieves 2.13x throughput improvement compared with representative baselines, while keeping quality degradation within the configured budget.
- Abstract(参考訳): Mixture-of-Experts(MoE)モデルは、大規模なAIサービスにおいて支配的なアーキテクチャとなっているが、地理的に分散した異種エッジサーバにデプロイすることは依然として難しい。
トークンのTop-kアクティベートされたエキスパートが複数のサーバに分散する場合、最適なルーティングは、クロスサーバリンク帯域幅、異種GPUコンピューティング能力、GPU-CPU専門家のロード遅延、即時キューングバックログ、レプリカレベルの量子化品質損失に共同で依存する。
既存の分散推論とMoEサービスメソッドはこれらの要因を個別に扱い、オンラインマルチサーバ協調ルーティングのための統一されたフレームワークを提供していない。
本稿では,分散エッジMoE推論のための異種コスト対応協調ルーティングフレームワークHetRouteを提案する。
HetRouteは、クロスサーバトランスミッション、GPU-CPUオフロード、キュー付きGPU計算、量子化による品質ペナルティの4つのコストコンポーネントを明示的にキャプチャする、統一されたアサインメント単位のコストモデルを導入している。
このモデルによってガイドされたオフラインステージは、ルーティングコストと結合したデプロイメントアルゴリズムを通じて、エキスパートサーバの配置、GPU-CPUの常駐、レプリカの精度を決定する一方、オンラインステージは、正確な列挙やビームサーチによってボトルネック層コストを最小化することで、Top-kアクティベートされたエキスパートセット全体をルーティングする。
理論的分析は、フォールバック実現可能性、参加するサーバ数、小さな候補ドメインに対する層ごとの最適性、オンライン計算複雑性を確立する。
不均一な10サーバエッジテストベッド上での3つのMoEモデルのトレース駆動評価は、HetRouteが平均推論遅延を59.0%、P99レイテンシを58.0%削減し、サーバ間トラフィックを72.1%削減し、代表ベースラインと比較して2.13倍のスループット向上を実現し、設定された予算内で品質劣化を維持していることを示している。
関連論文リスト
- TrimMoE A communication aware and adaptive depth framework for distributed edge inference [44.83947237773358]
Serving Mixture-of-Experts (MoE) large language model across distributed edge server is scared by cross-server expert transmission。
本稿では,TrimMoEを提案する。TrimMoEは,レイヤスキップと信頼に基づく早期退避と,代用実行とサーバ専門家の選択を結合する。
異種10サーバテストベッドでは、TrimMoEは平均レイテンシを62.8%まで削減し、クロスサーバトラフィックとリモート実行比率を下げ、負荷下で高いスループットを維持する。
論文 参考訳(メタデータ) (2026-08-01T10:19:02Z) - GeoRouteNet: Geometry-Enhanced Non-Autoregressive Neural Solver for the Traveling Salesman Problem [5.202950948929751]
GeoRouteNetはユークリッド旅行セールスマン問題(TSP)のための幾何学強化ニューラルネットワークである
モデル側では、GeoRouteNetには、中心ノード機能、学習可能なラジアル距離基底関数、距離対応グラフアテンション、LayerNorm-SwiGLUフィードフォワードブロック、層間減衰残エンコーダミキシングが組み込まれている。
トレーニング側では,インスタンス毎に複数の候補ツアーを抽出するマルチ候補自己比較強化学習(MCS-RL)を設計する。
論文 参考訳(メタデータ) (2026-06-22T02:31:22Z) - INFRAMIND: Infrastructure-Aware Multi-Agent Orchestration [18.376319491516266]
INFRAMINDは,マルチエージェントスタック全体のインフラストラクチャを意識するフレームワークである。
赤外線対応エグゼキュータは、各エージェントステップでモデルキュー毎の深さ、キャッシュ利用、レスポンス待ち時間を観察し、どのモデルを呼び出すかを決定する。
予算対応スケジューラは、各モデルのキューをさらにリオーダーして、緊急要求を先に提供する。
論文 参考訳(メタデータ) (2026-06-09T20:50:12Z) - CR^2: Cost-Aware Risk-Controlled Routing for Wireless Device-Edge LLM Inference [52.849509991178884]
大規模言語モデル(LLM)は集中型クラウドからモバイルエッジ環境に移行する。
軽量オンデバイスモデルとより強力なエッジモデルの間のクエリレベルのルーティングは、このトレードオフをナビゲートするための柔軟なメカニズムを提供する。
既存のルータは、集中クラウド設定とトークンレベルのコストの最適化のために設計されており、無線エッジデプロイメントにおける動的レイテンシとエネルギーオーバーヘッドをキャプチャできない。
論文 参考訳(メタデータ) (2026-05-12T11:50:15Z) - ConsRoute:Consistency-Aware Adaptive Query Routing for Cloud-Edge-Device Large Language Models [7.869130026927]
ConsRouteは、大規模言語モデルのための軽量でセマンティックな、適応的なルーティングフレームワークである。
ConsRouteは、エンドツーエンドのレイテンシと推論コストを40%近く削減しながら、ほぼクラウドのパフォーマンス(=95%)を達成することを示す。
論文 参考訳(メタデータ) (2026-03-22T13:54:12Z) - Efficient and Interpretable Multi-Agent LLM Routing via Ant Colony Optimization [58.59491516762626]
マルチエージェントシステム(MAS)のための効率的かつ解釈可能なルーティングフレームワークAMRO-Sを提案する。
AMRO-Sは、意味条件付き経路選択問題としてMASルーティングをモデル化し、3つのキーメカニズムを通してルーティング性能を向上させる。
5つの公開ベンチマークと高速ストレステストによる大規模な実験により、AMRO-Sは強いルーティングベースラインに対する品質-コストトレードオフを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-03-13T12:26:05Z) - RollArt: Scaling Agentic RL Training via Disaggregated Infrastructure [49.88201789074532]
エージェント強化学習(RL)は、大規模言語モデル(LLM)が自律的な意思決定と長期計画を行うことを可能にする。
分散インフラストラクチャ上でマルチタスクエージェントRLのスループットを最大化する分散システムであるRollArcを提案する。
論文 参考訳(メタデータ) (2025-12-27T11:14:23Z) - ZeroLM: Data-Free Transformer Architecture Search for Language Models [54.83882149157548]
現在の自動プロキシ発見アプローチは、検索時間の拡張、データの過度なオーバーフィットへの感受性、構造的な複雑さに悩まされている。
本稿では,効率的な重み統計によるモデルキャパシティの定量化を目的とした,新しいゼロコストプロキシ手法を提案する。
本評価は,FlexiBERT ベンチマークで Spearman's rho 0.76 と Kendall's tau 0.53 を達成し,このアプローチの優位性を示すものである。
論文 参考訳(メタデータ) (2025-03-24T13:11:22Z) - An Adaptive Device-Edge Co-Inference Framework Based on Soft
Actor-Critic [72.35307086274912]
高次元パラメータモデルと大規模数学的計算は、特にIoT(Internet of Things)デバイスにおける実行効率を制限する。
本稿では,ソフトポリシーの繰り返しによるエフェキシット点,エフェキシット点,エンフェキシット点を生成する離散的(SAC-d)のための新しい深層強化学習(DRL)-ソフトアクタ批判法を提案する。
レイテンシと精度を意識した報酬設計に基づいて、そのような計算は動的無線チャンネルや任意の処理のような複雑な環境によく適応でき、5G URLをサポートすることができる。
論文 参考訳(メタデータ) (2022-01-09T09:31:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。