論文の概要: OrderMoE: An expert similarity driven distributed edge MoE inference
- arxiv url: http://arxiv.org/abs/2607.17154v1
- Date: Sun, 19 Jul 2026 09:20:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.383958
- Title: OrderMoE: An expert similarity driven distributed edge MoE inference
- Title(参考訳): OrderMoE: 専門家による類似性駆動型分散エッジMoE推論
- Abstract要約: 本稿では,OrderMoEと呼ばれる,類似性に配慮したエキスパートアロケーションと分散デプロイメントフレームワークを紹介する。
推論レイテンシ、通信オーバヘッド、サーバのワークロード、推論品質のバランスを保ちながら、エッジMoE推論を高速化することを目指している。
実験の結果、OrderMoEは平均レイテンシ、テールレイテンシ、クロスサーバトラフィック、リモート専門家の呼び出し比率を著しく削減することがわかった。
- 参考スコア(独自算出の注目度): 46.66948323823587
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although mixture-of-experts, MoE, models have been increasingly adopted to scale large language models with moderate computation cost, it remains challenging to deploy MoE inference over resource-constrained and bandwidth-limited edge infrastructures. Existing distributed MoE serving methods mainly rely on exact expert placement, caching, replication, or communication scheduling, while overlooking the functional similarity among experts, which provides an opportunity to reduce cross-server token transmission. Therefore, this paper introduces a similarity-aware expert allocation and distributed deployment framework, dubbed OrderMoE, which aims to accelerate edge MoE inference while balancing inference latency, communication overhead, server workload, and inference quality. OrderMoE first constructs an expert similarity model based on router-induced logits representations and partitions experts in each MoE layer into multiple similarity groups. Then, it develops a similarity-aware expert grouping and deployment strategy to improve local similarity coverage across edge servers. Since reducing remote expert invocation and preserving exact inference quality are conflicting objectives, OrderMoE further designs a quality-aware and trajectory-aware runtime server-expert selection algorithm to decide whether a token should invoke its remote target expert or use a feasible local substitute expert. Experimental results on a real distributed edge testbed show that OrderMoE significantly reduces average latency, tail latency, cross-server traffic, and remote expert invocation ratio, while introducing only small and controllable inference quality degradation.
- Abstract(参考訳): 大規模言語モデルを適度な計算コストでスケールするために、ME(Mix-of-experts)モデルがますます採用されているが、リソース制約や帯域幅制限のあるエッジインフラストラクチャよりもMoE推論をデプロイすることは依然として困難である。
既存の分散MoEサービス方式は、主に専門家の正確な配置、キャッシュ、レプリケーション、通信スケジューリングに依存し、専門家間の機能的類似性を見越して、サーバ間のトークン送信を減らす機会を提供する。
そこで本稿では,予測遅延,通信オーバヘッド,サーバのワークロード,および推論品質のバランスを保ちながら,エッジMoE推論を高速化することを目的とした,類似性を考慮したエキスパートアロケーションと分散デプロイメントフレームワークであるOrderMoEを紹介する。
OrderMoEはまず、ルータが引き起こしたロジット表現に基づいて専門家の類似性モデルを構築し、各MoE層のエキスパートを複数の類似性グループに分割する。
次に、エッジサーバ間の局所的な類似性カバレッジを改善するために、類似性を意識した専門家グループとデプロイメント戦略を開発する。
リモート専門家の呼び出しを減らし、正確な推論品質を保存することは目的と矛盾するため、OrderMoEはさらに、トークンがリモートターゲットエキスパートを呼び出すべきか、あるいは実現可能なローカル代替専門家を使用するべきかを決定するために、品質を意識し、トラジェクトリを意識した実行時サーバ専門家の選択アルゴリズムを設計する。
実際の分散エッジテストベッドの実験結果から、OrderMoEは平均レイテンシ、テールレイテンシ、クロスサーバトラフィック、リモート専門家の呼び出し比率を著しく低減し、小さくて制御可能な推論品質の低下のみを導入している。
関連論文リスト
- Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation [49.8459545291965]
Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-11T02:40:58Z) - FedWeave: Rethinking the Unit of Specialization in Heterogeneous Federated MoE-LoRA [15.068543696107227]
Federated PEFTは、LLMが生のサンプルを共有することなく、分散化されたプライベートデータに協調的に適応できるようにする。
既存のメソッドは通常、クライアントの粒度を専門とし、暗黙的にタスクコヒーレントなクライアントを仮定する。
非対称アグリゲーションを採用したフレームワークであるFedWeaveを提案し、ルータ最適化から専門家アグリゲーションを分離する。
論文 参考訳(メタデータ) (2026-07-29T08:47:58Z) - Multi-level context Modeling for consistent expert selection in Mixture-of-Experts [3.4913929232937604]
Mixture-of-Experts (MoE)は、トークンを少数の専門家にルーティングすることで、Transformerモデルの効率的なスケーリングを可能にする。
既存のルータは通常、浅いあるいは孤立したトークン表現に対して専門家の選択を条件にしている。
階層間セマンティックアグリゲーションと局所トークンレベルの相互作用から補完的な信号を統合することでコンテキスト認識表現を構築するフレームワークであるMulti-level Context Fusion MOEを提案する。
論文 参考訳(メタデータ) (2026-07-17T18:22:42Z) - Multi-Domain Learning with Global Expert Mapping [102.62297074508147]
Mixture-of-Experts (MoE)モデルは、入力を専門分野(専門家)にルーティングすることでスケーラブルなソリューションを提供する。
本稿では,学習ルータをグローバルスケジューラに置き換えるプランナー・コンパイラフレームワークであるGEMを提案する。
我々のプランナーは線形プログラミングの緩和に基づいて、データセットを専門家に分数的に割り当てる一方、コンパイラはこのソフトプランを決定論的でキャパシティを意識したマッピングに変換するために階層的なラウンドリングを適用する。
実験の結果、GEM-DINOはUODBベンチマークで最先端のパフォーマンスを達成し、表現不足のデータセットに顕著な利益をもたらし、タスク干渉をわずかに解決していることがわかった。
論文 参考訳(メタデータ) (2026-04-20T21:09:34Z) - Routing by Analogy: kNN-Augmented Expert Assignment for Mixture-of-Experts [32.65737144630759]
Mixture-of-Experts (MoE)アーキテクチャは、パラメトリックな"router"を使用して、トークンを専門家のまばらなサブセットにディスパッチすることで、大きな言語モデルを効率的にスケールする。
我々は、類似したケースのメモリから最適な専門家の割り当てを再利用する検索強化ルーティングフレームワークであるkNN-MoEを紹介する。
実験の結果、kNN-MoEはゼロショットベースラインよりも優れており、計算コストのかかる微調整に匹敵することがわかった。
論文 参考訳(メタデータ) (2026-01-05T14:16:11Z) - RepetitionCurse: Measuring and Understanding Router Imbalance in Mixture-of-Experts LLMs under DoS Stress [16.010076395422264]
分配不能のプロンプトはルーティング戦略を操作でき、特定のデバイス上で計算ボトルネックを発生させ、他のデバイスにアイドルを強いる。
この脆弱性を悪用するための低コストなブラックボックス戦略であるRepetitionCurseを提案する。
論文 参考訳(メタデータ) (2025-12-30T05:24:26Z) - Cluster Topology-Driven Placement of Experts Reduces Network Traffic in MoE Inference [49.141930185079325]
提案する整数線形プログラム(ILP)は,期待される送信数を最小限に抑え,専門家の最適な配置を決定する。
ILPベースの配置戦略は,小型モデル(DeepSeekMoE16B)や大規模モデル(DeepSeek-R1671B)と比較してネットワークトラフィックが低いことを示す。
論文 参考訳(メタデータ) (2025-08-12T07:08:48Z) - RouteMark: A Fingerprint for Intellectual Property Attribution in Routing-based Model Merging [69.2230254959204]
我々は,統合されたMoEモデルにおけるIP保護のためのフレームワークであるRouteMarkを提案する。
我々の重要な洞察は、タスク固有の専門家は、探索入力の下で安定かつ独特なルーティング行動を示すことである。
属性と改ざん検出のために,類似性に基づくマッチングアルゴリズムを導入する。
論文 参考訳(メタデータ) (2025-08-03T14:51:58Z) - Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design [59.00758127310582]
本稿では、事前学習された高密度LCMをより小さなMoEモデルに変換する新しいフレームワークRead-MEを提案する。
当社のアプローチでは,専門家の抽出にアクティベーション空間を用いる。
Read-MEは、同様のスケールの他の人気のあるオープンソース高密度モデルよりも優れています。
論文 参考訳(メタデータ) (2024-10-24T19:48:51Z) - Expert-Token Resonance MoE: Bidirectional Routing with Efficiency Affinity-Driven Active Selection [19.365009652356793]
エキスパート-トークン共鳴(ETR)は、専門家-トークン相互作用を再想像する理論的な双方向ルーティング機構である。
ETRは、ベースラインのMoE実装と比較して、エンドツーエンドのトレーニング効率が5.4%-46.6%向上している。
論文 参考訳(メタデータ) (2024-05-24T02:50:44Z) - MoEC: Mixture of Expert Clusters [93.63738535295866]
Sparsely Mixture of Experts (MoE)は、安価な計算オーバーヘッドを持つ有望なスケーリング能力のため、大きな関心を集めている。
MoEは密度の高い層をスパースの専門家に変換し、ゲートルーティングネットワークを使用して専門家を条件付きで活性化させる。
しかし、専門家の数が増加するにつれて、乱雑なパラメータを持つMoEはデータアロケーションの過度な調整とスパースに悩まされる。
論文 参考訳(メタデータ) (2022-07-19T06:09:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。