論文の概要: CIPHER-MoE: Balancing Efficiency and Routing Fidelity in Trillion-Scale MoE Training
- arxiv url: http://arxiv.org/abs/2610.05744v1
- Date: Mon, 05 Oct 2026 03:51:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 04:44:19.013177
- Title: CIPHER-MoE: Balancing Efficiency and Routing Fidelity in Trillion-Scale MoE Training
- Title(参考訳): CIPHER-MoE:Trillion-Scale MoE トレーニングにおける効率性とルーティングの整合性
- Abstract要約: Mixture-of-Experts (MoE)は最近の大規模言語モデル(LLM)アーキテクチャで広く採用されている。
非均一なトークンルーティングは、専門家やデバイス間で高度に不均衡なワークロードを引き起こす可能性がある。
CIPHER-MoEは、ルータのトークン側のTop-Kの選択を変更せずにMoEのワークロードの不均衡を緩和する。
- 参考スコア(独自算出の注目度): 23.265801521907417
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-Experts (MoE) has been widely adopted in recent large language model (LLM) architectures. However, scaling up MoE in LLM training introduces system-level challenges on training, where non-uniform token routing can lead to highly imbalanced workloads across experts and devices, further destabilizing the training process. With trillion-scale LLMs, imbalanced expert workloads further amplify the resource cost of MoE training, resulting in degraded training efficiency and hardware utilization for underloaded experts, while hot experts require additional resources to accommodate excessive workloads. Recent studies address imbalanced MoE training through intricate parallelism strategies or resource reallocation. However, these system-level approaches often introduce additional resource requirements and considerable orchestration complexity, which become increasingly difficult to afford when training trillion-parameter LLMs under constrained computational resources. This work introduces CIPHER-MoE, which mitigates MoE workload imbalance while keeping the router's token-side Top-K selection unchanged. CIPHER-MoE applies affinity-aware Expert-to-Token filtering with explicit capacity control to reduce hotspot expert workloads without additional hardware resources or complex runtime design. The proposed method has been evaluated on large-scale MoE models, including DeepSeek-V4-Pro, showing up to 64.9 percentage points Top-1 expert workload reduction and 1.10$\times$-1.94$\times$ training acceleration, while preserving the training quality. The source code will be released soon.
- Abstract(参考訳): Mixture-of-Experts (MoE)は最近の大規模言語モデル(LLM)アーキテクチャで広く採用されている。
しかし、LLMトレーニングにおけるMoEのスケールアップは、トレーニングにおけるシステムレベルの課題を導入し、非均一なトークンルーティングによって専門家やデバイス間で高度に不均衡なワークロードが発生し、さらにトレーニングプロセスが不安定になる。
数兆規模のLLMでは、不均衡な専門家ワークロードによって、MoEトレーニングのリソースコストがさらに向上し、過負荷のエキスパートのトレーニング効率とハードウェア利用が低下する一方、ホットエキスパートは過剰なワークロードに対応するために追加のリソースを必要とします。
最近の研究は、複雑な並列性戦略や資源再配置による不均衡なMoEトレーニングに対処している。
しかし、これらのシステムレベルのアプローチは、しばしば追加のリソース要件とかなりのオーケストレーションの複雑さを導入し、制約された計算資源の下で1兆パラメートルのLSMをトレーニングする際には、手頃な価格になる。
この研究はCIPHER-MoEを導入し、これはMoEのワークロードの不均衡を軽減し、ルータのトークン側のTop-K選択をそのまま維持する。
CIPHER-MoEは、ハードウェアリソースや複雑なランタイム設計を必要とせずに、ホットスポットの専門家ワークロードを削減するために、明示的なキャパシティ制御を備えたアフィニティ対応のExpert-to-Tokenフィルタを適用している。
提案手法はDeepSeek-V4-Proを含む大規模MoEモデルで評価され、トレーニング品質を維持しつつ、64.9%のTop-1エキスパートワークロード削減と1.10$\times$-1.94$\times$トレーニングアクセラレーションが得られた。
ソースコードはまもなくリリースされる予定だ。
関連論文リスト
- ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning [25.56589176139082]
既存のMoEトレーニングシステムは、将来の専門家の需要を予測するために、過去の負荷に依存しているため、急激な変動の下では効果が低下する。
本稿では,RLのロールアウトトレーニングワークフロー,ルーティングリプレイにおいて,ユニークな機会を利用するMoE RLトレーニングシステムであるReLibraを提案する。
ReLibraは2つのMoEロードバランシング機構をバッチ間およびバッチ内タイムスケールに配置し、通信パターンを階層的なネットワーク帯域幅に合わせる。
論文 参考訳(メタデータ) (2026-05-09T03:18:50Z) - Adaptive and Fine-grained Module-wise Expert Pruning for Efficient LoRA-MoE Fine-Tuning [22.981851203999614]
LoRA-MoEはパラメータ効率の良い微調整のための効果的なパラダイムとして登場した。
既存のLoRA-MoEフレームワークは通常、下流モジュールにまたがる固定かつ均一なトランスフォーマーを採用する。
本稿では,動的モジュールワイド・エキスパート・プルーニングに基づくLoRA-MoEファインチューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-29T06:45:44Z) - MoEless: Efficient MoE LLM Serving via Serverless Computing [14.858661450986794]
MoElessは、専門家の負荷不均衡を緩和し、サーバーレスの専門家による推論を加速する、最初のサーバレスMoEサービスフレームワークである。
MoElessは軽量で層対応の予測器を使用して、入ってくる専門家の負荷分布を正確に推定し、ストラグラーを積極的に識別する。
MoElessは、最先端のソリューションと比較して、推論レイテンシを43%削減し、推論コストを84%削減する。
論文 参考訳(メタデータ) (2026-03-06T14:58:16Z) - A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs [64.8510381475827]
SMOE(Sparse Mixture-of-Experts)アーキテクチャは、大規模言語モデルを効率的にスケールするためにますます使われている。
SMoEモデルは専門家間で厳しい負荷不均衡に悩まされることが多く、専門家のごく一部がほとんどのトークンを受け取り、他のモデルは未利用である。
推定中のエキスパートルーティングの体系的解析を行い, (i) 負荷不均衡が持続し, バッチサイズが大きくなる, (ii) 選択頻度が, 専門家の重要度を確実に反映しない, (iii) 専門家の全体負荷と重要性を, キャリブレーションセットを用いて推定できる,という3つの知見を同定する。
論文 参考訳(メタデータ) (2026-02-23T15:11:16Z) - xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning [104.63494870852894]
我々は,学習したルータが直接応答するか,あるいは1つ以上の外部モデルを呼び出すことができるツールコールベースのルーティングシステム x を提案する。
当社の実装には、報酬とコスト会計を含む、完全な強化学習フレームワークが含まれています。
さまざまなベンチマークで、xはコストパフォーマンスのトレードオフを強く達成します。
論文 参考訳(メタデータ) (2025-10-09T16:52:01Z) - Federated Fine-Tuning of Sparsely-Activated Large Language Models on Resource-Constrained Devices [41.84571097603175]
大規模言語モデル (LLM) のファインチューニングは, 膨大な計算量と参加者の資源制約のため, 困難である。
制約コンピューティングリソースの参加者間でMoEベースのLLMの微調整を可能にするシステムであるFLUXを提案する。
FLUXは既存の手法よりも優れており、時間と精度で最大4.75倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2025-08-26T14:39:00Z) - HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference [54.40808356999408]
フレキシブルで効率的なMoE推論を実現するための混合精度専門家オフロードシステムHOBBITを提案する。
キーとなる洞察は、重要でないキャッシュミスの専門家を低い精度で動的に置き換えることで、専門家のロード遅延を大幅に削減できるということです。
HOBBITは、最先端のMoEオフロードシステムと比較して、デコードで最大9.93倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2024-11-03T04:25:46Z) - Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design [59.00758127310582]
本稿では、事前学習された高密度LCMをより小さなMoEモデルに変換する新しいフレームワークRead-MEを提案する。
当社のアプローチでは,専門家の抽出にアクティベーション空間を用いる。
Read-MEは、同様のスケールの他の人気のあるオープンソース高密度モデルよりも優れています。
論文 参考訳(メタデータ) (2024-10-24T19:48:51Z) - MoExtend: Tuning New Experts for Modality and Task Extension [61.29100693866109]
MoExtendは、Mixture-of-Experts (MoE)モデルのモダリティ適応と拡張を効率化する効果的なフレームワークである。
MoExtendは、新しいエキスパートをトレーニング済みのMoEモデルにシームレスに統合し、トレーニング済みのモデルをチューニングすることなく、新しい知識を提供する。
論文 参考訳(メタデータ) (2024-08-07T02:28:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。