論文の概要: Sticky Routing: Training MoE Models for Memory-Efficient Inference
- arxiv url: http://arxiv.org/abs/2607.08780v1
- Date: Fri, 12 Jun 2026 23:47:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.35244
- Title: Sticky Routing: Training MoE Models for Memory-Efficient Inference
- Title(参考訳): Sticky Routing: メモリ効率の良い推論のためのMoEモデルのトレーニング
- Authors: Ali Kayyam,
- Abstract要約: StickyMoEは、隣接するトークン間の急激な専門家スイッチをペナライズする。
ポストホックメソッドとは異なり、StickyMoEはエキスパート表現とルーティング決定を、最初のトレーニングステップから共適応させる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts (MoE) models activate only a sparse subset of experts per token, yet consecutive tokens frequently activate different experts -- causing constant weight swapping between slow storage and fast memory on edge devices. Existing remedies are either system-level (caching heuristics) or post-hoc (router fine-tuning), leaving the root cause unchanged during pretraining. We propose StickyMoE, a differentiable routing consistency loss that penalises abrupt expert switches between adjacent tokens, encouraging the router to maintain the same expert assignment across semantically coherent spans. StickyMoE requires no architectural changes, adds a single hyperparameter lambda, and unlike post-hoc methods, allows expert representations and routing decisions to co-adapt from the first training step. Experiments on small-scale MoE language models show that StickyMoE reduces the expert switch rate by up to 60% with less than 4% perplexity degradation, Pareto-dominating post-hoc fine-tuning on the quality-locality frontier. Routing temporal locality is most efficiently instilled at training time.
- Abstract(参考訳): Mixture-of-Experts(MoE)モデルはトークンごとに専門家のスパースサブセットのみを活性化するが、連続するトークンは異なる専門家を頻繁に活性化する。
既存の治療法は、システムレベル(キャッシュヒューリスティックス)またはポストホック(ルーターの微調整)のいずれかであり、事前訓練中に根本原因が変わらない。
我々は,隣接するトークン間の急激な専門家スイッチを解析し,ルータがセマンティック・コヒーレントなスパンにまたがって同じ専門家の割り当てを維持することを奨励する,微分可能なルーティング整合性損失であるStickyMoEを提案する。
StickyMoEはアーキテクチャの変更を必要とせず、単一のハイパーパラメータラムダを追加している。
小規模のMoE言語モデルを用いた実験では、StickyMoEはエキスパートの切り替え率を最大60%削減し、パープレキシティ劣化は4%以下である。
時間的局所性は、トレーニング時に最も効率的に注入される。
関連論文リスト
- Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models [50.34585122347149]
これは連続的なトランスフォーマー層にまたがるエキスパートパラメータを共有するアーキテクチャ修正である。
我々は、OLMoE、Qwen3、DeepSeekスタイルのMoEなど、一般的な最先端アーキテクチャにおけるこのアプローチを評価した。
論文 参考訳(メタデータ) (2026-06-15T15:08:09Z) - When Model Merging Breaks Routing: Training-Free Calibration for MoE [67.27839627141972]
Hessian-Aware Router (HARC) は、二階曲率情報を利用してマージされたルータを認識できるトレーニングフリーのフレームワークである。
数学的推論とコード生成タスクの実験は、HARCが様々なMoEマージベースライン間のルーティングの分解を効果的に軽減していることを示している。
論文 参考訳(メタデータ) (2026-06-02T09:33:33Z) - Dynamic Mixture of Latent Memories for Self-Evolving Agents [57.20419419302731]
MoLEMは、動的混合(MoE)に基づく潜在メモリフレームワークの生成混合物である。
我々は、数学、科学、コードドメインにまたがる連続的な学習シーケンスに基づいて、このフレームワークを訓練する。
連続学習を完了した後、Vanilla事前学習ベースラインよりも平均精度を10.40%向上させる。
論文 参考訳(メタデータ) (2026-05-21T03:35:10Z) - Dense Backpropagation Improves Training for Sparse Mixture-of-Experts [42.583124646425084]
そこで本研究では,MoEルータのパラメータを緩やかに活性化しながら,高密度勾配更新を行う軽量近似法を提案する。
私たちのデフォルトのMoEは、計算オーバーヘッドをかなり必要とせずに、様々な設定で標準のTopKルーティングより優れています。
論文 参考訳(メタデータ) (2025-04-16T19:55:36Z) - Mixture Compressor for Mixture-of-Experts LLMs Gains More [71.0473038084673]
我々は、Mixture-of-Experts Large Language Model (MoE-LLMs) のためのトレーニング不要なMixture-Compressorを提案する。
我々のMCは静的量子化と動的プルーニングを統合し、より少ない精度でMoE-LLMの極端な圧縮を実現する。
例えば、2.54ビットでは、MCは76.6%を圧縮し、平均精度損失は3.8%である。
論文 参考訳(メタデータ) (2024-10-08T18:09:38Z) - SMILE: Scaling Mixture-of-Experts with Efficient Bi-level Routing [47.11171833082974]
我々は、異種ネットワーク帯域を利用するSMILEを導入し、シングルステップのルーティングをバイレベルルーティングに分割する。
提案手法は, コンバージェンス速度を損なうことなく, コロッサルクリーンクローリングコーパスのプリトレーニングスループットにおいて, スイッチ変換器の2.5倍の高速化が得られることを示す。
論文 参考訳(メタデータ) (2022-12-10T03:44:16Z) - StableMoE: Stable Routing Strategy for Mixture of Experts [109.0602120199226]
Mixture-of-Experts (MoE)技術は、安価な計算オーバーヘッドでトランスフォーマーのモデルサイズをスケールアップすることができる。
本稿では、ルーティング変動問題に対処する2つのトレーニング段階を持つStableMoEを提案する。
その結果,StableMoEは収束速度と性能の両面で既存のMoE法よりも優れていた。
論文 参考訳(メタデータ) (2022-04-18T16:48:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。