論文の概要: Elbow-Based MoE Routing: A Training-Free Inference Time Plugin for Expert Selection
- arxiv url: http://arxiv.org/abs/2608.04401v1
- Date: Wed, 05 Aug 2026 03:10:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.699896
- Title: Elbow-Based MoE Routing: A Training-Free Inference Time Plugin for Expert Selection
- Title(参考訳): Elbow-based MoE Routing: エキスパート選択のためのトレーニング不要推論時間プラグイン
- Authors: Robin Pan, Raymond Liu, Daniel Fang, Adelina Andrei, Rosa Wu,
- Abstract要約: Mixture-of-Experts (MoE)モデルは、低推論時間計算を維持しながらモデルスケーリングを可能にする。
我々は,訓練不要な推論時間修正である肘ベースのルーティングを導入し,一人あたりのエキスパート数を動的に調整する。
最先端のMoEモデルの実験では、6つのベンチマークで精度を維持しながら平均遅延時間を5.3%削減した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-Experts (MoE) models enable model scaling while maintaining low inference-time compute by activating only a subset of experts per token. However, conventional routing relies on a fixed top-k selection, forcing the model to spend the same compute regardless of how many experts are relevant. We introduce elbow-based routing, a training-free inference-time modification that dynamically adjusts the number of experts on a per-token basis. Our method examines the sorted router probability distribution and identifies an elbow point that separates high- and low-probability experts. We find that most router distributions exhibit clear inflection points suitable for this strategy, and we show both theoretically and empirically that elbow-based routing preserves expert load balance. Experiments on a state-of-the-art MoE model demonstrate an average latency reduction of 5.3% while maintaining accuracy across six benchmarks.
- Abstract(参考訳): Mixture-of-Experts (MoE)モデルは、トークン当たりのエキスパートのサブセットのみを活性化することにより、低推論時間計算を維持しながらモデルスケーリングを可能にする。
しかし、従来のルーティングは固定されたトップk選択に依存しており、専門家の数に関係なくモデルに同じ計算を使わざるを得ない。
我々は,訓練不要な推論時間修正である肘ベースのルーティングを導入し,一人あたりのエキスパート数を動的に調整する。
提案手法は、ソートしたルータの確率分布を調べ、高い確率と低確率のエキスパートを分離する肘点を同定する。
多くのルータ分布は、この戦略に適した明確な偏向点を示しており、エルボベースのルーティングが専門家の負荷バランスを保っていることを理論的および経験的に示している。
最先端のMoEモデルの実験では、6つのベンチマークで精度を維持しながら平均遅延時間を5.3%削減した。
関連論文リスト
- Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression [74.00650541246374]
そこで本研究では,MoEモデルに適した構造解析フレームワークを提案する。
我々のアプローチはメモリフットプリントを5.27$times削減し、最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-16T06:53:27Z) - ProbMoE: Differentiable Probabilistic Routing for Mixture-of-Experts [32.864092506780004]
Mixture-of-Experts (MoE)モデルはトークンごとに少数の専門家を活性化することでスケールする。
本稿では,確率的ルーティングフレームワークProbMoEを紹介する。
論文 参考訳(メタデータ) (2026-06-01T00:16:36Z) - Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts [74.40169987564724]
エキスパート並列性(EP)は、複数のデバイスに専門家を分散させることで、MoEモデルをスケールするように設計されている。
極端な不均衡の下で、EPは少数の専門家に不均等な数のトークンを渡し、計算とメモリバウンドの障害を引き起こす。
本稿では,過剰なトークンと関連する専門家パラメータを過負荷デバイスから未利用デバイスへ動的に再帰する新しいEPアルゴリズムであるLast-Loaded Expert Parallelism (LLEP)を提案する。
論文 参考訳(メタデータ) (2026-01-23T18:19:15Z) - Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert models [52.502867924372275]
Mixture-of-Experts (MoE)モデルは、スパース専門家のアクティベーションを通じて効率的なスケーリングを実現するが、デプロイメントの分散シフトによる最適以下のルーティング決定に悩まされることが多い。
我々は、外部の監視やデータなしで、テキスト生成中にMoEルーティング決定を継続的に適用するテキストタデータフリーオンラインテストタイムフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-16T16:24:36Z) - Mixture of Efficient Diffusion Experts Through Automatic Interval and Sub-Network Selection [63.96018203905272]
本稿では, 事前学習した拡散モデルを用いて, 効率の良い専門家の混入を図り, サンプリングコストを削減することを提案する。
提案手法であるDiffPruningの有効性を,複数のデータセットで示す。
論文 参考訳(メタデータ) (2024-09-23T21:27:26Z) - Adapted-MoE: Mixture of Experts with Test-Time Adaption for Anomaly Detection [10.12283550685127]
そこで本稿では,同カテゴリの複数の分布を分割・分割して処理するAdapted-MoEを提案する。
具体的には,同じカテゴリのサンプルをサブクラスの特徴空間にルーティングする表現学習に基づくルーティングネットワークを提案する。
本研究では,未確認のサンプル表現と専門家モデルで学習した特徴分布の偏りを取り除くために,テスト時間適応を提案する。
論文 参考訳(メタデータ) (2024-09-09T13:49:09Z) - Soft Merging of Experts with Adaptive Routing [38.962451264172856]
適応ルーティングによるエキスパートのソフトマージ(SMEAR)について紹介する
SMEARは、専門家のパラメータの重み付け平均を通して構築された単一の「マージされた」専門家を使用することで、離散的なルーティングを避ける。
我々は,メタデータに基づいた経路モデルや,勾配推定によるスパースルーティングを学習するSMEARモデルを用いたモデルの有効性を実証的に検証した。
論文 参考訳(メタデータ) (2023-06-06T15:04:31Z) - On the Representation Collapse of Sparse Mixture of Experts [102.83396489230375]
専門家のまばらな混合は、一定の計算オーバーヘッドを必要としながら、より大きなモデルキャパシティを提供する。
入力トークンを隠された表現に従ってベストマッチした専門家に分散するためにルーティング機構を使用する。
しかし、そのようなルーティングメカニズムを学ぶことで、専門家のセントロイドを中心にトークンのクラスタリングが促進され、表現の崩壊の傾向が示唆される。
論文 参考訳(メタデータ) (2022-04-20T01:40:19Z) - Distributionally Robust Models with Parametric Likelihood Ratios [123.05074253513935]
3つの単純なアイデアにより、より広いパラメトリックな確率比のクラスを用いてDROでモデルを訓練することができる。
パラメトリック逆数を用いてトレーニングしたモデルは、他のDROアプローチと比較して、サブポピュレーションシフトに対して一貫して頑健であることがわかった。
論文 参考訳(メタデータ) (2022-04-13T12:43:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。