論文の概要: Self-Routing: Parameter-Free Expert Routing from Hidden States
- arxiv url: http://arxiv.org/abs/2604.00421v1
- Date: Wed, 01 Apr 2026 03:05:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.810804
- Title: Self-Routing: Parameter-Free Expert Routing from Hidden States
- Title(参考訳): 自己ルーティング:隠れた状態からパラメータフリーのエキスパートルーティング
- Authors: Jama Hussein Mohamud, Drew Wagner, Mirco Ravanelli,
- Abstract要約: Mixture-of-Experts (MoE)レイヤは、トークンごとに専門家の小さなサブセットをアクティベートすることで、モデルのキャパシティを向上する。
本稿では,トークン隠蔽状態の指定された部分空間を専門家のロジットとして直接使用するパラメータフリーなルーティング機構であるSelf-Routingを提案する。
- 参考スコア(独自算出の注目度): 14.018297453424454
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts (MoE) layers increase model capacity by activating only a small subset of experts per token, and typically rely on a learned router to map hidden states to expert assignments. In this work, we ask whether a dedicated learned router is strictly necessary in the MoE settings we study. We propose Self-Routing, a parameter-free routing mechanism that uses a designated subspace of the token hidden state directly as expert logits, eliminating the router projection entirely while leaving the rest of the MoE layer unchanged. We evaluate Self-Routing on GPT-2-scale language modeling and ImageNet-1K classification by comparing it against a standard learned router, random-routing baselines, and dense non-MoE baselines. Our results show that Self-Routing remains competitive with the learned-router baseline while removing all dedicated routing parameters, and yields more balanced expert utilization, with about 17 % higher average normalized routing entropy and no explicit load-balancing loss. On ImageNet-1K with DeiT-S/16, Self-Routing also slightly improves over the corresponding learned-router MoE. These findings suggest that effective MoE routing can emerge from the hidden representation itself without requiring a separate learned router module.
- Abstract(参考訳): Mixture-of-Experts (MoE) レイヤはトークン単位のエキスパートのサブセットを活性化することでモデルキャパシティを向上し、典型的には隠れた状態を専門家の割り当てにマップするために学習されたルータに依存する。
本研究では,研究対象のMoE設定において,専用ルータが厳密に必要かどうかを問う。
トークン隠蔽状態の指定された部分空間を専門家のロジットとして直接使用するパラメータフリーなルーティング機構であるSelf-Routingを提案する。
我々は、GPT-2スケールの言語モデリングとImageNet-1K分類を、標準学習ルータ、ランダムルーティングベースライン、高密度非MoEベースラインと比較することで評価する。
以上の結果から,自己ルーティングは学習ルータベースラインとの競合を保ちながら,全ての専用ルーティングパラメータを除去し,平均正規化ルーティングエントロピーを約17%高め,負荷分散損失を負わない,よりバランスの取れた専門家の利用率を高めることが示唆された。
DeiT-S/16のImageNet-1Kでは、学習ルータMoEよりも若干改善されている。
これらの結果は、学習ルータモジュールを別途必要とせずに、効果的なMoEルーティングが隠蔽表現自体から現れることを示唆している。
関連論文リスト
- ReMix: Reinforcement routing for mixtures of LoRAs in LLM finetuning [85.39146836671897]
低ランクアダプタ(LoRAs)は、トレーニング可能な低ランク行列をトレーニング済みモデルに注入し、新しいタスクに適応するパラメータ効率の微調整技術である。
既存のMixture-of-LoRAsルータは学習したルーティングウェイトを各LoRAに割り当て、ルータのエンドツーエンドのトレーニングを可能にする。
Reinforcement Routing for Mixture-of-LoRAs (ReMix) と呼ばれる新しいルータを提案する。
論文 参考訳(メタデータ) (2026-03-10T18:51:27Z) - L2R: Low-Rank and Lipschitz-Controlled Routing for Mixture-of-Experts [49.90176890917986]
ルーティング空間とスコアリング幾何の両方を共用する統一的なルーティングフレームワークであるL2Rを提案する。
L2Rは、共有低ランク遅延ルーティング空間で専門家の割り当てを行い、ルーティング関数のリプシッツ挙動を明示的に制御するために飽和内積スコーリング(SIPS)を導入している。
大規模言語MoEモデルとImageNet上のビジョンMoE設定の実験では、L2Rはルーティングの安定性、専門家の専門化、モデル全体のパフォーマンスを一貫して改善している。
論文 参考訳(メタデータ) (2026-01-29T07:18:33Z) - Routing by Analogy: kNN-Augmented Expert Assignment for Mixture-of-Experts [32.65737144630759]
Mixture-of-Experts (MoE)アーキテクチャは、パラメトリックな"router"を使用して、トークンを専門家のまばらなサブセットにディスパッチすることで、大きな言語モデルを効率的にスケールする。
我々は、類似したケースのメモリから最適な専門家の割り当てを再利用する検索強化ルーティングフレームワークであるkNN-MoEを紹介する。
実験の結果、kNN-MoEはゼロショットベースラインよりも優れており、計算コストのかかる微調整に匹敵することがわかった。
論文 参考訳(メタデータ) (2026-01-05T14:16:11Z) - From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing [52.01745035243826]
Mixture-of-Experts (MoE)モデルは、各トークンを専門家のサブセットにルーティングすることで、パラメータキャパシティをスケールすることができる。
条件付きルーティングは、推論メモリの負荷をシフトし、デバイスごとに専門家の数を制限する。
本稿では,精度を保ちながら負荷のバランスをとるプラグイン・アンド・プレイ型推論時ルーティングアルゴリズムLASERを提案する。
論文 参考訳(メタデータ) (2025-09-29T16:29:17Z) - Optimizing MoE Routers: Design, Implementation, and Evaluation in Transformer Models [0.0]
Mixture of Experts (MoE)アーキテクチャは言語モデルのスケーラビリティを向上するが、そのパフォーマンスはトークンを専門の専門家に移すルータモジュールに依存している。
この研究は、MoEルータの設計の比較分析を提供し、その性能を効率的かつ効率的な大規模モデル展開のために最適化するための洞察を提供する。
論文 参考訳(メタデータ) (2025-06-19T15:55:43Z) - Universal Model Routing for Efficient LLM Inference [69.86195589350264]
モデルルーティングは,大規模言語モデル(LLM)の推論コストを削減する手法である
動的ルーティング問題に対する新しいアプローチであるUniRouteを提案する。
これらは理論的に最適なルーティングルールの推定であり、過大なリスクバウンドによってそれらのエラーを定量化する。
論文 参考訳(メタデータ) (2025-02-12T20:30:28Z) - ReMoE: Fully Differentiable Mixture-of-Experts with ReLU Routing [28.73697327316267]
計算予算を増大させることなく、モデルキャパシティをスケールアップするために、緩やかに活性化されたMixture-of-Experts (MoE)モデルが広く採用されている。
我々は,従来のTopK+Softmaxルーティングの簡易かつ効果的なドロップイン置換を提供する,完全に微分可能なMoEアーキテクチャであるReMoEを提案する。
ReMoEは、さまざまなモデルサイズ、専門家数、粒度のレベルにおいて、バニラTopKのMoEを一貫して上回る。
論文 参考訳(メタデータ) (2024-12-19T10:21:20Z) - Routers in Vision Mixture of Experts: An Empirical Study [26.51711534240885]
Mixture-of-Experts (MoE)モデルは、計算コストを大幅に増加させることなく、モデル容量をスケールアップする有望な方法である。
MoEsの主要なコンポーネントはルータであり、どのパラメータ(専門家)プロセスのサブセットが埋め込み(トークン)を特徴付けるかを決定する。
論文 参考訳(メタデータ) (2024-01-29T08:58:07Z) - Patch-level Routing in Mixture-of-Experts is Provably Sample-efficient
for Convolutional Neural Networks [74.68583356645276]
ディープラーニングでは、Mixix-of-experts(MoE)が、サンプル単位またはトーケン単位で専門家(サブネットワーク)を活性化する。
我々は,pMoEが適切な一般化を実現するために,必要なトレーニングサンプル数を確実に削減できることを初めて示す。
論文 参考訳(メタデータ) (2023-06-07T00:16:10Z) - StableMoE: Stable Routing Strategy for Mixture of Experts [109.0602120199226]
Mixture-of-Experts (MoE)技術は、安価な計算オーバーヘッドでトランスフォーマーのモデルサイズをスケールアップすることができる。
本稿では、ルーティング変動問題に対処する2つのトレーニング段階を持つStableMoEを提案する。
その結果,StableMoEは収束速度と性能の両面で既存のMoE法よりも優れていた。
論文 参考訳(メタデータ) (2022-04-18T16:48:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。