論文の概要: Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation
- arxiv url: http://arxiv.org/abs/2608.10392v1
- Date: Tue, 11 Aug 2026 02:40:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.868867
- Title: Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation
- Title(参考訳): 共有ファースト, 残る経路: Token-Adaptive MoE 計算のための統一フレームワーク
- Authors: Gongli Zhang, Zhulin Liu, C. L. Philip Chen,
- Abstract要約: Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
- 参考スコア(独自算出の注目度): 49.8459545291965
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-experts (MoE) models have recently moved beyond routing a fixed number of complete experts. Shared-expert designs preserve reusable knowledge, fine-grained methods vary computation within experts, and dynamic routers adapt the number of active experts. Yet these decisions are usually made independently, overlooking a basic dependency: extracting reusable computation changes both what remains and how much expert capacity the remainder needs. We study this dependency by decomposing sparsely upcycled feed-forward experts into key-value channels. Co-activated experts align at a subset of value positions; removing these positions changes expert preference; and greater shared coverage is associated with lower residual expert demand. These observations lead to one principle: share first, then route what remains. We instantiate it in UniF-MoE, a unified framework for token-adaptive MoE computation. Each expert is partitioned into aligned blocks. A shared-demand score sets the shared block count and pathway weight, key prototypes select the shared content, and the complementary demand determines the residual expert count through cumulative routing mass. A Gram regularizer separates and normalizes router embeddings, promoting diverse routing directions, sparse expert overlap, and a simple routing geometry. Experiments on DomainBed and GLUE show that this unified design improves predictive performance over representative static and dynamic MoEs while reducing activated computation, inference latency, and memory. Code is available at https://github.com/existence0420/UniF-MoE.
- Abstract(参考訳): Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
共有専門家の設計は再利用可能な知識を保存し、きめ細かい方法は専門家の計算量を変え、動的ルータはアクティブな専門家の数に適応する。
しかし、これらの決定は通常、基本的な依存関係を見越して、独立して行われます。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
共同アクティベートされた専門家は、価値ポジションのサブセットに整合し、これらのポジションを削除すれば専門家の好みが変わる。
これらの観察は、まず共有し、残りをルートする、という1つの原則につながります。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
各エキスパートは、整列ブロックに分割される。
共有要求スコアは、共有ブロック数と経路重みを設定し、キープロトタイプは共有コンテンツを選択し、補完要求は累積ルーティング質量を介して残留専門家数を決定する。
グラマー正規化器は、ルータの埋め込みを分離し、正規化し、多様なルーティング方向を推進し、スパースなエキスパートオーバーラップと単純なルーティング幾何を行う。
DomainBedとGLUEの実験では、この統一設計により、アクティブな計算、推論レイテンシ、メモリを削減しつつ、静的および動的なMoEよりも予測性能が向上することが示された。
コードはhttps://github.com/existence0420/UniF-MoEで入手できる。
関連論文リスト
- OrderMoE: An expert similarity driven distributed edge MoE inference [46.66948323823587]
本稿では,OrderMoEと呼ばれる,類似性に配慮したエキスパートアロケーションと分散デプロイメントフレームワークを紹介する。
推論レイテンシ、通信オーバヘッド、サーバのワークロード、推論品質のバランスを保ちながら、エッジMoE推論を高速化することを目指している。
実験の結果、OrderMoEは平均レイテンシ、テールレイテンシ、クロスサーバトラフィック、リモート専門家の呼び出し比率を著しく削減することがわかった。
論文 参考訳(メタデータ) (2026-07-19T09:20:21Z) - Multi-level context Modeling for consistent expert selection in Mixture-of-Experts [3.4913929232937604]
Mixture-of-Experts (MoE)は、トークンを少数の専門家にルーティングすることで、Transformerモデルの効率的なスケーリングを可能にする。
既存のルータは通常、浅いあるいは孤立したトークン表現に対して専門家の選択を条件にしている。
階層間セマンティックアグリゲーションと局所トークンレベルの相互作用から補完的な信号を統合することでコンテキスト認識表現を構築するフレームワークであるMulti-level Context Fusion MOEを提案する。
論文 参考訳(メタデータ) (2026-07-17T18:22:42Z) - Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts [49.09151538536423]
Mixture-of-experts (MoE)モデルはトークンごとに専門家のサブセットだけを活性化することでスケーラブルなトランスフォーマーアーキテクチャを実現する。
最近の証拠は、より粒度の細かい専門家、すなわち、少数の大きな専門家ではなく、多くの小さな専門家によって、パフォーマンスが向上することを示している。
ベクトル量子化(VQ)に基づく逆インデックス型ルーティングアーキテクチャである MoE (AIR-MoE) の適応型逆インデックスルーティングを導入する。
論文 参考訳(メタデータ) (2026-05-06T14:15:10Z) - ERMoE: Eigen-Reparameterized Mixture-of-Experts for Stable Routing and Interpretable Specialization [13.182475975397251]
ERMoEは、学習したゲーティングログを"Eigenbasis Score"に置き換えるスパースなMoE変換器である
ERMoE は ImageNet 分類と クロスモーダル画像テキスト検索ベンチマークにおける最先端の精度を実現する。
3D MRI変異体(ERMoE-ba)は、脳年齢予測の精度を7%以上改善し、解釈可能な専門家の専門化をもたらす。
論文 参考訳(メタデータ) (2025-11-14T05:31:37Z) - RouteMark: A Fingerprint for Intellectual Property Attribution in Routing-based Model Merging [69.2230254959204]
我々は,統合されたMoEモデルにおけるIP保護のためのフレームワークであるRouteMarkを提案する。
我々の重要な洞察は、タスク固有の専門家は、探索入力の下で安定かつ独特なルーティング行動を示すことである。
属性と改ざん検出のために,類似性に基づくマッチングアルゴリズムを導入する。
論文 参考訳(メタデータ) (2025-08-03T14:51:58Z) - Chain-of-Experts: Unlocking the Communication Power of Mixture-of-Experts Models [58.54288496296157]
CoE(Chain-of-Experts)は新しいMixture-of-Experts(MoE)アーキテクチャで、各レイヤ内でのシーケンシャルな専門家通信を導入している。
イテレーション間の動的専門家選択をサポートするために、CoEはレイヤ内の各ステップに専用のルータを使用している。
論文 参考訳(メタデータ) (2025-06-23T02:15:43Z) - Mixture of Group Experts for Learning Invariant Representations [25.935653652324532]
わずかに活性化されたMixture-of-Experts (MoE)モデルはトークン当たりの一貫した計算コストを維持しながらパラメータ数を効果的に増加させる。
スパース表現にインスパイアされた上位$kのルーティングによるバニラMOEの新しい視点を示す。
グループエキスパートの混合(Mixture of Group Experts, MOGE)と呼ばれるトップ$kのルーティング入力に対するグループスパース正規化手法を提案する。
論文 参考訳(メタデータ) (2025-04-12T15:58:02Z) - Complexity Experts are Task-Discriminative Learners for Any Image Restoration [80.46313715427928]
複雑性の専門家" - 様々な計算複雑性と受容的なフィールドを持つフレキシブルな専門家ブロックを紹介します。
この選好は、タスク固有の割り当てを効果的に推進し、適切な複雑さを持つ専門家にタスクを割り当てる。
提案したMoCE-IRモデルは最先端の手法より優れており、その効率性と実用性が確認されている。
論文 参考訳(メタデータ) (2024-11-27T15:58:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。