論文の概要: Multi-level context Modeling for consistent expert selection in Mixture-of-Experts
- arxiv url: http://arxiv.org/abs/2607.16427v1
- Date: Fri, 17 Jul 2026 18:22:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.148581
- Title: Multi-level context Modeling for consistent expert selection in Mixture-of-Experts
- Title(参考訳): Mixture-of-Expertsにおける一貫した専門家選択のためのマルチレベルコンテキストモデリング
- Authors: Shuhan Huang, Naifan Zhang, Yuanbo Tang, Yang Li, Wai Kin Victor Chan,
- Abstract要約: Mixture-of-Experts (MoE)は、トークンを少数の専門家にルーティングすることで、Transformerモデルの効率的なスケーリングを可能にする。
既存のルータは通常、浅いあるいは孤立したトークン表現に対して専門家の選択を条件にしている。
階層間セマンティックアグリゲーションと局所トークンレベルの相互作用から補完的な信号を統合することでコンテキスト認識表現を構築するフレームワークであるMulti-level Context Fusion MOEを提案する。
- 参考スコア(独自算出の注目度): 3.4913929232937604
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-Experts (MoE) enables efficient scaling of Transformer models by routing tokens to a small subset of experts. However, existing routers typically condition expert selection on shallow or isolated token representations, which often produce unstable and semantically inconsistent routing decisions across layers. In this work, we revisit expert selection from a representation perspective and identify context incompleteness as a key bottleneck limiting effective expert specialization. To address this issue, we propose Multi-level Context Fusion MOE (MCF-MOE), a framework that constructs context-aware representations by integrating complementary signals from cross-layer semantic aggregation and local token-level interactions, enabling more informative and consistent expert selection. Experiments on language modeling and understanding benchmarks demonstrate that MCF-MOE consistently improves routing consistency and downstream performance over strong MoE baselines, highlighting the importance of contextual completeness in expert routing. The code is available at https://anonymous.4open.science/r/MCFMOE.
- Abstract(参考訳): Mixture-of-Experts (MoE)は、トークンを少数の専門家にルーティングすることで、Transformerモデルの効率的なスケーリングを可能にする。
しかし、既存のルータは通常、浅いあるいは孤立したトークン表現に対して専門家の選択を条件にしている。
本研究では、表現の観点から専門家の選択を再考し、文脈の不完全性を、効果的な専門家の専門化を制限する重要なボトルネックとして認識する。
この問題を解決するために,多層セマンティックアグリゲーションと局所トークンレベルの相互作用から補完的な信号を統合してコンテキスト認識表現を構築するフレームワークであるMulti-level Context Fusion MOE (MCF-MOE)を提案する。
言語モデリングと理解ベンチマークの実験では、MCF-MOEは、強力なMoEベースラインよりもルーティング一貫性とダウンストリームパフォーマンスを一貫して改善し、エキスパートルーティングにおけるコンテキスト完全性の重要性を強調している。
コードはhttps://anonymous.4open.science/r/MCFMOEで公開されている。
関連論文リスト
- DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts [56.175408382091796]
本研究では, 標準重み付け集約を構造集約に置き換えることにより, 専門家やルータを変更することなく, 専門家合成空間を拡大することを示す。
DAG-MoEは軽量モジュールを用いて,選択した専門家の最適な集約構造を自動的に学習するスパースMoEフレームワークである。
論文 参考訳(メタデータ) (2026-05-31T07:08:16Z) - MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts [12.42628977620548]
MoST(Mixture of Speech and Text)は、音声処理とテキスト処理をシームレスに統合する新しい大規模言語モデルである。
入力型に基づいて、モダリティに適した専門家にトークンを指示する特殊な経路を導入する。
MoSTは、パラメータ数に匹敵する既存のモデルよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-01-15T10:43:29Z) - Token-Level LLM Collaboration via FusionRoute [60.72307345997823]
FusionRouteはトークンレベルのマルチLLMコラボレーションフレームワークである。
各デコーディングステップで最も適した専門家を選択し、選択した専門家の次のTokenディストリビューションを洗練または修正する補完ロジットをコントリビュートする。
シーケンスレベルのコラボレーションとトークンレベルのコラボレーション、モデルマージ、ダイレクト微調整の両方に優れています。
論文 参考訳(メタデータ) (2026-01-08T16:53:16Z) - Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance [79.21541758879012]
Mixture-of-Experts (MoE) は計算効率を保ちながらモデルキャパシティをスケールするための強力なパラダイムとして登場した。
本稿では、専門家の専門化を促進する明示的なルーティングガイダンスを備えた2ステップルータを備えたMoEフレームワークであるProMoEを紹介する。
論文 参考訳(メタデータ) (2025-10-28T17:59:02Z) - RouteMark: A Fingerprint for Intellectual Property Attribution in Routing-based Model Merging [69.2230254959204]
我々は,統合されたMoEモデルにおけるIP保護のためのフレームワークであるRouteMarkを提案する。
我々の重要な洞察は、タスク固有の専門家は、探索入力の下で安定かつ独特なルーティング行動を示すことである。
属性と改ざん検出のために,類似性に基づくマッチングアルゴリズムを導入する。
論文 参考訳(メタデータ) (2025-08-03T14:51:58Z) - EvoMoE: Expert Evolution in Mixture of Experts for Multimodal Large Language Models [25.12002287083368]
MLLM(Multi-modal large language model)は、MoE技術を採用した。
MoEの専門家は、単にLPMからFFNパラメータを複製することで、しばしば発生する。
専門家の統一性は、MOEの専門家が単に LLM から FFN パラメータを複製することによって生じることが多いためである。
ルータの剛性は 専門家の選択に 静的リニアルータが 広く使われていることに由来する
論文 参考訳(メタデータ) (2025-05-28T08:38:39Z) - Token-Level Prompt Mixture with Parameter-Free Routing for Federated Domain Generalization [51.562474873972086]
Federated Domain Generalization (FedDG)は、異種データを持つ分散クライアントからグローバルに一般化可能なモデルを学ぶことを目的としている。
近年の研究では、単一のグローバルなプロンプトを学習することで、FedDGの視覚言語モデル(VLM)を適応させる素早い学習が導入されている。
本稿では,FedDGのためのパラメータフリールーティングフレームワークであるTRIPを提案する。
論文 参考訳(メタデータ) (2025-04-29T11:06:03Z) - Multi-Grained Query-Guided Set Prediction Network for Grounded Multimodal Named Entity Recognition [9.506482334842293]
Grounded Multimodal Named Entity Recognition (GMNER) は、新しい情報抽出(IE)タスクである。
近年,機械読解やシーケンス生成に基づくフレームワークを用いた統一手法は,この難易度に限界を生じさせている。
そこで我々は,Multi-fine Query-guided Set Prediction Network (MQSPN) という新しい統合フレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-17T05:42:43Z) - On the Representation Collapse of Sparse Mixture of Experts [102.83396489230375]
専門家のまばらな混合は、一定の計算オーバーヘッドを必要としながら、より大きなモデルキャパシティを提供する。
入力トークンを隠された表現に従ってベストマッチした専門家に分散するためにルーティング機構を使用する。
しかし、そのようなルーティングメカニズムを学ぶことで、専門家のセントロイドを中心にトークンのクラスタリングが促進され、表現の崩壊の傾向が示唆される。
論文 参考訳(メタデータ) (2022-04-20T01:40:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。