論文の概要: GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models
- arxiv url: http://arxiv.org/abs/2606.26287v1
- Date: Wed, 24 Jun 2026 18:34:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.053278
- Title: GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models
- Title(参考訳): GeMoE:MoEベースの大型ビジョンランゲージモデルにおける不確実性認識適応ルーティングに必要なエントロピー
- Abstract要約: 大規模ビジョンランゲージモデル(LVLM)は、推論コストを維持しながらパラメータ容量を拡大する。
従来のMoEメソッドはTop-k静的ルーティング戦略を採用しており、入力のバリエーションを考慮せず、専門家の数を適応的に選択する。
ゲティングエントロピーに基づく不確実性を考慮した適応ルーティング(GeMoE)を提案する。
本手法は,従来の静的なルーティングに比べて99.5%の平均的な性能保持を実現するとともに,平均的な専門家アクティベーション間隔を36.5%改善する。
- 参考スコア(独自算出の注目度): 22.253490303318262
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the increase in model parameters and training data, the instruction following and generalization capabilities of Large VisionLanguage Models (LVLMs) have been significantly improved. Based on the Mixture of Experts (MoE) architecture, LVLMs expand their parameter capacity while maintaining the inference cost. However, traditional MoE methods employ a Top-k static routing strategy, which fails to account for variations in the input and adaptively select the number of experts, resulting in suboptimal resource utilization. In this paper, we propose viewing token routing as an information encoding task, framing dynamic routing as a Minimum Description Length (MDL) problem in encoding By validating the connection between MDL and gating entropy in the MoE scenario, we introduce Gating Entropy-based Uncertainty-aware Adaptive Routing (GeMoE) for MoE. Unlike traditional static or heuristic-based dynamic routing methods, GeMoE explicitly models the trade-off between model complexity and performance. By using gating entropy to assess the complexity of tokens, GeMoE adaptively determines the number of experts each token should engage. On a wide range of backbones and benchmarks, our method achieves 99.5% average performance retention compared to the original static routing, while improving average expert activation sparsity by 36.5%.
- Abstract(参考訳): モデルパラメータとトレーニングデータの増加に伴い、LVLM(Large VisionLanguage Models)の命令追従と一般化能力が大幅に向上した。
Mixture of Experts (MoE)アーキテクチャに基づいて、LVLMは推論コストを維持しながらパラメータ容量を拡大する。
しかし、従来のMoE手法ではTop-k静的ルーティング戦略を採用しており、入力の変動を考慮せず、専門家の数を適応的に選ぶことができず、リソースの最適利用につながる。
本稿では,MDL と Gating Entropy の接続を MoE シナリオで検証することにより,MoE のための Gating Entropy-based Uncertainty-aware Adaptive Routing (GeMoE) を導入する。
従来の静的あるいはヒューリスティックベースの動的ルーティング手法とは異なり、GeMoEはモデル複雑性とパフォーマンスの間のトレードオフを明示的にモデル化する。
トークンの複雑さを評価するためにゲーティングエントロピーを使用することで、GeMoEは各トークンが関与すべき専門家の数を適応的に決定する。
バックボーンとベンチマークの幅が広いため,従来の静的ルーティングに比べて99.5%の平均的な性能保持を実現し,平均的なアクティベーション間隔を36.5%改善した。
関連論文リスト
- Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models [11.628969213956502]
専門家選択ルーティングはトークン選択ルーティングよりも拡散言語モデルに適していることを示す。
我々は、時間に依存した専門家の能力を導入します。
DLM MoEモデルでは,ECルーティングが優れたパラダイムとして確立されている。
論文 参考訳(メタデータ) (2026-04-02T05:01:36Z) - Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert models [52.502867924372275]
Mixture-of-Experts (MoE)モデルは、スパース専門家のアクティベーションを通じて効率的なスケーリングを実現するが、デプロイメントの分散シフトによる最適以下のルーティング決定に悩まされることが多い。
我々は、外部の監視やデータなしで、テキスト生成中にMoEルーティング決定を継続的に適用するテキストタデータフリーオンラインテストタイムフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-16T16:24:36Z) - Learning Robust Stereo Matching in the Wild with Selective Mixture-of-Experts [29.52183168979229]
SMoEStereoは,Low-Rank Adaptation (LoRA) とMixture-of-Experts (MoE) モジュールの融合により,VFMをステレオマッチングに適用する新しいフレームワークである。
提案手法は,データセット固有の適応を伴わない複数のベンチマークに対して,最先端のクロスドメインと共同一般化を示す。
論文 参考訳(メタデータ) (2025-07-07T03:19:04Z) - DynMoLE: Boosting Mixture of LoRA Experts Fine-Tuning with a Hybrid Routing Mechanism [5.988126768890861]
DynMoLEは、ルータの確率分布のTsallisエントロピーに基づいて、専門家の選択を動的に調整するハイブリッドルーティング戦略である。
我々はDynMoLEが大幅な性能向上を実現していることを示す。
論文 参考訳(メタデータ) (2025-04-01T11:14:19Z) - DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs [86.76714527437383]
本稿では,事前学習したFFN層を計算ブロックに分割することで,分散化を実現するDSMoEを提案する。
我々は,Sigmoid アクティベーションとストレートスルー推定器を用いた適応型エキスパートルーティングを実装し,トークンがモデル知識の様々な側面に柔軟にアクセスできるようにする。
LLaMAモデルを用いた実験により、DSMoEは既存のプルーニング法やMoE法に比べて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-02-18T02:37:26Z) - Efficient and Effective Weight-Ensembling Mixture of Experts for Multi-Task Model Merging [111.8456671452411]
マルチタスク学習(MTL)は、共有モデルを利用して複数のタスクを遂行し、知識伝達を促進する。
マルチタスクモデル統合のためのウェイトエンセブリング・ミックス・オブ・エキスパート(WEMoE)手法を提案する。
WEMoEとE-WEMoEは, MTL性能, 一般化, 堅牢性の観点から, 最先端(SOTA)モデルマージ法より優れていることを示す。
論文 参考訳(メタデータ) (2024-10-29T07:16:31Z) - Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design [59.00758127310582]
本稿では、事前学習された高密度LCMをより小さなMoEモデルに変換する新しいフレームワークRead-MEを提案する。
当社のアプローチでは,専門家の抽出にアクティベーション空間を用いる。
Read-MEは、同様のスケールの他の人気のあるオープンソース高密度モデルよりも優れています。
論文 参考訳(メタデータ) (2024-10-24T19:48:51Z) - Layerwise Recurrent Router for Mixture-of-Experts [42.36093735411238]
Mixture-of-Experts (MoE)アーキテクチャは、トレーニングコストを大幅に増加させることなく、モデルサイズをスケールできる能力で際立っている。
現在のMoEモデルはパラメータ非効率をしばしば表示する。
我々はMixture-of-Experts(RMoE)のためのLayerwise Recurrent Routerを紹介する。
論文 参考訳(メタデータ) (2024-08-13T10:25:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。