論文の概要: Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.04454v1
- Date: Wed, 05 Aug 2026 05:09:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.727694
- Title: Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models
- Title(参考訳): グローバルルーティングアグリゲーションを超えて:MoEビジョンランゲージモデルのためのフェーズアウェアエキスパートマージ
- Authors: Hongyu Zhang, Cheng Yan, Xiang Xia, Wuyang Zhang,
- Abstract要約: 我々は、MoE-VLM専門家の合併は、段階条件付き専門家の役割を維持するべきであると論じる。
位相正規化ルーティング統計から各専門家のルーティングロールプロファイルを構成するトレーニング不要な方法であるRoleMergeを提案する。
- 参考スコア(独自算出の注目度): 12.145751917200485
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-experts vision-language models (MoE-VLMs) increase model capacity with sparse expert activation, yet deployment requires storing the full expert pool. Training-free expert merging reduces this burden, and many routing-based methods aggregate routing statistics across all tokens to determine merge compatibility. However, MoE-VLM inference is phase-structured: image-context tokens carry visual content, question tokens specify the query, and answer tokens produce the output, with different counts and routing distributions. Because image-context tokens are far more numerous, global aggregation can overemphasize image-context processing and obscure phase-conditioned expert roles, making experts serving different phases appear interchangeable and degrading model performance. We therefore argue that MoE-VLM expert merging should preserve phase-conditioned expert roles, judging compatibility by how experts serve different phases rather than globally aggregated routing statistics. Based on this view, we propose RoleMerge, a training-free method that constructs each expert's Routing Role Profile (RRP) from phase-normalized routing statistics, capturing its relative phase preference. Guided by expert-phase information loss, RoleMerge merges experts with compatible profiles and their corresponding router entries while preserving answer-decoding expert distinctions. Experiments on three models and multiple benchmarks show that RoleMerge preserves more of the full model's performance than alternative expert-merging methods at matched expert-retention ratios, with relative improvements of up to 9.6 percent in six-task macro-average performance. These results validate phase-conditioned expert roles as a more effective basis than global routing aggregation for MoE-VLM expert merging.
- Abstract(参考訳): 混合専門家向け視覚言語モデル(MoE-VLMs)は、専門家のアクティベーションの少ないモデルキャパシティを向上するが、デプロイにはエキスパートプール全体を格納する必要がある。
トレーニング不要のエキスパートマージは、この負担を軽減し、多くのルーティングベースのメソッドは、マージ互換性を決定するために、すべてのトークンにわたってルーティング統計を集約する。
しかし、MoE-VLM推論はフェーズ構造であり、画像コンテキストトークンは視覚的コンテンツを持ち、質問トークンはクエリを指定し、回答トークンは異なるカウントとルーティング分布で出力を生成する。
画像コンテキストトークンははるかに数が多いため、グローバルアグリゲーションは画像コンテキスト処理と不明瞭なフェーズ条件のエキスパートロールを過度に強調し、異なるフェーズを提供するエキスパートが交換可能で、モデルのパフォーマンスを劣化させる。
したがって、MoE-VLM専門家の合併は、グローバルに集約されたルーティング統計よりも、専門家が異なるフェーズでどのように機能するかの相違を判断し、段階条件付き専門家の役割を維持すべきである、と論じる。
この観点から,各専門家のルーティングロールプロファイル(RRP)を位相正規化ルーティング統計から構築し,その相対位相嗜好を抽出する学習自由手法であるRoleMergeを提案する。
RoleMergeは、専門家フェーズの情報損失によってガイドされ、専門家に互換性のあるプロファイルと対応するルータエントリをマージし、回答デコーディングの専門家の区別を保存する。
3つのモデルと複数のベンチマークの実験により、RoleMergeは6タスクのマクロ平均性能において9.6%の相対的な改善を伴い、他の専門家のマージ手法よりも完全なモデルの性能を保っていることが示された。
これらの結果は,MoE-VLMエキスパート統合のためのグローバルルーティングアグリゲーションよりも,位相条件付き専門家の役割をより効果的に評価する。
関連論文リスト
- Multi-level context Modeling for consistent expert selection in Mixture-of-Experts [3.4913929232937604]
Mixture-of-Experts (MoE)は、トークンを少数の専門家にルーティングすることで、Transformerモデルの効率的なスケーリングを可能にする。
既存のルータは通常、浅いあるいは孤立したトークン表現に対して専門家の選択を条件にしている。
階層間セマンティックアグリゲーションと局所トークンレベルの相互作用から補完的な信号を統合することでコンテキスト認識表現を構築するフレームワークであるMulti-level Context Fusion MOEを提案する。
論文 参考訳(メタデータ) (2026-07-17T18:22:42Z) - Multi-Domain Learning with Global Expert Mapping [102.62297074508147]
Mixture-of-Experts (MoE)モデルは、入力を専門分野(専門家)にルーティングすることでスケーラブルなソリューションを提供する。
本稿では,学習ルータをグローバルスケジューラに置き換えるプランナー・コンパイラフレームワークであるGEMを提案する。
我々のプランナーは線形プログラミングの緩和に基づいて、データセットを専門家に分数的に割り当てる一方、コンパイラはこのソフトプランを決定論的でキャパシティを意識したマッピングに変換するために階層的なラウンドリングを適用する。
実験の結果、GEM-DINOはUODBベンチマークで最先端のパフォーマンスを達成し、表現不足のデータセットに顕著な利益をもたらし、タスク干渉をわずかに解決していることがわかった。
論文 参考訳(メタデータ) (2026-04-20T21:09:34Z) - MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model [57.89395815934156]
Multi-Turn Contrastive Learning (MuCo)は、このプロセスを再考する対話にインスパイアされたフレームワークである。
新たな5Mマルチモーダルマルチターンデータセット(M3T)による MuCo の表示実験
論文 参考訳(メタデータ) (2026-02-06T05:18:33Z) - Token-Level LLM Collaboration via FusionRoute [60.72307345997823]
FusionRouteはトークンレベルのマルチLLMコラボレーションフレームワークである。
各デコーディングステップで最も適した専門家を選択し、選択した専門家の次のTokenディストリビューションを洗練または修正する補完ロジットをコントリビュートする。
シーケンスレベルのコラボレーションとトークンレベルのコラボレーション、モデルマージ、ダイレクト微調整の両方に優れています。
論文 参考訳(メタデータ) (2026-01-08T16:53:16Z) - Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance [79.21541758879012]
Mixture-of-Experts (MoE) は計算効率を保ちながらモデルキャパシティをスケールするための強力なパラダイムとして登場した。
本稿では、専門家の専門化を促進する明示的なルーティングガイダンスを備えた2ステップルータを備えたMoEフレームワークであるProMoEを紹介する。
論文 参考訳(メタデータ) (2025-10-28T17:59:02Z) - Mixture of Thoughts: Learning to Aggregate What Experts Think, Not Just What They Say [4.273730624882391]
Mixture of Thoughts (MoT) は、グローバルなルーティング方式の下で、異種の専門家間の潜在レベル協調のための単純な方法である。
MoTは現在のルーティングと集約ベースのアベンジャーズをそれぞれ$+0.38%$と$+2.92%$で上回っている。
論文 参考訳(メタデータ) (2025-09-25T13:50:09Z) - RouteMark: A Fingerprint for Intellectual Property Attribution in Routing-based Model Merging [69.2230254959204]
我々は,統合されたMoEモデルにおけるIP保護のためのフレームワークであるRouteMarkを提案する。
我々の重要な洞察は、タスク固有の専門家は、探索入力の下で安定かつ独特なルーティング行動を示すことである。
属性と改ざん検出のために,類似性に基づくマッチングアルゴリズムを導入する。
論文 参考訳(メタデータ) (2025-08-03T14:51:58Z) - Token-Level Prompt Mixture with Parameter-Free Routing for Federated Domain Generalization [51.562474873972086]
Federated Domain Generalization (FedDG)は、異種データを持つ分散クライアントからグローバルに一般化可能なモデルを学ぶことを目的としている。
近年の研究では、単一のグローバルなプロンプトを学習することで、FedDGの視覚言語モデル(VLM)を適応させる素早い学習が導入されている。
本稿では,FedDGのためのパラメータフリールーティングフレームワークであるTRIPを提案する。
論文 参考訳(メタデータ) (2025-04-29T11:06:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。