論文の概要: Beyond Routing: Characterising Expert Tuning and Representation in Vision Mixture-of-Experts
- arxiv url: http://arxiv.org/abs/2605.20610v1
- Date: Wed, 20 May 2026 01:55:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.431253
- Title: Beyond Routing: Characterising Expert Tuning and Representation in Vision Mixture-of-Experts
- Title(参考訳): Beyond Routing:Vision-of-Expertsにおけるエキスパートチューニングと表現の特徴付け
- Authors: Gene Tangtartharakul, Katherine R. Storrs,
- Abstract要約: Mixture-of-Experts (MoE)モデルは、専門家にルートされるカテゴリの分析によってしばしば解釈される。
我々は、自然画像と専門家の専門性に対して対照的な目標を掲げて、スパースゲートの畳み込み型MoEモデルを訓練する。
我々は、最もエキサイティングな入力を用いて、専門家ごとのカテゴリ分離性、および専門家ごとのチューニングを測定する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts (MoE) models are often interpreted by analysing which categories are routed to which experts. However, routing alone does not reveal what each expert actually encodes. We train sparsely-gated convolutional MoE models with a contrastive objective on natural images and characterise expert specialisation using tools from visual neuroscience. Extending from gating-level to expert-level analyses, we measure per-expert category separability, and per-expert tuning using the most exciting inputs. Extending from category-level to feature-level explanations, we interpret tuning via semantic dimensions derived from a dataset of human behavioural judgements (THINGS). Finally, we use tuning and representational similarity analysis to assess the stability of expertise-allocation across independent initialisations. We find that an animate-inanimate distinction dominates expert partitioning, apparent from gating through to expert readout, and is stable across independently trained models. Although routing statistics suggest relatively sparse, categorical preferences, expert analyses reveal broader tuning to continuous visual and semantic dimensions that extend beyond category boundaries. Experts exhibit similar category-separability to one another, despite distinct feature tuning, demonstrating the explanatory benefits of moving beyond category-level analyses. Together, these results show that expert specialisation in vision MoEs extends well beyond category routing and is better understood by probing fine-grained expert-level tuning and representational structure.
- Abstract(参考訳): Mixture-of-Experts (MoE)モデルは、どのカテゴリがどの専門家にルートされているかを分析することでしばしば解釈される。
しかし、ルーティングだけでは、各専門家が実際にエンコードしたものは明らかにしない。
我々は、視覚神経科学のツールを用いて、自然画像と専門家の専門化を特徴付けるために、対照的な目的を持った、小口径の畳み込み型MoEモデルを訓練する。
ゲーティングレベルからエキスパートレベルまでの範囲を拡大し、最もエキサイティングな入力を用いて、専門家ごとのカテゴリ分離性、および専門家ごとのチューニングを測定する。
カテゴリーレベルから特徴レベルまでを拡張し,人間の行動判断データセット(THINGS)から得られた意味的次元によるチューニングを解釈する。
最後に、チューニングと表現的類似性分析を用いて、独立初期化における専門的配置の安定性を評価する。
アニメート・イニメートの違いが専門家のパーティショニングを支配しており、ゲーティングから専門家の読み出しまで明らかであり、独立に訓練されたモデル間で安定している。
ルーティング統計は比較的スパースで分類的嗜好を示唆するが、専門家分析は、カテゴリー境界を越えて広がる連続的な視覚的・意味的な次元へのより広範なチューニングを明らかにしている。
専門家は、異なる特徴チューニングにもかかわらず、互いに類似したカテゴリ分離性を示し、カテゴリーレベルの分析を超えて動くことの説明的利点を示している。
これらの結果から,視覚における専門的専門化は,カテゴリルーティングを超えて大きく拡張され,より詳細な専門家レベルのチューニングや表現構造を求めることにより,より理解しやすいことが示唆された。
関連論文リスト
- DeferredSeg: A Multi-Expert Deferral Framework for Trustworthy Medical Image Segmentation [66.24948946364329]
DeferredSegは、特定の地域の人間専門家に予測をデファクトする、遅延認識セグメンテーションフレームワークである。
我々は、MedSAMとCENetをベースセグメンタとして、公平な比較のための3つの挑戦的な医療データセット上でDederredSegを評価した。
DeferredSegが一貫してベースラインを上回っていることを示す実験結果が得られた。
論文 参考訳(メタデータ) (2026-04-14T07:50:31Z) - MoE Lens -- An Expert Is All You Need [0.09444932939944471]
エキスパートの混合(MoE)モデルは、スパース専門家のアクティベーションを通じてパラメータ効率のスケーリングを可能にする。
本稿では,2つの相補的アプローチを用いて,MoEsの専門家専門化の体系的分析を行う。
論文 参考訳(メタデータ) (2026-03-06T01:35:28Z) - The Illusion of Specialization: Unveiling the Domain-Invariant "Standing Committee" in Mixture-of-Experts Models [18.428606280260187]
エキスパートモデルの混合は、スパースルーティングによってドメインの特殊化を実現すると広く仮定されている。
我々は,個別の専門家ではなく,専門家グループレベルでのルーティング行動を分析するフレームワークであるCOMMITTEEAUDITを紹介する。
私たちは、スタンドング委員会が、ドメイン、レイヤ、およびルーティング予算をまたいだルーティングマスの大部分を一貫して捉えていることに気付きました。
論文 参考訳(メタデータ) (2026-01-06T21:29:45Z) - Domain-Specific Pruning of Large Mixture-of-Experts Models with Few-shot Demonstrations [48.890534958441016]
本研究では,大規模MoEモデルにおける領域の特殊化と専門的冗長性について検討する。
本稿では,最も関係のある専門家のみを識別・保持するための簡易で効果的な刈取フレームワークであるEASY-EPを提案する。
DeepSeek-R1とDeepSeek-V3-0324の実験は、我々の手法が同じメモリ予算の下で同等の性能と2.99タイムのスループットを達成できることを示した。
論文 参考訳(メタデータ) (2025-04-09T11:34:06Z) - Convergence Rates for Softmax Gating Mixture of Experts [78.3687645289918]
機械学習モデルの効率性とスケーラビリティを向上するための効果的なフレームワークとして、Mixture of Expert (MoE)が登場した。
MoEの成功の中心は、適応的なソフトマックスゲーティングメカニズムであり、各専門家の入力に対する関連性を決定する責任を負い、それぞれの重みを動的に専門家に割り当てる。
標準ソフトマックスゲーティングまたはその変種を備えたMoEの下で,パラメータ推定と専門家推定の収束解析を行い,密度とスパースゲーティングと階層ソフトマックスゲーティングを含む。
論文 参考訳(メタデータ) (2025-03-05T06:11:24Z) - Generalization Error Analysis for Sparse Mixture-of-Experts: A Preliminary Study [65.11303133775857]
Mixture-of-Experts (MoE)計算アマルガメート予測
Sparse MoEは、限られた数、あるいは1つの専門家だけを選択的に扱うことで、経験的に保存され、時にはパフォーマンスが向上する一方で、オーバーヘッドを大幅に削減する。
論文 参考訳(メタデータ) (2024-03-26T05:48:02Z) - Sparsely-gated Mixture-of-Expert Layers for CNN Interpretability [3.021134753248103]
小さいゲートのMixture of Expert (MoE)層が大きなトランスのスケーリングに成功している。
本研究では,コンピュータビジョンタスクのCNNに対して,スパースMOE層を適用し,モデル解釈性への影響を解析する。
論文 参考訳(メタデータ) (2022-04-22T09:40:23Z) - On the Representation Collapse of Sparse Mixture of Experts [102.83396489230375]
専門家のまばらな混合は、一定の計算オーバーヘッドを必要としながら、より大きなモデルキャパシティを提供する。
入力トークンを隠された表現に従ってベストマッチした専門家に分散するためにルーティング機構を使用する。
しかし、そのようなルーティングメカニズムを学ぶことで、専門家のセントロイドを中心にトークンのクラスタリングが促進され、表現の崩壊の傾向が示唆される。
論文 参考訳(メタデータ) (2022-04-20T01:40:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。