論文の概要: Beyond Geometric Complementarity: Coherent Overlap in Sparse Mixture-of-Experts Routing
- arxiv url: http://arxiv.org/abs/2607.28308v1
- Date: Thu, 30 Jul 2026 14:45:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.612448
- Title: Beyond Geometric Complementarity: Coherent Overlap in Sparse Mixture-of-Experts Routing
- Title(参考訳): 幾何学的相補性を超えて:スパース・ミックス・オブ・エクササイズ・ルーティングにおけるコヒーレントオーバーラップ
- Abstract要約: 既存のエビデンスはしばしばルートコヒーレンス、候補品質、および候補・バイ・コンテクストの相互作用を混乱させる。
我々はこれらの量を、エキスパート部分空間分離指数(ESSI)、一致したルート残差、およびプレフィックス制御された2時間2$因子を用いて識別する。
ルーティングは、共有された幾何学的近傍からトークン関連の専門家を選別するが、有用なマルチエキスパート計算は、線形被覆を伴わずに継続する。
- 参考スコア(独自算出の注目度): 4.712287472749922
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sparse mixture-of-experts (MoE) language models route each token to multiple experts, suggesting a geometric account of their benefit: co-selected experts should contribute distinct representation directions. Existing evidence often conflates route coherence, candidate quality, and candidate-by-context interaction. We distinguish these quantities using an Expert Subspace Separation Index (ESSI), matched-route residuals, and a prefix-controlled $2\times2$ factorial; frozen-route interventions and a controlled Top-$k$ study assess functional value. Three paired contrasts organize the findings. First, across six MoE architectures, expert subspaces overlap substantially, yet actual routes explain token representations better than matched alternatives. Second, across the 39 factorial cells in OLMoE, Mixtral, and DeepSeek, the selected candidate explains more of the residual representation than the strongest unselected rival in every cell, yet the actual prefix narrows this advantage throughout: all interactions are negative, and every 95% confidence interval lies below zero. Third, this geometric narrowing does not imply functional redundancy: adding later experts improves next-token prediction in 24 of 39 frozen-route comparisons, while the other 15 estimates are inconclusive; a controlled training study also favors Top-2 over Top-1 in all three seeds. We call this joint pattern coherent overlap: routing selects token-relevant experts from a shared geometric neighborhood, while useful multi-expert computation persists without disjoint linear coverage. Separating these quantities clarifies why geometric similarity alone cannot determine redundancy or pruning value.
- Abstract(参考訳): スパース・ミックス・オブ・エキスパート(MoE)言語モデルは、それぞれのトークンを複数の専門家にルートし、それらの利益の幾何学的説明を提案する。
既存のエビデンスはしばしばルートコヒーレンス、候補品質、および候補・バイ・コンテクストの相互作用を混乱させる。
我々はこれらの量を、エキスパートサブスペース分離指数(ESSI)、マッチしたルート残差、およびプレフィックス制御された2\times2$ factorial、凍結されたルート介入、およびTop-$k$による関数値の評価を用いて識別する。
3対のコントラストが発見を整理します。
まず、6つのMoEアーキテクチャで、専門家のサブスペースが大幅に重複するが、実際のルートでは、マッチした代替よりもトークン表現が優れている。
第2に、OLMoE、Mixtral、DeepSeekの39個の因子的細胞において、選択された候補は、すべての細胞において最強の未選択のライバルよりも残留表現についてより説明しているが、実際の接頭辞は、全ての相互作用が陰性であり、95%の信頼区間はゼロ以下である。
第3に、この幾何的絞り込みは機能的冗長性を示唆しない: 39回の凍結経路比較の24回において、後続の専門家が次点予測を改善する一方で、他の15回の見積もりは不確定である。
ルーティングは、共有された幾何学的近傍からトークン関連の専門家を選別するが、有用なマルチエキスパート計算は、線形被覆を伴わずに継続する。
これらの量の分離は、幾何学的類似性だけで冗長性やプルーニング値を決定することができない理由を明確にする。
関連論文リスト
- Bridging Network Psychometrics and Artificial Intelligence: An Ising-Potts Model with LLM-Derived Weights [0.40611352512781873]
レーティングとカテゴリーラベルの合意指標を用いたラターイジングポッツモデルを提案する。
我々は,K=14,466の短い回答を3段階のルーブリックと2つのAERAエッセイのコーパスに散らばった3つの構成応答データセットについて,約1,200-1,400の応答を4点のルーブリックに提案した。
論文 参考訳(メタデータ) (2026-09-08T14:26:19Z) - Coverage-Maximizing Multinomial Subset Routing under Operational Constraints [6.499454916436427]
我々は,Multinomial Subset Routing (MSR)を紹介した。
各ラウンドで、学習者はマルチノミカルポリシーから$M$のエキスパートをサンプリングし、その結果、異なるサンプル専門家の集合がルーティングされたサブセットを形成する。
報酬はルーティングされたサブセットで最高のパフォーマンスのエキスパートにのみ依存します。
論文 参考訳(メタデータ) (2026-08-17T10:30:20Z) - Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation [49.8459545291965]
Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-11T02:40:58Z) - RecRec: Latent Interests Recursive Reasoning for Sequential Recommendation [52.23179023639867]
逐次リコメンデータシステムは、ユーザインタラクションをエンコードし、次の項目を予測するために、1つのフォワードパスに依存している。
シーケンシャルなレコメンデーションのための推論プロセスをどのように構成するかは、未解決の問題である。
既存のアプローチでは、推論と予測を単一の$d$次元の状態に分割し、推論の深さを制限する。
本稿ではRLフリーフレームワークRecRec(Recursive Reasoning for Recommendation)を提案する。
論文 参考訳(メタデータ) (2026-07-14T16:28:28Z) - SHAPE: Coalition-Aware Expert Pruning for Sparse Mixture-of-Experts LLMs [4.035485260002141]
Sparse Mixture-of-Experts (MoE)モデルは、トーケンの少ない計算で強力な品質を達成するが、そのデプロイメントはメモリウォールによって制限されることが多い。
課題駆動型プルーニングフレームワークのtextbfSHAPE を提案する。
論文 参考訳(メタデータ) (2026-06-03T08:41:48Z) - The Deterministic Horizon: Impossibility Results as Design Specifications for Trustworthy AI Systems [0.0]
この論文は、好奇心から不合理性の結果を設計規則に変える。
そのフラッグシップとなる結果は、アーキテクチャだけで設定された精度の高い天井を証明している。
同じ引数がサブフィールドにまたがって再キャストされる。
論文 参考訳(メタデータ) (2026-05-21T20:48:35Z) - Slicing and Dicing: Configuring Optimal Mixtures of Experts [49.5613403644084]
本研究は,最大6.6Bのパラメータにまたがる2000以上の事前学習走行に関する最初の系統的研究である。
私たちは、全体専門家、専門家の次元、単一層内の異種の専門家サイズ、共有専門家サイズ、ロードバランシングメカニズムを徹底的に変化させています。
専門家の数え方と粒度に焦点を合わせ、その他の選択肢は最終品質に最小限の影響を与える。
論文 参考訳(メタデータ) (2026-05-12T07:47:22Z) - Geometric Routing Enables Causal Expert Control in Mixture of Experts [0.0]
専門家のアイデンティティは因果的に意味があることを示します。
15%のエキスパートは10のカテゴリにまたがる単統的なスペシャリストである。
エキスパートレベルの特殊化は、第一級の解釈可能性プリミティブである。
論文 参考訳(メタデータ) (2026-04-15T21:24:42Z) - When Does Content-Based Routing Work? Representation Requirements for Selective Attention in Hybrid Sequence Models [0.0]
ハイブリッドリカレントアテンションアーキテクチャにおけるルーティングパラドックスを同定する。
コンテンツベースのルーティングは、ルーティングが避けるように設計されたペアワイズな計算を必要とすることを示す。
論文 参考訳(メタデータ) (2026-03-22T01:04:57Z) - Chain-of-Experts: Unlocking the Communication Power of Mixture-of-Experts Models [58.54288496296157]
CoE(Chain-of-Experts)は新しいMixture-of-Experts(MoE)アーキテクチャで、各レイヤ内でのシーケンシャルな専門家通信を導入している。
イテレーション間の動的専門家選択をサポートするために、CoEはレイヤ内の各ステップに専用のルータを使用している。
論文 参考訳(メタデータ) (2025-06-23T02:15:43Z) - Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy [84.11508381847929]
わずかに活性化されたMixture-of-Experts(SMoE)は、ニューラルネットワークの学習能力のスケールアップを約束している。
ルーティング統計を利用したM-SMoEを提案する。
我々のMC-SMoEは最大80%のメモリと20%のFLOPを削減でき、性能は実質的に損なわれない。
論文 参考訳(メタデータ) (2023-10-02T16:51:32Z) - On the Representation Collapse of Sparse Mixture of Experts [102.83396489230375]
専門家のまばらな混合は、一定の計算オーバーヘッドを必要としながら、より大きなモデルキャパシティを提供する。
入力トークンを隠された表現に従ってベストマッチした専門家に分散するためにルーティング機構を使用する。
しかし、そのようなルーティングメカニズムを学ぶことで、専門家のセントロイドを中心にトークンのクラスタリングが促進され、表現の崩壊の傾向が示唆される。
論文 参考訳(メタデータ) (2022-04-20T01:40:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。