論文の概要: Evidence for Shared Routing Geometry and Dynamics in Sparse Mixture-of-Experts
- arxiv url: http://arxiv.org/abs/2609.02404v1
- Date: Wed, 02 Sep 2026 10:17:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.232582
- Title: Evidence for Shared Routing Geometry and Dynamics in Sparse Mixture-of-Experts
- Title(参考訳): Sparse Mixture-of-Expertsにおける共有ルーティング形状とダイナミクスのエビデンス
- Authors: Kirill Labzin, Stepan Kulibaba, Artem Dzhalilov, Artem Gorokhov,
- Abstract要約: 層間のルーティング関連状態は、層固有の座標系によって隠蔽される共通の幾何学的構造を共有していることを示す。
一致したランク比較では、残差表現は層間で予測しやすく、一方、ルータ制御状態はモデルのエキスパート選択をより忠実に保存する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse mixture-of-experts (MoE) models use an independently parameterized router at each sparse layer to select experts for every token. Prior work has shown that routing decisions across depth can often be predicted from earlier routing signals, suggesting that routing is not fully independent across layers. However, the structure behind this predictability remains unclear. In this work, we provide evidence that routing-relevant states across layers share a common geometric structure that is obscured by layer-specific coordinate systems. We isolate the control subspace of each router and align these spaces into a shared canonical representation using generalized orthogonal Procrustes analysis. After alignment, a single linear transition reaches $R^2=0.39$--$0.71$ and retains 79--90\% of the predictive power of separately fitted layer-specific dynamics, indicating that much of routing-state evolution follows a reusable process across depth. We then ask whether this shared dynamics is specific to routing or simply reflects the smooth evolution of hidden representations. A matched-rank comparison shows that residual representations are often easier to predict across layers, while router-control states preserve the model's expert choices much more faithfully. This separates generic cross-layer predictability from routing-specific information. Finally, we test whether the predicted canonical states remain meaningful when used in place of native routing states. The transported states preserve local routing behavior, while learned state evolution reduces $Δ\mathrm{NLL}$ relative to simple persistence by 15.7\% on OLMoE and 6.2\% over a 10-router horizon on Phi.
- Abstract(参考訳): スパースミキシング・オブ・エキスパート(MoE)モデルは、各スパース層で独立にパラメータ化されたルータを使用して、トークンごとに専門家を選択する。
以前の研究では、奥行きのルーティング決定は以前のルーティング信号から予測可能であることが示されており、ルーティングがレイヤ間で完全に独立していないことを示唆している。
しかし、この予測可能性の背後にある構造はいまだ不明である。
本研究では、層間のルーティング関連状態が、層固有の座標系によって隠蔽される共通の幾何学的構造を共有していることを示す。
我々は、各ルータの制御部分空間を分離し、一般化直交Procrustes解析を用いて、これらの空間を共有正準表現に整列する。
アライメント後、単一の線形遷移は$R^2=0.39$-0.71$に達し、分離された層特異的なダイナミクスの予測力の79--90\%を保持し、ルーティング状態の進化の多くは深さにわたって再利用可能なプロセスに従っていることを示す。
次に、この共有ダイナミクスがルーティングに特有のものなのか、それとも単に隠れた表現のスムーズな進化を反映しているのかを問う。
一致したランク比較では、残差表現は層間で予測しやすく、一方、ルータ制御状態はモデルのエキスパート選択をより忠実に保存する。
これにより、一般的な層間予測可能性とルーティング固有の情報とが分離される。
最後に、ネイティブルーティング状態の代わりに使用する場合、予測された正準状態が有意かどうかを検証する。
輸送された状態は局所的なルーティングの挙動を保ち、学習された状態の進化は単純な永続性に対して$Δ\mathrm{NLL}$を、OLMoEでは15.7\%、Phiでは10ルーター地平線では6.2\%減少させる。
関連論文リスト
- Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents [60.650808962786364]
外部判断や選択時間テストの実行なしに,ネイティブなMoEルータトレースがステアリングと選択をガイドできるかどうかを検討する。
我々の分析は、ルーティングが堅牢な行動的役割シグナルを提供することを示している。トークン・グラニュラ・リードアウトと決定整合比較セットは、ルーティングを効果的に制御する。
オープンウェイトスパースMOEエージェントを用いたSWEベンチ検証を行い,評価を行った。
論文 参考訳(メタデータ) (2026-08-23T03:07:03Z) - Self-Routing: Parameter-Free Expert Routing from Hidden States [14.018297453424454]
Mixture-of-Experts (MoE)レイヤは、トークンごとに専門家の小さなサブセットをアクティベートすることで、モデルのキャパシティを向上する。
本稿では,トークン隠蔽状態の指定された部分空間を専門家のロジットとして直接使用するパラメータフリーなルーティング機構であるSelf-Routingを提案する。
論文 参考訳(メタデータ) (2026-04-01T03:05:20Z) - Path-Constrained Mixture-of-Experts [23.80197713200086]
MoEルーティングは各レイヤの専門家を独立して選択する。
本稿では,連続層にまたがるルータパラメータを共有するパスモエを提案する。
0.9Bおよび16Bパラメータモデルの実験では、独立ルーティングよりも複雑なタスクと下流タスクが一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-03-18T21:35:53Z) - Task-Conditioned Routing Signatures in Sparse Mixture-of-Experts Transformers [0.0]
与えられたプロンプトに対して、各レイヤにまたがる専門家アクティベーションパターンを要約したベクトル表現であるルーティングシグネチャを導入する。
同一タスクカテゴリからのプロンプトは、非常に類似したルーティングシグネチャを誘導する一方、異なるカテゴリからのプロンプトは、かなり類似度が低いことを示す。
ルーティングシグネチャのみに訓練されたロジスティック回帰は、4方向タスク分類において92.5%+/-6.1%のクロスバリデーション精度を達成する。
論文 参考訳(メタデータ) (2026-03-11T12:45:53Z) - RealRoute: Dynamic Query Routing System via Retrieve-then-Verify Paradigm [19.239852494559212]
予測ルーティングからロバストなRetrieve-then-VerifyメカニズムへパラダイムをシフトするフレームワークであるRealRouteを紹介する。
実験により、RealRouteはマルチホップRag推論タスクにおいて予測ベースラインを大幅に上回ることがわかった。
論文 参考訳(メタデータ) (2026-03-02T17:57:46Z) - Unifying Environment Perception and Route Choice Modeling for Trajectory Representation Learning [47.00223863430964]
Tray Learning (TRL) は、低次元ベクトルに生の軌跡をエンコードすることを目的としており、旅行時間推定、位置予測、軌道類似性解析など様々な下流タスクに活用できる。
効率的なtextbfPRTrajectory表現学習のための時間的明示的textRoute選択モデルであるtextbfPRTrajを提案する。
論文 参考訳(メタデータ) (2025-10-16T15:55:28Z) - Omni-Router: Sharing Routing Decisions in Sparse Mixture-of-Experts for Speech Recognition [22.046185271408202]
Mixture-of-experts (MoE)アーキテクチャは、言語モデリングから自動音声認識(ASR)へと拡張されている。
我々の分析によると、ほとんどの層におけるルータは、他の層におけるルータの選択と強く相関しない専門家の選択を行う。
異なるレイヤの専門家間の協力を強化し、より高度な専門化を促進するために、私たちは異なるMoE層にまたがる共有ルータを使用します。
論文 参考訳(メタデータ) (2025-07-08T07:18:33Z) - Find A Winning Sign: Sign Is All We Need to Win the Lottery [52.63674911541416]
既存のIP手法によって訓練されたスパースネットワークは,パラメータ記号と正規化層パラメータが保存されている場合,アトラクションの基盤を保持することができることを示す。
本手法により訓練されたスパースネットワークと正規化層パラメータとの線形経路における高い誤差障壁を防止し, 正規化層パラメータへの依存を緩和する。
論文 参考訳(メタデータ) (2025-04-07T09:30:38Z) - Learning to Generate Content-Aware Dynamic Detectors [62.74209921174237]
サンプル適応型モデルアーキテクチャを自動的に生成する効率的な検出器の設計を新たに導入する。
動的ルーティングの学習を導くために、オブジェクト検出に適したコースツーファインの成層図を紹介します。
MS-COCOデータセットの実験により、CADDetはバニラルーティングに比べて10%少ないFLOPで1.8以上のmAPを達成することが示された。
論文 参考訳(メタデータ) (2020-12-08T08:05:20Z) - DHP: Differentiable Meta Pruning via HyperNetworks [158.69345612783198]
本稿では,ネットワークの自動プルーニングのためのハイパーネットによる識別可能なプルーニング手法を提案する。
遅延ベクトルは、バックボーンネットワーク内の畳み込み層の出力チャネルを制御し、レイヤのプルーニングのハンドルとして機能する。
画像分類、単一画像超解像、復調のための様々なネットワークで実験が行われた。
論文 参考訳(メタデータ) (2020-03-30T17:59:18Z) - Learning Dynamic Routing for Semantic Segmentation [86.56049245100084]
本稿では,動的ルーティングと呼ばれる意味表現のスケール分散を緩和する概念的に新しい手法を提案する。
提案フレームワークは,各画像のスケール分布に適応して,データ依存経路を生成する。
この目的のために、ハエのスケール変換経路を選択するために、ソフトコンディショナルゲートと呼ばれる微分可能なゲーティング関数を提案する。
論文 参考訳(メタデータ) (2020-03-23T17:22:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。