論文の概要: Teacher-Guided Routing for Sparse Vision Mixture-of-Experts
- arxiv url: http://arxiv.org/abs/2604.21330v1
- Date: Thu, 23 Apr 2026 06:34:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-24 14:40:06.336473
- Title: Teacher-Guided Routing for Sparse Vision Mixture-of-Experts
- Title(参考訳): Sparse Vision Mixture-of-Experts のための教師ガイド型ルーティング
- Authors: Masahiro Kada, Ryota Yoshihashi, Satoshi Ikehata, Rei Kawakami, Ikuro Sato,
- Abstract要約: 本稿では,Sparse Vision Mixture-of-ExpertsのためのTGR-MoE: Teacher-Guided Routingを提案する。
事前訓練された高密度教師モデルから導かれた指導を用いてルータ学習を安定化する。
高度にスパースな構成でも安定したトレーニングを維持しながら、正確性とルーティングの整合性を一貫して改善する。
- 参考スコア(独自算出の注目度): 25.423413775524704
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent progress in deep learning has been driven by increasingly large-scale models, but the resulting computational cost has become a critical bottleneck. Sparse Mixture of Experts (MoE) offers an effective solution by activating only a small subset of experts for each input, achieving high scalability without sacrificing inference speed. Although effective, sparse MoE training exhibits characteristic optimization difficulties. Because the router receives informative gradients only through the experts selected in the forward pass, it suffers from gradient blocking and obtains little information from unselected routes. This limited, highly localized feedback makes it difficult for the router to learn appropriate expert-selection scores and often leads to unstable routing dynamics, such as fluctuating expert assignments during training. To address this issue, we propose TGR-MoE: Teacher-Guided Routing for Sparse Vision Mixture-of-Experts, a simple yet effective method that stabilizes router learning using supervision derived from a pretrained dense teacher model. TGR-MoE constructs a teacher router from the teacher's intermediate representations and uses its routing outputs as pseudo-supervision for the student router, suppressing frequent routing fluctuations during training and enabling knowledge-guided expert selection from the early stages of training. Extensive experiments on ImageNet-1K and CIFAR-100 demonstrate that TGR consistently improves both accuracy and routing consistency, while maintaining stable training even under highly sparse configurations.
- Abstract(参考訳): ディープラーニングの最近の進歩は、ますます大規模なモデルによって推進されているが、結果として生じる計算コストは、重大なボトルネックとなっている。
Sparse Mixture of Experts (MoE)は、入力毎に少数の専門家のみを活性化し、推論速度を犠牲にすることなく高いスケーラビリティを実現する、効果的なソリューションを提供する。
効果はあるものの、スパースMoEトレーニングは特性的な最適化の難しさを示す。
ルータはフォワードパスで選択された専門家を通してのみ情報勾配を受信するため、グラデーションブロッキングに悩まされ、選択されていないルートからの情報はほとんど得られない。
この制限された高度に局所化されたフィードバックは、ルータが適切な専門家選択スコアを学習することを難しくし、トレーニング中に専門家の割り当てを変動させるような不安定なルーティングダイナミクスにつながることが多い。
この問題に対処するために、我々はTGR-MoE: Teacher-Guided Routing for Sparse Vision Mixture-of-Expertsを提案する。
TGR-MoEは教師の中間表現から教師のルータを構築し、そのルーティング出力を学生ルータの擬似スーパービジョンとして使用し、トレーニング中の頻繁なルーティング変動を抑制し、訓練の初期段階から知識誘導された専門家の選択を可能にする。
ImageNet-1KとCIFAR-100の大規模な実験は、TGRが高度にスパースな構成でも安定したトレーニングを維持しながら、精度とルーティングの整合性の両方を一貫して改善していることを示している。
関連論文リスト
- SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning [83.66308307152808]
マルチモーダル・インストラクション・チューニング(MCIT)のためのStAbilized Mixture-of-Experts(SAME)を提案する。
プロプライエタリは、サブスペースへのルーティングダイナミクスを分解し、タスク関連方向のみを更新することで、専門家の選択を安定化する。
また、トレーニング中に選択した専門家を凍結するためにアダプティブな専門家アクティベーションを導入し、冗長でクロスタスクな干渉を減らす。
論文 参考訳(メタデータ) (2026-02-02T11:47:06Z) - L2R: Low-Rank and Lipschitz-Controlled Routing for Mixture-of-Experts [49.90176890917986]
ルーティング空間とスコアリング幾何の両方を共用する統一的なルーティングフレームワークであるL2Rを提案する。
L2Rは、共有低ランク遅延ルーティング空間で専門家の割り当てを行い、ルーティング関数のリプシッツ挙動を明示的に制御するために飽和内積スコーリング(SIPS)を導入している。
大規模言語MoEモデルとImageNet上のビジョンMoE設定の実験では、L2Rはルーティングの安定性、専門家の専門化、モデル全体のパフォーマンスを一貫して改善している。
論文 参考訳(メタデータ) (2026-01-29T07:18:33Z) - ProxRouter: Proximity-Weighted LLM Query Routing for Improved Robustness to Outliers [14.831117443453165]
大規模言語モデル(LLM)クエリルータは、現代のAIプラットフォームにとって極めて重要である。
非パラメトリックルータにおけるバイアスと分散のバランスをとるために指数関数的に傾いたアグリゲーション機構を応用したProxを提案する。
論文 参考訳(メタデータ) (2025-10-10T20:28:14Z) - xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning [104.63494870852894]
我々は,学習したルータが直接応答するか,あるいは1つ以上の外部モデルを呼び出すことができるツールコールベースのルーティングシステム x を提案する。
当社の実装には、報酬とコスト会計を含む、完全な強化学習フレームワークが含まれています。
さまざまなベンチマークで、xはコストパフォーマンスのトレードオフを強く達成します。
論文 参考訳(メタデータ) (2025-10-09T16:52:01Z) - Guided by the Experts: Provable Feature Learning Dynamic of Soft-Routed Mixture-of-Experts [11.437368205968573]
本稿では,非線形ルータと専門家によるソフトローイング型MoEモデルの連成訓練のための収束保証を提供することにより,MoE理論を推し進める。
訓練後プルーニングは、効果的に冗長ニューロンを除去し、続いて、大域的最適性に到達した、確実に収束した微調整プロセスを示す。
論文 参考訳(メタデータ) (2025-10-08T16:40:31Z) - Divide, Weight, and Route: Difficulty-Aware Optimization with Dynamic Expert Fusion for Long-tailed Recognition [3.616706632062255]
textbfDQRouteは、難易度を考慮した最適化と動的専門家のコラボレーションを組み合わせたモジュラーフレームワークである。
DQRouteはまず、予測の不確実性と過去のパフォーマンスに基づいて、クラスレベルの難易度を推定する。
推測時に専門家予測は、専門家固有のOOD検出器から得られる信頼度スコアによって重み付けされ、入力適応ルーティングが可能である。
論文 参考訳(メタデータ) (2025-08-27T07:09:00Z) - Towards Deviation-Robust Agent Navigation via Perturbation-Aware
Contrastive Learning [125.61772424068903]
視覚言語ナビゲーション(VLN)は、エージェントに与えられた言語命令に従って実際の3D環境をナビゲートするように要求する。
本稿では,既存のVLNエージェントの一般化能力を高めるために,PROPER(Progressive Perturbation-aware Contrastive Learning)と呼ばれるモデルに依存しない学習パラダイムを提案する。
論文 参考訳(メタデータ) (2024-03-09T02:34:13Z) - Soft Merging of Experts with Adaptive Routing [38.962451264172856]
適応ルーティングによるエキスパートのソフトマージ(SMEAR)について紹介する
SMEARは、専門家のパラメータの重み付け平均を通して構築された単一の「マージされた」専門家を使用することで、離散的なルーティングを避ける。
我々は,メタデータに基づいた経路モデルや,勾配推定によるスパースルーティングを学習するSMEARモデルを用いたモデルの有効性を実証的に検証した。
論文 参考訳(メタデータ) (2023-06-06T15:04:31Z) - StableMoE: Stable Routing Strategy for Mixture of Experts [109.0602120199226]
Mixture-of-Experts (MoE)技術は、安価な計算オーバーヘッドでトランスフォーマーのモデルサイズをスケールアップすることができる。
本稿では、ルーティング変動問題に対処する2つのトレーニング段階を持つStableMoEを提案する。
その結果,StableMoEは収束速度と性能の両面で既存のMoE法よりも優れていた。
論文 参考訳(メタデータ) (2022-04-18T16:48:19Z) - Auto-Rectify Network for Unsupervised Indoor Depth Estimation [119.82412041164372]
ハンドヘルド環境に現れる複雑な自我運動が,学習深度にとって重要な障害であることが確認された。
本稿では,相対回転を除去してトレーニング画像の修正を効果的に行うデータ前処理手法を提案する。
その結果、従来の教師なしSOTA法よりも、難易度の高いNYUv2データセットよりも優れていた。
論文 参考訳(メタデータ) (2020-06-04T08:59:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。