論文の概要: Routing in Gradient Space: Balanced Usage Is Not Expert Specialization
- arxiv url: http://arxiv.org/abs/2609.36724v1
- Date: Tue, 29 Sep 2026 05:01:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.1973
- Title: Routing in Gradient Space: Balanced Usage Is Not Expert Specialization
- Title(参考訳): グラディエントな空間でのルーティング:バランスのとれた利用は専門家の専門性ではない
- Abstract要約: 勾配整列ルーティング(GAR)
GARの検証精度が最も高く、タスクロスのみのルーティングよりも1.07ポイント高い。
冷凍されたDeBERTaとQwen3-1.7Bのバックボーンと低ランクのアダプタの専門家により、タスクロスのみのルーティングよりも1.10ポイントも上位にランクされている。
- 参考スコア(独自算出の注目度): 2.366625762160647
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sparse expert models can distribute traffic evenly while still grouping incompatible training signals within the same experts. We study routing as a gradient-partitioning problem and introduce gradient-aligned routing (GAR), whose load-normalized router objective rewards grouping observations with aligned gradients. On five multi-task text-classification mixtures, we compare GAR with task-loss-only routing, gradient-combination and gradient-conflict methods, and load-balancing losses. With a fully trainable RoBERTa backbone and classification-head experts, GAR has the highest aggregate validation accuracy, 1.07 percentage points above task-loss-only routing. With frozen DeBERTa and Qwen3-1.7B backbones and low-rank adapter experts, it again ranks first, 1.10 points above task-loss-only routing, with better-balanced expert load and higher gradient-mass purity, the share of each expert's gradient-norm mass from its dominant task; the load-balancing losses flatten load further but leave this purity near its task-loss-only level. Top-1 routing, trainable full-parameter feed-forward network (FFN) experts, and a larger backbone also show positive aggregate gains. The results distinguish expert-load balance from gradient-based routing organization and indicate the predictive value of gradient-informed routing in multi-task text classification.
- Abstract(参考訳): スパースエキスパートモデルは、同じ専門家内で互換性のないトレーニングシグナルをグループ化しながら、トラフィックを均等に分散することができる。
我々は、勾配分割問題としてルーティングについて検討し、負荷正規化ルータの目標値が整合勾配の観測をグループ化する勾配整列ルーティング(GAR)を導入する。
5つのマルチタスクテキスト分類混合物について,GARとタスクロスのみのルーティング,勾配組合せ法と勾配衝突法,負荷分散損失を比較した。
完全にトレーニング可能なRoBERTaバックボーンと分類ヘッドの専門家によって、GARは、タスクロスのみのルーティングよりも1.07ポイント高いアグリゲートバリデーション精度を持つ。
凍結したDeBERTaとQwen3-1.7Bのバックボーンと低ランクのアダプタエキスパートにより、タスクロスのみのルーティングの1.10ポイント、バランスのよい専門家負荷と高い勾配質量純度、各専門家の勾配ノルム質量のシェアが支配的なタスクから切り離され、負荷分散損失はさらに負荷を平らにしたが、タスクロスのみのレベル近くにこの純度を残している。
トップ1ルーティング、トレーニング可能なフルパラメータフィードフォワードネットワーク(FFN)の専門家、さらに大きなバックボーンも肯定的なアグリゲーションゲインを示している。
その結果,勾配に基づくルーティング組織と専門家負荷バランスを区別し,マルチタスクテキスト分類における勾配インフォームドルーティングの予測値を示す。
関連論文リスト
- MeshHeal: Two-Timescale Self-Healing for Gray Failures in Decentralized LLM Agent Networks [60.95806999869478]
MeshHealは、完全に分散化された自己修復フレームワークである。
能力にマッチしたピアレビューを2つのタイムスケールに分けている。
1タスクあたり51kのトータルモデルトークンを使用して0.839の劣化位相精度を達成し、最強のベースラインでは1タスクあたり115kの0.807の精度を達成した。
論文 参考訳(メタデータ) (2026-09-24T04:29:37Z) - ACE: Adaptive Calibration-Free Expert Skipping for MoE-based LLMs [15.24786135265898]
Mixture-of-Experts (MoE)アーキテクチャは、大規模言語モデル(LLM)のスケーリングに効率的なパラダイムを提供する。
本稿では,トークン適応型エキスパートスキップのためのトレーニングフリー,キャリブレーションフリー,チェックポイント保存フレームワークであるACEを提案する。
論文 参考訳(メタデータ) (2026-09-04T14:56:00Z) - PRIME: Mitigating Subgroup Optimization Competition in Shared CTR Top Networks with Plug-in Residual Input-Conditioned Mixture of Expert [16.073701450851008]
4つのモデルと4つのセマンティックフィールドを持つアバズ上での競合について検討する。
我々は,低ランクの残留専門家を混在させたPRIME(Plug-in Residual Input- Conditioned Mixture of Experts)を紹介する。
論文 参考訳(メタデータ) (2026-08-31T08:37:44Z) - Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation [49.8459545291965]
Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-11T02:40:58Z) - Hierarchical Copula-Gumbel-Top-\texorpdfstring{$K$}{K} Routing: Two-Sided Dependence Control for Frozen Mixture-of-Experts at Fixed Per-Token Routing Laws [6.555429729518591]
A Gumbel-Top-$K$ router, for every token of a mixed-of-experts (MoE) model, a emphrouting law
両面構成 emphHierarchical Copula-Gumbel-Top-$K$ (CGA) を与える。
論文 参考訳(メタデータ) (2026-07-25T12:43:47Z) - ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents [48.80766702702854]
LLMベースの検索エージェントは、主に結果のみの報酬で訓練され、検索プロセス自体は監督されていない。
この信号は、全てのサンプル軌跡が同じ正当性を共有する結果同質な群に対して退化し、群内の優位性はゼロとなり、勾配は得られない。
ARBOR(Adaptive Buffer for Online Reward)は,クエリ間で共有されるルーリックメモリを維持する再利用可能なプロセス・リワードフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T06:58:54Z) - Routers Learn the Geometry of Their Experts: Geometric Coupling in Sparse Mixture-of-Experts [23.123497435269112]
SMoEの経路決定が機械的にどのように形成されるかを検討する。
スクラッチからトレーニングされた1億ドルのSMoEでは、より高いルータスコアが専門家のニューロンの活性化を予測する。
この結果から、ルータが効率的な分業を支援する代入幾何学をいかに形成するかが説明できる。
論文 参考訳(メタデータ) (2026-05-12T17:55:02Z) - Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts [49.09151538536423]
Mixture-of-experts (MoE)モデルはトークンごとに専門家のサブセットだけを活性化することでスケーラブルなトランスフォーマーアーキテクチャを実現する。
最近の証拠は、より粒度の細かい専門家、すなわち、少数の大きな専門家ではなく、多くの小さな専門家によって、パフォーマンスが向上することを示している。
ベクトル量子化(VQ)に基づく逆インデックス型ルーティングアーキテクチャである MoE (AIR-MoE) の適応型逆インデックスルーティングを導入する。
論文 参考訳(メタデータ) (2026-05-06T14:15:10Z) - Teacher-Guided Routing for Sparse Vision Mixture-of-Experts [25.423413775524704]
本稿では,Sparse Vision Mixture-of-ExpertsのためのTGR-MoE: Teacher-Guided Routingを提案する。
事前訓練された高密度教師モデルから導かれた指導を用いてルータ学習を安定化する。
高度にスパースな構成でも安定したトレーニングを維持しながら、正確性とルーティングの整合性を一貫して改善する。
論文 参考訳(メタデータ) (2026-04-23T06:34:10Z) - MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching [60.886768806064936]
Tool-Integrated Reasoningは、外部ツールのインタラクションと推論ステップをインターリーブすることで、大規模な言語モデルで複雑なタスクに対処することを可能にする。
既存の強化学習法は、結果や軌道レベルの報酬に依存し、軌道内のすべてのステップに一様の利点を割り当てる。
両部間マッチングに基づくターンレベルの報酬割当と二重レベルの優位性推定によるきめ細かい監視を実現するフレームワークであるMatchTIRを提案する。
論文 参考訳(メタデータ) (2026-01-15T18:59:23Z) - BASE Layers: Simplifying Training of Large, Sparse Models [53.98145464002843]
我々は,大規模言語モデルのための新しいバランスド・アサイン・オブ・エキスパート(base)層を導入する。
スパース層は、各トークンを専門のエキスパートモジュールにルーティングすることで、トレーニングと推論の効率を劇的に改善することができる。
トークン対エキスパート割り当てを線形割り当て問題として定式化し、各専門家が等しいトークン数を受け取る最適な割り当てを可能にする。
論文 参考訳(メタデータ) (2021-03-30T23:08:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。