論文の概要: Routing by Analogy: kNN-Augmented Expert Assignment for Mixture-of-Experts
- arxiv url: http://arxiv.org/abs/2601.02144v1
- Date: Mon, 05 Jan 2026 14:16:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-06 16:25:23.171005
- Title: Routing by Analogy: kNN-Augmented Expert Assignment for Mixture-of-Experts
- Title(参考訳): アナロジーによるルーティング:kNN-Augmented Expert Assignment for Mixture-of-Experts
- Abstract要約: Mixture-of-Experts (MoE)アーキテクチャは、パラメトリックな"router"を使用して、トークンを専門家のまばらなサブセットにディスパッチすることで、大きな言語モデルを効率的にスケールする。
我々は、類似したケースのメモリから最適な専門家の割り当てを再利用する検索強化ルーティングフレームワークであるkNN-MoEを紹介する。
実験の結果、kNN-MoEはゼロショットベースラインよりも優れており、計算コストのかかる微調整に匹敵することがわかった。
- 参考スコア(独自算出の注目度): 32.65737144630759
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts (MoE) architectures scale large language models efficiently by employing a parametric "router" to dispatch tokens to a sparse subset of experts. Typically, this router is trained once and then frozen, rendering routing decisions brittle under distribution shifts. We address this limitation by introducing kNN-MoE, a retrieval-augmented routing framework that reuses optimal expert assignments from a memory of similar past cases. This memory is constructed offline by directly optimizing token-wise routing logits to maximize the likelihood on a reference set. Crucially, we use the aggregate similarity of retrieved neighbors as a confidence-driven mixing coefficient, thus allowing the method to fall back to the frozen router when no relevant cases are found. Experiments show kNN-MoE outperforms zero-shot baselines and rivals computationally expensive supervised fine-tuning.
- Abstract(参考訳): Mixture-of-Experts (MoE)アーキテクチャは、パラメトリックな"router"を使用して、トークンを専門家のまばらなサブセットにディスパッチすることで、大きな言語モデルを効率的にスケールする。
通常、このルータは一度訓練され、その後凍結される。
我々は、類似した過去のメモリから最適な専門家の割り当てを再利用する検索強化ルーティングフレームワークであるkNN-MoEを導入することで、この制限に対処する。
このメモリは、トークン単位のルーティングログを直接最適化して、参照セット上の可能性の最大化によってオフラインで構築される。
重要なことは、回収された隣人の集合的類似性を信頼駆動混合係数として使用することにより、関連するケースが見つからない場合に、その手法を冷凍ルータにフォールバックすることができる。
実験の結果、kNN-MoEはゼロショットベースラインよりも優れており、計算コストのかかる微調整に匹敵することがわかった。
関連論文リスト
- Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation [49.8459545291965]
Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-11T02:40:58Z) - Agent-as-a-Router: Agentic Model Routing for Coding Tasks [54.00153674547733]
Agent-as-a-router (AC)はC-A-Fループとしてルーティングを形式化する(Context->Action->FeedbackContext)
ACは、分配タスクに対する最小の累積後悔を達成し、配布外エージェントプログラミングタスクに一般化する。
論文 参考訳(メタデータ) (2026-06-22T06:37:31Z) - Redesign Mixture-of-Experts Routers with Manifold Power Iteration [60.55368504665436]
Manifold Power Iteration (MPI) を用いたルータの再設計を提案する。
MPIはルータ列を駆動し、関連する専門家の主特異方向に向かって収束させる。
MPIはルータ列を駆動し、関連する専門家の主特異方向に向かって収束することを示す。
論文 参考訳(メタデータ) (2026-06-10T17:57:36Z) - When Model Merging Breaks Routing: Training-Free Calibration for MoE [67.27839627141972]
Hessian-Aware Router (HARC) は、二階曲率情報を利用してマージされたルータを認識できるトレーニングフリーのフレームワークである。
数学的推論とコード生成タスクの実験は、HARCが様々なMoEマージベースライン間のルーティングの分解を効果的に軽減していることを示している。
論文 参考訳(メタデータ) (2026-06-02T09:33:33Z) - Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts [49.09151538536423]
Mixture-of-experts (MoE)モデルはトークンごとに専門家のサブセットだけを活性化することでスケーラブルなトランスフォーマーアーキテクチャを実現する。
最近の証拠は、より粒度の細かい専門家、すなわち、少数の大きな専門家ではなく、多くの小さな専門家によって、パフォーマンスが向上することを示している。
ベクトル量子化(VQ)に基づく逆インデックス型ルーティングアーキテクチャである MoE (AIR-MoE) の適応型逆インデックスルーティングを導入する。
論文 参考訳(メタデータ) (2026-05-06T14:15:10Z) - Self-Routing: Parameter-Free Expert Routing from Hidden States [14.018297453424454]
Mixture-of-Experts (MoE)レイヤは、トークンごとに専門家の小さなサブセットをアクティベートすることで、モデルのキャパシティを向上する。
本稿では,トークン隠蔽状態の指定された部分空間を専門家のロジットとして直接使用するパラメータフリーなルーティング機構であるSelf-Routingを提案する。
論文 参考訳(メタデータ) (2026-04-01T03:05:20Z) - Path-Constrained Mixture-of-Experts [23.80197713200086]
MoEルーティングは各レイヤの専門家を独立して選択する。
本稿では,連続層にまたがるルータパラメータを共有するパスモエを提案する。
0.9Bおよび16Bパラメータモデルの実験では、独立ルーティングよりも複雑なタスクと下流タスクが一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-03-18T21:35:53Z) - Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs [24.791817951102487]
ルーティング重みの多様体をタスク埋め込みの多様体と整合させることで、このギャップを効果的に軽減できることを示す。
実験では,RoMAを用いてOLMoE,DeepSeekMoE,Qwen3-MoEのルータを微調整する。
論文 参考訳(メタデータ) (2025-11-10T18:59:53Z) - Robust Nearest Neighbour Retrieval Using Targeted Manifold Manipulation [0.0]
最近傍の検索は、分類と説明可能なAIパイプラインの中心である。
特徴多様体の指定された領域に各サンプルをどの程度容易に適用できるかを評価することによって,検索を再現するTMM-NNを提案する。
TMM-NNは軽量でクエリ固有のトリガパッチを通じてこれを実装している。
論文 参考訳(メタデータ) (2025-11-09T07:37:05Z) - Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert models [52.502867924372275]
Mixture-of-Experts (MoE)モデルは、スパース専門家のアクティベーションを通じて効率的なスケーリングを実現するが、デプロイメントの分散シフトによる最適以下のルーティング決定に悩まされることが多い。
我々は、外部の監視やデータなしで、テキスト生成中にMoEルーティング決定を継続的に適用するテキストタデータフリーオンラインテストタイムフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-16T16:24:36Z) - From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing [52.01745035243826]
Mixture-of-Experts (MoE)モデルは、各トークンを専門家のサブセットにルーティングすることで、パラメータキャパシティをスケールすることができる。
条件付きルーティングは、推論メモリの負荷をシフトし、デバイスごとに専門家の数を制限する。
本稿では,精度を保ちながら負荷のバランスをとるプラグイン・アンド・プレイ型推論時ルーティングアルゴリズムLASERを提案する。
論文 参考訳(メタデータ) (2025-09-29T16:29:17Z) - RouteMark: A Fingerprint for Intellectual Property Attribution in Routing-based Model Merging [69.2230254959204]
我々は,統合されたMoEモデルにおけるIP保護のためのフレームワークであるRouteMarkを提案する。
我々の重要な洞察は、タスク固有の専門家は、探索入力の下で安定かつ独特なルーティング行動を示すことである。
属性と改ざん検出のために,類似性に基づくマッチングアルゴリズムを導入する。
論文 参考訳(メタデータ) (2025-08-03T14:51:58Z) - MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts [29.11217299899888]
MoQAEは、量子化の専門家の混合による混合精度量子化法である。
この結果から,MoQAEは最先端のKVキャッシュ量子化手法よりも効率と効率の両面で優れていることがわかった。
論文 参考訳(メタデータ) (2025-06-09T08:16:24Z) - Tight Clusters Make Specialized Experts [1.7597562616011944]
Sparse Mixture-of-Experts (MoE)アーキテクチャは、計算コストからモデルキャパシティを分離するための有望なアプローチとして登場した。
本稿では,入力トークンを適切な専門家に送信するために,入力分布の基盤となるクラスタリング構造を学習する新しいルータを提案する。
当社のACルータは,1) 収束速度の向上,2) データの破損に対する堅牢性の向上,3) 全体的な性能改善という,MoEモデルに接続した3つの利点を得ることができる。
論文 参考訳(メタデータ) (2025-02-21T09:10:54Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z) - Tractable Bounding of Counterfactual Queries by Knowledge Compilation [51.47174989680976]
本稿では, パール構造因果モデルにおいて, 因果関係などの部分的特定可能なクエリのバウンダリングの問題について議論する。
最近提案された反復EMスキームは初期化パラメータをサンプリングしてそれらの境界を内部近似する。
シンボルパラメータを実際の値に置き換えた回路構造を,単一のシンボル知識コンパイルによって得られることを示す。
論文 参考訳(メタデータ) (2023-10-05T07:10:40Z) - Sparse Backpropagation for MoE Training [118.31785160874024]
バックプロパゲーションとスパースエキスパートルーティングのギャップを埋めるスケーラブルな勾配推定器であるSparseMixerを紹介する。
SparseMixerは数値的なODEフレームワークを基盤として、2階のODEソルバであるミドルポイント法を利用して正確な勾配近似を行う。
事前トレーニングと機械翻訳の両方にSparseMixerをSwitch Transformerに適用すると、SparseMixerのパフォーマンスは大幅に向上する。
論文 参考訳(メタデータ) (2023-10-01T22:43:57Z) - Soft Merging of Experts with Adaptive Routing [38.962451264172856]
適応ルーティングによるエキスパートのソフトマージ(SMEAR)について紹介する
SMEARは、専門家のパラメータの重み付け平均を通して構築された単一の「マージされた」専門家を使用することで、離散的なルーティングを避ける。
我々は,メタデータに基づいた経路モデルや,勾配推定によるスパースルーティングを学習するSMEARモデルを用いたモデルの有効性を実証的に検証した。
論文 参考訳(メタデータ) (2023-06-06T15:04:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。