論文の概要: MaskCoFT: Masked Co-Adaptive Fine-Tuning for Memory-Efficient MoE Inference
- arxiv url: http://arxiv.org/abs/2609.34077v2
- Date: Fri, 02 Oct 2026 14:55:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:29.924006
- Title: MaskCoFT: Masked Co-Adaptive Fine-Tuning for Memory-Efficient MoE Inference
- Title(参考訳): MaskCoFT: メモリ効率の良いMoE推論のためのマスク付き適応ファインチューニング
- Abstract要約: MaskCoFTは、クロスエントロピー損失だけでルーターとエキスパートを訓練する。
トークン単位のエキスパートフェッチを23.7%、ベースモデルに対して10.1%削減する。
9つのベンチマークの平均精度は、ベースモデルよりも0.92と0.53ポイント高い。
- 参考スコア(独自算出の注目度): 17.718564947470906
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-experts (MoE) language models often exceed the memory of a single GPU. Expert offloading keeps most experts in host memory and loads them on demand, so decoding speed depends on how many experts each token must fetch. Caching and prefetching reduce this cost only as far as the routing allows. Router-only fine-tuning can reshape the routing to reuse experts, but it keeps the experts frozen, so they cannot adapt to the tokens the new routing sends them. We propose MaskCoFT, a masked co-adaptive fine-tuning method that trains routers and experts together with the cross-entropy loss alone. During fine-tuning, a learnable binary mask restricts the Top-K routing of each layer to a subset of experts, and the experts adapt to the tokens redirected to them. At inference, the learned mask becomes a soft prior that re-ranks experts, so every expert remains selectable. We simulate a GPU cache of 4 experts per layer for Mixtral-8x7B and 12 for DeepSeek-V2-Lite. MaskCoFT cuts expert fetches per token by 23.7% and 10.1% relative to the base model. In real offloading system serving, it lowers the time per output token by up to 16.4% and 5.5%, respectively. Its average accuracy over nine benchmarks stays above the base model by 0.92 and 0.53 points.
- Abstract(参考訳): Mixture-of-experts (MoE)言語モデルは、1つのGPUのメモリを超えることが多い。
専門家のオフロードは、ほとんどの専門家をホストメモリに保持し、必要に応じてロードするので、デコード速度は各トークンが取得しなければならない専門家の数に依存する。
キャッシュとプリフェッチは、ルーティングが許す限り、このコストを削減します。
ルータのみの微調整は、専門家の再利用のためにルーティングを再構築するが、専門家は凍結し続けるため、新しいルーティングが送信するトークンに適応できない。
本研究では,クロスエントロピー損失のみでルータとエキスパートを訓練するマスク付き共適応微調整手法MaskCoFTを提案する。
微調整の間、学習可能なバイナリマスクは各レイヤのTop-Kルーティングを専門家のサブセットに制限し、専門家はそれらにリダイレクトされたトークンに適応する。
推測すると、学習したマスクは、専門家を再ランクする柔らかい事前になるため、すべての専門家が選択可能である。
我々は、Mixtral-8x7BのGPUキャッシュとDeepSeek-V2-Liteの12のGPUキャッシュをシミュレートする。
MaskCoFTはトークン当たりのエキスパートフェッチを23.7%、ベースモデルに対して10.1%削減する。
実際のオフロードシステムでは、出力トークンあたりの時間をそれぞれ16.4%と5.5%に下げる。
9つのベンチマークの平均精度は、ベースモデルよりも0.92と0.53ポイント高い。
関連論文リスト
- Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models [3.749501286035187]
再正規化は暗黙的に専門家のアウトプットゲインをトレーニングのトップ$k$に校正することを示す。
再正常化を完全に除去することは破滅的であり、適切な基準質量を維持することが重要であることを示す。
論文 参考訳(メタデータ) (2026-09-04T00:11:28Z) - Every Expert Counts: ExactMoE for Memory-Efficient W4A16 Inference [0.0]
ExactMoEは、対称群-128 4ビットの量子化をルーティングされた専門家にのみ適用する推論設計である。
Exactは、専門家の完全な可用性と、変更なしのトップkルーティング手順を指す。
論文 参考訳(メタデータ) (2026-08-15T19:26:07Z) - Beyond Routing: Decoupling Expert Dispatch and Aggregation in Sparse Mixture-of-Experts [0.0]
これら2つの役割,ディスパッチとアグリゲーションが結合されるべきかどうかを検討する。
構造化されたオラクルは、3つの種に対して0.0160 +/- 0.0039 の完全水平交叉エントロピーを改善する。
FDAAは3つの種に対して Delta CE = -0.1523 +/- 0.0031 で WikiText-103 テストを改善する。
論文 参考訳(メタデータ) (2026-08-09T18:31:16Z) - ReMoE: Boosting Expert Reuse through Router Fine-Tuning in Memory-Constrained MoE LLM Inference [8.678113280424876]
きめ細かいMixture-of-Experts(MoE)モデルはトークンごとに専門家のサブセットだけを活性化する。
メモリ制約のある推論シナリオでは、少数の専門家しかキャッシュできない。
トークンワイド専門家の再利用を促進するために設計されたルータファインチューニングフレームワークであるReMoEを提案する。
論文 参考訳(メタデータ) (2026-05-26T14:32:56Z) - From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing [52.01745035243826]
Mixture-of-Experts (MoE)モデルは、各トークンを専門家のサブセットにルーティングすることで、パラメータキャパシティをスケールすることができる。
条件付きルーティングは、推論メモリの負荷をシフトし、デバイスごとに専門家の数を制限する。
本稿では,精度を保ちながら負荷のバランスをとるプラグイン・アンド・プレイ型推論時ルーティングアルゴリズムLASERを提案する。
論文 参考訳(メタデータ) (2025-09-29T16:29:17Z) - Chain-of-Experts: Unlocking the Communication Power of Mixture-of-Experts Models [58.54288496296157]
CoE(Chain-of-Experts)は新しいMixture-of-Experts(MoE)アーキテクチャで、各レイヤ内でのシーケンシャルな専門家通信を導入している。
イテレーション間の動的専門家選択をサポートするために、CoEはレイヤ内の各ステップに専用のルータを使用している。
論文 参考訳(メタデータ) (2025-06-23T02:15:43Z) - Turn Waste into Worth: Rectifying Top-$k$ Router of MoE [111.12838294273033]
MoEモデルは、その計算効率のために、大きな言語モデルのトレーニングに人気がある。
一般的に使用される上位$のルーティングメカニズムは、アンバランスなルーティングのために冗長性とメモリコストに悩まされる。
ドロップトークンとパディングに対処するため,GPU内整流とFill-in整流を含む整流化を提案する。
これらの組み合わせは、バニラトップ1ルータの精度を4.7%上回る優れた性能を達成する。
論文 参考訳(メタデータ) (2024-02-17T06:23:27Z) - Mixtral of Experts [57.411379935325435]
Mixtral 8x7Bはスパース・ミックス・オブ・エキスパートズ(SMOE)言語モデルである。
Mixtralは数学、コード生成、多言語ベンチマークでLlama 270Bをはるかに上回っている。
また、GPT-3.5 Turbo、Claude-2.1、Gemini Pro、Llama 2 70Bを超越したMixtral 8x7B - Instructという命令に従うように微調整されたモデルも提供する。
論文 参考訳(メタデータ) (2024-01-08T18:47:34Z) - Mixture-of-Experts with Expert Choice Routing [44.777850078713634]
以前の作業では、トップk関数を使用して各トークンに一定数の専門家を割り当てていた。
本稿では,専門家選択手法を用いた異種混合実験を提案する。
本手法は, トレーニング収束時間を2倍以上改善する。
論文 参考訳(メタデータ) (2022-02-18T17:46:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。