論文の概要: From Experts to Sub-experts: Fine-grained Parameter-Efficient Fine-Tuning for MoE LLMs
- arxiv url: http://arxiv.org/abs/2609.25655v1
- Date: Tue, 22 Sep 2026 04:04:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.217047
- Title: From Experts to Sub-experts: Fine-grained Parameter-Efficient Fine-Tuning for MoE LLMs
- Title(参考訳): エキスパートからサブエキスパートへ: MoE LLM のパラメータ効率の良い微調整
- Abstract要約: サブエキスパートレベルの適応は、大規模言語モデルのためのより正確で効率的なPEFTパラダイムである。
Neural Sub-expert Fine-Tuningは、専門家からサブエキスパートへのMoE適応を洗練させる微細なPEFTフレームワークである。
- 参考スコア(独自算出の注目度): 54.56613868885818
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As large language models (LLMs) scale rapidly, dense full-parameter adaptation becomes increasingly expensive, motivating sparse and modular architectures such as Mixture-of-Experts (MoE) models. This shift raises a key question for parameter-efficient fine-tuning (PEFT): at what granularity should parameters be selected and updated? Existing PEFT methods such as LoRA operate on predefined weight matrices, while expert-level sparse tuning methods update entire selected experts. However, we observe that activated experts are internally sparse, with only a small fraction of intermediate channels strongly responding to downstream tasks, indicating that expert-level adaptation is still too coarse. We propose NSFT (Neural Sub-expert Fine-Tuning), a fine-grained PEFT framework that refines MoE adaptation from experts to sub-experts. NSFT decomposes each expert along the intermediate dimension into structured channel groups and selects task-relevant sub-experts by combining routing importance with intra-expert activation saliency. To optimize sparse partial updates, NSFT further introduces learning-rate scaling and dynamic gradient scaling to compensate for the reduced effective update magnitude. Experiments on OLMoE and Ling-mini-2.0 across challenging domain-specific tasks and general benchmarks show that NSFT consistently outperforms representative PEFT and expert-level sparse tuning baselines, while using substantially fewer trainable parameters and preserving competitive general capability. These results suggest that sub-expert-level adaptation is a more precise and efficient PEFT paradigm for MoE LLMs.
- Abstract(参考訳): 大規模言語モデル (LLM) が急速にスケールするにつれて、密度の高いフルパラメータ適応はますます高価になり、Mixture-of-Experts (MoE) モデルのようなスパースとモジュラーアーキテクチャを動機付けている。
このシフトは、パラメータ効率の細かいチューニング(PEFT: parameter- efficient fine-tuning)の重要な疑問を提起する。
LoRAのような既存のPEFTメソッドは事前に定義された重み行列で動作し、専門家レベルのスパースチューニングメソッドは選択した専門家全体を更新する。
しかし、アクティベートされた専門家は内部的に疎いため、下流のタスクに強く反応する中間チャネルのごく一部しか存在せず、専門家レベルの適応はいまだに粗いことを示唆している。
我々は、専門家からサブエキスパートへのMoE適応を洗練させる微細なPEFTフレームワークNSFT(Neural Sub-expert Fine-Tuning)を提案する。
NSFTは、各専門家を中間次元に沿って構造化されたチャネル群に分解し、ルーティングの重要度とエキスパート内のアクティベーションサリエンシを組み合わせたタスク関連サブエキスパートを選択する。
スパース部分更新を最適化するために、NSFTはさらに学習速度のスケーリングと動的勾配のスケーリングを導入し、効率の悪い更新の規模を補う。
OLMoEとLing-mini-2.0のドメイン固有の課題と一般的なベンチマークによる実験により、NSFTはPEFTとエキスパートレベルのスパースチューニングベースラインを一貫して上回り、トレーニング可能なパラメータをはるかに少なくし、競争力のある汎用能力を保っていることが示された。
これらの結果から, サブエキスパートレベルの適応はより正確で効率的なPEFTパラダイムであることが示唆された。
関連論文リスト
- Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models [50.34585122347149]
これは連続的なトランスフォーマー層にまたがるエキスパートパラメータを共有するアーキテクチャ修正である。
我々は、OLMoE、Qwen3、DeepSeekスタイルのMoEなど、一般的な最先端アーキテクチャにおけるこのアプローチを評価した。
論文 参考訳(メタデータ) (2026-06-15T15:08:09Z) - DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts [56.175408382091796]
本研究では, 標準重み付け集約を構造集約に置き換えることにより, 専門家やルータを変更することなく, 専門家合成空間を拡大することを示す。
DAG-MoEは軽量モジュールを用いて,選択した専門家の最適な集約構造を自動的に学習するスパースMoEフレームワークである。
論文 参考訳(メタデータ) (2026-05-31T07:08:16Z) - TuckA: Hierarchical Compact Tensor Experts for Efficient Fine-Tuning [83.93651411533533]
4つのキー特性を持つTucker Adaptation(TuckA)を導入する。
我々は,ルータのパラメータサイズを$L$の係数で削減する,効率的なバッチレベルルーティング機構を開発した。
自然言語理解、画像分類、数学的推論におけるベンチマーク実験は、TuckAの有効性を物語っている。
論文 参考訳(メタデータ) (2025-11-10T09:03:16Z) - Rank Also Matters: Hierarchical Configuration for Mixture of Adapter Experts in LLM Fine-Tuning [5.074620301447097]
本稿では,大規模言語モデル(LLM)のための専門家のアロケーションとランク設定のための階層型スキームHILOを提案する。
HILOは、層間のアダプタエキスパートの数とランクを動的に調整し、アダプタの粒度の異なるモデルレイヤの表現複雑性に適合する。
複数のベンチマークタスクの実験では、HILOが既存のメソッドよりも精度が高く、トレーニング可能なパラメータが少ないことが示されている。
論文 参考訳(メタデータ) (2025-02-06T08:58:03Z) - Upcycling Instruction Tuning from Dense to Mixture-of-Experts via Parameter Merging [36.0133566024214]
Upcycling Instruction Tuning (UpIT) は、密度の高い事前学習されたモデルをMoE命令モデルにチューニングするためのデータ効率のよいアプローチである。
MoEモデルの各専門家が期待通りに機能するように、我々は、ルータを事前最適化するために、各専門家が抽出する少数のシードデータを選択する。
論文 参考訳(メタデータ) (2024-10-02T14:48:22Z) - Let the Expert Stick to His Last: Expert-Specialized Fine-Tuning for Sparse Architectural Large Language Models [24.915387910764082]
エキスパート特化ファインチューニング(Expert-Specialized Fine-Tuning、ESFT)は、他の専門家やモジュールを凍結しながら、下流のタスクに最も関係のある専門家をチューニングする。
よりきめ細かい専門家によるMoEモデルは、下流タスクに最も関係のある専門家の組み合わせを選択する上でより有利である。
論文 参考訳(メタデータ) (2024-07-02T03:11:13Z) - Multilinear Mixture of Experts: Scalable Expert Specialization through Factorization [51.98792406392873]
Mixture of Experts (MoE)は、高密度層をより小さくモジュール化された計算に分解する強力な方法を提供する。
大きな課題は、きめ細かい特殊化を達成するのに十分高い専門家の数をスケーリングする計算コストである。
視覚モデルに焦点をあて、この問題に対処するため、Multilinear Mixture of Experts(mu$MoE)層を提案する。
論文 参考訳(メタデータ) (2024-02-19T21:20:22Z) - MoEC: Mixture of Expert Clusters [93.63738535295866]
Sparsely Mixture of Experts (MoE)は、安価な計算オーバーヘッドを持つ有望なスケーリング能力のため、大きな関心を集めている。
MoEは密度の高い層をスパースの専門家に変換し、ゲートルーティングネットワークを使用して専門家を条件付きで活性化させる。
しかし、専門家の数が増加するにつれて、乱雑なパラメータを持つMoEはデータアロケーションの過度な調整とスパースに悩まされる。
論文 参考訳(メタデータ) (2022-07-19T06:09:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。