論文の概要: EPnG: Adaptive Expert Prune-and-Grow for Parameter-Efficient MoE Fine-tuning
- arxiv url: http://arxiv.org/abs/2607.01789v1
- Date: Thu, 02 Jul 2026 07:02:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.714439
- Title: EPnG: Adaptive Expert Prune-and-Grow for Parameter-Efficient MoE Fine-tuning
- Title(参考訳): EPnG:パラメータ効率の良いMoEファインチューニングのためのアダプティブエキスパートPrune-and-Grow
- Abstract要約: Mixture-of-Experts (MoE)モデルは効率よくスケールするが、冗長な専門家と均一なパラメータ割り当てのため、コストがかかる。
本稿では,ルータゲートの確率からLoRAのキャパシティを推定する適応的プーン・アンド・グローフレームワークEPnGを提案する。
OLMoE と Qwen1.5-MoE 全体では、EPnG は同じ予算で LoRA を一貫して上回り、完全な微調整に匹敵する性能を達成する。
- 参考スコア(独自算出の注目度): 6.019056267714185
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-Experts (MoE) models scale efficiently but remain costly to adapt due to redundant experts and uniform parameter allocation. Existing parameter-efficient fine-tuning (PEFT) methods such as LoRA ignore MoE routing dynamics, leading to suboptimal resource use. We propose EPnG, an adaptive prune-and-grow framework that reallocates LoRA capacity based on expert importance derived from router gate probabilities. EPnG prunes under-utilized experts and expands high-importance experts via rank growth with orthogonal initialization, while maintaining a fixed parameter budget. Across OLMoE and Qwen1.5-MoE, EPnG consistently outperforms LoRA under the same budget and achieves performance comparable to full fine-tuning while updating only 0.55%-0.72% of parameters (up to 140x-180x fewer). These results demonstrate that aligning PEFT with MoE routing yields a more effective and scalable fine-tuning strategy.
- Abstract(参考訳): Mixture-of-Experts (MoE)モデルは効率よくスケールするが、冗長な専門家と均一なパラメータ割り当てのため、コストがかかる。
LoRAのような既存のパラメータ効率の細かいチューニング(PEFT)メソッドは、MoEルーティングのダイナミクスを無視し、リソースの最適化に繋がる。
本稿では,ルータゲートの確率からLoRAのキャパシティを推定する適応的プーン・アンド・グローフレームワークEPnGを提案する。
EPnGは、未使用の専門家を抜粋し、厳格なパラメータ予算を維持しながら、直交初期化によるランク成長を通じて、重要度の高い専門家を拡大する。
OLMoE と Qwen1.5-MoE 全体では、EPnG は一貫して同じ予算で LoRA を上回り、0.55%-0.72% のパラメータしか更新せず、完全な微調整に匹敵する性能を達成している(最大 140x-180x 以下)。
これらの結果から,PEFTとMoEルーティングの整合性は,より効率的かつスケーラブルな微調整戦略をもたらすことが示された。
関連論文リスト
- APEX: Adaptive Expert Prefetching for Memory-Efficient Edge MoE Inference [0.0]
Mixture-of-Experts(MoE)モデルは、トークン当たりのパラメータの小さなサブセットのみをアクティベートしながら、高いモデルキャパシティを提供するため、エッジデプロイメントにとって魅力的なものだ。
本稿では,APEX:Adaptive Expert Prefetchingについて述べる。
論文 参考訳(メタデータ) (2026-08-12T05:57:09Z) - MMOE: Modernizing Diffusion Transformers with Efficient Expert Design [76.86793131833551]
現代の大規模言語モデルは、キャパシティの増大と効率のペアリング、トーケン毎の維持、およびキャパシティの増大に伴うデプロイメントコストの制御によって、うまくスケールする。
近年の取り組みは, LLMのスケーリングを実践する効率メカニズムをインポートすることなく, 全パラメータ数と空間比を大きくした。
我々は、ルーティングされた専門家、共有および軽量の専門家、ゲート-残留ルーティング、AIGC生成へのアテンション-残留情報再利用に対応する、SiTスタイルの拡散変換器の近代化であるModernMOEを紹介する。
論文 参考訳(メタデータ) (2026-07-27T17:05:04Z) - SMoA: Spectrum Modulation Adapter for Parameter-Efficient Fine-Tuning [57.85676271833619]
低ランク適応 (LoRA) は、全パラメータの微調整をシミュレートするために低ランク更新法を用いる。
ランクが大きくなるにつれて、より主特異な方向が保存され、一般にモデルの性能が向上する。
textbfSpectrum textbfModulation textbfAdapterを提案する。
論文 参考訳(メタデータ) (2026-05-20T13:19:28Z) - Adaptive and Fine-grained Module-wise Expert Pruning for Efficient LoRA-MoE Fine-Tuning [22.981851203999614]
LoRA-MoEはパラメータ効率の良い微調整のための効果的なパラダイムとして登場した。
既存のLoRA-MoEフレームワークは通常、下流モジュールにまたがる固定かつ均一なトランスフォーマーを採用する。
本稿では,動的モジュールワイド・エキスパート・プルーニングに基づくLoRA-MoEファインチューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-29T06:45:44Z) - FineRMoE: Dimension Expansion for Finer-Grained Expert with Its Upcycling Approach [58.345210583013454]
FineRMoEは、細粒度の専門家設計を中間次元と出力次元の両方に拡張するアーキテクチャである。
パラメータ効率の6倍、プリフィルレイテンシの281倍、推論時の復号スループットの136倍を実現している。
論文 参考訳(メタデータ) (2026-03-09T12:00:36Z) - High-Rank Structured Modulation for Parameter-Efficient Fine-Tuning [57.85676271833619]
低ランク適応 (LoRA) は、全パラメータの微調整をシミュレートするために低ランク更新法を用いる。
textbfStructured textbfMOdulation textbfAdapterは、より高いランクを維持しながらトレーニング可能なパラメータを少なくする。
論文 参考訳(メタデータ) (2026-01-12T13:06:17Z) - ALoRE: Efficient Visual Adaptation via Aggregating Low Rank Experts [71.91042186338163]
ALoREは、Kroneckerによって構築された超複素パラメータ化空間をAggregate Low Rank Expertsに再利用する新しいPETL法である。
巧妙な設計のおかげで、ALoREは無視できる余分なパラメータを保持し、凍ったバックボーンに強制的にマージできる。
論文 参考訳(メタデータ) (2024-12-11T12:31:30Z) - ETHER: Efficient Finetuning of Large-Scale Models with Hyperplane Reflections [59.839926875976225]
本稿では,HypErplane Reflectionsによる高効率微調整を行うETHER変換ファミリを提案する。
特に,既存のPEFT法と極めて少ないパラメータで一致または性能を向上するEtheRと緩和ETHER+を導入する。
論文 参考訳(メタデータ) (2024-05-30T17:26:02Z) - DoRA: Enhancing Parameter-Efficient Fine-Tuning with Dynamic Rank Distribution [28.589498108609202]
Low-Rank Adaptation (LoRA) は、ウェイト行列の差分パラメータ予算要件を無視したバイパスフレームワークに依存している。
DoRAは、高ランクのLoRA層を構造化シングルランクコンポーネントに分解し、パラメータ予算の動的プルーニングを可能にする。
実験結果から,LORAやフルモデルファインチューニングと比較して,DoRAの競争性能が向上することが示された。
論文 参考訳(メタデータ) (2024-05-27T17:02:27Z) - T-REX: Mixture-of-Rank-One-Experts with Semantic-aware Intuition for Multi-task Large Language Model Finetuning [31.276142111455847]
大規模言語モデル(LLM)は多様なマルチタスクの微調整において重要な適応課題に直面している。
我々はmixunderlinetextbfTureunderlinetextbf-of-underlinetextbfRank-onunderlinetextbfE-eunderlinetextbfXper ts (textttT-REX) という新しいフレームワークを設計する。
Rank-1のエキスパートは、ミックス・アンド・マッチのメカニズムにより、線形パラメータのオーバーヘッドを持つエキスパートのベクトル部分空間を2次に拡張し、最適で近似誤差削減を達成することができる。
論文 参考訳(メタデータ) (2024-04-13T12:14:58Z) - LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning [56.88751562302793]
低ランク適応 (LoRA) が大型言語モデル (LLM) に登場した。
LoRAPruneは、高度にメモリ効率の良い正確な構造化プルーンドモデルを提供する新しいフレームワークである。
LoRAPruneはWikiText2では4.81、TBでは3.46、メモリ使用量は52.6%減少している。
論文 参考訳(メタデータ) (2023-05-28T15:15:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。