論文の概要: ACE: Adapter Consolidation across Experts for Parameter-Efficient Fine-Tuning of MoE LLMs
- arxiv url: http://arxiv.org/abs/2609.06072v1
- Date: Sat, 05 Sep 2026 13:05:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.189842
- Title: ACE: Adapter Consolidation across Experts for Parameter-Efficient Fine-Tuning of MoE LLMs
- Title(参考訳): ACE: MoE LLMのパラメータ効率向上のためのエキスパート間のアダプタ統合
- Abstract要約: そこで我々はACE(Adapter Consolidation across Experts)を提案し、冗長な専門家をグループ化し、専門家固有のアダプタをグループ共有の上位LoRAモジュールに置き換える。
12のデータセットと4つのMoEバックボーンを網羅した評価において、ACEはパラメータマッチングPEFT法の中で最も高い平均精度を達成している。
- 参考スコア(独自算出の注目度): 5.509795962249259
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Parameter-efficient fine-tuning (PEFT) of mixture-of-experts (MoE) models commonly attaches a separate low-rank adapter to each expert. This expert-wise design fragments adaptation in three ways: capacity is split across narrow low-rank updates, gradient supervision becomes sparse and imbalanced under sparse routing, and execution is decomposed into many small GEMMs. We find that such expert-wise separation is often unnecessary, as subsets of LoRA adapters become functionally similar during fine-tuning, revealing redundancy among expert-specific adapters. Based on this redundancy, we propose ACE (Adapter Consolidation across Experts), which groups redundant experts and replaces their expert-specific adapters with group-shared higher-rank LoRA modules under the same PEFT budget. ACE further introduces grouped adapter execution, which consolidates fragmented expert-wise adapter computations into fewer, larger group-level GEMMs. Across evaluations covering 12 datasets and four MoE backbones, ACE achieves the highest observed mean accuracy among the parameter-matched PEFT methods on the three backbones with complete baseline coverage, while providing $1.31\times$ to $1.48\times$ wall-clock training speedup over expert-wise LoRA without increasing peak memory. Our code is available at https://github.com/UbiquitousAILab/ACE.
- Abstract(参考訳): パラメータ効率のよいMix-of-Experts(MoE)モデルの細調整(PEFT)は、各専門家に個別の低ランクアダプタを付けるのが一般的である。
キャパシティは狭い低ランク更新に分割され、勾配監督はスパースルーティングの下でスパースかつ不均衡となり、実行は多くの小さなGEMMに分解される。
LoRAアダプタのサブセットは微調整中に機能的に類似し、専門家固有のアダプタ間の冗長性が明らかになるため、このような専門家の分離は不要であることが多い。
この冗長性に基づいて、ACE(Adapter Consolidation across Experts)を提案する。これは、冗長な専門家をグループ化し、専門家固有のアダプタを、同じPEFT予算の下でグループ共有された上位LoRAモジュールに置き換えるものである。
ACEはさらにグループ化されたアダプタ実行を導入し、断片化された専門家レベルのアダプタ計算をより少ないグループレベルのGEMMに集約する。
12のデータセットと4つのMoEバックボーンをカバーする評価全体で、ACEは3つのバックボーン上のパラメータマッチングPEFTメソッドの中で最も高い平均精度を達成している。
私たちのコードはhttps://github.com/UbiquitousAILab/ACEで利用可能です。
関連論文リスト
- ACE: Adaptive Calibration-Free Expert Skipping for MoE-based LLMs [15.24786135265898]
Mixture-of-Experts (MoE)アーキテクチャは、大規模言語モデル(LLM)のスケーリングに効率的なパラダイムを提供する。
本稿では,トークン適応型エキスパートスキップのためのトレーニングフリー,キャリブレーションフリー,チェックポイント保存フレームワークであるACEを提案する。
論文 参考訳(メタデータ) (2026-09-04T14:56:00Z) - MoEGen: Mixture-of-Experts for Instance-Adaptive LoRA Generation [29.127625777844617]
MoEGenは、MoEベースのPEFTをエキスパート選択からエキスパート条件パラメータ生成に移行する適応フレームワークである。
MoEGenは、各エキスパートを、エキスパートコードと呼ばれる、小さな学習可能なベクトルとして表現する。
8つのコモンセンス推論ベンチマークの実験では、強い静的およびMoEベースのPEFTベースラインよりも一貫した改善が見られた。
論文 参考訳(メタデータ) (2026-08-04T07:51:30Z) - CoMoL: Efficient Mixture of LoRA Experts via Dynamic Core Space Merging [49.87105462292961]
Core Space Mixture of LoRA (bfCoMoL)は、専門家の多様性、パラメータ効率、きめ細かい適応を取り入れた新しいMoE-LoRAフレームワークである。
CoMoLは、複数のタスクで既存のメソッドを一貫して上回る。
論文 参考訳(メタデータ) (2026-02-28T09:40:11Z) - LiME: Lightweight Mixture of Experts for Efficient Multimodal Multi-task Learning [9.408969079896528]
MoE-PEFT法はMixture of Expertsとパラメータ効率の良い微調整を組み合わせたマルチタスク適応法である。
本稿では,アダプタレプリケーションではなく,軽量な変調によって専門的な特殊化を実現するLiMEを提案する。
MMT-47は、テキスト、画像、ビデオにまたがる47のタスクを持つマルチモーダルマルチタスクベンチマークである。
論文 参考訳(メタデータ) (2026-02-01T01:37:34Z) - Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts [74.40169987564724]
エキスパート並列性(EP)は、複数のデバイスに専門家を分散させることで、MoEモデルをスケールするように設計されている。
極端な不均衡の下で、EPは少数の専門家に不均等な数のトークンを渡し、計算とメモリバウンドの障害を引き起こす。
本稿では,過剰なトークンと関連する専門家パラメータを過負荷デバイスから未利用デバイスへ動的に再帰する新しいEPアルゴリズムであるLast-Loaded Expert Parallelism (LLEP)を提案する。
論文 参考訳(メタデータ) (2026-01-23T18:19:15Z) - TuckA: Hierarchical Compact Tensor Experts for Efficient Fine-Tuning [83.93651411533533]
4つのキー特性を持つTucker Adaptation(TuckA)を導入する。
我々は,ルータのパラメータサイズを$L$の係数で削減する,効率的なバッチレベルルーティング機構を開発した。
自然言語理解、画像分類、数学的推論におけるベンチマーク実験は、TuckAの有効性を物語っている。
論文 参考訳(メタデータ) (2025-11-10T09:03:16Z) - Exploring Sparse Adapters for Scalable Merging of Parameter Efficient Experts [72.22148263683037]
ニューラルネットワークの重みのサブセットのみをトレーニングするスパースアダプタの特性をモジュラーアーキテクチャの潜在的な構成要素として検討する。
まず,本論文の既存の手法よりも概念的にシンプルである,効果的なスパースアダプタの訓練方法を提案する。
次に,これらのスパースアダプタのマージ特性について,最大20の自然言語処理タスクに対して,アダプタをマージすることで検討する。
論文 参考訳(メタデータ) (2025-07-09T03:25:45Z) - MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models [61.89384981175277]
ローランド適応 (LoRA) とミックスオブエキスパート (MoE) を統合するための固有テキストbfMixture-of-Adapters (MoA) アプローチを提案する。
実験結果から, 不均一なMoAは均一なMoE-LoRA法よりも性能およびパラメータ効率が優れていることがわかった。
論文 参考訳(メタデータ) (2025-06-06T09:54:19Z) - TT-LoRA MoE: Unifying Parameter-Efficient Fine-Tuning and Sparse Mixture-of-Experts [4.5558042369389105]
TT-LoRA MoEはトレーニングを2つの異なる最適化段階に分解する。
まず、軽量かつテンソル化低ランクアダプタ(TT-LoRAエキスパート)を個別に訓練する。
その後、これらの専門家アダプタは凍結状態のままであり、マルチタスク設定でタスク間干渉を排除し、忘れる。
個別に訓練されたスパースMOEルータは、ベースモデル表現を動的に活用し、推論時に入力ごとに正確に1つの特別なアダプタを選択する。
総合的な実験により、我々のアーキテクチャは低ランクアダプタのメモリ効率を保ち、大きなエキスパートプールにシームレスにスケールし、堅牢なタスクレベルの最適化を実現する。
論文 参考訳(メタデータ) (2025-04-29T21:46:43Z) - Rank Also Matters: Hierarchical Configuration for Mixture of Adapter Experts in LLM Fine-Tuning [5.074620301447097]
本稿では,大規模言語モデル(LLM)のための専門家のアロケーションとランク設定のための階層型スキームHILOを提案する。
HILOは、層間のアダプタエキスパートの数とランクを動的に調整し、アダプタの粒度の異なるモデルレイヤの表現複雑性に適合する。
複数のベンチマークタスクの実験では、HILOが既存のメソッドよりも精度が高く、トレーニング可能なパラメータが少ないことが示されている。
論文 参考訳(メタデータ) (2025-02-06T08:58:03Z) - Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy [84.11508381847929]
わずかに活性化されたMixture-of-Experts(SMoE)は、ニューラルネットワークの学習能力のスケールアップを約束している。
ルーティング統計を利用したM-SMoEを提案する。
我々のMC-SMoEは最大80%のメモリと20%のFLOPを削減でき、性能は実質的に損なわれない。
論文 参考訳(メタデータ) (2023-10-02T16:51:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。