論文の概要: MoE$^2$-LoRA: When MoE Models Meet MoE-style Low-Rank Adaptation
- arxiv url: http://arxiv.org/abs/2607.21978v1
- Date: Fri, 24 Jul 2026 04:50:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.049185
- Title: MoE$^2$-LoRA: When MoE Models Meet MoE-style Low-Rank Adaptation
- Title(参考訳): MoE$^2$-LoRA: MoEモデルがMoEスタイルの低ランク適応と出会うとき
- Authors: Qingyu Yang, Haonan He, Minglei Li, Jingqi Ye, Tao Chen, Lei Bai, Peng Ye,
- Abstract要約: ミックス・オブ・エクササイズ(Mixture-of-Experts, MOE)アーキテクチャは大規模言語モデルで広く採用されているが、パラメータ効率のよいMOEモデルのための微細チューニング(PEFT)は未検討のままである。
我々は、MoEスタイルの低ランク適応でMoEモデルを微調整する最初の試みを行う: “MoE$2$-LoRA” と題された我々の手法は、タスク固有の適応性を備えた事前訓練された専門家専門化を深く結合する。
- 参考スコア(独自算出の注目度): 23.49321952252126
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts (MoE) architectures have been widely adopted in large language models, yet parameter-efficient fine-tuning (PEFT) for MoE models remains underexplored. Existing PEFT methods for MoE either ignore router priors with uniform adapters, reducing efficiency and risking forgetting, or rely on static expert selection, limiting per-token capacity and cross-expert feature learning. In this paper, we make the first attempt to fine-tune MoE models with MoE-style low-rank adaptation: our method, entitled MoE$^2$-LoRA, deeply couples the pretrained expert specialization with task-specific adaptivity via a dual-channel Routing-Conditioned Projection (RCP) module, which reuses base router activations to inform LoRA routing. We further introduce a single global LoRA expert pool shared across all layers, enabling model-wide adaptation with emergent layer-wise affinities and balanced expert utilization. MoE$^2$-LoRA simultaneously benefits from the advantages of prior reuse, dynamic adapter routing, and model-wide knowledge sharing. Evaluated on multiple MoE backbones with varying scales and expert granularities, MoE$^2$-LoRA consistently achieves state-of-the-art downstream accuracy while retaining stronger general capabilities.
- Abstract(参考訳): ミックス・オブ・エクササイズ(Mixture-of-Experts, MOE)アーキテクチャは大規模言語モデルで広く採用されているが、パラメータ効率のよいMOEモデルのための微細チューニング(PEFT)は未検討のままである。
既存のMoEのPEFTメソッドは、均一なアダプタでルータの先行を無視し、効率を低下させ、忘れるリスクを冒すか、静的な専門家の選択に頼り、トークン単位のキャパシティとクロスエキスパート機能学習を制限している。
本稿では,MoE方式の低ランク適応でMoEモデルを微調整する試みとして,MoE$^2$-LoRAと題する手法について述べる。
さらに、すべてのレイヤで共有される単一のグローバルなLoRAエキスパートプールを導入し、創発的なレイヤワイド親和性とバランスの取れたエキスパート利用によるモデルワイド適応を可能にします。
MoE$^2$-LoRAは、事前の再利用、動的アダプタルーティング、モデル全体の知識共有の利点から同時に恩恵を受ける。
MoE$^2$-LoRAは、様々なスケールと専門的な粒度を持つ複数のMoEバックボーンで評価され、より強力な汎用能力を保ちながら、常に最先端の下流精度を達成する。
関連論文リスト
- CoMoL: Efficient Mixture of LoRA Experts via Dynamic Core Space Merging [49.87105462292961]
Core Space Mixture of LoRA (bfCoMoL)は、専門家の多様性、パラメータ効率、きめ細かい適応を取り入れた新しいMoE-LoRAフレームワークである。
CoMoLは、複数のタスクで既存のメソッドを一貫して上回る。
論文 参考訳(メタデータ) (2026-02-28T09:40:11Z) - L-MoE: End-to-End Training of a Lightweight Mixture of Low-Rank Adaptation Experts [10.21556794551883]
L-MoE: LoRA エキスパートの軽量混合体について紹介する。
L-MoEは、MoEの専門家をタスク特化して低ランクのアダプタとして再定義する。
L-MoE の公式な数学的枠組みを提案する。
論文 参考訳(メタデータ) (2025-10-19T08:44:25Z) - FURINA: Free from Unmergeable Router via LINear Aggregation of mixed experts [17.056585698418587]
パラメータ効率の良い微調整のために,Mixture of Experts (MoE) をローランド適応 (LoRA) に統合することに成功している。
既存のMoE-LoRA手法の鍵となる制限は、離散ルータに依存することである。
我々は,LINear Aggregation of expertsに基づく,フリー・アグリゲーション・オブ・アンマージブル・ルータ・フレームワークであるFURINAを提案する。
論文 参考訳(メタデータ) (2025-09-18T12:22:32Z) - MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models [52.876185634349575]
我々は、モダリティ内およびモダリティ間エキスパート(MoIIE)の混合をLVLM(Large Vision-Language Models)に組み込むことを提案する。
それぞれのトークンに対して、専門家のルーティングはそのモダリティによってガイドされ、それぞれのモダリティの専門家と、モダリティ間のエキスパートの共有プールにトークンを指示する。
5.5B と 11.3B の活性化パラメータを持つ MoIIE モデルは,既存のオープンソース MoE-LLM ベースのマルチモーダルモデルの性能に適合するか,さらに上回っている。
論文 参考訳(メタデータ) (2025-08-13T13:00:05Z) - Exploring Sparse Adapters for Scalable Merging of Parameter Efficient Experts [72.22148263683037]
ニューラルネットワークの重みのサブセットのみをトレーニングするスパースアダプタの特性をモジュラーアーキテクチャの潜在的な構成要素として検討する。
まず,本論文の既存の手法よりも概念的にシンプルである,効果的なスパースアダプタの訓練方法を提案する。
次に,これらのスパースアダプタのマージ特性について,最大20の自然言語処理タスクに対して,アダプタをマージすることで検討する。
論文 参考訳(メタデータ) (2025-07-09T03:25:45Z) - MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models [61.89384981175277]
ローランド適応 (LoRA) とミックスオブエキスパート (MoE) を統合するための固有テキストbfMixture-of-Adapters (MoA) アプローチを提案する。
実験結果から, 不均一なMoAは均一なMoE-LoRA法よりも性能およびパラメータ効率が優れていることがわかった。
論文 参考訳(メタデータ) (2025-06-06T09:54:19Z) - ReMoE: Fully Differentiable Mixture-of-Experts with ReLU Routing [28.73697327316267]
計算予算を増大させることなく、モデルキャパシティをスケールアップするために、緩やかに活性化されたMixture-of-Experts (MoE)モデルが広く採用されている。
我々は,従来のTopK+Softmaxルーティングの簡易かつ効果的なドロップイン置換を提供する,完全に微分可能なMoEアーキテクチャであるReMoEを提案する。
ReMoEは、さまざまなモデルサイズ、専門家数、粒度のレベルにおいて、バニラTopKのMoEを一貫して上回る。
論文 参考訳(メタデータ) (2024-12-19T10:21:20Z) - Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design [59.00758127310582]
本稿では、事前学習された高密度LCMをより小さなMoEモデルに変換する新しいフレームワークRead-MEを提案する。
当社のアプローチでは,専門家の抽出にアクティベーション空間を用いる。
Read-MEは、同様のスケールの他の人気のあるオープンソース高密度モデルよりも優れています。
論文 参考訳(メタデータ) (2024-10-24T19:48:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。