論文の概要: SAMoRA: Semantic-Aware Mixture of LoRA Experts for Task-Adaptive Learning
- arxiv url: http://arxiv.org/abs/2604.19048v1
- Date: Tue, 21 Apr 2026 03:55:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-22 22:41:49.606534
- Title: SAMoRA: Semantic-Aware Mixture of LoRA Experts for Task-Adaptive Learning
- Title(参考訳): SAMoRA:タスク適応学習のためのLoRAエキスパートのセマンティック・アウェア・ミックス
- Authors: Boyan Shi, Wei Chen, Shuyuan Zhao, Junfeng Shen, Shengnan Guo, Shaojiang Wang, Huaiyu Wan,
- Abstract要約: 本稿では,タスク適応学習に適したパラメータ効率の高いファインチューニングフレームワークを提案する。
セマンティック・アウェア・ルータは、テキストのセマンティックスを正確にルーティングするのに最も適した専門家と明確に整合させることが提案されている。
Task-Uniform Scalingメカニズムは、特定のタスク要求に基づいて専門家のコントリビューションを調整するように設計されている。
- 参考スコア(独自算出の注目度): 16.375739338401303
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The combination of Mixture-of-Experts (MoE) and Low-Rank Adaptation (LoRA) has shown significant potential for enhancing the multi-task learning capabilities of Large Language Models. However, existing methods face two primary challenges: (1)Imprecise Routing in the current MoE-LoRA method fails to explicitly match input semantics with expert capabilities, leading to weak expert specialization. (2)Uniform weight fusion strategies struggle to provide adaptive update strengths, overlooking the varying complexity of different tasks. To address these limitations, we propose SAMoRA (Semantic-Aware Mixture of LoRA Experts), a novel parameter-efficient fine-tuning framework tailored for task-adaptive learning. Specifically, A Semantic-Aware Router is proposed to explicitly align textual semantics with the most suitable experts for precise routing. A Task-Adaptive Scaling mechanism is designed to regulate expert contributions based on specific task requirements dynamically. In addition, a novel regularization objective is proposed to jointly promote expert specialization and effective scaling. Extensive experiments on multiple multi-task benchmarks demonstrate that SAMoRA significantly outperforms the state-of-the-art methods and holds excellent task generalization capabilities. Code is available at https://github.com/boyan-code/SAMoRA
- Abstract(参考訳): MoE(Mixture-of-Experts)とLoRA(Low-Rank Adaptation)の組み合わせは、大規模言語モデルのマルチタスク学習能力を向上する大きな可能性を示している。
1) 現在のMoE-LoRA法では、入力セマンティクスと専門家の能力とを明確に一致させることができず、専門家の専門化が弱くなる。
2) 統一的な重み融合戦略は, 様々なタスクの複雑さを見越して, 適応的な更新強度の提供に苦慮している。
これらの制約に対処するために,タスク適応学習に適したパラメータ効率の高いファインチューニングフレームワークであるSAMoRA(Semantic-Aware Mixture of LoRA Experts)を提案する。
具体的には、セマンティック・アウェア・ルータ(Semantic-Aware Router)を提案する。
Task-Adaptive Scalingメカニズムは、特定のタスク要求に基づいて専門家のコントリビューションを動的に調整するように設計されている。
また,専門家の専門化と効果的なスケーリングを促進するために,新たな正規化目標を提案する。
複数のマルチタスクベンチマークに対する大規模な実験により、SAMoRAは最先端の手法を著しく上回り、優れたタスク一般化能力を有することが示された。
コードはhttps://github.com/boyan-code/SAMoRAで入手できる。
関連論文リスト
- Beyond Redundancy: Diverse and Specialized Multi-Expert Sparse Autoencoder [59.89996751196727]
スパースオートエンコーダ(SAE)は、大規模な言語モデルを解釈するための強力なツールとして登場した。
SAEの隠蔽層は、空間的制約を満たすために高い次元性を持ち、結果として禁止的なトレーニングと推論コストをもたらす。
近年のMixture of Experts (MoE) アプローチは、SAEsによってゲートアクティベーションを持つより狭い専門家ネットワークにこの問題に対処しようとしている。
本稿では,(1)専門化を促進するために意味的に重み付けされた専門家サブセットを同時に関与する複数の専門家活性化,(2)適応的な高周波スケーリングによって多様性を高める特徴スケーリングという2つの重要なイノベーションを提案する。
論文 参考訳(メタデータ) (2025-11-07T22:19:34Z) - MoRE: A Mixture of Low-Rank Experts for Adaptive Multi-Task Learning [18.0412262027514]
マルチタスクのためのMixture of Low-Rank Experts (MoRE)を提案する。
各タスクに個別のLoRAを使う代わりに、異なるタスクでLoRAモジュールの異なるランクを調整します。
また、タスクごとに適切な専門家を選択するために、新しい適応的なランクセレクタを設計する。
論文 参考訳(メタデータ) (2025-05-28T12:32:09Z) - ThanoRA: Task Heterogeneity-Aware Multi-Task Low-Rank Adaptation [96.86211867758652]
Low-Rank Adaptation (LoRA) は、基礎モデルの下流の微調整に広く採用されている。
タスク不均一性を考慮したマルチタスク低ランク適応フレームワークであるTanoRAを提案する。
論文 参考訳(メタデータ) (2025-05-24T11:01:45Z) - AT-MoE: Adaptive Task-planning Mixture of Experts via LoRA Approach [0.6906005491572401]
本稿では,Adaptive Task-planing Mixture of Experts(AT-MoE)アーキテクチャを紹介する。
まず、LoRAアプローチを用いてタスク固有の専門家を訓練し、専門分野における問題解決能力と解釈可能性を高める。
次に,複雑なタスク命令に基づくモジュール融合を最適化する階層適応型グループルーティングモジュールを提案する。
論文 参考訳(メタデータ) (2024-10-12T13:03:15Z) - MTL-LoRA: Low-Rank Adaptation for Multi-Task Learning [74.43869839954168]
MTL能力を大幅に向上させながら、低ランク適応の利点を保ちつつ、MTL-LoRAを提案する。
MTL-LoRAは、タスク固有の情報を識別し、共有知識をキャプチャするタスク適応パラメータを追加することで、LoRAを強化する。
このアプローチにより、事前訓練されたモデルは、限られた数のトレーニング可能なパラメータで、異なるターゲットドメインに共同で適応することができる。
論文 参考訳(メタデータ) (2024-10-12T08:32:26Z) - AdaMoLE: Fine-Tuning Large Language Models with Adaptive Mixture of Low-Rank Adaptation Experts [0.0]
本稿では,Lank Adaptation ExpertsのAdaptive Mixtureを通じて,大規模言語モデル(LLM)を微調整する新しい手法であるAdaMoLEを紹介する。
AdaMoLEは専用のしきい値ネットワークを使用してアクティベーション閾値を動的に調整し、異なるタスクの複雑さに応じて適応的に応答する。
論文 参考訳(メタデータ) (2024-05-01T07:33:43Z) - Mixture of Cluster-conditional LoRA Experts for Vision-language Instruction Tuning [68.94230363140771]
クラスター条件のLoRAエキスパート(MoCLE)の混合
MoCLEは、命令クラスタに基づいてタスクカスタマイズされたモデルパラメータを活性化するために設計された、新しいMixture of Expertsアーキテクチャである。
InstructBLIPとLLaVAの実験はMoCLEの有効性を示した。
論文 参考訳(メタデータ) (2023-12-19T18:11:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。