論文の概要: Rethinking Expert Training for Model Merging with Prompt Learning
- arxiv url: http://arxiv.org/abs/2607.24465v1
- Date: Mon, 27 Jul 2026 14:04:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.450473
- Title: Rethinking Expert Training for Model Merging with Prompt Learning
- Title(参考訳): プロンプト学習によるモデルマージのためのエキスパートトレーニングの再考
- Authors: Christos Georgakilas, Aniello Panariello, Samir El Karrat Moreno, Simone Calderara, Dimosthenis Karatzas, Joost van de Weijer,
- Abstract要約: モデルマージは、共有基盤モデルからトレーニングされた複数のドメイン特化専門家を単一のマルチタスクモデルに結合することを目的としている。
既存のアプローチは、マージ手順自体の改善に重点を置いている。
最初にプロンプトを学習し、次に視覚エンコーダを微調整する2段階のトレーニング戦略であるDual-Tuned Experts(DTE)を紹介する。
- 参考スコア(独自算出の注目度): 29.003417422329715
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model merging aims to combine multiple domain-specialized experts trained from a shared foundation model into a single multi-task model. Existing approaches largely focus on improving the merging procedure itself and typically assume experts obtained through full-parameter fine-tuning. In this work, we revisit expert training for model merging. We first show that prompt-based adaptation provides a strong baseline: independently learned prompts can be exploited across tasks while keeping the backbone fixed, avoiding the interference introduced by weight merging. Building on this observation, we introduce Dual-Tuned Experts (DTEs), a two-stage training strategy that first learns prompts and then fine-tunes the vision encoder. This reduces the magnitude of task-specific parameter updates and produces experts with higher merge compatibility. Experiments across multiple CLIP architectures, full fine-tuning, and LoRA experts show that DTEs consistently improve merged performance of standard merging approaches and remain effective even when combining heterogeneous sets of experts.
- Abstract(参考訳): モデルマージは、共有基盤モデルからトレーニングされた複数のドメイン特化専門家を単一のマルチタスクモデルに結合することを目的としている。
既存のアプローチは、マージ手順自体の改善に重点を置いており、通常はフルパラメータの微調整によって得られた専門家を仮定する。
本研究では,モデルマージのエキスパートトレーニングを再考する。
独立に学習したプロンプトは、バックボーンの固定を保ちながらタスク全体にわたって利用でき、重み付けによる干渉を避けることができる。
この観察に基づいて、まずプロンプトを学習し、次に視覚エンコーダを微調整する2段階のトレーニング戦略であるDual-Tuned Experts (DTEs)を紹介する。
これにより、タスク固有のパラメータの更新の規模が小さくなり、マージ互換性の高いエキスパートが生成される。
複数のCLIPアーキテクチャ、完全な微調整、LoRAの専門家による実験は、DTEが標準マージアプローチのマージパフォーマンスを一貫して改善し、ヘテロジニアスな専門家セットを組み合わせても有効であることを示している。
関連論文リスト
- Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models [50.34585122347149]
これは連続的なトランスフォーマー層にまたがるエキスパートパラメータを共有するアーキテクチャ修正である。
我々は、OLMoE、Qwen3、DeepSeekスタイルのMoEなど、一般的な最先端アーキテクチャにおけるこのアプローチを評価した。
論文 参考訳(メタデータ) (2026-06-15T15:08:09Z) - Sparse Subspace-to-Expert Sharing for Task-Agnostic Continual Learning [10.01449025634975]
既存のメソッドはパラメータを均一に扱い、特定のタスク知識と共有能力の区別に失敗する。
適応的なスパース部分空間分解によって可塑性・安定性の対立を解決するフレームワークであるタスク非依存型連続学習のためのスパースエキスパートの混合(SETA)を導入する。
SETAは、最先端の継続的な学習ベースラインと比較して、競争力や優れた総合的なパフォーマンスを達成できることを示す。
論文 参考訳(メタデータ) (2026-06-05T17:53:52Z) - PRISM: Synergizing Vision Foundation Models via Self-organized Expert Specialization [25.22639372242625]
モジュールの特殊化によるVFMの相乗化を実現する,新しい双方向Mixture-of-Experts (MoE) フレームワークである textbfPRISM を紹介する。
PASCAL-ContextとNYUD-v2の実験は、textbfPRISMが芸術の新たな状態を確立し、スパースで創発的な特殊化は多様な視覚知識を統合するためのスケーラブルなアプローチであることを証明している。
論文 参考訳(メタデータ) (2026-06-02T10:28:32Z) - Co-Evolving Policy Distillation [56.500154041818746]
Co-Evolving Policy Distillation (CoPD)は専門家の並行トレーニングを促進し、各専門家のRLVRトレーニング中にOPDを導入する。
実験では、CoPDがテキスト、画像、ビデオの推論機能のオールインワン統合を実現することを検証する。
論文 参考訳(メタデータ) (2026-04-29T18:24:11Z) - Split-on-Share: Mixture of Sparse Experts for Task-Agnostic Continual Learning [10.01449025634975]
大規模言語モデル(LLM)における連続学習は、可塑性安定性ジレンマによって妨げられる。
モデルをモジュラー部分空間に分解することで可塑性と安定性の衝突を解決するフレームワークであるSETAを紹介する。
SETA は,パラメータ効率のよい連続学習法よりも常に優れていることを示す。
論文 参考訳(メタデータ) (2026-01-24T22:39:22Z) - HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation [72.69742127579508]
最近の統一モデルでは、理解の専門家(LLMなど)と生成の専門家(拡散モデルなど)を統合している。
本研究では,非対称なH字型アーキテクチャであるHBridgeを提案する。
複数のベンチマークにわたる大規模な実験は、HBridgeの有効性と優れた性能を示している。
論文 参考訳(メタデータ) (2025-11-25T17:23:38Z) - Adaptive Shared Experts with LoRA-Based Mixture of Experts for Multi-Task Learning [49.90176890917986]
マルチタスク学習(MTL)のための強力なフレームワークとして、Mixture-of-Experts(MoE)が登場した。
既存のMoE-MTL法は、しばしばシングルタスクで事前訓練されたバックボーンに依存し、冗長な適応と非効率的な知識共有に悩まされる。
低ランク適応 (LoRA) に基づく MoE の適応型共有専門家 (ASE) を提案する。
論文 参考訳(メタデータ) (2025-10-01T06:49:19Z) - Symphony-MoE: Harmonizing Disparate Pre-trained Models into a Coherent Mixture-of-Experts [18.18231276284727]
Mixture-of-Experts (MoE)モデルは、大きなパラメータセットをわずかに活性化することにより、スケーラブルなパフォーマンスを実現する。
近年の作業では、フィードフォワードネットワーク(FFN)層を専門家に複製することで、トレーニング済みの高密度モデル1つを再利用している。
本稿では、複数の同一構造を持つ異なる事前学習モデルから得られたエキスパートを用いて、強力なMoEモデルを構築することにより、この制限に対処する。
論文 参考訳(メタデータ) (2025-09-23T02:07:14Z) - Unveiling Hidden Collaboration within Mixture-of-Experts in Large Language Models [5.211806751260724]
本稿では,専門家間の協調パターンを明らかにする階層型スパース辞書学習法を提案する。
また、コントリビューション・アウェア・エキスパート・プルーニング(CAEP)アルゴリズムを導入し、低コントリビューション・エキスパートを効果的に育成する。
論文 参考訳(メタデータ) (2025-04-16T04:06:15Z) - Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy [84.11508381847929]
わずかに活性化されたMixture-of-Experts(SMoE)は、ニューラルネットワークの学習能力のスケールアップを約束している。
ルーティング統計を利用したM-SMoEを提案する。
我々のMC-SMoEは最大80%のメモリと20%のFLOPを削減でき、性能は実質的に損なわれない。
論文 参考訳(メタデータ) (2023-10-02T16:51:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。