論文の概要: Model Merging to Evolution: Parameter Space Exploration for Expert Models
- arxiv url: http://arxiv.org/abs/2606.28373v1
- Date: Wed, 17 Jun 2026 12:39:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-05 17:01:29.601377
- Title: Model Merging to Evolution: Parameter Space Exploration for Expert Models
- Title(参考訳): 進化へのモデルマージング:エキスパートモデルのためのパラメータ空間探索
- Abstract要約: 本稿では,モデルマージと進化を進化戦略内で統合するMERGEvolveフレームワークを提案する。
シングルタスクおよびマルチタスクベンチマークの実験では、MERGEvolveは、高度なモデルマージベースラインとの競争性を一貫して達成している。
- 参考スコア(独自算出の注目度): 20.24423369651786
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Model merging integrates the capabilities of multiple expert models to create strong models for multiple tasks without additional training, thereby reducing computational resource requirements. However, existing methods operate within the convex combination space of expert models, failing to explore high-performance regions outside this space. This paper proposes the MERGEvolve framework, which unifies model merging and evolution within an evolution strategy by treating the merged model as the initialization for evolutionary exploration of the parameter space. During the merging phase, expert models act as deterministic sources to build a strong initial point. The evolution phase then explores the parameter space using random noise. Theoretical analysis shows that MERGEvolve explores regions outside the convex combination space. Extensive experiments on single-task and multi-task benchmarks demonstrate that MERGEvolve consistently achieves performance competitive with advanced model merging baselines. Ablation studies confirm that a high-quality initial point is critical for efficient exploration of the parameter space.
- Abstract(参考訳): モデルマージは、複数のエキスパートモデルの機能を統合して、追加のトレーニングなしで複数のタスクのための強力なモデルを作成することで、計算リソースの要求を低減します。
しかし、既存の手法はエキスパートモデルの凸結合空間内で動作し、この分野以外の高性能領域を探索することができない。
本稿では,MERGEvolveフレームワークを提案する。MERGEvolveフレームワークは,モデル統合をパラメータ空間の進化的探索の初期化として扱うことにより,モデル統合と進化を進化戦略内で統合する。
マージフェーズの間、エキスパートモデルは強力な初期点を構築するために決定論的ソースとして機能する。
進化段階はランダムノイズを用いてパラメータ空間を探索する。
理論的解析は、MERGEvolveが凸結合空間の外側の領域を探索していることを示している。
シングルタスクおよびマルチタスクベンチマークの大規模な実験により、MERGEvolveは、高度なモデルマージベースラインとの競争性を一貫して達成していることが示された。
アブレーション研究により、パラメータ空間の効率的な探索には高品質な初期点が不可欠であることが確認された。
関連論文リスト
- EvoGM: Learning to Merge LLMs via Evolutionary Generative Optimization [27.31325788417927]
本稿では、学習可能な生成モデルを用いてマージ係数を最適化するフレームワークであるEvoGM(Evolutionary Generative Merging)を提案する。
EvoGMは、サイクル一貫性学習を備えたデュアルジェネレータアーキテクチャを備え、有望なマージ候補を適応的にサンプリングし、精査する。
さまざまなベンチマークによる実験によると、EvoGMは最先端のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2026-05-28T03:22:54Z) - POINTS-Seeker: Towards Training a Multimodal Agentic Search Model from Scratch [84.73366911912512]
エージェント・シーディング(Agenic Seeding)は,エージェント行動の抽出に必要な前駆体を織り込むための専用フェーズである。
本稿では、最近の対話を高忠実に保ちながら、歴史的コンテキストをレンダリングを介して視覚空間に折り畳みながら、適応的履歴認識圧縮方式であるV-Foldを提案する。
我々は,最新のマルチモーダルエージェントサーチモデルであるPOINTS-Seeker-8Bを開発した。
論文 参考訳(メタデータ) (2026-04-15T16:09:37Z) - MCCE: A Framework for Multi-LLM Collaborative Co-Evolution [17.41200156551317]
多目的離散最適化問題は、その広大かつ非構造的な空間のために重大な問題を引き起こす。
大規模言語モデル(LLM)は、強力な先行と推論能力を提供し、専門家の知識が重要となると自然にします。
我々は,凍結したオープンソースLCMと軽量なトレーニングモデルを組み合わせたハイブリッドフレームワークであるMulti-LLM Collaborative Co-evolutionを紹介する。
論文 参考訳(メタデータ) (2025-10-06T10:03:28Z) - SE-Merging: A Self-Enhanced Approach for Dynamic Model Merging [60.83635006372403]
textttSE-Mergingは自己拡張型モデルマージフレームワークである。
textttSE-Mergingは、追加のトレーニングなしで動的モデルのマージを実現することを示す。
論文 参考訳(メタデータ) (2025-06-22T18:38:41Z) - Reinforced Model Merging [53.84354455400038]
本稿では,タスク統合に適した環境とエージェントを含むRMM(Reinforced Model Merging)という,革新的なフレームワークを提案する。
評価プロセス中にデータサブセットを利用することで、報酬フィードバックフェーズのボトルネックに対処し、RMMを最大100倍高速化する。
論文 参考訳(メタデータ) (2025-03-27T08:52:41Z) - Merging Models on the Fly Without Retraining: A Sequential Approach to Scalable Continual Model Merging [75.93960998357812]
ディープモデルマージ(Deep Modelmerging)は、複数の微調整モデルを組み合わせて、さまざまなタスクやドメインにまたがる能力を活用する、新たな研究方向を示すものだ。
現在のモデルマージ技術は、全ての利用可能なモデルを同時にマージすることに集中しており、重量行列に基づく手法が主要なアプローチである。
本稿では,モデルを逐次処理するトレーニングフリーなプロジェクションベース連続マージ手法を提案する。
論文 参考訳(メタデータ) (2025-01-16T13:17:24Z) - Training-free Heterogeneous Model Merging [40.681362819808136]
異種モデル用に設計された革新的なモデルマージフレームワークを提案する。
構造的に不均一なモデルのマージは、均質なマージに匹敵する性能レベルを達成することができることを示す。
私たちのコードはhttps://github.com/zju-vipa/training_free_heterogeneous_model_mergingで公開されています。
論文 参考訳(メタデータ) (2024-12-29T04:49:11Z) - Collective Model Intelligence Requires Compatible Specialization [29.590052023903457]
モデルが専門化するにつれて、特徴空間構造における類似性が減少し、集合的使用能力の妨げとなることを示す。
我々は、互換性のある特殊化と呼ばれるものを通して、集合モデルインテリジェンスを達成するための新しい方向を提案する。
論文 参考訳(メタデータ) (2024-11-04T15:59:16Z) - Exploring Model Kinship for Merging Large Language Models [73.98345036483299]
我々は, モデル進化を反復的融合を通じて研究し, 生物進化の類似性について考察した。
モデル親和性はマージによって達成された性能改善と密接に関連していることを示す。
本稿では,新しいモデル統合戦略を提案する。
論文 参考訳(メタデータ) (2024-10-16T14:29:29Z) - SMILE: Zero-Shot Sparse Mixture of Low-Rank Experts Construction From Pre-Trained Foundation Models [85.67096251281191]
我々は、ゼロショットスパースミクチャー(SMILE)と呼ばれるモデル融合に対する革新的なアプローチを提案する。
SMILEは、余分なデータやさらなるトレーニングなしに、ソースモデルをMoEモデルにアップスケーリングできる。
画像分類やテキスト生成タスクなど,さまざまなシナリオに対して,フル微調整とLoRA微調整を用いて広範な実験を行う。
論文 参考訳(メタデータ) (2024-08-19T17:32:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。