論文の概要: A Broader Look at Model Merging: Rethinking Implicit Regularization Induced by Task Arithmetic
- arxiv url: http://arxiv.org/abs/2610.07990v1
- Date: Tue, 06 Oct 2026 08:49:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.90523
- Title: A Broader Look at Model Merging: Rethinking Implicit Regularization Induced by Task Arithmetic
- Title(参考訳): モデルマージのより広い展望:タスク算術による不規則化の再考
- Abstract要約: 本研究は,タスク固有の重み更新によって分散された部分空間に対して,候補モデルの探索が制限されるかどうかを考察する。
驚くべきことに、この正規化を伴わないマージモデルウェイトを最適化することで、一般的なマージ法の性能が向上することを示す実験結果が得られた。
この研究は、既存のモデル統合パイプラインを再考し、ウェイト空間のより広範な探索と、タスク算術によって誘導される暗黙の正規化の再考を動機付けている。
- 参考スコア(独自算出の注目度): 65.83135376894784
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model merging aims to build a multi-task model cheaply by combining the weights of individual task-specific models. To perform well across multiple tasks, most existing merging methods use an additional dataset to find the coefficients for the best linear combination of task-specific weight updates. However, we identify an implicit regularization in this standard practice: searching over coefficients restricts the candidate models to a subspace spanned by task-specific weight updates. In this work, we investigate whether this regularization is actually useful. Surprisingly, empirical results show that optimizing merged-model weights without this regularization significantly boosts the performance of common merging methods across multiple architectures, domains, and even in an extremely data-limited scenario where only one instance is available per class. Moreover, directly optimizing the pretrained model weights even outperforms some existing merging methods. Analysis shows that better multi-task weights exist outside the subspace and can be found using multiple methods. We study different strategies for using the additional dataset, discussing their practical use and implications for model merging. Overall, this work calls for revisiting the existing model-merging pipeline, motivating a broader exploration of the weight space and a reconsideration of the implicit regularization induced by task arithmetic.
- Abstract(参考訳): モデルマージは、タスク固有のモデルの重みを組み合わせることで、マルチタスクモデルを安価に構築することを目的としている。
複数のタスクをうまく処理するために、既存のマージメソッドの多くは、タスク固有の重み付けの最良の線形結合の係数を見つけるために追加データセットを使用している。
係数を探索することで、候補モデルをタスク固有の重み更新によって分散された部分空間に制限する。
本研究では,この正規化が実際に有用かどうかを検討する。
驚くべきことに、この正規化なしでマージモデルの重み付けを最適化することは、複数のアーキテクチャ、ドメイン、そしてクラス毎にひとつのインスタンスしか利用できない非常にデータ制限のシナリオでさえ、共通のマージメソッドの性能を大幅に向上させる。
さらに、事前訓練されたモデルの重み付けを直接最適化することは、既存のマージ方法よりも優れている。
解析により、より優れたマルチタスクウェイトがサブスペースの外に存在することが示され、複数の方法を用いて見つけることができる。
追加データセットを使用するためのさまざまな戦略について検討し、それらの実用的利用とモデルマージの意味について論じる。
全体として、この研究は既存のモデル統合パイプラインを再考し、重み空間のより広い探索とタスク算術によって引き起こされる暗黙の正規化の再考を動機付けている。
関連論文リスト
- PACT: Preserving Anchored Cores in Task-vectors for Model Merging [68.52455853496585]
モデルマージは、複数のタスク固有の細調整されたモデルを単一のマルチタスクモデルに結合することを目的としている。
既存のモデルマージアプローチのほとんどは、Task Arithmeticパラダイムに従っています。
本研究では,タスクベクトル内の固定されたタスク固有コア(LBW次元)を,事前学習した重みのサブ空間と補間を整合させることにより保存するPACTを提案する。
論文 参考訳(メタデータ) (2026-06-17T02:48:35Z) - MergeBench: A Benchmark for Merging Domain-Specialized LLMs [25.333088749417414]
MergeBenchは、スケールでのモデルマージを評価するために設計された評価スイートである。
2Bから9BスケールのLlamaやGemmaファミリなど、最先端のオープンソース言語モデルの上に構築されている。
マルチタスク性能, 忘れられたこと, 実行効率にまたがる8つの代表的なマージ手法を評価した。
論文 参考訳(メタデータ) (2025-05-16T04:02:55Z) - No Task Left Behind: Isotropic Model Merging with Common and Task-Specific Subspaces [17.69597528370121]
モデルマージは、複数のタスク固有のモデルの重みを単一のマルチタスクモデルに統合する。
この問題に対する最近の関心にもかかわらず、シングルタスクモデルと組み合わせたモデルの間には大きなパフォーマンスギャップが残っている。
タスク固有成分とマージ行列の特異成分のアライメントは,性能改善と強く相関していることを示す。
論文 参考訳(メタデータ) (2025-02-07T14:22:56Z) - The Non-Local Model Merging Problem: Permutation Symmetries and Variance Collapse [25.002218722102505]
モデルマージは、特定のタスクでトレーニングされた複数のエキスパートモデルの重みを、単一のマルチタスクモデルに効率的に結合することを目的としている。
この研究は、"非ローカル"マージのより困難なシナリオを探求する。
標準的なマージ技術は、この非局所的な環境で効果的に一般化できないことが多い。
本稿では,タスク毎のマージモデルの出力アクティベーションを再スケール・シフトするマルチタスク手法を提案する。
論文 参考訳(メタデータ) (2024-10-16T17:41:59Z) - Concrete Subspace Learning based Interference Elimination for Multi-task
Model Fusion [86.6191592951269]
一般的な事前訓練された大規模モデルから微調整されたマージングモデルは、様々なタスクに特化しているが、様々なタスクでうまく機能するマルチタスクモデルを構築するための安価でスケーラブルな戦略として実証されている。
本稿では、共通低次元部分空間を同定し、その共有情報トラック干渉問題を性能を犠牲にすることなく利用するための連続緩和(Concrete)部分空間学習法を提案する。
論文 参考訳(メタデータ) (2023-12-11T07:24:54Z) - AdaMerging: Adaptive Model Merging for Multi-Task Learning [68.75885518081357]
本稿では,Adaptive Model Merging (AdaMerging)と呼ばれる革新的な手法を紹介する。
本来のトレーニングデータに頼ることなく、タスクレベルでも階層的にも、モデルマージの係数を自律的に学習することを目指している。
AdaMergingは、現在の最先端のタスク演算のマージ方式と比較すると、パフォーマンスが11%向上している。
論文 参考訳(メタデータ) (2023-10-04T04:26:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。