論文の概要: Are we Merging the Right Models? Impact of Expert Training Duration on Model Merging for LLMs
- arxiv url: http://arxiv.org/abs/2607.11997v2
- Date: Wed, 15 Jul 2026 11:14:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 12:21:59.473674
- Title: Are we Merging the Right Models? Impact of Expert Training Duration on Model Merging for LLMs
- Title(参考訳): 正しいモデルをマージするのか? : LLMのモデルマージにおける訓練期間の影響
- Authors: Nikita Kozodoi, Zainab Afolabi, Jack Butler,
- Abstract要約: マルチタスクモデルマージは、個別に訓練されたエキスパートモデルを、コトレーニングなしですべてのタスクを処理する単一のモデルに結合する。
標準のプラクティスは、専門家を最適な検証損失にマージします。
ドメインエキスパートのトレーニング期間がマージモデルの品質に与える影響について検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-task model merging combines separately trained expert models into a single model that handles all tasks without co-training. Standard practice merges experts at their optimal validation loss. We challenge this convention by systematically studying how training duration of domain experts affects the quality of the merged model. We fine-tune experts on five domains (Math, Code, Instruction Following, Multilingual, and Safety) across three model sizes (Qwen 3.5 0.8B, 2B, and 4B), saving checkpoints from 25% to 500% of the optimal training steps and evaluating five merging methods at each duration. Our findings reveal a striking method-dependent pattern: simple averaging degrades sharply with overfitting, while sparsification-based methods achieve their best performance well past the validation optimum. We formalize this through bias-variance decomposition analysis, drawing a parallel to random forests where averaging benefits from high-variance individual learners. These results suggest that training duration and merging method should be chosen jointly rather than independently.
- Abstract(参考訳): マルチタスクモデルマージは、個別に訓練されたエキスパートモデルを、コトレーニングなしですべてのタスクを処理する単一のモデルに結合する。
標準のプラクティスは、専門家を最適な検証損失にマージします。
ドメインエキスパートのトレーニング期間がマージされたモデルの品質にどのように影響するかを体系的に研究することで、この慣行に挑戦する。
3つのモデルサイズ(Qwen 3.5 0.8B, 2B, 4B)にまたがる5つのドメイン(Math, Code, Instruction following, Multilingual, and Safety)の専門家を精査し、最適なトレーニングステップの25%から500%のチェックポイントを節約し、各期間で5つのマージ方法を評価する。
単純平均化はオーバーフィッティングによって著しく低下するが,スペーシフィケーションに基づく手法は検証の最適化よりも優れた性能を達成できる。
偏差分解解析によりこれを定式化し、高分散個別学習者の利益を平均化するランダム森林に並列に描画する。
これらの結果から, トレーニング期間とマージ法は独立にではなく, 共同で選択すべきであることが示唆された。
関連論文リスト
- FABSVer: Faster Training and Better Self-Verification for LLM Mathematical Reasoning [8.96133612398978]
自己検証モデルを備えた既存のアプローチは、解の生成と検証を2つの別々のタスクとして扱うのが一般的である。
本稿では,この2つのタスクを1世代パスに融合するFABSVerを提案する。
FABSVerは3つのモデルスケールで優れた自己検証と推論性能を実現する。
論文 参考訳(メタデータ) (2026-05-27T12:26:34Z) - Bagging-Based Model Merging for Robust General Text Embeddings [73.51674133699196]
汎用テキスト埋め込みモデルは、幅広いNLPおよび情報検索アプリケーションを支える。
本稿では,データスケジューリングとモデルマージという2つの観点から,テキスト埋め込みのためのマルチタスク学習の体系的研究を行う。
本稿では,Baging ベースの rObust mOdel Merging (BOOM) を提案する。
論文 参考訳(メタデータ) (2026-02-05T15:45:08Z) - Improving Robustness to Multiple Spurious Correlations by Multi-Objective Optimization [38.64563231429112]
複数のバイアスを持つデータセットを与えられた非バイアスで正確なモデルでトレーニングする問題について検討する。
本稿では,この課題に対処するための新しいトレーニング手法を提案する。
偏りのあるトレーニング手法を評価するために,MultiCelebAと呼ばれる複数のバイアスを持つ新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2024-09-05T07:19:03Z) - Rethinking Classifier Re-Training in Long-Tailed Recognition: A Simple
Logits Retargeting Approach [102.0769560460338]
我々は,クラスごとのサンプル数に関する事前知識を必要とせず,シンプルなロジットアプローチ(LORT)を開発した。
提案手法は,CIFAR100-LT, ImageNet-LT, iNaturalist 2018など,様々な不均衡データセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2024-03-01T03:27:08Z) - Dataless Knowledge Fusion by Merging Weights of Language Models [47.432215933099016]
微調整された事前学習言語モデルは、下流のNLPモデルを構築するための主要なパラダイムとなっている。
これは、より優れた単一モデルを生み出すために、個々のモデル間で知識を融合させる障壁を生み出します。
パラメータ空間のモデルをマージするデータレス知識融合法を提案する。
論文 参考訳(メタデータ) (2022-12-19T20:46:43Z) - Distributionally Robust Models with Parametric Likelihood Ratios [123.05074253513935]
3つの単純なアイデアにより、より広いパラメトリックな確率比のクラスを用いてDROでモデルを訓練することができる。
パラメトリック逆数を用いてトレーニングしたモデルは、他のDROアプローチと比較して、サブポピュレーションシフトに対して一貫して頑健であることがわかった。
論文 参考訳(メタデータ) (2022-04-13T12:43:12Z) - Jigsaw Clustering for Unsupervised Visual Representation Learning [68.09280490213399]
本稿では,新しいjigsawクラスタリング・プレテキストタスクを提案する。
本手法は画像内情報と画像間情報の両方を利用する。
トレーニングバッチの半分しか使用されていない場合、コントラスト学習方法にも匹敵します。
論文 参考訳(メタデータ) (2021-04-01T08:09:26Z) - Modeling Score Distributions and Continuous Covariates: A Bayesian
Approach [8.772459063453285]
連続共変量に対するマッチングと非マッチスコア分布の生成モデルを構築した。
混合モデルを用いて任意の分布と局所基底関数をキャプチャする。
提案手法の精度と有効性を示す3つの実験を行った。
論文 参考訳(メタデータ) (2020-09-21T02:41:20Z) - The Right Tool for the Job: Matching Model and Instance Complexities [62.95183777679024]
NLPモデルが大きくなればなるほど、訓練されたモデルを実行するには、金銭的・環境的なコストを発生させる重要な計算資源が必要である。
我々は、推論中、早期(かつ高速)の"exit"を可能にする文脈表現微調整の修正を提案する。
3つのテキスト分類データセットと2つの自然言語推論ベンチマークの2つのタスクで、5つの異なるデータセットに対して提案した修正を検証した。
論文 参考訳(メタデータ) (2020-04-16T04:28:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。