論文の概要: Understanding Layer Patching in Model Size Interpolation
- arxiv url: http://arxiv.org/abs/2607.08170v1
- Date: Thu, 09 Jul 2026 07:14:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.433419
- Title: Understanding Layer Patching in Model Size Interpolation
- Title(参考訳): モデルサイズ補間における層パッチングの理解
- Abstract要約: パッチは, モデル家族間で大きく異なる影響を伴って, 行動が強く形成されることを示す。
KLPatchは、KLの発散に基づくグリージーなパッチアルゴリズムであり、Lon-to-firstパッチよりもしばしば改善される。
- 参考スコア(独自算出の注目度): 30.74896485280105
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Zero-shot model size interpolation aims to create new models of intermediate target sizes by combining existing models without additional training. Recent work on boomerang distillation [Kangaslahti et al., 2026] shows that a student language model distilled from a larger teacher can be expanded by iteratively patching its layers, replacing student layers with contiguous blocks of teacher layers to obtain models whose size and performance interpolate between the student and the teacher. In this work, we provide the first systematic study of student-layer selection for model size interpolation. We cast finding the optimal layer subset for each model size as an optimization problem and prove it can be viewed as a shortest-path problem in a certain acyclic graph. In experiments, we show that patching strongly shapes interpolation behavior, with effects that vary substantially across model families. We find that simple sequential strategies--patching either from the first layer to the last or from the last to the first--often achieve surprisingly strong performance in practice. We further introduce KLPatch, a greedy patching algorithm based on KL divergence, which often improves over last-to-first patching and approximately solves the optimization problem. Together, our results provide a principled understanding of how layer patching affects model size interpolation and offer practical guidance for constructing near-optimal interpolated models.
- Abstract(参考訳): ゼロショットモデルサイズ補間は、既存のモデルを追加トレーニングなしで組み合わせることで、中間ターゲットサイズの新しいモデルを作成することを目的としている。
近年のブーメラン蒸留(Kangaslahti et al , 2026)では, 生徒層を連続的に固定し, 生徒層を連続した教師層に置き換えて, 学生層と教師層を介在するサイズと性能の異なるモデルを得ることにより, より大きな教師層から蒸留した学生言語モデルを拡張できることが示されている。
本研究は,モデルサイズ補間のための学生層選択に関する最初の体系的研究である。
モデルサイズ毎の最適層部分集合を最適化問題とみなし、ある非巡回グラフにおいて最短パス問題とみなすことができることを示す。
実験では, パッチングは補間挙動を強く形成し, その影響はモデル群によって大きく異なることがわかった。
単純なシーケンシャルな戦略 – 第1層から第2層へ,あるいは第1層から第1層まで – が,実際には驚くほど高いパフォーマンスを実現しています。
さらに、KL分散に基づくグリーディパッチアルゴリズムであるKLPatchを導入し、Lon-to-firstパッチよりもよく改善し、最適化問題を概ね解決する。
この結果から, 層パッチがモデルサイズ補間に与える影響を原理的に把握し, 近似補間モデルを構築するための実践的ガイダンスを提供する。
関連論文リスト
- Logit Distillation on Manifolds: Mapping by Learning [2.2965611981841993]
学習過程において,生徒と教師の表現を高次元の埋め込み空間にマッピングするレイヤとポイントワイズ・プロジェクション・マッピングを導入する。
提案手法をLoRAインジェクションと組み合わせることで,教師モデルのトレーニング可能なパラメータを1%未満に削減すると同時に,他の蒸留法と比較して単語誤り率(WER)を大幅に改善する。
論文 参考訳(メタデータ) (2026-05-30T15:22:59Z) - Neural Network Optimization Reimagined: Decoupled Techniques for Scratch and Fine-Tuning [49.751529745537546]
我々はDualOptを提案する。DualOptは、スクラッチからトレーニングに適した最適化技術を分離する新しいアプローチである。
スクラッチからのトレーニングでは、収束と一般化の両面を強化するために設計されたリアルタイムな層ワイド・ウェイト・デポジットを導入する。
我々は、異なる下流タスクの様々な要求に適応して、レイヤ単位の重量減衰を拡張して、レイヤ間のロールバックレベルを動的に調整する。
論文 参考訳(メタデータ) (2026-04-21T06:27:18Z) - Train with Perturbation, Infer after Merging: A Two-Stage Framework for Continual Learning [57.514786046966265]
textbfPerturb-and-Merge(P&M)は,モデルマージをCLパラダイムに統合し,忘れを緩和する新しい連続学習フレームワークである。
提案手法は,複数の連続学習ベンチマークデータセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2025-05-28T14:14:19Z) - Order-Robust Class Incremental Learning: Graph-Driven Dynamic Similarity Grouping [19.168022702075774]
クラスインクリメンタルラーニング(Class Incremental Learning, CIL)は、モデルが新しいクラスのシーケンシャルな学習を可能にすることを目的としている。
近年の研究では、CILモデルの性能はクラス到着の順序に非常に敏感であることが示されている。
グラフカラー化アルゴリズムを用いてクラスを類似性制約付きグループに動的に分割するグラフ駆動動的類似性グループ(GDDSG)を提案する。
論文 参考訳(メタデータ) (2025-02-27T12:16:57Z) - LESA: Learnable LLM Layer Scaling-Up [57.0510934286449]
LLM(Large Language Models)をスクラッチからトレーニングするには膨大な計算資源が必要であるため、非常に高価である。
モデルスケーリングアップは、より小さなモデルのパラメータを活用してより大きなモデルを作成することで、有望なソリューションを提供する。
深度スケールアップのための新しい学習方法である textbfLESA を提案する。
論文 参考訳(メタデータ) (2025-02-19T14:58:48Z) - Modeling Multi-Task Model Merging as Adaptive Projective Gradient Descent [72.10987117380584]
複数のエキスパートモデルをマージすることは、元のデータにアクセスせずにマルチタスク学習を実行するための有望なアプローチを提供する。
既存のメソッドは、競合を引き起こす一方で、パフォーマンスにとって重要なタスク固有の情報を捨てている。
我々の手法は従来の手法より一貫して優れており、視覚領域とNLP領域の両方において様々なアーキテクチャやタスクにまたがって最先端の結果が得られます。
論文 参考訳(メタデータ) (2025-01-02T12:45:21Z) - MAP: Low-compute Model Merging with Amortized Pareto Fronts via Quadratic Approximation [80.47072100963017]
Amortized Pareto Front (MAP) を用いた新しい低演算アルゴリズム Model Merging を導入する。
MAPは、複数のモデルをマージするためのスケーリング係数のセットを効率的に識別し、関連するトレードオフを反映する。
また,タスク数が比較的少ないシナリオではベイジアンMAP,タスク数の多い状況ではNested MAPを導入し,計算コストを削減した。
論文 参考訳(メタデータ) (2024-06-11T17:55:25Z) - Majority Kernels: An Approach to Leverage Big Model Dynamics for Efficient Small Model Training [32.154166415680066]
蒸留、圧縮、量子化といった手法は、高性能な大きなモデルを利用してより小さな性能のモデルを誘導するのに役立つ。
本稿では、単一トレーニングランが同時に、より大きなパフォーマンスモデルをトレーニングし、より小さなデプロイメントモデルを導出できるという仮説を考察する。
論文 参考訳(メタデータ) (2024-02-07T17:07:41Z) - Layer-wise Linear Mode Connectivity [52.6945036534469]
ニューラルネットワークパラメータの平均化は、2つの独立したモデルの知識の直感的な方法である。
フェデレートラーニングにおいて最も顕著に用いられている。
私たちは、単一グループやグループを平均化するモデルの性能を分析します。
論文 参考訳(メタデータ) (2023-07-13T09:39:10Z) - Sub-Graph Learning for Spatiotemporal Forecasting via Knowledge
Distillation [22.434970343698676]
サブグラフを効果的に学習するためのフレームワークKD-SGLを提案する。
グラフの全体構造と各サブグラフの複数の局所モデルを学ぶために,グローバルモデルを定義する。
論文 参考訳(メタデータ) (2022-11-17T18:02:55Z) - When to Update Your Model: Constrained Model-based Reinforcement
Learning [50.74369835934703]
モデルベースRL(MBRL)の非遅延性能保証のための新規で一般的な理論スキームを提案する。
続いて導いた境界は、モデルシフトとパフォーマンス改善の関係を明らかにします。
さらなる例では、動的に変化する探索からの学習モデルが、最終的なリターンの恩恵をもたらすことが示されている。
論文 参考訳(メタデータ) (2022-10-15T17:57:43Z) - A Unified Analysis of Dynamic Interactive Learning [5.474944738795308]
Emamjomeh-Zadeh氏らによる以前の研究は、非静的なユーザの好みをモデル化する手段として、インタラクティブな学習のダイナミクスを導入しました。
私たちは、[Emamjomeh-Zadeh et al., 2020]で分析されたモデルの両方をキャプチャするフレームワークを提供します。
また,学習者が各ラウンドのフィードバックに従う,効率的なアルゴリズムについても検討する。
論文 参考訳(メタデータ) (2022-04-14T16:03:37Z) - Compressing Models with Few Samples: Mimicking then Replacing [33.66481681493925]
サンプルの少ない小さなコンパクトなモデルに、大きな冗長なモデルを圧縮することを目的としている。
数サンプル圧縮のためのMimicking then Replacing (MiR) という新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2022-01-07T07:03:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。