論文の概要: Matryoshka Language Model Suites
- arxiv url: http://arxiv.org/abs/2608.09703v1
- Date: Mon, 10 Aug 2026 15:07:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.326344
- Title: Matryoshka Language Model Suites
- Title(参考訳): Matryoshka言語モデルスイート
- Authors: Nathan Godey, Yoav Artzi,
- Abstract要約: 古典的には、言語モデルスイートのトレーニングには、各モデルを個別にトレーニングし、それらを独立して提供する必要がある。
我々は、サイズが大きくなるサブモデルを、エンドツーエンドで訓練された単一のネストアーキテクチャに積み重ねることで、トレーニングと推論の効率を改善する。
我々は500M,1.5B,3BサブモデルからなるMatryoshkaスイートをトレーニングし,本手法の有効性を検証した。
- 参考スコア(独自算出の注目度): 14.297816005348539
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Training a language model suite classically requires training each model separately and serving them independently. We improve both training and inference efficiency by stacking sub-models of increasing size into a single nested architecture trained end-to-end. This Matryoshka training framework reduces the total parameter count of the suite, enables low-cost distillation from the largest to all smaller sub-models at every training step, and is well-suited for speculative decoding as the draft model is contained within the verifier. We validate our approach by training a Matryoshka suite comprising 500M, 1.5B, and 3B sub-models. Our suite is on par with independently trained baselines on benchmark performance and validation and out-of-domain perplexities, while using 36% less training compute and improving the throughput of speculative decoding by 14-26%. We also ablate key architectural choices, offering guidance for building strong Matryoshka LM suites.
- Abstract(参考訳): 古典的には、言語モデルスイートをトレーニングするには、各モデルを個別にトレーニングし、それらを独立して提供する必要がある。
我々は、サイズが大きくなるサブモデルを、エンドツーエンドで訓練された単一のネストアーキテクチャに積み重ねることで、トレーニングと推論の効率を改善する。
このマトリオシカトレーニングフレームワークは、スイートの総パラメータ数を減らし、トレーニングステップ毎に、最大からすべての小さなサブモデルへの低コスト蒸留を可能にし、ドラフトモデルが検証対象に含まれるため、投機的復号化に適している。
我々は500M,1.5B,3BサブモデルからなるMatryoshkaスイートをトレーニングし,本手法の有効性を検証した。
私たちのスイートは、ベンチマークのパフォーマンスと検証、ドメイン外の複雑さに関する独立したトレーニングベースラインと同等ですが、トレーニング計算を36%削減し、投機的デコーディングのスループットを14~26%向上させています。
また、Materyoshka LMスイートを構築するためのガイダンスも提供しています。
関連論文リスト
- IMU-1: Sample-Efficient Pre-training of Small Language Models [0.0]
IMU-1は、72Bトークンで訓練された430Mパラメータ言語モデルであり、56倍のデータで訓練されたモデルのベンチマーク性能にアプローチする。
本稿では、最近のアーキテクチャ介入(QK-norm attention, per-head gating, value residuals, LayerNorm scalings)と最適化の進歩を組み合わせた検証済みのトレーニングレシピについて述べる。
論文 参考訳(メタデータ) (2026-01-25T21:24:15Z) - Nemotron Elastic: Towards Efficient Many-in-One Reasoning LLMs [80.72350166388601]
Nemotron Elasticは推論指向のLLMを構築するためのフレームワークである。
ネストしたサブモデルを単一の親モデルに組み込む。
これらのサブモデルはそれぞれ、親モデルと重みを共有し、デプロイ中にゼロショットを抽出できる。
論文 参考訳(メタデータ) (2025-11-20T18:59:21Z) - Matryoshka Model Learning for Improved Elastic Student Models [62.154536258259384]
MatTAは、新しいTeacher-TA-Studentレシピを使用して、複数の正確な学生モデルをトレーニングするためのフレームワークである。
本手法はパブリックモデルであるGPT-2 Medium上で実証し,SAT Mathで24%,LAMBADAベンチマークで10%以上の相対的な改善を実現した。
論文 参考訳(メタデータ) (2025-05-29T10:54:58Z) - Starbucks-v2: Improved Training for 2D Matryoshka Embeddings [30.24508997323456]
2D Matryoshkaトレーニングにより、単一の埋め込みモデルにより、異なるレイヤにわたるサブネットワーク表現と埋め込み次元を生成することができる。
本稿では,構造化ファインチューニングとマスク付きオートエンコーダ事前学習を組み合わせた,Matryoshkaスタイルの埋め込みモデルの新たなトレーニング戦略であるStarbucksを提案する。
我々のMAEベースの事前学習により、サブネットワークの表現品質が向上し、下流タスクのバックボーンが強化される。
論文 参考訳(メタデータ) (2024-10-17T05:33:50Z) - Compact Language Models via Pruning and Knowledge Distillation [61.56557874432008]
ミニトロンモデルでは、スクラッチからのトレーニングに比べてMMLUスコアが最大16%改善している。
すでにトレーニング済みの15Bモデルから8Bと4Bモデルを抽出するには、スクラッチからトレーニングするよりも、モデル毎のトレーニングトークンを最大40倍少なくする必要があります。
論文 参考訳(メタデータ) (2024-07-19T21:47:57Z) - Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning [52.29522018586365]
我々は,事前訓練された大規模モデルからより小型のLCMを開発するための効果的な方法として構造化プルーニングについて検討した。
提案手法では,(1)階層,頭部,中間および隠蔽次元をエンド・ツー・エンドに除去することで,より大きなモデルを特定のターゲット形状にプルーニングするターゲット構造化プルーニングと,(2)各トレーニングバッチにおけるサンプルデータの構成を,異なるドメイン間での損失に基づいて動的に更新する動的バッチローディングという2つの重要な手法を用いる。
論文 参考訳(メタデータ) (2023-10-10T15:13:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。