論文の概要: When Data Is Scarce: Scaling Sparse Language Models with Repeated Training
- arxiv url: http://arxiv.org/abs/2606.01155v1
- Date: Sun, 31 May 2026 10:51:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:29.286058
- Title: When Data Is Scarce: Scaling Sparse Language Models with Repeated Training
- Title(参考訳): データが不足する時 - 反復トレーニングによるスパース言語モデルのスケーリング
- Authors: Boqian Wu, Qiao Xiao, Patrik Okanovic, Tomasz Sternal, Maurice van Keulen, Mykola Pechenizkiy, Elena Mocanu, Torsten Hoefler, Decebal Constantin Mocanu,
- Abstract要約: 限られたユニークなトークンがマルチエポックなトレーニングを必要とするデータ制約型レシエーションにおけるスパーストレーニングについて検討する。
スパーシリティは単に効率のツールではなく、データ不足下でのトレードオフのスケーリングを改善するためのメカニズムである、ということに気付きました。
- 参考スコア(独自算出の注目度): 38.73262288439019
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scaling laws for dense LLMs under infinite data are well explored, but how sparsity interacts with limited data is not. In this work, we study sparse training in data-constrained regimes where limited unique tokens require multi-epoch training. Our experiments span models up to 1.92B parameters in the fitting set, sparsity up to 93.75%, unique data budgets up to 2.6B tokens, and total training tokens up to 41.6B over 16 epochs; we further validate extrapolation on held-out dense-equivalent models up to 7.68B parameters. We find that: 1. Sparse scaling in data-limited settings: We introduce a scaling law that models loss as a function of active parameters, unique tokens, data repetition, and sparsity, accurately predicting performance across compute and data budgets. 2. Delayed data saturation: sparse training postpones diminishing returns from repeated data, making multi-epoch training more effective. 3. Resource trade-offs: With fixed data, loss-optimal sparsity is moderate ~ 50%, while compute-optimal sparsity is higher and grows with data scale. Overall, sparsity is not just a tool for efficiency, but a mechanism for improving scaling trade-offs under data scarcity. Our code is available at: https://github.com/boqian333/sparse-dc-scaling.
- Abstract(参考訳): 無限データの下での高密度LLMのスケーリング法則はよく研究されているが、空間が限られたデータとどのように相互作用するかは明らかになっていない。
本研究では,限られたユニークなトークンがマルチエポックトレーニングを必要とするデータ制約型レシエーションにおけるスパーストレーニングについて検討する。
我々の実験は、フィッティングセット内の最大1.92Bパラメータ、最大93.75%、ユニークなデータ予算2.6Bトークン、および16のエポック上で41.6Bまでのトレーニングトークンにまたがる。
以下に示す。
1. データ制限設定でのスパーススケーリング: アクティブパラメータ、ユニークなトークン、データ繰り返し、スパーシティの関数として損失をモデル化し、計算とデータ予算間でのパフォーマンスを正確に予測するスケーリング法則を導入する。
2. 遅延データ飽和: スパーストレーニングポストポンは繰り返しデータからのリターンを減少させ、マルチエポックトレーニングをより効果的にする。
3. リソースのトレードオフ: 固定データの場合、損失-最適スパシティはおよそ50%、計算-最適スパシティはより高く、データスケールで成長する。
全体として、スパーシリティは単に効率のツールではなく、データ不足下でのトレードオフのスケーリングを改善するためのメカニズムである。
私たちのコードは、https://github.com/boqian333/sparse-dc-scalingで利用可能です。
関連論文リスト
- Scaling Data-Constrained Language Models [133.2083255645999]
データ制約付きシステムにおける言語モデルのスケーリングについて検討する。
固定された計算予算に対する制約付きデータでは、反復するデータの最大4つのエポックなトレーニングは、ユニークなデータに比べて損失に対する無視可能な変化をもたらす。
本稿では,繰り返しトークンと過剰パラメータの値の減少を考慮に入れた計算最適性のスケーリング法則を提案し,実証的に検証する。
論文 参考訳(メタデータ) (2023-05-25T17:18:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。