論文の概要: How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size
- arxiv url: http://arxiv.org/abs/2607.01487v1
- Date: Wed, 01 Jul 2026 21:32:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.598815
- Title: How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size
- Title(参考訳): トークンのアロケート方法 : トレーニングステップとバッチサイズによる法則のスケーリング
- Authors: Fabian Schaipp,
- Abstract要約: モデルのサイズとトレーニングデータを考慮し、後者をトレーニングステップとバッチサイズに明示的に分割するスケーリング法則を提案する。
提案法則を大規模なトレーニング実行に当てはめると、最適なバッチサイズのスケーリングを正しく回復することがわかった。
最適バッチサイズでトレーニングを実行するので,提案法則は極めて少ないトレーニングの実行量で堅牢に適合する。
- 参考スコア(独自算出の注目度): 1.1603243575080533
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose a scaling law that takes into account model size and training data while explicitly splitting the latter into training steps and batch size (called three-term law). Fitting the proposed law on a large set of training runs, we find that it correctly recovers the scaling of the optimal batch size. Moreover, because it makes use of training runs with suboptimal batch size, our proposed law can be robustly fit with a significantly smaller amount of training runs. We further show that the three-term law can be used to derive scaling laws for suboptimal batch sizes, and that it matches previous empirical findings related to the critical batch size.
- Abstract(参考訳): 本稿では,モデルのサイズとトレーニングデータを考慮に入れながら,後者をトレーニングステップとバッチサイズ(3項法則)に明確に分割するスケーリング法則を提案する。
提案法則を大規模なトレーニング実行に当てはめると、最適なバッチサイズのスケーリングを正しく回復することがわかった。
さらに, 最適バッチサイズでトレーニングを実行するため, 提案法は比較的少ないトレーニングの実行量で堅牢に適合する。
さらに, 3 項法則は, 最適バッチサイズに対するスケーリング法則の導出に有効であることを示すとともに, 臨界バッチサイズに関する過去の経験的知見と一致することを示す。
関連論文リスト
- Predictive Scaling Laws for Efficient GRPO Training of Large Reasoning Models [0.41942958779358663]
本稿では,動的トレーニングをモデル化し,資源利用の最適化を支援する予測フレームワークを提案する。
モデルサイズ,初期性能,トレーニング進捗に基づく経験的スケーリング法則を導出する。
特定のエポック数を超えるトレーニングでは、ほとんど利益が得られず、早い段階で停止することで、パフォーマンスを犠牲にすることなく計算を大幅に削減できることが示唆されている。
論文 参考訳(メタデータ) (2025-07-24T01:09:25Z) - Small Batch Size Training for Language Models: When Vanilla SGD Works, and Why Gradient Accumulation Is Wasteful [69.57125049281993]
この作業は、バッチサイズ1まで、小さなバッチサイズを見直します。
小さいバッチサイズは安定してトレーニングし、より大きなバッチサイズよりもFLOP当たりのパフォーマンスが等しく、あるいは良好であることが分かりました。
論文 参考訳(メタデータ) (2025-07-09T17:57:36Z) - Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training [54.860881625923184]
本稿では,トレーニング中の勾配雑音尺度に基づいて,臨界バッチサイズ(CBS)を推定する方法を示す。
CBSがバッチサイズのウォームアップを動機づけてどのように変化するかについての知見は,小規模なトレーニングランからCBSが大規模トレーニングランを知らせる可能性があることを示唆している。
論文 参考訳(メタデータ) (2025-05-29T19:53:39Z) - The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws [51.608402959163925]
本稿では,大規模言語モデルに対する最適スパース事前学習構成の体系的検討を行う。
総トレーニング計算の25%でプルーニングを開始し、75%で終了すると、ほぼ最適の最終評価損失が得られることがわかった。
本稿では,事前学習よりも平均パラメータ数を使用するように,チンチラスケーリング法を修正した新しいスケーリング法を提案する。
論文 参考訳(メタデータ) (2025-01-21T20:23:22Z) - Scaling Law for Language Models Training Considering Batch Size [17.09348741898811]
大規模言語モデル(LLM)は近年顕著な進歩を遂げており、この急速な進歩においてスケーリング法則が重要な役割を担っている。
本稿は,LLMトレーニングの実践において,重要なハイパーパラメータ,すなわちグローバルバッチサイズがどのように影響するかを実証的に検討する。
モデルのサイズとトレーニングデータ量に関する基本的なスケーリング法則を確立します。
次に,バッチサイズや学習率の変化が,これらのモデルの収束と一般化にどのように影響するかを検討する。
論文 参考訳(メタデータ) (2024-12-02T13:58:35Z) - Scaling Laws for Precision [73.24325358259753]
トレーニングと推論の両方に"精度対応"のスケーリング法則を考案する。
推論では,学習後の量子化によって生じる劣化が,モデルがより多くのデータに基づいて訓練されるにつれて増加することが分かる。
トレーニングのために、我々のスケーリング法則は、異なるパーツの異なるモデルの損失を、異なる精度で予測することができる。
論文 参考訳(メタデータ) (2024-11-07T00:10:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。