論文の概要: Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss
- arxiv url: http://arxiv.org/abs/2608.28308v2
- Date: Mon, 31 Aug 2026 09:44:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 15:47:04.413549
- Title: Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss
- Title(参考訳): OpenEuroLLMモデルのスケーリング法則の導出:学習率、バッチサイズ、損失
- Authors: Niccolò Ajroldi, Diana Alexandra Onutu, Haider Al-Tahan, Jörg Franke, Sampo Pyysalo, Jenia Jitsev, Aaron Klein,
- Abstract要約: 本研究では,英語対応コーパス上での高密度大言語モデルの学習速度とバッチサイズのスケーリング挙動について検討した。
我々はこれらの関係を捉えたモデルを開発する。
本研究は,OpenEuroLLMモデル開発のための第1のベースラインとスケーリング手順を確立する。
- 参考スコア(独自算出の注目度): 7.969401498219657
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study the scaling behavior of learning rate and batch size in pretraining dense large language models on English-prevalent corpora. Beyond scaling jointly optimal learning rates and batch sizes, we investigate their marginal evolution with model capacity and data scale and develop a model that captures these relationships. As we employ a Warmup-Stable-Decay learning rate schedule, we further investigate the gains from learning rate annealing over a broad range of hyperparameters settings, models and data budgets, and whether the optimal learning rate and batch size transfer between the stable and decay phases. Finally, we characterize the dependence of loss on model capacity and dataset size, evaluating recently proposed scaling forms that explicitly model their interaction. We find these approaches particularly effective at capturing both undertraining and overtraining regimes across our experiments. This study establishes a first baseline and scaling procedure for the development of future OpenEuroLLM models. We open-source the complete collection of pretraining runs used in this study.
- Abstract(参考訳): 本研究では,英語対応コーパス上での高密度大言語モデルの学習速度とバッチサイズのスケーリング挙動について検討した。
協調的に最適な学習率とバッチサイズをスケーリングする以外に、モデルキャパシティとデータスケールによる限界進化を調査し、これらの関係を捉えるモデルを開発する。
我々はWarmup-Stable-Decay学習率スケジュールを採用するとともに、幅広いハイパーパラメータ設定、モデル、データ予算に対する学習率のアニールと、安定相と崩壊相の間の最適な学習率とバッチサイズ転送について検討する。
最後に、モデルキャパシティとデータセットサイズに対する損失の依存性を特徴付け、その相互作用を明示的にモデル化するスケーリングフォームを最近提案した。
これらのアプローチは、実験全体にわたって過度のトレーニングと過度のトレーニングの両方を捉えるのに特に有効である。
本研究は,OpenEuroLLMモデル開発のための第1のベースラインとスケーリング手順を確立する。
本研究で使用される事前学習実行の完全なコレクションをオープンソースとして公開する。
関連論文リスト
- Scaling Law Analysis in Federated Learning: How to Select the Optimal Model Size? [12.791994483385409]
高品質で精度の高いトレーニングデータの枯渇に対する懸念が高まっている。
Federated Learningにおけるトレーニングデータセットの分散化は、大規模なモデルをスケールする上での課題を導入している。
本稿では,従来のモデルスケーリング体験をフェデレートした学習シナリオに一般化するための洞察を提供する。
論文 参考訳(メタデータ) (2025-11-15T12:41:25Z) - Mid-Training of Large Language Models: A Survey [12.322464058364405]
大規模言語モデル(LLM)は通常、大規模事前学習とタスク固有の微調整によって開発される。
近年の進歩は中間訓練段階の重要性を浮き彫りにしている。
トレーニング中のデータ分散,学習速度スケジューリング,長文拡張の最初の分類について紹介する。
論文 参考訳(メタデータ) (2025-10-08T09:49:37Z) - Compute-Optimal Scaling for Value-Based Deep RL [99.680827753493]
オンライン価値ベースディープRLの計算スケーリングについて検討する。
解析の結果,モデルサイズ,バッチサイズ,UTD間の微妙な相互作用が明らかになった。
この現象を理解するためのメンタルモデルを提供し、バッチサイズとUTDを選択するためのガイドラインを構築します。
論文 参考訳(メタデータ) (2025-08-20T17:54:21Z) - Scaling Laws of Motion Forecasting and Planning - Technical Report [21.486301157587132]
本研究では,エンコーダ・デコーダ・オートレグレッシブ・トランスモデルの実証スケーリング法則について検討する。
モデルトレーニング損失とモデル評価指標との間には,強い相関関係がみられた。
我々は,エゴエージェントの性能向上のために,他のエージェントの一般的なログ化された運転データに対するトレーニングの有用性を短時間で検討した。
論文 参考訳(メタデータ) (2025-06-09T20:54:23Z) - The Fine Line: Navigating Large Language Model Pretraining with Down-streaming Capability Analysis [27.310894780313618]
本稿では,様々な事前学習中間点におけるモデル能力の総合的な比較を行う。
特定のダウンストリームメトリクスが、異なるサイズのモデルにまたがる同様のトレーニングダイナミクスを示すことを確認します。
コアの発見に加えて、AmberとOpenLLaMAを再現し、中間チェックポイントをリリースしました。
論文 参考訳(メタデータ) (2024-04-01T16:00:01Z) - Scaling Laws For Dense Retrieval [22.76001461620846]
本研究は,高密度検索モデルの性能が他のニューラルモデルと同様のスケーリング法則に従うかどうかを考察する。
その結果、我々の設定下では、高密度検索モデルの性能は、モデルサイズとアノテーション数に関連する正確なパワーロースケーリングに従っていることがわかった。
論文 参考訳(メタデータ) (2024-03-27T15:27:36Z) - The Languini Kitchen: Enabling Language Modelling Research at Different
Scales of Compute [66.84421705029624]
本稿では,アクセル時間で測定された等価計算に基づくモデル比較を可能にする実験的プロトコルを提案する。
私たちは、既存の学術的ベンチマークを上回り、品質、多様性、文書の長さで上回る、大規模で多様で高品質な書籍データセットを前処理します。
この研究は、GPT-2アーキテクチャから派生したフィードフォワードモデルと、10倍のスループットを持つ新しいLSTMの形式でのリカレントモデルという2つのベースラインモデルも提供する。
論文 参考訳(メタデータ) (2023-09-20T10:31:17Z) - Training Trajectories of Language Models Across Scales [99.38721327771208]
言語モデルのスケールアップは、前例のないパフォーマンス向上につながった。
異なるサイズの言語モデルは事前学習中にどのように学習するか?
より大きな言語モデルはなぜ望ましい振る舞いを示すのか?
論文 参考訳(メタデータ) (2022-12-19T19:16:29Z) - Large Language Models with Controllable Working Memory [64.71038763708161]
大規模言語モデル(LLM)は、自然言語処理(NLP)の一連のブレークスルーをもたらした。
これらのモデルをさらに切り離すのは、事前訓練中に内在する膨大な量の世界的知識だ。
モデルの世界知識が、文脈で提示された事実情報とどのように相互作用するかは、まだ解明されていない。
論文 参考訳(メタデータ) (2022-11-09T18:58:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。