論文の概要: Bridging Compute- and Data-Optimal Pretraining
- arxiv url: http://arxiv.org/abs/2607.25271v1
- Date: Tue, 28 Jul 2026 04:18:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.707583
- Title: Bridging Compute- and Data-Optimal Pretraining
- Title(参考訳): ブリッジングコンピューティングとデータ最適事前学習
- Abstract要約: 本稿では,データと計算を自由にスケーリングする計算最適スケーリングと,コーパスが固定され,計算がバウンドなしで成長するデータ最適スケーリングをブリッジする統合フレームワークを提案する。
CDスケーリングは、派生したトークン生成の値を定量化するトークン効率関数$$を導入することによって、古典的なスケーリング法則を拡張する。
- 参考スコア(独自算出の注目度): 18.911780119556663
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Classical compute-optimal scaling laws assume an unbounded supply of fresh pretraining data, yet pretraining is increasingly entering a regime in which compute grows faster than the availability of high-quality data. We propose Compute-Data (CD) scaling laws, a unified framework that bridges compute-optimal scaling, where data scales freely with compute, and data-optimal scaling, where the corpus is fixed while compute can grow without bound. CD scaling extends classical scaling laws by introducing a token-effectiveness function, $η$, which quantifies the value of a derived token-produced, for example, through multi-epoch repetition or paraphrasing-relative to a fresh token, ranging from a perfect substitute to having no value. We fit $η$ for two data-expansion strategies, multi-epoch repetition and paraphrasing, across model sizes from 14M to 600M parameters using the Dolma-3 corpus. We find that token effectiveness is far from constant: it depends jointly on model size, the tokens-per-parameter ratio, and the amount of derived data, and it saturates as the corpus is expanded. The functional form of $η$ implies diminishing returns when substituting compute for data as either model size or data availability increases. It also partitions training into three operational regimes---compute-bound, data-bound, and model-bound---and shows that classical compute-optimal allocation is suboptimal across most practically relevant settings.
- Abstract(参考訳): 古典的な計算-最適スケーリング法は、新しい事前学習データの無制限供給を前提としていますが、事前学習は、高品質なデータよりも高速に計算が成長する体制に入りつつあります。
本稿では,計算-最適スケーリングをブリッジする統一フレームワークであるCompute-Data(CD)スケーリング法則と,計算で自由にスケールするデータ-最適スケーリング法則を提案する。
CDスケーリングは、トークン有効性関数である$η$を導入して古典的なスケーリング法則を拡張している。
我々はDolma-3コーパスを用いたモデルサイズ14Mから6Mの2つのデータ拡張戦略、マルチエポック反復とパラフレージングに$η$を適合させる。
トークンの有効性は, モデルサイズ, パラメータごとのトークン比, 導出データ量に大きく依存し, コーパスの拡大とともに飽和する。
$η$の関数形式は、モデルサイズやデータ可用性が増大するにつれて、データに対する計算を代入する際のリターンを減少させることを意味する。
また、トレーニングを3つの運用体制 – 計算バウンド、データバウンド、モデルバウンド – に分割することで、古典的な計算-最適アロケーションが、最も実用的に関係のある設定で最適であることを示す。
関連論文リスト
- Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws [41.26396818761427]
正規化とスケーリングという2つの軸に沿ったデータ制約付き事前学習について検討した。
モデルサイズとデータサイズを結合して、繰り返しデータの下でのインタラクションをキャプチャするスケーリング法則であるSoftQを提案する。
論文 参考訳(メタデータ) (2026-06-05T04:10:09Z) - Prescriptive Scaling Laws for Data Constrained Training [21.261009598515066]
トレーニング計算は、高品質なデータの可用性をますます上回っている。
チンチラスケーリング法は、すべてのトレーニングトークンがユニークであると仮定する。
我々のスケーリング法則は、定性的に新しい計算-最適割り当てアドバイスをもたらす。
論文 参考訳(メタデータ) (2026-05-02T23:14:20Z) - Pre-training under infinite compute [87.02472603429936]
本研究では、エポック数の増加とパラメータ数の増加に対するデータ制約によるアプローチが、最終的には過度に適合することを示す。
独立に訓練されたモデルのアンサンブルは、正規化レシピよりもはるかに低損失の漸近を達成できる。
この結果から,計算量の多い将来において,よりデータ効率の高い事前学習が実現できることが示唆された。
論文 参考訳(メタデータ) (2025-09-18T09:36:23Z) - Value-Based Deep RL Scales Predictably [100.21834069400023]
本研究は, 地域社会が病的行動に不安を抱いているにもかかわらず, 価値に基づく非政治的RL法が予測可能であることを示す。
SAC、BRO、PQLの3つのアルゴリズムを使って、DeepMind Control、OpenAI gym、IsaacGymの3つのアプローチを検証する。
論文 参考訳(メタデータ) (2025-02-06T18:59:47Z) - The interplay between domain specialization and model size [8.653321928148547]
計算制約シナリオ下での継続事前学習におけるドメインサイズとモデルサイズ間の相互作用について検討する。
我々の目標は、このシナリオに最適なトレーニング体制を特定し、異なるモデルサイズとドメインにまたがって一般化可能な、この相互作用のパターンを検出することです。
論文 参考訳(メタデータ) (2025-01-03T19:28:53Z) - gzip Predicts Data-dependent Scaling Laws [2.5461535398221478]
我々は,PCFGの構文特性を調節することにより,様々な複雑さのトレーニングデータセットを生成する。
本稿では,トレーニングデータのgzip圧縮性を考慮したLMのスケーリング法を提案する。
論文 参考訳(メタデータ) (2024-05-26T20:33:08Z) - Scaling Laws for Data Filtering -- Data Curation cannot be Compute Agnostic [99.3682210827572]
ビジョン言語モデル(VLM)は、慎重にキュレートされたWebデータセット上で数千のGPU時間でトレーニングされる。
データキュレーション戦略は通常、トレーニングに利用可能な計算を知らないように開発されている。
ウェブデータの非均一性を考慮したニューラルスケーリング法則を導入する。
論文 参考訳(メタデータ) (2024-04-10T17:27:54Z) - A Dynamical Model of Neural Scaling Laws [79.59705237659547]
ネットワークトレーニングと一般化の解決可能なモデルとして,勾配降下で訓練されたランダムな特徴モデルを分析する。
我々の理論は、データの繰り返し再利用により、トレーニングとテスト損失のギャップが徐々に増大することを示している。
論文 参考訳(メタデータ) (2024-02-02T01:41:38Z) - Scaling Data-Constrained Language Models [133.2083255645999]
データ制約付きシステムにおける言語モデルのスケーリングについて検討する。
固定された計算予算に対する制約付きデータでは、反復するデータの最大4つのエポックなトレーニングは、ユニークなデータに比べて損失に対する無視可能な変化をもたらす。
本稿では,繰り返しトークンと過剰パラメータの値の減少を考慮に入れた計算最適性のスケーリング法則を提案し,実証的に検証する。
論文 参考訳(メタデータ) (2023-05-25T17:18:55Z) - A Solvable Model of Neural Scaling Laws [72.8349503901712]
大量のパラメータを持つ大規模な言語モデルは、インターネットに近い数のトークンで訓練されると、ニューラルネットワークのスケーリング法則に従うことが実証的に示されている。
我々は,このニューラルスケーリング現象を捉える統計モデル(共同生成データモデルとランダム特徴モデル)を提案する。
主な発見は、自然データセットの統計に現れる電力法則が非線形ランダムな特徴写像によって拡張される方法である。
論文 参考訳(メタデータ) (2022-10-30T15:13:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。