論文の概要: Practical Scaling Laws: Converting Compute into Performance in a Data-Constrained World
- arxiv url: http://arxiv.org/abs/2605.09189v1
- Date: Sat, 09 May 2026 22:07:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 02:24:05.528626
- Title: Practical Scaling Laws: Converting Compute into Performance in a Data-Constrained World
- Title(参考訳): 実践的なスケーリング法則: データ制約のある世界での計算をパフォーマンスに変換する
- Abstract要約: チンチラの$L = E + A/N+ B/D$は、主要なスケーリング法則形式であるが、非インフォームベースラインで飽和するのではなく、ユニークなデータが縮小するにつれて分散する。
本稿では,損失を低容量化,減量化,過度化に分解する閉形式拡張を提案する。
視覚、科学ML、言語ドメインの4つのマルチエポックな実験で検証する。
- 参考スコア(独自算出の注目度): 4.6607470395685215
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The scaling laws guiding modern model training were calibrated for a single regime: data-rich, single-epoch pretraining. The dominant such scaling law form, Chinchilla's $L = E + A/N^α+ B/D^β$, has three structural limitations outside that regime: it diverges as unique data shrinks instead of saturating at the uninformed baseline; it cannot represent overfitting when capacity exceeds the data; and it conflates total examples seen with unique examples available. We propose a closed-form extension, $L(N, D, T) = E + (L_0 - E)\,h/(1+h)$ with $h = a/N^α+ b/T^β+ c\,N^γ/D^δ$, that decomposes loss into undercapacity, undertraining, and overfitting terms. It saturates between the irreducible loss $E$ and an uninformed baseline $L_0$ fixed by the loss type, and reduces to Chinchilla in the data-rich, single-epoch limit. We validate it on four multi-epoch experiments spanning four architecture families (MLPs, ResNets, Fourier neural operators, and transformers) across vision, scientific ML, and language domains, and refit it to five published LLM scaling-law grids. Extrapolating to higher compute and larger unique data than seen at fit time, our form achieves state-of-the-art RMSE on every published LLM grid we evaluate and on most cells of our constructed experiments. Once calibrated, the form admits a cost-aware allocation that recovers Chinchilla's optimum when data is free and shifts toward smaller corpora and more epochs as data grows expensive.
- Abstract(参考訳): 近代的なモデルトレーニングを導くスケーリング法は、データ豊かで、単一のエポックな事前訓練という、単一の体制のために校正された。
このようなスケール法則は、Chinchillaの$L = E + A/N^α+ B/D^β$ の3つの構造的制限がある:それは、非インフォームベースラインで飽和する代わりに、一意のデータが縮小するにつれて発散し、キャパシティがデータを超えたときの過度な適合を表すことができず、利用可能なユニークな例で見られる全例を混同する。
L(N, D, T) = E + (L_0 - E)\,h/(1+h)$ with $h = a/N^α+ b/T^β+ c\,N^γ/D^δ$。
損失型によって固定された既約損失$E$と非インフォームベースライン$L_0$の間に飽和し、データリッチで単一エポックな制限でChinchillaに還元される。
4つのアーキテクチャファミリ(MLP、ResNet、フーリエニューラル演算子、トランスフォーマー)にまたがる、視覚、科学ML、言語ドメインにわたる4つのマルチエポジカルな実験で検証し、5つのLLMスケーリング法格子に適合する。
適合する時間よりも高い計算量と大きなユニークなデータから外挿することで、我々は構築した実験のほとんどのセルで評価した全てのLLMグリッド上で最先端のRMSEを達成する。
一度校正すると、この形式は、データが無料になったときにチチラの最適性を回復し、データが高価になるにつれて、より小さなコーポラやエポックへとシフトするコスト認識アロケーションを許容する。
関連論文リスト
- Bridging Compute- and Data-Optimal Pretraining [18.911780119556663]
本稿では,データと計算を自由にスケーリングする計算最適スケーリングと,コーパスが固定され,計算がバウンドなしで成長するデータ最適スケーリングをブリッジする統合フレームワークを提案する。
CDスケーリングは、派生したトークン生成の値を定量化するトークン効率関数$$を導入することによって、古典的なスケーリング法則を拡張する。
論文 参考訳(メタデータ) (2026-07-28T04:18:49Z) - Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws [41.26396818761427]
正規化とスケーリングという2つの軸に沿ったデータ制約付き事前学習について検討した。
モデルサイズとデータサイズを結合して、繰り返しデータの下でのインタラクションをキャプチャするスケーリング法則であるSoftQを提案する。
論文 参考訳(メタデータ) (2026-06-05T04:10:09Z) - Prescriptive Scaling Laws for Data Constrained Training [21.261009598515066]
トレーニング計算は、高品質なデータの可用性をますます上回っている。
チンチラスケーリング法は、すべてのトレーニングトークンがユニークであると仮定する。
我々のスケーリング法則は、定性的に新しい計算-最適割り当てアドバイスをもたらす。
論文 参考訳(メタデータ) (2026-05-02T23:14:20Z) - Semantic Tube Prediction: Beating LLM Data Efficiency with JEPA [50.494504099850325]
我々は、トークン列が滑らかな意味多様体上の測地線を辿り、従って局所線型であることを示す測地論仮説を導入する。
本稿では,この制約により信号対雑音比が向上し,軌道中の衝突を防止することにより多様性が保たれることを示す。
幾何学的先行性は、ブルートフォーススケーリングを超越できることを実証する。
論文 参考訳(メタデータ) (2026-02-26T04:45:07Z) - Larger Datasets Can Be Repeated More: A Theoretical Analysis of Multi-Epoch Scaling in Linear Regression [18.692159157168803]
本稿では,線形回帰学習における一般的な回避策,エポックトレーニング,リマプショントレーニングの理論的解析について述べる。
我々は、データセットが成長しなければならない乗算因子として定義するデータのテキスト有効再利用率である$E(K, N)$を用いてこれを定量化する。
以上の結果から,K$が$E(K, N)の近似値である最大$K$は,データサイズと分布に依存することが明らかとなった。
論文 参考訳(メタデータ) (2025-11-17T14:34:03Z) - Pre-training under infinite compute [87.02472603429936]
本研究では、エポック数の増加とパラメータ数の増加に対するデータ制約によるアプローチが、最終的には過度に適合することを示す。
独立に訓練されたモデルのアンサンブルは、正規化レシピよりもはるかに低損失の漸近を達成できる。
この結果から,計算量の多い将来において,よりデータ効率の高い事前学習が実現できることが示唆された。
論文 参考訳(メタデータ) (2025-09-18T09:36:23Z) - Improved Scaling Laws in Linear Regression via Data Reuse [36.110514249309254]
データの再利用は線形回帰における既存のスケーリング法則を改善することができることを示す。
これはデータ再利用によるスケーリング法則の改善(すなわち、データ制約されたレシエーションで$L>N$を選択する)を示唆している。
論文 参考訳(メタデータ) (2025-06-10T03:39:29Z) - Scaling Laws in Linear Regression: Compute, Parameters, and Data [86.48154162485712]
無限次元線形回帰セットアップにおけるスケーリング法則の理論について検討する。
テストエラーの再現可能な部分は$Theta(-(a-1) + N-(a-1)/a)$であることを示す。
我々の理論は経験的ニューラルスケーリング法則と一致し、数値シミュレーションによって検証される。
論文 参考訳(メタデータ) (2024-06-12T17:53:29Z) - Scaling Laws for Data Filtering -- Data Curation cannot be Compute Agnostic [99.3682210827572]
ビジョン言語モデル(VLM)は、慎重にキュレートされたWebデータセット上で数千のGPU時間でトレーニングされる。
データキュレーション戦略は通常、トレーニングに利用可能な計算を知らないように開発されている。
ウェブデータの非均一性を考慮したニューラルスケーリング法則を導入する。
論文 参考訳(メタデータ) (2024-04-10T17:27:54Z) - Scaling Data-Constrained Language Models [133.2083255645999]
データ制約付きシステムにおける言語モデルのスケーリングについて検討する。
固定された計算予算に対する制約付きデータでは、反復するデータの最大4つのエポックなトレーニングは、ユニークなデータに比べて損失に対する無視可能な変化をもたらす。
本稿では,繰り返しトークンと過剰パラメータの値の減少を考慮に入れた計算最適性のスケーリング法則を提案し,実証的に検証する。
論文 参考訳(メタデータ) (2023-05-25T17:18:55Z) - Data Scaling Laws in NMT: The Effect of Noise and Architecture [59.767899982937756]
ニューラルネットワーク翻訳(NMT)のデータスケーリング特性に及ぼすアーキテクチャとトレーニングデータ品質の影響について検討する。
データスケーリング指数は最小限の影響を受けており、より多くのデータを追加することで、極端に悪いアーキテクチャやトレーニングデータの補償が可能になることを示唆しています。
論文 参考訳(メタデータ) (2022-02-04T06:53:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。