論文の概要: Predicting Large Model Test Losses with a Noisy Quadratic System
- arxiv url: http://arxiv.org/abs/2605.09154v1
- Date: Sat, 09 May 2026 20:35:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.091868
- Title: Predicting Large Model Test Losses with a Noisy Quadratic System
- Title(参考訳): ノイズ2次システムによる大規模モデル試験損失の予測
- Abstract要約: モデルサイズ(N)、バッチサイズ(B)、重み更新数(K)から、大規模モデルの事前学習損失を推定する予測モデルを導入する。
これはバッチサイズの変化に対処できる最初の損失予測モデルです。
- 参考スコア(独自算出の注目度): 18.22919317870566
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce a predictive model that estimates the pre-training loss of large models from model size (N), batch size (B) and number of weight updates (K). This is the first loss prediction model that can handle changing batch size. The model outperforms Chinchilla's loss model, a model of the test loss using the batch size and number of tokens, in terms of projecting the loss at extrapolated compute budgets (up to 1000 folds). A natural use of the model is to find optimal N, B, K configurations under explicit and compound resource constraints like time, memory and compute. In our experiments, the model-selected configurations are close to ground-truth optimal. Our work advocates for loss prediction as a better alternative to heuristic-based laws, which are growing in complexity. The implementation is available on https://github.com/chuningxdy/Noisy-Quadratic-System.
- Abstract(参考訳): 本稿では,モデルサイズ(N),バッチサイズ(B),重み更新数(K)から,大規模モデルの事前学習損失を推定する予測モデルを提案する。
これはバッチサイズの変化に対処できる最初の損失予測モデルです。
このモデルは、外挿された計算予算(最大1000倍)での損失を予測するという点で、バッチサイズとトークン数を使用したテスト損失のモデルであるChinchillaの損失モデルよりも優れています。
このモデルの自然な用途は、時間、メモリ、計算といった明示的で複雑なリソース制約の下で、最適なN、B、K構成を見つけることである。
実験では, モデル選択構成が最適に近い。
我々の研究は、複雑さが増しているヒューリスティックな法則のより良い代替手段として、損失予測を提唱している。
実装はhttps://github.com/chuningxdy/Noisy-Quadratic-Systemで公開されている。
関連論文リスト
- Establishing Task Scaling Laws via Compute-Efficient Model Ladders [136.76316239300363]
我々は,事前訓練された言語モデル(LM)のタスク性能を予測するために,タスクスケーリング法則とモデルはしごを開発する。
2つの予測ステップのパラメータ化関数に適合するデータポイントを収集し、2つの対象モデルの予測を行う。
ランク付けされた4つの多重選択タスクにおいて、絶対誤差の2ポイント以内で、両方のターゲットモデルの精度を予測することができる。
論文 参考訳(メタデータ) (2024-12-05T18:21:49Z) - Coarse Graining with Neural Operators for Simulating Chaotic Systems [78.64101336150419]
カオスシステムの長期的挙動を予測することは、気候モデリングなどの様々な応用に不可欠である。
このような完全解法シミュレーションに対する別のアプローチは、粗いグリッドを使用して、時間テキストモデルによってエラーを修正することである。
この制限を克服する物理インフォームド・ニューラル演算子(PINO)を用いたエンド・ツー・エンドの学習手法を提案する。
論文 参考訳(メタデータ) (2024-08-09T17:05:45Z) - BayesBlend: Easy Model Blending using Pseudo-Bayesian Model Averaging, Stacking and Hierarchical Stacking in Python [0.0]
重みを推定し、複数の(ベイジアン)モデルの予測分布をブレンドするために、BayesBlend Pythonパッケージを導入する。
ベイズブレンドは、モデルウェイトを推定するために擬ベイズモデルの平均化、積み重ね、一意的に階層的ベイズ積み重ねを実装している。
ベイズブレンドの保険損失モデリングの例を例に紹介する。
論文 参考訳(メタデータ) (2024-04-30T19:15:33Z) - nanoLM: an Affordable LLM Pre-training Benchmark via Accurate Loss Prediction across Scales [65.01417261415833]
我々は,最大更新パラメトリゼーション(muP)がスケーリング法則の正確な適合を可能にするという観測に基づいて,事前学習損失を予測する手法を提案する。
トレーニング前コストの約14%で、52Bまでのモデルの損失を正確に予測できる。
NanoLMのゴールは、限られた資源を持つ研究者が大きなモデルで有意義な結論に達することを可能にすることです。
論文 参考訳(メタデータ) (2023-04-14T00:45:01Z) - An Approximation Method for Fitted Random Forests [0.0]
本研究では,葉にデータポイントを割り当てたランダムフォレストモデルを用いて,各木を近似する手法について検討した。
具体的には,多項ロジスティック回帰の適合が予測品質を保ちながらサイズを減少させるかどうかを考察することから始める。
論文 参考訳(メタデータ) (2022-07-05T17:28:52Z) - Scaling Laws for Acoustic Models [7.906034575114518]
近年の研究では、クロスエントロピー目的関数を持つ自己回帰生成モデルがスムーズなパワー-ロー関係を示すことが示されている。
自動予測符号損失で訓練された音響モデルは、まるで同様のスケーリング法則に従うかのように振る舞うことを示す。
論文 参考訳(メタデータ) (2021-06-11T18:59:24Z) - Bayes DistNet -- A Robust Neural Network for Algorithm Runtime
Distribution Predictions [1.8275108630751844]
ランダム化アルゴリズムは制約満足度問題 (CSP) やブール満足度問題 (SAT) の多くの最先端の解法で用いられている。
従来の最先端の手法は、入力インスタンスが従う固定パラメトリック分布を直接予測しようとする。
この新モデルは,低観測環境下での堅牢な予測性能と,検閲された観測処理を実現する。
論文 参考訳(メタデータ) (2020-12-14T01:15:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。