論文の概要: Predict before you train: Scaling Laws for particle physics foundation models
- arxiv url: http://arxiv.org/abs/2607.23377v1
- Date: Sat, 25 Jul 2026 21:46:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.413112
- Title: Predict before you train: Scaling Laws for particle physics foundation models
- Title(参考訳): トレーニング前の予測:粒子物理基礎モデルのスケーリング法則
- Abstract要約: 我々は、コライダージェットで事前訓練された汎用変圧器について、予測可能であることを示す。
複数のサイズにまたがる事前トレーニングされた5つのモデルと、完全なトレーニングレシピとコードをリリースします。
- 参考スコア(独自算出の注目度): 3.279137362765848
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The largest machine learning models in particle physics are also the most expensive to train, yet the return on scaling a given architecture cannot be estimated before that compute is spent. Scaling laws have been fit for jets, but none has yet been shown to predict the performance of models it was not fit on. We show that, for a generic transformer pretrained on collider jets, it can be forecast. Fitting a joint model-and-data scaling law on small models alone, spanning three orders of magnitude of training compute, we predict the loss of models trained afterward with more than one hundred times more compute to within one percent. We then connect the forecast to downstream physics performance: across two standard tagging benchmarks, lower pretraining loss yields systematically lower fine-tuning loss and higher background rejection after fine-tuning. Within this model family and these tasks, a compute budget can therefore be translated into expected physics performance before any large model is trained. The final frontier model is consistent with the published numbers for current state-of-the-art physics-aware foundation models trained on the same corpus, on accuracy, AUC, and quark/gluon rejection, with a residual edge for the physics-aware model only in the high-purity tail of top tagging. We release five pretrained models spanning multiple sizes, together with the complete training recipe and code.
- Abstract(参考訳): 素粒子物理学における最大の機械学習モデルは、トレーニングに最もコストがかかるが、与えられたアーキテクチャのスケーリングに対する回帰は、計算に費やされる前に見積もることはできない。
スケール法則はジェット機に適合するが、不適合なモデルの性能を予測できることは示されていない。
我々は、コライダージェットで事前訓練された汎用変圧器について、予測可能であることを示す。
モデルとデータの同時スケーリング法則を小さなモデルのみに適用し,3桁のトレーニング計算を行ない,100倍以上の計算量でトレーニング後のモデルの損失を1%以下に予測する。
次に,2つの標準タグ付けベンチマーク,事前学習損失の低減,微調整損失の体系的低減,微調整後の背景拒絶などの予測を下流物理性能に結びつける。
このモデルファミリーとこれらのタスクの中で、大きなモデルが訓練される前に計算予算を期待された物理性能に変換することができる。
最終フロンティアモデルは、同じコーパス、精度、AUC、クォーク/グルーオンの拒絶に基づいて訓練された現在の最先端物理認識基盤モデルの公表された数と一致しており、物理認識モデルの残留エッジはトップタグの高純度テールのみである。
複数のサイズにまたがる事前トレーニングされた5つのモデルと、完全なトレーニングレシピとコードをリリースします。
関連論文リスト
- Neural Scaling Laws for Jet Generation [0.46843765915430247]
本研究は, 粒子ジェット発生の課題に対して, スケーリング法則を観測できるかどうかを考察する。
トレーニング中のモデルではすぐに利用できない5つの物理量のスライスされたワッサーシュタイン距離について検討する。
データセットのサイズと計算によるスケーリングでは、損失とスライスされたワッサーシュタイン距離の両方のスケーリング挙動が著しく弱い。
論文 参考訳(メタデータ) (2026-05-27T18:00:03Z) - Scaling Laws for Precision [73.24325358259753]
トレーニングと推論の両方に"精度対応"のスケーリング法則を考案する。
推論では,学習後の量子化によって生じる劣化が,モデルがより多くのデータに基づいて訓練されるにつれて増加することが分かる。
トレーニングのために、我々のスケーリング法則は、異なるパーツの異なるモデルの損失を、異なる精度で予測することができる。
論文 参考訳(メタデータ) (2024-11-07T00:10:10Z) - A Hitchhiker's Guide to Scaling Law Estimation [56.06982415792523]
スケーリング法則は、より少ないパラメータやより少ないトレーニングセットで訓練が容易なモデルから外挿することで、ターゲットとなる機械学習モデルの損失を予測する。
我々は1000以上のスケーリング法則を推定し、新しいモデルファミリーにおけるスケーリング法則を推定するためのベストプラクティスを導出する。
論文 参考訳(メタデータ) (2024-10-15T17:59:10Z) - Language models scale reliably with over-training and on downstream tasks [121.69867718185125]
スケーリング法則は、高価なトレーニング実行を引き出すための有用なガイドである。
しかし、現在の研究と言語モデルがどのように訓練されているかには差がある。
対照的に、スケーリング法則は主に推論における損失を予測するが、モデルは通常下流のタスクのパフォーマンスで比較される。
論文 参考訳(メタデータ) (2024-03-13T13:54:00Z) - A Dynamical Model of Neural Scaling Laws [79.59705237659547]
ネットワークトレーニングと一般化の解決可能なモデルとして,勾配降下で訓練されたランダムな特徴モデルを分析する。
我々の理論は、データの繰り返し再利用により、トレーニングとテスト損失のギャップが徐々に増大することを示している。
論文 参考訳(メタデータ) (2024-02-02T01:41:38Z) - Weight subcloning: direct initialization of transformers using larger
pretrained ones [42.056148990349094]
本稿では,事前学習されたモデルの知識をより小さな変種に伝達する手法を提案する。
ウェイト・サブクロニングは、より大きな事前訓練モデルからウェイトを初期化することにより、スケールダウン・トランスフォーマーのトレーニングを高速化する。
我々は、次のトークン予測のために設計された画像分類と言語モデルにおいて、視覚変換器の4倍高速なトレーニングを実現する。
論文 参考訳(メタデータ) (2023-12-14T19:08:56Z) - Reusing Pretrained Models by Multi-linear Operators for Efficient
Training [65.64075958382034]
大規模なモデルをスクラッチからトレーニングすることは、通常、かなりの量のリソースを必要とする。
bert2BERT や LiGO といった最近の研究は、大規模なモデルを初期化するために、小さな事前訓練されたモデルを再利用している。
本稿では,対象モデルの各重みを事前学習モデルの全重みに線形に相関させる手法を提案する。
論文 参考訳(メタデータ) (2023-10-16T06:16:47Z) - Scaling Laws for Acoustic Models [7.906034575114518]
近年の研究では、クロスエントロピー目的関数を持つ自己回帰生成モデルがスムーズなパワー-ロー関係を示すことが示されている。
自動予測符号損失で訓練された音響モデルは、まるで同様のスケーリング法則に従うかのように振る舞うことを示す。
論文 参考訳(メタデータ) (2021-06-11T18:59:24Z) - Embedded training of neural-network sub-grid-scale turbulence models [0.0]
ディープニューラルネットワークモデルの重みは、制御フロー方程式と共に最適化され、サブグリッドスケールの応力のモデルを提供する。
トレーニングは勾配降下法で行われ、随伴ナビエ-ストークス方程式を用いてモデル重みのエンドツーエンドの感度を速度場に与える。
論文 参考訳(メタデータ) (2021-05-03T17:28:39Z) - Train Large, Then Compress: Rethinking Model Size for Efficient Training
and Inference of Transformers [94.43313684188819]
本研究では,計算によって制限されたNLPタスクのトランスフォーマーモデルに着目し,モデルサイズの影響について検討する。
まず最初に、より小さなTransformerモデルがイテレーション毎に高速に実行されているにもかかわらず、より広いモデルとより深いモデルがはるかに少ないステップで収束していることを示します。
これは、大きなTransformerモデルのトレーニング効率と小さなTransformerモデルの推論効率との間に明らかなトレードオフをもたらす。
論文 参考訳(メタデータ) (2020-02-26T21:17:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。