論文の概要: Predicting Deep Neural Network Training Outcomes from Early Training Telemetry
- arxiv url: http://arxiv.org/abs/2608.03709v1
- Date: Tue, 04 Aug 2026 14:13:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.235736
- Title: Predicting Deep Neural Network Training Outcomes from Early Training Telemetry
- Title(参考訳): 早期トレーニングテレメトリによる深部ニューラルネットワークトレーニング結果の予測
- Authors: Ranjita Naik, Anh D. Nguyen, Pankaj Kumar Singh,
- Abstract要約: 我々は,1つのトレーニングランの早期テレメトリが,他のランに言及することなく,そのランの最終的な結果を予測することができるかどうかを調査する。
23,788のトレーニングは、6つのアーキテクチャ/データセットの組み合わせにまたがって実行され、最初の5つのテレメトリのエポックだけが最終精度の回帰のためにR2 = 0.92-0.99を達成する。
これらの結果から,早期学習テレメトリは計算割当のための実用的な意思決定支援信号を提供する可能性が示唆された。
- 参考スコア(独自算出の注目度): 2.310157248304176
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large hyperparameter sweeps for deep neural networks spend substantial compute on configurations that are effectively doomed from the first few epochs. We study whether a single training run's own early telemetry - per-epoch loss, training accuracy, gradient signal-to-noise ratio, weight-norm growth, and an activation-saturation snapshot - together with its sampled hyperparameters, can predict that run's eventual outcome without reference to other runs. We evaluate three prediction tasks: final test accuracy, relative performance within a domain, and training-dynamics failure, including numerical divergence. Across 23,788 training runs spanning six architecture/dataset combinations, gradient-boosted trees using only the first five epochs of telemetry achieve R^2 = 0.92-0.99 for final-accuracy regression and ROC-AUC = 0.983-0.998 for relative classification on a permanently held-out set of hyperparameter configurations. Useful prediction is already available after a single epoch. A paired ablation shows that gradient- and weight-level telemetry provides a statistically consistent improvement over loss and accuracy curves alone, although the practical gain varies by domain. Transfer is strong between similar architectures, while cross-dataset transfer is limited mainly by differences in accuracy scale rather than loss of the underlying relationship. These results suggest that early-training telemetry can provide a practical decision-support signal for compute allocation while motivating human oversight for any automated intervention.
- Abstract(参考訳): ディープニューラルネットワークのための大規模なハイパーパラメータスイープは、最初のいくつかのエポックから効果的に完了した構成に相当な計算を費やす。
我々は,1回のトレーニングランの初期テレメトリ – 画期的損失,トレーニング精度,勾配信号-雑音比,ウェイト-ノーム成長,アクティベーション-飽和スナップショット – が,サンプルのハイパーパラメータとともに,他のランに言及することなく,ランの最終的な結果を予測することができるかどうかを検討した。
最終テスト精度、ドメイン内の相対的性能、数値分岐を含むトレーニング・力学故障の3つの予測課題を評価する。
23,788のトレーニングは、6つのアーキテクチャ/データセットの組み合わせにまたがって実行され、最初の5つのエポックしか使用しない勾配木は最終精度回帰でR^2 = 0.92-0.99、ROC-AUC = 0.983-0.998は永久に保持されるハイパーパラメータ構成で相対分類される。
有意義な予測は、1つの時代を経てすでに利用可能である。
対のアブレーションにより、勾配レベルと重量レベルのテレメトリは損失曲線と精度曲線だけで統計的に一貫した改善をもたらすが、実際的な利得は領域によって異なる。
トランスファーは、類似のアーキテクチャ間で強いが、クロスデータセット転送は、基礎となる関係を失うことよりも、主に精度の尺度の違いによって制限される。
これらの結果から,早期学習テレメトリは,自動介入に対する人間の監視を動機づけつつ,計算割当のための実用的な意思決定支援信号を提供する可能性が示唆された。
関連論文リスト
- The Butterfly Effect: Neural Network Training Trajectories Are Highly Sensitive to Initial Conditions [51.68215326304272]
たとえ小さな摂動であっても、同じ訓練軌跡を確実に引き起こすことで、トレーニング時間とともに急速に減少する効果が発散することを示します。
この結果から,ニューラルネットワークのトレーニング安定性,微調整,モデルマージ,モデルアンサンブルの多様性の実践的意味が示唆された。
論文 参考訳(メタデータ) (2025-06-16T08:35:16Z) - The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws [51.608402959163925]
本稿では,大規模言語モデルに対する最適スパース事前学習構成の体系的検討を行う。
総トレーニング計算の25%でプルーニングを開始し、75%で終了すると、ほぼ最適の最終評価損失が得られることがわかった。
本稿では,事前学習よりも平均パラメータ数を使用するように,チンチラスケーリング法を修正した新しいスケーリング法を提案する。
論文 参考訳(メタデータ) (2025-01-21T20:23:22Z) - Just How Flexible are Neural Networks in Practice? [89.80474583606242]
ニューラルネットワークは、パラメータを持つ少なくとも多くのサンプルを含むトレーニングセットに適合できると広く信じられている。
しかし実際には、勾配や正規化子など、柔軟性を制限したトレーニング手順によるソリューションしか見つからない。
論文 参考訳(メタデータ) (2024-06-17T12:24:45Z) - Adaptive Sampling for Deep Learning via Efficient Nonparametric Proxies [35.29595714883275]
我々は,Nadaraya-Watson推定器に対する効率的なスケッチベース近似を開発した。
サンプリングアルゴリズムは,4つのデータセットに対して,壁面時間と精度でベースラインを上回っている。
論文 参考訳(メタデータ) (2023-11-22T18:40:18Z) - Bridging Precision and Confidence: A Train-Time Loss for Calibrating
Object Detection [58.789823426981044]
本稿では,境界ボックスのクラス信頼度を予測精度に合わせることを目的とした,新たな補助損失定式化を提案する。
その結果,列車の走行時間損失はキャリブレーション基準を超過し,キャリブレーション誤差を低減させることがわかった。
論文 参考訳(メタデータ) (2023-03-25T08:56:21Z) - Efficient Parametric Approximations of Neural Network Function Space
Distance [6.117371161379209]
モデルパラメータとトレーニングデータの重要な特性をコンパクトに要約して、データセット全体を保存または/または反復することなく後で使用できるようにすることが、しばしば有用である。
我々は,FSD(Function Space Distance)をトレーニングセット上で推定することを検討する。
本稿では、線形化活性化TRick (LAFTR) を提案し、ReLUニューラルネットワークに対するFSDの効率的な近似を導出する。
論文 参考訳(メタデータ) (2023-02-07T15:09:23Z) - Robust Learning via Persistency of Excitation [4.674053902991301]
勾配勾配勾配を用いたネットワークトレーニングは力学系パラメータ推定問題と等価であることを示す。
極値理論を用いて対応するリプシッツ定数を推定する効率的な手法を提案する。
我々の手法は、様々な最先端の対数訓練モデルにおいて、対数精度を0.1%から0.3%に普遍的に向上させる。
論文 参考訳(メタデータ) (2021-06-03T18:49:05Z) - Predicting Training Time Without Training [120.92623395389255]
我々は、事前訓練された深層ネットワークが損失関数の所定の値に収束する必要がある最適化ステップの数を予測する問題に取り組む。
我々は、微調整中の深部ネットワークのトレーニングダイナミクスが線形化モデルによってよく近似されているという事実を活用する。
トレーニングをする必要なく、特定の損失にモデルを微調整するのに要する時間を予測できます。
論文 参考訳(メタデータ) (2020-08-28T04:29:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。