論文の概要: The Silent Freeze: Predicting When Low-Precision Training Stops Learning
- arxiv url: http://arxiv.org/abs/2607.09800v1
- Date: Thu, 09 Jul 2026 15:23:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.198838
- Title: The Silent Freeze: Predicting When Low-Precision Training Stops Learning
- Title(参考訳): サイレントフリーズ:低精度トレーニングが学習を止めたときの予測
- Authors: Zekai Shang,
- Abstract要約: 浮動小数点精度の低下による訓練は、静かに学習を止めることができる。
凍結は決定論的であり、調整された半ULP条件によって制御される。
凍結機能回帰、マニサ・トランケーション・エミュレータ、およびMNIST上のCNN間の条件伝達。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training in reduced floating-point precision can silently halt learning: when a gradient-descent weight update falls below half the unit in the last place (ULP) of the weight, it rounds away and that coordinate freezes while its gradient is still nonzero. The freeze is deterministic, governed by a per-coordinate half-ULP condition, and predictable from a high-precision trajectory and the target mantissa length alone, without low-precision data. In a small GPT trained under the standard AdamW-plus-cosine recipe with bf16-equivalent stored weights, training proceeds normally and then permanently freezes just past mid-run, within four steps of the a-priori prediction. In a $124$-million-parameter GPT-2 transformer whose weights are constrained to the $8$-bit floating-point grid after every optimizer step, with no master weights, the dense weights freeze at initialization in both fp8 formats -- predicted \emph{a priori} from an fp32 reference -- and validation loss plateaus while full precision keeps improving. Stochastic rounding removes the persistent freeze, and the same reference predicts that too. The condition transfers across frozen-feature regression, a mantissa-truncation emulator spanning $128\times$ in precision, small networks, and a CNN on MNIST: a computable axis of low-precision training, not diffuse noise.
- Abstract(参考訳): 浮動小数点精度を下げる訓練は、学習を静かに停止することができる: 重みの最後の場所(ULP)の単位の半分以下に下がれば、その勾配がまだゼロである間に、その座標が回転し、凍結する。
凍結は決定論的であり、コーディネート毎の半ULP条件で制御され、高精度な軌跡と目標マンティッサの長さだけで予測できる。
標準のAdamW+コサインレシピとbf16相当の保存重量で訓練された小さなGPTでは、トレーニングは正常に進行し、アプリオリ予測の4段階の中間から永久に凍結する。
マスターウェイトのないオプティマイザステップ毎に8ドルビット浮動小数点格子に重みが拘束される124ドルのGPT-2トランスフォーマーでは、両方のfp8フォーマットの初期化時に密集重みが凍結される -- fp32参照から予測される -- fp32参照から"emph{a priori}" -- と、完全な精度が向上する一方で、検証損失プラトーは改善され続けている。
確率的な丸めは、永続的な凍結を排除し、同じ参照もそれを予測します。
この条件は、フリーズ・フィーチャー・レグレッション(英語版)、精度が128\times$のマニサ・トランケーション・エミュレータ、MNIST上のCNN(拡散雑音ではなく、低精度トレーニングの計算可能な軸)にまたがる。
関連論文リスト
- M+Adam: Low-Precision Training via Additive-Multiplicative Optimization [69.5989114185868]
量子化された重量のトレーニングはコストを削減できるが、しばしば精度が低下する。
本稿では,2つの更新タイプを組み合わせたM+Adamを提案する。
60M-1Bのモデルと1x-8xのチンチラ、BF16、FP8、FP4のマスターウェイトを使用したLLaMA型プレトレーニングでは、M+アダムは一貫して低精度トレーニングを改善している。
論文 参考訳(メタデータ) (2026-07-12T07:15:47Z) - Pre-Warm: Input-Conditioned Weight Initialization for Convolutional Neural Networks [0.0]
Pre-Warmは、単一のトレーニングバッチから平均中心のローカルパッチを抽出する。
それらをMiniKMeansでクラスタし、逆マンハッタン空間重み付けを適用し、その結果のセントロイドを使って第1層フィルタの半分を初期化する。
論文 参考訳(メタデータ) (2026-06-24T00:27:53Z) - Bandit Convex Optimization with Gradient Prediction Adaptivity [56.816177049016794]
本研究では, 楽観的な勾配予測が, 最悪の後悔の保証を予測順応的に改善できるかどうかを考察する。
鍵となるアイデアは、分散が勾配ノルムではなく予測誤差でスケールする、新しい分散還元勾配推定器である。
我々は、$(sqrtmathbbE[S_T])$としてスケールする情報理論の下限を確立し、最も達成可能な予測適応的後悔の基本的な特徴を提供する。
論文 参考訳(メタデータ) (2026-05-21T08:57:38Z) - ECO: Quantized Training without Full-Precision Master Weights [58.97082407934466]
Error-Compensating (ECO)は、量子化されたパラメータに直接更新を適用することで、マスターウェイトを除去する。
ECO は最適値の定数半径近傍に収束するが、素早いマスターウェイト除去は学習率に逆比例する誤差を生じさせる。
論文 参考訳(メタデータ) (2026-01-29T18:35:01Z) - Speeding Up MACE: Low-Precision Tricks for Equivarient Force Fields [51.95157731126864]
機械学習力場は高い計算コストで正確な分子動力学(MD)を提供することができる。
この論文は、計算ボトルネックを特定し、低精度の実行ポリシーを評価することで、MACEを安価かつ高速にすることを目的としている。
論文 参考訳(メタデータ) (2025-10-23T14:02:34Z) - OrthoGrad Improves Neural Calibration [0.0]
$perp$Gradは、過信に対処するために降下方向を制約する。
$perp$Gradは、最適化のための幾何学的な修正である。
論文 参考訳(メタデータ) (2025-06-04T22:12:46Z) - PLUMAGE: Probabilistic Low rank Unbiased Min Variance Gradient Estimator for Efficient Large Model Training [21.695928776150808]
アクセラレータのメモリとネットワークの制約は、大きな言語モデルをトレーニングする際の主要なボトルネックとして現れている。
PLUMAGE: Probabilistic Low rank Unbiased Minimum v Ariance Gradient Estorを提案する。
PLUMAGEは,モデル全体で平均33%,GLUEベンチマークで平均28%,GaloREと同様の計算量およびメモリフットプリントで平均33%の事前トレーニング評価損失に対して,フルランク最適化のギャップを縮めることを実証的に実証した。
論文 参考訳(メタデータ) (2025-05-23T19:17:55Z) - Fine-tuning Quantized Neural Networks with Zeroth-order Optimization [21.0540879091664]
我々は、勾配推定のために連続量子化スケールを摂動する単純で効果的な方法である量子化ゼロ階最適化(QZO)を提案する。
QZOは4ビットLLMの合計メモリコストを18ドル以上削減でき、24GBのGPUでLlama-2-13Bを微調整できる。
論文 参考訳(メタデータ) (2025-05-19T17:55:15Z) - FreezeNet: Full Performance by Reduced Storage Costs [68.8204255655161]
プルーニングはパラメータを0に設定することでスパースネットワークを生成する。
我々は、追加のストレージコストを加えることなく、トレーニング前に適用したワンショットプルーニング法を改善した。
我々はFreezeNetsが特に極端凍結速度で良い結果を得ることを示す。
論文 参考訳(メタデータ) (2020-11-28T08:32:44Z) - Predicting Training Time Without Training [120.92623395389255]
我々は、事前訓練された深層ネットワークが損失関数の所定の値に収束する必要がある最適化ステップの数を予測する問題に取り組む。
我々は、微調整中の深部ネットワークのトレーニングダイナミクスが線形化モデルによってよく近似されているという事実を活用する。
トレーニングをする必要なく、特定の損失にモデルを微調整するのに要する時間を予測できます。
論文 参考訳(メタデータ) (2020-08-28T04:29:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。