論文の概要: UE5M3 FP4 Block Scaling for Stable Language Model Pretraining
- arxiv url: http://arxiv.org/abs/2609.02846v1
- Date: Wed, 02 Sep 2026 17:32:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.480502
- Title: UE5M3 FP4 Block Scaling for Stable Language Model Pretraining
- Title(参考訳): UE5M3 FP4による安定言語モデルの事前学習のためのブロックスケーリング
- Abstract要約: NVIDIAのTransformer Engine nvレシピを使用して、約190億トークンのモデルを事前トレーニングします。
Transformer Engine nvと比較して、提案したブロック16レシピは、最終ウィンドウのトレーニング損失が低く、各量子化推論ポリシーの下で、保持された負のログライクな状態として測定された検証損失が低い。
RHTとBF16の最終ブロック免除を共同で除去するネイティブなnv実行アブレーションは、測定されたモデルボディトークンのスループットを21.2%向上させる。
- 参考スコア(独自算出の注目度): 6.963061311516306
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Stable 4-bit floating-point (FP4) pretraining is difficult because the E2M1 payload represents only a narrow range of magnitudes. NVIDIA's Transformer Engine \nv{} recipe addresses this with current-tensor scaling, a randomized Hadamard transform (RHT), and bfloat16 (BF16) final layers, adding work outside the FP4 matrix multiplications. We instead pair E2M1 payloads with unsigned E5M3 (\ue{}) block scales. Their wider range permits periodic tensor scaling, while our recipe applies selective stochastic rounding to backward gradients, omits RHT, and uses FP4 in all eligible internal linears. We pretrain a Nemotron-H 8B model for nearly 190 billion tokens. Compared with Transformer Engine \nv{}, the proposed block-16 recipe finishes with lower final-window training loss and, under their respective quantized-inference policies, lower validation loss measured as held-out negative log-likelihood. Its quantized-inference downstream point estimates are also higher on all three reported aggregates. A native \nv{} execution ablation that jointly removes RHT and the BF16 final-block exemption increases measured model-body token throughput by 21.2\%. These results demonstrate end-to-end software-emulated \uefp{} pretraining with a simpler recipe and motivate native support for \ue{} block scaling.
- Abstract(参考訳): 安定な4ビット浮動小数点 (FP4) 事前訓練は、E2M1ペイロードが狭い範囲しか表現できないため困難である。
NVIDIAのTransformer Engine \nv{}レシピは、これを、カレントテンソルスケーリング、ランダム化されたHadamard変換(RHT)、およびbfloat16(BF16)ファイナルレイヤで解決し、FP4行列乗算の外での作業を追加する。
代わりに、E2M1ペイロードと符号なしのE5M3(\ue{})ブロックスケールをペアにします。
より広い範囲では周期的テンソルスケーリングが可能であり、我々のレシピでは後方勾配に選択的確率的ラウンドリングを適用し、RHTを省略し、FP4を任意の内部線形に使用する。
我々は190億近いトークンに対してNemotron-H 8Bモデルを事前訓練する。
Transformer Engine \nv{}と比較して、提案したブロック16レシピは、最終ウィンドウのトレーニング損失が低く、それぞれの量子化推論ポリシーの下で、保持された負のログライクな状態として測定された検証損失が低い。
その量子化推論ダウンストリーム点推定は、報告された3つの集合全てに対して高い。
RHTとBF16の最終ブロック免除を共同で除去するネイティブな \nv{} 実行アブレーションは、測定されたモデルボディトークンのスループットを21.2\%増加させる。
これらの結果は、よりシンプルなレシピで、エンドツーエンドのソフトウェアエミュレートされた \uefp{} プリトレーニングを示し、 \ue{} ブロックスケーリングのネイティブサポートを動機付けている。
関連論文リスト
- Stable FP4 Training via Transposition-Invariant Block Quantization [14.373963304887754]
従来の1Dブロック量子化では、前方と後方のパスは変換後に同じ値に誘電性スケーリング因子を割り当てる。
本稿では,2次元ブロックFP4量子化に基づく低精度トレーニングフレームワークを提案する。
提案手法は安定なエンドツーエンドFP4トレーニングを実現し,BF16の性能と密に一致し,パープレキシティと下流精度が1.3%未満に低下した。
論文 参考訳(メタデータ) (2026-07-27T18:03:34Z) - Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models [75.80275843320511]
トランスフォーマーのバックボーンを固定したまま、各トークンにより多くの計算を割り当てることで、既存のバックボーンが改善を続けることができるかどうかを検討する。
継続事前学習中に適用されたシーケンス長スケーリング手法であるHidden Decodingを提案する。
論文 参考訳(メタデータ) (2026-07-09T07:37:59Z) - FourTune: Towards Fully 4-Bit Efficient Post-Training for Diffusion Models [50.66675248468456]
FourTuneは、エンドツーエンドのW4A4G4パラダイムに基づいた拡散モデルのための効率的な後トレーニングフレームワークである。
FourTuneはメモリオーバーヘッドを2.25$times$に減らし、エンドツーエンドのトレーニングスループットをBF16 LoRAと比較して2.27$times$にする。
論文 参考訳(メタデータ) (2026-07-07T00:34:30Z) - Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention [34.07319488267708]
最近のNVFP4事前学習法は主に変圧器線形層を対象としており、4ビットパイプラインで探索された計算状態、算術的および注意点を残している。
この臨界ギャップは、3つのコアモジュールがユニークな数値的な故障パターンを示すため、安定なフルスタック4ビットプリトレーニングをブロックする。
3つの安定性ボトルネックをすべて解決した最初の完全NVFP4事前学習フレームワークであるFull-Stack FP4を提案する。
論文 参考訳(メタデータ) (2026-07-05T17:31:36Z) - SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference [4.219937026460372]
SharQは、オンラインスパース-デンス分解による活性化空間とFP4量子化を橋渡しする。
スパースFP4 GEMMはバックボーンを処理し、密度の高いFP4 GEMMはマスク誘起活性化損失とスパースパス量子化誤差の両方を補償する。
論文 参考訳(メタデータ) (2026-06-25T04:19:04Z) - Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe [31.895766254664167]
ラウンドリングをdYのみに制限しながら,RHTを3つのトレーニングGEMMすべてに適用する4ビットトレーニングレシピを提案する。
Dense 1.5B、MoE 7.9B、MoE 124Bの長期事前訓練では、UFP4は強いE2M1ベースラインよりも低いBF16相対損失劣化を達成する。
この結果から,将来の加速器はE1M2/INT4スタイルの4ビットグリッドを,E2M1とともに第一級の訓練プリミティブとしてサポートすべきであることが示唆された。
論文 参考訳(メタデータ) (2026-06-18T15:40:51Z) - N-vium: Mixture-of-Exits Transformer for Accelerated Exact Generation [68.47358899451255]
N-vium (N-vium) は、標準ハードウェア上での計算を部分的に並列化する変圧器である。
N-Viumは複数の深さで予測ヘッドを付加し、次のトーケン分布をこれらの出口上の学習混合物として定義する。
論文 参考訳(メタデータ) (2026-05-13T08:46:17Z) - Normalized Architectures are Natively 4-Bit [49.13186675123547]
重みと隠れ表現を単位超球面に制限するアーキテクチャであるnGPTは、本質的に低精度算術よりも堅牢である。
本手法は,最大3B/30Bパラメータの1.2B密度モデルとハイブリッド(Mamba-Transformer)MoEモデルの両方で検証する。
論文 参考訳(メタデータ) (2026-05-07T11:54:07Z) - Speeding Up MACE: Low-Precision Tricks for Equivarient Force Fields [51.95157731126864]
機械学習力場は高い計算コストで正確な分子動力学(MD)を提供することができる。
この論文は、計算ボトルネックを特定し、低精度の実行ポリシーを評価することで、MACEを安価かつ高速にすることを目的としている。
論文 参考訳(メタデータ) (2025-10-23T14:02:34Z) - FP4 All the Way: Fully Quantized Training of LLMs [26.195547788434908]
主に4ビット浮動小数点(FP4)の精度を用いて,大規模言語モデル(LLM)の完全量子化訓練(FQT)を実演する。
ブロックサイズ,スケーリングフォーマット,ラウンドメソッドなど,FP4の主要な設計選択について検討する。
論文 参考訳(メタデータ) (2025-05-25T12:14:25Z) - SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models [61.474101404805545]
拡散モデルは高品質なイメージを生成することができるが、スケールするにつれて、メモリ要求が増加し、より高いレイテンシがデプロイメント上の課題を引き起こす。
この制限を克服する新しい4ビット量子化パラダイムであるSVDQuantを提案する。
We reduce the memory usage for the 12B FLUX.1 models by 3.5$times$, achieved 3.0$times$ speedup over the 4-bit weight-only Quantization (W4A16) baseline。
論文 参考訳(メタデータ) (2024-11-07T18:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。