論文の概要: Stochastic Rounding in Low-Precision Transformer Inference: A Variable-Precision Emulation Study of a Small GPT-2
- arxiv url: http://arxiv.org/abs/2610.01889v1
- Date: Thu, 01 Oct 2026 15:40:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.230184
- Title: Stochastic Rounding in Low-Precision Transformer Inference: A Variable-Precision Emulation Study of a Small GPT-2
- Title(参考訳): 低精度変圧器推論における確率的ラウンドリング:小型GPT-2の可変精度エミュレーション
- Abstract要約: 確率的ラウンドリング(SR)とラウンド・トゥ・アレスト(RN)を用いた低精度変圧器推定法について検討した。
PRISMベクトル化ラウンドリングライブラリを可変精度ラウンドリングアルゴリズムにより任意の仮想精度に拡張する。
SRは精度が1.15倍になるのに対し、RNは2.21倍である。
- 参考スコア(独自算出の注目度): 0.6982738885923204
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Should low-precision transformer inference use stochastic rounding (SR) or round-to-nearest (RN)? The answer depends on where in the network you look. We isolate this effect by holding the numerical format fixed and varying only the rounding rule at individual operation sites. To enable experiments at freely chosen precisions, we extend the PRISM vectorized rounding library to arbitrary virtual precision via a variable-precision stochastic rounding (VPSR) algorithm, proving that the rounding decision is evaluated exactly in hardware floating point. We develop two analyses providing complementary insight into this site-level trade-off. First, a probabilistic forward-error bound for linear projections shows that SR's error envelope grows as $O(\sqrt{n} u)$ in reduction length $n$, versus $O(n u)$ for RN, a gap that widens rapidly at low precision and is most pronounced in the long multilayer perceptron (MLP) down-projection. Second, a second-order decomposition of expected cross-entropy loss change at the output softmax into signed drift, drift curvature, and a Fisher-weighted variance penalty reveals why the two sites behave oppositely: MLP noise is predominantly a uniform logit shift to which softmax is invariant, so SR's variance is largely discounted; head noise is non-uniform across the vocabulary and is not. On DistilGPT-2 at $t=6$ significand bits, observations match theory: SR in the MLP raises perplexity to 1.15x the full-precision reference, versus 2.21x for RN. At the language-model head, the ordering reverses because SR introduces non-uniform variance, whereas deterministic RN carries none. In a mixed-precision configuration (MLP output at $t=6$), assigning SR to the MLP and RN to the head brings perplexity within 1.10x of the full-precision reference, a 28% reduction over matched-bit RN.
- Abstract(参考訳): 低精度変圧器推論では、確率円環 (SR) やラウンド・トゥ・アレスト (RN) を用いるべきか?
答えは、ネットワークのどこを見ているかによって異なります。
数値形式を固定し,各操作箇所の丸め規則のみを変化させることで,この効果を分離する。
PRISMベクトル化ラウンドリングライブラリを可変精度確率的ラウンドリング(VPSR)アルゴリズムにより任意の仮想精度に拡張し、ラウンドリング決定がハードウェア浮動小数点において正確に評価されることを示す。
このサイトレベルのトレードオフに関する相補的な洞察を提供する2つの分析法を開発した。
第一に、線形射影に対する確率的前方誤差境界は、SRの誤差包絡線が$O(\sqrt{n} u)$ in reduction length $n$, versus $O(n u)$ for RN, このギャップは低精度で急速に広がり、長多層パーセプトロン(MLP)ダウンプロジェクションで最も顕著であることを示している。
第二に、出力ソフトマックスにおける予測されるクロスエントロピー損失変化の2次分解は、符号付きドリフト、ドリフト曲率、フィッシャー重み付き分散ペナルティによって、2つのサイトが逆向きに振る舞う理由が示される: MLPノイズは、主にソフトマックスが不変となる均一なロジットシフトであり、SRの分散は大幅に割引される。
DistilGPT-2 at $t=6$ significand bits, observed match theory: SR in the MLP raises perplexity to 1.15x the full-precision reference, versus 2.21x for RN。
言語モデルヘッドでは、順序付けが逆になるのは、SRが非一様分散を導入するのに対して、決定論的RNは、何も持たないからである。
MLP出力が$t=6$の混合精度構成(MLP出力)では、MLPにSRを割り当て、RNをヘッドに割り当てると、完全精度参照の1.10倍以内にパープレキシティが生じる。
関連論文リスト
- Calibrated Derivative-Process Sensitivity for Gaussian-Process Variable Selection [1.9493449206135296]
自動妥当性決定(ARD)はガウス過程(GP)回帰における変数選択のデフォルトツールである。
微分感度 $_j = mathbbE[(partial f/partial x_j)2]$ は、適合したGPから閉じた形で利用できるが、それを選択規則に変換することは見た目よりも難しい。
論文 参考訳(メタデータ) (2026-09-27T13:18:13Z) - Learning to Fluctuate: Statistical Foundations for Causal Tabular Pretraining [8.401473551081748]
本研究では,固定配置人口に必要となる繰り返しサンプル応答を符号化した揺らぎ制御事前訓練(FSP)を導入する。
FSPは、温かいワンスレッドベンチマークでテーブル毎の11.6Times$高速にデプロイします。
2つのランダム化されたスタディ評価は、低いRMSEが残留減衰と共存できることを示している。
論文 参考訳(メタデータ) (2026-09-22T12:03:30Z) - Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions [51.50375419691955]
分布的に堅牢なマルコフ決定プロセスは、モデルの不確実性の下でのシーケンシャルな意思決定のための原則化されたフレームワークを提供する。
我々は,平均回帰基準の下で,$varepsilon$-Optimal robust policyを学習するのに必要なサンプル数と十分なサンプル数について検討した。
論文 参考訳(メタデータ) (2026-08-06T19:49:48Z) - Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate [0.0]
混合精度量子化は、モデルのどの部分がより高い精度を維持するかを決定する必要がある。
本研究は, 層単位での定量化による損失を, 層ごとの感性や, 対方向の感性から再現可能であることを示す。
本稿では, 測定値の差分プロファイルである$f(S)=cbigl (1-prod_iin S (1-a_i)bigr)$を, その$L$適合ブレークレートから数パーセント以内まで再現する。
論文 参考訳(メタデータ) (2026-07-14T02:08:33Z) - Bandit Convex Optimization with Gradient Prediction Adaptivity [56.816177049016794]
本研究では, 楽観的な勾配予測が, 最悪の後悔の保証を予測順応的に改善できるかどうかを考察する。
鍵となるアイデアは、分散が勾配ノルムではなく予測誤差でスケールする、新しい分散還元勾配推定器である。
我々は、$(sqrtmathbbE[S_T])$としてスケールする情報理論の下限を確立し、最も達成可能な予測適応的後悔の基本的な特徴を提供する。
論文 参考訳(メタデータ) (2026-05-21T08:57:38Z) - Online Covariance Estimation in Averaged SGD: Improved Batch-Mean Rates and Minimax Optimality via Trajectory Regression [12.805268849262243]
我々はPolyak-Ruppert averaged gradient descent (SGD)のオンライン共分散行列推定について検討した。
この構造は、このボトルネックがSGDドリフトからヘッセンの情報をサブ線形に蓄積していることを明らかにする。
論文 参考訳(メタデータ) (2026-04-12T20:49:33Z) - When Does Margin Clamping Affect Training Variance? Dataset-Dependent Effects in Contrastive Forward-Forward Learning [0.0]
コントラストフォワード(Contrastive Forward-Forward, CFF)学習は、教師付きコントラスト目標に対して、ビジョントランスフォーマーを層別に層状化する。
比較損失における正対辺のマージンは、類似度クランプの飽和により適用される。
対数確率の後にマージンを減じる別の定式化が、平均-上-正の還元の下で勾配ニュートラルであることを証明する。
論文 参考訳(メタデータ) (2026-03-01T07:00:38Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Transformers as Support Vector Machines [54.642793677472724]
自己アテンションの最適化幾何と厳密なSVM問題との間には,形式的等価性を確立する。
勾配降下に最適化された1層変圧器の暗黙バイアスを特徴付ける。
これらの発見は、最適なトークンを分離し選択するSVMの階層としてのトランスフォーマーの解釈を刺激していると信じている。
論文 参考訳(メタデータ) (2023-08-31T17:57:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。