論文の概要: Correcting Stochastic Update Bias in Preconditioned Language Model Optimizers
- arxiv url: http://arxiv.org/abs/2605.20756v1
- Date: Wed, 20 May 2026 05:54:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.509828
- Title: Correcting Stochastic Update Bias in Preconditioned Language Model Optimizers
- Title(参考訳): 事前条件付き言語モデル最適化における確率的更新バイアスの補正
- Authors: Nikhil Nayak, Julia White, Urchade Zaratiana, Kelton Zhang, Henrijs Princis, Dhruv Atreja, Henry Fawcett, Matthew Thomas, George Hurn-Maloney, Ash Lewis,
- Abstract要約: 導入とプレコンディショナーは、通常同じミニバッチから推定されることを示す。
プレコンディショナー推定が偏りのない場合でも、逆根や逆根は一般に非線形であるため偏りがある。
両効果に対処する単一バッチバイアス補正フレームワークを提案する。
- 参考スコア(独自算出の注目度): 6.018167862639113
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Preconditioned optimizers are central to language model training, but their stochastic update rules are usually treated as direct approximations to population preconditioned descent. We show that this view misses two finite-sample biases. First, the gradient and preconditioner are typically estimated from the same minibatch, introducing gradient--preconditioner coupling bias. Second, even when the preconditioner estimate is unbiased, its inverse or inverse-root is generally biased because inversion is nonlinear. We propose a single-batch bias-correction framework that addresses both effects: cross-fitted preconditioning estimates the numerator and preconditioner from independent microbatch groups, while variance-corrected inversion uses microbatch variability to subtract the leading delta-method bias term. The framework applies to diagonal moment, diagonal curvature, and matrix preconditioning methods, instantiated in AdamW, Sophia, and Shampoo. Bias correction reduces held-out pretraining loss on Qwen2.5-0.5B by $0.15$, $0.07$, and $0.11$ nats, respectively; the effects on mixed-quality pretraining and downstream instruction tuning are consistently neutral-to-positive. Together, these results establish bias correction as a practical mechanism for reducing finite-sample update bias and improving the performance of preconditioned optimizers.
- Abstract(参考訳): 事前条件付きオプティマイザは言語モデルトレーニングの中心であるが、確率的更新規則は通常、集団事前条件付き降下に対する直接的な近似として扱われる。
この見解は2つの有限サンプルバイアスを欠いていることを示す。
まず、勾配とプレコンディショナーは、通常同じミニバッチから推定され、勾配-プレコンディショナー結合バイアスが生じる。
第二に、プレコンディショナーの推定値が偏りのない場合でも、逆根や逆根は一般に非線型であるため偏りがある。
クロスフィット型プレコンディショニングは、独立マイクロバッチ群から数値とプレコンディショナーを推定する一方、分散補正型インバージョンはマイクロバッチの可変性を用いて、主要なデルタ-メソッドバイアス項を減算する。
この枠組みは、アダムW、ソフィア、シャンプーでインスタンス化された対角モーメント、対角曲率、行列プレコンディショニング法に適用される。
バイアス補正はQwen2.5-0.5Bの事前トレーニング損失をそれぞれ0.15$、$0.07$、$0.11$nats削減する。
これらの結果から, 有限サンプル更新バイアスを低減し, プリコンディショニングオプティマイザの性能を向上させるための実用的なメカニズムとしてバイアス補正が確立された。
関連論文リスト
- Micro-Diffusion Compression - Binary Tree Tweedie Denoising for Online Probability Estimation [0.0]
適応統計モデルにより生成される確率推定を改善するために, マイクロ拡散復調層を導入する。
Midicothは、適応型PPMモデル、長距離マッチングモデル、トレーベースワードモデル、高階コンテキストモデル、マイクロ拡散デノイザの5つの完全オンラインコンポーネントを最終段階として組み合わせている。
論文 参考訳(メタデータ) (2026-03-09T16:59:24Z) - Preconditioned Score and Flow Matching [15.378063594292955]
共分散 $_t$ of $p_t$ が最適化バイアスを支配していることを示す。
我々は、$p_t$の幾何学を再構成する可逆的でラベル条件付きエンプレコンディショニングマップを提案する。
プレコンディショニングは最適下高原を避けることによって、より優れたトレーニングモデルが得られることを示す。
論文 参考訳(メタデータ) (2026-03-02T19:09:15Z) - On the Optimal Construction of Unbiased Gradient Estimators for Zeroth-Order Optimization [57.179679246370114]
既存の手法の潜在的な制限は、ステップサイズが提案されない限り、ほとんどの摂動推定器に固有のバイアスである。
本稿では, 良好な構成を維持しつつ, バイアスを排除した非バイアス勾配スケーリング推定器のファミリーを提案する。
論文 参考訳(メタデータ) (2025-10-22T18:25:43Z) - From Noisy Traces to Stable Gradients: Bias-Variance Optimized Preference Optimization for Aligning Large Reasoning Models [90.45197506653341]
大規模推論モデルは最終回答を生成する前に中間的推論トレースを生成する。
LRMと人間の好みの整合性は、モデルデプロイメントにとって重要な前提条件であり、まだ過小評価されていない。
共通の回避策は1つのサンプル軌道を最適化し、トレースサンプリングからかなり勾配のばらつきをもたらす。
論文 参考訳(メタデータ) (2025-10-06T17:58:01Z) - The Implicit Bias of Batch Normalization in Linear Models and Two-layer
Linear Convolutional Neural Networks [117.93273337740442]
勾配勾配勾配は、exp(-Omega(log2 t))$収束率でトレーニングデータ上の一様マージン分類器に収束することを示す。
また、バッチ正規化はパッチワイドの均一なマージンに対して暗黙の偏りを持つことを示す。
論文 参考訳(メタデータ) (2023-06-20T16:58:00Z) - Ensembling over Classifiers: a Bias-Variance Perspective [13.006468721874372]
Pfau (2013) による偏差分解の拡張の上に構築し, 分類器のアンサンブルの挙動に関する重要な知見を得る。
条件付き推定は必然的に既約誤差を生じさせることを示す。
経験的に、標準的なアンサンブルはバイアスを減少させ、この予期せぬ減少のために、分類器のアンサンブルがうまく機能するかもしれないという仮説を立てる。
論文 参考訳(メタデータ) (2022-06-21T17:46:35Z) - Sample-Efficient Optimisation with Probabilistic Transformer Surrogates [66.98962321504085]
本稿では,ベイズ最適化における最先端確率変換器の適用可能性について検討する。
トレーニング手順と損失定義から生じる2つの欠点を観察し、ブラックボックス最適化のプロキシとして直接デプロイすることを妨げる。
1)非一様分散点を前処理するBO調整トレーニング,2)予測性能を向上させるために最適な定常点をフィルタする新しい近似後正則整定器トレードオフ精度と入力感度を導入する。
論文 参考訳(メタデータ) (2022-05-27T11:13:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。