論文の概要: Correction of Decoupled Weight Decay
- arxiv url: http://arxiv.org/abs/2512.08217v1
- Date: Tue, 09 Dec 2025 03:52:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-10 22:28:07.799058
- Title: Correction of Decoupled Weight Decay
- Title(参考訳): 脱カップリング重量減少の補正
- Abstract要約: 我々は、分離重み崩壊$propto 2$は、更新が定常状態から独立になるという単純な仮定に基づいて、安定した重みノルムをもたらすと主張している。
分離したウェイト崩壊$propto 2$は、安定なウェイトと勾配ノルムをもたらし、トレーニングダイナミクスをよりよく制御し、モデル性能を向上させることができることを示す。
- 参考スコア(独自算出の注目度): 2.538209532048867
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Decoupled weight decay, solely responsible for the performance advantage of AdamW over Adam, has long been set to proportional to learning rate $γ$ without questioning. Some researchers have recently challenged such assumption and argued that decoupled weight decay should be set $\propto γ^2$ instead based on orthogonality arguments at steady state. To the contrary, we find that eliminating the contribution of the perpendicular component of the update to the weight norm leads to little change to the training dynamics. Instead, we derive that decoupled weight decay $\propto γ^2$ results in stable weight norm based on the simple assumption that updates become independent of the weights at steady state, regardless of the nature of the optimizer. Based on the same assumption, we derive and empirically verify that the Total Update Contribution (TUC) of a minibatch under the Scion optimizer is better characterized by the momentum-dependent effective learning rate whose optimal value transfers and we show that decoupled weight decay $\propto γ^2$ leads to stable weight and gradient norms and allows us to better control the training dynamics and improve the model performance.
- Abstract(参考訳): アダムよりもアダムWの性能上の優位性にのみ責任を負う非結合重み崩壊は、疑わしいことなく学習率に比例して$γ$と設定されている。
一部の研究者はそのような仮定に挑戦し、代わりに定常状態の直交論に基づいて分離重み崩壊を$\propto γ^2$とするべきだと主張した。
それとは対照的に、更新の垂直成分のウェイトノルムへの寄与をなくすことで、トレーニングのダイナミクスにはほとんど変化がないことがわかった。
代わりに、分離されたウェイト崩壊$\propto γ^2$は、オプティマイザの性質に関係なく、更新が定常状態のウェイトから独立になるという単純な仮定に基づいて、安定したウェイトノルムをもたらす。
同じ仮定に基づいて、シオンオプティマイザの下でのミニバッチのトータル更新寄与(TUC)が、最適な値が転送される運動量依存の効果的な学習速度によりより優れていることを実証し、デカップリングウェイト崩壊$\propto γ^2$が安定なウェイトと勾配ノルムにつながり、トレーニングのダイナミクスをよりよく制御し、モデル性能を向上させることができることを示す。
関連論文リスト
- Scale Weight Decay and Train Better [0.0]
本稿では,ピーク学習率$/_max$のごく一部で重量減衰を拡大することを提案する。
このことは、勾配降下と非ユークリッドミューオンの両方に対して、対応する非正規化手法の定常性を保証することを証明している。
定常状態解析を用いて、標準ウェイト崩壊下では、トレーニングが進むにつれて、ウェイトノルムが着実に低下するのに対し、スケールされたウェイト崩壊では、ほぼ一定値に落ち着く理由を説明する。
論文 参考訳(メタデータ) (2026-07-26T17:55:40Z) - Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors [110.10775872372047]
EmphMagnitude-Direction-Direction (MD) Decouplingを提案する。
これは、各重量をハイパースフィア上の固定ノルム方向に分解し、学習可能な1ローとカラムごとのマグニチュードゲインを、別々の学習速度で更新する。
アダムとムーンの双方で、MD Decouplingはよく調整されたベースラインを改善し、モデルの幅を調整せずに最適なLRを転送し、大規模なMixture-of-Expertsモデルのスケールに役立っている。
論文 参考訳(メタデータ) (2026-06-24T15:40:26Z) - Fantastic Pretraining Optimizers and Where to Find Them II: Hyperball Optimization [67.29294986811314]
Muon のようなマトリックスベースは言語モデルの事前学習を著しく高速化するが、AdamW に対する利得は標準の一定重量減衰を用いると縮小する。
この問題に対処するシンプルなラッパーであるHyperballを提案する。
Qwen3スタイルモデルでは、最大1.2Bパラメータで、Muon Hyperballはウェイト崩壊ベースラインよりも20-30%のトークン等価なスピードアップを達成する。
論文 参考訳(メタデータ) (2026-06-15T16:09:02Z) - Weibull Weight-Scale Parameter Evolution under AdamW Training Dynamics [0.0]
我々は、Weibullの重み付けパラメータ $(t)$ が成長し、オーバーシュートし、AdamWトレーニング中にリラックスする理由を研究する。
飽和に近い、アライメントと崩壊のアプローチバランスは、重量スケールの成長から緩和への移行を説明する。
論文 参考訳(メタデータ) (2026-06-11T03:50:14Z) - Bug or Feature$^2$: Weight Drift, Activation Sparsity and Spikes [53.726365933748134]
標準損失と正に偏りのある活性化関数の相互作用によって引き起こされる負の重みのドリフトを解析する。
79の構成にまたがるスパシティ・精度のトレードオフを特徴付けるとともに、$sim$70%のアクティベーション・スパシティよりも高い精度の崖を識別する。
論文 参考訳(メタデータ) (2026-05-17T21:29:20Z) - Reinforcement Learning from Multi-Source Imperfect Preferences: Best-of-Both-Regimes Regret [71.69884486156359]
我々は, 累積的不完全化予算を用いて, エンフルティソースの不完全性選好からエピソードRLを考察した。
我々は,最良な登録行動を示す,後悔$tildeO(sqrtK/M+)$の統一アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-20T19:34:53Z) - AdamHD: Decoupled Huber Decay Regularization for Language Model Pre-Training [0.2578242050187029]
AdamHuberDecayはAdamWのドロップイン代替品で、$ell$ペナルティを分離したスムーズなHuberレギュレータで置き換える。
GPT-2 と GPT-3 の事前学習実験により,AdamHuberDecay は壁面時間で 10-15% の速度で収束することが示された。
論文 参考訳(メタデータ) (2025-11-18T18:08:20Z) - Rethinking Weight Decay for Robust Fine-Tuning of Foundation Models [27.847140934456288]
本稿では,新しい重み劣化手法Selective Projection Decay (SPD)を提案する。
SPDは特定の層に強いペナルティを課し、他の層は自由に変更できる。
SPDを搭載した場合、Adamはベンチマーク上でより優れた分散ロバスト性とアウト・オブ・ディストリビュート性能を提供する。
論文 参考訳(メタデータ) (2024-11-03T23:36:53Z) - Large Continual Instruction Assistant [59.585544987096974]
CIT(Continuous Instruction Tuning)は、大規模モデルにデータによる人間の意図データに従うよう指示するために用いられる。
既存の更新勾配は、CITプロセス中に前のデータセットのパフォーマンスを著しく損なうことになる。
本稿では,この課題に対処する汎用的な連続的命令チューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-08T11:24:59Z) - Generalized Balancing Weights via Deep Neural Networks [0.0]
観測データから因果効果を推定することは、多くの領域において中心的な問題である。
離散的および連続的な介入の任意の混合による因果効果を推定するために、一般化バランスウェイト、ニューラルバランスウェイト(NBW)を提案する。
論文 参考訳(メタデータ) (2022-11-14T17:03:56Z) - Improving Robustness with Adaptive Weight Decay [8.096469295357737]
本稿では,各トレーニング中の重み減衰に対するハイパーパラメータ反復を自動調整する適応的重み減衰法を提案する。
この単純な修正は、ロバスト性に大きな改善をもたらす可能性があることを示す。
この手法には、学習率に対する感度の低下や重量ノルムの低下など、他の望ましい性質がある。
論文 参考訳(メタデータ) (2022-09-30T21:13:00Z) - Learning to Re-weight Examples with Optimal Transport for Imbalanced
Classification [74.62203971625173]
不均衡データは、ディープラーニングに基づく分類モデルに課題をもたらす。
不均衡なデータを扱うための最も広く使われているアプローチの1つは、再重み付けである。
本稿では,分布の観点からの最適輸送(OT)に基づく新しい再重み付け手法を提案する。
論文 参考訳(メタデータ) (2022-08-05T01:23:54Z) - Long-Tailed Recognition via Weight Balancing [66.03068252811993]
ナイーブトレーニングは、より高い精度で一般的なクラスに偏ったモデルを生成する。
重みのバランス、L2-正規化、重みの崩壊、MaxNormの3つの手法について検討する。
提案手法は,5つの標準ベンチマークにおける最先端の精度を実現する。
論文 参考訳(メタデータ) (2022-03-27T03:26:31Z) - On the Overlooked Pitfalls of Weight Decay and How to Mitigate Them: A Gradient-Norm Perspective [90.39123717733334]
そこで本研究では,Shduled Weight Decay (SWD) 法と呼ばれる,減量のための最初の実用的なスケジューラを提案する。
我々の実験は、SWDが実際に大きな勾配ノルムを緩和し、適応モーメント推定(Adam)の従来の定重崩壊戦略を著しく上回っていることも裏付けている。
論文 参考訳(メタデータ) (2020-11-23T00:39:49Z) - Optimal Variance Control of the Score Function Gradient Estimator for
Importance Weighted Bounds [12.75471887147565]
本稿では,重要重み付き変動境界(IWAE)のスコア関数勾配推定器の新しい結果を紹介する。
我々は、大きな$K$の極限において、推定子のSignal-to-Noise比(SNR)が$sqrtK$として大きくなるように制御変数を選択することができることを証明した。
論文 参考訳(メタデータ) (2020-08-05T08:41:46Z) - AdamP: Slowing Down the Slowdown for Momentum Optimizers on
Scale-invariant Weights [53.8489656709356]
正規化技術は現代の深層学習の恩恵である。
しかし、運動量を導入することで、スケール不変の重みに対する効果的なステップサイズが急速に小さくなることがしばしば見過ごされる。
本稿では,この2つの材料の組み合わせが,有効ステップサイズと準最適モデル性能の早期劣化につながることを検証した。
論文 参考訳(メタデータ) (2020-06-15T08:35:15Z) - Understanding the Difficulty of Training Transformers [120.99980924577787]
バランスの取れない勾配がトレーニングの不安定性の根本原因ではないことを示す。
我々は,早期段階のトレーニングを安定させ,後期段階においてその潜在能力を最大限に活用するためのアドミンを提案する。
論文 参考訳(メタデータ) (2020-04-17T13:59:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。