論文の概要: Learning in Curved Weight Space:Exponential-Linear Weight Reparameterization for Improved Optimization
- arxiv url: http://arxiv.org/abs/2607.09967v2
- Date: Tue, 14 Jul 2026 07:41:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.52415
- Title: Learning in Curved Weight Space:Exponential-Linear Weight Reparameterization for Improved Optimization
- Title(参考訳): 曲線重み空間における学習:改良された最適化のための指数線形重み再パラメータ化
- Authors: Ethan Smith,
- Abstract要約: textbfmethodは、符号認識の対称指数経路とアイデンティティのような線形経路を結合する。
OpenWebTextで9つの幅$times$depth設定でトランスフォーマーをトレーニングします。
shortmethodは1.32-1.49$timesで一致した検証損失に到達した。
- 参考スコア(独自算出の注目度): 1.8613536568358355
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many neural networks operations have a multiplicative nature rather than additive: halving or doubling a norm are analogous relatively but require unequal optimization distances when taking linear steps. Adaptive optimizers such as Adam normalize updates per coordinate, but update steps remain additive; weights with very different magnitudes receive similarly sized absolute changes, producing very different relative perturbations. We introduce \textbf{\method} (\textbf{\methodshort}), a weight reparameterization for neural networks that combines a sign-aware symmetric-exponential pathway with an identity-like linear pathway. The symmetric-exponential pathway is near-linear for small raw weights but increasingly curved at larger magnitudes. Additive updates in logarithmic space map to magnitude-proportional changes in effective weight space. The linear pathway provides a direct route through the transform that we hypothesize stabilizes optimization, while learnable scale, curvature, and offset parameters control balance between pathways and the curvature of the exponential pathway. These components create a curved parameter-space geometry that empirically improves speed of loss descent over standard linear parameterization. We also identify a useful \emph{mismatched initialization}: raw weights are chosen so a symmetric version of the transform matches Xavier statistics, but training uses an asymmetric forward transform that leaves positive weights at full strength while making negative weights smaller in magnitude; in small-model ablations, this improves early optimization and may act as a form of symmetry breaking. We train transformers on OpenWebText over nine width$\times$depth configurations, \methodshort reaches matched validation loss in 1.32--1.49$\times$ fewer training steps, with the largest widths seeing the biggest gains.
- Abstract(参考訳): 多くのニューラルネットワーク演算は加法ではなく乗法的な性質を持つ:ノルムを半分にするか倍にするかは、相対的に類似しているが、線形ステップを取る際には不等な最適化距離を必要とする。
アダムのような適応オプティマイザは座標ごとに更新を正規化するが、更新ステップは加法的のままであり、非常に異なる大きさの重みは同様の大きさの絶対的な変化を受け、非常に異なる相対摂動を生み出す。
本稿では,記号認識型対称指数経路と同一性類似の線形経路を組み合わせたニューラルネットワークの重み再パラメータ化である‘textbf{\method}(\textbf{\methodshort})を紹介する。
対称指数経路は小さな生重量に対してほぼ直線的であるが、より大きな大きさで曲がる傾向にある。
対数空間マップの加法的更新と有効重み空間の等間隔変化
線形経路は、最適化を仮定する変換を通して直接経路を提供するが、学習可能なスケール、曲率、オフセットパラメータは、指数経路の曲率と経路間のバランスを制御する。
これらの成分は、標準線形パラメータ化よりも損失降下の速度を経験的に改善する曲線パラメータ空間幾何学を作成する。
生の重みはXavier統計に一致する対称版として選択されるが、トレーニングでは正の重みを最大化しながら負の重みを小さくする非対称の前方変換を用いる。
OpenWebTextのトランスフォーマーを9つの幅$\times$depth設定でトレーニングし、\methodshortは1.32--1.49$\times$より少ないトレーニングステップで一致した検証損失に達した。
関連論文リスト
- Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors [110.10775872372047]
EmphMagnitude-Direction-Direction (MD) Decouplingを提案する。
これは、各重量をハイパースフィア上の固定ノルム方向に分解し、学習可能な1ローとカラムごとのマグニチュードゲインを、別々の学習速度で更新する。
アダムとムーンの双方で、MD Decouplingはよく調整されたベースラインを改善し、モデルの幅を調整せずに最適なLRを転送し、大規模なMixture-of-Expertsモデルのスケールに役立っている。
論文 参考訳(メタデータ) (2026-06-24T15:40:26Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - Rao-Blackwell Gradient Estimators for Equivariant Denoising Diffusion [55.95767828747407]
分子やタンパク質の生成のようなドメインでは、物理系はモデルにとって重要な固有の対称性を示す。
学習のばらつきを低減し、確率的に低い分散勾配推定器を提供するフレームワークを提案する。
また,軌道拡散法(Orbit Diffusion)と呼ばれる手法を用いて,損失とサンプリングの手順を取り入れた推定器の実用的実装を提案する。
論文 参考訳(メタデータ) (2025-02-14T03:26:57Z) - Scalable Stochastic Gradient Riemannian Langevin Dynamics in Non-Diagonal Metrics [3.8811062755861956]
本稿では,2つの非対角的指標について述べる。
完全接続型ニューラルネットワーク(NN)と疎結合型プリエントと、相関したプリエントを持つ畳み込みNNでは、これらのメトリクスを用いることで改善が期待できることを示す。
論文 参考訳(メタデータ) (2023-03-09T08:20:28Z) - Error-Correcting Neural Networks for Two-Dimensional Curvature
Computation in the Level-Set Method [0.0]
本稿では,2次元曲率をレベルセット法で近似するための誤差ニューラルモデルに基づく手法を提案する。
我々の主な貢献は、需要に応じて機械学習操作を可能にする数値スキームに依存する、再設計されたハイブリッド・ソルバである。
論文 参考訳(メタデータ) (2022-01-22T05:14:40Z) - Learning Augmentation Distributions using Transformed Risk Minimization [47.236227685707526]
本稿では,古典的リスク最小化の拡張として,新しいemphTransformed Risk Minimization(TRM)フレームワークを提案する。
重要な応用として、与えられたクラスの予測器による分類性能を改善するために、学習強化に焦点を当てる。
論文 参考訳(メタデータ) (2021-11-16T02:07:20Z) - Efficient Neural Network Training via Forward and Backward Propagation
Sparsification [26.301103403328312]
本研究では, 完全スパース前方・後方パスを用いた効率的なスパーストレーニング手法を提案する。
私たちのアルゴリズムは、トレーニングプロセスを最大で桁違いに高速化する上で、はるかに効果的です。
論文 参考訳(メタデータ) (2021-11-10T13:49:47Z) - Optimizing Mode Connectivity via Neuron Alignment [84.26606622400423]
経験的に、損失関数の局所ミニマは、損失がほぼ一定であるようなモデル空間の学習曲線で接続することができる。
本稿では,ネットワークの重み変化を考慮し,対称性がランドスケープ・コネクティビティに与える影響を明らかにするための,より一般的な枠組みを提案する。
論文 参考訳(メタデータ) (2020-09-05T02:25:23Z) - Balancing Rates and Variance via Adaptive Batch-Size for Stochastic
Optimization Problems [120.21685755278509]
本研究は,ステップサイズの減衰が正確な収束に必要であるという事実と,一定のステップサイズがエラーまでの時間でより速く学習するという事実のバランスをとることを目的とする。
ステップサイズのミニバッチを最初から修正するのではなく,パラメータを適応的に進化させることを提案する。
論文 参考訳(メタデータ) (2020-07-02T16:02:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。