論文の概要: Sven: Singular Value Descent as a Computationally Efficient Natural Gradient Method
- arxiv url: http://arxiv.org/abs/2604.01279v1
- Date: Wed, 01 Apr 2026 18:00:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-03 14:21:09.665529
- Title: Sven: Singular Value Descent as a Computationally Efficient Natural Gradient Method
- Title(参考訳): Sven: 計算効率の良い自然勾配法としての特異値退化
- Authors: Samuel Bright-Thonney, Thomas R. Harvey, Andre Lukas, Jesse Thaler,
- Abstract要約: Svenは、損失関数を個々のデータポイント上の和に自然分解するニューラルネットワークの最適化アルゴリズムである。
我々は,Svenを過度にパラメータ化された状態に一般化した自然な勾配法として理解することができることを示す。
SvenはAdamを含む標準的な一階法よりもはるかに優れており、より速く収束し、最終的な損失を下げている。
- 参考スコア(独自算出の注目度): 0.5833117322405447
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Sven (Singular Value dEsceNt), a new optimization algorithm for neural networks that exploits the natural decomposition of loss functions into a sum over individual data points, rather than reducing the full loss to a single scalar before computing a parameter update. Sven treats each data point's residual as a separate condition to be satisfied simultaneously, using the Moore-Penrose pseudoinverse of the loss Jacobian to find the minimum-norm parameter update that best satisfies all conditions at once. In practice, this pseudoinverse is approximated via a truncated singular value decomposition, retaining only the $k$ most significant directions and incurring a computational overhead of only a factor of $k$ relative to stochastic gradient descent. This is in comparison to traditional natural gradient methods, which scale as the square of the number of parameters. We show that Sven can be understood as a natural gradient method generalized to the over-parametrized regime, recovering natural gradient descent in the under-parametrized limit. On regression tasks, Sven significantly outperforms standard first-order methods including Adam, converging faster and to a lower final loss, while remaining competitive with LBFGS at a fraction of the wall-time cost. We discuss the primary challenge to scaling, namely memory overhead, and propose mitigation strategies. Beyond standard machine learning benchmarks, we anticipate that Sven will find natural application in scientific computing settings where custom loss functions decompose into several conditions.
- Abstract(参考訳): Sven(Singular Value dEsceNt)は、ニューラルネットワークの新しい最適化アルゴリズムで、パラメータ更新を計算する前に単一のスカラーに全損失を減らすのではなく、損失関数を個々のデータポイント上の和に自然に分解する。
スヴェンは各データポイントの残差を、損失ヤコビアンのムーア・ペンローズ擬似逆数を用いて、同時に満たされる別の条件として扱う。
実際には、この擬逆は、切り詰められた特異値分解によって近似され、最も重要な方向の$k$だけを保持し、確率勾配勾配に対する$k$のみの計算オーバーヘッドを生じる。
これは、パラメータ数の平方としてスケールする伝統的な自然勾配法と比較される。
我々は,Svenを過度なパラメータ化状態に一般化した自然勾配法として理解することができ,過度なパラメータ化限界における自然勾配降下を回復させることを示した。
回帰タスクでは、SvenはAdamを含む標準的な一階法よりも優れており、より速く収束し、最終損失は低く、LBFGSとの競争力はウォールタイムコストのごく一部にとどまっている。
本稿では、メモリオーバーヘッドのスケーリングにおける主な課題について論じ、緩和戦略を提案する。
標準的な機械学習ベンチマーク以外にも、Svenは、カスタム損失関数がいくつかの条件に分解される科学計算環境において、自然な応用が期待できる。
関連論文リスト
- Stein-Rule Shrinkage for Stochastic Gradient Estimation in High Dimensions [0.0]
勾配法は大規模学習の中心であるが、古典的決定理論が高次元において許容できないことを示す非バイアス推定器としてミニバッチ勾配を扱う。
本稿では, 歴史運動量から導かれる安定な推定器に対して, ミニバッチ勾配を適応的に調整する勾配推定器を構築する。
CIFAR10とCIFAR100の実験的評価は、大型バッチ方式におけるAdamよりも一貫した改善を示した。
論文 参考訳(メタデータ) (2026-02-02T08:01:13Z) - Convex Relaxations of ReLU Neural Networks Approximate Global Optima in Polynomial Time [45.72323731094864]
本稿では,2層ReLULUネットワーク間における重み減衰と凸緩和の最適性ギャップについて検討する。
私たちの研究は、なぜローカルメソッドがうまく機能するのかを理解することに新たな光を当てています。
論文 参考訳(メタデータ) (2024-02-06T01:29:35Z) - Bridging Discrete and Backpropagation: Straight-Through and Beyond [62.46558842476455]
本稿では,離散潜在変数の生成に関わるパラメータの勾配を近似する新しい手法を提案する。
本稿では,Hunの手法とODEを解くための2次数値法を統合することで,2次精度を実現するReinMaxを提案する。
論文 参考訳(メタデータ) (2023-04-17T20:59:49Z) - Stochastic regularized majorization-minimization with weakly convex and
multi-convex surrogates [0.0]
提案アルゴリズムの最初の最適性ギャップは,非テンソル依存データ設定下での様々な手法の期待損失率で減衰することを示す。
非テンション依存データ設定の下で, 各種手法の収束点を求める。
論文 参考訳(メタデータ) (2022-01-05T15:17:35Z) - Comparing Classes of Estimators: When does Gradient Descent Beat Ridge
Regression in Linear Models? [46.01087792062936]
クラス内のEmphbestメソッドの相対的性能による推定器のクラスの比較を行う。
これにより、学習アルゴリズムのチューニング感度を厳格に定量化できます。
論文 参考訳(メタデータ) (2021-08-26T16:01:37Z) - Combining resampling and reweighting for faithful stochastic
optimization [1.52292571922932]
損失関数が複数の項の和であるとき、一般的な方法は勾配降下である。
損失関数における複数の項のリプシッツ定数の差は、異なる最小値における異なる分散への勾配降下を引き起こすことを示す。
論文 参考訳(メタデータ) (2021-05-31T04:21:25Z) - MLE-guided parameter search for task loss minimization in neural
sequence modeling [83.83249536279239]
ニューラル自己回帰シーケンスモデルは、さまざまな自然言語処理(NLP)タスクのシーケンスを生成するために使用される。
本稿では,現在のパラメータとその周辺における乱探索の混合である更新方向の分布から,最大至適勾配の分布をサンプリングする,最大至適誘導パラメータ探索(MGS)を提案する。
以上の結果から,MGS は,機械翻訳における最小リスクトレーニングに比べて,繰り返しや非終端の大幅な削減を図り,シーケンスレベルの損失を最適化できることが示唆された。
論文 参考訳(メタデータ) (2020-06-04T22:21:22Z) - Carath\'eodory Sampling for Stochastic Gradient Descent [79.55586575988292]
本稿では,Tchakaloff と Carath'eodory の古典的な結果から着想を得た手法を提案する。
我々は、測定値の低減を行う降下ステップを適応的に選択する。
これをBlock Coordinate Descentと組み合わせることで、測定の削減を極めて安価に行えるようにします。
論文 参考訳(メタデータ) (2020-06-02T17:52:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。