論文の概要: Loss Landscape Features That Make Adam Stall: Definitions, Estimators, and the Preconditioned Hessian View
- arxiv url: http://arxiv.org/abs/2608.22145v1
- Date: Sun, 23 Aug 2026 00:21:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.636718
- Title: Loss Landscape Features That Make Adam Stall: Definitions, Estimators, and the Preconditioned Hessian View
- Title(参考訳): アダム・ストール(Adam Stall)を損なう景観的特徴 - 定義, 推定, 条件付きヘッセン観-
- Abstract要約: 我々は、完全に調整されたAdamが、不調なロスランドスケープであっても、非常に低い損失に達する可能性があることを示す。
このレポートは、Adamが与えられた損失状況の条件を緩和できるかどうかを判断するのに役立つ測定値を定義します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Across implicit-neural-representation (INR) architectures and analytic benchmarks we observe that a thoroughly tuned Adam (especially its learning rate (lr), e.g. in a hyperparameter sweep from $lr = 0.05$ to $10^{-8}$) can potentially reach a very low loss even on ill-conditioned loss landscape or converge at a plateau far above the loss attained by second-order methods. This report defines the measured metrics that help determine if Adam can mitigate the ill-conditioning on a given loss landscape. We provide the indicators by which each outcome is determined, that are: the condition number of the Hessian and of the Adam-preconditioned Hessian $D^{-1/2}HD^{-1/2}$ (with the derivation from Adam's update rule), the diagonal mass $ρ$ that distinguishes axis-aligned from cross-coupled ill-conditioning, the negative spectral mass estimated by stochastic Lanczos quadrature, and the gradient energy fractions over curvature bands, including the flat fraction that indicates the Adam stall. A worked out $2\times 2$ example and an illustration show the reasons why a diagonal preconditioning by Adam can remove axis-aligned ill-conditioning by rescaling and why it cannot do the same if the ill-conditioning is cross coupled. In addition, we present a case study of FINER image fitting architecture that goes over the whole loss landscape analysis framework: the fitting architecture description, reasons due to which its landscape stalls Adam at saddles, the measured PSNR values through our tuned baselines to the $120$--$134$\,dB results of the blockwise second order methods, the error maps behind those numbers, and description of the benefits such image fitting accuracy gives in practice.
- Abstract(参考訳): 暗黙的ニューラル表現(INR)アーキテクチャと分析ベンチマークにより、完全に調整されたAdam(特に学習率(lr)egが、$lr = 0.05$から10^{-8}$)の超パラメータスイープで、不調なロスランドスケープでも非常に低損失に達する可能性があるか、2階法で得られた損失よりもはるかに高い台地で収束する可能性がある。
このレポートは、Adamが与えられた損失状況の条件を緩和できるかどうかを判断するのに役立つ測定値を定義します。
我々は,各結果が決定される指標として,ヘシアンおよびアダムプレコンディション付きヘシアン$D^{-1/2}HD^{-1/2}$(アダムの更新規則からの導出)の条件数,対角質量$ρ$(Adamの更新規則からの導出),交叉結合型条件と整列した軸を区別する対角質量$ρ$(Adam's update rule),確率的ランツォス二次によって推定される負のスペクトル質量(Raczos quadrature),および曲率帯上の勾配エネルギー分画(Adam stall)を示す平坦分画を含む。
A work out $2\times 2$ example and an illustration shows that why a diagonal preconditioning can remove axis-aligned ill-conditioning by rescaling and why it can do the same as the ill-conditioning is cross coupled。
さらに、FINER画像適合アーキテクチャのケーススタディとして、画像適合アーキテクチャの説明、サドルでランドスケープが停滞する理由、調整されたベースラインを通したPSNR値からブロックワイド2次法の1,200$--$134$\,dB結果、これらの数値の裏にある誤差マップ、実際の画像適合精度がもたらす利点について述べる。
関連論文リスト
- Coarsening Latent-Class Probabilities: Directional Distortion and Coverage Loss [1.14219428942199]
結果が、観測されていないクラスメンバーシップの確率ベクトル上でますます後退していることが示される。
定数係数構造平均と条件キャリブレーションの下では、観測データ問題は確率ベクトル上の結果の部分的に線形回帰である。
粗い場合、プラグイン推定器は$mathcalA$に収束し、粗い演算子は$mathcalA$と$u$の廃信号を満たす。
論文 参考訳(メタデータ) (2026-08-12T08:26:33Z) - Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability [51.56484100374058]
機械論的解釈可能性プリミティブに対する最初の識別可能性定理を証明した。
スペクトルは、正当性分解ではなく、記述されたエラーバーを持つ識別可能なモデル固有の指紋である。
論文 参考訳(メタデータ) (2026-08-10T19:42:01Z) - On the Superlinear Relationship between SGD Noise Covariance and Loss Landscape Curvature [1.6773271875801752]
グラディエントDescent (SGD) は、損失ランドスケープの局所曲率と相関する異方性雑音を導入し、平坦なミニマに対して最適化を行う。
この仮定は、ディープニューラルネットワークでは通常違反される制約条件下でのみ成立することを示す。
データセット、アーキテクチャ、損失関数にわたる実験は、これらの境界を検証し、ディープラーニングにおけるノイズ-曲率関係を統一的に評価する。
論文 参考訳(メタデータ) (2026-02-05T12:35:13Z) - Implicit Bias of Per-sample Adam on Separable Data: Departure from the Full-batch Regime [26.492222550365735]
アダムは深層学習の事実上のデファクトであるが、理論的な理解は限られている。
線形分離可能なデータに対するロジスティック回帰のために, インクリメンタルAdamの暗黙バイアス(ステップ毎に1つのサンプルを用いて)について検討した。
我々は、Adam が $ell_infty$-max-margin に確実に収束する構造化データセットのクラスを構築する。
論文 参考訳(メタデータ) (2025-10-30T09:41:33Z) - Simple Convergence Proof of Adam From a Sign-like Descent Perspective [58.89890024903816]
我々は、Adamが以前の$cal O(fracln TTs14)$よりも$cal O(frac1Ts14)$の最適なレートを達成することを示す。
我々の理論分析は、収束を保証する重要な要因として運動量の役割に関する新たな洞察を提供する。
論文 参考訳(メタデータ) (2025-07-08T13:19:26Z) - Adaptive Preconditioners Trigger Loss Spikes in Adam [13.978861012576399]
Adamプリコンディショナーを使用すると、さまざまなアーキテクチャとスケールのニューラルネットワークを横断するトレーニング中に、損失のスパイクが一般的に発生する。
これまでの説明では、これらの現象は損失景観の低損失化特性に起因している。
第二次モーメント推定よりも二乗がかなり小さくなり、後者が$beta$-exponential崩壊する臨界状態を特定する。
この不安定さは勾配と最大固有方向とのアライメントをもたらし、勾配方向の曲率が2/eta$を超えると正確に損失スパイクが発生する。
論文 参考訳(メタデータ) (2025-06-05T09:31:41Z) - Towards Quantifying the Preconditioning Effect of Adam [36.91196231006288]
二次関数に対するアダムの事前条件効果を詳細に解析する。
我々は、アダムがヘッセンの条件数への依存を緩和できる程度に定量化する。
以上の結果から, 十分に非対角ヘッセン系では, アダムは勾配降下よりも悪くなる可能性が示唆された。
論文 参考訳(メタデータ) (2024-02-11T06:21:18Z) - Causal Bandits for Linear Structural Equation Models [58.2875460517691]
本稿では,因果図形モデルにおける最適な介入順序を設計する問題について検討する。
グラフの構造は知られており、ノードは$N$である。
頻繁性(UCBベース)とベイズ的設定に2つのアルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-08-26T16:21:31Z) - Provable Adaptivity of Adam under Non-uniform Smoothness [79.25087082434975]
アダムは急速に収束するため、実用的な用途で広く採用されている。
アダムの既存の収束解析は、有界な滑らかさの仮定に依存する。
本稿では,ランダムにリシャッフルされたAdamの学習率の低下に伴う収束について検討する。
論文 参考訳(メタデータ) (2022-08-21T14:57:47Z) - Understanding AdamW through Proximal Methods and Scale-Freeness [57.47324825501137]
Adam は $ell$ regularizer Adam-$ell$ の一般化である。
AdamWは、Adam-$ell$の更新ルールからAdam-$ell$の勾配を分離する。
我々はAdamWがAdam-$ell$よりも有利であることを示し、ネットワークの勾配が複数のスケールを示すことを期待する度合いを示す。
論文 参考訳(メタデータ) (2022-01-31T21:00:55Z) - Lattice partition recovery with dyadic CART [79.96359947166592]
我々は、$d$次元格子上の加法ガウス雑音によって破損したピースワイド定値信号について検討する。
この形式のデータは、多くのアプリケーションで自然に発生し、統計処理や信号処理の文献において、信号の検出やテスト、ノイズの除去、推定といったタスクが広く研究されている。
本稿では,未知の信号の一貫性領域によって誘導される格子の分割を推定する,分割回復の問題について考察する。
我々は、DCARTベースの手順が、下位分割を$sigma2 k*の順序で一貫して推定することを証明した。
論文 参考訳(メタデータ) (2021-05-27T23:41:01Z) - Adam$^+$: A Stochastic Method with Adaptive Variance Reduction [56.051001950733315]
Adamはディープラーニングアプリケーションに広く使われている最適化手法である。
我々はAdam$+$(Adam-plusと発音する)という新しい方法を提案する。
画像分類,言語モデリング,自動音声認識など,さまざまなディープラーニングタスクに関する実証研究により,Adam$+$がAdamを著しく上回ることを示した。
論文 参考訳(メタデータ) (2020-11-24T09:28:53Z) - The Generalized Lasso with Nonlinear Observations and Generative Priors [63.541900026673055]
我々は、幅広い測定モデルで満たされるガウス下測度を仮定する。
この結果から, 局所埋込特性を仮定して, 均一回復保証まで拡張できることが示唆された。
論文 参考訳(メタデータ) (2020-06-22T16:43:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。