論文の概要: Explaining f-Divergence-Based Regularization via Local Curvature and Sharpness-Aware Minimization
- arxiv url: http://arxiv.org/abs/2609.09367v1
- Date: Tue, 08 Sep 2026 19:01:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.792063
- Title: Explaining f-Divergence-Based Regularization via Local Curvature and Sharpness-Aware Minimization
- Title(参考訳): f-divergence-based regularization by Local Curvature and Sharpness-Aware Minimization
- Authors: Nour Jamoussi, Marios Kountouris,
- Abstract要約: 多様性に基づく正規化とシャープネス認識最小化(SAM)は、ディープラーニングの一般化を改善するための2つの重要なアプローチである。
この2つの手法はパラメータ空間の摂動の下で局所的に一致していることを示す。
また、分岐に基づく正規化は入力の変換によって定義されることを示す。
- 参考スコア(独自算出の注目度): 7.792020418343022
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Divergence-based regularization and Sharpness-Aware Minimization (SAM) are two prominent approaches for improving generalization in deep learning, both motivated by robustness to perturbations. However, their relationship has remained largely unexplored. Building on classical second-order expansions of $f$-divergences, we show that the two methods are locally consistent under parameter-space perturbations: both induce curvature-sensitive penalties, with divergence regularization yielding a Fisher-weighted quadratic form and SAM penalizing sharpness through the dominant Hessian eigenvalue. For negative log-likelihood objectives with exponential-family output distributions, this correspondence becomes especially transparent, since the Fisher and Gauss-Newton matrices coincide. We further show that the same local geometric perspective extends to input-space perturbations, where divergence-based regularization is defined through transformations of the input. In this setting, the regularizer induces a pullback quadratic form on the input space, providing a more general perturbation framework than standard SAM while preserving the same local sensitivity interpretation. To validate the analysis empirically, we use the asymmetric $α$-skew Jensen-Shannon divergence (JSD) family as a controlled testbed. Its local curvature coefficient scales as $α(1-α)$ and is maximized at the symmetric point $α=\tfrac12$, which recovers the standard JSD. Loss-landscape visualizations in the input-perturbation regime show that stronger induced curvature penalization is associated with flatter local minima. Experiments on four benchmark datasets further demonstrate that both accuracy and negative log-likelihood are consistently best near this regime of maximal curvature penalization.
- Abstract(参考訳): 多様性に基づく正規化とシャープネス・アウェア・最小化(SAM)は、深層学習における一般化を改善するための2つの顕著なアプローチである。
しかし、その関係は未解明のままである。
古典的な$f$-divergencesの2階展開に基づいて、2つの手法がパラメータ空間の摂動の下で局所的に整合していることを示し、どちらも曲率に敏感なペナルティを誘導し、分岐正則化はフィッシャー重み付き二次形式となり、SAMは支配的ヘッセン固有値を通じて鋭さを罰する。
指数出力分布を持つ負の対数様の目的に対して、フィッシャー行列とガウスニュートン行列が一致するため、この対応は特に透明になる。
さらに、同じ局所幾何学的視点が入力空間の摂動に拡張され、入力の変換によって発散に基づく正規化が定義されることを示す。
この設定では、正規化器は入力空間上のプルバック二次形式を誘導し、同じ局所感度解釈を保ちながら、標準SAMよりもより一般的な摂動フレームワークを提供する。
この分析を実証的に検証するために、非対称な$α$-skew Jensen-Shannon divergence (JSD) ファミリーを制御テストベッドとして使用する。
その局所曲率係数は$α(1-α)$で、標準JSDを回復する対称点$α=\tfrac12$で最大化される。
入力摂動系におけるロスランドスケープの可視化は、より強い誘起曲率のペナル化が、より平坦な局所的なミニマと関連していることを示している。
4つのベンチマークデータセットの実験により、正当性と負の対数類似性の両方が、最大曲率のペナル化のこの状態に常に最も近いことが示されている。
関連論文リスト
- Phasor Attention: Mean Root Square Normalization for Phase Manifold Preservation [3.0459410574367314]
平均根角正規化(MRSNorm)について紹介する。
MRSNormは数学的に従来のスケーリングパラダイムを反転させる。
我々は、この制約がピタゴラスのアイデンティティによって支配される組込み三角勾配クリッパーをもたらすことを解析的に実証した。
論文 参考訳(メタデータ) (2026-07-20T11:10:51Z) - On Higher-Order Geometric Refinements of Classical Covariance Asymptotics: An Approach via Intrinsic and Extrinsic Information Geometry [0.0]
混合、曲線指数族、潜在変数モデル、多様体-ルートパラメータ空間を含む曲線モデルでは、有限サンプルの振る舞いは予測から体系的に逸脱することができる。
我々は、正規パラメトリック族をフィッシャー制約ラオ計量の((,g))として見ることにより、座標不変な曲率対応の洗練を開発する。
本稿では,学習速度と後進平均二乗誤差における実対数正準しきい値の役割,および正規理論を特殊ケースとして回復する解空間上の曲率に基づく共分散展開について述べる。
論文 参考訳(メタデータ) (2026-04-14T13:40:13Z) - Regularized Online RLHF with Generalized Bilinear Preferences [68.44113000390544]
一般的な嗜好を伴う文脈的オンラインRLHFの問題を考える。
一般化された双線形選好モデルを用いて、低ランクなスキュー対称行列による選好を捉える。
グリーディポリシーの双対ギャップは推定誤差の正方形によって有界であることを示す。
論文 参考訳(メタデータ) (2026-02-26T15:27:53Z) - Stability and Generalization of Push-Sum Based Decentralized Optimization over Directed Graphs [55.77845440440496]
プッシュベースの分散通信は、情報交換が非対称である可能性のある通信ネットワークの最適化を可能にする。
我々は、グラディエント・プッシュ(SGP)アルゴリズムのための統一的な一様安定性フレームワークを開発する。
重要な技術的要素は、2つの量に束縛された不均衡認識の一般化である。
論文 参考訳(メタデータ) (2026-02-24T05:32:03Z) - Distributional Stability of Tangent-Linearized Gaussian Inference on Smooth Manifolds [3.632189127068905]
我々は、投射限界化と表面測定条件付けのために、明示的な非漸近的な$W$安定性境界を導出する。
境界は局所的な2次幾何学的歪みと非局所的な尾の漏れを区別する。
実験では、$sqrt||_mathrmop/Rapprox 1/6$付近で予測されたキャリブレーション遷移を検証し、正規方向の不確実性が局所性破壊時の支配的な障害モードであることを示す。
論文 参考訳(メタデータ) (2026-02-22T13:18:45Z) - Revisiting Zeroth-Order Optimization: Minimum-Variance Two-Point Estimators and Directionally Aligned Perturbations [57.179679246370114]
乱摂動の分布は, 摂動段差がゼロになる傾向にあるため, 推定子の分散を最小限に抑える。
以上の結果から, 一定の長さを維持するのではなく, 真の勾配に方向を合わせることが可能であることが示唆された。
論文 参考訳(メタデータ) (2025-10-22T19:06:39Z) - On the Double Descent of Random Features Models Trained with SGD [78.0918823643911]
勾配降下(SGD)により最適化された高次元におけるランダム特徴(RF)回帰特性について検討する。
本研究では, RF回帰の高精度な非漸近誤差境界を, 定常および適応的なステップサイズSGD設定の下で導出する。
理論的にも経験的にも二重降下現象を観察する。
論文 参考訳(メタデータ) (2021-10-13T17:47:39Z) - Benign Overfitting of Constant-Stepsize SGD for Linear Regression [122.70478935214128]
帰納バイアスは 経験的に過剰フィットを防げる中心的存在です
この研究は、この問題を最も基本的な設定として考慮している: 線形回帰に対する定数ステップサイズ SGD。
我々は、(正規化されていない)SGDで得られるアルゴリズム正則化と、通常の最小二乗よりも多くの顕著な違いを反映する。
論文 参考訳(メタデータ) (2021-03-23T17:15:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。