論文の概要: Directional Curvature from Armijo Backtracking: A Low-Cost Sharpness Probe and a Calibration-Free Learning-Rate Safeguard for Adam
- arxiv url: http://arxiv.org/abs/2607.03998v2
- Date: Sat, 11 Jul 2026 20:23:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 13:33:35.656347
- Title: Directional Curvature from Armijo Backtracking: A Low-Cost Sharpness Probe and a Calibration-Free Learning-Rate Safeguard for Adam
- Title(参考訳): Armijo Backtrackingからの方向曲率:Adamの低コストシャープネスプローブと校正自由学習率保護
- Authors: Ashmitha R, Jörg Frochte,
- Abstract要約: 単一のArmijoバックトラックラインサーチが、この情報を数回のフォワードパスのコストですでに持っているのを観察する。
初期化時に一度使うと、この測定値が学習率の上限となり、Adamはあまりに大きな初期学習率に頑健になる。
- 参考スコア(独自算出の注目度): 0.16283634001181238
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The local sharpness of the loss, the top Hessian eigenvalue $λ_1$, determines the largest stable gradient step, but measuring it normally requires Lanczos or Hessian-vector iterations. We observe that a single Armijo backtracking line search already carries this information at the cost of a few forward passes: the accepted step $α$ brackets the \emph{directional} curvature $q = g^\top H g/\|g\|^2$ within the multiplicative band set by the backtracking factor. Across CIFAR-10, Fashion-MNIST and Imagenette, $\logα$ tracks $\logλ_1$ at Pearson $-0.91$ to $-0.95$, giving a low-cost online Edge-of-Stability reading. Used once at initialisation, this measurement yields a learning-rate cap (a safeguard, not a faster optimiser) that makes Adam robust to a too-large initial learning rate across more than three orders of magnitude ($10^{-3}$ to $3.0$), at about one percent overhead, and it is a no-op when the chosen rate is already safe. One probe is enough: periodic in-training probing adds no robust benefit. The raw-gradient probe exposes the mechanism but needs a safety factor calibrated to the architecture by a one-minute divergence sweep. Probing along Adam's own update direction removes this calibration: a single fixed safety factor $κ= 2$ avoids divergence on all nine architectures we test and across the full learning-rate grids of all four benchmarks, and the recipe transfers to AdamW unchanged.
- Abstract(参考訳): 損失の局所的シャープさ、トップヘッセン固有値 $λ_1$ は最大の安定勾配ステップを決定するが、通常はランツォスやヘッセンベクトルの反復を必要とする。
受理ステップ $α$ brackets the \emph{directional} curvature $q = g^\top H g/\|g\|^2$ は、バックトラック係数によって設定された乗法帯域内に存在する。
CIFAR-10、Fashion-MNIST、Imagenette、$\logα$ tracks $\logλ_1$ at Pearson $-0.91$ to $-0.95$で、低コストのオンラインEdge-of-Stability読み込みを提供する。
初期化時に一度使用すると、この測定値によって学習レベル上限(より高速なオプティマイザではなく安全なガード)が得られ、これはアダムを3桁以上の大小数($10^{-3}$から$3.0$)で強固に初期学習率($10^{-3}$から$3.0$)に約1%のオーバーヘッドで到達させ、選択されたレートが既に安全である場合のノーオプトとなる。
1つのプローブは十分である: 定期的なトレーニング中のプローブは、堅牢な利益を与えない。
生の勾配プローブは機構を露呈するが、1分間の発散スイープによってアーキテクチャに調整された安全因子が必要である。
a single fixed safety factor $κ= 2$ is avoids divergence on all nine architectures we test and across the full learning-rate grids of all four benchmarks and the recipe transfers to AdamW。
関連論文リスト
- Dead-Direction Signatures: A Cheap Spectral Reading of Singular Complexity [5.67642958049511]
特異学習理論は、損失特異点の幾何学を通して深いネットワークの複雑さを特徴づける。
単体構造をもつ安価でクローズドなスペクトル読影器であるDeadDirection Signatures (DDS)を紹介する。
それぞれが選択された層でネットワークの活性化行列またはサンプル単位のフィッシャーグラムを読み、後鎖スペクトル線型代数を置き換える。
論文 参考訳(メタデータ) (2026-06-19T06:49:09Z) - Hidden-State Privacy Has an Empty Middle [51.56484100374058]
すべてのフルランクガウス解放を$O(1)$ Fisher utility で表すと、マハラノビス信号が隠れた幅で直線的に成長する方向を認める。
スクラッチからトレーニングされたスプリットメモリトランスフォーマーは、[20, 33]$90MでG_mathrmMahに達し、固定言語損失ペナルティにおいて、30Mから1Bまでの同じ予算のGPTベースラインに対して6ドル~24ドルという優位性を維持する。
論文 参考訳(メタデータ) (2026-05-21T20:12:09Z) - The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations [50.43168858368539]
大規模言語モデルは自信を持って時代遅れの回答を生成し、既存の方法では検出できない。
これは工学的な失敗ではなく構造的な失敗であり、時間的ドリフトは、幾何的に残留流の方向として、正確性と不確実性の両方に符号化される。
論文 参考訳(メタデータ) (2026-05-09T22:27:31Z) - Online Covariance Estimation in Averaged SGD: Improved Batch-Mean Rates and Minimax Optimality via Trajectory Regression [12.805268849262243]
我々はPolyak-Ruppert averaged gradient descent (SGD)のオンライン共分散行列推定について検討した。
この構造は、このボトルネックがSGDドリフトからヘッセンの情報をサブ線形に蓄積していることを明らかにする。
論文 参考訳(メタデータ) (2026-04-12T20:49:33Z) - Ghosts of Softmax: Complex Singularities That Limit Safe Step Sizes in Cross-Entropy [0.0]
クロスエントロピートレーニング分析は、提案されたステップが目標を減少させるかどうかを予測するために、損失の局所的なテイラーモデルに依存する。
提案した更新方向に沿って,ロジット線形化の下で閉形式式を導出する。
_a$の正規化は、標準偏差$0.992$から$0.164$へのオンセット閾値の広がりを縮小する。
論文 参考訳(メタデータ) (2026-03-13T19:42:12Z) - Numerical Fragility in Transformers: A Layer-wise Theory for Explaining, Forecasting, and Mitigating Instability [0.0]
エラーがいつどこで発生するかを予測する一階のモジュールワイズ理論を提示する。
自己注意のために、3つの解釈可能な診断に分解する層間境界を導出する。
また、精度と幅を意識したLayerNormインジケータ$rho_rm LN$も導入する。
論文 参考訳(メタデータ) (2025-10-17T01:03:02Z) - Heavy-Tailed Linear Bandits: Huber Regression with One-Pass Update [62.96781471194877]
ヘビーテール付きバンディットには、ヘビーテール付きノイズ、トランケーション、中央値の2つの基本戦略が導入されている。
本稿では,オンラインミラー降下フレームワークに基づくEmphone-passアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-03-01T09:41:45Z) - Correcting Momentum with Second-order Information [50.992629498861724]
最適積に$O(epsilon)$epsilon点を求める非臨界最適化のための新しいアルゴリズムを開発した。
我々は、さまざまな大規模ディープラーニングベンチマークとアーキテクチャで結果を検証する。
論文 参考訳(メタデータ) (2021-03-04T19:01:20Z) - Online Robust Regression via SGD on the l1 loss [19.087335681007477]
ストリーミング方式でデータにアクセス可能なオンライン環境において、ロバストな線形回帰問題を考察する。
この研究で、$ell_O( 1 / (1 - eta)2 n )$損失の降下は、汚染された測定値に依存しない$tildeO( 1 / (1 - eta)2 n )$レートで真のパラメータベクトルに収束することを示した。
論文 参考訳(メタデータ) (2020-07-01T11:38:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。