論文の概要: Ideal Paths for Approximating Logistic Gradient Descent Trajectories at Large Initialization
- arxiv url: http://arxiv.org/abs/2610.04142v2
- Date: Tue, 06 Oct 2026 06:01:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.297195
- Title: Ideal Paths for Approximating Logistic Gradient Descent Trajectories at Large Initialization
- Title(参考訳): 大規模初期化におけるロジスティック勾配線軌跡の近似法
- Abstract要約: 我々は、厳密な線形分離可能なデータに基づいて、全バッチロジスティック降下軌道の幾何学的近似を用いる。
固定ステップ GD 軌道が$R$ で割られたことは、固定パラメータ区間毎に$Rtoinfty$ として一様収束することを証明している。
この近似はピーク評価損失と累積トレーニング損失の式を提供する。
- 参考スコア(独自算出の注目度): 2.1771821757134915
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern training on a new task often starts from a previously trained model rather than from scratch, raising the question of how this initialization affects the subsequent training trajectory. Classical implicit-bias results characterize the direction selected by prolonged training, but this direction alone does not provide information regarding the intermediate behavior. We address this question through a geometric approximation of full-batch logistic gradient descent (GD) trajectories on strictly linearly separable data, with large initialization of scale $R$ motivated by prior training. From any limiting normalized initial position, we use minimum-norm projection rules to construct a unique continuous ideal path consisting of finitely many linear segments. The path has two stages: negative-margin correction followed by minimum-margin growth. We prove that, after an explicit two-stage time reparameterization, the fixed-step GD trajectory divided by $R$ converges uniformly to this path on every fixed parameter interval as $R\to\infty$. Further, our quantitative error bounds account for initialization perturbations and the transition between stages. This approximation provides asymptotic formulas for peak evaluation loss and cumulative training loss. In particular, peak evaluation loss can grow linearly in $R$ even when both endpoint losses tend to zero. The cumulative losses in the correction and margin-growth stages, normalized by $R^2$ and $R$, respectively, converge to explicit limits. Experiments on controlled geometries and fixed image features complement our theoretical results.
- Abstract(参考訳): 新しいタスクに対する現代的なトレーニングは、しばしばスクラッチからではなく、以前にトレーニングされたモデルから始まり、この初期化がその後のトレーニングの軌道にどのように影響するかという疑問を提起する。
古典的な暗黙のバイアスは、長い訓練によって選択された方向を特徴付けるが、この方向だけでは中間行動に関する情報は提供されない。
我々は、厳密な線形分離可能なデータ上で、全バッチロジスティック勾配勾配勾配(GD)軌道の幾何学的近似を用いてこの問題に対処し、事前トレーニングによって動機付けられたスケール$R$の大規模な初期化を行う。
任意の極限正規化初期位置から、有限個の線型セグメントからなる一意的な連続イデアルパスを構築するために最小ノルム射影規則を用いる。
この経路には2つの段階がある: 負のマージン補正と最小のマージン成長である。
明示的な2段階の時間再パラメータ化の後、固定ステップのGD軌道が$R$で割られ、固定パラメータ区間のこの経路に$R\to\infty$として一様収束することが証明される。
さらに,初期化摂動と段階間の遷移を考慮した定量的誤差境界について検討した。
この近似は、ピーク評価損失と累積トレーニング損失の漸近式を提供する。
特に、ピーク評価損失は、両方のエンドポイント損失がゼロになる傾向にある場合でも、$R$で線形に増加する。
補正とマージン成長段階における累積損失は、それぞれ$R^2$と$R$によって正規化され、明示的な極限に収束する。
制御されたジオメトリと固定画像の特徴の実験は、我々の理論的な結果を補完する。
関連論文リスト
- Bandit Convex Optimization with Gradient Prediction Adaptivity [56.816177049016794]
本研究では, 楽観的な勾配予測が, 最悪の後悔の保証を予測順応的に改善できるかどうかを考察する。
鍵となるアイデアは、分散が勾配ノルムではなく予測誤差でスケールする、新しい分散還元勾配推定器である。
我々は、$(sqrtmathbbE[S_T])$としてスケールする情報理論の下限を確立し、最も達成可能な予測適応的後悔の基本的な特徴を提供する。
論文 参考訳(メタデータ) (2026-05-21T08:57:38Z) - Minor First, Major Last: A Depth-Induced Implicit Bias of Sharpness-Aware Minimization [24.4931530458436]
線形分離可能な二元分類に基づく$L$層線形対角ネットワークのトレーニングにおいて,シャープネス・アウェア最小化(SAM)の暗黙バイアスについて検討した。
$ell_infty$-SAM の場合、極限方向は $mathbf0$ あるいは任意の標準ベクトルに収束する。
我々の理論解析は、この現象を正規化に応用した$ell$-SAMの勾配正規化因子とみなす。
論文 参考訳(メタデータ) (2026-03-09T12:09:14Z) - Linear regression with overparameterized linear neural networks: Tight upper and lower bounds for implicit $\ell^1$-regularization [3.4540258577108776]
過パラメータ線形回帰問題に対する深度Dge 2$の対角線形ニューラルネットワークの暗黙正則化について検討した。
D ge 3$ の場合、誤差は$alpha$ で線形的に減少するが、$D=2$ の場合、$alpha1-varrho$ で減少する。
数値実験は、我々の理論的な発見を裏付け、より深いネットワーク、すなわち$D ge 3$がより良い一般化をもたらすことを示唆している。
論文 参考訳(メタデータ) (2025-06-01T19:55:31Z) - From Continual Learning to SGD and Back: Better Rates for Continual Linear Models [50.11453013647086]
以前見られたタスクの損失を、$k$の繰り返しの後、忘れること、すなわち、分析する。
実現可能な最小二乗の設定において、新しい最上界を創出する。
我々は、タスクを繰り返しないランダム化だけで、十分に長いタスクシーケンスで破滅的な事態を防げることを初めて証明した。
論文 参考訳(メタデータ) (2025-04-06T18:39:45Z) - The Role of the Time-Dependent Hessian in High-Dimensional Optimization [9.50832466973301]
グラディエント降下は、特に機械学習アプリケーションにおいて、荒れた風景の中でミニマを見つけるのに一般的に使用される。
ここでは,信号が失われる前に,システムが信号を回復する能力である解像位相に着目した。
論文 参考訳(メタデータ) (2024-03-04T19:12:13Z) - Large Stepsize Gradient Descent for Logistic Loss: Non-Monotonicity of the Loss Improves Optimization Efficiency [47.8739414267201]
線形分離可能なデータを用いたロジスティック回帰に一定の段差を持つ勾配降下(GD)を考える。
GD はこの初期振動位相を急速に終了し、$mathcalO(eta)$ steps となり、その後$tildemathcalO (1 / (eta t) )$ convergence rate が得られることを示す。
我々の結果は、予算が$T$ ステップであれば、GD は攻撃的なステップサイズで $tildemathcalO (1/T2)$ の加速損失を達成できることを示している。
論文 参考訳(メタデータ) (2024-02-24T23:10:28Z) - Direction Matters: On the Implicit Bias of Stochastic Gradient Descent
with Moderate Learning Rate [105.62979485062756]
本稿では,中等度学習におけるSGDの特定の正規化効果を特徴付けることを試みる。
SGDはデータ行列の大きな固有値方向に沿って収束し、GDは小さな固有値方向に沿って収束することを示す。
論文 参考訳(メタデータ) (2020-11-04T21:07:52Z) - Implicit Bias in Deep Linear Classification: Initialization Scale vs
Training Accuracy [71.25689267025244]
移行がスケールとトレーニング損失の最小化の関係によってどのように制御されるかを示す。
以上の結果から,勾配降下の限界挙動は,ばかげた訓練精度でのみ引き起こされることが示唆された。
論文 参考訳(メタデータ) (2020-07-13T23:49:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。