論文の概要: Hard-ReLU Gradient Descent Selects an Event-Free Sensitivity Limit
- arxiv url: http://arxiv.org/abs/2608.30960v2
- Date: Thu, 03 Sep 2026 02:52:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 13:51:58.188749
- Title: Hard-ReLU Gradient Descent Selects an Event-Free Sensitivity Limit
- Title(参考訳): イベントフリー感度限界を選択できるHard-ReLUグラディエントDescent
- Abstract要約: 硬ReLU勾配勾配による正確な自動微分の固定水平・消滅段階限界を特徴付ける。
ハードルールトレーニングの勾配-フロー制限は, 差別化後に有効でなくてもよいことを示す。
- 参考スコア(独自算出の注目度): 3.337151338735509
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Gradient flow is widely used as a continuous-time surrogate for gradient descent, but state convergence does not imply convergence of differentiated training maps in nonsmooth networks. We characterize the fixed-horizon, vanishing-step limit of exact automatic differentiation through hard-ReLU gradient descent. Under a stable finite itinerary of separated, same-direction transverse activation events, gradient-descent states converge at first order to the corresponding piecewise-smooth gradient flow, while the exact derivative of every nonresonant discrete program converges to an event-free regional propagator. The true flow derivative instead interleaves classical saltation matrices that encode event-time sensitivity. For globally convex objectives, any strict activation event prevents complete cancellation of these missing transfers. Moreover, minimal globally 1-strongly convex residual-ReLU risks can realize arbitrarily large reciprocal sensitivity gaps, subject to an explicit transversality-scale tradeoff, and a coupled strongly convex construction yields an open set on which the largest initialization-gradient coordinate is reversed. In a controlled 17-parameter ReLU MLP, state and regional-AD errors vanish under mesh refinement while AD-to-flow errors remain between 0.18 and 0.39; an event-aware corrected product restores convergence. Resolved smoothing likewise recovers the flow sensitivity when the transition layer is sufficiently resolved. These results show that the gradient-flow limit of hard-ReLU training need not remain valid after differentiation.
- Abstract(参考訳): 勾配流は勾配降下の連続的時間的サロゲートとして広く用いられているが、状態収束は非滑らかなネットワークにおける微分されたトレーニングマップの収束を示唆しない。
硬ReLU勾配勾配による正確な自動微分の固定水平・消滅段階限界を特徴付ける。
分離された同方向の逆アクティベーション事象の安定な有限イテナリーの下では、勾配-退化状態は、最初は対応する片方向の滑らかな勾配流れに収束し、一方、すべての非共鳴離散プログラムの正確な微分は、事象のない地域プロパゲータに収束する。
真のフロー微分は、イベント時感度をエンコードする古典的な塩化行列をインターリーブする。
グローバルな凸目標に対して、厳格なアクティベーションイベントは、これらの欠落した転送を完全にキャンセルするのを防ぐ。
さらに、最小限の1-strongly convex残ReLUリスクは、明示的な超越スケールのトレードオフを受けることなく、任意に大きな相互感度ギャップを実現することができ、結合された強凸構造は、最大の初期化勾配座標が反転する開集合を得る。
制御された17パラメータのReLU MLPでは、状態と地域ADエラーはメッシュ改良の下で消滅し、AD-to-flowエラーは0.18から0.39の間にとどまる。
解消された平滑化は、遷移層が十分に解決されたときに流感を回復させる。
これらの結果から, ハードルールトレーニングの勾配-フロー限界は, 差別化後も有効ではないことが示された。
関連論文リスト
- Linearized PINN with pretrained nonlinear layers [48.01541150431857]
lPINNは、前方および逆微分方程式の低次ニューラルネットワーク基底法である。
我々は, 対流拡散方程式, バーガーズ方程式, 非線形振り子方程式に対する逆問題に対する lPINN の評価を行った。
論文 参考訳(メタデータ) (2026-09-14T02:18:00Z) - Critical initialization destabilizes higher input derivatives in wide scalar-input networks [3.0318216701273397]
任意の固定有限微分位数は、明示的な正則性仮定の下で一様有界な分散を持つことを証明する。
分岐スケール L-1/2 の残留ネットワークに対して、すべての固定有限微分位数は一様有界な分散を持つことを証明する。
論文 参考訳(メタデータ) (2026-09-08T10:17:45Z) - Solution-space heterogeneity shapes federated learning dynamics across partial differential equations [41.890949680958805]
フェデレートされた機械学習により、組織は局所的な物理データを集中することなく、ニューラルネットワークを訓練できる。
既存のプロトコルは、方程式固有の規則に従って座標、係数、境界条件、またはジオメトリを分割する。
本稿では、連続的な教師付き応答を再利用可能なソリューションビンに変換するプロトコルであるPDE-Dirichletについて紹介する。
論文 参考訳(メタデータ) (2026-09-04T11:23:29Z) - Self-Normalized Inference for Constant-Stepsize Temporal-Difference Learning under Markovian Sampling [9.271408028342496]
定段階時間差学習(TD)は政策評価に魅力的であるが,1つのマルコフ軌道からの推論は連続的依存と段階的依存的定常目標を考慮しなければならない。
我々は、ランダムなTD行列と定常反復誤差によって誘導される乗法成分を共分散が保持する機能中心極限定理を確立する。
FrozenLakeとGarnetの実験では、静止目標被覆、RR目標補正、地平線インデクシング設計の有限サンプル挙動が示されている。
論文 参考訳(メタデータ) (2026-08-11T13:19:28Z) - Discretization and Statistical Consistency of Functional Flow Matching [0.0]
有限ランク再構成の強い一貫した列に対して、有限条件速度目標の強い$L2$収束を証明した。
学習フローに対して、集団重ね合わせ経路に直接結合すると、終端ワッサーシュタイン境界が得られる。
論文 参考訳(メタデータ) (2026-08-05T07:05:47Z) - Quotient Dynamics, Effective Curvature, and Implicit Bias in Positive Quadratic Networks [0.0]
正の二次ネットワークは、低ランク表現 f_U(x)=xtop UUtop x を持ち、UinmathbbRdtimes r は右乗法までしか特定できない。
この商構造は, トレーニング力学, 曲率, 回復, バイアスをいかに支配するかを考察する。
論文 参考訳(メタデータ) (2026-07-28T12:04:46Z) - Beyond Negative-Ridge Endpoints: Mixed-Sign Spectral Regularization via Negative-Shifted Gradient Descent [11.327284468812948]
負シフト勾配降下は構造的制約から逃れることを示す。
フィルタは、wil-be極で滑らかで、混合符号対応である。
有限グリッドのホールドアウト不等式は、分離をバリデーション選択アルゴリズムに転送する。
論文 参考訳(メタデータ) (2026-07-24T16:42:46Z) - Optimization Geometrodynamics: Variational Reduction and Interaction Curvature [0.0]
我々は、この隠れ行列式プッシュフォワードの変分理論として、測地力学を発展させる。
アフィン事前還元の場合、誘導的相互作用曲率(英語版)は負半有限作用素 $-G*H-1G$ である。
閉全測地線ファイバーを持つ大域的解析バンドルと、特異な解析的近接制御器部とを証明した。
論文 参考訳(メタデータ) (2026-07-07T18:42:00Z) - Stability Annealing Selects the Implicit Bias of Smoothed Sign Descent: A Rate-Indexed Barrier Path on Separable Data [3.7437735326653883]
本稿では,分離可能なデータに対する完全バッチ線形分類における速度制御中間事例について検討する。
指数損失を重み付けしたメモリレス安定アニール型スムーズドサイン降下に対して, 正規化繰り返しは, 凸バーグ型バリアの最小化に収束することが証明された。
論文 参考訳(メタデータ) (2026-07-07T08:55:35Z) - Implicit Bias of SGD in Multivariate ReLU Networks: Effective Width Collapse [16.78534503577613]
入力重みとバイアスが有限個の方向に沿って一致していることを示し、有効幅の崩壊を導いた。
我々は、学習方向がトレーニングデータに固有の3次活性化パターンを誘導することを証明することによって、学習表現の非冗長性を確立する。
論文 参考訳(メタデータ) (2026-07-03T22:03:13Z) - Divergence is Uncertainty: A Closed-Form Posterior Covariance for Flow Matching [8.603039700922809]
フローマッチングは生成モデルの主要なフレームワークとなっているが、サンプルの不確かさの定量化は未解決の問題である。
これらのトレードオフはいずれも必要ありません。
MNISTの実験により、ピクセルごとの不確実性マップが意味論的に意味があることが確認された。
論文 参考訳(メタデータ) (2026-05-01T04:25:00Z) - Variational Bayesian Flow Network for Graph Generation [54.94088904387278]
グラフ生成のための変分ベイズフローネットワーク(VBFN)を提案する。
VBFNは、構造化精度で支配されるトラクタブルジョイントガウス変分信念ファミリーに対して変分リフトを行う。
合成グラフと分子グラフのデータセットでは、VBFNは忠実度と多様性を改善し、ベースライン法を超えている。
論文 参考訳(メタデータ) (2026-01-30T03:59:38Z) - Sampling and estimation on manifolds using the Langevin diffusion [45.57801520690309]
離散化マルコフ過程に基づく$mu_phi $の線形汎函数の2つの推定器を検討する。
誤差境界は、本質的に定義されたランゲヴィン拡散の離散化を用いてサンプリングと推定のために導出される。
論文 参考訳(メタデータ) (2023-12-22T18:01:11Z) - Provably Accelerating Ill-Conditioned Low-rank Estimation via Scaled
Gradient Descent, Even with Overparameterization [48.65416821017865]
この章では、スケールドグラデーション(ScaledGD)と呼ばれる新しいアルゴリズムアプローチを紹介します。
低ランク物体の条件数に依存しない定数速度で直線的に収束する。
様々なタスクに対して、勾配降下の低い摂動コストを維持できる。
論文 参考訳(メタデータ) (2023-10-09T21:16:57Z) - Last-Iterate Convergence of Adaptive Riemannian Gradient Descent for Equilibrium Computation [52.73824786627612]
本稿では,テクスト幾何学的強単調ゲームに対する新たな収束結果を確立する。
我々のキーとなる結果は、RGDがテクスト幾何学的手法で最終定位線形収束を実現することを示しています。
全体として、ユークリッド設定を超えるゲームに対して、幾何学的に非依存な最終点収束解析を初めて提示する。
論文 参考訳(メタデータ) (2023-06-29T01:20:44Z) - Convergence of mean-field Langevin dynamics: Time and space
discretization, stochastic gradient, and variance reduction [49.66486092259376]
平均場ランゲヴィンダイナミクス(英: mean-field Langevin dynamics、MFLD)は、分布依存のドリフトを含むランゲヴィン力学の非線形一般化である。
近年の研究では、MFLDは測度空間で機能するエントロピー規則化された凸関数を地球規模で最小化することが示されている。
有限粒子近似,時間分散,勾配近似による誤差を考慮し,MFLDのカオスの均一時間伝播を示す枠組みを提供する。
論文 参考訳(メタデータ) (2023-06-12T16:28:11Z) - Implicit Bias of Gradient Descent for Logistic Regression at the Edge of
Stability [69.01076284478151]
機械学習の最適化において、勾配降下(GD)はしばしば安定性の端(EoS)で動く
本稿では,EoS系における線形分離可能なデータに対するロジスティック回帰のための定数段差GDの収束と暗黙バイアスについて検討する。
論文 参考訳(メタデータ) (2023-05-19T16:24:47Z) - On the Effective Number of Linear Regions in Shallow Univariate ReLU
Networks: Convergence Guarantees and Implicit Bias [50.84569563188485]
我々は、ラベルが$r$のニューロンを持つターゲットネットワークの符号によって決定されるとき、勾配流が方向収束することを示す。
我々の結果は、標本サイズによらず、幅が$tildemathcalO(r)$である、緩やかなオーバーパラメータ化をすでに維持しているかもしれない。
論文 参考訳(メタデータ) (2022-05-18T16:57:10Z) - Mean-field Analysis of Piecewise Linear Solutions for Wide ReLU Networks [83.58049517083138]
勾配勾配勾配を用いた2層ReLUネットワークについて検討する。
SGDは単純な解に偏りがあることが示される。
また,データポイントと異なる場所で結び目が発生するという経験的証拠も提供する。
論文 参考訳(メタデータ) (2021-11-03T15:14:20Z) - Benign Overfitting of Constant-Stepsize SGD for Linear Regression [122.70478935214128]
帰納バイアスは 経験的に過剰フィットを防げる中心的存在です
この研究は、この問題を最も基本的な設定として考慮している: 線形回帰に対する定数ステップサイズ SGD。
我々は、(正規化されていない)SGDで得られるアルゴリズム正則化と、通常の最小二乗よりも多くの顕著な違いを反映する。
論文 参考訳(メタデータ) (2021-03-23T17:15:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。