論文の概要: The Loss Does Not See the Basis, but Adam Does
- arxiv url: http://arxiv.org/abs/2608.05136v1
- Date: Wed, 05 Aug 2026 17:56:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.070838
- Title: The Loss Does Not See the Basis, but Adam Does
- Title(参考訳): The Lossはベーシズムを知らないが、Adamはそうしている
- Authors: Devender Singh,
- Abstract要約: 因子モデル$W = UVtop$の勾配勾配は低ランク解に対して暗黙的に偏りがあることが示される。
次に, 埋設地真実に対する回復誤差により, 未決定行列検出に関する9つの更新規則を整理した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Gradient descent on a factored model $W = UV^\top$ is implicitly biased toward low-rank solutions, while Adam, starting from the same small initialization, is not. We trace the difference to the gauge symmetry of the loss, its invariance under $(U, V) \mapsto (UQ, VQ)$. Gradient flow's low-rank mechanism is available to an optimizer only if that optimizer is gauge-equivariant, a condition necessary for the transfer but not sufficient for low-rank recovery. Gradient descent, momentum, "shared-scalar" Adam, Muon, and Shampoo satisfy it. Adam, RMSProp, and the other coordinate-wise methods do not. A structure theorem characterizes the memoryless equivariant rules as exactly the Gram-determined left preconditioners, and a transfer theorem carries gradient flow's pathwise properties to common-scalar flows. We then sort nine update rules on underdetermined matrix sensing by recovery error against the planted ground truth. A one-parameter family from coordinate-wise to shared-scalar preconditioning restores the bias monotonically, isolating anisotropy as the cause. A "spectral schedule" reconciles two opposing reports about Muon: equal-rate updates recover exactly low-rank targets but lose their edge as the spectral tail grows. In transformers, Adam separates two gauge-equivalent initializations at the first step, where the equivariant optimizers stay at float precision, and ends with the per-head invariants $W_Q^\top W_K$ 56% apart in relative Frobenius distance, a gap no per-head rotation can close. On two hyperspectral datasets at matched training loss, gradient descent cuts held-out error by 43-44% at the lowest sampling density, and at lower effective rank. Basis choice is therefore not a tuning detail but a decision about which interpolant the optimizer selects.
- Abstract(参考訳): 因子モデル上の勾配降下$W = UV^\top$は暗黙的に低ランク解に偏りがあるが、同じ小さな初期化から始まるアダムはそうではない。
損失のゲージ対称性と、その不変性を$(U, V) \mapsto (UQ, VQ)$で追跡する。
グラディエントフローの低ランク機構は、そのオプティマイザがゲージ同変である場合のみオプティマイザが利用できる。
緩やかな降下、運動量、"Shared-scalar" アダム、ムーン、シャンプーはそれを満足する。
Adam、RMSProp、その他の座標ワイドメソッドはそうではない。
構造定理はメモリレス同変規則をちょうどグラム決定左プレコンディショナーとして特徴づけ、転移定理は勾配流のパスワイズ特性をコモンスカラーフローに伝達する。
次に, 埋設地真実に対する回復誤差により, 未決定行列検出に関する9つの更新規則を整理した。
座標ワイドから共有スカラープレコンディショニングまでの1パラメータファミリーは、バイアスを単調に復元し、異方性を原因として分離する。
スペクトルスケジュール」は、ムオンに関する2つの反対の報告を解釈する: 等レート更新は正確に低ランクの目標を回復するが、スペクトルの尾が大きくなるにつれてエッジを失う。
変換器では、アダムは最初のステップで2つのゲージ等価初期化を分離し、同変オプティマイザは浮動小数点の精度に留まり、相対フロベニウス距離では56%の差で頭ごとの不変量である$W_Q^\top W_K$で終わる。
トレーニング損失に一致した2つのハイパースペクトルデータセットにおいて、勾配降下は最低サンプリング密度で43-44%、低い有効ランクで誤差を43-44%削減する。
したがって、基本選択はチューニングの詳細ではなく、オプティマイザが選択する補間詞に関する決定である。
関連論文リスト
- Attractor Geometry Determines the Identifiability Limits of System Discovery [0.764671395172401]
1つの数値、$_min(M)$はスパース回帰(SINDy)と進化回帰(PySR)の両方に対して識別可能性天井を設定する。
また、二進数や予測スコアに見えない性能差を解消する係数重み付き構造計量であるSoft F1を導入する。
論文 参考訳(メタデータ) (2026-07-20T20:19:19Z) - Dead-Direction Conditioners: Gauge-Equivariant Preconditioning for Deep Networks [0.0]
ディープネットワークの損失はそのパラメータの連続対称性に不変である。
我々は、$G$-不変距離の軌道分解を条件付けるデッド・ディビジョン・コンディショナーであるDDCを構築する。
適合点を越えて訓練された言語モデルでは、DDCAdamはAdamWの過度のトレーニング崩壊に抵抗し、5.88に対して0.67のトレーニング損失ギャップを保持し、65層中32層でデッドダイレクト率を読み取る。
論文 参考訳(メタデータ) (2026-06-28T03:44:59Z) - Dead Directions: Geometric Singular Learning [0.0]
特異学習理論と情報幾何学は、主に別々の語彙で同じパラメータ空間を研究してきた。
我々はそれらを1つのプリミティブ、デッド方向、すなわちフィッシャー計量が退化する単位ベクトルを通してブリッジする。
滑らかな繊維上の選択規則は、この速度を実対数正準しきい値に対する渡辺の単一方向寄与に変換する。
多層K-FAC分解は、各フィッシャーブロックをアクティベーションと勾配側率の積として記述する。
論文 参考訳(メタデータ) (2026-06-04T09:54:08Z) - Bandit Convex Optimization with Gradient Prediction Adaptivity [56.816177049016794]
本研究では, 楽観的な勾配予測が, 最悪の後悔の保証を予測順応的に改善できるかどうかを考察する。
鍵となるアイデアは、分散が勾配ノルムではなく予測誤差でスケールする、新しい分散還元勾配推定器である。
我々は、$(sqrtmathbbE[S_T])$としてスケールする情報理論の下限を確立し、最も達成可能な予測適応的後悔の基本的な特徴を提供する。
論文 参考訳(メタデータ) (2026-05-21T08:57:38Z) - From Noisy Traces to Stable Gradients: Bias-Variance Optimized Preference Optimization for Aligning Large Reasoning Models [90.45197506653341]
大規模推論モデルは最終回答を生成する前に中間的推論トレースを生成する。
LRMと人間の好みの整合性は、モデルデプロイメントにとって重要な前提条件であり、まだ過小評価されていない。
共通の回避策は1つのサンプル軌道を最適化し、トレースサンプリングからかなり勾配のばらつきをもたらす。
論文 参考訳(メタデータ) (2025-10-06T17:58:01Z) - Transformers as Support Vector Machines [54.642793677472724]
自己アテンションの最適化幾何と厳密なSVM問題との間には,形式的等価性を確立する。
勾配降下に最適化された1層変圧器の暗黙バイアスを特徴付ける。
これらの発見は、最適なトークンを分離し選択するSVMの階層としてのトランスフォーマーの解釈を刺激していると信じている。
論文 参考訳(メタデータ) (2023-08-31T17:57:50Z) - A Simple Convergence Proof of Adam and Adagrad [74.24716715922759]
我々はAdam Adagradと$O(d(N)/st)$アルゴリズムの収束の証明を示す。
Adamはデフォルトパラメータで使用する場合と同じ収束$O(d(N)/st)$で収束する。
論文 参考訳(メタデータ) (2020-03-05T01:56:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。