論文の概要: Quadratic Weak-to-Strong Generalization in Random Feature Networks via Random Matrix Theory
- arxiv url: http://arxiv.org/abs/2610.09044v1
- Date: Tue, 06 Oct 2026 19:46:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.576543
- Title: Quadratic Weak-to-Strong Generalization in Random Feature Networks via Random Matrix Theory
- Title(参考訳): ランダム行列理論によるランダム特徴ネットワークにおける擬似弱-ストロング一般化
- Abstract要約: 弱と強の一般化は、ラベルで訓練された強力な学生モデルが教師よりもうまく一般化できる現象である。
モデル強度をその幅で決定する2層ランダム特徴ネットワークにおいて,この現象を考察する。
- 参考スコア(独自算出の注目度): 5.142160533428576
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Weak-to-strong generalization is the phenomenon where a strong student model trained with labels produced by a weak teacher model is able to generalize better than the teacher. In this paper, we study this phenomenon in two-layer random feature networks where the model strength is determined by its width. Using tools from random matrix theory, we derive deterministic equivalents for the population errors of an optimally trained teacher and a student trained with gradient flow. For ReLU activation and a pure spherical harmonic target, we obtain sharp asymptotics under a Gaussian universality assumption, showing a quadratic improvement: the student error scales as the square of the teacher error. These results attain the general lower bound of Medvedev at al (2025). We also analyze how the student behaves under more general stopping times and targets supported on multiple harmonic degrees, characterizing the regimes in which weak-to-strong generalization occurs and identifying the transition between quadratic, non-quadratic, and no improvement.
- Abstract(参考訳): 弱弱一般化とは、弱い教師モデルによって作られたラベルで訓練された強力な学生モデルが、教師よりも優れた一般化が可能となる現象である。
本稿では,モデル強度が幅によって決定される2層ランダム特徴ネットワークにおいて,この現象を考察する。
確率行列理論のツールを用いて、最適に訓練された教師と勾配流の訓練を受けた学生の集団誤差に対する決定論的等価性を導出する。
ReLUアクティベーションと純粋球面調和目標に対して、ガウス普遍性仮定の下で急激な漸近値を求め、学生誤差を教師誤差の正方形として2次改善を示す。
これらの結果は、 al (2025) における Medvedev の一般下界に達する。
また、より一般的な停止時間の下での生徒の行動や、複数の調和度に支えられた目標について分析し、弱い対強の一般化が起こる体制を特徴づけ、二次的、非四次的、そして改善のない遷移を識別する。
関連論文リスト
- Global Convergence of Gradient Descent for Score Matching in Gaussian Mixtures via Reverse Fisher Divergence [67.12978375116599]
そこで本研究では,学生分布に対する期待値の逆のフィッシャー発散(Fisher divergence)について検討する。
我々は、目標平均に対して$widetilde(1)$-separationの仮定の下で、大域収束保証を証明した。
我々はリアプノフに基づく勾配勾配勾配の動的解析を頼りにしており、逆のフィッシャー発散は前方のフィッシャー発散よりもはるかに良い最適化環境を持つことが示されている。
論文 参考訳(メタデータ) (2026-06-18T07:34:33Z) - Escape dynamics and implicit bias of one-pass SGD in overparameterized quadratic networks [3.198538967655537]
2層ニューラルネットワークの1パス勾配勾配勾配ダイナミクスを教師の枠組みで解析する。
本研究では,学生の進化を規定する低次元常微分方程式について考察する。
論文 参考訳(メタデータ) (2026-04-03T14:47:24Z) - Random-Matrix-Induced Simplicity Bias in Over-parameterized Variational Quantum Circuits [72.0643009153473]
本稿では,観測可能な期待値とパラメータ勾配の両方がシステムサイズに指数関数的に集中するHaar型普遍性クラスに,表現的変分アンサーゼが入ることを示す。
その結果、そのような回路によって誘導される仮説クラスは、近点関数の狭い族に高い確率で崩壊する。
テンソル-ネットワークベースおよびテンソル-ハイパーネットワークパラメータ化を含むテンソル構造VQCは、ハール型普遍性クラスの外にある。
論文 参考訳(メタデータ) (2026-01-05T08:04:33Z) - Zero Generalization Error Theorem for Random Interpolators via Algebraic Geometry [8.60583035881168]
本研究では,教師の学習環境下での機械学習モデルの補間器の一般化誤差が,学習サンプル数が一定の閾値を超えるとゼロとなることを示す。
論文 参考訳(メタデータ) (2025-12-06T08:40:28Z) - Provable Weak-to-Strong Generalization via Benign Overfitting [3.4652800888823294]
弱い教師が不完全な擬似ラベルを持つ強い生徒を監督する逆の状況を考える。
理論的には、二進分類と多進分類の弱強一般化を理論的に検討する。
我々の手法は最終的には弱いクラスから強いクラスに拡張されるべきである。
論文 参考訳(メタデータ) (2024-10-06T22:10:50Z) - Scaling and renormalization in high-dimensional regression [72.59731158970894]
リッジ回帰に関する最近の結果について統一的な視点を提示する。
我々は、物理とディープラーニングの背景を持つ読者を対象に、ランダム行列理論と自由確率の基本的なツールを使用する。
我々の結果は拡張され、初期のスケーリング法則のモデルについて統一的な視点を提供する。
論文 参考訳(メタデータ) (2024-05-01T15:59:00Z) - Online Learning for the Random Feature Model in the Student-Teacher
Framework [0.0]
学生-教師の枠組みの文脈における過度なパラメトリゼーションについて検討する。
隠蔽層の大きさと入力次元の有限比に対して、学生は完全に一般化することはできない。
学生の隠蔽層の大きさが入力次元よりも指数関数的に大きい場合のみ、完全な一般化へのアプローチが可能である。
論文 参考訳(メタデータ) (2023-03-24T15:49:02Z) - More Than a Toy: Random Matrix Models Predict How Real-World Neural
Representations Generalize [94.70343385404203]
ほとんどの理論解析は、カーネル回帰においても定性的現象を捉えるには不十分であることがわかった。
古典的GCV推定器は局所確率行列法則が成立するたびに一般化リスクに収束することを示す。
この結果から, ランダム行列理論は, 実際には神経表現の性質を理解する上で重要である可能性が示唆された。
論文 参考訳(メタデータ) (2022-03-11T18:59:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。