論文の概要: Teacher Geometry Shapes Learnability in Teacher-Student Networks
- arxiv url: http://arxiv.org/abs/2609.09595v1
- Date: Wed, 09 Sep 2026 01:44:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.864549
- Title: Teacher Geometry Shapes Learnability in Teacher-Student Networks
- Title(参考訳): 教師-学生ネットワークにおける教師の幾何学的形状の学習性
- Abstract要約: 我々は、世界最小に収束する成功率として学習可能性を定式化する。
本研究では,2種類の最適局所最小値を含む小型ニューラルネットワークのロスランドスケープについて検討した。
大きなネットワークでは、最大に異なる教師が内部のミニマを、最小に異なる教師がより多くのOOBミニマを誘導する。
- 参考スコア(独自算出の注目度): 42.48772422438361
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Teacher-student systems, in which a teacher neural network generates training labels so that a student neural network can learn to implement the same function, are widely used as an abstract setting to study learning. However, the structure of the teachers is often overlooked by assuming randomly-generated, normally-distributed parameters. This hides substantial variation in how learnable different teachers are. We formalize learnability as the success rate of converging to the global minimum, as a function of overparameterization, learning algorithm, student initialization distribution, and teacher geometry. We both identify an easy distribution that maximizes node dissimilarity and a hard distribution that minimizes it, and show that these two distributions induce markedly different success rates across a large range of settings and for different activation functions. To explain the gap, we study the loss landscape of small neural networks that contain two distinct kinds of suboptimal local minima, out-of-bounds (OOB) minima at the edge of the data distribution and interior minima within. Assuming infinite data and a fast readout layer, we analytically reduce the loss landscape of small networks to two dimensions, showing that the region of attraction of interior minima changes as a function of teacher structure. In larger networks, maximally dissimilar teachers induce more interior minima, while minimally dissimilar teachers induce more OOB minima. Motivated by these analyses, we show that differentially increasing the learning rate of the readout layer and decreasing the learning rate of the inner biases increases success rates. These findings provide an important step in narrowing the gap between the study of teacher-student networks and more structured functions that arise in practice.
- Abstract(参考訳): 教師-学生システムでは、教師のニューラルネットワークがトレーニングラベルを生成して、学生のニューラルネットワークが同じ機能を実装することを学べるようにし、学習を学ぶための抽象的な設定として広く利用されている。
しかし、教師の構造はランダムに生成され、通常は分散されたパラメータを仮定することで見落とされがちである。
これは、学習可能な異なる教師の在り方に大きな変化を隠している。
我々は,学習容易性を,過度パラメータ化,学習アルゴリズム,学生の初期化分布,教師幾何学の関数として,世界最小値への収束の成功率として定式化する。
どちらも、ノードの相似性を最大化する簡単な分布と、それを最小化するハード分布を識別し、これらの2つの分布が、広範囲な設定と異なるアクティベーション関数に対して、著しく異なる成功率を誘導することを示す。
このギャップを説明するために、我々は、データ分布の端に2種類の最適な局所最小値、アウト・オブ・バウンド(OOB)最小値と内部の最小値を含む小さなニューラルネットワークの損失状況について検討した。
無限のデータと高速な読み出し層を仮定し,小ネットワークの損失景観を2次元に解析的に低減し,教師構造の関数として内的ミニマの魅力の領域が変化することを示す。
大きなネットワークでは、最大に異なる教師が内部のミニマを、最小に異なる教師がより多くのOOBミニマを誘導する。
これらの分析により、読み出し層の学習率を差分的に増加させ、内部バイアスの学習率を低下させることが成功率を増加させることが示されている。
これらの知見は,教師と学生のネットワーク研究と,実際に発生するより構造化された機能とのギャップを狭める上で重要なステップとなる。
関連論文リスト
- Generalization performance of narrow one-hidden layer networks in the teacher-student setting [40.69556943879117]
我々は、狭いネットワーク、すなわち多数の隠れユニットを持つネットワークに対して、入力次元よりもはるかに小さい一般理論を開発する。
我々の理論は、回帰や分類タスクで訓練されたニューラルネットワークの一般化誤差を正確に予測する。
論文 参考訳(メタデータ) (2025-07-01T10:18:20Z) - Statistical mechanics of extensive-width Bayesian neural networks near interpolation [4.976898227858662]
総重量分布と活性化関数を持つ2層完全連結ネットワークの教師あり学習について検討した。
我々は、同じアーキテクチャを持つ別のネットワークによって生成されたデータセットを用いて、教師学生のシナリオにおけるベイズ最適学習に焦点を当てる。
分析の結果,データ数の増加に伴い,多様な学習遷移を伴う豊富な現象が明らかになった。
論文 参考訳(メタデータ) (2025-05-30T17:46:59Z) - Feature-Learning Networks Are Consistent Across Widths At Realistic
Scales [72.27228085606147]
様々なアーキテクチャやデータセットにわたる特徴学習ニューラルネットワークのダイナミクスに対する幅の影響について検討する。
トレーニングの初期、オンラインデータでトレーニングされた広範なニューラルネットワークは、損失曲線が同じであるだけでなく、トレーニング全体を通じてポイントワイドなテスト予測に一致している。
しかし、より狭いネットワークのアンサンブルは、単一のワイドネットワークよりも性能が劣っている。
論文 参考訳(メタデータ) (2023-05-28T17:09:32Z) - Expand-and-Cluster: Parameter Recovery of Neural Networks [9.497862562614666]
それぞれのニューロンの重みベクトルは,活性化関数に応じて,サインやスケーリングが可能であることを示す。
提案手法は, 一般的に使用されるすべてのアクティベーション関数に対して, 対象ネットワークの重みを同定する。
論文 参考訳(メタデータ) (2023-04-25T13:14:20Z) - Slimmable Networks for Contrastive Self-supervised Learning [69.9454691873866]
自己教師付き学習は、大規模なモデルを事前訓練する上で大きな進歩を遂げるが、小さなモデルでは苦労する。
追加の教師を必要とせず、訓練済みの小型モデルを得るための1段階のソリューションも導入する。
スリム化可能なネットワークは、完全なネットワークと、様々なネットワークを得るために一度にトレーニングできるいくつかの重み共有サブネットワークから構成される。
論文 参考訳(メタデータ) (2022-09-30T15:15:05Z) - Excess Risk of Two-Layer ReLU Neural Networks in Teacher-Student
Settings and its Superiority to Kernel Methods [58.44819696433327]
教師回帰モデルにおける2層ReLUニューラルネットワークのリスクについて検討する。
学生ネットワークは、どの解法よりも確実に優れていることがわかった。
論文 参考訳(メタデータ) (2022-05-30T02:51:36Z) - A Few-shot Learning Graph Multi-Trajectory Evolution Network for
Forecasting Multimodal Baby Connectivity Development from a Baseline
Timepoint [53.73316520733503]
本稿では,教師-学生パラダイムを取り入れたグラフ多目的進化ネットワーク(GmTE-Net)を提案する。
これは、脳グラフ多軌道成長予測に適した最初の教師学生アーキテクチャである。
論文 参考訳(メタデータ) (2021-10-06T08:26:57Z) - On Learnability via Gradient Method for Two-Layer ReLU Neural Networks
in Teacher-Student Setting [41.60125423028092]
教師-学生回帰モデルにおける2層ReLUネットワークについて検討する。
特定の正規化と十分な過剰パラメータ化により、学生ネットワークは降下によってパラメータを識別できることを示す。
測度空間における疎大なグローバルな性質のグローバルなミニマを解析する。
論文 参考訳(メタデータ) (2021-06-11T09:05:41Z) - Statistical Mechanical Analysis of Catastrophic Forgetting in Continual
Learning with Teacher and Student Networks [5.209145866174911]
計算システムが絶えず変化する環境から学習すると、その過去の経験を急速に忘れてしまう。
教師-学生学習を用いて破滅的な忘れを解析するための理論的枠組みを提供する。
その結果,入力分布の類似度が小さく,対象関数の入出力関係が大きい場合,ネットワークは壊滅的な記憶を回避できることがわかった。
論文 参考訳(メタデータ) (2021-05-16T09:02:48Z) - The Connection Between Approximation, Depth Separation and Learnability
in Neural Networks [70.55686685872008]
学習可能性と近似能力の関係について検討する。
対象関数の深いネットワークでの学習性は、より単純なクラスがターゲットを近似する能力に依存することを示す。
論文 参考訳(メタデータ) (2021-01-31T11:32:30Z) - The large learning rate phase of deep learning: the catapult mechanism [50.23041928811575]
問題解決可能なトレーニングダイナミクスを備えたニューラルネットワークのクラスを提示する。
現実的なディープラーニング環境において,モデルの予測とトレーニングのダイナミクスとの間には,よい一致がある。
我々の結果は、異なる学習率でトレーニングされたモデルの特性に光を当てたと信じています。
論文 参考訳(メタデータ) (2020-03-04T17:52:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。