論文の概要: Two-Timescale Fine-tuning Provably Learns New Features for Two-Layer ReLU Networks
- arxiv url: http://arxiv.org/abs/2609.34667v1
- Date: Mon, 28 Sep 2026 09:04:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 11:25:33.877481
- Title: Two-Timescale Fine-tuning Provably Learns New Features for Two-Layer ReLU Networks
- Title(参考訳): 2階層ReLUネットワークの新機能を学習する2時間ファインチューニング
- Abstract要約: 少ないデータを持つ専門的なタスクに関する微調整済みのモデルが、現代のディープラーニングの中心である。
事前学習した重みから微調整を研究するために,ガウスのマルチインデックス設定を導入する。
2層ReLUネットワークでは,2段階のトレーニング,すなわち,隠れたものよりも外重みを無限に高速に更新することで,事前学習したものを保存しながらタスク固有の新しい特徴を学習できることが示されている。
- 参考スコア(独自算出の注目度): 42.810764832348234
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fine-tuning pre-trained models on specialized tasks with scarce data is central to modern deep learning. Despite its empirical success, theoretical understanding of fine-tuning remains limited. We introduce a Gaussian multi-index setting to study fine-tuning from pre-trained weights, where the teacher network has $m+1$ features, $m$ of which are learned during pre-training and one of which must be learned during fine-tuning. For two-layer ReLU networks, we show that two-timescale training, i.e., updating the outer weights infinitely faster than the hidden ones, learns the new task-specific feature while preserving the pre-trained ones in the model representation. Moreover, only $\mathcal{O}(d)$ fine-tuning samples are required for this recovery, independently of the number of pre-trained features. In contrast, with random initialization, the same number of samples is insufficient to recover the target parameters. Our results therefore demonstrate that pre-training can induce an implicit bias with a clear statistical advantage over random initialization, enabling feature learning from scarce fine-tuning data.
- Abstract(参考訳): 少ないデータを持つ専門的なタスクに関する微調整済みのモデルが、現代のディープラーニングの中心である。
実証的な成功にもかかわらず、微調整の理論的な理解は依然として限られている。
そこでは,教師ネットワークがm+1$機能を持ち,m+1$機能は事前学習時に学習され,その中の1つが微調整時に学習される。
2層ReLUネットワークの場合、モデル表現に事前学習したものを保存しながら、外部重みを隠れたものよりも無限に高速に更新し、タスク固有の特徴を学習する。
さらに、このリカバリには事前訓練された特徴の数とは無関係に、$\mathcal{O}(d)$ fine-tuning サンプルが要求される。
対照的に、ランダム初期化では、同じ数のサンプルがターゲットパラメータを復元するには不十分である。
以上の結果から,事前学習はランダム初期化よりも統計的に有利な暗黙バイアスを生じさせ,微調整の少ないデータから特徴学習を可能にすることが示唆された。
関連論文リスト
- Statistical Benefits of Fine-Tuning from Pretrained Initialization in Diagonal Linear Networks [76.86688424891021]
グラデーションベースの微調整によって、微調整済みの重みが暗黙的に悪用されることを示す。
以上の結果から,事前学習した重み付き情報を勾配に基づく微調整によって暗黙的に活用する方法が示唆された。
論文 参考訳(メタデータ) (2026-09-28T09:42:39Z) - DeepONet as a Multi-Operator Extrapolation Model: Distributed Pretraining with Physics-Informed Fine-Tuning [6.635683993472882]
マルチオペレータ学習を実現するためのファインチューニング手法を提案する。
本手法は,事前学習における各種演算子からのデータを分散学習と組み合わせ,物理インフォームド手法によりゼロショット微調整が可能となる。
論文 参考訳(メタデータ) (2024-11-11T18:58:46Z) - Tune without Validation: Searching for Learning Rate and Weight Decay on
Training Sets [0.0]
Tune without Validation (Twin)は、学習率と体重減少をチューニングするためのパイプラインである。
我々は、20の画像分類データセットに関する広範な実験を行い、ディープネットワークの数家族を訓練する。
我々は,スクラッチと微調整の訓練において適切なHP選択を示し,小サンプルシナリオを強調した。
論文 参考訳(メタデータ) (2024-03-08T18:57:00Z) - An Emulator for Fine-Tuning Large Language Models using Small Language
Models [91.02498576056057]
本研究では,異なるスケールでの事前学習と微調整の結果を近似する分布から,エミュレート・ファインチューニング(EFT)を原理的かつ実用的なサンプリング法として導入する。
EFTは、追加トレーニングを伴わずに、有益性や無害性といった競合する行動特性をテスト時間で調整できることを示す。
最後に、LMアップスケーリングと呼ばれるエミュレートされたファインチューニングの特殊な場合において、小さなファインチューニングモデルと組み合わせることで、大きな事前学習モデルのリソース集約的なファインチューニングを回避する。
論文 参考訳(メタデータ) (2023-10-19T17:57:16Z) - TWINS: A Fine-Tuning Framework for Improved Transferability of
Adversarial Robustness and Generalization [89.54947228958494]
本稿では,様々な分類タスクにおいて,逆向きに事前訓練されたモデルの微調整に焦点を当てる。
本稿では,TWINS(Two-WIng NormliSation)ファインチューニングフレームワークを提案する。
TWINSは、一般化とロバスト性の両方の観点から、幅広い画像分類データセットに有効であることが示されている。
論文 参考訳(メタデータ) (2023-03-20T14:12:55Z) - Informative regularization for a multi-layer perceptron RR Lyrae
classifier under data shift [3.303002683812084]
本稿では,情報正規化とアドホックなトレーニング手法に基づくスケーラブルで容易に適応可能なアプローチを提案し,シフト問題を緩和する。
提案手法は,特徴量からの知識をニューラルネットワークに組み込むことで,基礎となるデータシフト問題を管理する。
論文 参考訳(メタデータ) (2023-03-12T02:49:19Z) - Slimmable Networks for Contrastive Self-supervised Learning [69.9454691873866]
自己教師付き学習は、大規模なモデルを事前訓練する上で大きな進歩を遂げるが、小さなモデルでは苦労する。
追加の教師を必要とせず、訓練済みの小型モデルを得るための1段階のソリューションも導入する。
スリム化可能なネットワークは、完全なネットワークと、様々なネットワークを得るために一度にトレーニングできるいくつかの重み共有サブネットワークから構成される。
論文 参考訳(メタデータ) (2022-09-30T15:15:05Z) - Two-Stage Fine-Tuning: A Novel Strategy for Learning Class-Imbalanced
Data [11.66734752179563]
長い尾の分散データの分類は難しい問題である。
トレーニング済みのモデルを下流タスクに転送する場合、特に微調整では、テールクラスでの学習は困難である。
本稿では,2段階のファインチューニングを提案する。まず,事前訓練されたモデルの最終層をクラスバランスの再重み付け損失で微調整し,次に標準のファインチューニングを実行する。
論文 参考訳(メタデータ) (2022-07-22T03:39:51Z) - Predicting Training Time Without Training [120.92623395389255]
我々は、事前訓練された深層ネットワークが損失関数の所定の値に収束する必要がある最適化ステップの数を予測する問題に取り組む。
我々は、微調整中の深部ネットワークのトレーニングダイナミクスが線形化モデルによってよく近似されているという事実を活用する。
トレーニングをする必要なく、特定の損失にモデルを微調整するのに要する時間を予測できます。
論文 参考訳(メタデータ) (2020-08-28T04:29:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。