論文の概要: Early Data Exposure Improves Robustness to Subsequent Fine-Tuning
- arxiv url: http://arxiv.org/abs/2605.12705v1
- Date: Tue, 12 May 2026 20:08:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:27.660657
- Title: Early Data Exposure Improves Robustness to Subsequent Fine-Tuning
- Title(参考訳): 初期のデータ露光は、その後のファインチューニングのロバスト性を改善する
- Authors: Lawrence Feng, Gaurav R. Ghosal, Jacob Mitchell Springer, Ziqian Zhong, Aditi Raghunathan,
- Abstract要約: 上流でのトレーニング選択が、その能力がいかに頑健に保たれるかを調査する。
初期の露光 - トレーニング後のデータを事前トレーニングに混ぜることで、アップストリームパフォーマンスとダウンストリームパフォーマンスの間のフロンティアを一貫して改善する。
以上の結果から,後続の微調整に対する頑健性は上流トレーニングの第一級目標として扱われるべきであることが示唆された。
- 参考スコア(独自算出の注目度): 26.380638571847815
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: How can we train models whose post-trained capabilities survive subsequent fine-tuning? Rather than focusing on downstream interventions to mitigate forgetting of upstream capabilities, we study how upstream training choices - that is, the manner in which a capability is acquired - shape how robustly that capability is retained. We investigate this question in a controlled three-stage language-model pipeline: pretraining, post-training to acquire a target capability, and downstream fine-tuning on a new objective. Across 135M and 1B models, two post-training domains, and two downstream fine-tuning tasks, we find that immediate post-training performance does not reliably predict retention after subsequent fine-tuning: training recipes that look equivalent immediately after post-training can retain the target capability very differently after subsequent fine-tuning. In particular, early exposure - mixing post-training data into pretraining - consistently improves the frontier between retained upstream performance and downstream performance. In compute-matched experiments, where the target data must be allocated between pretraining and post-training, we find that the optimum lies at neither extreme. Together with our other empirical and theoretical findings, this supports the view that post-training drives immediate specialization while early exposure improves robustness to later forgetting. Replay and dropout, typically used to mitigate forgetting as it occurs during fine-tuning, provide complementary gains to early exposure when applied during post-training. Our findings suggest that robustness to subsequent fine-tuning should be treated as a first-class objective of upstream training, addressed preventatively through choices like early exposure rather than reactively during fine-tuning itself.
- Abstract(参考訳): 後続の微調整を継続するポストトレーニング能力を持つモデルをトレーニングするにはどうすればいいのか?
上流の能力の忘れを緩和するために下流の介入に焦点を当てるのではなく、上流のトレーニング選択 — すなわち、能力を取得する方法 — がいかに堅牢に維持されているかを調査します。
制御された3段階言語モデルパイプライン(事前学習、目標能力獲得のための後学習、新しい目的のための下流微調整)におけるこの問題について検討する。
135Mモデルと1Bモデル,2つの訓練後ドメイン,および2つの下流微調整タスクにおいて,訓練直後のパフォーマンスがその後の微調整後の保持を確実に予測できないことが判明した。
特に、トレーニング後のデータを事前トレーニングに混ぜた早期露出は、アップストリームパフォーマンスとダウンストリームパフォーマンスの間のフロンティアを一貫して改善します。
事前学習と後学習の間に目標データを割り当てなければならない計算マッチング実験では、最適値が極端ではないことが判明した。
他の経験的、理論的な発見とともに、これはポストトレーニングが即時専門化を促進する一方で、初期の露光は後から忘れるほど堅牢性を向上させるという見解を支持する。
リプレイ・アンド・ドロップアウト(Replay and Dropout)は、通常、微調整中に発生する忘れを緩和するために使用され、後トレーニング中に適用された場合、早期露光に対して相補的な利得を提供する。
以上の結果から,後続の微調整に対する堅牢性は上流訓練の第一級目標として扱われるべきであり,早期曝露などの選択によって予防的に対処すべきであると考えられた。
関連論文リスト
- Midtraining Bridges Pretraining and Posttraining Distributions [73.84346031272473]
ミストレイン(Midtraining)とは、事前トレーニングの終了時に、高い品質の命令形式データを混合するフェーズである。
我々は,スクラッチから事前学習した言語モデルを用いた実験を通じて,中等教育に関する最初の体系的な研究を行う。
教師付き微調整の結果と比較すると,数学やコード領域において中等教育の有効性が最も高いことがわかった。
論文 参考訳(メタデータ) (2025-10-16T16:39:52Z) - RLP: Reinforcement as a Pretraining Objective [103.45068938532923]
我々は,情報駆動型強化事前訓練の目的として,強化学習のコアスピリットである探索を,事前訓練の最終段階に導くことを提案する。
このトレーニングの目的は、モデルが次に何が起こるかを予測する前に、自分自身で考えることを奨励し、事前学習の早い段階で独立した思考行動を教えることである。
特に、RLPは、通常のテキストにおける事前学習対象としての推論のための強化学習を再構築し、次のトーケン予測と有用な連鎖推論の出現の間のギャップを埋める。
論文 参考訳(メタデータ) (2025-09-26T17:53:54Z) - A Comparative Study of Pre-training and Self-training [0.40964539027092917]
本研究では,事前学習,自己学習,微調整を併用した,実現可能な訓練パラダイムを実証的に研究するためのアンサンブル手法を提案する。
我々は6つのデータセット、4つのデータ拡張、感情分析と自然言語推論タスクのための不均衡なデータについて実験を行った。
以上の結果から,事前学習と微調整のパラダイムが全体のパフォーマンスに最高の結果をもたらすことが確認された。
論文 参考訳(メタデータ) (2024-09-04T14:30:13Z) - Understanding and Mitigating the Label Noise in Pre-training on
Downstream Tasks [91.15120211190519]
本稿では、事前学習データセットにおけるノイズの性質を理解し、下流タスクへの影響を軽減することを目的とする。
雑音の悪影響を軽減するために特徴空間に適応する軽量ブラックボックスチューニング法(NMTune)を提案する。
論文 参考訳(メタデータ) (2023-09-29T06:18:15Z) - Examining the Effect of Pre-training on Time Series Classification [21.38211396933795]
本研究では, プレトレーニング後の微調整が微調整過程に及ぼす影響について検討した。
150の分類データセットを網羅的に検討した。
事前学習は、データに適合しないモデルの最適化プロセスを改善するのにしか役立ちません。
事前学習データを追加することで一般化は向上しないが、元のデータボリュームの事前学習の利点を強化することができる。
論文 参考訳(メタデータ) (2023-09-11T06:26:57Z) - Self-Distillation for Further Pre-training of Transformers [83.84227016847096]
我々は、さらなる事前学習段階の正則化として自己蒸留を提案する。
画像およびテキスト分類タスクのための様々なベンチマークデータセットにおける自己蒸留の有効性を実証的に検証する。
論文 参考訳(メタデータ) (2022-09-30T02:25:12Z) - On Transfer of Adversarial Robustness from Pretraining to Downstream
Tasks [1.8900691517352295]
下流タスクにおける線形予測子のロバスト性は、その基盤となる表現のロバスト性によって制約できることを示す。
本結果は,適応後の信頼性向上のために,表現関数の要求を特徴付けるための最初のステップを提供する。
論文 参考訳(メタデータ) (2022-08-07T23:00:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。