論文の概要: Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining
- arxiv url: http://arxiv.org/abs/2606.16246v2
- Date: Fri, 19 Jun 2026 17:02:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.147549
- Title: Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining
- Title(参考訳): データ制約付き言語モデル事前学習のためのデミスティフィケーショントレーニング-時間拡張
- Abstract要約: 言語モデルの事前訓練は、データ制約付き、計算能力のある体制へと移行しつつある。
トークンレベルのノイズ,シーケンス順列,ターゲットオフセット予測という,AR事前学習のための拡張の3つのカテゴリを紹介した。
個々の強化がオーバーフィッティングを遅らせ、ベースラインに対する検証損失が低下していることが判明した。
- 参考スコア(独自算出の注目度): 6.5664347332837
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As AI labs approach a data ceiling where compute capacity outpaces the rate of new high-quality text generation, language model pretraining is shifting toward a data-constrained, compute-abundant regime that demands productive multi-epoch training on fixed corpora. Standard autoregressive (AR) pretraining overfits severely in this setting, reaching its optimum early and then continuously deteriorating. We investigate training-time data augmentation as a regularizer to mitigate this overfitting and enable productive training for hundreds of epochs on the same data. We introduce three orthogonal categories of augmentation for AR pretraining: token-level noise (masking, random replacement), sequence permutations (right-to-left prediction, Fill-in-the-Middle), and target offset prediction ($x_{t+i}$ for $i > 1$). Through systematic ablations, we find that individual augmentations delay overfitting and lower validation loss relative to the baseline, with random token replacement achieving the best minimum loss among individual methods. Combining augmentation categories further lowers the minimum validation loss. Our experiments demonstrate that data augmentations mitigate AR pretraining's data inefficiency and offer a promising solution to the data-constrained regime~\footnote{All code and data are available at https://github.com/ michaelchen-lab/ data-augmentations-for-pretraining.
- Abstract(参考訳): AIラボが計算能力が新しい高品質テキスト生成の速度を上回るようなデータ天井に近づくにつれ、言語モデルの事前訓練は、固定されたコーパス上で生産的なマルチエポックトレーニングを要求する、データに制約のある計算能力のある体制へとシフトしつつある。
標準自己回帰(AR)事前訓練は、この設定において過度に適合し、その最適を早期に達成し、連続的に劣化する。
我々は、この過度な適合を緩和し、同じデータ上で数百のエポックに対する生産的トレーニングを可能にするために、レギュレータとしてのトレーニング時間データ拡張について検討する。
トークンレベルのノイズ(マスキング、ランダム置換)、シーケンス置換(右から左への予測、Fill-in-the-Middle)、ターゲットオフセット予測(x_{t+i}$ for $i > 1$)である。
体系的な改善により,各手法で最大最小損失を達成できるランダムトークン置換により,個々の拡張遅延がオーバーフィットし,ベースラインに対する検証損失が低くなることが判明した。
拡張カテゴリを組み合わせることで、最小限のバリデーション損失が減少する。
我々の実験は、データ拡張がARプリトレーニングのデータ非効率を軽減し、データ制約された状態~\footnote{allコードとデータはhttps://github.com/ Michelchen-lab/ data-augmentations-for-pretrainingで利用可能であることを示す。
関連論文リスト
- Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws [41.26396818761427]
正規化とスケーリングという2つの軸に沿ったデータ制約付き事前学習について検討した。
モデルサイズとデータサイズを結合して、繰り返しデータの下でのインタラクションをキャプチャするスケーリング法則であるSoftQを提案する。
論文 参考訳(メタデータ) (2026-06-05T04:10:09Z) - Prescriptive Scaling Laws for Data Constrained Training [21.261009598515066]
トレーニング計算は、高品質なデータの可用性をますます上回っている。
チンチラスケーリング法は、すべてのトレーニングトークンがユニークであると仮定する。
我々のスケーリング法則は、定性的に新しい計算-最適割り当てアドバイスをもたらす。
論文 参考訳(メタデータ) (2026-05-02T23:14:20Z) - Pre-training under infinite compute [87.02472603429936]
本研究では、エポック数の増加とパラメータ数の増加に対するデータ制約によるアプローチが、最終的には過度に適合することを示す。
独立に訓練されたモデルのアンサンブルは、正規化レシピよりもはるかに低損失の漸近を達成できる。
この結果から,計算量の多い将来において,よりデータ効率の高い事前学習が実現できることが示唆された。
論文 参考訳(メタデータ) (2025-09-18T09:36:23Z) - ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining [53.893792844055106]
大規模言語モデルの事前学習は計算集約的であるが、多くのトークンが学習にわずかに寄与し、非効率になる。
Selective Efficient Language Modelingは、オンライントークンレベルのバッチ選択を行うことで、トレーニング効率と分散ロバスト性を改善するリスク認識アルゴリズムである。
GPT-2プレトレーニング実験の結果、ESLMはベースラインに比べて複雑度と下流性能の両面を維持・改善しながら、トレーニングFLOPを著しく低減することが示された。
論文 参考訳(メタデータ) (2025-05-26T12:23:26Z) - Reasoning to Learn from Latent Thoughts [61.2395150828168]
本研究では,テキスト生成プロセスの根底にある表現的思考を明示的にモデル化し,推論することにより,事前学習データの効率を大幅に向上させることができることを示す。
1B LMは、少なくとも3回の反復でその性能をブートストラップし、生データに基づいてトレーニングされたベースラインを大幅に上回ることを示す。
論文 参考訳(メタデータ) (2025-03-24T16:41:23Z) - Scaling Data-Constrained Language Models [133.2083255645999]
データ制約付きシステムにおける言語モデルのスケーリングについて検討する。
固定された計算予算に対する制約付きデータでは、反復するデータの最大4つのエポックなトレーニングは、ユニークなデータに比べて損失に対する無視可能な変化をもたらす。
本稿では,繰り返しトークンと過剰パラメータの値の減少を考慮に入れた計算最適性のスケーリング法則を提案し,実証的に検証する。
論文 参考訳(メタデータ) (2023-05-25T17:18:55Z) - On-the-fly Denoising for Data Augmentation in Natural Language
Understanding [101.46848743193358]
よりクリーンなオリジナルデータに基づいて訓練された有機教師モデルによって提供されるソフトな拡張ラベルから学習する,データ拡張のためのオンザフライデノケーション手法を提案する。
本手法は,一般的な拡張手法に適用でき,テキスト分類と質問応答の両タスクの性能を一貫して向上させることができる。
論文 参考訳(メタデータ) (2022-12-20T18:58:33Z) - Efficient Augmentation for Imbalanced Deep Learning [8.38844520504124]
本研究では、畳み込みニューラルネットワークの内部表現である不均衡画像データについて検討する。
モデルの特徴埋め込みとテストセットの一般化ギャップを測定し、マイノリティクラスではそのギャップが広いことを示す。
この洞察により、不均衡なデータのための効率的な3相CNNトレーニングフレームワークを設計できる。
論文 参考訳(メタデータ) (2022-07-13T09:43:17Z) - Predicting Training Time Without Training [120.92623395389255]
我々は、事前訓練された深層ネットワークが損失関数の所定の値に収束する必要がある最適化ステップの数を予測する問題に取り組む。
我々は、微調整中の深部ネットワークのトレーニングダイナミクスが線形化モデルによってよく近似されているという事実を活用する。
トレーニングをする必要なく、特定の損失にモデルを微調整するのに要する時間を予測できます。
論文 参考訳(メタデータ) (2020-08-28T04:29:54Z) - Self-Adaptive Training: beyond Empirical Risk Minimization [15.59721834388181]
余分な計算コストを伴わずにモデル予測により問題ラベルを動的に補正する新しいトレーニングアルゴリズムを提案する。
自己適応型トレーニングは、様々なレベルのノイズに対する一般化を著しく改善し、自然と敵対両方のトレーニングにおいて過度に適合する問題を緩和する。
CIFARとImageNetデータセットの実験は、我々のアプローチの有効性を2つのアプリケーションで検証する。
論文 参考訳(メタデータ) (2020-02-24T15:47:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。