論文の概要: Time-Incremental Continued Pretraining of LLMs: Knowledge Updates Without Catastrophic Forgetting
- arxiv url: http://arxiv.org/abs/2609.23916v1
- Date: Sun, 20 Sep 2026 22:44:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.018004
- Title: Time-Incremental Continued Pretraining of LLMs: Knowledge Updates Without Catastrophic Forgetting
- Title(参考訳): LLMの経時的事前訓練:破滅的鍛造を伴わない知識更新
- Abstract要約: 大規模な言語モデル(LLM)は、トレーニングが終了する瞬間に時代遅れになるが、スクラッチから再トレーニングするのは違法に高価である。
継続事前学習(Continuoused Pretraining, CPT)は自然療法であるが、典型的には、解離したデータストリームを仮定する連続学習レンズによって評価される。
これは、Webスケールのクローラにおける時間的な更新には適していない。
本研究は,3家系にまたがる6つのオープンウェイトモデルにおいて,この現実的な状況下での時間的CPTについて検討した。
- 参考スコア(独自算出の注目度): 20.354692758968014
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) drift out of date the moment their pretraining ends, yet retraining from scratch is prohibitively expensive. Continued pretraining (CPT) is the natural remedy, but it is typically evaluated through a continual learning lens that assumes disjoint data streams. This is a poor fit for time-incremental updates on web-scale crawls, where successive snapshots share substantial URL overlap by design. We study time-incremental CPT in this realistic regime: continued pretraining on FineWeb-Edu dumps drawn strictly from after each model's knowledge cutoff, evaluated across six open-weight models spanning three families (OLMo2, Llama-3.1/3.2, Gemma-3-1B) and four parameter scales (1B-3B-7B-8B). We organize our findings around four practical questions. (i) Is knowledge acquired? Yes, but heterogeneously, and without catastrophic forgetting: five of six models also improve on pre-cutoff factual recall, and the gains track pretraining saturation (driven primarily by token budget per parameter). (ii) What does it cost? Almost nothing: the macro-average across a thirteen-task suite stays within 0.01 of the base for every model. (iii) What is the recipe? Data quality dominates quantity (a curated 6B-token slice matches a broader 40B one); the optima for knowledge acquisition and general capability are separated by roughly an order of magnitude in learning rate; and LoRA at sufficient rank matches full CPT. (iv) Does it survive deployment? CPT gains transfer through SFT, while DPO's effect is family-dependent. Together, these results paint a more optimistic picture of time-incremental CPT than the prior continual learning literature suggests.
- Abstract(参考訳): 大規模な言語モデル(LLM)は、トレーニングが終了する瞬間に時代遅れになるが、スクラッチから再トレーニングするのは違法に高価である。
継続事前学習(Continuoused Pretraining, CPT)は自然療法であるが、典型的には、解離したデータストリームを仮定する連続学習レンズによって評価される。
これは、Webスケールのクローラにおける時間的な更新には適していない。
両モデルの知識遮断後から厳密に抽出されたFineWeb-Eduダンプの事前学習を継続し、3つのファミリー(OLMo2, Llama-3.1/3.2, Gemma-3-1B)と4つのパラメータスケール(1B-3B-7B-8B)にまたがる6つのオープンウェイトモデルで評価した。
実践的な4つの質問に関する調査結果を整理する。
一 知識は得ているか。
6つのモデルのうち5つは、カットオフ前のファクトリコールを改善し、ゲインは(主にトークン毎の予算によって)事前トレーニングされた飽和を追跡します。
(ii)費用はいくらですか。
13タスクスイートのマクロ平均値は、すべてのモデルにおいて、ベースから0.01以内に留まる。
(三)レシピは何ですか。
データ品質が支配的(キュレートされた6Bトーケンスライスは、より広い40Bスライスと一致する)、知識獲得と一般能力の最適化は、学習率のおよそ1桁のオーダーで分離され、十分なランクのLoRAは完全なCPTと一致する。
(iv) デプロイは生き残るか?
CPTはSFTを介して転移し、DPOの効果はファミリー依存的である。
これらの結果は,従来の継続学習文献が示唆するよりも,より楽観的なCPT像を描いている。
関連論文リスト
- RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - Fast Unlearning at Scale via Margin Self-Correction [52.46927918952516]
言語モデルアンラーニングは、トレーニングモデルを更新して、選択したトレーニング例を見ていないかのように振る舞う。
MASCは、既存のベースラインの計算コストのごく一部で、競争力のある忘れがちなトレードオフを達成する。
論文 参考訳(メタデータ) (2026-06-01T21:49:54Z) - Understanding Data Temporality Impact on Large Language Models Pre-training [3.679526459634607]
大型言語モデル(LLM)は一般にシャッフルコーパスで訓練される。
本研究では,事前学習のダイナミクスが時間に敏感な事実知識の獲得に与える影響について検討する。
論文 参考訳(メタデータ) (2026-05-21T17:31:17Z) - Anatomy of Unlearning: The Dual Impact of Fact Salience and Model Fine-Tuning [59.19460954480119]
忘れられた知識が事前学習や教師付き微調整に由来するかどうかを考察する。
実験の結果,事前学習モデルとSFTモデルは未学習に対して異なる反応を示した。
論文 参考訳(メタデータ) (2026-02-23T08:58:48Z) - Beyond Cosine Decay: On the effectiveness of Infinite Learning Rate Schedule for Continual Pre-training [28.73282119260246]
ラベルのないデータは、人工知能システムのトレーニングの機会と課題の両方を提示します。
自己教師付き学習は、大量のラベルのないデータから有意義な表現を抽出する強力なパラダイムとして現れてきたが、既存の手法は、それまでの知識を忘れずに、実世界のデータストリームの静的で非IID的な性質に適応することに苦慮している。
本研究では,最近提案された無限学習率スケジュールと広く使用されているコサインスケジュールを体系的に比較し,後者がより効果的な方法であることを示す。
論文 参考訳(メタデータ) (2025-03-04T18:15:57Z) - Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training [68.94373533768501]
我々は、知識保持をモデル化し、そのコーパスから事実情報を記憶するための事前学習言語モデルの能力を示し、学習前にそれを推定する原則的手法を導入する。
本稿では,知識周波数,知識特異度,モデルサイズを統合し,クローズドブック質問応答(QA)の精度を予測する情報理論予測器である,サイズ依存型相互情報(SMI)を提案する。
論文 参考訳(メタデータ) (2025-02-06T13:23:53Z) - Efficient Continual Pre-training by Mitigating the Stability Gap [68.49269649759005]
本研究では,Large Language Models (LLM) の継続事前学習における挙動について検討する。
固定された計算予算内でのLLM性能を向上させるための3つの効果的な戦略を提案する。
当社の戦略は,OpenLlama-3Bモデルの平均医療タスク性能を36.2%から40.7%に改善し,当初のトレーニング予算の40%に過ぎなかった。
論文 参考訳(メタデータ) (2024-06-21T02:28:37Z) - Rephrasing the Web: A Recipe for Compute and Data-Efficient Language
Modeling [27.975832264345772]
本稿では,Web上の文書をパラフレーズ化するために,既製の命令調整モデルを用いたWeb Rephrase Augmented Pre-training(textbfWRAP$)を提案する。
自然にノイズの多いC4データセットでWRAPを使用することで、プリトレーニングを$sim3x$で高速化する。
同じトレーニング済みの計算予算で、Pileのさまざまなサブセットで平均して10%以上のパープレキシティを改善し、13のタスクでゼロショットの質問応答精度を2%以上改善する。
論文 参考訳(メタデータ) (2024-01-29T18:19:08Z) - Confidence-Guided Learning Process for Continuous Classification of Time
Series [7.047989935886483]
実世界では、時系列のクラスは通常最終時にラベル付けされるが、多くのアプリケーションは各時点の時系列を分類する必要がある。
我々は新しい概念である連続時系列分類(CCTS)を提案する。
しかし、時系列は動的に進化し、異なるデータ分布へと繋がる。
論文 参考訳(メタデータ) (2022-08-14T17:00:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。