論文の概要: Forgetting in Language Models: Capacity, Optimization, and Self-Generated Replay
- arxiv url: http://arxiv.org/abs/2605.26097v1
- Date: Mon, 25 May 2026 17:54:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:20.644822
- Title: Forgetting in Language Models: Capacity, Optimization, and Self-Generated Replay
- Title(参考訳): 言語モデルにおけるフォーミング: キャパシティ、最適化、自己生成リプレイ
- Authors: Martin Marek, Dongkyu Cho, Shikai Qiu, Rumi Chunara, Pavel Izmailov, Andrew Gordon Wilson,
- Abstract要約: 自己生成サンプルが効果的な再生データとして機能し、ほとんど忘れられないことを示す。
モデルがキャパシティをほとんど持たない場合には、忘れることが継続する。
- 参考スコア(独自算出の注目度): 44.18996691373878
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Models trained on a new task typically degrade on prior tasks, a phenomenon known as forgetting. Traditionally, mitigating forgetting has required replaying stored exemplars from prior tasks, which is often impractical. By contrast, language models can sample from their own training distribution, and we show that these self-generated samples serve as effective replay data, nearly eliminating forgetting. We find that forgetting nonetheless persists when the model has little remaining capacity: models pretrained close to saturation cannot absorb new information without overwriting prior knowledge. When capacity is not the limiting factor, low learning rates reduce forgetting but require substantially more training steps. Replay breaks this tradeoff, enabling fast, high-learning-rate finetuning without forgetting.
- Abstract(参考訳): 新しいタスクで訓練されたモデルは、通常、忘れることとして知られる、以前のタスクで劣化する。
伝統的に、忘れることを減らすには、以前のタスクから格納された例を再生する必要があるが、これはしばしば非現実的である。
対照的に、言語モデルは、自身のトレーニング分布からサンプリングすることができ、これらの自己生成サンプルが効果的なリプレイデータとして機能し、ほとんど忘れられないことを示す。
飽和に近い事前訓練されたモデルは、事前知識を上書きすることなく、新しい情報を吸収することはできない。
キャパシティが制限要因ではない場合、低学習率は忘れを減らし、トレーニングのステップを大幅に増やす必要がある。
Replayはこのトレードオフを破り、忘れずに高速でハイラーニングの微調整を可能にします。
関連論文リスト
- Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning [30.941068379610794]
我々は,スクラッチからトレーニングした大規模事前学習型視覚言語行動(VLA)モデルの挙動について検討した。
トレーニング済みのVLAは、スクラッチからトレーニングした小さなポリシーモデルと比較して、忘れることに対して極めて抵抗的であることが分かりました。
本分析により,下流の連続学習性能において,事前学習が重要な役割を担っていることが明らかとなった。
論文 参考訳(メタデータ) (2026-03-04T08:03:13Z) - Continual Learning via Sparse Memory Finetuning [58.163704181154834]
本稿では,スパースパラメータの更新が大惨事な忘れをせずに学習を可能にするかどうかを考察する。
事前学習データの使用に関する新しい知識によって活性化されるメモリスロットのみを更新することにより、新しい知識とモデルの既存の能力との干渉を減らすことができる。
スパースメモリの微調整は、忘れることを大幅に減らしながら、新しい知識を学習することを発見した。
論文 参考訳(メタデータ) (2025-10-16T19:44:38Z) - From Acceleration to Saturation: Scaling Behavior of Bootstrapped Language Model Pretraining [2.569647910019739]
ブートストラッププレトレーニングのスケーリング挙動について検討し,そのスケーリング効率が予測可能な方法で低下することを確認した。
本研究は,効率的な言語モデル学習のための実践的知見を提供し,過度に訓練されたモデルの再利用に関する重要な考察を提起する。
論文 参考訳(メタデータ) (2025-10-08T00:59:33Z) - Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models [19.136589266017694]
大規模言語モデルのトレーニングは通常、大量のコーパスで事前トレーニングを行う。
新しいデータは、しばしば分散シフトを引き起こし、以前に学習したタスクのパフォーマンスが低下する。
この分散シフトに対処するための2つの一般的な提案、すなわちエクスペリエンスのリプレイとアライメントアライメントについて、より深く検討する。
論文 参考訳(メタデータ) (2025-08-03T20:07:15Z) - AutoElicit: Using Large Language Models for Expert Prior Elicitation in Predictive Modelling [53.54623137152208]
我々はAutoElicitを導入し、大規模言語モデルから知識を抽出し、予測モデルのための事前構築を行う。
これらの先行情報は情報的であり、自然言語を用いて洗練できることを示す。
AutoElicitは、非形式的な事前よりもエラーを大幅に減らし、ラベルを減らし、コンテクスト内学習を一貫して上回ります。
論文 参考訳(メタデータ) (2024-11-26T10:13:39Z) - Controlling Forgetting with Test-Time Data in Continual Learning [15.455400390299593]
継続学習研究は、新しい知識が得られたときの過去の情報の破滅的な忘れを克服する技術を提供する。
テストタイムデータには,従来の学習タスクのモデルメモリをリフレッシュするために,自己管理的な方法で活用できる優れた情報がある,と我々は主張する。
論文 参考訳(メタデータ) (2024-06-19T15:56:21Z) - Embedding Recycling for Language Models [38.11465250435789]
我々は, 埋込みリサイクル(ER)によるそのような環境下での計算コストの削減について検討する。
我々は、事前訓練されたモデルから中間層の出力をキャッシュし、残りのレイヤを微調整して新しいタスクを行う方法を提案する。
本研究では,本手法が学習中の100%の高速化,55~86%の推論速度向上を実現し,学術領域におけるテキスト分類とエンティティ認識タスクの精度への影響を無視できることを示した。
論文 参考訳(メタデータ) (2022-07-11T16:36:14Z) - BERT WEAVER: Using WEight AVERaging to enable lifelong learning for
transformer-based models in biomedical semantic search engines [49.75878234192369]
We present WEAVER, a simple, yet efficient post-processing method that infuse old knowledge into the new model。
WEAVERを逐次的に適用すると、同じ単語の埋め込み分布が、一度にすべてのデータに対する総合的なトレーニングとして得られることを示す。
論文 参考訳(メタデータ) (2022-02-21T10:34:41Z) - Automatic Recall Machines: Internal Replay, Continual Learning and the
Brain [104.38824285741248]
ニューラルネットワークのリプレイには、記憶されたサンプルを使ってシーケンシャルなデータのトレーニングが含まれる。
本研究では,これらの補助サンプルをフライ時に生成する手法を提案する。
代わりに、評価されたモデル自体内の学習したサンプルの暗黙の記憶が利用されます。
論文 参考訳(メタデータ) (2020-06-22T15:07:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。