論文の概要: Local Support Learning
- arxiv url: http://arxiv.org/abs/2610.02126v1
- Date: Thu, 01 Oct 2026 17:39:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.338271
- Title: Local Support Learning
- Title(参考訳): 地域支援学習
- Abstract要約: Local Support Learningは、事前データにアクセスせずに事前機能を維持するための勾配ベースのトレーニングを強化する。
本手法は,最大70億個のパラメータのLLMにおける誤りを解消できることを示す。
- 参考スコア(独自算出の注目度): 28.443334391996796
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We explore catastrophic forgetting in the context of large pre-trained models. By considering forgetting as a geometric problem in the input space of each weight matrix, we uncover a natural retention objective under which updates produced by gradient-based optimizers are suboptimal. Following this observation, we propose Local Support Learning (LSL), a general-purpose framework that augments gradient-based training for retention of prior capabilities without access to prior data. During a new learning phase, LSL pairs two components with distinct roles: a standard weight adapter, trained as usual to minimize the loss, and a gating function that enables the adapter only on input activations from its own training distribution, making the update local to that distribution. The key challenge is that this gate must route data from all learning phases while training only on data from the current one. We address this with a gate based on a Gaussian Mixture Model (GMM), whose likelihood decays rapidly away from its training data, giving it a natural tendency to stay closed on data from prior phases. We show that this post-training approach can resolve forgetting in LLMs of up to 7 billion parameters, retaining both pretrained and finetuned capabilities across multiple training phases, while being efficient in memory and compute, robust to hyperparameter choice, and showing scaling potential.
- Abstract(参考訳): 我々は、大規模な事前学習モデルの文脈で破滅的な忘れ方を探究する。
各重み行列の入力空間における幾何学的問題として忘れることを検討することにより、勾配に基づく最適化器による更新が最適以下である自然保持目的を明らかにする。
そこで本研究では,事前データへのアクセスを必要とせずに,事前能力の維持のためのグラデーションベーストレーニングを強化する汎用フレームワークであるLocal Support Learning (LSL)を提案する。
新しい学習フェーズにおいて、LSLは2つの異なる役割を持つコンポーネントをペアリングする: 標準のウェイトアダプタは、損失を最小限に抑えるために通常通りに訓練され、アダプタは、自身のトレーニングディストリビューションからの入力アクティベーションのみを許容するゲーティング機能により、その分布にローカルに更新される。
重要な課題は、このゲートがすべての学習フェーズからデータをルーティングし、現在のフェーズのデータのみをトレーニングしなければならないことだ。
本稿では,ガウス混合モデル(GMM)に基づくゲートを用いてこの問題に対処する。
このポストトレーニングアプローチは、最大70億のパラメータのLLMにおける忘れを解消し、複数のトレーニングフェーズにわたる事前訓練と微調整の両方の能力を維持しながら、メモリと計算の効率、高パラメータ選択の堅牢性、スケーリングの可能性を示す。
関連論文リスト
- Miles: Metric Learning with Expandable Subspace for Pre-Trained Model-Based Class-Incremental Learning [57.237835833636154]
本稿では,事前学習された知識の事前情報を活用するために,拡張可能なサブスペース(マイル)を用いたMetrIc Learningを提案する。
Milesは様々なCIL設定で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-20T06:22:02Z) - Efficient and Adaptive Human Activity Recognition via LLM Backbones [39.42078885809324]
本稿では,大規模事前学習言語モデル(LLM)をセンサベースHARの汎用時間バックボーンとして再利用するパラダイムシフトを提案する。
提案手法は, 高速収束, 強力なデータ効率, 堅牢なデータ転送を実現する。
論文 参考訳(メタデータ) (2026-05-12T12:06:39Z) - What Do Learning Dynamics Reveal About Generalization in LLM Reasoning? [83.83230167222852]
モデルの一般化動作は,事前記憶列車の精度と呼ばれるトレーニング指標によって効果的に特徴づけられることがわかった。
モデルの学習行動と一般化を結びつけることで、トレーニング戦略に目標とする改善を導くことができる。
論文 参考訳(メタデータ) (2024-11-12T09:52:40Z) - Adaptive Memory Replay for Continual Learning [29.333341368722653]
新たなデータが利用可能になれば、ファンデーションモデルの更新は破滅的な忘れに繋がる」
連続学習のための適応型メモリリプレイの枠組みを導入し、過去のデータのサンプリングをマルチアームバンディット問題と表現する。
我々は,学習効率を犠牲にすることなく,最大10%の忘れ込みを低減しつつ,高い性能を維持するアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2024-04-18T22:01:56Z) - Towards Seamless Adaptation of Pre-trained Models for Visual Place Recognition [72.35438297011176]
視覚的位置認識のための事前学習モデル(VPR)のシームレスな適応を実現する新しい手法を提案する。
具体的には、地域を識別するための有意義なランドマークに焦点を当てたグローバルな特徴とローカルな特徴の両方を得るために、ハイブリッド適応法を設計する。
実験結果から,本手法はトレーニングデータやトレーニング時間が少なく,最先端の手法よりも優れていることがわかった。
論文 参考訳(メタデータ) (2024-02-22T12:55:01Z) - SPDF: Sparse Pre-training and Dense Fine-tuning for Large Language
Models [4.114555639014612]
本研究は,非構造的重み空間を用いて,事前訓練中にのみ重みのサブセットを訓練する利点を示す。
我々は1.3Bパラメータ GPT-3 XL モデルに最大75%の間隔を誘導できることを示す。
論文 参考訳(メタデータ) (2023-03-18T17:56:01Z) - The Power and Limitation of Pretraining-Finetuning for Linear Regression
under Covariate Shift [127.21287240963859]
本研究では,対象データに基づく事前学習と微調整を併用した伝達学習手法について検討する。
大規模な線形回帰インスタンスの場合、$O(N2)$ソースデータによる転送学習は、$N$ターゲットデータによる教師あり学習と同じくらい効果的である。
論文 参考訳(メタデータ) (2022-08-03T05:59:49Z) - Acceleration of Federated Learning with Alleviated Forgetting in Local
Training [61.231021417674235]
フェデレートラーニング(FL)は、プライバシを保護しながら機械学習モデルの分散最適化を可能にする。
我々は,FedRegを提案する。FedRegは,局所的な訓練段階において,知識を忘れることなくFLを加速するアルゴリズムである。
我々の実験は、FedRegはFLの収束率を著しく改善するだけでなく、特にニューラルネットワークアーキテクチャが深い場合にも改善することを示した。
論文 参考訳(メタデータ) (2022-03-05T02:31:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。