論文の概要: MANGO: Meta-Adaptive Network Gradient Optimization for Online Continual Learning
- arxiv url: http://arxiv.org/abs/2605.19080v1
- Date: Mon, 18 May 2026 20:11:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 15:03:08.973623
- Title: MANGO: Meta-Adaptive Network Gradient Optimization for Online Continual Learning
- Title(参考訳): MANGO: オンライン連続学習のためのメタ適応型ネットワーク勾配最適化
- Authors: Ankita Awasthi, Marco Apolinario, Kaushik Roy,
- Abstract要約: Online Continual Learning (OCL)では、ニューラルネットワークは、制限されたメモリ再生バッファにのみアクセス可能な単一のパスで、非定常データストリームから順次学習する。
既存の方法は、リプレイベースのリハーサル、出力レベルの蒸留、固定正規化、あるいは現在のデータでのメタラーニングによる忘れを抑える。
OCL フレームワークである Meta-Adaptive Network Gradient Optimization (MANGO) を提案する。
- 参考スコア(独自算出の注目度): 6.996743265827468
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In Online Continual Learning (OCL), a neural network sequentially learns from a non-stationary data stream in a single-pass with access only to a limited memory replay buffer. This contrasts sharply with off-line continual learning where training is multiple epoch dependent on large datasets. The main challenge faced by OCL is to overcome catastrophic forgetting of past tasks (stability) while learning new ones efficiently (plasticity). Existing methods counter forgetting via replay-based rehearsal, output level distillation, fixed regularization, or meta-learning on the current data. However, these methods have limitations: rehearsal introduces a stored sample bias; distillation operates on output-distributions without modulating parameter updates; fixed-regularization penalizes parameters irrespective of sensitivity; stream-only meta-learning lacks a feedback controlled parameter update. We propose Meta-Adaptive Network Gradient Optimization (MANGO), an OCL framework that balances stability-plasticity via gradient-gating and meta-learned regularization. Gradient-gating scales parameter updates based on sensitivity, preventing destructive updates. Meta-learned regularization adapts stability coefficients, evaluating the effect of parameter update on replay. In MANGO, replay acts as both a training signal and a forgetting evaluator. We evaluated our method on three standard OCL benchmark datasets. MANGO outperforms strong baselines, achieving state-of-the-art results with consistent performance across replay sizes. In domain incremental learning on CLEAR-10 and class incremental learning on CIFAR-100 and Tiny-ImageNet, it achieves highest accuracy among all baselines and achieves positive Backward Transfer, overcoming forgetting on CLEAR-10.
- Abstract(参考訳): Online Continual Learning (OCL)では、ニューラルネットワークは、制限されたメモリ再生バッファにのみアクセス可能なシングルパスで、非定常データストリームから順次学習する。
これは、トレーニングが大規模データセットに依存する複数のエポックなオフライン連続学習とは対照的である。
OCLが直面している主な課題は、新しいタスク(可塑性)を効率的に学習しながら、過去のタスク(安定性)の破滅的な忘れを克服することである。
既存の方法は、リプレイベースのリハーサル、出力レベルの蒸留、固定正規化、あるいは現在のデータでのメタラーニングによる忘れを抑える。
しかし、これらの手法には制限がある:リハーサルはサンプルバイアスを格納し、蒸留はパラメータ更新を調整せずに出力分布を制御し、固定規則化は感度に関係なくパラメータを罰する。
OCL フレームワークである Meta-Adaptive Network Gradient Optimization (MANGO) を提案する。
Gradient-gatingは、感度に基づいてパラメータ更新をスケールし、破壊的な更新を防ぐ。
メタ学習正規化は安定性係数に適応し、パラメータ更新が再生に与える影響を評価する。
MANGOでは、リプレイはトレーニング信号と忘れる評価器の両方として機能する。
提案手法を3つの標準OCLベンチマークデータセットで評価した。
MANGOは強力なベースラインを上回り、リプレイサイズで一貫したパフォーマンスで最先端の結果を達成する。
CIFAR-100とTiny-ImageNetのドメインインクリメンタル学習では,すべてのベースラインで高い精度を達成し,下位転送を正に達成し,CLEAR-10の忘れを克服する。
関連論文リスト
- Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training [50.86545293331458]
強化学習は、教師付き学習よりも構造的に難しい。
本稿では,固定クリッピングを政策比率の正規化された有効サンプルサイズに置き換える,単純かつ効果的なバッチ適応目的を提案する。
論文 参考訳(メタデータ) (2026-05-12T16:44:47Z) - Towards Realistic Class-Incremental Learning with Free-Flow Increments [17.558920457942936]
本稿では,自由フロー到着時のCIL学習のためのモデルに依存しないフレームワークを提案する。
これは、サンプル周波数重み付き損失を一様に集約されたクラス条件監督に置き換えるクラスワイド平均(CWM)の目的を含む。
FFCIL下での各種CIL基線における明らかな性能劣化を実験により確認した。
論文 参考訳(メタデータ) (2026-04-03T06:19:58Z) - GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning [55.03441672267886]
強化学習のための勾配整列データ選択法GradAlignを提案する。
GradAlignは,信頼できない報酬信号,分散不均衡,低ユーティリティトレーニングコーパスの3つにまたがって評価する。
論文 参考訳(メタデータ) (2026-02-25T01:54:50Z) - Online Continual Learning for Time Series: a Natural Score-driven Approach [2.8989185098518626]
オンライン連続学習(OCL)手法は、過去の知識を忘れずに環境の変化に適応する。
オンライン時系列予測(OTSF)は、データが時間とともに進化し、成功は、迅速な適応と長期記憶の両方に依存する現実世界の問題である。
本稿では,時系列法とOCLの理論的および実践的関係を強化することを目的とする。
論文 参考訳(メタデータ) (2026-01-19T10:31:01Z) - Beyond Freezing: Sparse Tuning Enhances Plasticity in Continual Learning with Pre-Trained Models [10.904981532789824]
事前訓練されたモデルによる継続的な学習は、シーケンシャルなタスクにまたがる効率的な適応を大いに約束する。
既存のアプローチはPTMを凍結し、プロンプトやアダプタのような補助モジュールに依存している。
MIST(Mutual Information-Guided Sparse Tuning)は,PTMパラメータのサブセットを選択的に更新するプラグイン・アンド・プレイ方式である。
論文 参考訳(メタデータ) (2025-05-26T13:09:25Z) - Online Curvature-Aware Replay: Leveraging $\mathbf{2^{nd}}$ Order Information for Online Continual Learning [2.0165668334347187]
我々は、リプレイデータに対する明示的なKL分割制約により、リプレイベースのオンライン共同最適化を定式化する。
非IDデータに対する連続的な2次最適化にFIMの推定を適用する方法について述べる。
OCARは3つの異なるベンチマークでトレーニングプロセスを通して高い平均精度を達成するために、連続的なメトリクスで最先端の手法より優れている。
論文 参考訳(メタデータ) (2025-02-03T22:31:36Z) - ALoRE: Efficient Visual Adaptation via Aggregating Low Rank Experts [71.91042186338163]
ALoREは、Kroneckerによって構築された超複素パラメータ化空間をAggregate Low Rank Expertsに再利用する新しいPETL法である。
巧妙な設計のおかげで、ALoREは無視できる余分なパラメータを保持し、凍ったバックボーンに強制的にマージできる。
論文 参考訳(メタデータ) (2024-12-11T12:31:30Z) - Large Continual Instruction Assistant [59.585544987096974]
CIT(Continuous Instruction Tuning)は、大規模モデルにデータによる人間の意図データに従うよう指示するために用いられる。
既存の更新勾配は、CITプロセス中に前のデータセットのパフォーマンスを著しく損なうことになる。
本稿では,この課題に対処する汎用的な連続的命令チューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-08T11:24:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。