論文の概要: Vision Transformers that Never Stop Learning
- arxiv url: http://arxiv.org/abs/2603.07787v1
- Date: Sun, 08 Mar 2026 20:07:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-10 15:13:15.215976
- Title: Vision Transformers that Never Stop Learning
- Title(参考訳): 学習をやめない視覚変換器
- Abstract要約: 視覚変換器(ViT)の可塑性損失に関する系統的研究について述べる。
分析の結果,重み付きアテンションモジュールは可塑性損失を増大させる不安定性を示し,フィードフォワードネットワークモジュールはより顕著に劣化することがわかった。
本稿では,アテンションモジュールのオンライン曲率推定値を用いて方向を適応的に変換することで,可塑性を保った幾何学的認識モデルであるARROWを提案する。
- 参考スコア(独自算出の注目度): 13.804234595369058
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Loss of plasticity refers to the progressive inability of a model to adapt to new tasks and poses a fundamental challenge for continual learning. While this phenomenon has been extensively studied in homogeneous neural architectures, such as multilayer perceptrons, its mechanisms in structurally heterogeneous, attention-based models such as Vision Transformers (ViTs) remain underexplored. In this work, we present a systematic investigation of loss of plasticity in ViTs, including a fine-grained diagnosis using local metrics that capture parameter diversity and utilization. Our analysis reveals that stacked attention modules exhibit increasing instability that exacerbates plasticity loss, while feed-forward network modules suffer even more pronounced degradation. Furthermore, we evaluate several approaches for mitigating plasticity loss. The results indicate that methods based on parameter re-initialization fail to recover plasticity in ViTs, whereas approaches that explicitly regulate the update process are more effective. Motivated by this insight, we propose ARROW, a geometry-aware optimizer that preserves plasticity by adaptively reshaping gradient directions using an online curvature estimate for the attention module. Extensive experiments show that ARROW effectively improves plasticity and maintains better performance on newly encountered tasks.
- Abstract(参考訳): 可塑性の喪失は、モデルが新しいタスクに適応できないことを示し、継続的な学習に根本的な課題を提起する。
この現象は多層パーセプトロンのような均質な神経構造において広く研究されているが、その構造的に異質な視覚変換器(ViTs)のような注意に基づくモデルにおけるメカニズムは未解明のままである。
本研究では, パラメータの多様性と利用率を計測する局所的指標を用いた微粒化診断を含む, ViTsの可塑性損失の系統的研究を行う。
分析の結果,重み付きアテンションモジュールは可塑性損失を増大させる不安定性を示す一方,フィードフォワードネットワークモジュールはより顕著に劣化することが明らかとなった。
さらに, 可塑性損失軽減のためのいくつかの手法について検討した。
その結果、パラメータ再初期化に基づく手法は、ViTの可塑性回復に失敗するが、更新プロセスを明示的に規制するアプローチはより効果的であることが示唆された。
この知見により,アテンションモジュールのオンライン曲率推定値を用いて勾配方向を適応的に整形することで,塑性を保ち得る幾何認識最適化器であるARROWを提案する。
大規模な実験により、ARROWは塑性を効果的に改善し、新しく遭遇したタスクにおいてより良い性能を維持することが示されている。
関連論文リスト
- The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning [62.72522261010872]
深部強化学習(RL)は、非定常性の性質により、可塑性の喪失に苦しむ。
ネットワーク最適化の理論的観点から, 可塑性損失問題について検討する。
勾配等級を復元する軽量な手法であるサンプル重み決定法を提案する。
論文 参考訳(メタデータ) (2026-04-02T11:29:46Z) - Rethinking Plasticity in Deep Reinforcement Learning [3.18807491942654]
本稿では, 深部強化学習(RL)における塑性損失の基本的なメカニズムについて検討する。
本稿では,従来のタスクの最適点が,新しいタスクの局所的最適度に乏しいため,可塑性損失が発生することを示唆する最適化・中心塑性(OCP)仮説を提案する。
複雑なドメインにおけるネットワーク可塑性の理解と復元のための厳密な最適化に基づくフレームワークを提供する。
論文 参考訳(メタデータ) (2026-03-22T11:27:16Z) - Plasticine: Accelerating Research in Plasticity-Motivated Deep Reinforcement Learning [122.67854581396578]
Plasticineは、深層強化学習における塑性最適化をベンチマークするためのオープンソースのフレームワークである。
Plasticineは13以上の緩和メソッド、評価メトリクス10、学習シナリオの単一ファイル実装を提供する。
論文 参考訳(メタデータ) (2025-04-24T12:32:13Z) - Model Hemorrhage and the Robustness Limits of Large Language Models [119.46442117681147]
大規模言語モデル(LLM)は、自然言語処理タスク全体で強力なパフォーマンスを示すが、デプロイメント用に修正された場合、大幅なパフォーマンス低下を経験する。
この現象をモデル出血(パラメータ変更とアーキテクチャ変更によるパフォーマンス低下)と定義する。
論文 参考訳(メタデータ) (2025-03-31T10:16:03Z) - Revisiting Plasticity in Visual Reinforcement Learning: Data, Modules and Training Stages [56.98243487769916]
ニューラルネットワークが新しいデータで進化する能力である塑性は、高性能でサンプル効率のよい視覚強化学習に不可欠である。
本稿では,批評家の可塑性レベルに基づいてリプレイ率を動的に調整するAdaptive RRを提案する。
論文 参考訳(メタデータ) (2023-10-11T12:05:34Z) - PLASTIC: Improving Input and Label Plasticity for Sample Efficient
Reinforcement Learning [54.409634256153154]
強化学習(RL)では, サンプル効率の向上が重要である。
原則として、非政治的なRLアルゴリズムは、環境相互作用毎に複数の更新を可能にすることで、サンプル効率を向上させることができる。
本研究は, この現象の原因を, 塑性を2つの側面に分けて検討した。
論文 参考訳(メタデータ) (2023-06-19T06:14:51Z) - Understanding plasticity in neural networks [41.79540750236036]
可塑性は、ニューラルネットワークが新しい情報に反応して予測を素早く変更する能力である。
深層ニューラルネットワークは、比較的単純な学習問題であっても、トレーニングの過程で可塑性を失うことが知られている。
論文 参考訳(メタデータ) (2023-03-02T18:47:51Z) - Unveiling the role of plasticity rules in reservoir computing [0.0]
Reservoir Computing (RC) は機械学習において魅力的なアプローチである。
我々は,RCの性能向上につながる変化に対して,塑性規則が果たす役割を分析する。
論文 参考訳(メタデータ) (2021-01-14T19:55:30Z) - Progressive Self-Guided Loss for Salient Object Detection [102.35488902433896]
画像中の深層学習に基づくサラエント物体検出を容易にするプログレッシブ自己誘導損失関数を提案する。
我々のフレームワークは適応的に集約されたマルチスケール機能を利用して、健全な物体の探索と検出を効果的に行う。
論文 参考訳(メタデータ) (2021-01-07T07:33:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。