論文の概要: Layers Matter: Why Continual Learning Regularization Should Be Layer-Adaptive
- arxiv url: http://arxiv.org/abs/2608.15901v1
- Date: Sun, 16 Aug 2026 19:37:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.46436
- Title: Layers Matter: Why Continual Learning Regularization Should Be Layer-Adaptive
- Title(参考訳): レイヤが重要: 継続的学習の正規化が階層適応であるべき理由
- Authors: Brian B. Moser, Ahmed Anwar, Tobias Christian Nauen, Shishir Muralidhara, Federico Raue, René Schuster, Stanislav Frolov, Andreas Dengel,
- Abstract要約: EWCのような継続的な学習正規化は、従来のタスクパラメータからパラメータ単位の重要度に変化をペナルティ化することで、忘れる。
逆ビットフリップ攻撃とヘッセン分光法の研究は、この層ごとの感度の欠如がニューラルネットワークの桁数にまたがっていることを示している。
我々はこのレシピをEWCとSLCAに適用し、平均的なパフォーマンスとメトリクスを忘れることの明確な改善を示す。
- 参考スコア(独自算出の注目度): 11.547299731981894
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Continual learning regularizers like EWC fight forgetting by penalizing changes from previous-task parameters with per-parameter importance, typically diagonal Fisher values. Per-parameter looks more flexible than per-layer, but each layer's diagonal Fisher is a weak summary of its actual curvature, missing the top-eigenvalue information that controls forgetting. Adversarial bit-flip attacks and Hessian-spectrum studies show that this missing per-layer sensitivity spans orders of magnitude in neural networks. Under a block-diagonal Hessian assumption, the layer-level analogue of EWC's existing diagonal assumption, we prove three things. Forgetting decomposes as a sum of per-layer terms weighted by each layer's top Hessian eigenvalue. Diagonal-Fisher weights cannot recover this eigenvalue. For instance, two layers with identical Fisher averages can have top eigenvalues differing by a factor as large as the layer width. For the same level of forgetting, uniform regularization loses new-task performance by an amount scaling with the layer condition number. Our theoretical analysis leads to a simple recipe: protect early layers strongly, let deeper layers move. We apply this recipe to EWC and SLCA and show clear improvements in average performance and forgetting metrics.
- Abstract(参考訳): EWCのような連続学習正規化器は、従来のタスクパラメータからパラメータ単位の重要度、通常対角的なフィッシャー値の変更をペナルティ化することで、忘れる。
パラメータごとの幅は層ごとよりも柔軟に見えるが、各層の対角線フィッシャーは実際の曲率の弱い要約であり、忘れることを制御する最高固有値情報を欠いている。
逆ビットフリップ攻撃とヘッセン分光法の研究は、この層ごとの感度の欠如がニューラルネットワークの桁数にまたがっていることを示している。
ブロック対角ヘッセンの仮定の下では、EWCの既存の対角線仮定の層レベルの類似が3つのことを証明している。
蓄積は各層のトップヘッセン固有値によって重み付けられた層ごとの項の和として分解される。
対角フィッシャー重みは、この固有値を取り戻すことができない。
例えば、フィッシャー平均と同一の2つの層は、最上位の固有値が層幅の1倍の大きさで異なることができる。
同じレベルを忘れても、均一な正規化は層条件数によるスケーリングによって新しいタスク性能を失う。
初期のレイヤを強く保護し、より深いレイヤを移動させます。
我々はこのレシピをEWCとSLCAに適用し、平均的なパフォーマンスとメトリクスを忘れることの明確な改善を示す。
関連論文リスト
- Representational Depth of Evaluation Awareness Shifts With Scale in Open-Weight Language Models [0.0]
評価コンテキストを認識するモデルは、その振る舞いを戦略的に変化させ、下流のベンチマークを解釈しにくくする。
Qwen 2.5, Gemma 2, およびLlama 3.2にまたがる11のモデルを用いて、表現深さの体系的な大きさ依存的なシフトを求める。
このことは,評価意識の強さだけでなく,ネットワーク上で最も線形に回復可能な場所でのスケール変化を示唆している。
論文 参考訳(メタデータ) (2026-06-28T04:48:17Z) - Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding [92.1521161575198]
我々は、最も信頼性の高いニアファイナル層を動的に選択する、トレーニング不要なデコーディング戦略であるConfident Decodingを紹介する。
密集型および混合型LLMの実験は、挑戦的推論ベンチマークにおいて一貫した利得を示す。
論文 参考訳(メタデータ) (2026-06-20T07:03:26Z) - Spectral Surgery: Class-Targeted Post-Hoc Rebalancing via Hessian Spike Perturbation [0.0]
訓練された深層ネットワークのヘッセンスペクトルは特徴的構造を示す: ほぼゼロに近い固有値の連続バルクと少数の大きなアウトリーな固有値(スパイク)
本稿では,スパイク固有ベクトルに沿ったモデル重みを直接摂動させて,クラスごとの精度を再調整する,ポストホック最適化手法であるスペクトル手術を提案する。
我々は,CIFAR-10とISIC 2019において,バランスの取れた精度と標準偏差の両面での奨励的な結果を得た。
論文 参考訳(メタデータ) (2026-05-08T14:27:41Z) - SeWA: Selective Weight Average via Probabilistic Masking [51.015724517293236]
より良く、より高速な収束を達成するためには、ほんの数ポイントしか必要としないことを示す。
離散選択問題を連続的な部分集合最適化フレームワークに変換する。
両凸画像チェックポイントの値よりもシャープなSeWAの安定性境界を導出する。
論文 参考訳(メタデータ) (2025-02-14T12:35:21Z) - Deep Imbalanced Regression via Hierarchical Classification Adjustment [50.19438850112964]
コンピュータビジョンにおける回帰タスクは、しばしば、対象空間をクラスに定量化することで分類される。
トレーニングサンプルの大多数は目標値の先頭にあるが、少数のサンプルは通常より広い尾幅に分布する。
不均衡回帰タスクを解くために階層型分類器を構築することを提案する。
不均衡回帰のための新しい階層型分類調整(HCA)は,3つのタスクにおいて優れた結果を示す。
論文 参考訳(メタデータ) (2023-10-26T04:54:39Z) - Improved techniques for deterministic l2 robustness [63.34032156196848]
畳み込みニューラルネットワーク(CNN)を$l_2$ノルムの下で厳密な1-Lipschitz制約で訓練することは、対向的堅牢性、解釈可能な勾配、安定した訓練に有用である。
我々は,最後の線形層を1重層に置き換えることで,1-Lipschitz CNNのロバスト性を証明する手法を提案する。
我々は,CIFAR-10およびCIFAR-100における標準および証明可能な堅牢な精度の最先端化を図る。
論文 参考訳(メタデータ) (2022-11-15T19:10:12Z) - Fire Together Wire Together: A Dynamic Pruning Approach with
Self-Supervised Mask Prediction [12.86325214182021]
動的モデルプルーニング(Dynamic Model pruning)は、デプロイ中の各入力サンプルに対する異なるサブネットワークの推測を可能にする、最近の方法である。
現在の動的手法は、間隔損失を誘導することによって正規化を通じて連続的なチャネルゲーティングを学ぶことに依存している。
我々は,CIFARおよびImageNet上で,VGG,ResNet,MobileNetなどのニューラルネットワークの実験を行った。
論文 参考訳(メタデータ) (2021-10-15T17:39:53Z) - Distribution of Classification Margins: Are All Data Equal? [61.16681488656473]
我々は理論的に動機付け、トレーニングセット上のマージン分布の曲線の下の領域が実際は一般化のよい尺度であることを実証的に示す。
結果として生じる"高いキャパシティ"機能のサブセットは、異なるトレーニング実行間で一貫性がない。
論文 参考訳(メタデータ) (2021-07-21T16:41:57Z) - Training with Multi-Layer Embeddings for Model Reduction [0.9046327456472286]
複数層埋め込み学習アーキテクチャを導入し, 一連の線形層を通して埋め込みを訓練する。
その結果,メモリフットプリントの精度が向上し,dを4~8倍削減できることがわかった。
論文 参考訳(メタデータ) (2020-06-10T02:47:40Z) - Revisiting Initialization of Neural Networks [72.24615341588846]
ヘッセン行列のノルムを近似し, 制御することにより, 層間における重みのグローバルな曲率を厳密に推定する。
Word2Vec と MNIST/CIFAR 画像分類タスクの実験により,Hessian ノルムの追跡が診断ツールとして有用であることが確認された。
論文 参考訳(メタデータ) (2020-04-20T18:12:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。