論文の概要: The Intruder Threshold: A Spectral Law for LoRA Fine-Tuning
- arxiv url: http://arxiv.org/abs/2607.23711v1
- Date: Sun, 26 Jul 2026 15:17:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.208436
- Title: The Intruder Threshold: A Spectral Law for LoRA Fine-Tuning
- Title(参考訳): LoRAファインチューニングのスペクトル法則
- Authors: Peng Xie,
- Abstract要約: LoRAファインチューニングは、破滅的な忘れを誘う侵入者次元を生み出すことができる。
観測されたスペクトルの層ごとに層が現れると予測される理論は存在しない。
完全な微調整は、すべてのレイヤのしきい値よりはるかに低いアップデートを分散させる。
Norm-matchedの介入は、更新の規模ではなく、しきい値の交差する層が忘れを伴っていることを確認します。
- 参考スコア(独自算出の注目度): 3.860898721527665
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LoRA fine-tuning can create intruder dimensions: new leading singular vectors of the updated weight matrix $W+BA$ that are nearly orthogonal to all pretrained singular vectors and that drive catastrophic forgetting. Since their discovery, no theory has predicted, layer by layer on measured spectra, when they appear. We derive a per-layer critical update strength $s^\ast=\barθ/(γσ_1(BA))$, computed from the measured spectrum of $W$ alone through the rectangular spiked-deformation transform, together with an exact secular-equation characterization of the updated spectrum, with no fitted parameters. In a pre-specified study spanning four dense Transformer families, a state-space model, a mixture-of-experts model, and an encoder-decoder (18 adapters, 9{,}840 layer scans), the law localizes the empirical threshold within a factor of two on $82\%$ of layers, separates intruder-bearing from intruder-free layers at deployment with a mean AUC of $0.89$, holds unchanged on six third-party adapters, and predicts where WikiText-2 perplexity begins to degrade; a combination of the two pre-specified edge evaluations reaches $98\%$ and is confirmed out-of-bag on the external adapters ($0.997$). Full fine-tuning disperses its update far below the threshold of every layer, which resolves the asymmetry between LoRA and full fine-tuning. Norm-matched interventions confirm that threshold-crossing layers, rather than update magnitude, carry the forgetting, and a spike-budget rule derived from the thresholds, requiring one SVD and no validation sweeps, reduces forgetting by $62\%$ on the most fragile model at no task cost.
- Abstract(参考訳): 改良された重み行列 $W+BA$ の新たな先頭特異ベクトルは、事前訓練されたすべての特異ベクトルとほぼ直交し、破滅的な忘れ込みを引き起こす。
発見以来、観測されたスペクトルの層ごとに層が現れると予測される理論は存在していない。
我々は, 正方形スパイク・デフォーメーション変換によってW$の計測スペクトルから計算した層ごとの臨界更新強度$s^\ast=\barθ/(γσ_1(BA))$と, 更新されたスペクトルの正確な世俗方程式特性を, パラメータを含まない形で導出した。
4つの高密度トランスフォーマーファミリー、ステートスペースモデル、ミックス・オブ・エキスパートモデル、およびエンコーダ・デコーダ(18アダプタ、9{,}840層スキャン)にまたがる事前特定研究において、法則は、8,2\%の層上の2つの要素で経験的閾値をローカライズする。
フル微調整は全層のしきい値よりはるかに低い範囲で更新を分散し、LORAとフル微調整の間の非対称性を解消する。
Norm-matchedの介入は、更新サイズではなくしきい値の交差するレイヤが忘れを伴い、しきい値から派生したスパイク予算ルールが1つのSVDを必要とせず、バリデーションが不要であることを確認する。
関連論文リスト
- Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate [0.0]
混合精度量子化は、モデルのどの部分がより高い精度を維持するかを決定する必要がある。
本研究は, 層単位での定量化による損失を, 層ごとの感性や, 対方向の感性から再現可能であることを示す。
本稿では, 測定値の差分プロファイルである$f(S)=cbigl (1-prod_iin S (1-a_i)bigr)$を, その$L$適合ブレークレートから数パーセント以内まで再現する。
論文 参考訳(メタデータ) (2026-07-14T02:08:33Z) - Stochastic Estimation of the Layer-wise Hessian Trace for Monitoring Neural-network Training [45.88028371034407]
本稿では,ニューラルネットワークの経験的リスクであるヘッセン行列の対角ブロックの軌跡のパラメータ推定器を提案する。
この手順はハッチンソントレース推定器とパラメータベクトル全体の上の1つのヘッセンベクトル積を組み合わせたものである。
重み分担の下での正しさは,第2次微分の前に階層的にヘッセンを組み立てる必要があることを示す。
論文 参考訳(メタデータ) (2026-05-25T10:24:32Z) - How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis [53.063298916923976]
r*(x) = *(langle *, xrangle)$ と $x sim N(0, I_d)$ でガウスの単一インデックスモデルでフィードバックを研究する。
まず、報酬重み付きサンプルから隠れた方向を*$で学習し、次に重み付きリッジ回帰により読み出し層に適合する2段階のニューラル報酬モデルを分析する。
論文 参考訳(メタデータ) (2026-05-23T22:00:38Z) - Weight Decay Regimes in Grokking Transformers: Cheap Online Diagnostics [0.0]
モジュラー演算で訓練された変換器は、記憶、一般化、崩壊の急激な遷移を示す。
重み劣化はこれらの状態に対するスカラーな経験的制御パラメータとして機能することを示す。
トレーニングのダイナミクスをトラックするオンライン診断,平均的注意頭コサイン類似性とエントロピー標準偏差を導入する。
論文 参考訳(メタデータ) (2026-05-19T19:48:40Z) - Gradient Clipping Beyond Vector Norms: A Spectral Approach for Matrix-Valued Parameters [48.3175117923623]
ほとんどの勾配クリッピング規則は、全てのパラメータを重ベクトルとして扱い、現代のベクトルの行列構造を無視する。
実験により、データのアウトリーチは、少数のリード特異値のみを増幅することを示した。
この現象を動機として,特異値で安定化するクリッピングを提案する。
論文 参考訳(メタデータ) (2026-05-12T09:24:59Z) - Spectral Edge Dynamics of Training Trajectories: Signal--Noise Geometry Across Scales [0.0]
コンヒーレントな方向のみにおいてトランスフォーマー訓練軌道が発展することを示す。
共同作業では、同じスペクトル幾何学がグラッキングの早期警戒信号を提供する。
論文 参考訳(メタデータ) (2026-03-14T04:46:05Z) - Beyond Accuracy: A Unified Random Matrix Theory Diagnostic Framework for Crash Classification Models [6.908972852063454]
ランダム行列理論(RMT)とヘビープレート自己正規化(HTSR)に基づく診断枠組みを導入する。
アイオワDOTの2つのクラッシュ分類タスク(173,512,371,062)において,9つのモデルファミリーを評価した。
正規化されたモデルは常に$[2, 4]$(平均2.87 pm 0.34$)内で$を出力します。
我々は、$$ベースの早期停止基準とスペクトルモデル選択プロトコルを提案し、両者が相互検証されたFに対して検証する。
論文 参考訳(メタデータ) (2026-02-23T05:42:54Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - FedSVD: Adaptive Orthogonalization for Private Federated Learning with LoRA [68.44043212834204]
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
論文 参考訳(メタデータ) (2025-05-19T07:32:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。