論文の概要: Learn the Directions, Normalize the Gains: Post-Training Normalization for LoRA
- arxiv url: http://arxiv.org/abs/2610.02067v1
- Date: Thu, 01 Oct 2026 17:07:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.319665
- Title: Learn the Directions, Normalize the Gains: Post-Training Normalization for LoRA
- Title(参考訳): 方向性を学習し、ゲインを正規化する:LoRAの訓練後正規化
- Abstract要約: Low-Rank Adaptation (LoRA)は効率的なタスク特殊化を可能にする。
トレーニング後の正規化手法である textbfLoRA-Norm をモチベーションとし、学習の方向性を維持しながら利得を再バランスさせる。
- 参考スコア(独自算出の注目度): 36.66664283517932
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Low-Rank Adaptation (LoRA) enables efficient task specialization, its learned updates can compromise capabilities beyond the target task. We identify \textbf{adaptation imbalance}: a few singular directions dominate the trained update, leaving its performance sensitive to how gains are allocated. We argue that \textbf{learning where to adapt does not ensure that adaptation gains are well balanced}. This motivates \textbf{LoRA-Norm}, a post-training normalization method that retains learned directions while rebalancing their gains. LoRA-Norm combines spectral rebalancing, a fixed nonlinear transformation of singular values, with nuclear-norm restoration, which preserves the original total spectral mass. It requires no calibration data or additional training and introduces no inference overhead. Across two backbones and three adaptation tasks, LoRA-Norm improves average specialization and capability retention, outperforming the evaluated post-hoc spectral pruning and gradient-guided editing configurations on both measures. Stronger functional equalization brings no consistent additional gains, revealing that balancing adapter gains and equalizing their responses are distinct objectives.
- Abstract(参考訳): Low-Rank Adaptation (LoRA)は効率的なタスク特殊化を可能にするが、学習した更新はターゲットタスクを超える能力を損なう可能性がある。
いくつかの特異な方向がトレーニングされた更新を支配しており、そのパフォーマンスはゲインの割り当てに敏感なままです。
我々は、適応する場所が適応のバランスをよく保っていることを保証しない、と論じる。
これは、学習方向を維持しながらゲインを再バランスする訓練後の正規化手法である。
LoRA-Normは、特異値の固定された非線形変換であるスペクトルリバランシングと、元の全スペクトル質量を保存する核ノルムの復元を組み合わせている。
キャリブレーションデータや追加のトレーニングは必要とせず、推論オーバーヘッドも発生しない。
2つのバックボーンと3つの適応タスクの中で、LoRA-Normは平均的な特殊化と能力保持を改善し、評価後のスペクトルプルーニングと勾配誘導の編集構成よりも優れている。
より強い機能的等化は、一貫した追加利得をもたらしず、アダプタの利得のバランスと応答の等化が異なる目的であることを明らかにする。
関連論文リスト
- When the Merge Coefficient Stops Mattering: Proximity Regularized Merging for Continual LoRA Adaptation [11.963603083282264]
逐次LoRAマージに対する最小限の修正であるPRM(Proximity Regularized Merging)を提案する。
PRMはロバストなタスクベクトル正規化器として機能することを示す。
また, 逐次LoRAマージの有効性は, タスクベクトルの書き込み量だけでなく, タスクベクトル自体がマージ可能かどうかにも依存することを示した。
論文 参考訳(メタデータ) (2026-09-26T07:50:00Z) - Normalized Low-Rank Adaptation [18.076347530341426]
トレーニング中の下降行列を正規化するための簡易かつ効果的な手法である正規化低ランク適応(NoRA)を導入する。
NoRAは一貫して収束を加速し、パフォーマンスとトレーニングの安定性を改善し、破滅的な忘れを緩和する。
論文 参考訳(メタデータ) (2026-08-31T16:15:36Z) - Foundation-Preserving Adaptation via Generalized Rayleigh-Quotient Optimization [36.95831224411691]
本稿では,忘れがちな最適化フレームワークであるFoLoRA(Foundation Preserving LoRA)を提案する。
FoLoRAは、プレトレーニングプロキシアクティベーションよりも忘れるペナルティと、下流タスクアクティベーションよりもタスクユーティリティを定義している。
数学、コード、命令の順応による実験は、FoLoRAがベースラインよりも強い保存適応バランスを達成していることを示している。
論文 参考訳(メタデータ) (2026-05-28T21:22:31Z) - Spectral Surgery: Training-Free Refinement of LoRA via Gradient-Guided Singular Value Reweighting [19.886879714344076]
Low-Rank Adaptation (LoRA)は、タスク更新を低ランクパラメータサブスペースに制限することで、ダウンストリームのパフォーマンスを改善する。
訓練されたLoRA更新は、しばしば非効率なスペクトルを示し、タスク効果は特異方向の小さなサブセットに集中している。
SVD で LoRA 更新を分解する訓練自由改良法である Spectral Surgery を提案する。
論文 参考訳(メタデータ) (2026-03-04T12:38:36Z) - Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers [55.33468902405567]
本稿では、事前学習とデプロイの両方が好みのフィードバックにのみ依存する新しい学習パラダイム、In-Context Preference-based Reinforcement Learning (ICPRL)を提案する。
ICPRLは、厳密なコンテキスト内一般化を可能にし、完全な報酬管理で訓練されたICRLメソッドに匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-09T03:42:16Z) - Decomposing and Composing: Towards Efficient Vision-Language Continual Learning via Rank-1 Expert Pool in a Single LoRA [50.97792275353563]
単一低ランク適応 (LoRA) モジュールを分解可能な Rank-1 エキスパートプールとして再構成する,新しいフレームワークを提案する。
本手法では,このエキスパートプールから[Guided]トークンのセマンティクスに導かれて,疎結合でタスク固有の更新を動的に作成することを学ぶ。
論文 参考訳(メタデータ) (2026-01-30T10:54:51Z) - Ranking-aware Reinforcement Learning for Ordinal Ranking [19.678002354790582]
本稿では,これらの関係を明示的に学習する新しいRLフレームワークであるRARLを提案する。
RARLはレグレッションとL2R(Learning-to-Rank)を統合する統一された目的を持ち、2つのタスク間の相互改善を可能にする。
トレーニングをさらに強化するため,制御ノイズを注入して探索を改善し,サドル地点での停滞を防止するリアクションミューテーション操作(RMO)を導入する。
論文 参考訳(メタデータ) (2026-01-28T13:22:42Z) - Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty [59.97939500426759]
本稿ではRLCRについて述べる。RLCRは精度と信頼性を共同で向上する推論モデルを訓練する手法である。
多様なデータセット間で、RLCRは精度を損なうことなくキャリブレーションを大幅に改善することを示す。
また,言語的信頼度をテスト時に活用し,精度とキャリブレーションを向上させることも実証した。
論文 参考訳(メタデータ) (2025-07-22T17:56:01Z) - Sparse Low-rank Adaptation of Pre-trained Language Models [79.74094517030035]
本稿では,適応過程における固有ランクの動的調整を可能にする疎低ランク適応(SoRA)を提案する。
提案手法は,LoRAを高いランクで初期化すると同時に,一時的に増大するパラメータを効率的に利用することにより,LoRAの表現力を向上する。
実験の結果,SoRAは70%の保持パラメータと70%のトレーニング時間でも,他のベースラインよりも優れていることがわかった。
論文 参考訳(メタデータ) (2023-11-20T11:56:25Z) - Bridging the Gap Between Target Networks and Functional Regularization [61.051716530459586]
ターゲットネットワークは暗黙の正則化器として機能し、いくつかのケースでは有益であるが、欠点もある。
本稿では,フレキシブルな関数正規化法と関数空間における凸正規化法を提案する。
この結果から,機能正規化はTarget Networksのドロップイン代替として利用でき,結果として性能が向上することが示唆された。
論文 参考訳(メタデータ) (2021-06-04T17:21:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。