論文の概要: Between Gradient and Natural Gradient: A Continuum of LoRA Initializations
- arxiv url: http://arxiv.org/abs/2607.26247v1
- Date: Tue, 28 Jul 2026 20:32:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.468774
- Title: Between Gradient and Natural Gradient: A Continuum of LoRA Initializations
- Title(参考訳): グラディエントと自然グラディエントの間:LoRA初期化の連続体
- Abstract要約: 低ランク適応(LoRA) 完全な微調整のコストのごく一部で、大型の微調整済みモデルである。
最近の方式では、下流の損失勾配からアダプタを初期化する。
これらの明らかに異なる手法は単一の連続体上の点であることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Low-rank adaptation (LoRA) fine-tunes large pretrained models at a fraction of the cost of full fine-tuning, but its performance depends strongly on how the adapters are initialized. Recent schemes initialize the adapters from the downstream loss gradient: some project the raw gradient onto its top directions, while others first whiten it with an estimate of the loss curvature. We show that these seemingly distinct methods are points on a single continuum: a two-parameter family of preconditioned gradient initializations, which we call Unified LoRA (ULoRA), governed by a spectral whitening exponent and an Adam-like diagonal exponent. Sweeping this family under a full learning-rate search, we find that no single fixed preconditioning strength dominates: the best operating point is task-dependent and frequently lies strictly inside the family, away from the published endpoints. Treated as an upper bound of this family, a tuned ULoRA configuration matches or exceeds full fine-tuning on all five GLUE tasks with RoBERTa-base and is competitive with the strongest baselines on GSM8K with LLaMA-2-7B. Our deployable, search-free variant, ULoRA-Auto, selects per-layer exponents from measured spectral statistics, approaches this upper bound at no additional search cost, and ranks at or near the top among deployable LoRA methods. Our results show that a principled design space for LoRA initialization and curvature preconditioning should be treated as a tunable dimension rather than a fixed design decision.
- Abstract(参考訳): ローランク適応 (LoRA) は、完全な微調整のコストのごく一部で事前訓練された大型モデルであるが、その性能はアダプタをどのように初期化するかに大きく依存する。
最近のスキームでは、アダプタを下流の損失勾配から初期化しており、一部は生勾配を最上方向に投影し、他方は損失曲率を見積もって最初に白くしている。
スペクトルホワイトニング指数とAdamのような対角指数が支配するUnified LoRA (ULoRA) と呼ばれる2パラメータの事前条件付き勾配初期化ファミリである。
このファミリーをフルラーニングレートで検索すると、1つの固定プレコンディショニングの強度が支配的でないことが分かりました。
このファミリーの上限として扱われ、チューンされたULoRA構成はRoBERTaベースで5つのGLUEタスク全てをフル微調整し、GSM8KとLLaMA-2-7Bで最強のベースラインと競合する。
我々の展開可能な無探索変種であるULoRA-Autoは、測定されたスペクトル統計値から層ごとの指数を選択し、この上限を余分な検索コストなしで接近し、デプロイ可能なLORAメソッドの中で最上位付近にランク付けする。
この結果から, LoRAの初期化と曲率事前条件付けの原理設計空間は, 固定設計決定ではなく, 調整可能な次元として扱うことが示唆された。
関連論文リスト
- LoRA-TSD: Tangent-Space Spectral Descent for LoRA via Muon-Style Updates [48.87937677659571]
低ランク適応(LoRA)は、大型モデルを微調整する標準的な方法である。
固定ランク行列多様体に対してすべてのLoRAステップを接として扱うアダプタであるLoRA-TSDを導入する。
LoRA-Pro と LoRA-TSD の両方に対して最初のグローバル収束保証を与える。
論文 参考訳(メタデータ) (2026-09-02T15:41:45Z) - LoRA-GA$^2$: Low Rank Adaptation with Multi-step Gradient Adaptive Alignment [3.934797837010563]
Low-Rank Adaptation (LoRA) は、大型モデルのための卓越した微調整法である。
LoRA-GA$2$は、多段階勾配情報を完全に活用する効果的な微調整アルゴリズムである。
論文 参考訳(メタデータ) (2026-08-20T08:55:05Z) - SDS-LoRA: Overcoming Anisotropic Gradient Scaling in Low-Rank Adaptation [64.33799467286265]
Low-Rank Adaptation (LoRA)は、大規模な事前訓練されたモデルの下流タスクへの効率的な適応を可能にする。
完全な微調整勾配が低ランク行列に逆伝播すると,その特異値によって誘導される異方性スケーリングを受けることを示す。
本稿では,後方パスから特異値を構造的に分離する新しい低ランクパラメータ化SDS-LoRAを提案する。
論文 参考訳(メタデータ) (2026-06-15T09:27:50Z) - Post-Optimization Adaptive Rank Allocation for LoRA [10.796887002907456]
Post-Optimization Adaptive Rank Allocation (PARA) はローランド適応データ自由圧縮法である。
我々は,既存の微調整パイプラインにシームレスに統合されたLoRAのデータフリー圧縮手法であるPARAを提案する。
PARAは、視覚および言語ベンチマークにおけるオリジナルの圧縮されていないLoRAの予測性能を維持しながら、パラメータ数を75-90%削減することを示した。
論文 参考訳(メタデータ) (2026-04-30T12:40:11Z) - Curvature-Guided LoRA: Steering in the pretrained NTK subspace [60.35296431630704]
本稿では,PEFTを用いて得られた予測器と,出力レベルにおける完全微調整の予測器との整合性を考慮した予測アライメント問題を提案する。
我々は、この目的が自然に、ニュートンのような、曲率ホワイトの勾配に対応する最適な低ランク更新を行う、曲率対応の2階定式化につながることを示した。
この知見に基づいて、局所曲率情報を用いて適応方向を選択し、スケールする曲率誘導LoRA(CG-LoRA)を提案する。
論文 参考訳(メタデータ) (2026-03-31T14:46:39Z) - IGU-LoRA: Adaptive Rank Allocation via Integrated Gradients and Uncertainty-Aware Scoring [9.250460219785188]
IGU-LoRAは、階層内統合勾配(IG)の感度を計算し、それらをランク割り当てのための階層レベルスコアに集約する適応ランクLoRAである。
IGU-LoRAは、一致したパラメータ予算でPEFTベースラインを一貫して上回り、下流の精度とロバスト性を改善している。
論文 参考訳(メタデータ) (2026-03-14T06:45:54Z) - GRIT -- Geometry-Aware PEFT with K-FACPreconditioning, Fisher-Guided Reprojection, andDynamic Rank Adaptation [4.748720471060117]
GRITは、LoRAパラメータ化を保存する曲率対応のLoRAプロシージャである。
トレーニング可能なパラメータを平均で46%削減しながら、LoRAとQLoRAにマッチまたは超越する。
GRITは強力なPEFT最適化器ベースラインよりも低いドリフトと更新vs保持フロンティアが得られる。
論文 参考訳(メタデータ) (2026-01-01T06:31:54Z) - HRP: High-Rank Preheating for Superior LoRA Initialization [58.3319586613105]
ハイランク予熱 (HRP) はローランク適応 (LoRA) を数ステップで運転する。
HRPは様々なモデルやタスクにおいてLoRAの有効性を大幅に向上させる。
論文 参考訳(メタデータ) (2025-02-11T17:59:35Z) - SD-LoRA: Scalable Decoupled Low-Rank Adaptation for Class Incremental Learning [73.93639228235622]
基礎モデルによる継続的な学習は、シーケンシャルなタスクに取り組むための事前トレーニング中に得られた豊富な知識を活用するための有望なパラダイムとして現れてきた。
既存のプロンプトベースおよびローランク適応ベース(LoRAベース)メソッドでは、プロンプト/ローラプールの拡張や、以前のタスクのサンプルの保持がしばしば必要である。
クラスインクリメンタル学習のためのスケーラブルデカップリングLoRA(SD-LoRA)を提案する。
論文 参考訳(メタデータ) (2025-01-22T20:00:41Z) - Randomized Asymmetric Chain of LoRA: The First Meaningful Theoretical Framework for Low-Rank Adaptation [58.288682735160585]
Low-Rank Adaptation (LoRA) は、ファインチューニングモデルの一般的なテクニックである。
LoRAは、フルパラメータの微調整と比較すると、しばしば実行されます。
本稿では,LoRA手法の適応率を厳密に分析するフレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-10T18:51:53Z) - PRILoRA: Pruned and Rank-Increasing Low-Rank Adaptation [65.268245109828]
我々はPRILoRAを導入し、各層ごとに異なるランクを線形に割り当て、トレーニングプロセスを通してプルーニングを行う。
8つのGLUEベンチマークで広範な実験を行い,PRILoRAの有効性を検証する。
論文 参考訳(メタデータ) (2024-01-20T20:25:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。