論文の概要: On the Convergence of Stochastic Low-Rank Adaptation
- arxiv url: http://arxiv.org/abs/2607.21975v1
- Date: Fri, 24 Jul 2026 04:41:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.048559
- Title: On the Convergence of Stochastic Low-Rank Adaptation
- Title(参考訳): 確率的低ランク適応の収束性について
- Abstract要約: 低ランク適応(LoRA)は、$J(B,A)=mathcal L(W_mathrmbase+sBA)$2以上を最適化する。
我々はLoRA-NSGDMを提案し、これは$mathcalO(-8)$ Oracle complexity を持つ$-stationary point を求める。
- 参考スコア(独自算出の注目度): 46.97973925956649
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Low-rank adaptation (LoRA) optimizes $J(B,A)=\mathcal L(W_\mathrm{base}+sBA)$ over two adapters $B \in \mathbb{R}^{m \times r}$ and $A \in \mathbb{R}^{r \times n}$ that form a low-rank update to a frozen pretrained weight matrix $W_\mathrm{base} \in \mathbb{R}^{m \times n}$. The prior analysis shows LoRA-GD takes $\exp\{\mathcal{O}(ε^{-2})\}$ oracle calls to find an $ε$-stationary point such that $\|\nabla J(B,A)\|\leq ε$ in the deterministic setting. We sharpen the analysis and show that $\mathcal{O}(ε^{-4})$ full-gradient evaluations suffice for the same first-order criterion. We further study stochastic LoRA under unbiased gradient estimates and finite variance. We propose LoRA-NSGDM, which finds an $ε$-stationary point with $\mathcal{O}(ε^{-8})$ stochastic oracle complexity. Under the additional mean-square smoothness condition, we use variance reduction strategy and propose LoRA-STORM, which improves the stochastic oracle complexity to $\mathcal{O}(ε^{-6})$.
- Abstract(参考訳): 低ランク適応(LoRA)は、$J(B,A)=\mathcal L(W_\mathrm{base}+sBA)$を2つのアダプタ上で最適化する$B \in \mathbb{R}^{m \times r}$と$A \in \mathbb{R}^{r \times n}$は、凍結事前トレーニングされた重み行列$W_\mathrm{base} \in \mathbb{R}^{m \times n}$に対する低ランク更新を形成する。
以前の分析では、LoRA-GD は $\exp\{\mathcal{O}(ε^{-2})\} を、決定論的条件において $\|\nabla J(B,A)\|\leq ε$ となるような $ε$-定常点を見つけるために、オーラルコールを取る。
解析を研ぎ、$\mathcal{O}(ε^{-4})$ full-gradient evaluations suffices the same first-order criterion。
さらに,不偏勾配推定と有限分散下での確率ロラについて検討する。
我々はLoRA-NSGDMを提案し、これは$\mathcal{O}(ε^{-8})$tochastic oracle complexityを持つε$定常点を求める。
付加平均2乗滑らか性条件の下では、分散還元戦略を用いて、確率的オラクル複雑性を$\mathcal{O}(ε^{-6})$に改善するLoRA-STORMを提案する。
関連論文リスト
- Information-Computation Tradeoffs for Noiseless Linear Regression with Oblivious Contamination [65.37519531362157]
このタスクに対する効率的な統計的クエリアルゴリズムは、VSTATの複雑さを少なくとも$tildeOmega(d1/2/alpha2)$で要求する。
論文 参考訳(メタデータ) (2025-10-12T15:42:44Z) - Sparse Max-Affine Regression [8.338559499737135]
本稿では,凸片方向線形回帰における変数選択の解としてスパース勾配を提案する。
準ガウス雑音下でのSp-GDの非漸近局所収束解析を行う。
スパース一般化をスパースマックスアフィンモデルに変換するために、Real Maslov Dequantization (RMD) と呼ばれる新しい変換を提案する。
論文 参考訳(メタデータ) (2024-11-04T16:19:09Z) - Convergence of Gradient Descent with Small Initialization for
Unregularized Matrix Completion [21.846732043706318]
バニラ勾配降下は、明示的な正則化を必要とせず、必ず基底真理$rmXstar$に収束することを示す。
驚くべきことに、収束率も最終的な精度もオーバーパラメータ化された検索ランク$r'$に依存しておらず、それらは真のランク$r$によってのみ支配される。
論文 参考訳(メタデータ) (2024-02-09T19:39:23Z) - A Unified Framework for Uniform Signal Recovery in Nonlinear Generative
Compressed Sensing [68.80803866919123]
非線形測定では、ほとんどの先行結果は一様ではない、すなわち、すべての$mathbfx*$に対してではなく、固定された$mathbfx*$に対して高い確率で保持される。
本フレームワークはGCSに1ビット/一様量子化観測と単一インデックスモデルを標準例として適用する。
また、指標集合が計量エントロピーが低い製品プロセスに対して、より厳密な境界を生み出す濃度不等式も開発する。
論文 参考訳(メタデータ) (2023-09-25T17:54:19Z) - Oblivious Stochastic Composite Optimization [47.48197617884748]
我々のアルゴリズムは問題のパラメータに関する事前の知識なしで収束することを示す。
3つのアルゴリズムは全て、実現可能な集合の直径、リプシッツ定数、あるいは目的関数の滑らかさについて事前の知識なしに機能する。
我々は,フレームワークを比較的大規模に拡張し,大規模半確定プログラム上での手法の効率性と堅牢性を実証する。
論文 参考訳(メタデータ) (2023-06-30T08:34:29Z) - On the Complexity of Decentralized Smooth Nonconvex Finite-Sum Optimization [21.334985032433778]
分散最適化問題 $min_bf xinmathbb Rd f(bf x)triq frac1msum_i=1m f_i(bf x)triq frac1nsum_j=1n。
論文 参考訳(メタデータ) (2022-10-25T11:37:11Z) - On Submodular Contextual Bandits [92.45432756301231]
作用が基底集合の部分集合であり、平均報酬が未知の単調部分モジュラ函数によってモデル化されるような文脈的包帯の問題を考える。
Inverse Gap Weighting 戦略により,提案アルゴリズムは推定関数の局所的最適度を効率よくランダム化することを示す。
論文 参考訳(メタデータ) (2021-12-03T21:42:33Z) - Minimax Optimal Regression over Sobolev Spaces via Laplacian
Regularization on Neighborhood Graphs [25.597646488273558]
非パラメトリック回帰に対するグラフに基づくアプローチであるラプラシア平滑化の統計的性質について検討する。
ラプラシアン滑らか化が多様体適応であることを証明する。
論文 参考訳(メタデータ) (2021-06-03T01:20:41Z) - Optimal Robust Linear Regression in Nearly Linear Time [97.11565882347772]
学習者が生成モデル$Y = langle X,w* rangle + epsilon$から$n$のサンプルにアクセスできるような高次元頑健な線形回帰問題について検討する。
i) $X$ is L4-L2 hypercontractive, $mathbbE [XXtop]$ has bounded condition number and $epsilon$ has bounded variance, (ii) $X$ is sub-Gaussian with identity second moment and $epsilon$ is
論文 参考訳(メタデータ) (2020-07-16T06:44:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。