論文の概要: CORA: Per-Slice Coherent Orthogonal Rotation for SVD-based Low-Rank Adaptation
- arxiv url: http://arxiv.org/abs/2607.02576v1
- Date: Tue, 30 Jun 2026 20:00:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.332319
- Title: CORA: Per-Slice Coherent Orthogonal Rotation for SVD-based Low-Rank Adaptation
- Title(参考訳): CORA: SVDに基づく低ランク適応のためのスライスコヒーレント直交回転
- Abstract要約: 安定な微調整はコヒーレントSVD回転に続くことを示す。
CORAは、常識推論とコード生成でLoRA、DoRA、PiSSA、MiLoRAを上回っている。
- 参考スコア(独自算出の注目度): 6.432245831737748
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Parameter-Efficient Fine-Tuning (PEFT) commonly adapts pretrained weights through low-rank updates, and recent methods further exploit the singular value decomposition (SVD) of the base weight for initialization or subspace selection. However, these methods do not explicitly preserve the coupled geometry between the pretrained left and right singular bases. Motivated by recent minimum-perturbation theory, which shows that stable finetuning follows a coherent SVD rotation in which a single orthogonal $Q$ acts on both the left singular basis $U_0$ and the right singular basis $V_0$, we prove a per-slice analogue: each row slice of $W_0$ can be adapted by a shared orthogonal rotation $Q_i$ on its left basis $U_i$ and right basis $V_i$ together with a diagonal spectrum shift. We implement this form as CORA (Coherent Orthogonal Rotation Adaptation), which applies per-slice orthogonal rotations and a per-layer diagonal scale to the rank-$r$ SVD truncation of $W_0$. CORA uses $\tfrac{1}{2}m(r{-}1)$ trainable parameters per linear layer, about $4{\times}$ fewer than LoRA at the same rank. CORA outperforms LoRA, DoRA, PiSSA, and MiLoRA on commonsense reasoning and code generation while using about $8{\times}$ fewer parameters.
- Abstract(参考訳): パラメータ効率のよいファインチューニング(PEFT)は、一般に低ランク更新によってトレーニング済みの重みを適応させ、最近の手法では、初期化や部分空間選択のために基底重みの特異値分解(SVD)をさらに活用している。
しかし、これらの手法は、事前訓練された左特異基底と右特異基底の間の結合幾何を明示的に保存するものではない。
最近の最小摂動理論により、安定な微調整は1つの直交$Q$が左特異基底$U_0$と右特異基底$V_0$の両方で作用するコヒーレントSVD回転に続くことが示されている。
この形式をCORA(Coherent Orthogonal Rotation Adaptation)として実装し、スライス毎の直交回転と層毎の対角スケールをランク-r$SVD truncation of $W_0$に適用する。
CORAは$\tfrac{1}{2}m(r{-}1)$ 線形層毎のトレーニング可能なパラメータを使用し、同じランクのLoRAよりも約4{\times}$少なくなる。
CORAは、LoRA、DoRA、PiSSA、MiLoRAを約8{\times}$より少ないパラメータを使用しながら、常識推論とコード生成で上回る。
関連論文リスト
- On the Convergence of Stochastic Low-Rank Adaptation [46.97973925956649]
低ランク適応(LoRA)は、$J(B,A)=mathcal L(W_mathrmbase+sBA)$2以上を最適化する。
我々はLoRA-NSGDMを提案し、これは$mathcalO(-8)$ Oracle complexity を持つ$-stationary point を求める。
論文 参考訳(メタデータ) (2026-07-24T04:41:26Z) - Subspace Geometry Governs Catastrophic Forgetting in Low-Rank Adaptation [0.0]
Low-Rank Adaptation (LoRA) は、大規模な事前学習モデルに適応するためのパラメータ効率の高いアプローチとして登場した。
勾配部分空間相互作用のレンズを通して,LoRAにおける破滅的忘れを特徴付ける幾何学的理論を提案する。
論文 参考訳(メタデータ) (2026-02-10T22:45:47Z) - Group Representational Position Encoding [66.33026480082025]
グループ行動に基づく位置符号化のための統一的なフレームワークであるGRAPEを提案する。
i)乗法回転 (Multiplicative GRAPE) in $mathrmSO(d)$ と (ii)加法ロジットバイアス (Additive GRAPE) は一般線型群 $mathrmGL$ における一等作用から生じる。
論文 参考訳(メタデータ) (2025-12-08T18:39:13Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - StelLA: Subspace Learning in Low-rank Adaptation using Stiefel Manifold [51.93627542334909]
低ランク適応(LoRA)は大規模事前訓練モデルのパラメータ効率向上手法として広く採用されている。
3要素分解$U!SVtop$を使用するLoRAの幾何学的拡張を提案する。
論文 参考訳(メタデータ) (2025-10-02T11:59:13Z) - Rethinking Parameter Sharing for LLM Fine-Tuning with Multiple LoRAs [26.212332132619736]
マルチタスクファインタニングにおいて,複数の$A$行列と1つの共有$B$を持つ非対称なマルチローラ設計を提案する。
提案手法は,既存のマルチLoRA手法と比較して,同等あるいは優れた平均精度でタスク間のバランスの取れた性能を実現する。
論文 参考訳(メタデータ) (2025-09-29T19:16:14Z) - FedSVD: Adaptive Orthogonalization for Private Federated Learning with LoRA [68.44043212834204]
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
論文 参考訳(メタデータ) (2025-05-19T07:32:56Z) - Computational Limits of Low-Rank Adaptation (LoRA) Fine-Tuning for Transformer Models [10.827800772359844]
微粒化複雑性理論を用いた変圧器モデルにおけるローランド適応(LoRA)の計算限界について検討する。
我々のキーとなる観察は、LoRA適応の勾配計算における低ランク分解の存在がアルゴリズムの高速化につながることである。
論文 参考訳(メタデータ) (2024-06-05T10:44:08Z) - A Single Linear Layer Yields Task-Adapted Low-Rank Matrices [4.695004706877747]
Low-Rank Adaptation (LoRA) は、初期重量行列$W_0$をデルタ行列$Delta W$で更新するPEFT (Efficient Fine-Tuning) 法として広く用いられている。
CondLoRAのトレーニング可能なパラメータがLoRAのパラメータよりも少ないにもかかわらず、CondLoRAはLoRAと同等のパフォーマンスを維持していることを示す。
論文 参考訳(メタデータ) (2024-03-22T04:38:42Z) - Improved Algorithm for Adversarial Linear Mixture MDPs with Bandit
Feedback and Unknown Transition [71.33787410075577]
線形関数近似,未知遷移,および逆損失を用いた強化学習について検討した。
我々は高い確率で$widetildeO(dsqrtHS3K + sqrtHSAK)$ regretを実現する新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-03-07T15:03:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。