論文の概要: PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer
- arxiv url: http://arxiv.org/abs/2607.17620v1
- Date: Mon, 20 Jul 2026 07:16:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.533601
- Title: PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer
- Title(参考訳): PoLoRA: 事前条件付き直交型LoRAオプティマイザ
- Abstract要約: 低ランク適応(LoRA)は、2つの行列の積としてパラメータ化されるトレーニング可能な低ランク更新を各重み行列に追加することにより、大きな言語モデルを微調整する。
PoLoRAは、製品対応更新方向、サンプル単位の損失変化を制御するプリコンディショニング、要素のサイズとマージした更新の両方を制御するマグニチュードルールの3つの要素で構成されている。
我々は1Bから8Bパラメータのデータセットの命令チューニングにおいてPoLoRAを評価し、調律されたAdamが達成した最後のホールトアウト損失を1.2-1.7倍のステップで達成することを発見した。
- 参考スコア(独自算出の注目度): 15.584731292085126
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Low-rank adaptation (LoRA) makes finetuning large language models cheaper by adding to each weight matrix a trainable low-rank update parameterized as the product of two matrices. These matrices are usually trained with Adam, which treats them as a single flat vector of parameters and ignores both the matrix and product structure of LoRA. Applying a matrix-aware optimizer such as Muon to each factor does not consistently improve over Adam, and neither do the product-aware Muon variants proposed in concurrent works. To realize consistent gains, we introduce PoLoRA, a Preconditioned Orthogonalized LoRA optimizer built from three ingredients: a product-aware spectral update direction, curvature preconditioning derived from controlling the per-sample loss change, and a magnitude rule that controls the sizes of both the factor and merged updates. We evaluate PoLoRA on instruction-tuning datasets for code and math across models from 1B to 8B parameters, and find that it reaches the final held-out loss achieved by tuned Adam in 1.2-1.7 times fewer steps, while adding at most 3% per-step overhead. Compared to Adam, PoLoRA is also less sensitive to the learning rate, and its optimal learning rate is stable across ranks.
- Abstract(参考訳): 低ランク適応(LoRA)は、2つの行列の積としてパラメータ化されるトレーニング可能な低ランク更新を各重み行列に追加することにより、大きな言語モデルを微調整する。
これらの行列は通常、Adamで訓練され、パラメータの単一の平坦ベクトルとして扱い、LoRAの行列と積構造の両方を無視する。
各因子にMuonのような行列対応オプティマイザを適用することは、Adamよりも一貫して改善されるわけではなく、同時に提案される製品対応のMuon変種も改善されない。
一貫したゲインを実現するために,PoLoRA,製品対応スペクトル更新方向,サンプル単位の損失変化を制御した曲率事前条件,および因子とマージした更新の両サイズを制御する大域的なルールの3つの要素から構築した,プレコンディショニング・オルソナライズド・ロラオプティマイザを導入する。
我々は1Bから8Bパラメータのモデルをまたいだ命令チューニングデータセット上でPoLoRAを評価し、Adamを1.2-1.7倍のステップでチューニングし、ステップ当たり3%のオーバーヘッドで最終的なホールトアウト損失に達することを発見した。
アダムと比較すると、PoLoRAは学習率に敏感であり、最適な学習速度は階級間で安定している。
関連論文リスト
- \k{appa}-LoRA: Condition Numbers Reveal Which LoRA Matrices Worth Updating [24.538290063991997]
Low-Rank Adaptation (LoRA)は、効率的なニューラルネットワークの微調整技術である。
kappa-LoRAは、最大の条件数を持つ行列の更新に焦点を当てている。
kappa-LoRAはトレーニング可能なパラメータ数を半減し、それに応じて計算とメモリコストを削減します。
論文 参考訳(メタデータ) (2026-07-24T17:00:40Z) - SMoA: Spectrum Modulation Adapter for Parameter-Efficient Fine-Tuning [57.85676271833619]
低ランク適応 (LoRA) は、全パラメータの微調整をシミュレートするために低ランク更新法を用いる。
ランクが大きくなるにつれて、より主特異な方向が保存され、一般にモデルの性能が向上する。
textbfSpectrum textbfModulation textbfAdapterを提案する。
論文 参考訳(メタデータ) (2026-05-20T13:19:28Z) - Taming Momentum: Rethinking Optimizer States Through Low-Rank Approximation [85.89510825889168]
効率的な事前学習のための新しい低ランクシステムであるLoRA-Preを紹介する。
LoRA-Pre オンライン線形学習器内のコンパクトな低ランク部分空間に運動量行列を分解する。
Llama アーキテクチャファミリーのモデルを事前学習することで,LoRA-Preの有効性を実証的に検証する。
論文 参考訳(メタデータ) (2026-02-27T18:57:06Z) - Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates [14.49537642990529]
低ランク適応(LoRA)はパラメータ効率微調整(PEFT)の中でも最も一般的な手法の1つである。
そこで本研究では,従来のLoRAにインダクティブバイアスを組み込むことにより,性能を向上させるために,Dual LoRAと呼ばれる新しい手法を提案する。
トレーニング可能なパラメータの数が同じで,LoRAとその最先端の変種を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2025-12-03T03:14:09Z) - Faster Than SVD, Smarter Than SGD: The OPLoRA Alternating Update [50.36542772932594]
Low-Rank Adaptation (LoRA) は、凍結重量の上の低ランク更新を学習することで、大きなモデルを微調整する。
ローランクプロジェクションによる完全なトレーニング(SVDLoRA)とLoRAファインチューニングの間にはまだギャップがあり、LoRAのステップをさらに改善できることを示している。
論文 参考訳(メタデータ) (2025-09-24T10:32:50Z) - Don't Forget the Nonlinearity: Unlocking Activation Functions in Efficient Fine-Tuning [82.16625951603315]
NoRAは、固定活性化を学習可能な有理関数に置き換え、構造化された低ランク更新を数値化係数と分母係数に適用する。
CIFAR-10とCIFAR-100で訓練された視覚変換器では、NoRAはパラメータのわずか0.4%を更新しながら完全な微調整に適合または超過する。
NoRAは低次元機能部分空間への適応を制約し、暗黙的に更新の規模と方向を規則化する。
論文 参考訳(メタデータ) (2025-09-16T16:47:03Z) - DenseLoRA: Dense Low-Rank Adaptation of Large Language Models [14.133511131962786]
低ランク適応 (LoRA) は大規模言語モデル (LLM) に適応するための効率的なアプローチとして開発されている。
パラメータ効率を高めつつ,LoRAよりも優れた性能を実現する新しい手法であるDense Low-Rank Adaptation (DenseLoRA)を導入する。
我々はDenseLoRAを様々なベンチマークで評価し、LLaMA3-8B上のトレーニング可能なパラメータの0.70%とLoRAの80.8%の精度と比較して、トレーニング可能なパラメータの0.01%で83.8%の精度を達成することを示した。
論文 参考訳(メタデータ) (2025-05-27T08:19:07Z) - LoRA Done RITE: Robust Invariant Transformation Equilibration for LoRA Optimization [78.93425154518705]
低ランク適応 (LoRA) は、メモリ要求を低減し、LLMのパラメータ効率の高い微調整法である。
本稿では,LoRA最適化のための適応行列プレコンディショニング手法であるLoRA-RITEを紹介する。
論文 参考訳(メタデータ) (2024-10-27T22:57:12Z) - CoRA: Optimizing Low-Rank Adaptation with Common Subspace of Large Language Models [7.108651381160281]
Low-Rank Adaptation (LoRA) 戦略は、微調整された大型モデルにおける効率と性能のバランスをとる。
我々は、共有知識を活用してLoRAトレーニングを最適化するtextbfCoRAを提案する。
実験の結果,最初のアプローチは,パラメータの半減よりも効率が良く,元のLoRAファインチューニングと同じ効果が得られることがわかった。
論文 参考訳(メタデータ) (2024-08-31T12:48:27Z) - Chain of LoRA: Efficient Fine-tuning of Language Models via Residual
Learning [31.036465632204663]
本稿では,Frank-Wolfeアルゴリズムにインスパイアされた反復最適化フレームワークであるLoRAのChainを紹介する。
計算コストやメモリコストを増大させることなく,COLA が LoRA を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2024-01-08T14:26:49Z) - LoRA: Low-Rank Adaptation of Large Language Models [71.75808607987281]
Low-Rank Adaptation (LoRA)はトレーニング済みモデルの重みを凍結し、トレーニング可能な階数分解をTransformerアーキテクチャの各層に注入する。
GPT-3では、LoRAはトレーニング可能なパラメータの数を1万倍に減らし、計算ハードウェアの要求をフル微調整の3倍に削減できる。
論文 参考訳(メタデータ) (2021-06-17T17:37:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。