論文の概要: How Much Rank Does LoRA Need? Rank-Error Bounds for Transformer Attention
- arxiv url: http://arxiv.org/abs/2608.26052v1
- Date: Wed, 26 Aug 2026 17:25:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.966326
- Title: How Much Rank Does LoRA Need? Rank-Error Bounds for Transformer Attention
- Title(参考訳): LoRAのランクはどれぐらい必要か? 変圧器の注意のためのランクエラー境界
- Authors: Gerard Conangla Planes,
- Abstract要約: 本稿では,Transformer の注目のために各 LoRA ランクで達成可能な近似誤差のタスク依存理論を提案する。
また、この分析を融合したマルチヘッドLoRAや、共同クエリ/キー更新にも拡張する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Choosing the rank of a low-rank adaptation (LoRA) update is usually an empirical task. In this paper, we provide a task-dependent theory of the approximation error achievable at each LoRA rank for Transformer attention. We fix a pretrained attention head, a target attention function, and a distribution over inputs from the downstream task, and bound the smallest expected Kullback--Leibler (KL) error achievable by a rank-$r$ query LoRA update. When target attention probabilities are bounded away from zero, we prove a lower bound of the error proportional to $ψ(\|d\|_2)$, where $d$ is the difference between candidate and target attention scores and $ψ(t)=\min\{t^2,t\}$. We also prove an unconditional upper bound $\min\{\|d\|_2^2/4,\sqrt2\|d\|_2\}$. Under explicit realizability, geometry, and moment conditions, we then bound the best rank-$r$ error between an explicit multiple of $ψ(\sqrt{T_r})$ and $\min\{T_r/4,\sqrt{2T_r}\}$, where $T_r$ is the downstream-weighted tail energy of the target update. We also provide target-Fisher bounds when candidate scores remain within a fixed range of the target scores, and an unrestricted lower bound when a subset of tokens carries most of the probability mass. These spectral bounds describe finite-score approximation. We then construct explicit families in which softmax saturation makes the rank required to match the attention function strictly smaller than the rank required to match the finite logits. Finally, we extend the analysis to fused multi-head LoRA and joint query/key updates, exposing the effects of rank sharing and query/key factorization constraints.
- Abstract(参考訳): 低ランク適応(LoRA)更新のランクを選択することは、通常経験的な作業である。
本稿では,Transformer の注意を向け,各 LoRA ランクで達成可能な近似誤差のタスク依存理論を提案する。
我々は、事前訓練されたアテンションヘッド、ターゲットアテンション関数、下流タスクからの入力に対する分布を修正し、ランク-$$クエリLoRA更新によって達成可能な最小のKLエラーをバインドする。
対象の注意確率がゼロから遠ざかっているとき、その誤差の下位境界が$(\|d\|_2)$であり、$d$は候補と対象の注意スコアの差であり、$(t)=\min\{t^2,t\}$であることを示す。
また、無条件上界 $\min\{\|d\|_2^2/4,\sqrt2\|d\|_2\}$ も証明する。
明示的実現可能性、幾何、モーメント条件の下では、最高の階数-$r$エラーを、(\sqrt{T_r})$ と $\min\{T_r/4,\sqrt{2T_r}\}$ の明示的な倍の間に有界にし、そこで、$T_r$ は目標更新の下流重み付きテールエネルギーである。
また、候補スコアが目標スコアの固定範囲内に留まっている場合の目標フィッシャー境界と、トークンのサブセットが確率質量の大部分を担っている場合の制限なし下界も提供する。
これらのスペクトル境界は有限スコア近似を記述する。
次に、ソフトマックス飽和度が、有限ロジットに合わせるのに必要なランクよりも厳密に小さい注意関数に適合するランクを与える明示的な族を構築する。
最後に,マルチヘッドLORAとジョイントクエリ/キー更新に解析を拡張し,ランク共有とクエリ/キー因数分解制約の影響を明らかにする。
関連論文リスト
- Tight Sample Complexity for Low-Rank Adaptation: Matching Bounds and Rank Selection [0.0]
Low-Rank Adaptation (LoRA) は、大規模な事前訓練モデルを微調整するための標準的なメカニズムとなっている。
ロラ階数 r をどうやって選ぶかという問題には正式な答えがない。
ランクr LoRA に対する経験的リスク最小化器の過大なリスクに対する O(rd/n) の上限を証明した。
論文 参考訳(メタデータ) (2026-07-30T04:56:27Z) - On the Convergence of Stochastic Low-Rank Adaptation [46.97973925956649]
低ランク適応(LoRA)は、$J(B,A)=mathcal L(W_mathrmbase+sBA)$2以上を最適化する。
我々はLoRA-NSGDMを提案し、これは$mathcalO(-8)$ Oracle complexity を持つ$-stationary point を求める。
論文 参考訳(メタデータ) (2026-07-24T04:41:26Z) - AR1-ZO: Topology-Aware Rank-1 Zeroth-Order Queries for High-Rank LoRA Fine-Tuning [17.98348342954707]
本稿では,このボトルネックが外部部分空間の必要性というよりも,測定トポロジの問題であることを示す。
AR1-ZOペアは、階数不変のアクティブシグナルを復元する、トポロジ対応のスケール$=r$と1$の原子クエリを交互に行う。
OPTモデルとQwen3モデルの実験により、信号機構が検証され、AR1-ZOが高ランクのLoRAを効果的にすることを示す。
論文 参考訳(メタデータ) (2026-05-19T12:39:30Z) - Subspace Geometry Governs Catastrophic Forgetting in Low-Rank Adaptation [0.0]
Low-Rank Adaptation (LoRA) は、大規模な事前学習モデルに適応するためのパラメータ効率の高いアプローチとして登場した。
勾配部分空間相互作用のレンズを通して,LoRAにおける破滅的忘れを特徴付ける幾何学的理論を提案する。
論文 参考訳(メタデータ) (2026-02-10T22:45:47Z) - Computational Limits of Low-Rank Adaptation (LoRA) Fine-Tuning for Transformer Models [10.827800772359844]
微粒化複雑性理論を用いた変圧器モデルにおけるローランド適応(LoRA)の計算限界について検討する。
我々のキーとなる観察は、LoRA適応の勾配計算における低ランク分解の存在がアルゴリズムの高速化につながることである。
論文 参考訳(メタデータ) (2024-06-05T10:44:08Z) - Nearly Minimax Optimal Regret for Learning Linear Mixture Stochastic
Shortest Path [80.60592344361073]
線形混合遷移カーネルを用いた最短経路(SSP)問題について検討する。
エージェントは繰り返し環境と対話し、累積コストを最小化しながら特定の目標状態に到達する。
既存の作業は、イテレーションコスト関数の厳密な下限や、最適ポリシーに対する期待長の上限を仮定することが多い。
論文 参考訳(メタデータ) (2024-02-14T07:52:00Z) - Communication-Constrained Bandits under Additive Gaussian Noise [111.06688156723018]
クライアントが学習者にコミュニケーション制約のあるフィードバックを提供する分散マルチアームバンディットについて検討する。
我々は、この下限を小さな加法係数にマッチさせるマルチフェーズ帯域幅アルゴリズム、$mathtUEtext-UCB++$を提案する。
論文 参考訳(メタデータ) (2023-04-25T09:31:20Z) - Agnostic Reinforcement Learning with Low-Rank MDPs and Rich Observations [79.66404989555566]
我々は、リッチな観測空間を持つより現実的な非依存的RLの設定と、近似的ポリシーを含まないような固定されたポリシーのクラス$Pi$を考える。
我々は,MDPの階数$d$の誤差が有界な設定のためのアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-06-22T03:20:40Z) - Minimax Regret for Stochastic Shortest Path [63.45407095296692]
我々は、エージェントが最小の総予想コストで目標状態に達する必要がある最短パス(SSP)問題を研究します。
この設定に対するminimaxの後悔は、$widetilde O(B_star sqrt|S| |A|K)$であり、$B_star$は任意の状態から最適なポリシーの予想コストに拘束されることを示しています。
本アルゴリズムは, 有限水平MDPにおける強化学習の新たな削減を基礎として, エピソードごとのインタイム動作を行う。
論文 参考訳(メタデータ) (2021-03-24T10:11:49Z) - Learning Near Optimal Policies with Low Inherent Bellman Error [115.16037976819331]
エピソード強化学習における近似線形作用値関数を用いた探索問題について検討する。
我々は,検討した設定に対して最適な統計率を達成するアルゴリズムを用いて,Emphbatch仮定のみを用いて探索を行うことが可能であることを示す。
論文 参考訳(メタデータ) (2020-02-29T02:02:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。