論文の概要: SAD-LoRA: Spectral Alignment for Low-Rank Knowledge Distillation
- arxiv url: http://arxiv.org/abs/2607.04306v1
- Date: Sun, 05 Jul 2026 13:44:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.888248
- Title: SAD-LoRA: Spectral Alignment for Low-Rank Knowledge Distillation
- Title(参考訳): SAD-LoRA:低ランク知識蒸留のためのスペクトルアライメント
- Abstract要約: 微調整の教師をLoRA適応の学生に誘惑することはパラメータ効率のよい圧縮の標準的なレシピであるが、出力レベルのKDはどのランク-$r$の重みがアダプタの占有する部分空間を明示的に制御しない。
textbfSAD-LoRAは、データ重み付き学生空間参照更新$DWTSigx1/2$からこの部分空間を選択し、colspan(B)$で微分可能な主角損失によってトレーニング中に維持する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Distilling a fine-tuned teacher into a LoRA-adapted student is a standard recipe for parameter-efficient compression, but output-level KD does not explicitly control which rank-$r$ weight subspace the adapter occupies. We propose \textbf{SAD-LoRA} (\textbf{S}pectral \textbf{A}lignment \textbf{D}istillation), which selects this subspace from the data-weighted student-space reference update $\DWT\Sigx^{1/2}$ and maintains it during training via a differentiable principal-angle loss on $\colspan(B)$. We show that the data-weighted distillation error decomposes exactly into subspace misalignment, within-subspace coefficient mismatch, and irreducible rank residual; standard KD can affect the first term only indirectly through output gradients. On controlled synthetic problems with a flat teacher spectrum, SAD-LoRA reduces the subspace-misalignment term from $51\%$ to nearly zero and lifts final subspace alignment from $0.49$ to $1.00$. On RoBERTa-large to RoBERTa-base distillation across six GLUE tasks, SAD-LoRA improves rank efficiency: at $r{=}4$, it matches or beats the strongest included spectral baseline on five of six tasks, and at $r{=}8$ it gives the best result on SST-2 and CoLA. Ablations identify subspace alignment as the load-bearing component, while coefficient matching is auxiliary.
- Abstract(参考訳): 微調整の教師をLoRA適応の学生に誘惑することはパラメータ効率のよい圧縮の標準的なレシピであるが、出力レベルのKDはどのランク-$r$の重みがアダプタの占有する部分空間を明示的に制御しない。
この部分空間は、データ重み付き学生空間参照更新$\DWT\Sigx^{1/2}$から選択され、$\colspan(B)$の異なる主角損失によってトレーニング中に維持される。
データ重み付き蒸留誤差は, 空間内不整合, 空間内係数ミスマッチ, 既約ランク残差に正確に分解され, 標準KDは出力勾配によってのみ間接的に第1項に影響を与える。
平らな教師スペクトルによる制御された合成問題において、SAD-LoRAは、部分空間調整項を511\%$からほぼ0に減らし、最終的な部分空間アライメントを0.49$から1.00$に引き上げる。
RoBERTa-largeからRoBERTa-baseへの6つのGLUEタスクにわたる蒸留では、SAD-LoRAはランク効率を改善し、$r{=}4$で6つのタスクのうち5つで最強に含まれるスペクトルベースラインにマッチまたは打ち負かし、$r{=}8$でSST-2とCoLAで最高の結果を与える。
アブレーションは、部分空間アライメントを負荷を含む成分とみなし、係数マッチングは補助的である。
関連論文リスト
- Sharp Rates and a One-Line Correction for Spectral Representation Learning [8.921166277011347]
自己管理エンコーダは、トレーニング時に誰も名前をつけないタスクの軽量プローブを通じてトレーニングされ、凍結され、再利用される。
標準相関解析、HGR最大相関、およびスペクトルのコントラスト損失の集団最適化は、全て、クロスビュー依存作用素のトップ-$k$特異部分空間を返す。
isotropy is the wrong hypothesis. the prior enters the transfer risk through through the task covariance $=mathbbE[top]$, and through its compression to the operator's leading singular direction。
論文 参考訳(メタデータ) (2026-09-14T16:26:55Z) - LoRA-TSD: Tangent-Space Spectral Descent for LoRA via Muon-Style Updates [48.87937677659571]
低ランク適応(LoRA)は、大型モデルを微調整する標準的な方法である。
固定ランク行列多様体に対してすべてのLoRAステップを接として扱うアダプタであるLoRA-TSDを導入する。
LoRA-Pro と LoRA-TSD の両方に対して最初のグローバル収束保証を与える。
論文 参考訳(メタデータ) (2026-09-02T15:41:45Z) - SDS-LoRA: Overcoming Anisotropic Gradient Scaling in Low-Rank Adaptation [64.33799467286265]
Low-Rank Adaptation (LoRA)は、大規模な事前訓練されたモデルの下流タスクへの効率的な適応を可能にする。
完全な微調整勾配が低ランク行列に逆伝播すると,その特異値によって誘導される異方性スケーリングを受けることを示す。
本稿では,後方パスから特異値を構造的に分離する新しい低ランクパラメータ化SDS-LoRAを提案する。
論文 参考訳(メタデータ) (2026-06-15T09:27:50Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - AR1-ZO: Topology-Aware Rank-1 Zeroth-Order Queries for High-Rank LoRA Fine-Tuning [17.98348342954707]
本稿では,このボトルネックが外部部分空間の必要性というよりも,測定トポロジの問題であることを示す。
AR1-ZOペアは、階数不変のアクティブシグナルを復元する、トポロジ対応のスケール$=r$と1$の原子クエリを交互に行う。
OPTモデルとQwen3モデルの実験により、信号機構が検証され、AR1-ZOが高ランクのLoRAを効果的にすることを示す。
論文 参考訳(メタデータ) (2026-05-19T12:39:30Z) - Catching a Moving Subspace: Low-Rank Bandits Beyond Stationarity [13.385373310554327]
本研究では,スカラーフィードバックを用いた縦-縦-縦-縦-横-横-縦-縦-縦-縦-縦-縦-縦-縦-縦-縦-縦-縦-縦-縦-縦-縦-横-横-横-横-横-横-横-横-横-横-横-縦-横-横-横-横-横-横-横-横-
シングルプレイスカラー報酬では、移動部分空間は報酬の二次函数によって回復可能である。
これは、識別境界を特徴づけ、本質的なランクの動的回帰率を得るための最初の研究である。
論文 参考訳(メタデータ) (2026-05-18T22:01:48Z) - AdaPreLoRA: Adafactor Preconditioned Low-Rank Adaptation [1.9996763865817948]
低ランク適応(LoRA)は2つの低ランク要因の積として重み更新をモデル化する。
AdaPreLoRAは、$W$にAdaeckerプリコンディショナー$H_t$を採用し、その結果のファクタ空間ソリューションファミリから選択することで、このギャップを埋める。
論文 参考訳(メタデータ) (2026-05-09T06:37:44Z) - Scaling Federated Linear Contextual Bandits via Sketching [49.12000877146222]
本稿では,FSCLB(Federated Sketch Contextual Linear Bandits)を提案する。
合成と実世界の両方のデータセットの実験では、FSCLBは計算と通信のコストを90%以上削減している。
論文 参考訳(メタデータ) (2026-05-01T08:22:06Z) - Training Transformers in Cosine Coefficient Space [0.0]
キャラクターレベルのシェイクスピアのスクラッチから訓練されたトランスフォーマーは、検証損失が1.604$で$K = mn/2$に達した。
同じトレーニング可能なパラメータ数でのランク48のLoRA分解は、わずか1.801$である。
ランダムな正規直交基底はノイズ中のDCTを$K = mn/2$で一致させ、$K = mn/10$と$K = mn/20$で圧縮すると、高階行列をホストできる部分空間が損失を低く保つことを示す。
論文 参考訳(メタデータ) (2026-04-06T05:39:31Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Subspace Geometry Governs Catastrophic Forgetting in Low-Rank Adaptation [0.0]
Low-Rank Adaptation (LoRA) は、大規模な事前学習モデルに適応するためのパラメータ効率の高いアプローチとして登場した。
勾配部分空間相互作用のレンズを通して,LoRAにおける破滅的忘れを特徴付ける幾何学的理論を提案する。
論文 参考訳(メタデータ) (2026-02-10T22:45:47Z) - FedSVD: Adaptive Orthogonalization for Private Federated Learning with LoRA [68.44043212834204]
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
論文 参考訳(メタデータ) (2025-05-19T07:32:56Z) - Stochastic Linear Bandits with Protected Subspace [51.43660657268171]
線形目的関数を最適化するが、報酬は未知の部分空間にのみ得られる線形帯域問題の変種について検討する。
特に、各ラウンドでは、学習者は、目的または保護されたサブスペースを、アクションの選択とともにクエリするかどうかを選択する必要がある。
提案アルゴリズムはOFULの原理から導かれるもので,保護された空間を推定するためにクエリのいくつかを利用する。
論文 参考訳(メタデータ) (2020-11-02T14:59:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。