論文の概要: Fora: From Weight-Space to Function-Space Protection in Capability-Preserving Fine-Tuning
- arxiv url: http://arxiv.org/abs/2606.31092v2
- Date: Wed, 01 Jul 2026 05:53:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.078714
- Title: Fora: From Weight-Space to Function-Space Protection in Capability-Preserving Fine-Tuning
- Title(参考訳): Fora: 軽量空間から機能空間保護へ
- Abstract要約: 我々は、その能力はウェイト行列の特異幾何よりも活性化部分空間によってより忠実に特徴づけられると論じる。
FORAは、重み空間の投影と標準正規化よりも一貫して改善されていることを示す。
- 参考スコア(独自算出の注目度): 6.942965409851371
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Full fine-tuning adapts large language models to new tasks but can erode capabilities they already possess. Existing remedies protect through proxies such as parameter distances, importance penalties, output matching, or dominant singular directions of the weights, but none directly asks which activation directions the preserved capability relies on. We argue that a capability is characterized more faithfully by the activation subspace it induces than by the singular geometry of the weight matrix, and develop function-space protection, instantiated as FORA (Function-space Orthogonal Residual Adaptation). From label-free calibration inputs, FORA estimates, per layer, the principal directions $Q$ of the input-activation covariance and forms a right projector $P_Q = I - QQ^T$. Paired with a left projector $P_U$ from the weight SVD, the update is $ΔW = P_U M P_Q + U_2 D_δ V_2^T$: a high-capacity branch structurally barred from reading capability-relevant function directions, plus a narrow spectral channel for controlled plasticity. The construction extends to parameter-efficient adaptation via $M \to (α/r) BA$. Across three settings on Qwen3-1.7B, including COGS and GSM8K learned while preserving translation and translation learned while preserving math, FORA consistently improves preservation over weight-space projection and standard regularization, with only a small new-task trade-off in the math-preservation setting. A controlled ablation isolating the projection source shows that the advantage comes not from projection itself, but from projecting onto capability-derived rather than weight-derived directions. Code is available at https://github.com/zrui239/FORA.
- Abstract(参考訳): 完全な微調整は、大きな言語モデルを新しいタスクに適応させるが、すでに持っている機能を省くことができる。
既存の治療薬は、パラメータ距離、重要刑罰、出力マッチング、重量の優越的な特異な方向などのプロキシを通して保護されるが、保存された能力がどのアクティベーション方向に依存するかを直接は問わない。
重み行列の特異な幾何よりも活性化部分空間により、その能力はより忠実に特徴づけられ、FORA(Function-space Orthogonal Residual Adaptation)としてインスタンス化された関数空間保護が発達する。
ラベルなしキャリブレーション入力から、FORAは層ごとに、入力アクティベーション共分散の主方向$Q$を推定し、右プロジェクタ$P_Q = I - QQ^T$を形成する。
重量 SVD から左プロジェクタ $P_U$ を装備し、この更新は$ΔW = P_U M P_Q + U_2 D_δ V_2^T$: 可塑性を制御するための狭いスペクトルチャネルに加えて、読み取り能力関連関数方向から構造的に制限された高容量分岐である。
この構成は、$M \to (α/r) BA$ によるパラメータ効率適応にまで拡張される。
Qwen3-1.7B上の3つの設定(COGSとGSM8Kを含む)は、数学を保存しながら学習した翻訳と翻訳を保存しながら学習し、ForreAは一貫して重量空間の投影と標準正規化の保存を改善し、数学保存設定では少し新しいタスクのトレードオフしか持たない。
射影源を分離する制御されたアブレーションは、その利点は射影自体からではなく、重量方向ではなく能力から射影することにあることを示している。
コードはhttps://github.com/zrui239/FORA.comから入手できる。
関連論文リスト
- Bug or Feature$^2$: Weight Drift, Activation Sparsity and Spikes [53.726365933748134]
標準損失と正に偏りのある活性化関数の相互作用によって引き起こされる負の重みのドリフトを解析する。
79の構成にまたがるスパシティ・精度のトレードオフを特徴付けるとともに、$sim$70%のアクティベーション・スパシティよりも高い精度の崖を識別する。
論文 参考訳(メタデータ) (2026-05-17T21:29:20Z) - BASIS: Balanced Activation Sketching with Invariant Scalars for "Ghost Backpropagation" [0.0]
正確なバックプロパゲーションに必要な活性化メモリは、ネットワーク深さ、コンテキスト長、特徴次元と線形にスケールする。
本稿では,活性化メモリをバッチ次元とシーケンス次元から完全に分離する効率的なバックプロパゲーションアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-05T20:38:25Z) - Learning in the Null Space: Small Singular Values for Continual Learning [15.50990273412897]
NESS (Null-space Estimated from Small Singular value) は、勾配操作ではなく、重み空間に直交性を直接適用する手法である。
NESSは各層の入力表現の最小特異値を用いて近似ヌル空間を構築し、この部分空間に制約されたコンパクトローランク適応(LoRA)によるタスク固有の更新をパラメータ化する。
3つのベンチマークデータセットの理論的解析と実験により、連続学習における小さな特異値の役割が強調され、タスク間の競合性能、低い忘れ込み、安定した精度が示される。
論文 参考訳(メタデータ) (2026-02-25T13:55:06Z) - Non-Interfering Weight Fields: Treating Model Parameters as a Continuously Extensible Function [0.0]
大規模言語モデルは、すべての学習した知識を1つの固定重みベクトルに格納する。
破滅的な忘れ物として知られるこの制限は、何十年にもわたって原則化された解決策に抵抗してきた。
本稿では,不干渉重みフィールド(Non-Interfering Weight Fields)を提案する。これは固定重みパラダイムを,需要に応じて重み設定を生成する学習関数に置き換えるフレームワークである。
論文 参考訳(メタデータ) (2026-02-20T21:43:26Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - SeqPE: Transformer with Sequential Position Encoding [76.22159277300891]
SeqPEは、各$n$次元位置指数をシンボルシーケンスとして表現し、軽量なシーケンシャル位置エンコーダを用いて埋め込みを学習する。
言語モデリング、長文質問応答、および2次元画像分類による実験により、SeqPEはパープレキシティ、正確なマッチング(EM)、精度の強いベースラインを超えるだけでなく、手作業によるアーキテクチャ再設計を必要とせず、多次元入力へのシームレスな一般化を可能にする。
論文 参考訳(メタデータ) (2025-06-16T09:16:40Z) - Stochastic Linear Bandits with Protected Subspace [51.43660657268171]
線形目的関数を最適化するが、報酬は未知の部分空間にのみ得られる線形帯域問題の変種について検討する。
特に、各ラウンドでは、学習者は、目的または保護されたサブスペースを、アクションの選択とともにクエリするかどうかを選択する必要がある。
提案アルゴリズムはOFULの原理から導かれるもので,保護された空間を推定するためにクエリのいくつかを利用する。
論文 参考訳(メタデータ) (2020-11-02T14:59:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。