論文の概要: Frozen Cores Need Task Signal: Fisher-Whitened Cross-Covariance for Low-Resource LLM Adaptation
- arxiv url: http://arxiv.org/abs/2609.00762v1
- Date: Tue, 01 Sep 2026 05:52:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.406028
- Title: Frozen Cores Need Task Signal: Fisher-Whitened Cross-Covariance for Low-Resource LLM Adaptation
- Title(参考訳): 冷凍炉コアにタスク信号:低リソースLCM適応のための釣り加工のクロス共分散
- Authors: Wentao Ye, Zhanming Shen, Zhiqing Xiao, Yao Ding, Haobo Wang, Gang Chen,
- Abstract要約: 厳格な訓練州予算の下で, コンストラクタ効率の高い微調整の選択について検討した。
我々は、署名された入力-エラーの相互共分散を推定し、対角的なフィッシャーモーメントと白くし、その結果の局所距離でそれを切り離し、選択した方向を写像し、より薄いQRを適用して安定したコア座標を得るFCCAを紹介する。
Qwen2.5-3B では、FCCA は 83.0 のマクロ平均値に達し、その2.3 ポイントは、マッチした予算のコンストラクタよりも高く、11 タスクすべてにおいて未白の RawGrad コントロールを超えている。
- 参考スコア(独自算出の注目度): 18.8104643146881
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Parameter-efficient fine-tuning is usually framed as a question of how many parameters to update. Under a severe trainable-state budget, however, where those coefficients act is equally consequential. We study this choice through frozen-core adaptation: a calibration pass fixes left and right bases for each weight matrix, and fine-tuning optimizes only an $r\times r$ core. This removes the ability of trainable factors to repair a poor initial span and makes subspace quality directly observable. We introduce FCCA, which estimates the signed input--error cross-covariance, whitens it with diagonal Fisher moments, truncates it in the resulting local metric, maps the selected directions back, and applies thin QR to obtain stable core coordinates. Under a matched $r^2$ budget, we compare eight basis constructors on 11 tasks, four model settings, and three seeds. On Qwen2.5-3B, FCCA reaches an 83.0 macro-average, 2.3 points above the next-best matched-budget constructor, and exceeds its unwhitened RawGrad control on all 11 tasks. It ranks first at all three Qwen scales and finishes within 0.13 points of the best method on Llama-3.2-1B. Controlled ablations show gains of 2.7--17.2 points from whitening and identify QR as necessary for stable core optimization in the tested regime. Finally, FCCA comes within 0.32 and 0.23 average points of LoRA and DoRA while optimizing 36.9K rather than roughly 7.4M parameters. These results show that a carefully selected fixed span can recover most of the benefit of movable low-rank factors at a much smaller trainable and optimizer-state cost.
- Abstract(参考訳): パラメータ効率の良い微調整は通常、更新すべきパラメータの数に関する質問としてフレーム化される。
しかし、厳しい訓練可能な州予算の下では、これらの係数が平等に作用する。
この選択を凍結コア適応を用いて検討し、各重み行列の左右ベースを校正パスで固定し、微調整はr=r=コアのみを最適化する。
これにより、トレーニング可能な要素が、貧弱な初期スパンを修復できなくなり、サブスペース品質を直接監視できるようになる。
我々は、署名された入力-エラーの相互共分散を推定し、対角的なフィッシャーモーメントと白くし、その結果の局所距離でそれを切り離し、選択した方向を写像し、より薄いQRを適用して安定したコア座標を得るFCCAを紹介する。
一致した$r^2$の予算の下で、11タスクの8つのベースコンストラクタ、4つのモデル設定、3つのシードを比較します。
Qwen2.5-3B では、FCCA は 83.0 のマクロ平均値に達し、その2.3 ポイントは、マッチした予算のコンストラクタよりも高く、11 タスクすべてにおいて未白の RawGrad コントロールを超えている。
3つのQwenスケールで1位、Llama-3.2-1Bのベストメソッドの0.13ポイント以内でフィニッシュする。
制御されたアブレーションは、ホワイトニングから2.7--17.2ポイントの上昇を示し、テスト体制における安定したコア最適化に必要なQRを識別する。
最後に、FCCAは、約7.4Mパラメータではなく36.9Kを最適化しながら、LoRAとDoRAの0.32と0.23の平均点以内である。
これらの結果から, 慎重に選択された固定スパンは, より少ないトレーニングおよび最適状態のコストで移動可能な低ランク因子の利点を回復できることがわかった。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - SS-ESOAP: Self-Scaled Adaptive Preconditioning for Physics-Informed Learning [70.71795707610961]
メソッドは、Kronecker幾何に適応したスカラーセマントエネルギー補正でSOAPスタイルのプレコンディショニングを強化する。
メソッドは8つのPDEベンチマークのうち6つで最下位の残差に達する。
4つの代表PDEの3列の$L2$と$H1$エラーは、低い残差と改善された解精度の間のリンクをサポートする。
論文 参考訳(メタデータ) (2026-08-29T21:34:47Z) - SchurQuant: Groupwise Discrete Optimization for Layer-Wise LLM Quantization [9.043029012704817]
本稿では,サフィックスの最適連続応答を解析的に排除するSCHUROPTを紹介する。
クローズドフォームの行単位のスケール/ゼロポイントのリフィッティングと、整数符号上の座標降下を交互に行う。
8つのLlamaモデルとQwenモデルで、SCHURQUANTはゼロショットの精度が最も高い。
論文 参考訳(メタデータ) (2026-08-16T06:29:10Z) - Agentic Stage-One Stellarator Optimization: Autonomous Multi-Objective Search for Finite-Beta Equilibria [0.0]
強調ステージワン最適化の概念実証を行う。
エージェント外ループ制御は有限ベータ・多目的探索を維持でき、繰り返し最適化を改良された平衡のスケーラブルなソースに変えることができる。
論文 参考訳(メタデータ) (2026-08-02T16:08:52Z) - TabPFN beyond Tabular Data: Calibration and Accuracy on Multimodal Embeddings [2.4483752182160954]
我々はTabPFNを,凍結画像,テキスト,オーディオエンコーダのためのプラグアンドプレイ,ゼログレートな分類ヘッドとして評価する。
TabPFNは14のデータセット、11のエンコーダ、3つのモダリティにまたがる22,820回の評価エピソードにおいて、負の対数類似度(NLL)と期待の校正誤差(ECE)の双方において、9つの分類長の中で最高の平均ランクを達成している。
その精度の利点は条件付きであり、中程度から高いショット数と低からモデレートの特徴次元に集中している。
論文 参考訳(メタデータ) (2026-07-13T02:11:27Z) - Towards Robust Training in NNGPT AutoML Pipeline: A Loss-Optimizer Pairing Selection Study [48.83701310501069]
本稿では, 一つのレシピがヘテロジニアスなアーキテクチャプールに十分であるか, 最適ペアリングが構造的に多様なモデルによって異なるかを検討する。
我々は,CEL(Cross-Entropy),NLL(Negative Log-Likelihood),および最近導入された遺伝学的に進化したNGL損失を,LEMURヘテロジニアス・アーキテクチャー・プールの6つの画像分類データセット上に提示したベースモデル間で比較検討した。
我々の結果は、単一のペアリングが普遍的に最適でないことを確認した。AdamやAdamWとのクロスエントロピーは、最も堅牢な選択である。
論文 参考訳(メタデータ) (2026-06-18T20:51:42Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - One-for-All: A Lightweight Stabilized and Parameter-Efficient Pre-trained LLM for Time Series Forecasting [4.364999214109123]
One-for-Allは、時系列分析のためにトレーニング済みの大規模言語モデルを適用するためのフレームワークである。
rsLoRAは、低いランクでの証明可能な勾配安定性を可能にする数学的に基底的なランク安定化機構を導入している。
One-for-Allは最先端の効率と精度のトレードオフを達成する。
論文 参考訳(メタデータ) (2026-03-31T13:54:43Z) - CarBoN: Calibrated Best-of-N Sampling Improves Test-time Reasoning [62.56541355300587]
本稿では,高逆推論経路に向けてモデルを適応的に修正する一般的なテスト時間校正フレームワークを提案する。
本フレームワークでは,まず解空間を探索し,次にロジットの校正を学習する二相法であるCarBoNを提案する。
MATH-500とAIME-2024の実験では、CarBoNは効率を向上し、同じ精度に達するために最大4倍のロールアウトが可能である。
論文 参考訳(メタデータ) (2025-10-17T14:04:37Z) - Nearly Minimax Optimal Reinforcement Learning for Linear Markov Decision
Processes [80.89852729380425]
そこで本研究では,最小限の最小残差である$tilde O(dsqrtH3K)$を計算効率よく実現したアルゴリズムを提案する。
我々の研究は線形 MDP を用いた最適 RL に対する完全な答えを提供する。
論文 参考訳(メタデータ) (2022-12-12T18:58:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。