論文の概要: Super Weights in LLMs and the Failure of Selective Training
- arxiv url: http://arxiv.org/abs/2607.08733v1
- Date: Thu, 09 Jul 2026 17:35:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.612223
- Title: Super Weights in LLMs and the Failure of Selective Training
- Title(参考訳): LLMの超軽量化と選択学習の失敗
- Abstract要約: 分離したスーパーウェイト(100から8,192パラメータ)のトレーニングでは、OLMo-1BとOLMo-7Bのランダムゲスティングレベルに精度を落としている。
同じdown_proj層でランダムに選択された位置の同じ数をトレーニングすることで、ベースラインよりも改善される。
- 参考スコア(独自算出の注目度): 2.168162018395079
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work identified Super Weights, individual parameters whose removal degrades model performance by orders of magnitude. We show that this degradation due to pruning Super Weights does not universally apply to all LLMs. Furthermore, if these parameters are so important, Super Weight-aware training should be effective. We show the opposite. Training Super Weights in isolation (100 to 8,192 parameters) drops accuracy to random-guessing levels on both OLMo-1B and OLMo-7B, and expanding to local neighborhoods of up to 36K parameters provides no improvement. The failure is specific to Super Weight coordinates: training an equal number of randomly chosen positions in the same down_proj layers instead improves over the baseline, so the collapse comes from targeting Super Weights, not from sparsity itself. Vanilla LoRA, updating every position in attention weight matrices through low-rank structure, succeeds with only 0.16% of parameters, and applying the same low-rank update to down_proj succeeds as well. A 10-seed ablation confirms that constraining LoRA updates at positions corresponding to Super Weight coordinates yields statistically indistinguishable results. These findings establish that parameter importance does not imply parameter trainability in isolation, and that effective fine-tuning relies on structured decompositions over entire layers rather than targeting individually important weights.
- Abstract(参考訳): 最近の研究では、除去した個々のパラメータが桁違いにモデル性能を低下させるスーパーウェイトが特定されている。
刈り取られたスーパーウェイトによるこの劣化は、全てのLLMに普遍的に適用されないことを示す。
さらに、これらのパラメータが重要である場合、スーパーウェイト対応トレーニングは効果的であるべきである。
私たちはその逆を示します。
分離したスーパーウェイト(100から8,192パラメータ)のトレーニングでは、OLMo-1BとOLMo-7Bの両方のランダムゲスティングレベルに精度を落とし、最大36Kパラメータのローカルエリアに拡張しても改善はない。
失敗はスーパーウェイト座標に特有で、同じdown_proj層で同じ数のランダムに選択された位置をトレーニングする代わりに、ベースライン上で改善する。
Vanilla LoRAは、低ランク構造による注目重量行列のすべての位置を更新し、パラメータの0.16%しか成功せず、down_projに同じ低ランク更新を適用することも成功している。
10列のアブレーションは、スーパーウェイト座標に対応する位置でのLoRA更新の制限が統計的に区別できない結果をもたらすことを確認している。
これらの結果から,パラメータの重要度は,個別に重要な重みを狙うのではなく,層全体の構造的分解に依存していることが明らかとなった。
関連論文リスト
- High-Rank Structured Modulation for Parameter-Efficient Fine-Tuning [57.85676271833619]
低ランク適応 (LoRA) は、全パラメータの微調整をシミュレートするために低ランク更新法を用いる。
textbfStructured textbfMOdulation textbfAdapterは、より高いランクを維持しながらトレーニング可能なパラメータを少なくする。
論文 参考訳(メタデータ) (2026-01-12T13:06:17Z) - Kernelized Sparse Fine-Tuning with Bi-level Parameter Competition for Vision Models [80.50996301430108]
スパースチューニングは、下流タスクに最も関係のある重みだけを調整することで、顕著なパフォーマンスを達成する。
上述の制限を克服する一段法SNELLAを提案する。
SNELLAは低メモリ使用量でSOTA性能を達成する。
論文 参考訳(メタデータ) (2025-10-28T03:39:18Z) - LIFT the Veil for the Truth: Principal Weights Emerge after Rank Reduction for Reasoning-Focused Supervised Fine-Tuning [32.86747945245703]
LLMの教師付き微調整により、強い推論能力が得られる。
フル微調整(Full FT)は計算コストが高く、過度にフィットしたり忘れたりする可能性がある。
以前大きな成功を収めたスパース微調整は、効率性と有効性の間に有望なトレードオフを提供する。
論文 参考訳(メタデータ) (2025-06-01T01:31:50Z) - EDoRA: Efficient Weight-Decomposed Low-Rank Adaptation via Singular Value Decomposition [2.5269004336032186]
Efficient Weight-Decomposed Low-Rank Adaptation (EDoRA) は、事前学習した重量を大きさと方向の成分に分解する新しいPEFT法である。
EDoRAは、LoRAやDoRAのような最先端の手法と比較して、競争力や優れた性能を達成する。
論文 参考訳(メタデータ) (2025-01-21T11:42:09Z) - The Super Weight in Large Language Models [7.631483871736014]
単一のパラメータでしか実行できないことは、LLMがテキストを生成する能力を損なう可能性がある。
超重みと呼ばれるパラメータを識別するためのデータフリー手法を提案する。
重み量子化では、スーパーウェイトを保存し、他のウェイトアウトレーヤを切断することで、ラウンド・ツー・アネレスト量子化は以前考えられていたよりもはるかに大きなブロックサイズにスケールできる。
論文 参考訳(メタデータ) (2024-11-11T18:05:48Z) - NEAT: Nonlinear Parameter-efficient Adaptation of Pre-trained Models [26.808251361020066]
微調整された事前学習モデルは、しばしば最先端のパフォーマンスをもたらすが、全てのパラメータを更新する際に計算コストがかかる。
本稿では,軽量ニューラルネットワークを用いた非線形PEFT手法NEATを提案し,事前学習した重みの非線形変換を学習する。
理論解析により, NEATは等価な表現性を維持しつつ, LoRA よりも高い効率を達成することが示された。
論文 参考訳(メタデータ) (2024-10-02T17:29:23Z) - Balancing LoRA Performance and Efficiency with Simple Shard Sharing [8.827921242078883]
textbfOptimal textbfShard textbfIntegration in textbfLoRAは、単純なシャード共有機構を通じて、このトレードオフに対処する新しいPEFTアプローチである。
Fossilsは、標準的なLoRAと、その顕著な変種を、モデルパフォーマンスメトリクスと計算効率の両方で大幅に上回っている。
論文 参考訳(メタデータ) (2024-09-19T10:26:42Z) - MELoRA: Mini-Ensemble Low-Rank Adapters for Parameter-Efficient Fine-Tuning [71.50432879573614]
低ランク適応 (LoRA) は、適応過程が本質的に低次元であるという考えに基づいている。
我々は、より高階を維持しながらトレーニング可能なパラメータを少なくするミニアンサンブルな低ランクアダプタMELoRAを提案する。
実験結果から, 自然言語理解タスクの8倍のトレーニングパラメータ, 続くタスクの36倍のトレーニングパラメータが得られた。
論文 参考訳(メタデータ) (2024-02-27T07:14:12Z) - DoRA: Weight-Decomposed Low-Rank Adaptation [57.68678247436207]
本稿では,FTとLoRAの相違点を明らかにするために,新しい重み分解解析法を提案する。
本研究は、FTの学習能力に類似することを目的として、重量分解低ランク適応(DoRA)を提案する。
DoRAは、事前訓練された重量を、微調整のための大きさと方向の2つの構成要素に分解する。
論文 参考訳(メタデータ) (2024-02-14T17:59:34Z) - PRILoRA: Pruned and Rank-Increasing Low-Rank Adaptation [65.268245109828]
我々はPRILoRAを導入し、各層ごとに異なるランクを線形に割り当て、トレーニングプロセスを通してプルーニングを行う。
8つのGLUEベンチマークで広範な実験を行い,PRILoRAの有効性を検証する。
論文 参考訳(メタデータ) (2024-01-20T20:25:17Z) - LoRA: Low-Rank Adaptation of Large Language Models [71.75808607987281]
Low-Rank Adaptation (LoRA)はトレーニング済みモデルの重みを凍結し、トレーニング可能な階数分解をTransformerアーキテクチャの各層に注入する。
GPT-3では、LoRAはトレーニング可能なパラメータの数を1万倍に減らし、計算ハードウェアの要求をフル微調整の3倍に削減できる。
論文 参考訳(メタデータ) (2021-06-17T17:37:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。