論文の概要: Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models
- arxiv url: http://arxiv.org/abs/2605.26895v1
- Date: Tue, 26 May 2026 11:56:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.988681
- Title: Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models
- Title(参考訳): 大きさが無視され効果が重要:大規模言語モデルにおけるスケールベクトルについて
- Authors: Mingze Wang, Shuchen Zhu, Yuxin Fang, Binghui Li, Kai Shen, Shu Zhong,
- Abstract要約: スケールベクトルはモデルパラメータの無視可能な部分のみを構成するが、モデル事前学習を著しく低下させることを示す。
我々の理論はさらに、プレノームアーキテクチャではスケールベクトルは表現性を高めず、その後の線形写像に対する自己増幅プレコンディショニング効果によって最適化を改善することを示している。
- 参考スコア(独自算出の注目度): 22.345571415005722
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Normalization layers in modern large language models (LLMs) consist of a deterministic normalization operation and a learnable scale vector. While the normalization operation has been extensively studied, the scale vector remains poorly understood despite its ubiquitous use. In this work, we present a systematic study of scale vectors in LLMs from the perspectives of expressivity, optimization, and architectural structure. First, we show empirically that although scale vectors constitute only a negligible fraction of model parameters, removing them substantially degrades LLM pre-training. Our theory further shows that, in Pre-Norm architectures, scale vectors do not increase expressivity; instead, they improve optimization through a self-amplifying preconditioning effect on subsequent linear mappings. Second, we investigate the role of weight decay for scale vectors. By distinguishing Input-Norm and Output-Norm layers, we theoretically show that weight decay is beneficial for the former but harmful for the latter, due to their distinct roles in optimization and expressivity. Third, motivated by this understanding, we propose three lightweight and complementary improvements to scale vectors: branch-specific heterogeneity, improved placement around linear mappings, and magnitude-direction reparameterization. Both theory and experiments show that each improvement yields consistent gains. Finally, we combine these improvements into a unified scale-vector strategy and evaluate it through extensive LLM pre-training experiments on dense and mixture-of-experts models ranging from 0.12B to 2B parameters, across multiple optimizers and learning rate schedules, under industrial-scale token budgets. The unified strategy consistently achieves lower terminal loss than well-tuned baselines and exhibits more favorable scaling behavior, while adding negligible parameter and computational overhead.
- Abstract(参考訳): 現代の大規模言語モデル(LLM)における正規化層は、決定論的正規化演算と学習可能なスケールベクトルからなる。
正規化操作は広く研究されているが、スケールベクトルはユビキタスな使用にもかかわらず理解されていない。
本研究では, LLMにおけるスケールベクトルを, 表現性, 最適化, アーキテクチャ構造の観点から体系的に研究する。
まず、スケールベクトルはモデルパラメータの無視可能な部分のみを構成するが、それらを取り除くことでLCMの事前学習が大幅に低下することを示す。
我々の理論はさらに、プレノームアーキテクチャではスケールベクトルは表現性を高めず、その後の線形写像に対する自己増幅プレコンディショニング効果によって最適化を改善することを示している。
第2に,スケールベクトルにおける重み劣化の役割について検討する。
インプット・ノーム層とアウトプット・ノーム層を区別することにより、重量減衰は前者にとって有益であるが後者には有害であることを示す。
第三に、この理解を動機として、枝特異な不均一性、線形写像の配置の改善、等級方向再パラメータ化という、3つの軽量で相補的なスケールベクトルの改善を提案する。
理論も実験も、それぞれの改善が一貫した利益をもたらすことを示している。
最後に、これらの改善を統一されたスケールベクター戦略に統合し、産業規模のトークン予算の下で、0.12Bから2Bパラメータの高密度およびミキシング・オブ・エキスパートモデルのLLM事前学習実験を通じて評価する。
統一された戦略は、よく調整されたベースラインよりも低い端末損失を一貫して達成し、無視可能なパラメータと計算オーバーヘッドを追加しながら、より好ましいスケーリング動作を示す。
関連論文リスト
- Understanding the Effects of Domain Finetuning on LLMs [60.874016669351874]
大規模医療言語モデルにおけるドメイン固有微調整に関する最初の体系的研究について述べる。
解析の結果,微調整は表現部分空間の小さな部分集合のみを修飾することがわかった。
サブ空間におけるこれらの変化を解釈するために、微調整によって引き起こされる方向パラメータシフトを明示的にキャプチャするチューニングベクトルを提案する。
論文 参考訳(メタデータ) (2025-10-10T13:14:06Z) - Scaling with Collapse: Efficient and Predictable Training of LLM Families [8.979516613284174]
崩壊は計算効率のトレーニングのサインとして現れる。
計算効率のトレーニングのサインとして崩壊が現れることを示す。
大規模に2つの応用を実演する。
論文 参考訳(メタデータ) (2025-09-29T17:26:11Z) - OSoRA: Output-Dimension and Singular-Value Initialized Low-Rank Adaptation [9.048461365342204]
大規模言語モデル(LLM)のための新しいPEFT法であるOSoRAを提案する。
OSoRAは、微調整中にトレーニング可能なパラメータの数を最小化することで、計算リソースの要求を大幅に削減する。
数学的推論、常識推論、その他のベンチマークの総合的な評価は、OSoRAが最先端の手法と同等または優れた性能を達成していることを示している。
論文 参考訳(メタデータ) (2025-05-20T13:34:06Z) - RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models [53.571195477043496]
本稿では,RoSTE (Rotated Straight-Through-Estimator) というアルゴリズムを提案する。
RoSTEは、量子化を意識した微調整(QA-SFT)と適応的な回転戦略を組み合わせることで、アクティベーションアウトリーを減少させる。
その結果, 予測誤差は収束重みの量子化誤差と直接比例し, 最適化された回転構成により効果的に管理できることが判明した。
論文 参考訳(メタデータ) (2025-02-13T06:44:33Z) - Latent Thought Models with Variational Bayes Inference-Time Computation [52.63299874322121]
ラテント思考モデル(LTM)は、ラテント空間における明示的な事前モデルに従う明示的なラテント思考ベクトルを包含する。
LTMは自己回帰モデルや離散拡散モデルよりも優れたサンプルおよびパラメータ効率を示す。
論文 参考訳(メタデータ) (2025-02-03T17:50:34Z) - Zeroth-Order Fine-Tuning of LLMs in Random Subspaces [63.10833446782114]
言語モデルのサイズが大きくなるにつれて、バックプロパゲーションに対するメモリ要求が増加する。
Zeroth-order (ZO) 最適化手法はメモリ効率の良い代替手段を提供する。
本稿では,高次元摂動によって生じる課題に対処するために,部分空間ゼロ次最適化を提案する。
論文 参考訳(メタデータ) (2024-10-11T17:01:43Z) - Building on Efficient Foundations: Effectively Training LLMs with Structured Feedforward Layers [16.253898272659242]
大規模言語モデル(LLM)における最先端の結果は、しばしばスケールに依存し、計算コストがかかる。
本研究は,計算集約型フィードフォワードネットワーク(FFN)を対象とするトランスフォーマーベースLLMに着目した。
広範かつ構造化されたネットワークは、最適なトレードオフにおいて、パラメータが少なく、高密度モデルよりも損失が少ないFLOPをより効率的に活用できることを示す。
論文 参考訳(メタデータ) (2024-06-24T08:43:21Z) - Understanding Augmentation-based Self-Supervised Representation Learning
via RKHS Approximation and Regression [53.15502562048627]
最近の研究は、自己教師付き学習とグラフラプラシアン作用素のトップ固有空間の近似との関係を構築している。
この研究は、増強に基づく事前訓練の統計的分析に発展する。
論文 参考訳(メタデータ) (2023-06-01T15:18:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。