論文の概要: GRRR: The Geometry of Reshaping, Rotation, and Routing in Decoder LLM post-training
- arxiv url: http://arxiv.org/abs/2609.22146v1
- Date: Wed, 26 Aug 2026 04:56:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.733244
- Title: GRRR: The Geometry of Reshaping, Rotation, and Routing in Decoder LLM post-training
- Title(参考訳): GRRR:Decoder LLMポストトレーニングにおける整形・回転・ルーティングの幾何学
- Abstract要約: 本研究では,事前訓練後の重みに対するLarge Language Models (LLM) の重みの変化について検討した。
対角成分の除去は、通常、トレーニング後の利益のほとんどを保存している。
- 参考スコア(独自算出の注目度): 9.24766442685354
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study how post-training changes the weights of Large Language Models (LLMs) relative to their pretrained weights. Across 12 post-training chains with supervised fine-tuning (SFT) and reinforcement learning (RL), we express each weight update in the pretrained matrix's singular value decomposition (SVD) frame. This decomposition separates the changes of three geometrically distinct components: diagonal values, which reshapes singular values; off-diagonal values, which rotates the coupling between pretrained input and output directions; and null-space values, which routes outside the matrix's original nonzero SVD core. On a math evaluation suite, we find that removing the diagonal component usually preserves most of the gains from post-training. These results suggest that post-training gains are carried primarily by reconfiguring and extending pretrained pathways rather than by substantially changing singular values of pre-trained models.
- Abstract(参考訳): 本研究では,事前訓練後の重みに対するLarge Language Models (LLM) の重みの変化について検討した。
教師付き微調整(SFT)と強化学習(RL)を併用した12個のポストトレーニングチェーンにおいて, 前訓練行列の特異値分解(SVD)フレームにおける各重み更新を表現した。
この分解は3つの幾何学的に異なる成分の変化を分離する: 対角値、特異値が再活性化される、外対角値、事前訓練された入力と出力方向の結合を回転させる、および行列の元々の非ゼロSVDコアの外側を通るヌル空間値。
数学評価スイートでは、対角成分の除去は通常、ポストトレーニングの利益のほとんどを保存している。
これらの結果から, 学習後ゲインは, 学習前モデルの特異値を大幅に変化させるのではなく, 学習前経路を再構成し, 拡張することによって行われることが示唆された。
関連論文リスト
- COEC: Calibrated Orthogonal-Equivalence Compensation for Structured Pruning of Large Language Models [13.501861808796873]
構造化プルーニングのためのトレーニングフリー補償フレームワークとしてCOEC(Calibrated Orthogonal-Equivalence Compensation)を提案する。
Llama-3、Llama-3.1、Qwen2.5のモデルファミリーの実験では、COECは全てのモデルにおけるパープレキシティを改善し、ほとんどの設定においてゼロショット精度を向上している。
論文 参考訳(メタデータ) (2026-08-21T14:20:49Z) - Sparse Weight Decomposition for Efficient Circuit Extraction [36.87892448834478]
複雑な事前訓練された変換器は、回路抽出のための解釈可能なユニットを自然に公開しない。
本稿では,各重み行列を2つのスパース因子に分解することで,事前学習した射影を分解するスパース重み分解法を提案する。
SWDは,非ゼロ因子値の微調整後,すべての注意および重み行列のフルモデル置換に有効であることを示す。
論文 参考訳(メタデータ) (2026-08-04T16:40:48Z) - Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors [110.10775872372047]
EmphMagnitude-Direction-Direction (MD) Decouplingを提案する。
これは、各重量をハイパースフィア上の固定ノルム方向に分解し、学習可能な1ローとカラムごとのマグニチュードゲインを、別々の学習速度で更新する。
アダムとムーンの双方で、MD Decouplingはよく調整されたベースラインを改善し、モデルの幅を調整せずに最適なLRを転送し、大規模なMixture-of-Expertsモデルのスケールに役立っている。
論文 参考訳(メタデータ) (2026-06-24T15:40:26Z) - Understanding Post-Training Structural Changes in Large Language Models [3.054513120350576]
後学習は大規模言語モデル(LLM)の振る舞いを根本的に変える
本研究は,指導チューニングと長鎖蒸留(Long-CoT)の2つの広く採用されているポストトレーニング手法に焦点をあてる。
論文 参考訳(メタデータ) (2025-09-22T15:03:36Z) - PAID: Pairwise Angular-Invariant Decomposition for Continual Test-Time Adaptation [70.98107766265636]
本稿では,事前学習した重みの幾何学的特性を出発点として,3つの重要な成分(等級,絶対角,対角構造)を体系的に解析する。
両角構造は多種多様なドメインにわたって安定であり, ドメイン不変な意味情報を符号化し, 適応中に保存すべきことを示唆する。
論文 参考訳(メタデータ) (2025-06-03T05:18:15Z) - Tangent Transformers for Composition, Privacy and Removal [58.280295030852194]
TAFT(Tangent Attention Fine-Tuning)は、線形変換器の微調整方法である。
TAFT(Tangent Attention Fine-Tuning)は、線形変換器の微調整方法である。
論文 参考訳(メタデータ) (2023-07-16T18:31:25Z) - Orthogonal Jacobian Regularization for Unsupervised Disentanglement in
Image Generation [64.92152574895111]
直交ジャコビアン正規化法(OroJaR)を提案する。
提案手法は, 絡み合った, 制御可能な画像生成に有効であり, 最先端の手法に対して好適に機能する。
論文 参考訳(メタデータ) (2021-08-17T15:01:46Z) - Learning Low-rank Deep Neural Networks via Singular Vector Orthogonality
Regularization and Singular Value Sparsification [53.50708351813565]
各ステップにSVDを適用することなく、トレーニング中に低ランクDNNを明示的に達成する最初の方法であるSVDトレーニングを提案する。
SVDトレーニングがDNN層のランクを著しく低減し,同じ精度で計算負荷の低減を実現することを実証的に示す。
論文 参考訳(メタデータ) (2020-04-20T02:40:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。