論文の概要: Demystifying Manifold Constraints in LLM Pre-training
- arxiv url: http://arxiv.org/abs/2605.04418v1
- Date: Wed, 06 May 2026 02:22:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.608689
- Title: Demystifying Manifold Constraints in LLM Pre-training
- Title(参考訳): LLMプレトレーニングにおけるデマイタイズマニフォールド制約
- Authors: Kang An, Jiaxiang Li, Donald Goldfarb, Shiqian Ma,
- Abstract要約: 本稿では,大規模言語モデル(LLM)事前学習における明示的多様体制約の役割を体系的に決定する。
Msign-Aligned Constrained (MACRO) を導入することで、Msign-Aligned Constrained (MACRO) は証明可能な収束性を持ち、単ループ最適化フレームワークである。
- 参考スコア(独自算出の注目度): 9.002615433212988
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The empirical success of large language model (LLM) pre-training relies heavily on heuristic stabilization techniques, such as explicit normalization layers and weight decay. While recent constrained optimization approaches that explicitly restrict weights may improve numerical stability and performance, the mechanism and motivation for adding constraints still remain elusive. This paper systematically demystifies the role of explicit manifold constraints in LLM pre-training. By introducing the Msign-Aligned Constrained Riemannian Optimizer (MACRO)-a provably convergent, single-loop optimization framework-our study disentangles weight regularization heuristics from interacting mechanisms like RMS normalization and decoupled weight decay. Theoretical analyses and comprehensive empirical evaluations reveal that manifold constraints independently bound forward activation scales and enforce stable rotational equilibrium, thereby subsuming the roles of these heuristic mechanisms. Evaluations on large-scale LLM architectures demonstrate that MACRO achieves highly competitive performance while rigorously preserving the theoretical guarantees of exact Riemannian optimization.
- Abstract(参考訳): 大規模言語モデル(LLM)の実証的な成功は、明示的な正規化層や重み減衰のようなヒューリスティック安定化技術に大きく依存している。
重みを明示的に制限する最近の制約付き最適化手法は数値安定性と性能を向上させる可能性があるが、制約を加えるメカニズムと動機はいまだ解明されていない。
本稿では,LLM事前学習における明示的多様体制約の役割を体系的に決定する。
Msign-Aligned Constrained Riemannian Optimizer (MACRO) を導入することにより、単ループ最適化フレームワークは、RMS正規化や非結合重み崩壊のような相互作用機構から重み正規化ヒューリスティックを解き放つ。
理論的解析と包括的経験的評価により、多様体の制約は独立に有界な前方活性化スケールを示し、安定な回転平衡を強制し、したがってこれらのヒューリスティック機構の役割を仮定する。
大規模LLMアーキテクチャの評価は、MACROが厳密なリーマン最適化の理論的保証を厳格に保ちながら高い競争性能を達成することを示した。
関連論文リスト
- Stabilizing Policy Optimization via Logits Convexity [59.242732612484474]
モデルロジットに対する教師付き微調整損失の凸性は、安定したトレーニングを可能にする上で重要な役割を担っていることを示す。
そこで本研究では,ロジッツ・コンベックス最適化(Logits Convex Optimization, LCO)を提案する。
論文 参考訳(メタデータ) (2026-03-01T07:40:12Z) - ODELoRA: Training Low-Rank Adaptation by Solving Ordinary Differential Equations [54.886931928255564]
低ランク適応(LoRA)は、深層移動学習においてパラメータ効率の高い微調整法として広く採用されている。
常微分方程式(ODE)の形でLoRA因子行列に対する新しい連続時間最適化ダイナミクスを提案する。
ODELoRAは,問題次元の異なるスケールのディープニューラルネットワークのトレーニングに不可欠な特性である,安定した特徴学習を実現する。
論文 参考訳(メタデータ) (2026-02-07T10:19:36Z) - Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models [50.248686344277246]
自己回帰言語モデル(SRLM)は、外部からのフィードバックなしに反復的にアライメントを改善することに成功している。
本稿では,SRLMの厳密な理論的保証について述べる。
論文 参考訳(メタデータ) (2026-01-30T03:45:43Z) - SIGMA: Scalable Spectral Insights for LLM Collapse [51.863164847253366]
SIGMA(Spectral Inequalities for Gram Matrix Analysis)は,モデル崩壊のための統一的なフレームワークである。
行列のスペクトル上の決定論的境界を導出するベンチマークを利用することで、SIGMAは表現空間の収縮を追跡するために数学的に基底化された計量を提供する。
我々は、SIGMAが状態への遷移を効果的に捉え、崩壊のメカニズムに関する理論的知見の両方を提供することを示した。
論文 参考訳(メタデータ) (2026-01-06T19:47:11Z) - Multiscale Aggregated Hierarchical Attention (MAHA): A Game Theoretic and Optimization Driven Approach to Efficient Contextual Modeling in Large Language Models [0.0]
マルチスケール集約階層的注意(MAHA)は、階層的分解と数学的に厳密な集約を通じて注意機構を再構築する新しいアーキテクチャフレームワークである。
MAHAは、入力シーケンスを学習可能なダウンサンプリング演算子を介して階層スケールに動的に分割する。
実験的なFLOP解析により,4096のシークエンス長で計算コストが81%削減されたことが確認された。
論文 参考訳(メタデータ) (2025-12-16T21:27:21Z) - MaP: A Unified Framework for Reliable Evaluation of Pre-training Dynamics [72.00014675808228]
大規模言語モデルの不安定性評価プロセスは、真の学習力学を曖昧にする。
textbfMaPは、アンダーラインMergingアンダーラインとアンダーラインPass@kメトリックを統合するフレームワークです。
実験により、MaPはよりスムーズな性能曲線を示し、ラン間分散を低減し、より一貫性のあるランキングを保証する。
論文 参考訳(メタデータ) (2025-10-10T11:40:27Z) - Force Matching with Relativistic Constraints: A Physics-Inspired Approach to Stable and Efficient Generative Modeling [26.145559807686706]
本稿では,特殊相対論的力学を取り入れた生成モデリングフレームワークForMを紹介する。
ForM は速度制約を課し、サンプル速度が一定限の範囲内にあることを保証する。
ForMは, 安定, 効率的, 柔軟な生成プロセスを実現するための, 有望な経路を提供する。
論文 参考訳(メタデータ) (2025-02-12T06:30:01Z) - Learning Dynamic Representations via An Optimally-Weighted Maximum Mean Discrepancy Optimization Framework for Continual Learning [16.10753846850319]
継続的な学習は、モデルを永続的に取得し、保持することを可能にする。
悲惨な忘れ物は モデルパフォーマンスを著しく損なう
本稿では,表現変更に対する罰則を課す,OPMMD(Optimally-Weighted Mean Discrepancy)と呼ばれる新しいフレームワークを紹介する。
論文 参考訳(メタデータ) (2025-01-21T13:33:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。