論文の概要: Clean: Second-order LLM Training at Linear Memory Cost via Nyström Sketching
- arxiv url: http://arxiv.org/abs/2610.04204v1
- Date: Sat, 03 Oct 2026 01:37:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.354147
- Title: Clean: Second-order LLM Training at Linear Memory Cost via Nyström Sketching
- Title(参考訳): Nyström Sketchingによるリニアメモリコストの2次LLMトレーニング
- Abstract要約: SOAPのようなメモリ効率の良いメソッドは、禁止されたメモリコストで収束を加速できます。
このボトルネックを解決するために設計されたメモリ効率が高くフル曲率のCleanを導入します。
クリーンは標準のAdamWよりも小さな状態のフットプリントで動作し、ウォールタイムではAdamWの最終パフォーマンスであるtextbf26%の速度で動作している。
- 参考スコア(独自算出の注目度): 9.681574077749
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training large language models (LLMs) entails a fundamental trade-off: memory-efficient optimizers such as Adam discard cross-parameter curvature, whereas full-curvature methods such as SOAP can accelerate convergence at prohibitive memory costs. We introduce Clean, a memory-efficient and full-curvature optimizer designed to resolve this bottleneck. Clean leverages the randomized Nystrom method to accurately approximate the left and right preconditioners in SOAP, and to reduce the optimizer's memory complexity from quadratic to linear in terms of model dimensions. We subsequently reintegrate the off-subspace components to capture curvature information beyond the low-rank approximation, preserving rich curvature at minimal memory cost. We further propose Q-Clean, a low-precision variant that aggressively compresses optimizer states. Q-Clean reduces optimizer memory consumption by \textbf{over 50\%} compared to Muon when pre-training a LLaMA-1.3B architecture, all while maintaining strong and competitive predictive performance. Notably, Clean operates with a smaller optimizer-state footprint than standard AdamW while reaching AdamW's final performance \textbf{26\% faster} in wall-clock time. Furthermore, our methods uniquely enable the pre-training of a 13B-parameter model on a single 80GB GPU, providing a scalable, efficient, and accessible approach to large-scale model optimization.
- Abstract(参考訳): 大規模な言語モデル(LLMs)のトレーニングには基本的なトレードオフが伴う。Adamのようなメモリ効率のよい最適化はパラメータ間の曲率を捨てるが、SOAPのようなフル曲率の手法は、禁止的なメモリコストで収束を加速させる。
このボトルネックを解決するために,メモリ効率の高いフル曲率オプティマイザであるCleanを導入する。
クリーンはランダム化されたNystrom法を利用して、SOAPの左右プレコンディショナーを正確に近似し、モデル次元の観点から最適化器のメモリ複雑性を2次から線形に削減する。
その後、オフサブスペースコンポーネントを再統合し、低ランク近似を超える曲率情報をキャプチャし、メモリコストを最小限に抑える。
さらに、最適化状態を積極的に圧縮する低精度変種であるQ-Cleanを提案する。
Q-Clean は LLaMA-1.3B アーキテクチャを事前トレーニングする際の Muon と比較して、最適化器のメモリ消費を \textbf{over 50\%} で削減する。
特に、Cleanは標準的なAdamWよりも小さなオプティマイザ状態のフットプリントで動作し、ウォールタイムでAdamWの最終パフォーマンスである‘textbf{26\%高速’に達する。
さらに,提案手法により,80GBのGPU上での13Bパラメータモデルの事前学習が一意に可能となり,大規模モデル最適化への拡張性,効率性,アクセシブルなアプローチが実現された。
関連論文リスト
- ECO: Quantized Training without Full-Precision Master Weights [58.97082407934466]
Error-Compensating (ECO)は、量子化されたパラメータに直接更新を適用することで、マスターウェイトを除去する。
ECO は最適値の定数半径近傍に収束するが、素早いマスターウェイト除去は学習率に逆比例する誤差を生じさせる。
論文 参考訳(メタデータ) (2026-01-29T18:35:01Z) - FOAM: Blocked State Folding for Memory-Efficient LLM Training [41.8909496809588]
大規模言語モデル (LLM) は, パラメータ数と広範囲なトレーニングデータにより, 顕著な性能を示した。
しかしながら、これらのスケールは、特にAdamのようなメモリ集約型を使用する場合、トレーニング中に大きなメモリボトルネックを引き起こす。
本稿では,ブロックワイズ方式で状態を圧縮し,勾配補正を組み込んで損失情報を復元するFolded with Approximate Moment (FOAM)を提案する。
論文 参考訳(メタデータ) (2025-12-08T02:48:27Z) - Low-rank Momentum Factorization for Memory Efficient Training [13.464518325870444]
Momentum Factorized (MoFaSGD) は、1次運動量の動的に更新された低ランクSVD表現を維持している。
大規模な言語モデルベンチマークにおけるMoFaSGDの有効性を実証し、メモリ削減(例えばLoRA)と性能の競合的なトレードオフを実現する。
論文 参考訳(メタデータ) (2025-07-10T18:04:52Z) - A Minimalist Optimizer Design for LLM Pretraining [31.996047271119156]
大規模言語モデルのトレーニングは通常、Adamのような適応型に依存します。
GaLore FiraやAPOLLOといった最近の研究は、メモリ消費を減らすために、状態圧縮型を提案した。
本研究では,LLMプレトレーニングにおける最先端性能を維持するために本当に必要となる,最小限の状態量について検討する。
論文 参考訳(メタデータ) (2025-06-20T00:10:35Z) - APOLLO: SGD-like Memory, AdamW-level Performance [61.53444035835778]
大規模言語モデル(LLM)は、トレーニング中にメモリ集約的であることで知られている。
メモリ使用量を減らすために、様々なメモリ効率のScalが提案されている。
i)コストのかかるSVDオペレーション、(ii)AdamWと比較して大きなパフォーマンストレードオフ、(iii)競争性能を維持する上でのメモリオーバーヘッド、などです。
論文 参考訳(メタデータ) (2024-12-06T18:55:34Z) - COAP: Memory-Efficient Training with Correlation-Aware Gradient Projection [17.54863041098623]
トレーニング性能を維持しながら計算オーバーヘッドを最小限に抑えるメモリ効率の高いCOAPを提案する。
LLaMA-1Bでは、メモリをわずか2%追加で61%削減し、AdamWと同じPPLを実現する。
8ビット量子化により、COAPはメモリを81%削減し、LLaVA-v1.5-7BファインチューニングのためにGaLoreを4倍高速化する。
論文 参考訳(メタデータ) (2024-11-26T03:50:52Z) - AdaLomo: Low-memory Optimization with Adaptive Learning Rate [59.64965955386855]
大規模言語モデルに対する適応学習率(AdaLomo)を用いた低メモリ最適化を提案する。
AdaLomoはAdamWと同等の結果を得ると同時に、メモリ要件を大幅に削減し、大きな言語モデルをトレーニングするためのハードウェア障壁を低くする。
論文 参考訳(メタデータ) (2023-10-16T09:04:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。