論文の概要: Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers
- arxiv url: http://arxiv.org/abs/2605.09176v1
- Date: Sat, 09 May 2026 21:34:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.101204
- Title: Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers
- Title(参考訳): LLMバレーをナビゲートする:AdamWからメモリ効率とマトリックスベースの最適化へ
- Abstract要約: 大規模言語モデルの訓練には、計算とメモリ効率が極端に高い最適化アルゴリズムが必要である。
本稿では,システム・アンド・最適化レンズを用いた大規模言語モデルの設計についてレビューする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training large language models requires optimization algorithms that are not only statistically effective, but also computationally and memory efficient at extreme scale. Although Adam remains the dominant optimizer for large-scale language-model pretraining and fine-tuning, recent work has revisited nearly every component of the optimization stack: adaptive moment estimation, decoupled weight decay, memory footprint, curvature approximation, sign-based updates, large-batch stability, low-rank gradient structure, and matrix-wise orthogonalized updates. This survey reviews optimizer design for large language models through a systems-and-optimization lens. We organize the literature into classical first-order optimizers, adaptive optimizers, memory-efficient variants, second-order and curvature-aware methods, sign-based and discovered optimizers, low-rank and projection-based methods, and matrix-based optimizers such as Muon. We also discuss benchmarking methodology, including hyperparameter fairness, scale dependence, wall-clock efficiency, token efficiency, memory overhead, and downstream evaluation. We argue that optimizer research for LLMs is entering a new phase: moving from single-algorithm speedup claims toward rigorous, scale-aware comparisons that jointly evaluate convergence, stability, memory, and implementation complexity.
- Abstract(参考訳): 大規模言語モデルの訓練には、統計的に効率的であるだけでなく、極端なスケールで計算とメモリ効率が良い最適化アルゴリズムが必要である。
大規模言語モデルの事前訓練と微調整において、Adam氏は依然として主要な最適化ツールであるが、最近の研究は、適応モーメント推定、デカップリングウェイト崩壊、メモリフットプリント、曲率近似、符号ベースの更新、大きなバッチ安定性、低ランク勾配構造、行列右傾化更新など、最適化スタックのほぼすべてのコンポーネントを再考している。
本稿では,システム・アンド・最適化レンズを用いた大規模言語モデルのオプティマイザ設計についてレビューする。
文献を古典的な一階最適化器、適応最適化器、メモリ効率の良い変種、二階および曲率認識法、符号ベースおよび発見オプティマイザ、低ランクおよびプロジェクションベース手法、そしてMuonのような行列ベースのオプティマイザに整理する。
また,ハイパーパラメータフェアネス,スケール依存,ウォールクロック効率,トークン効率,メモリオーバーヘッド,下流評価などのベンチマーク手法についても論じる。
LLMのオプティマイザ研究は、単一アルゴリズムによるスピードアップの主張から、収束、安定性、メモリ、実装の複雑さを共同で評価する厳密でスケールアウェアな比較へと移行し、新たな段階に入ったと我々は主張する。
関連論文リスト
- Blog: Survey of Optimizers [0.0]
サーベイは、時間的推定、更新幾何、地平線管理、表現とシステムという4つの軸に沿った最近のおよび訓練最適化手法を編成する。
これは、ムオンのスペクトル正規化、シャンプーとSOAPの歴史的行列統計、適応的およびハイブリッド行列法、メモリ効率、スケジュールなしトレーニング、小さなバッチ補正、量子化された状態とを結びつける。
論文 参考訳(メタデータ) (2026-08-28T17:35:11Z) - SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization [64.95852289011385]
大規模言語モデル(LLM)は拡大を続けており、様々な下流タスクのパフォーマンスは大幅に改善されている。
多数のベンチマークサンプルで推論を行うと、高い計算コストが発生するため、それらの能力を評価するのがますます高価になっている。
SparseEvalは,アンカーウェイトを最適化する勾配降下法を初めて導入し,アンカーセレクションに反復的洗練戦略を採用する手法である。
論文 参考訳(メタデータ) (2026-02-08T11:12:45Z) - Low-rank Momentum Factorization for Memory Efficient Training [13.464518325870444]
Momentum Factorized (MoFaSGD) は、1次運動量の動的に更新された低ランクSVD表現を維持している。
大規模な言語モデルベンチマークにおけるMoFaSGDの有効性を実証し、メモリ削減(例えばLoRA)と性能の競合的なトレードオフを実現する。
論文 参考訳(メタデータ) (2025-07-10T18:04:52Z) - COSMOS: A Hybrid Adaptive Optimizer for Memory-Efficient Training of LLMs [77.79640601822341]
大規模言語モデル(LLM)は、様々な領域で顕著な成功を収めている。
それらの最適化は、彼らが居住している複雑で高次元のロスランドスケープのために重要な課題である。
論文 参考訳(メタデータ) (2025-02-24T18:42:19Z) - Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension [16.037614012166063]
本稿では,Fisher InformationMatrix (FIM) のレンズによる効率的な近似の体系設計に向けて一歩進める。
我々は、多くの最先端の効率的な近似を(フロベニウスノルムの下で)特定の構造的仮定を持つFIMの解と見なせることを示した。
一般性と効率性のバランスをとるための構造的仮定を慎重に選択することを含む,LLMの実用的効率に関する2つの設計勧告を提案する。
論文 参考訳(メタデータ) (2025-02-11T18:27:19Z) - Memory-Reduced Meta-Learning with Guaranteed Convergence [7.306367313570251]
本稿では,履歴パラメータ/勾配の使用を回避し,各イテレーションにおけるメモリコストを大幅に削減するメタ学習アルゴリズムを提案する。
メタラーニングベンチマーク実験の結果,提案アルゴリズムの有効性が確認された。
論文 参考訳(メタデータ) (2024-12-16T17:55:55Z) - Revisiting Zeroth-Order Optimization for Memory-Efficient LLM Fine-Tuning: A Benchmark [166.40879020706151]
本稿では、微調整時のメモリコスト低減のためのソリューションとして、BPフリーゼロオーダー最適化(ZO)への移行を提案する。
従来のZO-SGD法とは異なり、我々の研究はより広い範囲のZO最適化手法に探索を広げる。
本研究は,タスクアライメントの重要性,前方勾配法の役割,アルゴリズムの複雑さと微調整性能のバランスについて,これまで見過ごされてきた最適化原理を明らかにした。
論文 参考訳(メタデータ) (2024-02-18T14:08:48Z) - AdaLomo: Low-memory Optimization with Adaptive Learning Rate [59.64965955386855]
大規模言語モデルに対する適応学習率(AdaLomo)を用いた低メモリ最適化を提案する。
AdaLomoはAdamWと同等の結果を得ると同時に、メモリ要件を大幅に削減し、大きな言語モデルをトレーニングするためのハードウェア障壁を低くする。
論文 参考訳(メタデータ) (2023-10-16T09:04:28Z) - Efficient Non-Parametric Optimizer Search for Diverse Tasks [93.64739408827604]
興味のあるタスクを直接検索できる,スケーラブルで汎用的なフレームワークを初めて提示する。
基礎となる数学表現の自然木構造に着想を得て、空間を超木に再配置する。
我々は,モンテカルロ法を木探索に適用し,レジェクションサンプリングと等価形状検出を備える。
論文 参考訳(メタデータ) (2022-09-27T17:51:31Z) - Conservative Objective Models for Effective Offline Model-Based
Optimization [78.19085445065845]
計算設計の問題は、合成生物学からコンピュータアーキテクチャまで、様々な場面で発生している。
本研究では,分布外入力に対する接地的目標の実際の値を低くする目的関数のモデルを学習する手法を提案する。
COMは、様々なMBO問題に対して、既存のメソッドの実装と性能の面では単純である。
論文 参考訳(メタデータ) (2021-07-14T17:55:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。