論文の概要: TACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning
- arxiv url: http://arxiv.org/abs/2610.02199v2
- Date: Tue, 06 Oct 2026 23:25:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.327995
- Title: TACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning
- Title(参考訳): TACO:LLMファインチューニングのための3次絶対最大カラムワイズワンスパース最適化
- Abstract要約: 既存のアプローチは、状態の圧縮、一階勾配の放棄、または更新幾何学の変更のいずれかである。
我々は,Muonの最も急激な視線に追随するが,幾何的経路を更に進める,3次絶対最大カラムワイドワンスパース(TACO)を提案する。
実用的TACOは列当たりの低精度勾配成分の小さなセットしか保持せず、AdamW8bitに対して174Times$の永続的状態が減少する。
- 参考スコア(独自算出の注目度): 9.687114690822321
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Full-parameter fine-tuning of large language models (LLMs) incurs substantial optimizer state memory overhead, limiting the model sizes that fit on modern GPUs. Existing approaches either compress optimizer state, abandon first-order gradients, or change the update geometry while retaining dense state. The recently introduced Muon optimizer reduces optimizer memory through matrix-valued updates. Still, its geometry differs from AdamW and can lead to performance degradation when fine-tuning AdamW-pretrained models. To reduce optimizer memory without sacrificing accuracy or computational efficiency in LLM fine-tuning, we propose Ternary Absolute-max Column-wise One-sparse optimizer, or TACO, which follows Muon's operator-norm steepest-descent view but takes the geometric route further. TACO computes the exact steepest-descent direction under a dimension-normalized $1\to1$ operator norm by selecting the sign of the largest magnitude entry in each column of two-dimensional weight matrices. This retains first-order gradients while making optimizer state memory nearly negligible. Our practical TACO optimizer maintains only a small set of low precision gradient components per column, reducing persistent optimizer state by $174\times$ relative to AdamW8bit (from 27.7 GB to 0.16 GB) and peak training memory by $2.9\times$ (from 80.6 GB to 27.5 GB) on OPT-13B, while achieving comparable accuracy and runtime. TACO further enables full-parameter fine-tuning of 30-32B-parameter models on a single 80 GB H100 GPU across multiple model families and tasks.
- Abstract(参考訳): 大規模言語モデル(LLM)のフルパラメータの微調整は、現在のGPUに適合するモデルサイズを制限するため、メモリオーバーヘッドを大幅に最適化する。
既存のアプローチでは、オプティマイザ状態の圧縮、一階勾配の放棄、あるいは高密度状態を維持しながら更新幾何の変更が可能である。
最近導入されたMuonオプティマイザは、行列値更新によってオプティマイザメモリを削減する。
それでも、その幾何学はAdamWと異なり、微調整のAdamW事前訓練モデルでは性能が低下する可能性がある。
LLMファインチューニングの精度や計算効率を犠牲にすることなく、最適化メモリを削減するために、Muonの演算子-ノーム急勾配ビューに従い、さらに幾何学的な経路を採るTernary Absolute-max Column-wise One-Sparse Optimizationr(TACO)を提案する。
TACOは2次元の重み行列の各列において最大等級エントリの符号を選択することにより、次元正規化された1\to1$演算ノルムの下で、最も急勾配の正確な方向を計算する。
これは、オプティマイザ状態メモリをほとんど無視しながら、一階勾配を維持します。
実用的TACOオプティマイザは列あたりの低精度勾配成分の小さなセットしか保持せず、AdamW8bit(27.7 GBから0.16 GB)に対して永続的なオプティマイザ状態が174\times$、OPT-13B上では2.9\times$(80.6 GBから27.5 GB)のピークトレーニングメモリが2.9\times$(80.6 GBから27.5 GB)と同等の精度とランタイムを実現する。
さらにTACOは、複数のモデルファミリとタスクにわたる単一の80GB H100 GPU上で、30-32Bパラメータモデルのフルパラメータ微調整を可能にする。
関連論文リスト
- TerMeZO: Ternary Sparse Zeroth-Order Optimization for Fine-tuning BitNet Models at the Edge [28.299368689650024]
1次勾配を持つ微調整アンゲージモデル(LLM)は、推論に必要なものよりも数倍大きなメモリを必要とする。
本稿では,三元数量化器自体の幾何学を利用して細調整時に値が変化する可能性のある潜時重みを同定する,スパースなMeZO方式であるTerMeZOを提案する。
論文 参考訳(メタデータ) (2026-09-27T13:14:44Z) - POME: Post Optimization Model Edit via Muon-style Projection [74.73326657229347]
POME(Post-Optimization Model Edit)は、微調整された大規模言語モデルの性能を向上させる。
デルタW$のミューオン式のプロジェクションを使い、微調整された重量と事前訓練された重量の違いを区別する。
単純な後処理ステップとして、POMEはトレーニングパイプラインから完全に分離される。
論文 参考訳(メタデータ) (2025-10-08T04:20:11Z) - A Minimalist Optimizer Design for LLM Pretraining [31.996047271119156]
大規模言語モデルのトレーニングは通常、Adamのような適応型に依存します。
GaLore FiraやAPOLLOといった最近の研究は、メモリ消費を減らすために、状態圧縮型を提案した。
本研究では,LLMプレトレーニングにおける最先端性能を維持するために本当に必要となる,最小限の状態量について検討する。
論文 参考訳(メタデータ) (2025-06-20T00:10:35Z) - APOLLO: SGD-like Memory, AdamW-level Performance [61.53444035835778]
大規模言語モデル(LLM)は、トレーニング中にメモリ集約的であることで知られている。
メモリ使用量を減らすために、様々なメモリ効率のScalが提案されている。
i)コストのかかるSVDオペレーション、(ii)AdamWと比較して大きなパフォーマンストレードオフ、(iii)競争性能を維持する上でのメモリオーバーヘッド、などです。
論文 参考訳(メタデータ) (2024-12-06T18:55:34Z) - Second-Order Fine-Tuning without Pain for LLMs:A Hessian Informed Zeroth-Order Optimizer [43.86938914517675]
古典的な1次メモリを備えた細調整の大型言語モデル(LLM)は、バックプロパゲーションプロセスによって禁止的なGPUを必要とする。
最近の研究は微調整のためのゼロオーダーに変化しており、2つのフォワードパスを使用することでかなりのメモリを節約している。
本研究では, 対角的ヘッセン情報に基づくゼロ階軌道であるHiZOOを提案する。
論文 参考訳(メタデータ) (2024-02-23T08:11:55Z) - 8-bit Optimizers via Block-wise Quantization [57.25800395197516]
ステートフルズは、例えば過去の値の指数的滑らかな和(運動量付きSGD)や2乗和(アダム)など、時間の経過とともに統計を維持している。
この状態は、通常の勾配降下よりも最適化を加速するために使用することができるが、そうでなければモデルパラメータに割り当てられる可能性のあるメモリを使用する。
本稿では,32ビットの勾配状態を用いた場合の性能レベルを維持しながら,8ビット統計を用いた第1次勾配法を開発する。
論文 参考訳(メタデータ) (2021-10-06T15:43:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。