論文の概要: MESH: Memory-Efficient Sinkhorn Optimization for Mixture-of-Experts Training
- arxiv url: http://arxiv.org/abs/2608.04407v1
- Date: Wed, 05 Aug 2026 03:23:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.702887
- Title: MESH: Memory-Efficient Sinkhorn Optimization for Mixture-of-Experts Training
- Title(参考訳): MESH:Mixture-of-Experts Trainingのためのメモリ効率の良いシンクホーン最適化
- Authors: Masato Fujitake,
- Abstract要約: シンクホーン勾配降下のようなメモリ効率のよい行列は、高密度トランスフォーマー行列のAdamW状態を除去するが、Mixture-of-Experts (MoE) トレーニングへの直接適用は信頼できない。
SAGE/シンクホーンハイブリッドは、状態を0.883GBから0.331GBに低下させるが、同じ設定で観測されたAdamWベースラインよりもはるかに高い3.8265に低下する。
- 参考スコア(独自算出の注目度): 8.832969171530054
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Memory-efficient matrix optimizers such as Sinkhorn gradient descent remove most AdamW optimizer state for dense Transformer matrices, but direct application to Mixture-of-Experts (MoE) training is unreliable. We study this failure in a controlled 110M-parameter nanowhale DeepSeek-style MoE pretraining setting. A SAGE/Sinkhorn hybrid reduces optimizer state from 0.883GB to 0.331GB but degrades evaluation loss to 3.8265, far above the AdamW baselines observed in the same setup (3.58--3.64 across the seeds we study). We show that routed MoE expert matrices are the dominant failure point: their gradients are conditional, temporally varying, and poorly served by stateless Sinkhorn normalization. We propose MESH, a hidden-momentum Sinkhorn update for MoE experts. MESH restores a temporal first-moment signal through the gradient-buffer lifecycle, without storing the expert first moment as optimizer state. MESH is an optional block-preconditioned variant that adds a coarse neuron/block inverse-RMS multiplier. Across ablations, temporal smoothing before matrix normalization is the primary causal ingredient; block/neuron preconditioning can improve the memory-quality frontier, but is not established as universally necessary. In two additional seeds, MESH and MESH-B reduce optimizer-state memory by 62.5\% and peak PyTorch CUDA allocation by about 12.6\% relative to AdamW, with a modest evaluation-loss gap. Full-state diagnostic variants recover AdamW-like performance in ablations, supporting the conclusion that MoE experts need temporal smoothing, but not necessarily full coordinate-wise AdamW state.
- Abstract(参考訳): シンクホーン勾配降下のようなメモリ効率のよい行列最適化器は、高密度トランスフォーマー行列に対してAdamW最適化器のほとんどの状態を除去するが、Mixture-of-Experts(MoE)トレーニングへの直接適用は信頼できない。
制御された110MパラメトリックのDeepSeekスタイルのMoEプレトレーニング環境で,この故障について検討した。
SAGE/シンクホーンハイブリッドはオプティマイザ状態を0.883GBから0.331GBに低下させるが、評価損失は3.8265に低下する。
解析結果から,ルーティングされたMoE専門家行列は,条件付き,時間的に変化し,状態のないシンクホーン正規化では不十分であることがわかった。
隠れモーメントのシンクホーン更新であるMESHを提案する。
MESHは、専門家のファーストモーメントをオプティマイザ状態として保存することなく、グラデーション-バッファライフサイクルを通じて一時的な第1モーメント信号を復元する。
MESHは、粗いニューロン/ブロック逆RMS乗算器を追加するオプションのブロックプレコンディショニング変種である。
行列正規化前の時間的平滑化は主要な因果成分であり、ブロック/ニューロンプレコンディショニングはメモリ品質のフロンティアを改善することができるが、一般には必要ではない。
さらにMESHとMESH-Bは最適化状態メモリを62.5\%削減し、ピークのPyTorch CUDA割り当てをAdamWと比較して12.6\%削減した。
フル状態診断の変種はAdamW様のパフォーマンスを改善させ、MoEの専門家は時間的スムージングを必要とするが、必ずしも完全な座標のAdamW状態ではないという結論を支持した。
関連論文リスト
- Forgetful Attention: A Trainable Support-Vector Memory with Certified Selection and Exact Unlearning [0.16921396880325776]
固定ボックスパラメータCの1クラスSfpの支持係数が重みを持つメモリであるSupport Vector Attention(SV-Attention)を導入する。
アクティブセットのパーティションは、リザーブトークンを正確にゼロウェイト、出力ウェイトを与え、インクリメンタルインクリメンタルソルバトークンは、同じCの下で再トレーニングせずに生成した状態を回復する。
また,実文埋め込み上での外科的排除,正確な編集,患者記録の削除,忘れやすい検索メモリも示す。
論文 参考訳(メタデータ) (2026-07-13T23:13:57Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - SAGE: Sign-Adaptive Gradient for Memory-Efficient LLM Optimization [1.675857332621569]
我々はAdamWをハイブリッド構造に置き換えるSAGE(Sign Adaptive GradiEnt)を提案する。
SAGEは、Lionスタイルの更新方向と、新しいメモリ効率の$O(d)$アダプティブスケールを組み合わせる。
最大1.3BパラメータのLlamaモデルでは、SAGEベースのハイブリッドは、新しい最先端のパープレキシティを実現し、すべてのベースラインを上回ります。
論文 参考訳(メタデータ) (2026-04-09T00:07:38Z) - Memory-Efficient Structured Backpropagation for On-Device LLM Fine-Tuning [10.913120072779193]
デバイス上での微調整により、大きな言語モデルのプライバシ保護によるパーソナライズが可能になる。
モバイルデバイスは、すべてのワークロード間で共有される6~12GBの厳しいメモリ制約を課す。
メモリ効率のよい構造化バックプロパゲーション(MeSP)を提案する。
MeSPはピークメモリを361MBから136MBのQwen2.5-0.5Bに減らし、これまで不可能だった微調整シナリオを実現する。
論文 参考訳(メタデータ) (2026-02-13T16:24:33Z) - Retrieval-Aware Distillation for Transformer-SSM Hybrids [56.85859614817908]
状態空間モデル(SSM)は効率的なシーケンスモデリングを提供するが、文脈内検索を必要とするベンチマークではTransformerに遅れがある。
本稿では, 事前学習したトランスフォーマーを, これらの検索クリティカルヘッドのみを保存して, ハイブリッド学習者に変換する「検索対応蒸留*」を提案する。
本研究は,* 2% の注意力の保持が,検索重度タスクにおける教師のパフォーマンスの95%以上を回復させることを示す。
論文 参考訳(メタデータ) (2026-02-11T21:05:00Z) - ECO: Quantized Training without Full-Precision Master Weights [58.97082407934466]
Error-Compensating (ECO)は、量子化されたパラメータに直接更新を適用することで、マスターウェイトを除去する。
ECO は最適値の定数半径近傍に収束するが、素早いマスターウェイト除去は学習率に逆比例する誤差を生じさせる。
論文 参考訳(メタデータ) (2026-01-29T18:35:01Z) - Kernelized Sparse Fine-Tuning with Bi-level Parameter Competition for Vision Models [80.50996301430108]
スパースチューニングは、下流タスクに最も関係のある重みだけを調整することで、顕著なパフォーマンスを達成する。
上述の制限を克服する一段法SNELLAを提案する。
SNELLAは低メモリ使用量でSOTA性能を達成する。
論文 参考訳(メタデータ) (2025-10-28T03:39:18Z) - AdaLomo: Low-memory Optimization with Adaptive Learning Rate [59.64965955386855]
大規模言語モデルに対する適応学習率(AdaLomo)を用いた低メモリ最適化を提案する。
AdaLomoはAdamWと同等の結果を得ると同時に、メモリ要件を大幅に削減し、大きな言語モデルをトレーニングするためのハードウェア障壁を低くする。
論文 参考訳(メタデータ) (2023-10-16T09:04:28Z) - Transformers meet Stochastic Block Models: Attention with Data-Adaptive
Sparsity and Cost [53.746169882193456]
最近の研究は、自己注意の二次的コストを克服するために、様々なスパークアテンションモジュールを提案している。
本稿では,それぞれの注意を混合メンバーシップブロックモデルで表現することで,両方の問題を解決するモデルを提案する。
我々のモデルは、以前の効率的な変種とオリジナルのトランスフォーマーより優れており、十分に注目されています。
論文 参考訳(メタデータ) (2022-10-27T15:30:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。