論文の概要: GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining
- arxiv url: http://arxiv.org/abs/2607.07494v1
- Date: Wed, 08 Jul 2026 14:55:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.427605
- Title: GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining
- Title(参考訳): GIFT:LLMプレトレーニングのための幾何インフォームド低精度グラディエント通信
- Authors: Jieying Wang, Shuyuan Fan, Mingkai Zheng, Zhao Zhang,
- Abstract要約: GIFTは、幾何対応座標の低精度通信を行う、幾何インフォームド勾配スケーリング手法である。
GIFTは64 NVIDIA GH200 Superchips上でLlama-600Mの終端事前学習時間を7.6%削減する。
- 参考スコア(独自算出の注目度): 9.091488418774585
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Gradient communication is a primary scaling bottleneck in large language model (LLM) pretraining. Communicating gradients in low-precision formats, such as FP8 and NVFP4, can significantly reduce the communication volume. Existing methods quantize gradients via linear or nonlinear mappings in Euclidean space, often degrading model performance because highly anisotropic gradients incur direction-dependent distortion. We present GIFT, a geometry-informed gradient scaling method that performs low-precision communication in geometry-aware coordinates. By transforming gradients into a near-isotropic space before quantization, GIFT makes low-precision representations substantially more faithful to their high-precision counterparts. GIFT only changes the coordinate system used for low-precision gradient communication and does not change the optimizer, training recipe, communication collective, or low-precision format. We also develop a simplified geometry-aware transformation algorithm with low-rank approximation and selective application to balance the computation overhead and communication reduction. We examine the empirical convergence of GIFT using Llama-300M and Llama-600M models. Our results show that GIFT reduces the end-to-end pretraining time of Llama-600M by 7.6% on 64 NVIDIA GH200 Superchips, while improving the downstream task preservation profile over direct Euclidean FP8 communication under the same optimizer and communication path.
- Abstract(参考訳): グラディエント通信は、大規模言語モデル(LLM)事前トレーニングにおける主要なスケーリングボトルネックである。
FP8やNVFP4のような低精度フォーマットでの通信勾配は、通信量を大幅に減少させる。
既存の方法では、ユークリッド空間の線型あるいは非線形な写像による勾配を定量化し、高異方性勾配が方向依存の歪みを生じさせるため、しばしばモデル性能を劣化させる。
本稿では,幾何対応座標における低精度通信を行う幾何インフォームド勾配スケーリング手法であるGIFTを提案する。
量子化の前に勾配を近等方空間に変換することにより、GIFTは、その高精度な表現にかなり忠実な低精度表現を実現する。
GIFTは、低精度勾配通信に使われる座標系のみを変更し、最適化器、訓練レシピ、通信集合、低精度フォーマットを変更しない。
また,計算オーバーヘッドと通信量削減のバランスをとるために,低ランク近似と選択的応用を併用した簡易な幾何認識変換アルゴリズムを開発した。
Llama-300MモデルとLlama-600Mモデルを用いてGIFTの実験的収束について検討した。
GIFTは,64個のNVIDIA GH200 Superchips上でのLlama-600Mの終端事前学習時間を7.6%削減し,同一のオプティマイザと通信経路下でのユークリッドFP8通信よりも下流タスク保存プロファイルを改善した。
関連論文リスト
- Language Models as Zero-shot Lossless Gradient Compressors: Towards General Neural Parameter Prior Models [56.00251589760559]
大型言語モデル(LLM)はゼロショット設定でグラデーション先行として振る舞うことができる。
本稿では,LSMと算術符号を統合する新しい手法であるLM-GCを紹介する。
実験により、LM-GCは既存の最先端のロスレス圧縮手法を超越していることが示された。
論文 参考訳(メタデータ) (2024-09-26T13:38:33Z) - Compressed and Sparse Models for Non-Convex Decentralized Learning [6.14375469212514]
頻繁なモデル通信は、分散機械学習の効率にとって重要なボトルネックである。
モデル空間と勾配勾配を組み合わせた新しい分散MLアルゴリズムであるMalcom-PSGDを提案する。
本手法は,最先端技術と比較して通信コストを約75%削減する。
論文 参考訳(メタデータ) (2023-11-09T21:55:53Z) - M22: A Communication-Efficient Algorithm for Federated Learning Inspired
by Rate-Distortion [19.862336286338564]
連合学習では、通信制約による精度の損失を最小限に抑えるために、モデル更新を圧縮する必要がある。
本稿では、勾配圧縮に対する速度歪みに着想を得たEmph$bf M$-magnitudeed $L_bf 2$ distortion + $bf 2$ degrees of freedom' (M22)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-01-23T04:40:01Z) - Adaptive Top-K in SGD for Communication-Efficient Distributed Learning [14.867068493072885]
本稿では,SGDフレームワークにおける新しい適応Top-Kを提案する。
MNIST と CIFAR-10 データセットの数値結果から,SGD における適応型 Top-K アルゴリズムは,最先端の手法に比べてはるかに優れた収束率が得られることが示された。
論文 参考訳(メタデータ) (2022-10-24T18:33:35Z) - Fundamental Limits of Communication Efficiency for Model Aggregation in
Distributed Learning: A Rate-Distortion Approach [54.311495894129585]
本研究では,分散学習におけるモデルアグリゲーションの通信コストの限界について,速度歪みの観点から検討する。
SignSGDでは,ワーカノード間の相関を利用した通信利得が重要であることがわかった。
論文 参考訳(メタデータ) (2022-06-28T13:10:40Z) - Cogradient Descent for Dependable Learning [64.02052988844301]
双線形最適化問題に対処するために,CoGDアルゴリズムに基づく信頼度の高い学習法を提案する。
CoGDは、ある変数がスパーシティ制約を持つ場合の双線形問題を解くために導入された。
また、特徴と重みの関連を分解するためにも使用できるため、畳み込みニューラルネットワーク(CNN)をより良く訓練するための我々の手法をさらに一般化することができる。
論文 参考訳(メタデータ) (2021-06-20T04:28:20Z) - Wireless Federated Learning with Limited Communication and Differential
Privacy [21.328507360172203]
本稿では,空力計算(AirComp)に基づくフェデレーション学習(FL)モデルにおいて,リモートユーザにおけるローカルデータセットの効率的な通信と差分プライバシー(DP)における次元性低減の役割について検討する。
論文 参考訳(メタデータ) (2021-06-01T15:23:12Z) - Cogradient Descent for Bilinear Optimization [124.45816011848096]
双線形問題に対処するために、CoGDアルゴリズム(Cogradient Descent Algorithm)を導入する。
一方の変数は、他方の変数との結合関係を考慮し、同期勾配降下をもたらす。
本アルゴリズムは,空間的制約下での1変数の問題を解くために応用される。
論文 参考訳(メタデータ) (2020-06-16T13:41:54Z) - Optimal Gradient Quantization Condition for Communication-Efficient
Distributed Training [99.42912552638168]
勾配の通信は、コンピュータビジョンアプリケーションで複数のデバイスでディープニューラルネットワークをトレーニングするのに費用がかかる。
本研究は,textbfANY勾配分布に対する二値および多値勾配量子化の最適条件を導出する。
最適条件に基づいて, 偏差BinGradと非偏差ORQの2値勾配量子化と多値勾配量子化の2つの新しい量子化手法を開発した。
論文 参考訳(メタデータ) (2020-02-25T18:28:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。