論文の概要: Mixtures of Subspaces for Bandwidth Efficient Context Parallel Training
- arxiv url: http://arxiv.org/abs/2606.16384v1
- Date: Mon, 15 Jun 2026 08:17:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:34.177745
- Title: Mixtures of Subspaces for Bandwidth Efficient Context Parallel Training
- Title(参考訳): 帯域幅効率の良い並列学習のための部分空間の混合
- Authors: Sameera Ramasinghe, Ajanthan Thalaiyasingam, Hadi Mohaghegh Dolatabadi, Gil Avraham, Violetta Shevchenko, Yan Zuo, Chamin Hewa Koneputugodage, Alexander Long,
- Abstract要約: 分散環境における通信効率のよいコンテキスト並列化のための圧縮手法を提案する。
我々の重要な洞察は、アクティベーション出力の本質的な低ランク構造を、学習されたサブスペースの混合に動的に拘束することで活用することである。
- 参考スコア(独自算出の注目度): 54.43685601795611
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pretraining language models with extended context windows enhances their ability to leverage rich information during generation. Existing methods split input sequences into chunks, broadcast them across multiple devices, and compute attention block by block which incurs significant communication overhead. While feasible in high-speed clusters, these methods are impractical for decentralized training over low-bandwidth connections. We propose a compression method for communication-efficient context parallelism in decentralized settings, achieving a remarkable compression rate of over 95\% with negligible overhead and no loss in convergence. Our key insight is to exploit the intrinsic low-rank structure of activation outputs by dynamically constraining them to learned mixtures of subspaces via efficient reparameterizations. We demonstrate scaling billion-parameter decentralized models to context lengths exceeding 100K tokens on networks as slow as 300Mbps, matching the wall-clock convergence speed of centralized models on 100Gbps interconnects.
- Abstract(参考訳): 拡張コンテキストウィンドウによる言語モデルの事前学習は、生成時に豊富な情報を活用する能力を高める。
既存の方法では、入力シーケンスをチャンクに分割し、複数のデバイスでブロードキャストし、重要な通信オーバーヘッドを引き起こすブロックによるアテンションブロックを計算する。
高速クラスタでは実現不可能であるが、これらの手法は低帯域接続上での分散トレーニングには実用的ではない。
本稿では,分散化環境での通信効率のよいコンテキスト並列化のための圧縮手法を提案する。
我々の重要な洞察は、活性化出力の本質的な低ランク構造を効率的に再パラメータ化することで、学習した部分空間の混合物に動的に拘束することで活用することである。
ネットワーク上の10億パラメータの分散モデルから,ネットワーク上の100Kトークンを超えるコンテキスト長を300Mbpsの速度で拡張し,100Gbpsの相互接続上での集中型モデルのウォールクロック収束速度と一致することを示した。
関連論文リスト
- AsyncMesh: Fully Asynchronous Optimization for Data and Pipeline Parallelism [54.8494905524997]
両方の並列処理軸をまたいだ非同期更新を導入し、コロケーション要求を緩和します。
スパース平均化と非同期更新の両方に対して収束保証を提供します。
大規模言語モデルを用いた実験により,本手法が完全同期ベースラインの性能と一致することを示した。
論文 参考訳(メタデータ) (2026-01-30T01:24:47Z) - Distributed Low-Communication Training with Decoupled Momentum Optimization [38.33322656231618]
大規模モデルのトレーニングには相当な計算資源が必要であり、通常は高帯域の相互接続を持つデータセンターでのみ利用可能である。
本稿では,分散モデルレプリカ間の頻繁な同期と運動量勾配圧縮を組み合わせることで,コミュニケーションをさらに削減する手法を提案する。
特に、モーメントを信号として扱い、離散コサイン変換によりネステロフモーメントを高周波成分と低周波成分に分解する。
論文 参考訳(メタデータ) (2025-10-03T08:25:21Z) - DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster [7.597885871452736]
そこで我々は,低コミュニケーションの大規模分散クラスタトレーニングフレームワークであるDiLoCoXを提案する。
パイプライン並列性と、通信とローカルトレーニングのデュアルステップ遅延オーバーラップと、適応的なグラディエント圧縮スキームを組み合わせる。
本研究では,DiLoCoXがモデル収束の無視可能な劣化を維持しつつ,分散トレーニングにおいて357倍の高速化を実現可能であることを示す。
論文 参考訳(メタデータ) (2025-06-26T13:45:04Z) - Protocol Models: Scaling Decentralized Training with Communication-Efficient Model Parallelism [59.79227116582264]
モデルスケーリングはディープラーニングの大幅な進歩につながったが、これらのモデルを分散環境でトレーニングすることは依然として難しい。
本研究では,前処理と後処理の両方を圧縮し,最大99%の圧縮が可能となる新しい圧縮アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-02T02:19:22Z) - Flash Communication: Reducing Tensor Parallelization Bottleneck for Fast Large Language Model Inference [14.805702987440512]
我々は、推論中にテンソル並列通信のボトルネックを軽減するために設計された、新しい低ビット圧縮技術であるFlash Communicationを紹介する。
提案手法は,ノード内通信速度を3倍以上に向上し,モデル精度を犠牲にすることなく,第1トーケンを2倍に削減する。
論文 参考訳(メタデータ) (2024-12-06T11:29:32Z) - Asynchronous Parallel Incremental Block-Coordinate Descent for
Decentralized Machine Learning [55.198301429316125]
機械学習(ML)は、巨大なIoT(Internet of Things)ベースのインテリジェントでユビキタスなコンピューティングのビッグデータ駆動モデリングと分析のための重要なテクニックである。
急成長するアプリケーションやデータ量にとって、分散学習は有望な新興パラダイムである。
本稿では,多くのユーザデバイスに分散した分散システム上でMLモデルをトレーニングする問題について検討する。
論文 参考訳(メタデータ) (2022-02-07T15:04:15Z) - PowerGossip: Practical Low-Rank Communication Compression in
Decentralized Deep Learning [62.440827696638664]
本稿では,近隣労働者間のモデル差を直接圧縮する簡単なアルゴリズムを提案する。
中央集権的なディープラーニングのためにPowerSGDにインスパイアされたこのアルゴリズムは、パワーステップを使用して、1ビットあたりの転送情報を最大化する。
論文 参考訳(メタデータ) (2020-08-04T09:14:52Z) - Joint Parameter-and-Bandwidth Allocation for Improving the Efficiency of
Partitioned Edge Learning [73.82875010696849]
機械学習アルゴリズムは、人工知能(AI)モデルをトレーニングするために、ネットワークエッジにデプロイされる。
本稿では,パラメータ(計算負荷)割り当てと帯域幅割り当ての新しい共同設計に焦点を当てる。
論文 参考訳(メタデータ) (2020-03-10T05:52:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。