論文の概要: SparseRL-Sync: Lossless Weight Synchronization with ~100x Less Communication
- arxiv url: http://arxiv.org/abs/2605.07330v1
- Date: Fri, 08 May 2026 06:34:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 19:43:38.86307
- Title: SparseRL-Sync: Lossless Weight Synchronization with ~100x Less Communication
- Title(参考訳): SparseRL-Sync:100倍少ない通信によるロスレスウェイト同期
- Authors: Lucas Hu, Ranchi Zhao, Isaac Zhu, Zach Zhang, Hscos Zhang, Hugh Yin, Jason Zhao,
- Abstract要約: フルウェイト転送をスパース更新ペイロードに置き換えるSparseRL-Syncを提案する。
SparseRL-Syncは帯域幅制限と高非同期RL設定におけるスケーラビリティとエンドツーエンドの効率を大幅に改善する。
- 参考スコア(独自算出の注目度): 0.6775438671102701
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In large-scale reinforcement learning (RL) systems with decoupled Trainer-Rollout execution, the Trainer must regularly synchronize policy weights to the Rollout side to limit policy staleness. When inter-node bandwidth is abundant, such synchronization is usually only a small fraction of end-to-end cost. As model size grows, however, the communication demand rises rapidly. In bandwidth-constrained or network-variable deployments -- for example, cross-datacenter or cross-cluster settings, heterogeneous resource pools, and online RL -- weight synchronization can become a dominant bottleneck for throughput and tail latency. We observe that, in mainstream large-model RL training, the locations where parameters actually change are highly sparse at the element level (often 99%+ sparsity). Building on this observation, we propose and implement SparseRL-Sync, which replaces full-weight transfers with a lossless sparse update payload (indices and values) that can be exactly reconstructed on the inference side, thereby preserving 100% fidelity. Under a simplified cost model, sparse synchronization reduces the per-update communication volume from S to approximately S/X; with 99% sparsity (X ~ 100), this yields about a 100x reduction in transmitted data. Combined with appropriate bucketing, SparseRL-Sync also reduces launch and control-plane overhead, significantly improving scalability and end-to-end efficiency in bandwidth-limited and highly asynchronous RL settings.
- Abstract(参考訳): 大規模強化学習(RL)システムと分離されたトレーナー・ロールアウト実行では、トレーナーはポリシーの安定性を制限するために、定期的にポリシーの重みをロールアウト側と同期させなければならない。
ノード間帯域が豊富である場合、このような同期は通常、エンド・ツー・エンドのコストのごく一部に過ぎない。
しかし、モデルのサイズが大きくなるにつれて、通信需要は急速に増大する。
帯域幅制限やネットワーク変数のデプロイメント – データセンタ間あるいはクラスタ間設定,異種リソースプール,オンラインRLなど – では,スループットとテールレイテンシにおいて,重み同期が主要なボトルネックになる可能性がある。
主流の大規模モデルRLトレーニングでは、パラメータが実際に変化する場所は、要素レベルでは(しばしば99%以上の間隔で)非常に疎いことが観察された。
そこで本研究では,SparseRL-Syncを提案する。このSparseRL-Syncは,フルウェイト転送を損失のないスパース更新ペイロード(インデックスと値)に置き換えて,推論側で正確に再構成可能で,100%の忠実さを維持できる。
単純化されたコストモデルの下では、スパース同期は更新毎の通信量をSからS/Xに減らし、99%の間隔(X〜100)で送信されたデータの約100倍の削減をもたらす。
適切なバケット化と組み合わせることで、SparseRL-Syncは起動とコントロールプレーンのオーバーヘッドを低減し、帯域幅制限と高非同期RL設定におけるスケーラビリティとエンドツーエンドの効率を大幅に改善する。
関連論文リスト
- Decoupled DiLoCo for Resilient Distributed Pre-training [19.201912399584813]
ロックステップ同期障壁を壊すように設計されたDiLoCoフレームワークの進化であるDecoupled DiLoCoを紹介した。
我々は,グローバルダウンタイムを厳格にゼロとした数百万のシミュレートされたチップを用いて,障害発生環境におけるトレーニング効率を大幅に向上させる。
論文 参考訳(メタデータ) (2026-04-23T08:45:38Z) - Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL [16.40150726450328]
帯域幅に制約のある分散環境では,100倍(14 GBから108 MB)の通信削減を実現している。
本研究は,重み付け時空間の段階的および多段階的粒度に関する系統的研究である。
アップデートの間隔は一貫して高く、実際に関係のある設定で99%を超えることがよくあります。
論文 参考訳(メタデータ) (2026-02-03T18:56:48Z) - AsyncMesh: Fully Asynchronous Optimization for Data and Pipeline Parallelism [54.8494905524997]
両方の並列処理軸をまたいだ非同期更新を導入し、コロケーション要求を緩和します。
スパース平均化と非同期更新の両方に対して収束保証を提供します。
大規模言語モデルを用いた実験により,本手法が完全同期ベースラインの性能と一致することを示した。
論文 参考訳(メタデータ) (2026-01-30T01:24:47Z) - RollArt: Scaling Agentic RL Training via Disaggregated Infrastructure [49.88201789074532]
エージェント強化学習(RL)は、大規模言語モデル(LLM)が自律的な意思決定と長期計画を行うことを可能にする。
分散インフラストラクチャ上でマルチタスクエージェントRLのスループットを最大化する分散システムであるRollArcを提案する。
論文 参考訳(メタデータ) (2025-12-27T11:14:23Z) - Laminar: A Scalable Asynchronous RL Post-Training Framework [20.127034898123508]
RL軌道生成における長い尾の歪みは、重いGPU不使用を引き起こす。
現在のRLシステムはアクターとロールアウト間のグローバルな重量同期に依存しており、厳密なモデル更新スケジュールを生成する。
完全に分離されたアーキテクチャ上に構築されたスケーラブルで堅牢なRLポストトレーニングシステムであるLaminarを提案する。
論文 参考訳(メタデータ) (2025-10-14T15:29:14Z) - Protocol Models: Scaling Decentralized Training with Communication-Efficient Model Parallelism [59.79227116582264]
モデルスケーリングはディープラーニングの大幅な進歩につながったが、これらのモデルを分散環境でトレーニングすることは依然として難しい。
本研究では,前処理と後処理の両方を圧縮し,最大99%の圧縮が可能となる新しい圧縮アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-02T02:19:22Z) - StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation [55.75008325187133]
強化学習(RL)は,大規模言語モデル(LLM)の学習後のコアとなる。
StreamRLは、最初の原則から分離して、2種類のパフォーマンスボトルネックに対処するように設計されている。
実験により、StreamRLは既存の最先端システムと比較してスループットを最大2.66倍改善することが示された。
論文 参考訳(メタデータ) (2025-04-22T14:19:06Z) - Streaming DiLoCo with overlapping communication: Towards a Distributed Free Lunch [66.84195842685459]
大規模言語モデル(LLM)のトレーニングは通常、トレーニング時間を短縮するために、多数のアクセラレータに分散される。
近年、DiLoCoのような分散アルゴリズムはそのようなコロケーション制約を緩和している。
我々は、数十億のパラメータのトレーニングを分散し、以前と同じような品質に到達できることを実験的に示す。
論文 参考訳(メタデータ) (2025-01-30T17:23:50Z) - Accelerating Distributed ML Training via Selective Synchronization [0.0]
textttSelSyncは、DNNトレーニングの実践的で低オーバーヘッドな方法であり、各ステップでコミュニケーションを発生または回避することを動的に選択する。
トレーニング時間を最大14$times$まで短縮しながら,BSPと同等あるいはより優れた精度に収束する。
論文 参考訳(メタデータ) (2023-07-16T05:28:59Z) - High-Throughput Synchronous Deep RL [132.43861715707905]
HTS-RL(High-Throughput Synchronous Deep Reinforcement Learning)の提案
私たちは同時に学習とロールアウトを行い、古いポリシーを避けるシステム設計を考案します。
我々は,アタリゲームとGoogle Research Football環境に対するアプローチを評価した。
論文 参考訳(メタデータ) (2020-12-17T18:59:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。