論文の概要: BASP: Communication-Efficient Batch-Aware Sequence Parallelism for LLM Training
- arxiv url: http://arxiv.org/abs/2609.03151v1
- Date: Wed, 02 Sep 2026 20:33:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.856825
- Title: BASP: Communication-Efficient Batch-Aware Sequence Parallelism for LLM Training
- Title(参考訳): BASP:LLMトレーニングのための通信効率の良いバッチ対応シーケンス並列処理
- Abstract要約: BASP(Batch-Aware Sequence Parallelism)は、バッチ構造を利用して通信オーバーヘッドを削減するシーケンス並列化手法である。
BASPは、マイクロバッチサイズに応じて分離されたシーケンス並列グループに分割することで、バッチ構造を利用する。
NVIDIA A100クラスタの実験結果によると、BASPはエンドツーエンドのトレーニング時間を最大1.17~1.31倍改善している。
- 参考スコア(独自算出の注目度): 0.48127184936824546
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-context reasoning for large language models (LLMs) is becoming increasingly important, but training over long sequences remains challenging due to massive memory and communication requirements. Sequence parallelism has emerged as an essential technique for addressing bottlenecks in long sequence LLM training. However, we observe that existing sequence parallelism methods are batch-agnostic and apply uniform sequence partitioning across all batch sizes, resulting in inefficient communication. In this paper, we introduce Batch- Aware Sequence Parallelism (BASP), a sequence parallelism approach that leverages batch structure to reduce communication overhead. BASP exploits batch structure by partitioning GPUs into disjoint sequence-parallel groups according to the micro- batch size. This design reduces the all-to-all communication group size, thereby localizing communication and improving training efficiency. Experimental results on an NVIDIA A100 cluster show that BASP improves end-to-end training time by up to 1.17 - 1.31x in Llama and Qwen models compared to standard sequence parallel baselines, while preserving identical model accuracy and memory usage.
- Abstract(参考訳): 大規模言語モデル(LLM)の長文推論はますます重要になりつつあるが、大量のメモリと通信要求のため、長いシーケンスでのトレーニングは難しいままである。
シーケンス並列性はLLMトレーニングにおけるボトルネックに対処するための重要な手法として登場した。
しかし,既存のシーケンス並列化手法はバッチ非依存であり,全てのバッチサイズに均一なシーケンス分割を適用し,非効率な通信を実現する。
本稿では,バッチ構造を利用して通信オーバーヘッドを低減するシーケンス並列化手法であるBatch-Aware Sequence Parallelism (BASP)を紹介する。
BASPは、GPUをマイクロバッチサイズに応じて非結合シーケンス並列グループに分割することで、バッチ構造を利用する。
この設計により、全てのコミュニケーショングループのサイズが小さくなり、コミュニケーションのローカライズが図られ、訓練効率が向上する。
NVIDIA A100クラスタの実験結果によると、BASPは標準シーケンスの並列ベースラインと比較して、LlamaとQwenモデルのエンドツーエンドのトレーニング時間を最大1.17~1.31倍改善し、同じモデルの精度とメモリ使用率を維持している。
関連論文リスト
- Learning to Share: Selective Memory for Efficient Parallel Agentic Systems [49.78267008828593]
エージェントシステムは、反復的に推論する複数のエージェントを調整することで複雑なタスクを解決し、ツールを呼び出し、中間結果を交換する。
最近のアプローチでは、さまざまな推論の軌跡を探索するために、複数のエージェントチームが並行して運用されている。
我々は並列エージェントフレームワークのための学習された共有メモリ機構であるLearning to Share (LTS)を提案する。
論文 参考訳(メタデータ) (2026-02-05T18:20:21Z) - PARALLELPROMPT: Extracting Parallelism from Large Language Model Queries [19.780108308260214]
本稿では,自然ユーザプロンプトにおけるクエリ内並列性を測定する最初のベンチマークであるPARALLELPROMPTを紹介する。
我々のデータセットは、パブリックなLLMチャットログから37,000以上の実世界のプロンプトで構成されています。
並列戦略とシリアル戦略をベンチマークし、レイテンシ、構造的忠実度、セマンティック忠実度を計測する実行スイートを提供する。
論文 参考訳(メタデータ) (2025-06-23T15:05:54Z) - Mini-Sequence Transformer: Optimizing Intermediate Memory for Long Sequences Training [78.93900796545523]
ミニシーケンス変換器(Mini-Sequence Transformer, MsT)は、非常に長いシーケンスを持つ高速かつ高精度なLLMトレーニング手法である。
MsTは入力シーケンスを分割し、中間メモリ使用量を減らすためにミニシーケンスを反復的に処理する。
huggingfaceライブラリと統合され、MsTはQwen、Mistral、Gemma-2の最大コンテキスト長を12-24倍に拡張した。
論文 参考訳(メタデータ) (2024-07-22T01:52:30Z) - DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme
Long Sequence Transformer Models [34.74093040678323]
我々は,高度に効率的かつスケーラブルなLDMトレーニングを実現するための,新しい,ポータブルで効果的な方法論であるDeepSpeed-Ulyssesを紹介した。
DeepSpeed-Ulyssesは、そのコアでシーケンス次元に沿って入力データを分割し、効率的なオール・ツー・オールの集合通信を用いて注意を払っている。
実験の結果、DeepSpeed-Ulyssesは既存のSOTAベースラインの4倍のシーケンス長で2.5倍高速であることがわかった。
論文 参考訳(メタデータ) (2023-09-25T20:15:57Z) - SWARM Parallelism: Training Large Models Can Be Surprisingly
Communication-Efficient [69.61083127540776]
ディープラーニングアプリケーションは、数十億のパラメータを持つ大きなモデルを使用することの恩恵を受ける。
これらのモデルのトレーニングは、特殊なHPCクラスタを必要とするため、非常に高価である。
安価な"プリエンプティブル"インスタンスを使用するか、あるいは複数のリージョンから既存のリソースをプールする。
論文 参考訳(メタデータ) (2023-01-27T18:55:19Z) - Parallel Training of GRU Networks with a Multi-Grid Solver for Long
Sequences [1.9798034349981162]
本稿では,GRU(Gated Recurrent Unit)ネットワークのための並列学習手法を提案する。
MGRITはシーケンスを複数の短いサブシーケンスに分割し、異なるプロセッサ上のサブシーケンスを並列に訓練する。
HMDB51データセットにおいて、各ビデオが画像シーケンスである実験結果から、新しい並列トレーニングスキームがシリアルアプローチよりも最大6.5$times$スピードアップを達成することを示した。
論文 参考訳(メタデータ) (2022-03-07T11:32:44Z) - Parallel Training of Deep Networks with Local Updates [84.30918922367442]
ローカル並列性(Local Parallelism)は、グローバルバックプロパゲーションを切り捨てられたレイヤワイズバックプロパゲーションに置き換えることで、ディープネットワーク内の個々のレイヤのトレーニングを並列化するフレームワークである。
我々は、様々なアーキテクチャセットにわたるビジョンと言語領域の両方で結果を示し、局所的並列性は特に高コンピュートなシステムにおいて有効であることを見出した。
論文 参考訳(メタデータ) (2020-12-07T16:38:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。