論文の概要: X-Stage: An Overlooked Pipeline Stage for Communication-Computation Overlap in DiT Inference
- arxiv url: http://arxiv.org/abs/2607.23264v1
- Date: Sat, 25 Jul 2026 16:04:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.040965
- Title: X-Stage: An Overlooked Pipeline Stage for Communication-Computation Overlap in DiT Inference
- Title(参考訳): X-Stage: DiT推論における通信計算オーバーラップのための見過ごされたパイプラインステージ
- Authors: Jianwen Xian, Zhiyuan Xu, Yuchen Li, Ziliang Lai, Kang He, Zhen Huang, Aichen Feng, Jinyan Chen, Yilin Zhang, Qinqin Chen, Chengru Song,
- Abstract要約: デバイス初期通信により、分散拡散トランスフォーマー(DiT)の永続的なGPUカーネルはリモートストアを発行する。
既存のシステムスケジュールは、通信が発行され、受信されたデータが消費可能になったときであるが、リモート可視完了前の発行後の進捗を省略する。
X-Stageはソフトウェアで見えるポストイシューパイプラインのステージです。
- 参考スコア(独自算出の注目度): 18.883833948875488
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fine-grained, device-initiated communication lets persistent GPU kernels in distributed diffusion transformer (DiT) inference issue remote stores and overlap data movement with Tensor Core computation. Existing systems schedule when communication is issued and when received data becomes consumable, but omit post-issue progress before remote-visible completion, making sender backpressure hard to predict. We identify X-Stage, a software-visible post-issue pipeline stage. Measurements on an eight-GPU node with a recent NVIDIA architecture show that short remote-store bursts drain as the issuer resumes work, whereas sustained injection exhausts finite outstanding capacity and delays later issues. A lightweight Burst-Gap model parameterized by backpressure-free issue time, effective drain rate, and outstanding capacity predicts issue overhead, recovery between bursts, and the onset of backpressure. Guided by the model, we redesign two communication-computation fused kernels. For DeepGEMM MegaMoE, interleaving Linear-1 and Linear-2 work across expert waves places computation between concentrated remote-store bursts, yielding a 1.18x geometric-mean and 1.62x maximum kernel speedup over the Expert-Wave baseline across 84 configurations. For Ulysses sequence-parallel attention, tile-granular fusion of the post-attention All-to-All with FlashAttention lets an output-tile owner issue remote stores and resume computation without a dedicated communication warp or streaming multiprocessor. FlashAttention-3 and FlashAttention-4 reach maximum sender-visible speedups of 1.43x and 1.42x over serial execution, and at long sequences their steady-state times approach those of FlashAttention alone. These results establish post-issue progress as a measurable scheduling lever for shaping bursts, avoiding backpressure, and hiding sender-side overhead.
- Abstract(参考訳): きめ細かいデバイス初期化通信により、分散拡散トランスフォーマー(DiT)推論における永続的なGPUカーネルは、リモートストアを発行し、Tensor Core計算でデータ移動を重複させる。
既存のシステムスケジュールは、通信が発行され、受信されたデータが消費可能になったときであるが、リモート可視完了前の発行後の進捗を省略し、送信者のバックプレッシャを予測しにくくする。
X-Stageはソフトウェアで見えるポストイシューパイプラインのステージです。
最近のNVIDIAアーキテクチャによる8GPUノードの測定では、発行者が作業再開すると、短いリモートストアがバーストし、持続的なインジェクションは不足したキャパシティを消費し、後続の問題も発生している。
バックプレッシャのない問題時間、効率的なドレイン率、優れたキャパシティによってパラメータ化された軽量Burst-Gapモデルは、問題オーバーヘッド、バースト間の回復、バックプレッシャの開始を予測する。
このモデルにより、通信計算融合カーネルを2つ再設計する。
DeepGEMM MegaMoE では、Linear-1 と Linear-2 が専門家の波にまたがって、集中したリモートストアバースト間の計算を配置し、84構成のExpert-Waveベースライン上での1.18倍の幾何平均と1.62倍のカーネルスピードアップをもたらす。
Ulyssesのシーケンシャル並列アテンションでは、アテンション後のAll-to-AllをFlashAttentionとタイルグラニュラーに融合することで、出力タイル所有者がリモートストアを発行し、専用の通信ワープやストリーミングマルチプロセッサなしで計算を再開することができる。
FlashAttention-3とFlashAttention-4は、シリアル実行時に最大1.43倍と1.42倍のスピードアップに達し、長いシークエンスでFlashAttentionに近づいた。
これらの結果は、バーストの成形、バックプレッシャの回避、送信側オーバーヘッドの隠蔽のための測定可能なスケジューリングレバーとして、発行後の進捗を確立する。
関連論文リスト
- An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation [63.50393485685279]
音声の理解と生成を統一する vLLM ベースの推論パイプラインを提案する。
共有直観自由誘導(CFG)のスループットを克服する。
連続バッチ内でペア条件と非条件要求を共スケジューリングすることにより、CFGの実装は、非CFGスループットの80%を維持できます。
論文 参考訳(メタデータ) (2026-07-02T12:55:11Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - Expert Streaming: Accelerating Low-Batch MoE Inference via Multi-chiplet Architecture and Dynamic Expert Trajectory Scheduling [29.998645673111536]
Mixture-of-Expertsは、ローバッチ推論を備えたエッジAIの有望なアプローチである。
MoEのスパーシリティと動的ゲーティングシフト 分散戦略は、より微細なランタイムの粒度に向かっている。
Fully Sharded Expert Data Parallelismは、低バッチのMoE計算用に特別に設計された並列化パラダイムである。
論文 参考訳(メタデータ) (2026-03-29T10:44:55Z) - Spava: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention [63.69228529380251]
Spavaはシーケンス並列フレームワークで、ロングビデオ推論に最適化されている。
Spavaは、FlashAttn、ZigZagRing、APBで12.72x、1.70x、1.18xのスピードアップを提供する。
論文 参考訳(メタデータ) (2026-01-29T09:23:13Z) - Polychronous Wave Computing: Timing-Native Address Selection in Spiking Networks [0.0]
Polychronous Wave Computingは、タイミングネイティブなアドレス選択プリミティブである。
スパイク時間は回転フレームに位相符号化され、プログラム可能なマルチポート干渉計で処理される。
位相ラップと相互コヒーレンスによって課される操作封筒を導出する。
論文 参考訳(メタデータ) (2026-01-19T14:12:01Z) - Tiny, On-Device Decision Makers with the MiniConv Library [0.0]
強化学習(RL)は大きな成果を上げているが、リソース制約されたエッジデバイスに視覚ポリシーをデプロイすることは依然として困難である。
本稿では,小さなオンデバイスエンコーダが各観測結果をリモートポリシヘッドに送信するコンパクトな特徴テンソルに変換する分割政治アーキテクチャを提案する。
我々は,NVIDIA Jetson Nano,Raspberry Pi 4B,Raspberry Pi Zero 2 Wを対象とし,学習結果の報告,持続負荷下でのデバイス上での実行動作,帯域幅形成時のエンドツーエンド決定レイテンシとスケーラビリティの測定を行った。
論文 参考訳(メタデータ) (2025-12-17T00:53:30Z) - Efficient and Adaptable Overlapping for Computation and Communication via Signaling and Reordering [13.185314408519107]
生成モデルは様々なアプリケーションで顕著な成功を収め、マルチGPUコンピューティングへの需要が高まっている。
本稿では,新しいシグナリング機構を用いたFlashOverlapを提案する。
実験の結果、FlashOverlapはオーバーラップによって最大1.65倍のスピードアップを実現しており、ほとんどの場合、既存の作業よりも優れています。
論文 参考訳(メタデータ) (2025-04-28T06:37:57Z) - Task-Oriented Feature Compression for Multimodal Understanding via Device-Edge Co-Inference [54.53508601749513]
本稿では,マルチモーダル理解のためのタスク指向特徴圧縮(TOFC)手法を提案する。
圧縮効率を向上させるために、視覚特徴の特性に基づいて複数のエントロピーモデルを適応的に選択する。
その結果,TOFCはデータ転送オーバーヘッドを最大52%削減し,システム遅延を最大63%削減できることがわかった。
論文 参考訳(メタデータ) (2025-03-17T08:37:22Z) - Turbocharge Speech Understanding with Pilot Inference [0.9699101045941684]
本稿では,資源制約のあるエッジデバイス上での現代音声理解の促進を図る。
デバイス上での実行をスピードアップする、デバイス容量を超える入力をオフロードする、というハイブリッドなアプローチが必要です。
プロトタイプはPASUと呼ばれ、Armプラットフォーム上で6~8コアでテストされており、SOTAの精度が得られます。
論文 参考訳(メタデータ) (2023-11-22T17:14:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。