論文の概要: Characterizing Parallelism Strategies in LLM Inference: Fundamental Compute-Communication Trade-offs
- arxiv url: http://arxiv.org/abs/2610.05305v1
- Date: Sun, 04 Oct 2026 15:28:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 21:47:10.992572
- Title: Characterizing Parallelism Strategies in LLM Inference: Fundamental Compute-Communication Trade-offs
- Title(参考訳): LLM推論における並列性戦略の特徴:基本計算通信トレードオフ
- Abstract要約: 大規模言語モデル(LLM)推論は、現代のAIシステムにおいて支配的なワークロードとなっている。
本稿では,分散LLM推論をTP,PP,HBでモデル化するための統一解析フレームワークを提案する。
- 参考スコア(独自算出の注目度): 1.4159869037535113
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM) inference has become the dominant workload in modern AI systems, requiring serving infrastructures to maximize throughput while meeting strict latency Service-Level Objectives (SLOs). Since state-of-the-art LLMs exceed the compute and memory capacity of a single GPU, inference is commonly distributed across multiple GPUs using tensor parallelism (TP), pipeline parallelism (PP), or hybrid parallelism (HB). However, selecting the most effective parallelism strategy remains challenging due to complex interactions among computation, communication, pipeline utilization, sequence length, batch size, and model architecture. Existing approaches largely rely on empirical evaluation and provide limited analytical insight into the trade-offs among these strategies, particularly across the distinct prefill and decoding phases of inference. In this paper, we present a unified analytical framework for modeling distributed LLM inference under TP, PP, and HB. The framework decomposes end-to-end latency into computation, inter-GPU communication, and pipeline bubble overhead, and derives analytical models that capture TP collective communication, PP point-to-point communication, and pipeline utilization as functions of hardware, model, and workload characteristics. The model further characterizes the differing execution behavior of prefill and decoding, explaining why PP-oriented configurations favor compute-intensive prefill while TP-oriented configurations reduce decoding latency by eliminating pipeline bubbles. Experiments with modern LLMs on multi-GPU platforms validate the model and confirm the fundamental compute-communication trade-off across parallelism strategies. The framework provides practical guidance for parallelism selection, capacity planning, and optimization of future LLM serving systems.
- Abstract(参考訳): 大規模言語モデル(LLM)推論は現代のAIシステムにおいて主要なワークロードとなり、厳格なレイテンシのサービスレベルオブジェクト(SLO)を満たしながらスループットを最大化するためにインフラストラクチャを提供する必要がある。
最先端のLLMは単一のGPUの計算能力とメモリ容量を超えるため、推論はテンソル並列(TP)、パイプライン並列(PP)、ハイブリッド並列(HB)を用いて複数のGPUに分散される。
しかし、計算、通信、パイプライン利用、シーケンス長、バッチサイズ、モデルアーキテクチャ間の複雑な相互作用のため、最も効果的な並列処理戦略を選択することは依然として困難である。
既存のアプローチは経験的評価に大きく依存しており、これらの戦略間のトレードオフに関する限られた分析的な洞察を提供する。
本稿では,分散LLM推論をTP,PP,HBでモデル化するための統一解析フレームワークを提案する。
このフレームワークは、計算、GPU間通信、パイプラインバブルのオーバーヘッドにエンドツーエンドのレイテンシを分解し、TP集団通信、PPポイントツーポイント通信、パイプラインをハードウェア、モデル、ワークロード特性の関数として利用する分析モデルを導出する。
このモデルはプリフィルとデコーディングの異なる実行挙動を特徴付け、なぜPP指向の構成が計算集約的なプリフィルを好むのか、TP指向の構成がパイプラインバブルを除去することでデコーディングのレイテンシを低減するのかを説明する。
マルチGPUプラットフォーム上での現代のLLMによる実験では、モデルを検証し、並列処理戦略間の基本的な計算通信トレードオフを確認する。
このフレームワークは、並列性の選択、キャパシティ計画、将来のLLMサービスシステムの最適化のための実用的なガイダンスを提供する。
関連論文リスト
- Para-Pipe: Exploiting Hierarchical Operator Parallelism of ML Computational Graphs on SoCs [22.6523068033902]
Para-Pipeは階層的なマッピングフレームワークで、パイプラインアーキテクチャ内で、ステージ内およびステージ間演算子並列性を統合する。
Para-Pipeは、パイプラインステージ内およびパイプラインステージ間の並列処理レベルを選択的に微調整することで、スループットとレイテンシのトレードオフをナビゲートする。
論文 参考訳(メタデータ) (2026-09-03T17:53:44Z) - Piper: Efficient Large-Scale MoE Training via Resource Modeling and Pipelined Hybrid Parallelism [1.0130502379786543]
HPCプラットフォーム上でのMoEモデルのトレーニングは、大きなメモリフットプリント、異種ネットワーク間の大規模通信の頻繁な増加、厳しいワークロードの不均衡によって妨げられている。
我々は,様々な並列化スキームの下で,MoE構成のメモリ,計算,通信要求を定量化する数学的モデルを開発した。
我々は、リソースモデリングを活用して、ターゲットHPCプラットフォーム上でのMoEモデルの効率的なトレーニング戦略を特定するフレームワークであるPiperを紹介する。
論文 参考訳(メタデータ) (2026-05-06T15:47:14Z) - CommFuse: Hiding Tail Latency via Communication Decomposition and Fusion for Distributed LLM Training [5.653799468368196]
本研究は,通信遅延を解消する新しい通信計算オーバーラップ手法を提案する。
そこで本研究では,従来のreduce-scatterとAll-gatherを代替するCommFuseという手法を提案する。
本手法は通信オーバヘッドを低減し,テール遅延を解消するための正確なアルゴリズムを提供する。
論文 参考訳(メタデータ) (2026-04-27T03:48:21Z) - PARM: Pipeline-Adapted Reward Model [60.769414637325326]
リワードモデル(RM)は、大規模言語モデル(LLM)を人間の好みと整合させることの中心であり、高度な復号化戦略を推進している。
これまでの作業はシングルステップ生成に重点を置いていたが、現実のアプリケーションはますますマルチステージパイプラインを採用するようになっている。
我々は、最適化のためのコード生成を通じてこれを調査し、報酬モデルを定式化とソリューション段階の両方に統合するパイプラインを構築する。
論文 参考訳(メタデータ) (2026-04-20T14:29:08Z) - Parallelization Strategies for Dense LLM Deployment: Navigating Through Application-Specific Tradeoffs and Bottlenecks [6.447439020088275]
AIのブレークスルーは、大規模言語モデル(LLM)ベースのアプリケーションの爆発を加速させた。
センスモデルは、その強力な能力、スケーラビリティ、微調整の容易さ、さまざまなタスクにおける汎用性のために、引き続き支配的です。
本稿では,ノード内並列化方式に着目した2つの代表的高密度LLMの負荷について検討する。
論文 参考訳(メタデータ) (2026-03-05T21:33:24Z) - Training Report of TeleChat3-MoE [77.94641922160359]
この技術的レポートは、主に、フロンティアモデルサイズへの信頼性と効率的なスケーリングを可能にする、基礎となるトレーニングインフラストラクチャを提示する。
本稿では,ハードウェアプラットフォーム間の整合性を確保するため,演算子レベルとエンドツーエンドの数値検証精度の体系的手法を詳述する。
解析的推定と整数線形プログラミングを利用した並列化フレームワークも提案され,多次元並列化の構成を最適化する。
論文 参考訳(メタデータ) (2025-12-30T11:42:14Z) - Vectorized Online POMDP Planning [4.097364225798782]
POMDPは部分的な可観測性問題の下での計画のためのフレームワークである。
本稿では,新たな並列オンライン解法であるVectorized Online POMDP Planner (VOPP)を提案する。
VOPPは、計画に関連するすべてのデータ構造をテンソルの集合として表現し、全ての計画ステップを完全にベクトル化された計算として実装する。
論文 参考訳(メタデータ) (2025-10-31T05:21:39Z) - Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey [69.45421620616486]
本研究は、大規模言語モデル(LLM)用に設計された離散トークン化手法の最初の構造的分類と解析である。
古典的および近代的なパラダイムにまたがる8つの代表的なVQ変種を分類し、アルゴリズムの原理を分析し、力学を訓練し、LLMパイプラインとの統合に挑戦する。
コードブックの崩壊、不安定な勾配推定、モダリティ固有の符号化制約など、重要な課題を特定する。
論文 参考訳(メタデータ) (2025-07-21T10:52:14Z) - Reference Trustable Decoding: A Training-Free Augmentation Paradigm for Large Language Models [79.41139393080736]
大規模言語モデル(LLM)は急速に進歩し、印象的な機能を示している。
In-Context Learning (ICL) など。
効率的なファインチューニング(PEFT)は、現在2つの主要な拡張方法である。
下流タスクへのLLM。
我々は、モデルが微調整なしで新しいタスクに迅速に適応できるパラダイムである参照信頼復号(RTD)を提案する。
論文 参考訳(メタデータ) (2024-09-30T10:48:20Z) - SpaFL: Communication-Efficient Federated Learning with Sparse Models and Low computational Overhead [75.87007729801304]
SpaFL: 計算オーバーヘッドの少ないスパースモデル構造を最適化する通信効率のよいFLフレームワークを提案する。
プルーニングプロセス自体を最適化するためには、パラメータの代わりにサーバとクライアントの間でしきい値だけが通信される。
グローバルしきい値は、集約されたパラメータの重要度を抽出することで、モデルパラメータの更新に使用される。
論文 参考訳(メタデータ) (2024-06-01T13:10:35Z) - SOLIS -- The MLOps journey from data acquisition to actionable insights [62.997667081978825]
本稿では,基本的なクロスプラットフォームテンソルフレームワークとスクリプト言語エンジンを使用しながら,すべての要件をサポートする統合デプロイメントパイプラインとフリー・ツー・オペレートアプローチを提案する。
しかし、このアプローチは、実際のプロダクショングレードシステムに機械学習機能を実際にデプロイするために必要な手順やパイプラインを提供していない。
論文 参考訳(メタデータ) (2021-12-22T14:45:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。