論文の概要: Threshold-Based Exclusive Batching for LLM Inference
- arxiv url: http://arxiv.org/abs/2606.00516v1
- Date: Sat, 30 May 2026 04:11:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.505082
- Title: Threshold-Based Exclusive Batching for LLM Inference
- Title(参考訳): LLM推論のための閾値ベース排他バッチ
- Abstract要約: プリフィル・デコード干渉は、MBの1ステップ当たりの限界コストが純粋なデコードよりも高くなることを示す。
我々のハイブリッドスケジューラ EB+ はこの条件をオンラインで適用し、手動で介入することなく、EB と MB を動的に切り替える。
- 参考スコア(独自算出の注目度): 3.5622123977989673
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixed batching (MB)--interleaving prefill and decode in a single batch--has become the standard scheduling strategy for large language model (LLM) inference due to its efficiency in maximizing compute and memory utilization. However, through controlled experiments, we find that prefill-decode interference inflates MB's per-step marginal cost above that of pure decode. On the high-bandwidth H200 (4.8 TB/s), this occurs only when decode tokens exceed 80% of the batch; however, on the bandwidth-constrained RTX PRO 6000 (1.792 TB/s), this threshold plummets to just 20%. Consequently, the optimal choice between MB and exclusive batching (EB) fundamentally depends on GPU memory bandwidth, model size, and workload composition. We derive a closed-form condition for this EB-MB performance crossover, along with asymptotically optimal phase-switching thresholds and memory-safe batch sizing for EB. Optimized EB achieves up to 41.9% higher throughput on bandwidth-constrained GPUs, while MB retains its advantage on high-bandwidth hardware with larger models. Our hybrid scheduler EB+ applies this condition online to dynamically switch between EB and MB without manual intervention. Under non-stationary traffic with distribution or concurrency shifts, EB+ attains the highest or near-highest throughput in every setting, outperforming MB by up to 36.4%.
- Abstract(参考訳): 混合バッチ処理(MB)- 単一バッチでのプリフィルとデコード- 計算とメモリ利用の最大化の効率のため、大規模言語モデル(LLM)推論の標準スケジューリング戦略となる。
しかし、制御された実験により、プリフィル・デコード干渉は、純粋なデコードよりもステップごとの限界コストを増大させることがわかった。
高帯域幅のH200 (4.8 TB/s)では、これは復号トークンがバッチの80%を超える場合にのみ発生するが、帯域制限のRTX PRO 6000 (1.792 TB/s)では、この閾値は20%に低下する。
したがって、MBと排他的バッチ(EB)の最適選択は、基本的にGPUメモリ帯域幅、モデルサイズ、ワークロード構成に依存する。
我々は,このEB-MB性能クロスオーバーに対して,漸近的に最適な位相スイッチングしきい値と,EBのメモリセーフなバッチサイズとともに,クローズドフォーム条件を導出する。
最適化されたEBは帯域制限のGPUで最大41.9%のスループットを達成する一方、MBはより大きなモデルで高帯域幅のハードウェアで優位を保っている。
我々のハイブリッドスケジューラ EB+ はこの条件をオンラインで適用し、手動で介入することなく、EB と MB を動的に切り替える。
分散や並行性のシフトを伴う非定常トラフィックでは、EB+はすべての設定において最高または最も高いスループットを達成し、最大36.4%のMBを達成している。
関連論文リスト
- dMoE: dLLMs with Learnable Block Experts [71.572316901001]
単純なブロックレベルのMoEフレームワークであるdMoEを提案する。
また,dMoEは,推論中に一意に活性化される専門家の数を著しく減少させることを示した。
また、メモリ使用量を76.64%から79.84%に減らし、1.14$times$から1.66$times$エンドツーエンドのレイテンシ高速化を実現している。
論文 参考訳(メタデータ) (2026-05-29T06:03:50Z) - Beyond Square Roots: Explicit Memory-Efficient Factorization for Multi-Epoch Private Learning [20.989810016108837]
相関ノイズ機構は、微分プライベートモデルトレーニングの実用性を改善する最も有望なアプローチの一つである。
近年の研究では,相関行列のバンド構造を利用したバンド化逆分解法が開発されている。
両因子の統一的な一般化を提案する。
論文 参考訳(メタデータ) (2026-05-18T13:25:56Z) - Prefill vs. Decode Bottlenecks: SRAM-Frequency Tradeoffs and the Memory-Bandwidth Ceiling [5.606289163036201]
エネルギー消費は、大規模言語モデルの展開によるコストと環境への影響を規定する。
本稿では,LLM推論のエネルギー効率と性能に及ぼすオンチップサイズと動作周波数の影響について検討する。
論文 参考訳(メタデータ) (2025-12-26T15:42:29Z) - SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations [54.303301888915406]
混合エキスパートモデル(MoE)は、計算コストを大幅に増加させることなく、言語モデルをスケールアップするためのデファクトアーキテクチャとして登場した。
最小のアクティベーションキャッシングでMoEの前後パスを計算するメモリ効率のアルゴリズムを提案する。
また,グループ化されたGEMMカーネルのパディングによる無駄計算を最小限に抑える新しい「トークンラウンドリング」手法を提案する。
論文 参考訳(メタデータ) (2025-12-16T04:39:10Z) - ODMA: On-Demand Memory Allocation Framework for LLM Serving on LPDDR-Class Accelerators [14.238528502723787]
ランダムアクセス帯域の低いアクセラレータ上での大規模言語モデル(LLM)は、現在のメモリマネージャによって制限される。
本稿では,RACMのためのオンデマンドメモリ割り当てフレームワークODMAを提案する。
ODMAは、軽量長予測器と動的バケットパーティショニングと大型バケットセーフガードを結合することで、分散ドリフトとヘビーテールリクエストに対処する。
論文 参考訳(メタデータ) (2025-12-10T08:52:20Z) - MC#: Mixture Compressor for Mixture-of-Experts Large Models [86.64315380917827]
Mixture-of-Experts (MoE)は、大きな言語モデル(LLM)と視覚言語モデル(VLM)をスパースアクティベーションによって拡張することで効果的にスケールする。
静的量子化と動的エキスパートプルーニングを組み合わせたフレームワークであるMC#(Mixture-Compressor-sharp)を提案する。
論文 参考訳(メタデータ) (2025-10-13T03:12:46Z) - Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference [8.475319961845903]
エッジアクセラレータは、高い領域効率を実現し、外部メモリアクセスを最小限にする。
本稿では,ハイブリッドシストリックアレイアーキテクチャを特徴とするエッジLLM推論アクセラレータを提案する。
我々のソリューションは、ロングインプット/ロングアウトプットのシナリオで1.3B LLMを実行しながら247/117 (token/s/mm2)を達成する。
論文 参考訳(メタデータ) (2025-07-11T20:27:30Z) - MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models [72.61076288351201]
メモリ効率の良いオフロードミニシーケンス推論(MOM)を提案する。
MOMは重要なレイヤを小さな“ミニシーケンス”に分割し、KVキャッシュのオフロードとシームレスに統合する。
Meta-Llama-3.2-8Bでは、単一のA100 80GB GPU上での最大コンテキスト長を155kから455kに拡張する。
論文 参考訳(メタデータ) (2025-04-16T23:15:09Z) - Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss [59.835032408496545]
本稿では, コントラスト損失計算を任意の小ブロックに分割するタイルベースの戦略を提案する。
分散システムの階層構造を活用するためのマルチレベルタイリング戦略も導入する。
SOTAメモリ効率のソリューションと比較すると、同等の速度を維持しながら、メモリの2桁の削減を実現している。
論文 参考訳(メタデータ) (2024-10-22T17:59:30Z) - EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference [49.94169109038806]
本稿では,既存の並列処理方式を超越したMoE用パイプラインスケジューラであるEPS-MoEを紹介する。
その結果,既存の並列推論手法と比較して,プリフィルスループットは52.4%向上した。
論文 参考訳(メタデータ) (2024-10-16T05:17:49Z) - Multi-Feature Fusion and Compressed Bi-LSTM for Memory-Efficient Heartbeat Classification on Wearable Devices [0.0]
多機能核融合と双方向長短期記憶(Bi-LSTM)を用いた心電図(ECG)を用いた心拍分類の資源効率向上手法を提案する。
このデータセットは、MIT-BIH Arrhythmia Database: Normal (N)、Left Bundle Branch Block (LBBB)、Right Bundle Branch Block (RBBB)、Premature Ventricular Contraction (PVC)、Paced Beat (PB)の5つのオリジナルクラスで構成されている。
論文 参考訳(メタデータ) (2024-05-24T07:53:27Z) - EBFT: Effective and Block-Wise Fine-Tuning for Sparse LLMs [68.41135269685576]
スパースLLMを微調整する既存の方法は、しばしば資源集約的な要求と高い再訓練コストに悩まされる。
再構成誤差の最小化に基づくスパルスLLMの微調整のための効率的かつ高速なフレームワークを提案する。
提案手法では, キャリブレーションのための小さなデータセットをサンプリングし, バックプロパゲーションを利用してブロックワイズ復元誤差を反復的に最適化する。
論文 参考訳(メタデータ) (2024-02-19T09:55:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。