論文の概要: Think Before You Grid-Search: Floor-First Triage for LLM Serving
- arxiv url: http://arxiv.org/abs/2607.05876v2
- Date: Wed, 08 Jul 2026 02:47:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 12:30:34.844857
- Title: Think Before You Grid-Search: Floor-First Triage for LLM Serving
- Title(参考訳): グリッド検索の前に考える: LLM サービングのためのフロアファーストトライアージ
- Authors: Yihua Liu,
- Abstract要約: LLMサービス最適化は通常、多くの設定をベンチマークし、遅延ターゲットが欠落しているときに重いプロファイラに到達する。
我々は逆の規律を主張する: 推定はプロファイリングの分析的な層である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM serving optimization typically benchmarks many configurations and reaches for heavy profilers when latency targets are missed. We argue for the reverse discipline: estimation is the analytical layer of profiling -- without it, optimization degenerates to grid search. Floor First is a residual-driven triage workflow. Each decode step is modeled as a five-dimensional resource vector (HBM bytes, FLOPs, network bytes, network messages, KV capacity); summing within a resource and maximizing across resources gives an optimistic floor, the plain sum a pessimistic one. Where a measurement lands inside this [max, sum] interval reads out overlap quality before any profiler is opened, and profilers escalate only on residuals above a stated threshold. Deployment alternatives are compared by wall ordering -- which resource wall binds first as load grows -- rather than by point benchmarks. The account is compositional: new attention or state-space variants enter by declaring one module, and the workflow ships as a zero-dependency calculator plus an agent skill that enforces the discipline in agentic optimization loops. As a case study we analyze a DeepSeek-V3.2-style 671B MoE/MLA model on 16 NVIDIA H20 GPUs, whose ridge point of ~74 FLOP/byte (vs ~590 for H100) makes it an extreme decode-oriented part. The floors show TP16 decoding is KV-capacity-limited to ~70 concurrent 8K requests; sparse attention removes the KV-bandwidth term but not the capacity wall; an EP16+DP-attention layout accepts slightly worse same-batch weight traffic for an order-of-magnitude higher capacity wall (~644) -- while single-stream latency favors TP by 2.4x. The layout judgment is thus a computable function of the operating point, explaining why production deployments on identical hardware have shipped opposite attention layouts.
- Abstract(参考訳): LLMサービス最適化は通常、多くの設定をベンチマークし、遅延ターゲットが欠落しているときに重いプロファイラに到達する。
推定はプロファイリングの分析層であり、それなしでは、最適化はグリッドサーチに退化する。
フロアファースト(Floor First)は、残余駆動のトリアージワークフローである。
各デコードステップは5次元のリソースベクトル(HBMバイト、FLOP、ネットワークバイト、ネットワークメッセージ、KVキャパシティ)としてモデル化される。
測定値がこの[max, sum]間隔内に落ち着いた場合、プロファイラが開く前にオーバーラップ品質を読み出し、プロファイラは指定しきい値以上の残差のみをエスカレートする。
デプロイの代替手段は、ポイントベンチマークではなく、ウォールオーダ -- リソースウォールがロードの増加に伴って最初にバインドする -- によって比較される。
新しい注意または状態空間の変種は1つのモジュールを宣言することで入力され、ワークフローはゼロ依存の電卓とエージェント最適化ループの規律を強制するエージェントスキルとして出荷される。
ケーススタディでは16個のNVIDIA H20 GPU上のDeepSeek-V3.2スタイルの671B MoE/MLAモデルを解析し、そのリッジポイントは74 FLOP/byte (vs 〜590 for H100) である。
フロアは、TP16デコードがKV容量に制限され、70の同時8Kリクエストに制限されていることを示している; わずかな注意は、KV帯域幅の項を除去するがキャパシティウォールは取り除く; EP16+DPアテンションレイアウトは、高キャパシティウォール(約644)のオーダーに対して、わずかに悪い同バッチウェイトトラフィックを受け入れる; シングルストリームレイテンシは、TPを2.4倍に好んでいる。
したがって、レイアウト判断は操作点の計算可能な機能であり、なぜ同じハードウェア上での運用配置が、注意レイアウトと反対のレイアウトを出荷したのかを説明する。
関連論文リスト
- PersistentKV: Page-Aware Decode Scheduling for Long-Context LLM Serving on Commodity GPUs [0.8460698440162889]
本稿では,ブロックテーブル型デコードアテンションエンジンPersistentKVとページ認識スケジューリング研究について述べる。
Per Per PersistentKVマップはKVヘッドグループによって動作し、ネイティブページテーブル上で直接実行される。
5つのホールドアウト種子は、バイモーダル、均一、Zipfライクなワークロードにおいて、平均壁の復号化スループットを1.04xから1.08x改善することを示した。
論文 参考訳(メタデータ) (2026-06-25T06:56:43Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference [0.0]
XFPはコードブックのサイズ、アウトリーチ予算、レイヤごとのパッケージを自動的に決定する。
XFPはワークステーションハードウェア上で128 tok/sのシングルストリームデコードに達する。
対象メモリエンベロープに収まらないモデルに対しては、H-Processを示す。
論文 参考訳(メタデータ) (2026-05-14T13:52:31Z) - ZeRO-Prefill: Zero Redundancy Overheads in MoE Prefill Serving [18.574823955774207]
本稿では,ZeRO-Prefillを提案する。ZeRO-Prefillはプリフィルのみのサービスシステムで,バックエンドはアクティベーションによってルーティングするのではなく,専門家を重みに集める。
Qwen3-235B-A22Bでは、4つのハードウェア/精度構成でZeRO-Prefillは1.35-1.37倍のスループットを提供する。
論文 参考訳(メタデータ) (2026-05-03T03:10:24Z) - Latent-Condensed Transformer for Efficient Long Context Modeling [60.72493959155964]
大規模言語モデルに対するLCA(Latent-Condensed Attention)を提案する。
LCAはMLAの潜伏空間内のコンテキストを凝縮し、表現はセマンティック潜伏ベクトルと位置キーに切り離される。
LCAは、最大2.5$times$プリフィルスピードアップと128Kコンテキストでの90%のKVキャッシュ削減を実現している。
論文 参考訳(メタデータ) (2026-04-14T08:40:31Z) - Resource-Efficient Iterative LLM-Based NAS with Feedback Memory [49.44875022114861]
ニューラルアーキテクチャサーチ(NAS)はネットワーク設計を自動化するが、従来の手法ではかなりの計算資源を必要とする。
本稿では,大規模言語モデル(LLM)を活用して,畳み込みニューラルネットワークアーキテクチャを反復的に生成し,評価し,洗練するクローズドループパイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-12T16:00:22Z) - Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving [4.309392302169281]
エンジンレベルのプリフィル・デコード(PD)デアグリゲーションは干渉を避けるが、高いハードウェアと調整オーバーヘッドを引き起こす。
PDは、最大2.2倍のスループット、20倍のTTFT、2.5倍のTBTを達成する。
論文 参考訳(メタデータ) (2025-07-09T07:27:18Z) - HiRE: High Recall Approximate Top-$k$ Estimation for Efficient LLM
Inference [68.59839755875252]
HiREは2つの新しいコンポーネントから構成される: (i) (i) (i) (i) (i) (i) (i) (i) (i) (i) (ii) DA-TOP-$k$: 効率的なマルチデバイス近似トップ-k$演算子) (i) (i) (i) (i) (i) (i) (i) DA-TOP-$k$演算子) 。
我々は、10億のパラメータモデルにおいて、HiREがソフトマックスとフィードフォワード層の両方に適用され、ほぼ一致した事前学習と下流の精度を実現し、1台のTPUv5eデバイスで1.47Times$の推論遅延を高速化することを示した。
論文 参考訳(メタデータ) (2024-02-14T18:04:36Z) - KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization [67.74400574357472]
LLMは、大きなコンテキストウィンドウを必要とするアプリケーションでの利用が増えており、この大きなコンテキストウィンドウでは、KVキャッシュのアクティベーションが推論時のメモリ消費の主要な要因として表面化している。
量子化はKVキャッシュのアクティベーションを圧縮する上で有望な手法であるが、既存のソリューションは4ビット以下の精度でアクティベーションを正確に表現できない。
我々の研究であるKVQuantは、いくつかの新しい手法を取り入れることで、低精度のKVキャッシュ量子化を容易にする。
論文 参考訳(メタデータ) (2024-01-31T18:58:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。