論文の概要: PrefixBench-H100: Characterizing Prefix Reuse and Time-to-First-Token in H100 LLM Serving
- arxiv url: http://arxiv.org/abs/2609.19657v1
- Date: Thu, 17 Sep 2026 03:56:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.094191
- Title: PrefixBench-H100: Characterizing Prefix Reuse and Time-to-First-Token in H100 LLM Serving
- Title(参考訳): PrefixBench-H100:H100 LLMにおけるプレフィックス再利用とタイム・ツー・ファーストトークンの特徴付け
- Abstract要約: PrefixBench-H100は、単一のNVIDIA H100上でプレフィックスの再利用を特徴付ける再現可能なベンチマークおよび測定フレームワークである。
ベンチマークでは、タイム・ツー・ファーストのレイテンシ、エンドツーエンドのレイテンシ、スループット、キャッシュヒット統計、GPUメモリ使用量、選択されたプロファイリングトレースを収集しながら、共有トークンの長さ、要求到着パターン、出力長、キャッシュ設定が異なる。
本研究は,プレフィックスの再利用が初歩的なレイテンシ低減を実現するレジームと,キャッシュ圧力がそれらを侵食するレジームを同定する。
- 参考スコア(独自算出の注目度): 1.9778286324340122
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Repeated prompt prefixes are increasingly common in LLM serving workloads, appearing in system prompts, templated retrieval-augmented generation pipelines, agent frameworks, and multi-turn conversations. Modern inference runtimes such as vLLM and TensorRT-LLM provide mechanisms for reusing previously computed KV-cache state across requests, yet it remains unclear when prefix reuse materially improves serving performance on contemporary accelerators and when its benefits are limited by scheduling, cache granularity, concurrency, or memory pressure. This paper presents PrefixBench-H100, a reproducible benchmark and measurement framework for characterizing prefix reuse on a single NVIDIA H100. PrefixBench-H100 combines controlled synthetic traces with chat-style and retrieval-style workloads, and evaluates two widely used LLM serving runtimes under matched workload conditions. The benchmark varies shared-prefix length, suffix diversity, request arrival pattern, concurrency, output length, and cache configuration, while collecting time-to-first-token, inter-token latency, end-to-end latency, throughput, cache-hit statistics, GPU memory usage, and selected profiling traces. The goal of PrefixBench-H100 is not to introduce a new caching algorithm, but to expose the practical operating envelope of prefix reuse for H100-class LLM serving. The study identifies the regime where prefix reuse provides substantial first-token latency reductions and the regime where cache pressure erodes them, while showing that cache effectiveness itself is largely insensitive to concurrency and output length; the cross-runtime differences that remain arise above the cache, in the scheduling layer.
- Abstract(参考訳): 繰り返しプロンプトプレフィックスは、システムプロンプト、テンプレート付き検索拡張生成パイプライン、エージェントフレームワーク、マルチターン会話など、LLMサービスワークロードでますます一般的になっている。
vLLMやTensorRT-LLMのような現代的な推論ランタイムは、リクエスト間で計算済みのKV-cache状態を再利用するためのメカニズムを提供するが、プレフィックスの再利用が現代のアクセラレーターでのサービス性能を大幅に改善し、その利点がスケジューリング、キャッシュの粒度、並行性、メモリプレッシャーによって制限されているかどうかは不明だ。
本稿では,1つのNVIDIA H100上でのプレフィックス再利用を再現可能なベンチマークおよび測定フレームワークであるPrefixBench-H100を提案する。
PrefixBench-H100は、制御された合成トレースをチャットスタイルと検索スタイルのワークロードと組み合わせ、マッチしたワークロード条件下で広く使用されている2つのLLMサービスランタイムを評価する。
ベンチマークでは、共有プレフィックスの長さ、サフィックスの多様性、リクエストの到着パターン、並行性、出力長、キャッシュ構成が変わり、一方、タイム・ツー・ファースト、トークン間レイテンシ、エンドツーエンドのレイテンシ、スループット、キャッシュヒット統計、GPUメモリ使用量、選択されたプロファイリングトレースが収集される。
PrefixBench-H100の目標は、新しいキャッシュアルゴリズムを導入することではなく、H100クラスのLLMサービスのためのプリフィックス再利用の実用的な動作エンベロープを公開することである。
本研究は,キャッシュ効率自体が並列性や出力長に大きく依存せず,キャッシュ上に残るランタイム間差がスケジューリング層において発生することを示しながら,プレフィックス再利用が実質的な第1段階のレイテンシ低減と,キャッシュ圧力がそれらを侵食するレジームを明らかにした。
関連論文リスト
- Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding [55.7992006853979]
SAVEMemは、セマンティックな認識をメモリ生成にもたらすフレームワークで、クエリ毎に検索スコープを適応させる。
SAVEMemは、メモリ生成にセマンティックな認識をもたらし、クエリ毎に検索範囲を適応させる、トレーニングフリーのデュアルステージフレームワークである。
論文 参考訳(メタデータ) (2026-05-08T15:40:40Z) - A Parametric Memory Head for Continual Generative Retrieval [52.66674234249913]
生成情報検索(GenIR)は、検索を単一のニューラルモデルに統合し、クエリから直接ドキュメント識別子(ドシデント)をデコードする。
逐次適応は、新たに追加された文書の検索を改善するが、以前のスライスの性能は著しく低下することを示す。
本稿では,モジュール型パラメトリックメモリヘッドで適応モデルを拡張するメモリのみの安定化ステージである,後適応メモリチューニング(PAMT)を提案する。
論文 参考訳(メタデータ) (2026-04-25T17:38:51Z) - EPIC: Efficient Position-Independent Caching for Serving Large Language Models [19.510078997414606]
キャッシングは、リクエスト間でキーバリューベクトルを再利用することで、パフォーマンスを向上させる。
既存のコンテキストキャッシュでは、リクエストにまたがる正確なプレフィックスが必要である。
位置独立キャッシング (PIC) を導入し, プレフィックスによらず KV ベクトルのモジュラー再利用を可能にする。
また、新しいLegoLinkアルゴリズムを取り入れたサービスシステムEPICも導入しています。
論文 参考訳(メタデータ) (2024-10-20T08:42:29Z) - Training-Free Exponential Context Extension via Cascading KV Cache [49.608367376911694]
カスケードサブキャッシュバッファを利用して,最も関連性の高いトークンを選択的に保持する機構を導入する。
本手法は,1Mトークンのフラッシュアテンションと比較して,プリフィルステージ遅延を6.8倍削減する。
論文 参考訳(メタデータ) (2024-06-24T03:59:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。