論文の概要: PersistentKV: Page-Aware Decode Scheduling for Long-Context LLM Serving on Commodity GPUs
- arxiv url: http://arxiv.org/abs/2606.26666v2
- Date: Wed, 01 Jul 2026 08:54:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 17:29:49.634335
- Title: PersistentKV: Page-Aware Decode Scheduling for Long-Context LLM Serving on Commodity GPUs
- Title(参考訳): PersistentKV:コモディティGPUを用いた長期LLMのためのページ認識デコードスケジューリング
- Authors: Muhammad Ahmed,
- Abstract要約: 本稿では,ブロックテーブル型デコードアテンションエンジンPersistentKVとページ認識スケジューリング研究について述べる。
Per Per PersistentKVマップはKVヘッドグループによって動作し、ネイティブページテーブル上で直接実行される。
5つのホールドアウト種子は、バイモーダル、均一、Zipfライクなワークロードにおいて、平均壁の復号化スループットを1.04xから1.08x改善することを示した。
- 参考スコア(独自算出の注目度): 0.8460698440162889
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autoregressive large language model (LLM) serving is increasingly limited by key-value (KV) cache movement rather than dense matrix multiplication. Modern paged-attention systems reduce fragmentation, and mature kernels like FlashInfer provide highly optimized decode attention. However, the best single-kernel implementation is not always the best serving schedule: low-active long-context decode can under-utilize GPUs, while mixed sequence lengths introduce tension between many exact-length launches and coarse padded batches. We present PersistentKV, a native block-table decode attention engine and page-aware scheduling study for grouped-query attention (GQA). PersistentKV maps work by KV-head group, executes directly over native page tables, and adds a compact workqueue schedule executing only non-empty row-KV-head-sequence-split tasks. On an RTX 3060 (FP16, page size 16, Hq=32, Hkv=8, d=128), a calibrated roofline-style policy selects FlashInfer for small active batches, PersistentKV sequence splitting for batch size 1 (B1) long-context steps, and PersistentKV workqueue scheduling for supported B8 long-context GQA steps. With cost-model constants fixed on calibration traces, five held-out seeds improve mean wall decode-token throughput by 1.04x to 1.08x on B8 bimodal, uniform, and Zipf-like workloads, and by 1.40x on a B1 bucketed trace. For the B4 boundary case and uncalibrated GQA ratios, the policy avoids regressions by routing to FlashInfer. We also report an attention-plus-MLP timing proxy and workload counters showing workqueue scheduling reduces launch fan-out from 16.00 to 2.00 launches per step on held-out bimodal B8. These results show that work assignment is a decisive serving-system variable.
- Abstract(参考訳): 自己回帰型大言語モデル(LLM)は、密度行列の乗算よりもキー値(KV)キャッシュの運動によってますます制限される。
現代のページアテンションシステムは断片化を減らし、FlashInferのような成熟したカーネルは高度に最適化されたデコードアテンションを提供する。
しかし、最も優れたシングルカーネル実装は、常に最高のサービススケジュールであるとは限らない。低活性長コンテキストデコードではGPUの低利用が可能であり、混合シーケンス長は、多くの正確な打ち上げと粗いパッド付きバッチの間に緊張をもたらす。
本稿では,ネイティブブロックテーブル型デコードアテンションエンジンPersistentKVと,グループクエリアテンション(GQA)のためのページ認識スケジューリング研究について述べる。
永続KVマップはKV-headグループによって動作し、ネイティブページテーブル上で直接実行し、空でない行-KV-head-splitタスクのみを実行するコンパクトなワークキュースケジュールを追加する。
RTX 3060 (FP16, page size 16, Hq=32, Hkv=8, d=128)では、キャリブレーションされたルーフラインスタイルのポリシーが、小さなアクティブバッチに対してFlashInferを選択し、バッチサイズ1(B1)長文ステップでPersistentKVシークエンスを分割し、サポート対象のB8長文GQAステップに対してPersistentKVワークキュースケジューリングを行う。
キャリブレーショントレースに固定されたコストモデル定数により、5つの保持されたシードは、B8バイモーダル、制服、Zipfのようなワークロードで平均壁のデコードスループットを1.04xから1.08x改善し、B1バケットトレースで1.40x改善する。
B4のバウンダリケースと未校正GQA比に対して、このポリシーはFlashInferへのルーティングによる回帰を避ける。
また、ワークキューのスケジュールを示すMLPタイミングプロキシとワークロードカウンタを報告し、ホールドアウトバイモーダルB8上での1ステップあたり16.00から2.00への起動を減らした。
これらの結果は、仕事の割り当てが決定的なサービスシステム変数であることを示している。
関連論文リスト
- You Only Index Once: Cross-Layer Sparse Attention with Shared Routing [61.29627714699688]
層間スパースアテンション(A)はYOCOなどのKV共有アーキテクチャ上に構築されている。
シングルインデクサはトークンレベルのトップk選択を一度計算し、その結果のインデックスをレイヤ間で再利用する。
その結果、CLSAは正確かつ効率的であり、最大7.6倍のデコードスピードアップと17.1倍のスループット向上を実現している。
論文 参考訳(メタデータ) (2026-06-04T17:54:04Z) - DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - S$^3$-Attention:Attention-Aligned Endogenous Retrieval for Memory-Bounded Long-Context Inference [11.779449360037518]
S3-Attentionは,長期コンテキスト処理を注目に順応した内因性検索として扱うメモリファースト推論時フレームワークである。
S3-Attentionは、軽量なスパースオートエンコーダを使用して、トランジェントキーとクエリプロジェクションをトップkスパース機能識別子にデコードする。
単一のストリーミングスキャン中にトークンの位置やスパンにCPUベースの逆インデックスマッピング機能を構築する。
論文 参考訳(メタデータ) (2026-01-25T05:25:22Z) - LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention [26.54297116028556]
大規模言語モデル(LLM)は、長いシーケンスや複雑な推論タスクの処理において顕著な可能性を示している。
LServeは,ハイブリッドスパースアテンションにより長周期LLMサービスを高速化する,効率的なシステムである。
LServeはLLMプリフィルを最大2.9倍加速し、vLLMで1.3-2.1倍デコードする。
論文 参考訳(メタデータ) (2025-02-20T18:59:52Z) - SCBench: A KV Cache-Centric Analysis of Long-Context Methods [61.025422435235456]
KVキャッシュ中心の視点から長文の手法を評価するベンチマークであるSCBenchを紹介する。
我々は、Gated Linear RNNsやMamba-Attention Hybridsを含む8つのカテゴリの長期コンテキストソリューションについて、広範なKVキャッシュ中心の分析を行う。
本研究は,O(n)メモリとサブO(n2)プリフィルによるスパース符号化が堅牢に動作する一方で,サブO(n)メモリ手法がマルチターンシナリオに悩まされていることを示す。
論文 参考訳(メタデータ) (2024-12-13T17:59:52Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z) - ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition [3.659659889927316]
ChunkAttentionは、大きな言語モデルのためのプレフィックス対応のセルフアテンションモジュールである。
複数のリクエストにまたがる一致したプロンプトプレフィックスを検出し、実行時にそのキー/値テンソルをメモリで共有する。
実験の結果、ChunkAttentionは最先端の実装と比較して、自己保持カーネルを3.2-4.8$times$で高速化できることがわかった。
論文 参考訳(メタデータ) (2024-02-23T09:29:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。