論文の概要: PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design
- arxiv url: http://arxiv.org/abs/2605.08581v1
- Date: Sat, 09 May 2026 00:48:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.755649
- Title: PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design
- Title(参考訳): PRISM: スケジューリングメモリによる高速オンラインLLMサービング
- Abstract要約: 本稿では、要求対応のラッドツリー(DART)とクエリ対応のスケジューラ(QAS)を共同設計し、要求の受け入れを正確なKV保持と整合させるPRISMを提案する。
評価の結果,最強のベースラインに対して,PRISMはQPS P99 TTFT平均を23.3%,P99 TTFT平均を37.1%削減し,KV-cacheの精度は4Bモデルと13Bモデルでそれぞれ5.9,12.2ポイント向上した。
- 参考スコア(独自算出の注目度): 5.476189551376108
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern online large language model (LLM) services, such as Retrieval-Augmented Generation (RAG) and agent systems, increasingly expose two prominent characteristics: prompt segmentation (e.g., system instructions, retrieved passages, tool outputs) and hotspot skew, where a small set of these segments recurs frequently across user requests. Failing to jointly exploit these patterns could lead to repeated prefill of hot segments and prolonged TTFT, undermining both throughput and user-perceived responsiveness. However, existing work tackles these patterns independently: KV-cache management mainly exploits segment reuse while scheduling reorders requests to improve cache locality, yet neither aligns request admission with KV-cache retention. To address this gap, we first analyze how scheduling and KV-cache management jointly affect TTFT. Guided by this, we present PRISM (Prefix Reuse Optimization Integrated Scheduling and Memory), which co-designs a query-aware scheduler (QAS) with a demand-aware radix tree (DART) to align request admission with exact-prefix KV retention. Our evaluation results show that, versus the strongest baseline, PRISM reduces average per-QPS P99 TTFT by 23.3\% and 37.1\% while increasing exact-prefix KV-cache hit rate by 5.9 and 12.2 percentage points on 4B and 13B models, respectively.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG) やエージェントシステムといった、現代のオンラインの大規模言語モデル(LLM)サービスでは、プロンプトセグメンテーション(例えば、システム命令、検索されたパス、ツールアウトプット)とホットスポットスキュー(英語版)という2つの特徴が明らかになってきている。
これらのパターンを共同で活用できないと、ホットセグメントと長いTTFTが繰り返しプリフィルされ、スループットとユーザ認識の応答性が損なわれる可能性がある。
KV-cache管理は主にセグメント再利用を利用しており、スケジューリングはキャッシュのローカリティを改善するためにリクエストを再注文する。
このギャップに対処するために、スケジューリングとKVキャッシュ管理がTTFTにどのように影響するかをまず分析する。
そこで我々は,要求対応のラディクスツリー (DART) とクエリ対応のスケジューラ (QAS) を共同設計し,要求入力を正確に前置KV保持と整合させる PRISM (Prefix Reuse Optimization Integrated Scheduling and Memory) を提案する。
評価の結果,PRISMではQPS P99 TTFTあたりの平均値が23.3 %,37.1 %,KV-cache が5.9 %,13B が12.2 %であった。
関連論文リスト
- BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference [20.58039191111583]
大型共振モデル (LRM) は拡張型チェイン・オブ・ソート (CoT) 生成により優れた問題解決を実現する。
その結果、キー値(KV)キャッシュはシーケンス長とともに線形に成長し、深刻なメモリボトルネックを発生させる。
本研究では,各グローバルなクエリクラスタに対して,Beaconクエリ,コンパクトな表現を格納する,トレーニング不要なKVキャッシュ圧縮手法であるBeaconKVを提案する。
論文 参考訳(メタデータ) (2026-09-04T10:23:16Z) - CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration [67.17709877327232]
ケイトKVは、一貫したヘッドに対して重要なトークン情報のみを保持するハイブリッドKVキャッシュ方式である。
Cate KV はメモリ使用量を最大$2.72 times$に減らし、シングルサンプル入力で$2.18times$に減らした。
論文 参考訳(メタデータ) (2026-08-31T06:02:37Z) - Kwai Summary Attention Technical Report [69.40814939510126]
長文の能力は、次世代の大規模言語モデルの最も重要な方向性の1つになっている。
標準ソフトマックスアテンションは、シーケンスの長さに関して2次時間複雑性を示す。
歴史的文脈を圧縮することでシーケンスモデリングコストを削減する新しいアテンションメカニズムであるKwai Summary Attention (KSA)を提案する。
論文 参考訳(メタデータ) (2026-04-27T12:59:53Z) - Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing [29.913403615975174]
高いスループットでトランスフォーマー言語モデルを実行するには、冗長な計算を避けるためにキーバリュー(KV)をキャッシュする必要がある。
KVキャッシュのメモリフットプリントは著しく、サービスコストに大きな影響を与えます。
本稿では,ランダムな層間注意(ランダムな層間注意,ランダムな層間注意,ランダムな層間注意)を提案する。
論文 参考訳(メタデータ) (2026-04-03T14:56:17Z) - Staggered Batch Scheduling: Co-optimizing Time-to-First-Token and Throughput for High-Efficiency LLM Inference [17.27010833526918]
Staggered Batch Scheduling (SBS)はリクエストをバッファして最適な実行バッチを生成する。
Load-Aware Global Allocation戦略は、PrefillとDecodeの両フェーズでDPユニット間で計算負荷のバランスをとる。
我々のシステムはTTFTを30%-40%削減し、最先端の即時スケジューリングベースラインに比べてスループットを15%-20%向上させる。
論文 参考訳(メタデータ) (2025-12-18T03:45:05Z) - CacheClip: Accelerating RAG with Effective KV Cache Reuse [8.016679032026824]
CacheClipは、高速TTFTとハイジェネレーション品質の両方を実現する新しいフレームワークである。
本手法は,(1)選択的KVキャッシュ再計算のための補助モデル誘導トークン選択,(2)冗長な注意シンクを排除するための共有プレフィックス,(3)局所コヒーレンスを維持するためのグループ化戦略の3つの手法を統合する。
論文 参考訳(メタデータ) (2025-10-11T09:28:26Z) - GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness [75.00019285120878]
キーバリュー(KV)キャッシュは、これを緩和することができるが、フルキャッシュの保存は、画像重大なコンテキストでは禁じられている。
既存のキャッシュ圧縮手法はGUIの空間的および時間的冗長性を考慮しないため、最適化されていない。
再学習を必要としないGUIエージェントのKVキャッシュ圧縮方式であるGUI-KVを紹介する。
論文 参考訳(メタデータ) (2025-10-01T05:37:54Z) - Runtime Adaptive Pruning for LLM Inference [7.5252252615137225]
我々は、強化学習(RL)によって駆動される弾力的な刈り取りフレームワークであるRAPを提案する。
RAPは、実際の実行におけるモデルパラメータとKV-cacheの進化率を追跡する。
RAPは最先端のベースラインよりも優れており、モデル重量とKVcacheを同時に検討するのは初めてである。
論文 参考訳(メタデータ) (2025-05-22T06:12:42Z) - QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache [67.84112700032007]
大きな言語モデル(LLM)は、長いコンテキスト設定のためにエッジデバイスにデプロイされることが増えている。
これらのシナリオでは、キーバリュー(KV)キャッシュがGPUメモリとレイテンシの両方において主要なボトルネックとなっている。
そこで本研究では,ターゲットモデルのアーキテクチャを共有するが,階層的な4ビット量子化KVキャッシュと4ビット量子化重みを併用して高速化を行う,新たな自己推論型デコーディングフレームワークであるQuantSpecを提案する。
論文 参考訳(メタデータ) (2025-02-05T20:43:48Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。