論文の概要: GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving
- arxiv url: http://arxiv.org/abs/2609.03494v1
- Date: Thu, 03 Sep 2026 07:53:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.974963
- Title: GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving
- Title(参考訳): GrowPage: 効率的なLDM推論作業のためのオンデマンドKV予算
- Abstract要約: 長期出力推論により、キー値(KV)キャッシュは効率的なサービスのために重要なメモリボトルネックとなった。
既存のKV圧縮法は通常、要求毎の予算に依存し、どのKV状態が保持されているかだけを調整する。
我々は,KVのキャパシティをランタイムリソースとして扱うオンデマンドKV予算フレームワークであるGrowPageを紹介した。
- 参考スコア(独自算出の注目度): 17.04616426989979
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-output reasoning has made the key--value (KV) cache a critical memory bottleneck for efficient LLM serving. Existing KV compression methods usually rely on a predefined per-request budget and adjust only which KV states are retained, leaving the total capacity fixed throughout decoding. However, reasoning workloads exhibit substantial demand variation: different requests require different KV capacities, and the attention demand of an individual request evolves during generation. We introduce \textbf{GrowPage}, an on-demand KV budgeting framework that treats KV capacity as a runtime resource. GrowPage maintains lightweight dual-timescale query summaries to capture recent and long-term attention behaviors, and uses their relative attention working sets to estimate demand evolution. At each capacity boundary, GrowPage either compresses KV states within the current allocation or acquires an additional physical page when broader demand emerges. By integrating with PagedAttention's page-level memory abstraction, GrowPage preserves continuous batching and prefix caching. Experiments on reasoning benchmarks across multiple models show that GrowPage achieves a superior performance--throughput trade-off over existing approaches.
- Abstract(参考訳): 長期出力推論により、キー値(KV)キャッシュは効率的なLLMサービスのための重要なメモリボトルネックとなった。
既存のKV圧縮法は通常、要求毎の予算に依存し、どのKV状態が保持されているかだけを調整する。
異なる要求は異なるKV能力を必要とし、個々の要求の注意力は世代毎に進化する。
我々は、KVのキャパシティをランタイムリソースとして扱うオンデマンドKV予算フレームワークである \textbf{GrowPage} を紹介した。
GrowPageは、最近のおよび長期の注意行動を把握するために、軽量なデュアルタイムスケールクエリサマリーを維持し、要求の進化を見積もるために、彼らの相対的な注意作業セットを使用する。
各キャパシティ境界では、GrowPageは現在のアロケーション内でKV状態を圧縮するか、より広い要求が生じたときに物理ページを取得する。
PagedAttentionのページレベルのメモリ抽象化を統合することで、GrowPageは継続的なバッチ処理とプレフィックスキャッシュを保存する。
複数のモデルにわたる推論ベンチマークの実験は、GrowPageが既存のアプローチよりも優れたパフォーマンス、スループットのトレードオフを実現していることを示している。
関連論文リスト
- HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models [10.767250624894665]
長文推論はデコード中にキー値(KV)キャッシュを増大させる。
このボトルネックは、残余のグローバルアテンション層がコンテキスト依存のキャッシュ需要を支配しているため、ハイブリッド言語モデルに残っています。
我々は、ハイブリッド言語モデルの残余グローバルKVキャッシュを圧縮する訓練不要のフレームワークであるHeadWiseKVを紹介する。
論文 参考訳(メタデータ) (2026-09-02T02:59:11Z) - PuzzleKV: Page-Wise Low-Rank Decomposition for KV Cache Compression [6.397490960170785]
PuzzleKVは大規模言語モデルの低ランク圧縮法である。
各層とKVヘッド内のページを分解し、高密度で分解されたページに直接注意を計算し、新たに利用可能なページを漸進的に圧縮する。
評価されたモデルとすべてのベンチマーク設定で、フルKVパフォーマンスの96%以上を達成する。
論文 参考訳(メタデータ) (2026-08-24T21:30:11Z) - InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories [6.141047838371132]
InduceKVは、選択したトレーニングプレフィックスを注目に値するメモリエントリとして格納する検索ベースの方法である。
InduceKVはPEFT, MoE, replay, prompt-retrievalベースラインを一致したメモリ予算下で一貫して改善することを示す。
論文 参考訳(メタデータ) (2026-07-02T10:45:28Z) - Kwai Summary Attention Technical Report [69.40814939510126]
長文の能力は、次世代の大規模言語モデルの最も重要な方向性の1つになっている。
標準ソフトマックスアテンションは、シーケンスの長さに関して2次時間複雑性を示す。
歴史的文脈を圧縮することでシーケンスモデリングコストを削減する新しいアテンションメカニズムであるKwai Summary Attention (KSA)を提案する。
論文 参考訳(メタデータ) (2026-04-27T12:59:53Z) - LKV: End-to-End Learning of Head-wise Budgets and Token Selection for LLM KV Cache Eviction [46.60403085398673]
本稿では,KV圧縮をエンドツーエンドの微分可能最適化問題として定式化するLKV(Learned KV Eviction)を提案する。
LKVは、LongBenchベンチマークとRULERベンチマークの両方で、高い圧縮速度で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-04-22T06:35:23Z) - Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttention [58.012620801746046]
復号フェーズにおけるKVキャッシュは、高コンカレンシーサービスを制限する重要な要因となっている。
本稿では,トークン単位のKVキャッシュ消去とPagedAttentionを組み合わせたCompressed PagedAttentionを提案する。
そこで我々は,高速LLM推論エンジンZipageを開発した。
論文 参考訳(メタデータ) (2026-03-01T14:01:36Z) - OjaKV: Context-Aware Online Low-Rank KV Cache Compression with Oja's Rule [54.37983890753086]
我々は,戦略的ハイブリッドストレージポリシとオンラインサブスペース適応を統合したフレームワークであるOjaKVを紹介する。
OjaKVは、重要かつ最新のトークンをフルランクで保存し、注意のために高忠実なアンカーを維持している。
オンライン主成分分析のためのOjaのアルゴリズムを用いて、プロジェクションベースを漸進的に適応させることにより、低ランク圧縮を適用する。
論文 参考訳(メタデータ) (2025-09-25T21:42:27Z) - DBudgetKV: Dynamic Budget in KV Cache Compression for Ensuring Optimal Performance [125.81664663201282]
我々はDBudgetKVと呼ばれる新しいKVキャッシュ圧縮手法を提案する。
残りのKVキャッシュがフルキャッシュのパフォーマンスにマッチしない場合、注意ベースのメトリクスが特徴である。
提案手法は, 平均圧縮率25%を超え, 無損失KVプルーニングを効果的かつ堅牢に実現している。
論文 参考訳(メタデータ) (2025-02-24T06:33:39Z) - PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation [97.41972925670508]
大規模視覚言語モデル(LVLM)は、推論中に重要な計算とメモリオーバーヘッドを引き起こす。
ここでは、PrefixKVについて述べる。ここでは、Prefixは、元のシーケンスの位置ではなく、重要度に基づいて、上位ランクのKVを意味する。
本手法は他の手法と比較して最先端の性能を実現する。
論文 参考訳(メタデータ) (2024-12-04T15:48:59Z) - QAQ: Quality Adaptive Quantization for LLM KV Cache [3.163526369095745]
モデルデプロイメントのボトルネックは、コンテキスト長のキーバリューキャッシュの線形拡張によって生じる。
KVキャッシュのための品質適応量子化スキームQAQを提案する。
論文 参考訳(メタデータ) (2024-03-07T16:42:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。