論文の概要: Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving
- arxiv url: http://arxiv.org/abs/2604.26837v1
- Date: Wed, 29 Apr 2026 16:02:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-30 15:59:36.480532
- Title: Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving
- Title(参考訳): 拡張性LLM実行のための階層メモリによるスパースアテンションの統一
- Authors: Zihan Zhao, Baotong Lu, Shengjie Lin, Yizou Chen, Jing Liu, Yanqi Zhang, Ziming Miao, Ming-Chang Yang, Haiying Shen, Qi Chen, Fan Yang,
- Abstract要約: 動的スパースアテンションは、デコーディングステップ毎にKV状態の小さなクエリ依存サブセットだけにアクセスすることで緩和を約束する。
しかし実際には、これらのアルゴリズムによる貯蓄は、エンドツーエンドのシステムレベルのゲインにはほとんど変換されない。
本稿では,階層的なKVストレージで実行パイプラインを協調設計するスパースアテンション対応推論フレームワークSPINを提案する。
- 参考スコア(独自算出の注目度): 18.681651346752766
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context LLM serving is bottlenecked by the cost of attending over ever-growing KV caches. Dynamic sparse attention promises relief by accessing only a small, query-dependent subset of the KV state per decoding step and extending the KV storage to CPU memory. In practice, however, these algorithmic savings rarely translate into end-to-end system-level gains because sparse methods typically operate at different granularities and thus rely on ad hoc, per-algorithm implementations. At the same time, hierarchical KV storage introduces a new systems bottleneck: retrieving fine-grained, irregular KV subsets across the GPU-CPU boundary can easily erase the benefits of sparsity. We present SPIN, a sparse-attention-aware inference framework that co-designs the execution pipeline with hierarchical KV storage through three techniques: (1) a unified partition abstraction that maps different sparsity granularities onto a shared page-based KV substrate; (2) a locality-aware KV cache manager that dynamically sizes per-request HBM budgets and uses a GPU-friendly bucketed LRU policy to cut PCIe round-trips; and (3) a two-level hierarchical metadata layout sized to the active working set rather than the worst-case address space. Built on vLLM with three representative sparse attention algorithms, SPIN delivers 1.66-5.66x higher end-to-end throughput and 7-9x lower TTFT than vLLM, and reduces TPOT by up to 58% over the original sparse-attention implementations.
- Abstract(参考訳): 長いコンテキストのLLMサービスには、成長を続けるKVキャッシュへの参加コストがボトルネックになっている。
動的スパースアテンションは、デコードステップ毎にKV状態の小さなクエリ依存サブセットだけにアクセスし、KVストレージをCPUメモリに拡張することで緩和を約束する。
しかし実際には、スパース法は一般的に異なる粒度で動作し、従ってアドホックなアルゴリズムごとの実装に依存するため、アルゴリズムの貯蓄はエンドツーエンドのシステムレベルゲインにはほとんど変換されない。
微細で不規則なKVサブセットをGPU-CPUバウンダリを越えて取得することで、スパーシティのメリットを簡単に消し去ることができる。
本研究では,(1)共有ページベースのKV基板上に異なる粒度をマッピングする統一的なパーティション抽象化,(2)HBM予算の動的サイズ化とGPUフレンドリなバケット型LRUポリシによるPCIeラウンドトリップの削減,(3)最悪のアドレス空間ではなくアクティブなワーキングセットに2段階の階層的メタデータレイアウトを使用する,3つの手法を用いて,実行パイプラインを階層的なKVストレージで設計するスパースアテンション型推論フレームワークであるSPINを提案する。
3つの代表的なスパースアテンションアルゴリズムで構築されたSPINは、vLLMよりも1.66-5.66倍高いエンドツーエンドスループットと7-9倍低いTTFTを提供する。
関連論文リスト
- DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - SCBench: A KV Cache-Centric Analysis of Long-Context Methods [61.025422435235456]
KVキャッシュ中心の視点から長文の手法を評価するベンチマークであるSCBenchを紹介する。
我々は、Gated Linear RNNsやMamba-Attention Hybridsを含む8つのカテゴリの長期コンテキストソリューションについて、広範なKVキャッシュ中心の分析を行う。
本研究は,O(n)メモリとサブO(n2)プリフィルによるスパース符号化が堅牢に動作する一方で,サブO(n)メモリ手法がマルチターンシナリオに悩まされていることを示す。
論文 参考訳(メタデータ) (2024-12-13T17:59:52Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z) - Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks [21.815661269986425]
KVMergerと呼ばれる新しいKVキャッシュマージ手法を提案し、長文タスクに対して適応的なKVキャッシュ圧縮を実現する。
我々のアプローチは、キー状態が1つのシーケンス内のトークンレベルで高い類似性を示すという興味深い観察にインスパイアされている。
我々は,制約メモリ予算下での長時間コンテキストタスクに対するKVMergerの有効性を示すため,広範囲な実験を行った。
論文 参考訳(メタデータ) (2024-07-11T12:50:42Z) - DeFT: Decoding with Flash Tree-attention for Efficient Tree-structured LLM Inference [22.684773338989007]
大規模言語モデル(LLM)は、トークンの共有プレフィックスを持つツリー構造において、複数の世代呼び出しを処理する複雑なタスクにますます採用されている。
木に基づくアプリケーションの既存の推論システムは、注意計算中にクエリとKVキャッシュの不適切なパーティショニングのために非効率である。
我々は,プレフィックス認識と負荷分散KVキャッシュパーティションを用いたハードウェア効率の高いアテンションアルゴリズムであるDeFTを提案する。
論文 参考訳(メタデータ) (2024-03-30T04:34:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。