論文の概要: LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention
- arxiv url: http://arxiv.org/abs/2607.11976v1
- Date: Mon, 13 Jul 2026 03:53:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.915339
- Title: LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention
- Title(参考訳): LiteTopK: 長期スパークアテンションにおける融合インデクサ-TopKカーネルの次元曲線の展開
- Authors: Ziqi Yin, Jianyang Gao, Peiqi Yin, Jiangneng Li, Gao Cong,
- Abstract要約: スコアの計算とトップk候補の選択を行うIndexer-TopKは、大規模言語モデルやレコメンデーションシステムやベクトルデータベースで広く使われている。
既存のGPUベースのIndexer-TopKカーネルであるDeepSeek Sparse Attention (DSA)は、過剰なグローバルメモリトラフィック、コストのかかる同期、禁止的なメモリオーバーヘッドのために非効率のままである。
本研究では,高次元ベクトル間の距離が狭い範囲に集中しがちな高次元空間における次元性の呪いを利用して,新規で効率的に融合したインデクサ・トップ(LITETOPK)を設計する。
- 参考スコア(独自算出の注目度): 10.43742762009752
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Indexer-TopK, the operation to compute the scores and select the top-k candidates, is widely used by sparse attention kernels in large language models and vector retrieval in recommendation systems and vector databases. However, existing GPU-based Indexer-TopK kernels like DeepSeek Sparse Attention (DSA) remain inefficient due to excessive global memory traffic, costly synchronization, and prohibitive memory overhead. In this work, we exploit the curse of dimensionality in high-dimensional spaces, where distances between high-dimensional vectors tend to concentrate within a narrow range, to design LITETOPK, a novel and efficient fused Indexer-TopK kernel. LITETOPK first samples a small subset of data to estimate query-data score ranges, then uses these estimates to partition candidate results into bins online. This organization allows the LITETOPK kernel to maintain a tight approximate threshold, write back only promising candidates, reduce unnecessary I/O, substantially lower memory overhead, and still preserve exact Top-k correctness. Experimental results show that LITETOPK accelerates the prefill stage of GLM 5.2 by 1.2x in real-world deployment scenarios while incurring lower memory overhead.
- Abstract(参考訳): スコアの計算とトップk候補の選択を行うIndexer-TopKは,大規模言語モデルにおける注目カーネルの分散化や,レコメンデーションシステムやベクトルデータベースにおけるベクトル検索に広く利用されている。
しかし、DeepSeek Sparse Attention (DSA)のようなGPUベースの既存のIndexer-TopKカーネルは、過剰なグローバルメモリトラフィック、コストのかかる同期、禁止的なメモリオーバーヘッドのために非効率のままである。
本研究では,高次元ベクトル間の距離が狭い範囲に集中しがちな高次元空間における次元性の呪いを利用して,新規で効率的なインデクサ・トップクカーネルであるLITETOPKを設計する。
LITETOPKはまず、クエリーデータスコア範囲を推定するためにデータの小さなサブセットをサンプリングし、次にこれらの推定値を使用して候補結果をオンラインでビンに分割する。
この組織により、LITETOPKカーネルは、厳密な近似しきい値を維持し、有望な候補のみを書き戻し、不要なI/Oを減らし、メモリオーバーヘッドを大幅に減らし、Top-kの正確性を維持することができる。
実験結果から、LITETOPKはGLM 5.2のプリフィルステージを現実のデプロイメントシナリオで1.2倍加速し、メモリオーバーヘッドの低減を図っている。
関連論文リスト
- FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention [77.12062766962815]
Lookahead Sparse Attention (LSA)は、DeepSeek-V4アーキテクチャ上に構築されたNeural Memory Indexerを利用している。
このアーキテクチャをバックボーンフリーの非結合なトレーニング戦略でインスタンス化する。
FM-DS-V4は、物理KVキャッシュのフットプリントを、フルコンテキストベースラインのわずか13.5%まで圧縮することを示した。
論文 参考訳(メタデータ) (2026-06-08T06:25:54Z) - You Only Index Once: Cross-Layer Sparse Attention with Shared Routing [61.29627714699688]
層間スパースアテンション(A)はYOCOなどのKV共有アーキテクチャ上に構築されている。
シングルインデクサはトークンレベルのトップk選択を一度計算し、その結果のインデックスをレイヤ間で再利用する。
その結果、CLSAは正確かつ効率的であり、最大7.6倍のデコードスピードアップと17.1倍のスループット向上を実現している。
論文 参考訳(メタデータ) (2026-06-04T17:54:04Z) - No More K-means: Single-Stage Sparse Coding for Efficient Multi-Vector Retrieval [51.43543998583709]
SSR(Single-stage Sparse Retrieval)は、高価なクラスタリングを効率的なスパースコーディングに置き換えるパラダイムシフトである。
ColBERTv2と比較してインデックス処理時間を15倍短縮し、検索レイテンシを半減させ、同時に検索性能を向上させる。
論文 参考訳(メタデータ) (2026-05-28T15:53:34Z) - Efficient Low Rank Attention for Long-Context Inference in Large Language Models [41.24530756499533]
低ランククエリとキーアテンション(LRQK)は、プリフィル段階で、完全精度クエリとキー行列をコンパクトなランク-(r)要素に分解するフレームワークである。
トップ(k)トークンと、最近のトークンの小さな固定セットだけを選択することで、LRQKは、完全に精度の低いKVペアだけを転送するヒットアンドミス機構を備えた混合GPU-CPUキャッシュを使用する。
論文 参考訳(メタデータ) (2025-10-25T11:43:27Z) - RetroInfer: A Vector-Storage Approach for Scalable Long-Context LLM Inference [27.69137902678418]
RetroInferは、長文推論を加速するために固有の注意空間を利用する新しいシステムである。
KVキャッシュがCPUメモリに拡張された場合、GPUメモリリミット内では4.5倍のスピードアップと、スムーズなアテンションベースライン上で最大10.5倍のスピードアップを示します。
論文 参考訳(メタデータ) (2025-05-05T18:01:17Z) - RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval [24.472784635757016]
RetrievalAttentionは、注意計算を高速化し、GPUメモリ消費を減らすためのトレーニング不要のアプローチである。
RetrievalAttentionは1-3%のデータのみを必要としながら、ほぼ全注意精度を達成できることを示す。
論文 参考訳(メタデータ) (2024-09-16T17:59:52Z) - CORM: Cache Optimization with Recent Message for Large Language Model Inference [57.109354287786154]
メモリフットプリントを大幅に最小化するKVキャッシュを最適化する革新的な手法を提案する。
KVキャッシュ消去ポリシーであるCORMは、モデル微調整を必要とせずに、推論に必要なキーと値のペアを動的に保持する。
検証の結果,CORMはKVキャッシュの推論メモリ使用量を最大70%削減し,LongBenchの6つのタスクで性能劣化を無視できることがわかった。
論文 参考訳(メタデータ) (2024-04-24T16:11:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。