論文の概要: PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention
- arxiv url: http://arxiv.org/abs/2607.24593v1
- Date: Mon, 27 Jul 2026 15:58:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.488595
- Title: PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention
- Title(参考訳): PIVOT: トークンレベルスパース注意のための効率的なクエリグループインデックス作成
- Abstract要約: 生産システムにおいてDeepSeek S Attention(DSA)によって実装されたトークンレベルのスパースアテンションは、下流のアテンションを効率良くするが、ボトルネックをインデクサにシフトさせる。
PIVOT, Proxy Indexing Via One full-parse Traversal, トレーニング不要でDSAインデクサのドロップイン置換を行う。
DeepSeek-V3.2 と GLM-5.1 では、LongBench と RULER で、PIVOT は密度の高い DSA インデクサの精度にマッチし、最大 4 倍の速度で加速し、エンドツーエンドのレイテンシを減少させる。
- 参考スコア(独自算出の注目度): 19.844672835223676
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Token-level sparse attention, as implemented by DeepSeek Sparse Attention (DSA) in production systems, makes the downstream attention efficient but shifts the bottleneck to the indexer that feeds it. To select the top-k tokens for each query, the indexer must still score every preceding token, incurring a cost of O(L^2) per layer for a sequence of length L. We observe that this per-query scan is largely redundant: nearby queries select highly overlapping top-k tokens, and the indexer scores are long-tailed along the key axis. We exploit these properties in PIVOT, Proxy Indexing Via One full-prefix Traversal, a training-free, drop-in replacement for the DSA indexer that shares one prefix scan across a group of nearby queries. PIVOT aggregates a group into a single proxy query, performs one shared full-prefix scan to obtain a candidate set, and then selects a top-k for each query from that set. Two variants trade speed for fidelity: PIVOT-Reuse shares the proxy top-k across the group for maximum speed, whereas PIVOT-Refine re-scores the candidate set with the indexer of each query and then selects an individual top-k, matching the dense indexer at a small additional cost. A single algorithm covers both inference phases, differing only in how groups are formed: fixed-size groups of consecutive queries in prefill, and the queries decoded together in one multi-token prediction (MTP) step in decode. On DeepSeek-V3.2 and GLM-5.1 across LongBench and RULER, PIVOT matches the accuracy of the dense DSA indexer while accelerating it by up to 4x and reducing end-to-end latency by up to 1.6x at long context.
- Abstract(参考訳): 生産システムにおいてDeepSeek Sparse Attention(DSA)によって実装されたトークンレベルのスパースアテンションは、下流の注意を効率的にするが、ボトルネックをインデクサにシフトさせる。
クエリ毎にトップkトークンを選択するには,インデックスインダクタが先行するトークンをすべてスコアし,長さLのシーケンス毎にO(L^2)のコストを発生させる必要がある。
PIVOT, Proxy Indexing Via One full-prefix Traversalはトレーニング不要で、DSAインデクサの代替で、近くのクエリのグループで1つのプレフィックススキャンを共有する。
PIVOTはグループを単一のプロキシクエリに集約し、1つの共有フルプレフィックススキャンを実行して候補セットを取得し、そのセットから各クエリのトップkを選択する。
PIVOT-Reuseは最大速度でプロキシトップkを共有し、PIVOT-Refineは各クエリのインデクサで設定された候補を再スコアし、個別のトップkを選択して、高密度インデクサを小さな追加コストでマッチングする。
1つのアルゴリズムは、2つの推論フェーズをカバーし、グループの生成方法が異なる: プレフィルにおける連続的なクエリの固定サイズグループと、デコードにおける1つのマルチトークン予測(MTP)ステップでデコードされたクエリである。
DeepSeek-V3.2 と GLM-5.1 では、LongBench と RULER にまたがって、PIVOT は密度の高い DSA インデクサの精度を 4 倍まで加速し、エンドツーエンドのレイテンシを 1.6 倍まで短縮する。
関連論文リスト
- ColBERTSaR: Sparsified ColBERT Index via Product Quantization [23.59576017606267]
ColBERTは効果的なニューラル検索アーキテクチャであるが、候補セット検索をサポートするために重いインデックス構造を必要とする。
我々は、ColBERTインデックスを真逆インデックスに変換する埋め込み量子化手法を提案する。
論文 参考訳(メタデータ) (2026-06-04T01:28:45Z) - MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference [75.41426145782751]
本稿では,DSAインデクサのリプレースとして,インデクサヘッドをエキスパートの混合プールとして扱うDSAインデクサを提案する。
MISAはロングベンチの密度の高いDSAインデクサとDeepSeek-V3.2とGLM-5で一致し、それぞれ8倍と4倍のインデクサヘッドで動作している。
私たちのTileLangカーネルは、単一のNVIDIA H200 GPU上で、DSAのオリジナルのインデクサカーネルの約3.82倍のスピードアップを実現しています。
論文 参考訳(メタデータ) (2026-05-08T07:19:34Z) - HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention [62.79085204939384]
HISA (Hierarchical Indexed Sparse Attention) は、平らなトークンスキャンから2段階の階層的な手順に検索パスを書き換える。
カーネルレベルのベンチマークでは、HISAは64Kコンテキストでの高速化を実現している。
論文 参考訳(メタデータ) (2026-03-30T13:59:51Z) - IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse [68.18308357205586]
Longcontext Agenticは、大規模言語モデルの定義ユースケースとして登場した。
Sparseは、この課題を効果的に解決し、DeepSeek Sparse Attention(DSA)は、代表的なプロダクショングレードソリューションである。
我々は、レイヤを独自のインデクサを実行するフルレイヤの小さなセットと、最も近いフルレイヤのトップkインデックスを単純に再利用する共有レイヤの大多数に分割することで、層間の冗長性を利用するIndexCacheを紹介します。
論文 参考訳(メタデータ) (2026-03-12T17:27:21Z) - Multi-Vector Index Compression in Any Modality [73.7330345057813]
後期の相互作用は、テキスト、画像、ビジュアルドキュメント、ビデオにおける情報検索の主要なパラダイムとして現れてきた。
インデックス圧縮には,シーケンスリサイズ,メモリトークン,階層プール,新しいアテンション誘導クラスタリング(AGC)の4つのアプローチを導入する。
AGCは、ドキュメントの最もセマンティックな領域をクラスタセントロイドとして識別し、トークンの集合を重み付けするために注意誘導機構を使用する。
論文 参考訳(メタデータ) (2026-02-24T18:57:33Z) - Dynamic Focus-aware Positional Queries for Semantic Segmentation [94.6834904076914]
本稿では,動的焦点認識型位置情報クエリと呼ばれるセマンティックセグメンテーションのための,シンプルで効果的なクエリ設計を提案する。
我々のフレームワークはSOTAの性能を達成し、ResNet-50、Swin-T、Swin-Bのバックボーンによる1.1%、1.9%、および1.1%の単一スケールmIoUでMask2formerより優れています。
論文 参考訳(メタデータ) (2022-04-04T05:16:41Z) - The Case for Learned Spatial Indexes [62.88514422115702]
我々は、空間範囲の問合せに答えるために、最先端の学習した多次元インデックス構造(すなわちFlood)から提案した手法を用いる。
i) パーティション内の機械学習検索は、1次元でフィルタリングを使用する場合の2進探索よりも11.79%速く、39.51%高速であることを示す。
また、2次元でフィルタする最も近い競合相手の1.23倍から1.83倍の速さで機械学習インデックスを精査する。
論文 参考訳(メタデータ) (2020-08-24T12:09:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。