論文の概要: LatentIndex: Cross-Layer Sharing with Layer-Specific Selection for Sparse Attention
- arxiv url: http://arxiv.org/abs/2610.04635v1
- Date: Sat, 03 Oct 2026 16:26:00 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:22:48.35457
- Title: LatentIndex: Cross-Layer Sharing with Layer-Specific Selection for Sparse Attention
- Title(参考訳): LatentIndex: スパースアテンションのための層選択による層間共有
- Abstract要約: インデクサ層にまたがるマルチヘッド遅延注意の潜在共有原則を拡張したLatentIndexを紹介する。
四層共有により、LaintIndexはDeepSeek-V3.2で論理的なインデクサキャッシュを61.1%削減する。
DeepSeek-V3.2 と GLM-5 全体で、トレーニングなしの LatentIndex は、IndexCache を最大3.28 ポイント改善している。
- 参考スコア(独自算出の注目度): 37.039490933483286
- License:
- Abstract: Sparse attention reduces core-attention computation, but its indexers still incur repeated selection work and per-layer key-cache storage. Reusing selected indices across layers reduces this overhead but constrains multiple layers to the same token set. We introduce LatentIndex, which extends the latent-sharing principle of Multi-head Latent Attention across indexer layers. Each layer group constructs a shared latent cache from its first layer's hidden states, while layer-specific scoring enables independent token selection. Absorbing key decoders into queries enables direct scoring of the shared cache without reconstructing historical per-layer keys. We develop training-free calibration and investigate a training-aware instantiation of this principle. To balance quality and computation, a hierarchical selection (HS) variant lets followers independently refine a shared candidate set proposed by the anchor. With four-layer sharing, LatentIndex reduces logical indexer-cache storage by 61.1% on DeepSeek-V3.2. Across DeepSeek-V3.2 and GLM-5, training-free LatentIndex improves head-wise attention-mass recall over IndexCache by up to 3.28 percentage points while maintaining RULER and LongBench performance close to native DSA. HS further achieves 2.30-2.72 times decode indexer speedups over DSA across 8K-128K contexts, retaining most of LatentIndex's recall. LatentIndex offers a new perspective on cross-layer indexing: sharing continuous representations rather than discrete selections enables efficient reuse while preserving layer-specific token selection.
- Abstract(参考訳): スパースアテンションはコアアテンション計算を減少させるが、インデクサは繰り返し選択作業と層ごとのキーキャッシュストレージを発生させる。
レイヤ間で選択されたインデックスを再利用することで、このオーバーヘッドを低減するが、複数のレイヤを同じトークンセットに制約する。
インデクサ層にまたがるマルチヘッド遅延注意の潜在共有原則を拡張したLatentIndexを紹介する。
各層群は第1層の隠蔽状態から共有潜在キャッシュを構成し、層固有のスコアリングは独立したトークン選択を可能にする。
キーデコーダをクエリに吸収することで、階層単位の歴史的キーを再構築することなく、共有キャッシュを直接スコアリングすることができる。
トレーニングフリーキャリブレーションを開発し、この原理のトレーニングアウェア・インスタンス化について検討する。
品質と計算のバランスをとるために、階層的選択(HS)変種は、フォロワーがアンカーが提案する共有候補セットを独立して洗練させる。
四層共有により、LaintIndexはDeepSeek-V3.2で論理的なインデクサキャッシュを61.1%削減する。
DeepSeek-V3.2 と GLM-5 全体で、トレーニングなしの LatentIndex は、RULER と LongBench のパフォーマンスをネイティブ DSA に近く保ちながら、IndexCache のヘッドワイズマスリコールを最大3.28 ポイント改善している。
HSはさらに、8K-128KコンテキストにおけるDSA上のインデクサのスピードアップを2.30-2.72回デコードし、LatentIndexのリコールの大半を維持している。
LatentIndexは、層間インデックスに関する新しい視点を提供する: 離散的な選択ではなく、連続的な表現を共有することは、層固有のトークン選択を保持しながら、効率的な再利用を可能にする。
関連論文リスト
- Self-Indexing Attention for Compression-Compatible Sparse Long-Context LLM Inference [35.07313012751119]
スパース長文推論はプリフィルとデコードの両方で効率的なトークン検索を必要とする。
本稿では,共有変換領域のサイン-マグニチュード表現に基づく学習自由度フレームワークであるSelf-Indexing Attentionを提案する。
論文 参考訳(メタデータ) (2026-08-16T03:41:37Z) - MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference [75.41426145782751]
本稿では,DSAインデクサのリプレースとして,インデクサヘッドをエキスパートの混合プールとして扱うDSAインデクサを提案する。
MISAはロングベンチの密度の高いDSAインデクサとDeepSeek-V3.2とGLM-5で一致し、それぞれ8倍と4倍のインデクサヘッドで動作している。
私たちのTileLangカーネルは、単一のNVIDIA H200 GPU上で、DSAのオリジナルのインデクサカーネルの約3.82倍のスピードアップを実現しています。
論文 参考訳(メタデータ) (2026-05-08T07:19:34Z) - HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention [62.79085204939384]
HISA (Hierarchical Indexed Sparse Attention) は、平らなトークンスキャンから2段階の階層的な手順に検索パスを書き換える。
カーネルレベルのベンチマークでは、HISAは64Kコンテキストでの高速化を実現している。
論文 参考訳(メタデータ) (2026-03-30T13:59:51Z) - IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse [68.18308357205586]
Longcontext Agenticは、大規模言語モデルの定義ユースケースとして登場した。
Sparseは、この課題を効果的に解決し、DeepSeek Sparse Attention(DSA)は、代表的なプロダクショングレードソリューションである。
我々は、レイヤを独自のインデクサを実行するフルレイヤの小さなセットと、最も近いフルレイヤのトップkインデックスを単純に再利用する共有レイヤの大多数に分割することで、層間の冗長性を利用するIndexCacheを紹介します。
論文 参考訳(メタデータ) (2026-03-12T17:27:21Z) - Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference [9.469995152350899]
我々は、既知の観測値を活用する訓練不要なスパースアテンション手法であるカスケードを提案する。
Kascadeは、小さなアンカー層で正確なTop-kインデックスを計算し、それらのインデックスを中間再利用層で再利用する。
Kascadeは、H100 GPU上のFlashAttention-3ベースラインに対して、デコードアテンションの最大4.1倍、プリフィルアテンションの2.2倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2025-12-18T10:37:14Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。