論文の概要: LongCat Sparse Attention: Taming the Lightning via Streaming-aware Hierarchical Cross-Layer Indexing
- arxiv url: http://arxiv.org/abs/2608.01662v2
- Date: Tue, 04 Aug 2026 07:46:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.426939
- Title: LongCat Sparse Attention: Taming the Lightning via Streaming-aware Hierarchical Cross-Layer Indexing
- Title(参考訳): LongCatスパース注意: ストリーミング対応階層型クロスレイアインデックスによるライトニングのカスタマイズ
- Authors: Wen Zan, Jiaqi Zhang, Jianchao Tan, Hong Liu, Cunguang Wang, Xiang Li, Duyue Ma, Guanyu Wu, Yifan Lu, Fengcun Li, Yerui Sun, Peng Pei, Yuchen Xie, Xunliang Cai,
- Abstract要約: LongCat Sparse Attention (LSA) は、ハードウェア・アルゴリズムで設計された、効率的な長文モデリングのためのフレームワークである。
汎用ベンチマークと長文ベンチマークの両方において,LSAが常に同等の性能を実現していることを示す。
LSAは100万トークンまでのコンテキスト長を持つネイティブトレーニングをサポートし、LongCat-2.0(1.6T-A48B)の開発を支えている。
- 参考スコア(独自算出の注目度): 30.089223464071264
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: DeepSeek Sparse Attention (DSA) enables efficient long-context modeling through its Lightning Indexer. However, practical deployment remains constrained by the indexer's expensive $O(L^2)$ scoring overhead and the hardware-inefficient, discontinuous memory-access patterns induced by its outputs. To address these system-level bottlenecks, we introduce LongCat Sparse Attention (LSA), a hardware-algorithm co-designed framework comprising three complementary and orthogonal strategies: (1) Streaming-Aware Indexing, which selectively converts scattered KV entries into hardware-aligned contiguous layouts to enable coalesced HBM access; (2) Cross-Layer Indexing, which amortizes indexing overhead by reusing the results produced by a single layer across consecutive layers, supported by cross-layer distillation; and (3) Hierarchical Indexing, which adopts a coarse-to-fine scoring scheme to progressively narrow the candidate set for each query, thereby substantially reducing indexing computation. Extensive scaling experiments, ranging from 69B-A3B to 560B-A27B models, demonstrate that LSA consistently achieves performance on par with full attention across both general-purpose and long-context benchmarks. Moreover, LSA supports native training with context lengths of up to one million tokens and underpins the development of LongCat-2.0 (1.6T-A48B). To facilitate further research, we also introduce and open-source LongCat-Flash-Lite-Sparse (69B-A3B), which integrates LSA into LongCat-Flash-Lite and incorporates an updated long-context training corpus.
- Abstract(参考訳): DeepSeek Sparse Attention (DSA)は、Lightning Indexerを通じて効率的なロングコンテキストモデリングを可能にする。
しかしながら、インデクサの高価な$O(L^2)$スコアリングオーバーヘッドと、その出力によって引き起こされるハードウェア非効率で不連続なメモリアクセスパターンによって、実際のデプロイメントは制限されている。
これらのシステムレベルのボトルネックに対処するために,(1)分散KVエントリをハードウェア整列した整列レイアウトに選択的に変換してHBMアクセスを可能にするストリーム・アウェア・インデックスリング,(2)クロス層蒸留で支持された連続層にまたがる単一層で生成された結果を再現してインデックス化オーバーヘッドを記憶するクロス層インデックス化,(3)粗粒化方式を採用して各クエリの候補セットを漸進的に絞り込む階層インデックス化,という3つの相補的・直交的な戦略からなるハードウェア・アルゴリズム共同設計のフレームワークであるLongCat Sparse Attention(LSA)を導入する。
69B-A3Bから560B-A27Bモデルまで広範囲にわたるスケーリング実験により、LSAは汎用ベンチマークと長文ベンチマークの両方において、常に同等のパフォーマンスを達成することを示した。
さらに、LongCat-2.0(1.6T-A48B)の開発を支えている。
また,LongCat-Flash-Lite-Sparse (69B-A3B) をLongCat-Flash-Liteに統合し,LongCat-Flash-Liteを改良したLongCat-Flash-Liteトレーニングコーパスを組み込んだオープンソースのLongCat-Flash-Lite-Sparse (69B-A3B) も紹介した。
関連論文リスト
- Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling [65.65882819517455]
本稿では,言語モデリング(LM)損失下でチャンク選択をエンドツーエンドに学習するチャンクワイズアテンション機構を提案する。
実験結果から,HiLS-Attentionはドメイン内コンテキスト長に対して十分に注意を払っている場合に比較して,性能が向上することが示された。
論文 参考訳(メタデータ) (2026-07-03T05:39:00Z) - You Only Index Once: Cross-Layer Sparse Attention with Shared Routing [61.29627714699688]
層間スパースアテンション(A)はYOCOなどのKV共有アーキテクチャ上に構築されている。
シングルインデクサはトークンレベルのトップk選択を一度計算し、その結果のインデックスをレイヤ間で再利用する。
その結果、CLSAは正確かつ効率的であり、最大7.6倍のデコードスピードアップと17.1倍のスループット向上を実現している。
論文 参考訳(メタデータ) (2026-06-04T17:54:04Z) - Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving [18.681651346752766]
動的スパースアテンションは、デコーディングステップ毎にKV状態の小さなクエリ依存サブセットだけにアクセスすることで緩和を約束する。
しかし実際には、これらのアルゴリズムによる貯蓄は、エンドツーエンドのシステムレベルのゲインにはほとんど変換されない。
本稿では,階層的なKVストレージで実行パイプラインを協調設計するスパースアテンション対応推論フレームワークSPINを提案する。
論文 参考訳(メタデータ) (2026-04-29T16:02:00Z) - IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse [68.18308357205586]
Longcontext Agenticは、大規模言語モデルの定義ユースケースとして登場した。
Sparseは、この課題を効果的に解決し、DeepSeek Sparse Attention(DSA)は、代表的なプロダクショングレードソリューションである。
我々は、レイヤを独自のインデクサを実行するフルレイヤの小さなセットと、最も近いフルレイヤのトップkインデックスを単純に再利用する共有レイヤの大多数に分割することで、層間の冗長性を利用するIndexCacheを紹介します。
論文 参考訳(メタデータ) (2026-03-12T17:27:21Z) - AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization [84.25316984309725]
動的スパース構造とパラメータ効率のよいアダプタ(例えばLoRA)の統合は、大規模言語モデル(LLM)を拡張するための強力な技術である。
計算負荷は最小限に抑えられるが、計算のレイテンシが急上昇し、復号速度が2.5倍以上遅くなる。
AdaFuseはアルゴリズムと基盤となるハードウェアシステムとの緊密な協調設計に基づいて構築されたフレームワークで、効率的な動的アダプタ実行を実現する。
論文 参考訳(メタデータ) (2026-03-12T12:46:42Z) - SimpleMem: Efficient Lifelong Memory for LLM Agents [73.74399447715052]
セマンティックロスレス圧縮に基づく効率的なメモリフレームワークSimpleMemを紹介する。
本稿では,情報密度とトークン利用量の最大化を目的とした3段階パイプラインを提案する。
ベンチマークデータセットを用いた実験により,提案手法は精度,検索効率,推論コストにおいて,ベースラインアプローチを一貫して上回っていることがわかった。
論文 参考訳(メタデータ) (2026-01-05T21:02:49Z) - LACONIC: Dense-Level Effectiveness for Scalable Sparse Retrieval via a Two-Phase Training Curriculum [73.82125917416067]
LACONICは、Llama-3アーキテクチャに基づく学習されたスパースレトリバーのファミリーである。
8Bの派生型はMTEB Retrievalベンチマークで最先端の60.2 nDCGを達成し、リーダーボードで15位となった。
論文 参考訳(メタデータ) (2026-01-04T22:42:20Z) - LAWCAT: Efficient Distillation from Quadratic to Linear Attention with Convolution across Tokens for Long Context Modeling [27.045621004239067]
本稿では,事前学習した変圧器の性能を線形アテンションアーキテクチャに効率よく伝達する新しい線形化フレームワークであるLAWCATを提案する。
LAWCATは因果Conv1D層を統合し、局所的な依存性モデリングを強化し、正規化されたゲート付き線形アテンションを用いてコンテキスト長の一般化を改善する。
以上の結果から,Mistral-7Bを1K長で蒸留すると,90%以上のパスキー検索精度が最大22Kトークンとなることがわかった。
論文 参考訳(メタデータ) (2025-09-22T22:43:44Z) - Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding [7.142158555793151]
大規模言語モデル(LLM)は、より長いコンテキストをサポートし続ける。
復号化時のキーバリューキャッシュのメモリ需要は急速に増大する。
スパースアテンション機構は、選択されたキー値対に対してのみ注意重みを計算することでこの問題を軽減する。
既存の方法は、各デコードステップを独立したプロセスとして扱うことが多い。
本研究では,過去の注目パターンに基づいて,スパースインデックス化候補を動的に構築する高速化手法LFPSを提案する。
論文 参考訳(メタデータ) (2025-05-30T02:35:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。