論文の概要: AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention
- arxiv url: http://arxiv.org/abs/2604.07815v1
- Date: Thu, 09 Apr 2026 05:15:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 18:34:05.711126
- Title: AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention
- Title(参考訳): AsyncTLS: 非同期二レベルスパースアテンションを用いた効率的なジェネレーションLLM推論
- Authors: Yuxuan Hu, Jianchao Tan, Jiaqi Zhang, Wen Zan, Pingwei Sun, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai, Jing Zhang,
- Abstract要約: AsyncTLSは、粗粒度ブロックフィルタリングと細粒度トークン選択を組み合わせた階層的スパースアテンションシステムである。
AsyncTLSは、1.2x - 10.0x演算子のスピードアップと1.3x - 4.7xのエンドツーエンドスループットの改善を48k - 96kコンテキストで提供しながら、完全な注意に匹敵する精度を達成する。
- 参考スコア(独自算出の注目度): 32.26860037633772
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context inference in LLMs faces the dual challenges of quadratic attention complexity and prohibitive KV cache memory. While token-level sparse attention offers superior accuracy, its indexing overhead is costly; block-level methods improve efficiency but sacrifice precision. We propose AsyncTLS, a hierarchical sparse attention system that combines coarse-grained block filtering with fine-grained token selection to balance accuracy and efficiency, coupled with an asynchronous offloading engine that overlaps KV cache transfers with computation via temporal locality exploitation. Evaluated on Qwen3 and GLM-4.7-Flash across GQA, and MLA architectures, AsyncTLS achieves accuracy comparable to full attention while delivering 1.2x - 10.0x operator speedups and 1.3x - 4.7x end-to-end throughput improvements on 48k - 96k contexts.
- Abstract(参考訳): LLMの長文推論は、二次的注意複雑性と禁止的なKVキャッシュメモリという2つの課題に直面している。
トークンレベルのスパースアテンションは精度が優れているが、インデックス化のオーバーヘッドはコストがかかる。
本稿では,KVキャッシュ転送と時間的局所性を利用した計算を重畳する非同期オフロードエンジンと組み合わせて,粗粒度ブロックフィルタと微細粒度トークン選択を組み合わせた階層的スパースアテンションシステムAsyncTLSを提案する。
Qwen3 と GLM-4.7-Flash を GQA と MLA アーキテクチャで評価すると、AsyncTLS は 1.2x - 10.0x 演算子のスピードアップと 1.3x - 4.7x のエンドツーエンドスループットの改善を48k - 96k コンテキストで実現し、完全な注意に匹敵する精度を達成している。
関連論文リスト
- Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference [36.81958522560282]
レイヤレベルでの注意を動的に最適化するコンテキスト対応フレームワークであるFlux Attentionを紹介します。
パラメータ効率のよいアプローチとして、我々のフレームワークは8$times$A800 GPU上でのトレーニングにわずか12時間しかかからない。
本フレームワークは,プリフィルおよびデコード段階において,最大2.8times$および2.0times$の速度改善を施したベースラインモデルと比較して,性能と推論速度のトレードオフを良好に実現している。
論文 参考訳(メタデータ) (2026-04-08T07:36:17Z) - AsyncSpade: Efficient Test-Time Scaling with Asynchronous Sparse Decoding [35.10915929939651]
テストタイムスケーリング(TTS)は長いチェーン・オブ・シント(CoT)を介してLCM推論を促進する
KV-cache成長は、LLMデコーディングのメモリバウンドボトルネックを増幅する。
2つのコアコンポーネント上に構築された効率的なTSのための非同期フレームワークであるAsyncSpadeを提案する。
論文 参考訳(メタデータ) (2025-10-08T19:36:11Z) - Fast-dLLM v2: Efficient Block-Diffusion LLM [64.38006546510337]
Fast-dLLM v2はブロック拡散言語モデルで、訓練済みのARモデルをdLLMに適応して並列テキストを生成する。
これは、Dream(580Bトークン)のようなフルアテンション拡散LDMと比較して、トレーニングデータの500倍の減少を示す。
論文 参考訳(メタデータ) (2025-09-30T14:40:18Z) - ATTS: Asynchronous Test-Time Scaling via Conformal Prediction [112.54016379556073]
大規模な言語モデル(LLM)は、テスト時のスケーリングの恩恵を受けるが、しばしば高い推論遅延によって妨げられる。
統計的に保証された適応スケーリングフレームワークであるATTS(Asynchronous Test-Time Scaling)を紹介する。
ATTSは、テストタイムのスケーリングにおいて最大56.7倍のスピードアップと4.14倍のスループット向上を実現している。
論文 参考訳(メタデータ) (2025-09-18T16:55:09Z) - QwenLong-CPRS: Towards $\infty$-LLMs with Dynamic Context Optimization [70.3105638352827]
QwenLong-CPRSはコンテキスト圧縮フレームワークであり、明示的な長文最適化のために設計されている。
QwenLong-CPRSは21.59$times$コンテキスト圧縮と19.15ポイントの平均パフォーマンス向上を達成した。
論文 参考訳(メタデータ) (2025-05-23T16:47:00Z) - LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention [26.54297116028556]
大規模言語モデル(LLM)は、長いシーケンスや複雑な推論タスクの処理において顕著な可能性を示している。
LServeは,ハイブリッドスパースアテンションにより長周期LLMサービスを高速化する,効率的なシステムである。
LServeはLLMプリフィルを最大2.9倍加速し、vLLMで1.3-2.1倍デコードする。
論文 参考訳(メタデータ) (2025-02-20T18:59:52Z) - Star Attention: Efficient LLM Inference over Long Sequences [17.401430615714]
本稿では,複数のホストに注意を向けることで,計算効率を向上させる2相ブロックスパース近似であるStar Attentionを紹介する。
Star Attentionは、グローバルに注意を払ってトレーニングされたほとんどのTransformerベースのLarge Language Modelとシームレスに統合され、メモリ要件と推論時間を最大11倍に短縮する。
論文 参考訳(メタデータ) (2024-11-26T05:10:04Z) - S2-Attention: Hardware-Aware Context Sharding Among Attention Heads [49.1454481007861]
スパースアテンションは、コンテキスト内のトークンのサブセットに選択的に出席する。
スパース・アテンションが今日の大規模言語モデルでモデルの品質を維持することができるかどうかは不明だ。
本稿では,Sparsely-Sharded(S2) attention, a Triton library that provide kernel optimization for sparse attention for sparse attention to customizable per-head and per-context-range levels。
論文 参考訳(メタデータ) (2024-07-25T00:27:07Z) - LoCoCo: Dropping In Convolutions for Long Context Compression [77.26610232994508]
本稿では,Long Context Compression(LoCoCo)のための新しいアプローチであるDropping In Convolutionsを提案する。
LoCoCoは、固定サイズキーバリュー(KV)キャッシュのみを使用し、推論と微調整の両方のステージで効率を向上させることができる。
論文 参考訳(メタデータ) (2024-06-08T01:35:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。