論文の概要: UNIQUE: Universal Top-k Sparse Attention for Training-free Inference and Sparsity-aware Training
- arxiv url: http://arxiv.org/abs/2605.27740v1
- Date: Tue, 26 May 2026 22:32:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.583213
- Title: UNIQUE: Universal Top-k Sparse Attention for Training-free Inference and Sparsity-aware Training
- Title(参考訳): UNIQUE: トレーニングフリー推論とスパースアウェアトレーニングのためのユニバーサルトップkスパースアテンション
- Authors: Keqi Deng, Shaoshi Ling, Ruchao Fan, Jinyu Li,
- Abstract要約: 大規模言語モデル(LLM)における長文推論は、自己注意キー値(KV)キャッシュの線形成長によってボトルネックとなる。
Top-kキャッシュはKVキャッシュのごく一部で注意を緩和するが、トレーニングと補助トレーニングの両方において、正確に重要性を推定する。
- 参考スコア(独自算出の注目度): 25.273337266205413
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-context inference in large language models (LLMs) is bottlenecked by the linear growth of the self-attention key-value (KV) cache. Top-k sparse attention alleviates this by loading only a small fraction of the KV cache, but accurately and cheaply estimating cache importance, for both training-free use and sparsity-aware training, remains challenging. This paper proposes UNIQUE, a universal top-k sparse attention framework that addresses both requirements and stays consistently effective across LLM modalities. UNIQUE operates at the granularity of KV pages and estimates per-page importance with a simple yet accurate score combining the mean of the page's keys as a representative vector with their standard deviation as an offset term. To further close the train-inference gap, this paper introduces a soft-mask sparsity-aware training scheme that uses the top-k score boundary as a per-query threshold and a sigmoid soft mask around it, requiring neither auxiliary losses nor architectural changes. Experiments on text and speech LLMs show that UNIQUE preserves task performance on long-context benchmarks such as LongBench Pro and on long-form speech recognition, while delivering up to 11.4x attention-kernel speedup over FlashInfer dense attention and at least 5.3x end-to-end decoding speedup over a vLLM-based dense model.
- Abstract(参考訳): 大規模言語モデル(LLM)における長文推論は、自己注意キー値(KV)キャッシュの線形成長によってボトルネックとなる。
トップkスパースアテンションは、KVキャッシュのごく一部だけをロードすることでこれを緩和するが、トレーニングなしの使用とスパースネス対応のトレーニングの両方において、キャッシュの重要性を正確かつ安価に推定することは、依然として困難である。
提案するUNIQUEは,LLMモダリティの両要求に対処し,一貫した有効性を維持する,汎用的なトップkスパースアテンションフレームワークである。
UNIQUEは、KVページの粒度で動作し、ページごとの重要度を、ページのキーの平均を代表ベクトルとして、標準偏差をオフセット項として、シンプルで正確なスコアで推定する。
そこで,本研究では,トップkスコア境界をクエリごとのしきい値とし,その周辺にシグモイドマスクを配置し,補助的損失もアーキテクチャ的変化も必要としないソフトマスク・スポーシティ・アウェアトレーニング手法を提案する。
LLMのテキストおよび音声の実験では、UNIQUEはLongBench Proのような長文ベンチマークや長文音声認識のタスク性能を保ちつつ、FlashInferの11.4倍の注目カーネルスピードアップと、vLLMベースの高密度モデル上の少なくとも5.3倍のエンド・ツー・エンドのデコードスピードアップを実現している。
関連論文リスト
- Training-free Context-adaptive Attention for Efficient Long Context Modeling [57.703159205740185]
トレーニングフリーコンテキスト適応注意(TCA-Attention)は、学習不要なスパースアテンション機構であり、効率的な長文推論のための情報トークンのみに選択的に参画する。
TCA-Attentionは2.8$times$のスピードアップを実現し、128Kのコンテキスト長でKVキャッシュを61%削減し、フルアテンションに匹敵するパフォーマンスを維持している。
論文 参考訳(メタデータ) (2025-12-10T01:54:57Z) - Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs [26.951325519894525]
本稿では,軽量保持ゲートを介して各トークンの創出時の本質的な重要性を学習する手法を提案する。
我々は,特に低メモリ環境において,強い信念と学習可能な検索ベースラインを一貫して上回ることを示す。
一部の設定ではフルキャッシュモデルを超えており、選択的な保持が正規化の一形態として機能することを示している。
論文 参考訳(メタデータ) (2025-12-03T00:20:35Z) - OjaKV: Context-Aware Online Low-Rank KV Cache Compression with Oja's Rule [54.37983890753086]
我々は,戦略的ハイブリッドストレージポリシとオンラインサブスペース適応を統合したフレームワークであるOjaKVを紹介する。
OjaKVは、重要かつ最新のトークンをフルランクで保存し、注意のために高忠実なアンカーを維持している。
オンライン主成分分析のためのOjaのアルゴリズムを用いて、プロジェクションベースを漸進的に適応させることにより、低ランク圧縮を適用する。
論文 参考訳(メタデータ) (2025-09-25T21:42:27Z) - RetroInfer: A Vector-Storage Approach for Scalable Long-Context LLM Inference [27.69137902678418]
RetroInferは、長文推論を加速するために固有の注意空間を利用する新しいシステムである。
KVキャッシュがCPUメモリに拡張された場合、GPUメモリリミット内では4.5倍のスピードアップと、スムーズなアテンションベースライン上で最大10.5倍のスピードアップを示します。
論文 参考訳(メタデータ) (2025-05-05T18:01:17Z) - AttentionPredictor: Temporal Patterns Matter for KV Cache Compression [64.75459635661562]
我々は,KVキャッシュ圧縮とクリティカルトークン識別のための注意パターンを直接予測する,学習に基づく最初の手法であるAttentionPredictorを提案する。
AttentionPredictorは、注意スコアを正確に予測し、無視可能なメモリを消費する統一予測モデルを共有する。
注意情報の大半を保持することで、AttentionPredictorは、キャッシュオフロードシナリオで13$times$KVキャッシュ圧縮と5.6$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2025-02-06T13:41:46Z) - S2-Attention: Hardware-Aware Context Sharding Among Attention Heads [49.1454481007861]
スパースアテンションは、コンテキスト内のトークンのサブセットに選択的に出席する。
スパース・アテンションが今日の大規模言語モデルでモデルの品質を維持することができるかどうかは不明だ。
本稿では,Sparsely-Sharded(S2) attention, a Triton library that provide kernel optimization for sparse attention for sparse attention to customizable per-head and per-context-range levels。
論文 参考訳(メタデータ) (2024-07-25T00:27:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。