論文の概要: More Value per Key: Asymmetric Sparse Attention for Faster LLM Decoding
- arxiv url: http://arxiv.org/abs/2610.04753v1
- Date: Sat, 03 Oct 2026 20:38:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.330247
- Title: More Value per Key: Asymmetric Sparse Attention for Faster LLM Decoding
- Title(参考訳): キーごとのさらなる値:より高速なLCM復号のための非対称スパースアテンション
- Abstract要約: Sparse Asymmetric Group-Query Attention (SAGA)を導入し、鍵と値のカウントを分離してこの原理を利用する。
この非対称性の利点を理論的に定式化し、遅延測定や品質評価を通じて実証的に検証する。
SAGAとAtop-Nは、長いコンテキストで、我々のフルアテンションGQAベースラインよりも、エンド・ツー・エンドのデコード・スピードアップを2ドル超で達成します。
- 参考スコア(独自算出の注目度): 19.982502376157175
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: utoregressive generation in Large Language Models (LLMs) is constrained by the memory and computational demands of attention mechanisms. Sparse attention methods mitigate this cost by selecting only high-probability entries of the attention matrix. We observe that in many such methods, this renders the probability-value multiplication negligible, shifting the bottleneck to the query-key step. Key heads can therefore be reduced to accelerate inference, while retaining more value heads preserves capacity with limited additional decoding cost. We introduce Sparse Asymmetric Group-Query Attention (SAGA), which decouples key and value head counts to exploit this principle, and pair it with approximate top-N (Atop-N) attention, a simple sparse attention method designed to study the interaction between sparsity and head-count asymmetry. We formalize the benefits of this asymmetry theoretically and validate them empirically through latency measurements and quality evaluations on models up to 1.5B parameters. Together, SAGA and Atop-N achieve end-to-end decoding speedups exceeding $2\times$ over our full-attention GQA baseline at long contexts. Models trained from scratch with SAGA nearly match the quality of comparable GQA variants on the evaluated benchmarks. To facilitate adoption, we introduce an efficient fine-tuning method that converts pretrained models to the SAGA architecture, enabling practitioners to benefit from our approach without costly retraining.
- Abstract(参考訳): 大規模言語モデル(LLM)における強迫的生成は、注意機構の記憶と計算要求によって制限される。
スパースアテンション法はこのコストを軽減し、アテンションマトリックスの高確率エントリのみを選択する。
このような手法の多くにおいて、この手法は確率値乗算を無視し、ボトルネックをクエリキーのステップにシフトさせる。
そのため、キーヘッドを減らして推論を加速し、より多くの値ヘッドを保持すれば、追加の復号コストでキャパシティを維持できる。
本稿では,鍵数と値ヘッドを分離してこの原理を活用できるスパース非対称グループクエリアテンション(SAGA)を導入し,スパースとヘッド数非対称性の相互作用を研究するための単純なスパースアテンション手法であるAtop-N(Atop-N)アテンションと組み合わせる。
我々は、この非対称性の利点を理論的に定式化し、最大1.5Bパラメータのモデル上での遅延測定と品質評価を通じて経験的に検証する。
SAGAとAtop-Nは共に、2ドル以上のエンドツーエンドのデコードスピードアップを実現しています。
SAGAでスクラッチからトレーニングされたモデルは、評価されたベンチマークで比較可能なGQA変種の品質とほぼ一致した。
導入を容易にするために,事前学習したモデルをSAGAアーキテクチャに変換する効率的な微調整手法を導入する。
関連論文リスト
- STS: Efficient Sparse Attention with Speculative Token Sparsity [12.543465979205266]
STSはスパースアテンションメカニズムであり、モデルの再トレーニングを必要としない。
代表ベンチマークであるNarrativeQAでは,STSが約90%の間隔で2.67倍の高速化を実現していることを示す。
論文 参考訳(メタデータ) (2026-05-15T01:05:37Z) - Explicit Multi-head Attention for Inter-head Interaction in Large Language Models [70.96854312026319]
マルチヘッド明示的注意(Multi-head Explicit Attention、MEA)は、頭間相互作用を明示的にモデル化した、単純で効果的な注意法である。
MEAは事前トレーニングにおいて強い堅牢性を示し、より高速な収束につながる学習率を使用することを可能にします。
これにより、KVキャッシュメモリ使用率を50%削減できる実用的なキー値キャッシュ圧縮戦略が実現される。
論文 参考訳(メタデータ) (2026-01-27T13:45:03Z) - LaSeR: Reinforcement Learning with Last-Token Self-Rewarding [54.72617309922891]
RLVR(Reinforcement Learning with Verifiable Rewards)は、Large Language Models(LLM)の推論能力を高めるためのコアパラダイムとして登場した。
従来、LLMは2つの異なるプロンプトテンプレートを使用してソリューションと自己検証をシーケンシャルに生成し、効率を大幅に低下させる必要があった。
本稿では,従来のRLVR損失をMSE損失で増大させるアルゴリズムであるLaSeR(Reinforcement Learning with Last-Token Self-Rewarding)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:55:11Z) - Sparse Query Attention (SQA): A Computationally Efficient Attention Mechanism with Query Heads Reduction [0.0]
本稿では,新しいアテンションアーキテクチャであるスパースクエリアテンション(SQA)について紹介する。
モデル事前トレーニング、微調整、エンコーダベースのタスクなど、計算バウンドシナリオで最大3倍のスループット向上を実現することができる。
SQAは、近くリリースされるReactive Transformerアーキテクチャの開発において、極めて重要視された。
論文 参考訳(メタデータ) (2025-10-02T09:01:38Z) - AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs [7.603859408568262]
AQUA (Attention via QUery mAgnitudes) は、新規で多用途な近似戦略である。
注目点積の25%削減は,統計的に有意な影響を伴って達成できることが示唆された。
論文 参考訳(メタデータ) (2025-09-14T08:20:48Z) - R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning [80.104336426172]
CoT(Chain-of- Thought)は、大規模言語モデルの問題解決能力を高める。
CoTは長い自己回帰軌道のためにかなりの推論コストを発生させる。
トレーニング不要なハイブリッドデコーディングフレームワークであるR-Stitchを紹介する。
論文 参考訳(メタデータ) (2025-07-23T08:14:36Z) - Multipole Attention for Efficient Long Context Reasoning [64.94673641704289]
大規模推論モデル (LRM) は複雑な問題解決タスクにおいて有望な精度の向上を示す。
LRMは、答える前に考えるために、長い連鎖推論を生成する必要がある。
本稿では,重要なトークンに対してのみ正確に注意を払うことで,自己回帰推論を高速化するマルチポール注意法を提案する。
論文 参考訳(メタデータ) (2025-06-16T03:00:40Z) - SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning [14.020244011380063]
SpecReasonは、LEM推論を加速するシステムである。
最終回答の正確性を維持する上で、思考トークンのセマンティックな柔軟性を利用する。
バニラLEM推論よりも1.4-3.0times$のスピードアップを実現している。
論文 参考訳(メタデータ) (2025-04-10T16:05:19Z) - Quantize What Counts: More for Keys, Less for Values [63.51476878610841]
大規模言語モデル(LLM)は、キーバリュー(KV)キャッシュに支配される推論時のメモリボトルネックに悩まされる。
本稿ではトランスフォーマーモデルの内在幾何学における混合精度KV量子化を固定する2つの定理を提案する。
論文 参考訳(メタデータ) (2025-02-20T22:24:27Z) - Zero-Shot Sharpness-Aware Quantization for Pre-trained Language Models [88.80146574509195]
量子化は、メモリオーバーヘッドを減らし、推論を加速するための有望なアプローチである。
種々のPLMのゼロショット量子化のための新しい量子化(ZSAQ)フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-20T07:09:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。