論文の概要: SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation
- arxiv url: http://arxiv.org/abs/2607.16213v1
- Date: Tue, 19 May 2026 17:44:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.035687
- Title: SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation
- Title(参考訳): SelKV: トークン単位のマージとアテンション補償による選択的なKVキャッシュマージ
- Authors: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur,
- Abstract要約: 大規模言語モデルは、メモリフットプリントがコンテキスト長とともに線形に増加するキー値(KV)キャッシュに依存して、テキストを自動回帰的に生成する。
最近の圧縮法はトークンマージによるコストを軽減している。
これらの制約に対処するKVキャッシュ圧縮のためのトレーニングフリーでデュアルコンポーネントのフレームワークを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) generate text autoregressively, relying on a key-value (KV) cache whose memory footprint grows linearly with context length, creating a major bottleneck. Recent compression methods mitigate this cost via token merging; however, these approaches often rely on indiscriminate aggregation, which degrades representations and introduces attention sag, a mismatch where merged tokens receive the same softmax mass as individual tokens despite encoding multiple inputs. We propose a training-free, dual-component framework for KV cache compression that addresses these limitations. First, a soft cosine gate adaptively modulates merging decisions based on value-vector similarity, suppressing or discarding dissimilar tokens to preserve semantic fidelity. Second, we introduce an attention-ratio compensation mechanism that applies a decoding-time logit bias derived from prefill attention statistics, correcting the softmax imbalance induced by merging. Evaluated on LongBench (16 English datasets) while retaining only 25% of the KV cache, our framework achieves strong compressed performance against representative one-shot baselines. It is especially robust on the evaluated grouped-query attention (GQA) models, maintaining nearlossless generation quality. Furthermore, the method outperforms the full-cache baseline on complex multi-document QA tasks and delivers a 3.3x decoding speedup at 100k tokens.
- Abstract(参考訳): 大規模言語モデル(LLM)は、メモリフットプリントがコンテキスト長とともに線形に増加するキー値(KV)キャッシュに依存して、自動回帰的にテキストを生成する。
近年の圧縮法では、トークンのマージによるコスト低減が試みられているが、これらの手法は、複数の入力を符号化したにもかかわらず、個々のトークンと同じソフトマックス質量を受け取るミスマッチである、表現を劣化させ、アテンションサグを導入する非差別アグリゲーションに依存していることが多い。
これらの制約に対処するKVキャッシュ圧縮のためのトレーニングフリーでデュアルコンポーネントのフレームワークを提案する。
まず、ソフトコサインゲートは、値ベクトル類似性に基づいてマージ決定を適応的に変調し、意味的忠実性を維持するために異種トークンを抑制または破棄する。
第2に,事前注意統計から導かれる復号時間ロジットバイアスを適用し,マージによるソフトマックス不均衡を補正するアテンション比補償機構を導入する。
KVキャッシュの25%しか保持していないLongBench(英語データセット)を評価したところ、このフレームワークは代表的ワンショットベースラインに対して強い圧縮性能を実現している。
評価されたグループ・クエリー・アテンション(GQA)モデルでは特に堅牢であり、ほぼ無作為な生成品質を維持している。
さらに、複雑なマルチドキュメントQAタスクでフルキャッシュベースラインを上回り、100kトークンで3.3倍のデコードスピードアップを提供する。
関連論文リスト
- GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs [97.36238579001544]
コンテキスト長が拡張された大規模言語モデル(LLM)は、キー値(KV)キャッシュに依存して、以前のトークンに対する注意をサポートする。
KVキャッシュを維持することは、KVキャッシュ圧縮メソッドを動機付け、かなりのメモリオーバーヘッドを引き起こす。
GRKVは,圧縮キャッシュとフルキャッシュのアテンション出力の差を直接最小化する,トレーニング不要なKV-cacheマージ手法である。
論文 参考訳(メタデータ) (2026-05-29T10:16:30Z) - Latent-Condensed Transformer for Efficient Long Context Modeling [60.72493959155964]
大規模言語モデルに対するLCA(Latent-Condensed Attention)を提案する。
LCAはMLAの潜伏空間内のコンテキストを凝縮し、表現はセマンティック潜伏ベクトルと位置キーに切り離される。
LCAは、最大2.5$times$プリフィルスピードアップと128Kコンテキストでの90%のKVキャッシュ削減を実現している。
論文 参考訳(メタデータ) (2026-04-14T08:40:31Z) - Training-free Context-adaptive Attention for Efficient Long Context Modeling [57.703159205740185]
トレーニングフリーコンテキスト適応注意(TCA-Attention)は、学習不要なスパースアテンション機構であり、効率的な長文推論のための情報トークンのみに選択的に参画する。
TCA-Attentionは2.8$times$のスピードアップを実現し、128Kのコンテキスト長でKVキャッシュを61%削減し、フルアテンションに匹敵するパフォーマンスを維持している。
論文 参考訳(メタデータ) (2025-12-10T01:54:57Z) - KVCompose: Efficient Structured KV Cache Compression with Composite Tokens [7.922206020386125]
大規模言語モデル(LLM)は、効率的な自己回帰復号化のためにキー値(KV)キャッシュに依存している。
我々は,注意誘導型,層適応型複合トークンに基づく,シンプルで効果的なKVキャッシュ圧縮フレームワークを提案する。
本手法は精度を保ちながらメモリの大幅な削減を実現し,従来手法と半構造化手法を一貫して上回っている。
論文 参考訳(メタデータ) (2025-09-05T14:58:24Z) - ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference [61.412894960600205]
大きな言語モデル(LLM)は、長いテキストを処理する際に大きなGPUメモリを必要とする。
ChunkKVは、セマンティックチャンクを基本的な圧縮単位として扱うことで、KVキャッシュ圧縮を再定義する。
結果: ChunkKVは最先端の手法を最大8.7%精度で上回る。
論文 参考訳(メタデータ) (2025-02-01T03:49:47Z) - ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression [10.003118268356017]
ロングコンテキストは推論効率に重大な課題をもたらす。
本稿では,意味クラスタの粒度でトークンをリコールするClusterKVを紹介する。
実験結果から、ClusterKVは32kのコンテキスト長を持つ様々なタスクにおいて、無視可能な精度の損失が得られることがわかった。
論文 参考訳(メタデータ) (2024-12-04T10:58:27Z) - Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity [24.118503938098307]
textscPoDはトークンの重要度に応じてメモリを割り当てる。
textscPoDは、パフォーマンスを損なうことなく、KVキャッシュメモリ使用量を最大35%削減する。
論文 参考訳(メタデータ) (2024-12-03T08:29:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。