論文の概要: Adaptive Mass-Segmented KV Compression for Long-Context Reasoning
- arxiv url: http://arxiv.org/abs/2605.23200v1
- Date: Fri, 22 May 2026 03:32:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-25 17:29:20.18864
- Title: Adaptive Mass-Segmented KV Compression for Long-Context Reasoning
- Title(参考訳): 長期推論のための適応質量分離型KV圧縮
- Authors: Junzhe Yang, Xiaoyu Shen,
- Abstract要約: 本稿では、トークンレベルの競合から地域対応クォータ割り当てへパラダイムをシフトさせるフレームワークである、適応質量分離(AMS)KV圧縮を提案する。
AMSは、注意質量の空間分布に基づいてKVキャッシュを適応的に分割し、構造上重要な推論セグメントが保証されたメモリクォータを受け取ることを保証する。
TOVA, expected Attention, KeyDiff, R-KV, Tri.Attention などの代表的なメソッドにシームレスに統合できる。
- 参考スコア(独自算出の注目度): 7.152154762874602
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The linear growth of the Key-Value (KV) cache is a critical bottleneck in long-form LLM inference. Existing KV compression methods mitigate this by evicting tokens based on importance scores. However, we show that their reliance on global Top-k selection triggers Region Wipe-out: the severe eviction of contiguous reasoning blocks that derails logical coherence. To address this, we propose Adaptive Mass-Segmented (AMS) KV Compression, a framework that shifts the paradigm from token-level competition to region-aware quota allocation. AMS adaptively partitions the KV cache based on the spatial distribution of attention mass, ensuring structurally vital reasoning segments receive guaranteed memory quotas. To ensure stability during iterative decoding, an EMA-based smoothing mechanism is incorporated to prevent jitter in segment boundaries. Crucially, AMS is a universal plug-and-play layer that is orthogonal to existing scorers. It can be seamlessly integrated into representative methods such as TOVA, Expected Attention, KeyDiff, R-KV and TriAttention. AMS is also system-compatible with modern paged-KV serving frameworks such as vLLM, supporting efficient gather-and-compact KV execution without introducing additional steady-state attention overhead. Extensive experiments across a diverse suite of tasks, including mathematical reasoning (MATH500, AIME, GSM8K), code completion, open-domain QA, and sparse retrieval, demonstrate that AMS consistently mitigates structural fragmentation and boosts model performance.
- Abstract(参考訳): キーバリュー(KV)キャッシュの線形成長は、長期LLM推論において重要なボトルネックである。
既存のKV圧縮手法は、重要なスコアに基づいてトークンを除去することでこれを緩和する。
しかし,グローバルなトップk選択への依存は,論理的コヒーレンスを損なう連続的推論ブロックの厳格な排除という領域ワイプアウトの引き金となることを示す。
これを解決するために、トークンレベルの競合から地域対応クォータ割り当てへパラダイムをシフトするフレームワークであるAdaptive Mass-Segmented (AMS) KV Compressionを提案する。
AMSは、注意質量の空間分布に基づいてKVキャッシュを適応的に分割し、構造上重要な推論セグメントが保証されたメモリクォータを受け取ることを保証する。
繰り返し復号化時の安定性を確保するため、セグメント境界のジッタを防止するためにEMAベースの平滑化機構が組み込まれている。
重要なのは、AMSは既存のスコアラーに直交する普遍的なプラグアンドプレイ層である。
TOVA、期待注意、KeyDiff、R-KV、TriAttentionなどの代表的なメソッドにシームレスに統合できる。
AMSはまた、vLLMのようなモダンなページ付きKVサービスフレームワークとシステム互換であり、定常的なオーバヘッドを追加することなく、効率的な集合およびコンパクトなKV実行をサポートする。
数学的推論(MATH500, AIME, GSM8K)、コード補完、オープンドメインQA、スパース検索など、多岐にわたる実験により、AMSは構造的断片化を一貫して軽減し、モデル性能を向上することを示した。
関連論文リスト
- Latent-Condensed Transformer for Efficient Long Context Modeling [60.72493959155964]
大規模言語モデルに対するLCA(Latent-Condensed Attention)を提案する。
LCAはMLAの潜伏空間内のコンテキストを凝縮し、表現はセマンティック潜伏ベクトルと位置キーに切り離される。
LCAは、最大2.5$times$プリフィルスピードアップと128Kコンテキストでの90%のKVキャッシュ削減を実現している。
論文 参考訳(メタデータ) (2026-04-14T08:40:31Z) - Understanding the Physics of Key-Value Cache Compression for LLMs through Attention Dynamics [22.98826013817833]
トークンレベルのルーティングの制御摂動として,KV圧縮を物理に着想を得た視点を提案する。
適度な圧縮は、内部表現をほとんど精度の低下なく劣化させ、冗長性を明らかにする。
トークンサバイバルにもかかわらず、過度なヘッドレベルのコンセンサスによってルーティングの柔軟性が崩壊する表現剛性を特定する。
論文 参考訳(メタデータ) (2026-03-02T04:16:36Z) - OjaKV: Context-Aware Online Low-Rank KV Cache Compression with Oja's Rule [54.37983890753086]
我々は,戦略的ハイブリッドストレージポリシとオンラインサブスペース適応を統合したフレームワークであるOjaKVを紹介する。
OjaKVは、重要かつ最新のトークンをフルランクで保存し、注意のために高忠実なアンカーを維持している。
オンライン主成分分析のためのOjaのアルゴリズムを用いて、プロジェクションベースを漸進的に適応させることにより、低ランク圧縮を適用する。
論文 参考訳(メタデータ) (2025-09-25T21:42:27Z) - KVCompose: Efficient Structured KV Cache Compression with Composite Tokens [7.922206020386125]
大規模言語モデル(LLM)は、効率的な自己回帰復号化のためにキー値(KV)キャッシュに依存している。
我々は,注意誘導型,層適応型複合トークンに基づく,シンプルで効果的なKVキャッシュ圧縮フレームワークを提案する。
本手法は精度を保ちながらメモリの大幅な削減を実現し,従来手法と半構造化手法を一貫して上回っている。
論文 参考訳(メタデータ) (2025-09-05T14:58:24Z) - EMS: Adaptive Evict-then-Merge Strategy for Head-wise KV Cache Compression Based on Global-Local Importance [44.14919492126948]
メモリオーバーヘッドが重要になるにつれて、KVキャッシュの効率的な圧縮が注目されている。
我々は,これらの制限を克服すると同時に,極端な圧縮比下でのKVキャッシュ圧縮を向上するEMSを提案する。
EMSは最低の難易度を一貫して達成し、256のキャッシュ予算の下でLongBench上の4つのLLMで1.28ポイント以上改善し、Needdle-in-a-Haystackタスクのコンテキスト長の2%未満のキャッシュ予算で95%の検索精度を維持している。
論文 参考訳(メタデータ) (2024-12-11T16:35:13Z) - Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs [82.08922896531618]
大規模言語モデル(LLM)における生成推論のメモリフットプリントを削減するプラグイン・アンド・プレイ方式である適応KVキャッシュ圧縮を導入する。
我々は,アテンションモジュールの本質的な構造を明らかにするために,ターゲットプロファイリングを行う。
認識された構造に基づいて、我々はKVキャッシュを適応的に構築する: 注意頭上の長距離コンテキストを排除し、局所的なコンテキストを強調し、特別なトークンを中心とした注意頭上の特別なトークンを排除し、すべてのトークンに広く参加する注目頭に対して標準のKVキャッシュのみを使用する。
論文 参考訳(メタデータ) (2023-10-03T05:17:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。