論文の概要: VestigeKV: The NoPE-MLA KV Cache Carries Its Own Sparse-Attention Signal in a Vestigial Branch
- arxiv url: http://arxiv.org/abs/2609.03949v2
- Date: Wed, 09 Sep 2026 16:04:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 15:10:00.932748
- Title: VestigeKV: The NoPE-MLA KV Cache Carries Its Own Sparse-Attention Signal in a Vestigial Branch
- Title(参考訳): VestigeKV: NoPE-MLA KVキャッシュは、独自のスパースアテンションシグナルをベスタジアルブランチにキャリアする
- Abstract要約: VestigeKVはキャッシュが既に持っていた信号からスパースアテンションパターンを導出する。
何もトレーニングされておらず、キャッシュ行は量子化されないため、すべての品質効果は、選択とスケジューリングに起因しています。
Kimi Linear 48B では、検索は 8x の 1.00 と 8k から 65k のコンテキストの 32x の 0.96 で保持され、完全な選択のギャップはゼロである。
- 参考スコア(独自算出の注目度): 0.44841701732863304
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A long-lived KV cache must be compressed before the queries that will read it exist. Selection by observed attention collapses there: on a NoPE-MLA model, H2O and SnapKV retrieve 0.00 and 0.33 of needles at 8x compression, because a token's importance has not yet been observed. VestigeKV instead derives a sparse attention pattern from a signal the cache already carries, occupying the sparse-attention literature's one unoccupied quadrant: training-free and query-independent. In NoPE-MLA the 64-dimensional decoupled branch is a vestige of RoPE that training repurposes into a salience channel; reading 11% of each row, it partitions the cache into an attended tier and a GPU-resident archive that no row ever leaves, reachable each step by a certified, query-adaptive trigger. Nothing is trained and cache rows are never quantized, so every quality effect attributes to selection and scheduling. On Kimi Linear 48B, retrieval holds at 1.00 under 8x and 0.96 under 32x from 8k to 65k context, with zero gap to full-row selection, and the recall tier holds 128x at 1.00 (8k). Both tiers stay on the GPU, so the win is speed, not memory: the per-step scan reads ~26% of the bytes dense attention would, and on a two-node sglang deployment the crossover sits at ~40k context, reaching 1.18x at 256k and 1.39x at 496k. The mechanism is exclusive to NoPE: the identical operator on a RoPE MLA collapses to 0.08, query-independent salience exists only without rotation, and query-universal exact merging is provably impossible under RoPE. All thresholds were frozen before their data; 20 archived verdicts and 8 closed routes accompany the paper.
- Abstract(参考訳): 長寿命のKVキャッシュは、それを読むクエリが存在する前に圧縮されなければならない。
NoPE-MLAモデルでは、トークンの重要性が観測されていないため、H2OとSnapKVは8倍の圧縮で0.00と0.33の針を回収する。
VestigeKVは、キャッシュが既に持っていた信号からスパースアテンションパターンを導出し、スパースアテンション文学の4分の1(トレーニング不要とクエリ非依存)を占有する。
NoPE-MLAでは、64次元の分離されたブランチは、トレーニングをサリエンスチャネルにリユースするRoPEの利点であり、各行の11%を読み込み、キャッシュを参加者層に分割する。
何もトレーニングされておらず、キャッシュ行は量子化されないため、すべての品質効果は、選択とスケジューリングに起因しています。
Kimi Linear 48Bでは、検索は8kから65kまでの32x以下の1.00、0.96は8kから65kまでの32x以下の1.00、リコール層は1.00(8k)で128xである。
ステップごとのスキャンでは、注目度の高いバイトの26%が読み取り、2ノードのsglangデプロイメントでは、クロスオーバーは40kのコンテキストで、256kで1.18x、496kで1.39xに達する。
このメカニズムはNoPEに排他的であり、RoPE MLA上の同一演算子は0.08に崩壊し、クエリ非依存のサリエンスはローテーションなしでしか存在せず、クエリ・ユニバーサルの正確なマージはRoPEでは証明不可能である。
データの前にすべてのしきい値が凍結され、20のアーカイブされた評決と8の閉道が論文に付随した。
関連論文リスト
- RedKnot-MLA: Multi-Head Offline-Online Reuse for DeepSeek-V4 Long-Context Serving [30.406836978404403]
マルチヘッド潜時注意(MLA)は、複数の論理的クエリヘッドを1つの満載の潜時KVストリームを通じて公開する。
我々はRedKnotのヘッドアウェア再利用原理をDeepSeek-V4で実現したシステムを提案する。
論文 参考訳(メタデータ) (2026-09-07T03:59:33Z) - PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents [85.82624962221026]
本稿では、読みを推論から切り離すPARSERを紹介する。
単一のチャンクにバインドされた軽量サブエージェントのバンクは、ドキュメント全体を並列に読み取る。
7Kから896Kまでのコンテキストを持つマルチホップQAでは、4Bバックボーンを持つPARSERが最強のシーケンシャルメモリベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-06T16:19:01Z) - Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning [78.75986976062454]
大規模言語モデルは、拡張推論を必要とするタスクにおいて優れたパフォーマンスを達成する。
既存のKVキャッシュ圧縮メソッドは、1つのパラダイムを共有している。
選択信号はほとんど役に立たないことを示す。ランダム注意は各アテンションヘッド内でプロンプトと退避者をランダムに保ち、スコアを全く計算しない。
論文 参考訳(メタデータ) (2026-09-03T06:38:38Z) - Minima-KV: Retention-Preserving KV Cache Compression with Mixed-Format Paged Attention [0.0]
Minima-KVは、混合形式ページアテンションのための保持保存階層である。
最近の保護されたアンカーページはFP8に残っており、古いアンカーページはTQ3に移動している。
フォーマット固有のカーネルは部分的な注意状態を計算し、それらをグローバルに標準化されたオンライン-ソフトマックス状態を通して組み合わせる。
論文 参考訳(メタデータ) (2026-08-24T21:21:58Z) - WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization [20.158719055939383]
KV-cache量子化は今日、オフラインベンチマーク平均によって検証されている。
デプロイされたシステムは、現在提供されている要求に圧縮がダメージを与えているかどうかを判断できない。
KV量子化のためのDTraceを実証可能な健全なランタイムメータとして提供します。
論文 参考訳(メタデータ) (2026-07-30T11:04:45Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Forgetful Attention: A Trainable Support-Vector Memory with Certified Selection and Exact Unlearning [0.16921396880325776]
固定ボックスパラメータCの1クラスSfpの支持係数が重みを持つメモリであるSupport Vector Attention(SV-Attention)を導入する。
アクティブセットのパーティションは、リザーブトークンを正確にゼロウェイト、出力ウェイトを与え、インクリメンタルインクリメンタルソルバトークンは、同じCの下で再トレーニングせずに生成した状態を回復する。
また,実文埋め込み上での外科的排除,正確な編集,患者記録の削除,忘れやすい検索メモリも示す。
論文 参考訳(メタデータ) (2026-07-13T23:13:57Z) - RoPE-Aware Bit Allocation for KV-Cache Quantization [52.099459337231345]
Block-GTQはTurboQuant-MSE上に構築されたキーキャッシュ量子化のためのビットアロケータである。
これは、RoPEクエリキーのロジットを10モデル診断パネルに保存する。
128Kコンテキストでfp16 FlashAttention2より1.34倍高速で動作する。
論文 参考訳(メタデータ) (2026-06-23T00:17:48Z) - FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention [77.12062766962815]
Lookahead Sparse Attention (LSA)は、DeepSeek-V4アーキテクチャ上に構築されたNeural Memory Indexerを利用している。
このアーキテクチャをバックボーンフリーの非結合なトレーニング戦略でインスタンス化する。
FM-DS-V4は、物理KVキャッシュのフットプリントを、フルコンテキストベースラインのわずか13.5%まで圧縮することを示した。
論文 参考訳(メタデータ) (2026-06-08T06:25:54Z) - IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference [12.04455190856202]
マルチターンLLMエージェントはショートクエリを、ツールコール、検索結果、中間推論の長い軌跡に扇動する。
我々は,基地LLMを凍結状態に保つための学習KVプルーニングであるIntentKVを紹介する。
IntentKVは、厳しいKV予算の下では精度の低下がほとんどなく、未完成のフルキャッシュベースラインと一致します。
論文 参考訳(メタデータ) (2026-06-06T15:54:48Z) - OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization [14.533966202649806]
そこで本研究では,アテンション・アウェアの共分散構造をオフラインで推定するUltra-low-bit KVキャッシュ量子化手法を提案する。
このようにして、KV量子化は、注意が実際に消費する共分散構造と整合する。
提案手法は,5つのタスクにまたがる最大32kトークンの推論トレースを用いて,最近の推論モデルを用いて評価する。
論文 参考訳(メタデータ) (2026-05-18T02:24:29Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - Agent Memory Below the Prompt: Persistent Q4 KV Cache for Multi-Agent LLM Inference on Edge Devices [0.0]
エッジデバイス上のマルチエージェントLLMシステムは、メモリ管理の問題に直面している。
10.2GBのキャッシュ予算を持つApple M4 Proでは、FP16の8Kコンテキストに適合するエージェントは3つしかない。
我々は、各エージェントのKVキャッシュを4ビットの量子化フォーマットでディスクに永続化することで、この問題に対処する。
論文 参考訳(メタデータ) (2026-02-17T05:46:20Z) - Cache Me If You Can: How Many KVs Do You Need for Effective Long-Context LMs? [79.58770714228983]
言語モデルは、書籍要約のようなタスクに対して、ますます長いコンテキストを扱う。
これによりキーバリュー(KV)キャッシュのメモリコストが増大する。
以前の多くの研究でKVをメモリから外す方法が提案されているが、そのアプローチは好ましい設定に適合している。
KVフットプリント*は、記憶中のKVエントリの量と寿命の両方を考慮し、統一された計量として提案する。
論文 参考訳(メタデータ) (2025-06-20T16:21:12Z) - SCBench: A KV Cache-Centric Analysis of Long-Context Methods [61.025422435235456]
KVキャッシュ中心の視点から長文の手法を評価するベンチマークであるSCBenchを紹介する。
我々は、Gated Linear RNNsやMamba-Attention Hybridsを含む8つのカテゴリの長期コンテキストソリューションについて、広範なKVキャッシュ中心の分析を行う。
本研究は,O(n)メモリとサブO(n2)プリフィルによるスパース符号化が堅牢に動作する一方で,サブO(n)メモリ手法がマルチターンシナリオに悩まされていることを示す。
論文 参考訳(メタデータ) (2024-12-13T17:59:52Z) - KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing [58.29726147780976]
我々は,層間をKVキャッシュで共有し,層間圧縮を実現する,textit KVSharerと呼ばれるプラグアンドプレイ方式を提案する。
実験の結果、textit KVSharerはKVキャッシュの計算を30%削減し、メモリ消費を削減できることがわかった。
我々は,textit KVSharerが既存の層内KVキャッシュ圧縮手法と互換性があることを検証する。
論文 参考訳(メタデータ) (2024-10-24T08:06:41Z) - PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling [38.732413451399]
ピラミッドKVは新規かつ効果的なKVキャッシュ圧縮法である。
提案手法は,KVキャッシュの12%しか保持せず,完全なKVキャッシュでモデルの性能と一致していることを示す。
Needle-in-a-Haystack実験では、Praamid KVは長文理解の維持において競合する手法より優れている。
論文 参考訳(メタデータ) (2024-06-04T07:51:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。