論文の概要: Forget Without Compromise: Nexus Sampling for Streaming KV-Cache Eviction Under Fixed Budgets
- arxiv url: http://arxiv.org/abs/2606.23961v1
- Date: Mon, 22 Jun 2026 21:42:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.694928
- Title: Forget Without Compromise: Nexus Sampling for Streaming KV-Cache Eviction Under Fixed Budgets
- Title(参考訳): 妥協なしの忘れ物 - 固定予算下でKVキャッシュエミッションをストリーミングするためのNexusサンプリング
- Authors: Duc Duong, Hoang Anh Duy Le, Jianwen Xie, Anshumali Shrivastava, Zhaozhuo Xu,
- Abstract要約: 既存のメソッドはすべて同じテンプレートを共有し、ステップごとのダイレクトアテンションスコアと、決定論的のトップ-$K$選択が続く。
そこで本研究では,Nexus スコアをペアリングする学習自由化手法である Nexus Smpling を提案する。
ここでは,Nexus サンプリングが重要なトークンの長期生存において,決定論的のトップ-K$を支配していることを示す。
- 参考スコア(独自算出の注目度): 44.357621398017876
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-context and agentic LLM workloads push the KV cache past any fixed memory budget, forcing the inference stack to permanently evict tokens at every step of a continuous-inference stream. Existing methods all share the same template, a per-step direct-attention score followed by deterministic top-$K$ selection, which converts a single below-cutoff step into an irreversible verdict and permanently erases any subtly important token that direct attention cannot single out from noise. To address this challenge, we propose Nexus Sampling, a training-free eviction method that pairs Nexus scoring, an iterative walk over direct attention that surfaces bridge tokens, with weighted reservoir sampling, which retains tokens with inclusion probability in place of deterministic top-$K$. Theoretically, we show that Nexus Sampling dominates deterministic top-$K$ in long-run survival of subtly important tokens. Empirically, at 80% KV cache eviction, Nexus Sampling matches dense attention within 1% on LongBench while outperforming top-$K$ baselines on retrieval-heavy tasks, with up to 10x smaller per-sequence cache memory.
- Abstract(参考訳): 長期コンテキストおよびエージェントLLMワークロードは、KVキャッシュを固定メモリ予算を超過し、連続推論ストリームのすべてのステップにおいて、推論スタックを恒久的にトークンを削除せざるを得ない。
既存のメソッドはすべて同じテンプレートを共有し、ステップごとのダイレクトアテンションスコアに続き、決定論的のトップ$選択が続く。
この課題に対処するために,Nexus スコアリングと,ブリッジトークンに面した直接の注意を反復的に歩行する,Nexus Smpling と,決定論的トップ$K$の代わりに包摂確率を持つトークンを保持する重み付き貯水池サンプリングを提案する。
理論的には,Nexus Smplingが重要なトークンの長期生存において,決定論的トップ・$K$を支配していることを示す。
実証的には、80パーセントのKVキャッシュ消去で、Nexus SmplingはLongBenchの1%以内の注目度と一致し、検索負荷の高いタスクでは最高$K$ベースラインを上回り、シーケンス毎のキャッシュメモリは最大10倍小さい。
関連論文リスト
- MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference [12.316173390280609]
Transformerベースの言語モデルにおける自動回帰デコーディングは、KVキャッシュに依存している。
KVキャッシュ消去は、キーと値のペアの固定サイズのサブセットを保持し、残りを破棄することでこの問題に対処する。
本稿では, 除去トークン集合上のコンパクトで小型なモーメント統計量を維持するMomentKVを提案する。
論文 参考訳(メタデータ) (2026-06-01T02:08:40Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models [8.323540970510809]
本稿では,新たに復号されたトークン分布の最大エントロピーを,いつ再計算するかを決定するための定コスト信号として利用する,トレーニング不要なKVキャッシュ手法であるEntropyCacheを提案する。
LLaDA-8B-InstructとDream-7B-Instructの実験によると、EntropyCacheは15.2times$-26.4times$標準ベンチマークのスピードアップ、22.4times$-24.1times$-24.1times$。
論文 参考訳(メタデータ) (2026-03-19T04:46:34Z) - ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution [84.41751286055909]
我々は、長文世代におけるどのKVペアを退避させるかを予測する訓練ベースのKVキャッシュ消去フレームワークを開発した。
我々は、マルコフ決定過程としてキャッシュ消去を定式化し、GRPOアルゴリズムを適用し、低エントロピートークンにおける言語モデリング損失の増加を緩和する。
論文 参考訳(メタデータ) (2026-02-03T07:16:51Z) - FASA: Frequency-aware Sparse Attention [56.26881872333624]
本稿では,トークンの重要度を動的に予測することで,クエリ対応のトークン消去を実現する新しいフレームワークであるFASAを提案する。
我々の重要な発見は、小さな「支配的」FCの特定可能なサブセットが、常に注目の頭文字と高い文脈の一致を示すことである。
長いコンテキストのタスクのスペクトル全体にわたって、FASAは全てのトークン放出ベースラインを一貫して上回り、ニアオラクル精度を達成する。
論文 参考訳(メタデータ) (2026-02-03T06:09:06Z) - ProphetKV: User-Query-Driven Selective Recomputation for Efficient KV Cache Reuse in Retrieval-Augmented Generation [22.835149054167122]
本稿では,RAGシナリオに対するユーザクエリ駆動型KVキャッシュ再利用手法であるProphet KVを提案する。
Prophet KVは、ユーザクエリに対するセマンティックな関連性に基づいてトークンを優先順位付けする。
以上の結果から, Prophet KVの完全補充精度は96%-101%であり,再計算率は20%に過ぎなかった。
論文 参考訳(メタデータ) (2026-01-31T09:53:31Z) - Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs [26.951325519894525]
本稿では,軽量保持ゲートを介して各トークンの創出時の本質的な重要性を学習する手法を提案する。
我々は,特に低メモリ環境において,強い信念と学習可能な検索ベースラインを一貫して上回ることを示す。
一部の設定ではフルキャッシュモデルを超えており、選択的な保持が正規化の一形態として機能することを示している。
論文 参考訳(メタデータ) (2025-12-03T00:20:35Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。