論文の概要: Trust the Mass: Forced Weights in KV-Cache Eviction
- arxiv url: http://arxiv.org/abs/2608.25230v2
- Date: Fri, 28 Aug 2026 06:26:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 15:11:36.078593
- Title: Trust the Mass: Forced Weights in KV-Cache Eviction
- Title(参考訳): 質量を信頼する:KVキャッシュの判断で強引な重み
- Abstract要約: スパースアテンションやKV-cache-evictionルールはキーのサブセットを保持し、残りを破棄し、保持されたセット上の注意重みを再正規化する。
最大の重量を維持することが既に最適に近いことを示しています。なぜなら、最高のサブセットは、完全な注意を引くための残りのギャップの中央値2ドルから5%ドルしか閉じていないからです。
- 参考スコア(独自算出の注目度): 0.9095465010382021
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Every deployed sparse-attention or KV-cache-eviction rule keeps a subset of the keys, discards the rest, and renormalizes the attention weights over the kept set. Enumerating the exact best subset under that constraint on $168{,}192$ attention rows from five models shows that keeping the largest weights is already near-optimal, since the best subset closes only a median $2$ to $5\%$ of the remaining gap to full attention. If selection closes this little, published margins between eviction methods must come from elsewhere, so we measure the bytes each method holds. In the shared evaluation pipeline, the strongest query-agnostic methods hold the full cache because their per-head selections are stored as masks, and only ragged per-head storage frees that memory. Enforcing a nominal budget on one fixed selection costs $14$ to $62$ benchmark points. We trace an $87.6$-point retrieval margin to rankings computed while the question is visible. ContourKV, a training-free allocator built from the dropped-mass statistic, wins $93$ of $160$ paired comparisons against that state of the art and loses $22$ at the byte count of the budget-enforcing baselines, and it ties the strongest of them.
- Abstract(参考訳): デプロイされたスパースアテンションまたはKV-cache-evictionルールは、キーのサブセットを保持し、残りを破棄し、保持されたセット上の注意重みを再正規化する。
5つのモデルから168{,}192$のアテンション列に、その制約の下で正確な最高のサブセットを列挙すると、最大の重みを保つことは、すでに最適に近い。
選択がこの小さな閉包の場合、各メソッドが保持するバイトを測るためには、他の方法からエビジョンメソッド間のマージンを公表しなければならない。
共有評価パイプラインでは、最強のクエリ非依存メソッドが全キャッシュを保持する。
1つの固定選択に対して、名目上の予算を課すことは、14ドルから62ドルというベンチマークポイントになる。
我々は、質問が目に見える間に計算されたランキングに対して、87.6ドルの検索マージンをたどる。
ContourKVは、下降した質量統計から作られた訓練なしアロケータで、その最先端技術との比較で9,60ドル(約1,300円)の賞金を獲得し、予算強化ベースラインのバイト数で22ドル(約2,300円)の損失を被った。
関連論文リスト
- A certified lower bound on the quantum-capacity threshold of the depolarizing channel [0.0]
クビット偏極チャネルが正の量子容量を保持する下のノイズ閾値は1996年から研究されている。
我々は、この体制において、独立にマシンチェック可能な正の証明を初めて与える。
論文の全ての計算クレームは、依存のない数個の数列線形検証器でチェック可能な、ビッグ整数比較の有限リストに還元される。
論文 参考訳(メタデータ) (2026-08-16T17:35:46Z) - Sub-Quadratic Bisimulation Metrics via Approximate Nearest Neighbors: Coverage-Augmented Guarantees and Computable Two-Sided Certificates [1.2891210250935148]
我々は,境界遷移をサポートするMPPに対して,証明書を搬送するサブクワッドラティックな方法を提案する。
近似アレスト近傍指数は、正確に制限された演算子によって更新されたペアを選択する。
ローカルインデックスの品質だけでは、グローバルエラーを制御できない。
論文 参考訳(メタデータ) (2026-08-07T03:32:40Z) - Recall Before You Rank: Similarity-Guided Top-$K$ Reuse for Efficient Long-Context Attention [4.6833133124119275]
ReTopKは、歴史的検索決定を再利用することで、動的Top-$Kの注意を加速するトレーニングフリーの手法である。
128Kが$K=512$で、ReTopKはExact Top-K$よりも0.50%のパープレキシティアップしか得られず、注意計算は$3.07times$で加速する。
論文 参考訳(メタデータ) (2026-07-30T05:25:23Z) - Top-$k$ Pareto Bandits: Hypervolume Regret for Multi-Objective Slate Selection [48.83076933238825]
我々は,各ラウンドにおいてエージェントが$k$アームのスレートを選択し,それらの$d$次元報酬ベクトルを半帯域フィードバック下で観察する多目的バンディット問題を考える。
この目的を、選択されたアームのサブセットによって誘導される支配的な超体積を通して定式化し、最高のサイズに対して$$$-approximate hypervolume regretを定義する。
ギャップのない後悔境界を持つ$tildeO(dsqrtnkT)$を、ギャップとともにすべてのインスタンスに保持する。
論文 参考訳(メタデータ) (2026-07-28T21:10:39Z) - Forget Without Compromise: Nexus Sampling for Streaming KV-Cache Eviction Under Fixed Budgets [44.357621398017876]
既存のメソッドはすべて同じテンプレートを共有し、ステップごとのダイレクトアテンションスコアと、決定論的のトップ-$K$選択が続く。
そこで本研究では,Nexus スコアをペアリングする学習自由化手法である Nexus Smpling を提案する。
ここでは,Nexus サンプリングが重要なトークンの長期生存において,決定論的のトップ-K$を支配していることを示す。
論文 参考訳(メタデータ) (2026-06-22T21:42:51Z) - Comparison Patrols on Drifting Orders: Certified Rank Maintenance, Evolving Planar Maxima, and Selection under Drifting Fitness [0.2864713389096699]
動的環境におけるランクベースの選択は、使用中に陳腐化する順序情報に作用する。
本稿では,欠落情報層をデータ構造問題として定式化する。
最大$n=65,536$の試験は、証明書、回復法則、平衡挙動、等予算の動的進化ループを監査する。
論文 参考訳(メタデータ) (2026-06-12T23:39:33Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - Sharp Capacity Thresholds in Linear Associative Memory: From Winner-Take-All to Listwise Retrieval [59.859592671274704]
$dtimes d$ リニアメモリストアはいくつのキー値アソシエーションが可能ですか?
この答えは、メモリマトリックスの$d2$自由度だけでなく、検索基準にも依存する。
論文 参考訳(メタデータ) (2026-05-06T17:53:20Z) - First-Order Regret in Reinforcement Learning with Linear Function
Approximation: A Robust Estimation Approach [57.570201404222935]
我々は,大規模状態空間を用いた強化学習において,$mathcalO(sqrtV_1star K)$として,後悔のスケーリングが得られることを示す。
この結果を得るためには,少なくとも2乗推定に基づく既存手法は不十分であることを示す。
論文 参考訳(メタデータ) (2021-12-07T00:29:57Z) - Consistent Structured Prediction with Max-Min Margin Markov Networks [84.60515484036239]
二項分類のためのマックスマージン法は、最大マージンマルコフネットワーク(M3N$)の名前で構造化予測設定まで拡張されている。
我々は、学習問題を"max-min"マージンの定式化で定義し、結果のメソッドmax-minマージンマルコフネットワーク(M4N$)を命名することで、そのような制限を克服する。
マルチクラス分類,順序回帰,シーケンス予測,ランキング実験により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2020-07-02T10:48:42Z) - Coresets for the Nearest-Neighbor Rule [78.15296214629433]
最も近い隣の凝縮は、サブセット$R の部分集合 P$ を見つけることである。
本稿では,最寄りの分類のためのコアセットの概念を紹介する。
そこで我々は,選択した部分集合のサイズを上界として証明可能な2次時間近似アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-02-16T19:00:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。