論文の概要: ARC-KV: Amortizing Anchor Search for Reconstruction-Based KV Cache Compaction
- arxiv url: http://arxiv.org/abs/2609.36835v1
- Date: Tue, 29 Sep 2026 06:45:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.244933
- Title: ARC-KV: Amortizing Anchor Search for Reconstruction-Based KV Cache Compaction
- Title(参考訳): ARC-KV:再構築型KVキャッシュ圧縮のためのアンカー検索の高速化
- Abstract要約: 長文大言語モデル推論は、列長とともに線形に成長するKVキャッシュによってボトルネックされる。
ARC-KVは, この原理に従う新しいKVキャッシュ圧縮法である。
Qualityの10%のKV保持では、ARC-KVはAttention Matchingの精度を0.6409から0.6474に改善し、圧縮時間を25.73に短縮する。
- 参考スコア(独自算出の注目度): 10.459643108213085
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context large language model inference is bottlenecked by KV caches that grow linearly with sequence length. This burden is especially severe for long, reusable context prefixes, whose cache must serve many downstream queries. Reconstruction-based methods such as Attention Matching achieve strong downstream task performance with compact KV caches. However, iterative anchor search dominates the compaction cost of OMP-based Attention Matching. This motivates our selective amortization principle of learning a reusable anchor-selection policy across contexts while retaining context-specific reconstruction. In this work, we propose ARC-KV, a novel reconstruction-based KV cache compaction method that follows this principle. To this end, we first train a value-aware indexer to select real-key anchors in a single scoring pass. ARC-KV then applies convex-hull-constrained key merging and fits an attention-mass bias and compact values against the full cache. At inference time, ARC-KV builds the compact cache once per context using the frozen indexer and reuses it for all subsequent queries. Extensive experiments demonstrate that ARC-KV outperforms reported compaction methods in most settings across QuALITY, RULER, and LongBench on Llama-3.1-8B-Instruct. In particular, at 10% KV retention on QuALITY, ARC-KV improves accuracy from 0.6409 to 0.6474 over Attention Matching while reducing compaction time by a factor of 25.73, from 959.8 s to 37.3 s.
- Abstract(参考訳): 長文大言語モデル推論は、列長とともに線形に成長するKVキャッシュによってボトルネックされる。
この負担は、キャッシュが多くのダウンストリームクエリに対応しなければならない、長く再利用可能なコンテキストプレフィックスに対して特に深刻です。
Attention Matchingのようなリコンストラクションベースの手法は、コンパクトなKVキャッシュで強力なダウンストリームタスク性能を実現する。
しかし、反復アンカー探索は、OMPベースのアテンションマッチングの圧縮コストを支配している。
このことは、コンテキスト固有の再構築を維持しながら、コンテキスト間で再利用可能なアンカー選択ポリシーを学ぶという、我々の選択的な償却原則を動機付けている。
そこで本研究では, ARC-KVという, この原理に従う新しいKVキャッシュ圧縮法を提案する。
この目的のために、まずバリュー認識インデクサをトレーニングし、1つのスコアパスで実際のキーアンカーを選択する。
ARC-KVはコンベックスに制約のあるキーマージを適用し、フルキャッシュに対して注目質量バイアスとコンパクト値に適合する。
推論時にARC-KVは、凍結インデックス装置を使用してコンテキスト毎に1回だけコンパクトキャッシュを構築し、その後の全てのクエリに再利用する。
大規模な実験により、ARC-KVは、Llama-3.1-8B-インストラクト上で、QuALITY、RULER、LongBenchのほとんどの設定において圧縮方法よりも優れていたことが示されている。
特に、Quality上の10%のKV保持では、ARC-KVは注意マッチングよりも0.6409から0.6474に精度を向上し、圧縮時間を25.73倍に短縮し、959.8秒から37.3秒に短縮する。
関連論文リスト
- Distance-KV: Exploiting Relative Distance for Efficient Long-Context Inference [31.161219222638294]
本稿では,レイヤ,アテンションヘッド,相対距離の結合空間上で静的なKV保持パターンを学習するDistance-KVを紹介する。
3つのバックボーンモデルと4つの長期コンテキストベンチマークで、Distance-KVは一貫して最高のパフォーマンスを実現している。
128KのLlama-3.1-8B-Instructでは、Distance-KVはKVキャッシュメモリを65.4%削減し、Denseと比較して1.66Times$デコードスピードアップを達成する。
論文 参考訳(メタデータ) (2026-09-26T14:20:58Z) - SGD-KV: Summarization Guided KV Cache Compression [21.816110519918876]
大規模言語モデル(LLM)は、線形に増大するキー値(KV)キャッシュのため、長いコンテキスト推論において深刻なメモリボトルネックに直面している。
SGD-KVは,階層的情報集約に特有な注意ヘッドを体系的に識別し,優先するために,新しいチャンク要約診断タスクを活用する,頭部認識フレームワークである。
以上の結果から,KVキャッシュ予算を注目ヘッドの総和スコア分布に基づいて戦略的に割り当てることにより,長文推論における効率・精度のトレードオフが良好であることが示唆された。
論文 参考訳(メタデータ) (2026-09-03T00:31:11Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - Sparse Attention across Multiple-context KV Cache [8.236266965773465]
推論効率を改善するために、履歴キーバリュー(KV)キャッシュを再利用することは、主流のアプローチとなっている。
近年の進歩は、KVキャッシュを選択できるスパースアテンション機構によってスループットをさらに向上させる。
本論文では,マルチコンテキストKVキャッシュにおける注意スペーシフィケーションの最初の調査であるSamKVについて述べる。
論文 参考訳(メタデータ) (2025-08-06T02:53:14Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction [37.97434606840326]
トランスフォーマーベースの大規模言語モデル(LLM)は、推論中にキー値(KV)ペアとしてキャッシュコンテキストを持つ。
コンテキストの長さが大きくなると、KVキャッシュのサイズが拡大し、メモリオーバーヘッドが大きくなり、注意の遅延が増大する。
本稿では,クエリに依存しないKVキャッシュ消去手法であるKVzipを紹介する。
論文 参考訳(メタデータ) (2025-05-29T13:05:47Z) - DBudgetKV: Dynamic Budget in KV Cache Compression for Ensuring Optimal Performance [125.81664663201282]
我々はDBudgetKVと呼ばれる新しいKVキャッシュ圧縮手法を提案する。
残りのKVキャッシュがフルキャッシュのパフォーマンスにマッチしない場合、注意ベースのメトリクスが特徴である。
提案手法は, 平均圧縮率25%を超え, 無損失KVプルーニングを効果的かつ堅牢に実現している。
論文 参考訳(メタデータ) (2025-02-24T06:33:39Z) - PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling [38.732413451399]
ピラミッドKVは新規かつ効果的なKVキャッシュ圧縮法である。
提案手法は,KVキャッシュの12%しか保持せず,完全なKVキャッシュでモデルの性能と一致していることを示す。
Needle-in-a-Haystack実験では、Praamid KVは長文理解の維持において競合する手法より優れている。
論文 参考訳(メタデータ) (2024-06-04T07:51:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。