論文の概要: Spend Bytes on Breadth: Precision-Count Trade-offs for Decode-Time KV Compression in Long Chain-of-Thought Reasoning
- arxiv url: http://arxiv.org/abs/2610.05685v1
- Date: Mon, 05 Oct 2026 01:56:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.43249
- Title: Spend Bytes on Breadth: Precision-Count Trade-offs for Decode-Time KV Compression in Long Chain-of-Thought Reasoning
- Title(参考訳): ブレッドスでのスペンドバイト:長期連鎖推論におけるデコード時間KV圧縮の精度-コナントトレードオフ
- Abstract要約: 推論モデルは、長いチェーンの思考をデコードしながら、KVキャッシュの大部分を記述します。
デコード時のメソッドは、どのトークンを削除すべきかをほとんど決定します。
固定バイトの予算をキャッシュされたトークンの数とそれらの正確さでどのように分割すべきかを問う。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reasoning models write most of their KV cache while decoding long chains of thought (CoT), so the cache has to be compressed online under a fixed memory budget. Decode-time methods mostly decide which tokens to evict. We ask how a fixed byte budget should be split between the number of cached tokens and their precision. BreadthKV spends the bytes on more tokens at low precision, combining quantization with eviction, and picks the bit-width for each model and budget with a 60-problem end-to-end calibration, since offline attention error does not predict it reliably. On three reasoning models and four math and science benchmarks, it scores above eviction alone in 17 of 18 settings and produces shorter outputs. Much of what eviction loses comes from derailed runs, which keep reasoning until the length cap without reaching an answer. On Qwen3-8B at our tightest budget, eviction sends 91% of AIME samples to the cap and BreadthKV 40%. Under the same protocol, BreadthKV is statistically indistinguishable from a joint rate-distortion allocator (RDKV) that uses 27% more KV memory-time, and it outperforms our re-implementation of ThinKV.
- Abstract(参考訳): 推論モデルは、長いチェーンの思考(CoT)をデコードしながら、ほとんどのKVキャッシュを記述します。
デコード時のメソッドは、どのトークンを削除すべきかをほとんど決定します。
固定バイトの予算をキャッシュされたトークンの数とそれらの正確さでどのように分割すべきかを問う。
BreadthKVは、低精度でより多くのトークンにバイトを費やし、量子化と消去を組み合わせ、各モデルと予算のビット幅を60プロブレムのエンドツーエンドキャリブレーションで選択する。
3つの推論モデルと4つの数学と科学のベンチマークで、18のセッティングのうち17のエクリエーションのみにスコアを付け、より短いアウトプットを生成する。
排除が失われる原因の多くは脱線によるものであり、解答が得られない長さの上限まで推論が続く。
最も厳しい予算でQwen3-8Bでは、EvictionはAIMEサンプルの91%をキャップとBreadthKV 40%に送信します。
同じプロトコルの下では、BreadthKVは27%のKVメモリ時間を使用するジョイントレート歪みアロケータ(RDKV)と統計的に区別できず、ThinKVの再実装よりも優れています。
関連論文リスト
- Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning [78.75986976062454]
大規模言語モデルは、拡張推論を必要とするタスクにおいて優れたパフォーマンスを達成する。
既存のKVキャッシュ圧縮メソッドは、1つのパラダイムを共有している。
選択信号はほとんど役に立たないことを示す。ランダム注意は各アテンションヘッド内でプロンプトと退避者をランダムに保ち、スコアを全く計算しない。
論文 参考訳(メタデータ) (2026-09-03T06:38:38Z) - CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration [67.17709877327232]
ケイトKVは、一貫したヘッドに対して重要なトークン情報のみを保持するハイブリッドKVキャッシュ方式である。
Cate KV はメモリ使用量を最大$2.72 times$に減らし、シングルサンプル入力で$2.18times$に減らした。
論文 参考訳(メタデータ) (2026-08-31T06:02:37Z) - KVpop -- Key-Value Cache Compression with Predictive Online Pruning [22.664867330302517]
我々は,KVpopを導入する。これは,固定予算のKV消去ポリシーを,直接監視することで学習する。
スコアラーは、高密度の注意マップを具体化せずに効率的に計算される、新しい未来の注意対象に対して訓練される。
KVpopは、Qwen3-4Bのフルアテンション性能の98%を75% KVキャッシュ圧縮で、97%を88%圧縮で維持し、確立されたエビクションベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-06T13:32:34Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache [28.54642982960947]
大規模言語モデル(LLM)は様々なタスクにまたがって高い性能を示すが、長い入力コンテキストでの推論はメモリサイズと帯域幅によってボトルネックとなる。
既存のメソッドは、消去または量子化によってキャッシュを減らすが、通常は2つを分離して扱う。
本稿では、KVキャッシュ圧縮をレート歪み問題とみなし、同じビット割り当て方式の2つの端点の消去と量子化を行う。
論文 参考訳(メタデータ) (2026-05-08T15:15:06Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - CaliDrop: KV Cache Compression with Calibration [44.722738059962296]
大規模言語モデル(LLM)は、世代間、かなりの計算資源を必要とする。
このボトルネックを軽減するため、KVキャッシュ圧縮技術が提案されている。
本稿ではトークン排除戦略の強化に焦点をあてる。
論文 参考訳(メタデータ) (2025-07-26T10:34:53Z) - Cache Me If You Can: How Many KVs Do You Need for Effective Long-Context LMs? [79.58770714228983]
言語モデルは、書籍要約のようなタスクに対して、ますます長いコンテキストを扱う。
これによりキーバリュー(KV)キャッシュのメモリコストが増大する。
以前の多くの研究でKVをメモリから外す方法が提案されているが、そのアプローチは好ましい設定に適合している。
KVフットプリント*は、記憶中のKVエントリの量と寿命の両方を考慮し、統一された計量として提案する。
論文 参考訳(メタデータ) (2025-06-20T16:21:12Z) - KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache [67.9776980972508]
我々はKIVIというチューニング不要な2ビットKVキャッシュ量子化アルゴリズムを開発した。
KIVI は Llama, Falcon, Mistral のモデルを $mathbf2.6times$ less peak memory を使用しながらほぼ同じ品質を維持することができる。
論文 参考訳(メタデータ) (2024-02-05T06:06:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。