論文の概要: Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
- arxiv url: http://arxiv.org/abs/2609.03430v1
- Date: Thu, 03 Sep 2026 06:38:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.948521
- Title: Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
- Title(参考訳): ランダムアテンション:効率的な推論のためのKVキャッシュエミッションの再考
- Abstract要約: 大規模言語モデルは、拡張推論を必要とするタスクにおいて優れたパフォーマンスを達成する。
既存のKVキャッシュ圧縮メソッドは、1つのパラダイムを共有している。
選択信号はほとんど役に立たないことを示す。ランダム注意は各アテンションヘッド内でプロンプトと退避者をランダムに保ち、スコアを全く計算しない。
- 参考スコア(独自算出の注目度): 78.75986976062454
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models achieve superior performance on tasks that require extended reasoning, but long chains of thought make the KV cache a severe memory bottleneck. Existing KV cache compression methods share one paradigm: score each cached token by some estimate of how much it will matter later, and keep the top-scoring ones. We show that the selection signal contributes almost nothing. Random Attention keeps the prompt and evicts uniformly at random within each attention head, computing no score at all; across four models and six reasoning tasks it matches the strongest prior evictor while serving 32-43% higher throughput than it in vLLM deployment. Controlled experiments explain this by showing that 1) the prompt is the fragile part of the cache, and most of the gap between selectors is just whether their selection signal happened to keep it; 2) the reasoning trace protects itself against eviction with redundancy at two levels, in the text (the model restates what it still needs as it works) and across attention heads (each keeps its own copy of the trace), so once the prompt is safe, a random draw retains enough copies of what the model still needs, and no score is required to pick them. Our code is publicly available at https://github.com/SalesforceAIResearch/Random-Attention.
- Abstract(参考訳): 大規模言語モデルは、拡張推論を必要とするタスクにおいて優れたパフォーマンスを達成するが、長いチェーンの思考により、KVキャッシュは深刻なメモリボトルネックとなる。
既存のKVキャッシュ圧縮メソッドは、1つのパラダイムを共有している。
選択信号はほとんど役に立たないことを示す。
ランダム注意(Random Attention)は、各アテンションヘッド内のプロンプトとエビデットをランダムに保ち、4つのモデルと6つの推論タスクで、vLLMデプロイメントよりも32~43%高いスループットを提供する。
制御された実験はそれを示して説明します
1) プロンプトはキャッシュの脆弱な部分であり,セレクタ間のギャップの大部分は,その選択信号がそれを保持しているかどうかに過ぎません。
2) 推論トレースは、テキスト(モデルが動作しているときに必要となるものを保留する)と注目ヘッド(それぞれがトレースの独自のコピーを保持する)の2段階の冗長性による排除から保護されているため、プロンプトが安全であれば、ランダムドローはモデルがまだ必要とするものを十分なコピーを保持し、それらを選択するためのスコアは不要である。
私たちのコードはhttps://github.com/SalesforceAIResearch/Random-Attention.comで公開されています。
関連論文リスト
- Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Value-Aware Stochastic KV Cache Eviction for Reasoning Models [34.29227693805387]
推論モデルは思考のチェーンを拡張して精度を向上させるが、その長い出力はメモリと計算のボトルネックを生み出す。
KVキャッシュ消去法は、重要でないキーと値のペアをキャッシュから排除することで、このコストを削減するが、選択に基づくスパースアテンションの代替よりも、しばしば精度が低下する。
本稿では,大容量値状態の保護と多様な消去決定を促進するトレーニング不要なレシピであるバリューアウェアなKVキャッシュ消去(VaSE)を提案する。
論文 参考訳(メタデータ) (2026-06-02T17:16:33Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - Neural Garbage Collection: Learning to Forget while Learning to Reason [36.674101487378245]
ニューラルガベージコレクション(Neural Garbage Collection)では、言語モデルが推論を学習しながら忘れることを学ぶ。
言語モデルからサンプリングした離散的なアクションとして、チェーン・オブ・シンクとキャッシュ消去決定におけるトークンを扱い、強化学習を用いてモデルの理由を協調的に最適化することができる。
Countdown, AMC, AIMEタスクでは, NGCは2~3倍のピークKVキャッシュサイズ圧縮において, フルキャッシュ上限に対して高い精度を維持している。
論文 参考訳(メタデータ) (2026-04-20T09:26:28Z) - G-KV: Decoding-Time KV Cache Eviction with Global Attention [57.47409249054187]
大規模言語モデル(LLM)は複雑なタスクに優れるが、長いシーケンス長のため、計算とメモリの重大な課題に遭遇する。
KVキャッシュ圧縮は推論の効率を大幅に向上させる効果的な手法として登場した。
本稿では,グローバルスコアリング機構を用いたKVキャッシュ消去手法であるG-KVを提案する。
論文 参考訳(メタデータ) (2025-11-29T14:21:33Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning [21.761205124793175]
拡張推論シーケンスでは、キー値(KV)キャッシュの増加によるGPUメモリオーバーヘッドが大幅に増加する。
既存のKVキャッシュ圧縮手法は、メモリボトルネックを軽減するが、長い推論タスクに苦労する。
トークンの繰り返しパターンに基づいた優先順位付けによる遅延繰り返しトークンを保持する観測窓ベースのラッチ消去フレームワークであるLazyEvictionを提案する。
論文 参考訳(メタデータ) (2025-06-19T02:25:04Z) - AttentionPredictor: Temporal Patterns Matter for KV Cache Compression [64.75459635661562]
我々は,KVキャッシュ圧縮とクリティカルトークン識別のための注意パターンを直接予測する,学習に基づく最初の手法であるAttentionPredictorを提案する。
AttentionPredictorは、注意スコアを正確に予測し、無視可能なメモリを消費する統一予測モデルを共有する。
注意情報の大半を保持することで、AttentionPredictorは、キャッシュオフロードシナリオで13$times$KVキャッシュ圧縮と5.6$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2025-02-06T13:41:46Z) - RazorAttention: Efficient KV Cache Compression Through Retrieval Heads [11.708388082001074]
トークン情報を全て保存するキーバリューキャッシュのための新しい圧縮手法を提案する。
RazorAttentionは、パフォーマンスに顕著な影響を与えずに、KVキャッシュサイズを70%以上削減する。
論文 参考訳(メタデータ) (2024-07-22T01:12:23Z) - CORM: Cache Optimization with Recent Message for Large Language Model Inference [57.109354287786154]
メモリフットプリントを大幅に最小化するKVキャッシュを最適化する革新的な手法を提案する。
KVキャッシュ消去ポリシーであるCORMは、モデル微調整を必要とせずに、推論に必要なキーと値のペアを動的に保持する。
検証の結果,CORMはKVキャッシュの推論メモリ使用量を最大70%削減し,LongBenchの6つのタスクで性能劣化を無視できることがわかった。
論文 参考訳(メタデータ) (2024-04-24T16:11:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。