論文の概要: DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression
- arxiv url: http://arxiv.org/abs/2607.06523v1
- Date: Tue, 07 Jul 2026 17:29:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.609049
- Title: DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression
- Title(参考訳): DepthWeave-KV:長期KVキャッシュ圧縮のためのToken-Adaptive Cross-Layer Residual Factorization
- Authors: Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesus Olivera,
- Abstract要約: DepthWeave-KVはトークン適応型キャッシュ圧縮手法で、近隣のトランスフォーマー層にまたがるキーと値の状態を分解する。
DepthWeave-KVは、メモリ使用量を大幅に削減した、ほぼ完全なタスク品質を実現する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-context language model inference is increasingly limited by the memory bandwidth and capacity required to store key-value caches, yet existing compression methods often apply uniform budgets across layers or tokens and degrade retrieval when lexical cues and semantic states require different preservation. We introduce DepthWeave-KV, a token-adaptive cache compression method that factorizes key and value states across neighboring transformer layers using shared low-rank channel bases while retaining lightweight token-specific residuals where attention behavior is sensitive. DepthWeave-KV combines cross-depth residual factorization with a token-conditional depth router that allocates higher reconstruction rank to instruction-bearing and retrieval-critical tokens, and uses calibration-free online error tracking from attention-output probes to adapt compression during generation without retraining the base model. A fused CUDA implementation jointly performs basis lookup, residual dequantization, and attention projection to reduce decode-time memory traffic. Across LongBench, Needle-in-a-Haystack, L-Eval, and long-form QA and summarization benchmarks, DepthWeave-KV achieves near-full-cache task quality with substantially lower memory use, improving average score and retrieval accuracy over prior compressed caches while reaching 8.3x KV memory reduction and 72.8 tokens per second at 64K context.
- Abstract(参考訳): 長文言語モデル推論は、キーバリューキャッシュを保存するために必要なメモリ帯域幅とキャパシティによってますます制限されているが、既存の圧縮手法では、レイヤやトークン間で均一な予算を適用し、語彙的なキューやセマンティックステートが異なる保存を必要とする場合、検索を低下させることが多い。
DepthWeave-KVは,注目行動に敏感な軽量なトークン固有残差を保持しつつ,共有低ランクチャネルベースを用いて隣接するトランスフォーマー層にまたがるキー状態と値状態を分解する,トークン適応型キャッシュ圧縮手法である。
DepthWeave-KVは、クロスディープス残差分解とトークン条件深度ルータを組み合わせることで、命令付きおよび検索クリティカルトークンに高い再構成ランクを割り当て、アテンションアウトプットプローブからのキャリブレーションなしオンラインエラートラッキングを使用して、ベースモデルをトレーニングすることなく、生成時に圧縮を適応する。
融合CUDA実装は、デコード時間メモリトラフィックを低減するために、ベースルックアップ、残留復調、アテンションプロジェクションを共同で行う。
LongBench, Needle-in-a-Haystack, L-Eval, long-form QA and summarization benchmarks, DepthWeave-KVは、メモリ使用量を大幅に削減し、64Kコンテキストで8.3倍のKVメモリ削減と72.8トークンに到達しながら、前回の圧縮キャッシュよりも平均スコアと精度を向上させる。
関連論文リスト
- FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference [0.0]
FreqDepthKVは、隣接層KV状態を共有低周波深さ成分とスパース高周波残差に分解する推論時キャッシュ圧縮法である。
軽量なオンラインプローブは、リコンストラクションに敏感なアテンションログへの貢献に応じて、アテンションヘッドを共有深度、残留深度、または正確なキャッシュモードに割り当てる。
FreqDepthKVは、長いコンテキストの質問応答、針の検索、要約、コード生成ベンチマークを通じて、かなり小さなキャッシュ予算の下でタスクの正確性を保持する。
論文 参考訳(メタデータ) (2026-07-07T17:26:28Z) - Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing [29.913403615975174]
高いスループットでトランスフォーマー言語モデルを実行するには、冗長な計算を避けるためにキーバリュー(KV)をキャッシュする必要がある。
KVキャッシュのメモリフットプリントは著しく、サービスコストに大きな影響を与えます。
本稿では,ランダムな層間注意(ランダムな層間注意,ランダムな層間注意,ランダムな層間注意)を提案する。
論文 参考訳(メタデータ) (2026-04-03T14:56:17Z) - EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction [55.026048429595384]
EchoKVは、標準と圧縮された推論間のオンデマンド移行を可能にする柔軟なKVキャッシュ圧縮スキームである。
高速で低コストなトレーニングを可能にする2段階の微調整戦略を導入する。
論文 参考訳(メタデータ) (2026-03-24T07:58:42Z) - KVReviver: Reversible KV Cache Compression with Sketch-Based Token Reconstruction [20.53279247581787]
スケッチアルゴリズムに基づく可逆的なKVキャッシュ圧縮手法であるKVReviverを提案する。
2kのコンテキストでは、同じエンドツーエンドの推論精度を維持しながら、KVキャッシュの予算の10%しか必要としない。
32kのコンテキストでは、同等または同等の精度の2%の精度の損失を達成する。
論文 参考訳(メタデータ) (2025-12-01T03:59:20Z) - KVCompose: Efficient Structured KV Cache Compression with Composite Tokens [7.922206020386125]
大規模言語モデル(LLM)は、効率的な自己回帰復号化のためにキー値(KV)キャッシュに依存している。
我々は,注意誘導型,層適応型複合トークンに基づく,シンプルで効果的なKVキャッシュ圧縮フレームワークを提案する。
本手法は精度を保ちながらメモリの大幅な削減を実現し,従来手法と半構造化手法を一貫して上回っている。
論文 参考訳(メタデータ) (2025-09-05T14:58:24Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。