論文の概要: Shared Global KV with Layer-Specific Local History
- arxiv url: http://arxiv.org/abs/2609.28006v1
- Date: Wed, 23 Sep 2026 12:33:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.017664
- Title: Shared Global KV with Layer-Specific Local History
- Title(参考訳): 層状局所履歴を持つ共有グローバルKV
- Abstract要約: 共有グローバルKVとともにローカルメモリが保持すべきものについて検討する。
2系統の研究では、現在の局所枝より約1.4%低い保持テストパープレキシティが地域史と一致している。
完全キャッシュを正確な演算で保ちながら上層建設作業を減らすのに十分な接尾辞スケジュールを導出する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Decoder-only Transformer language models cache keys and values (KV) to reuse past computation during generation. Sharing KV across layers saves storage but reduces the diversity of representations available across depth. We study what local memory should retain alongside shared global KV, separating historical content from the input source used to form it. At 126M parameters and 2K context, an eight-seed study finds about 1.4% lower held-out test perplexity with local history than with a current-token local branch. Capacity, entry-count and training-compute controls support the value of historical content. In a two-seed comparison, this value persists when adjacent layers share local inputs while retaining independent projections; source sharing also shortens exact cache-construction dependencies. Against GQA and adjacent-layer KV sharing, equal bounded learning-rate searches and new-seed confirmation yield better same-source likelihood with larger caches and higher long-request latency. The ordering against adjacent-layer sharing persists after equal-token adaptation to 8K, with a short-context cost. The eight-seed external-book history effect remains uncertain, and downstream outcomes vary by task. We derive a sufficient suffix schedule that reduces upper-layer construction work while preserving the complete cache in exact arithmetic.
- Abstract(参考訳): デコーダのみのTransformer言語は、キャッシュキーと値(KV)をモデルにして、生成時に過去の計算を再利用する。
レイヤ間でKVを共有することはストレージを節約するが、奥行きで利用可能な表現の多様性を減らす。
我々は,共有グローバルKVとともにローカルメモリが保持すべきものについて検討し,その形成に使用する入力源から履歴コンテンツを分離する。
126Mパラメータと2Kコンテキストでは、現在の局所分岐よりも約1.4%低い保留テストパープレキシティが局所履歴と一致する。
キャパシティ、エントリーカウント、トレーニング計算コントロールは、過去のコンテンツの価値をサポートする。
2シード比較では、この値は、隣接するレイヤが独立したプロジェクションを保持しながらローカル入力を共有するときに持続する。
GQAと隣接層KVの共有に対して、等式付き学習レート検索と新種確認により、キャッシュが大きくなり、長時間要求レイテンシが高くなることにより、同一ソースの可能性も向上する。
隣接層共有に対する順序付けは、8Kへの等額適応後の短文コストで継続する。
8シリーズの外部ブック履歴効果は依然として不確実であり、ダウンストリームの結果はタスクによって異なる。
完全キャッシュを正確な演算で保ちながら上層建設作業を減らすのに十分な接尾辞スケジュールを導出する。
関連論文リスト
- HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models [10.767250624894665]
長文推論はデコード中にキー値(KV)キャッシュを増大させる。
このボトルネックは、残余のグローバルアテンション層がコンテキスト依存のキャッシュ需要を支配しているため、ハイブリッド言語モデルに残っています。
我々は、ハイブリッド言語モデルの残余グローバルKVキャッシュを圧縮する訓練不要のフレームワークであるHeadWiseKVを紹介する。
論文 参考訳(メタデータ) (2026-09-02T02:59:11Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion [59.207505503284715]
FadeMemは、歴史的なKVブロックを固定キャッシュ予算の下で時間階層に整理する。
新しい歴史はきめ細かいエントリとして挿入され、古い隣のエントリは徐々にマージされる。
実験では、既存の有界キャッシュ戦略よりも、被験者の一貫性、背景安定性、時間的コヒーレンスが改善された。
論文 参考訳(メタデータ) (2026-06-09T10:22:18Z) - DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse [30.48395228595732]
KVLinkは、大規模言語モデル(LLM)における効率的なキー値(KV)キャッシュ再利用のためのアプローチである。
KVLinkは、連結後のグローバルな位置と一致するように、推論時にKVキャッシュの位置埋め込みを調整することと、自己注意を回復するためにトレーニング可能な特別なトークンを使用することである。
7つのデータセットにわたる実験によると、KVLinkは最先端の手法よりも平均4%の精度で質問応答を改善する。
論文 参考訳(メタデータ) (2025-02-21T23:34:29Z) - SCBench: A KV Cache-Centric Analysis of Long-Context Methods [61.025422435235456]
KVキャッシュ中心の視点から長文の手法を評価するベンチマークであるSCBenchを紹介する。
我々は、Gated Linear RNNsやMamba-Attention Hybridsを含む8つのカテゴリの長期コンテキストソリューションについて、広範なKVキャッシュ中心の分析を行う。
本研究は,O(n)メモリとサブO(n2)プリフィルによるスパース符号化が堅牢に動作する一方で,サブO(n)メモリ手法がマルチターンシナリオに悩まされていることを示す。
論文 参考訳(メタデータ) (2024-12-13T17:59:52Z) - KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing [58.29726147780976]
我々は,層間をKVキャッシュで共有し,層間圧縮を実現する,textit KVSharerと呼ばれるプラグアンドプレイ方式を提案する。
実験の結果、textit KVSharerはKVキャッシュの計算を30%削減し、メモリ消費を削減できることがわかった。
我々は,textit KVSharerが既存の層内KVキャッシュ圧縮手法と互換性があることを検証する。
論文 参考訳(メタデータ) (2024-10-24T08:06:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。