論文の概要: SemPIC: Learning Semantic Position-Independent KV Caches
- arxiv url: http://arxiv.org/abs/2607.28069v1
- Date: Thu, 30 Jul 2026 11:45:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.541457
- Title: SemPIC: Learning Semantic Position-Independent KV Caches
- Title(参考訳): SemPIC: 意味的位置に依存しないKVキャッシュの学習
- Abstract要約: emphSemPICはLoRA対応のWriterをトレーニングし、ネイティブなレイヤごとのドキュメントKVを振る舞いの蒸留を通じてコンパイルする。
KV Gradient Checkpointing – キャッシュされたKVをスレッディングすることなく、ピークトレーニングメモリを削減する。
- 参考スコア(独自算出の注目度): 26.14495003304512
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context retrieval and agentic workloads repeatedly reuse the same documents under changing instructions, histories, and document orders. Prefix caching cannot exploit this reuse, while position-independent caching (PIC) remains unreliable because independently compiled KV states lack the future context in which they will be consumed. Our diagnostics show that a learned boundary-conditioned baseline sharply reduces attention deviation near reusable-block boundaries but leaves interior and task-level residuals, motivating adaptation of the document representation itself. We present \emph{SemPIC}, which trains a LoRA-enabled Writer to compile native per-layer document KVs through behavioral distillation while retaining the pretrained decoder as an unchanged Reader. Adaptation is confined to offline cache construction, preserving the standard KV interface and cache-hit decoding path. We further introduce KV Gradient Checkpointing, which reduces peak training memory without severing gradients through cached KVs. Across three models and four tasks, SemPIC raises mean micro-F1 over KV Packet from 0.53 to 0.60, approaching Full Recompute at 0.62.
- Abstract(参考訳): 長いコンテキストの検索とエージェントのワークロードは、変更命令、履歴、文書命令の下で同じドキュメントを繰り返し再利用する。
プリフィックスキャッシュは、この再利用を利用できないが、独立してコンパイルされたKV状態には、それらが消費される将来のコンテキストがないため、位置独立キャッシング(PIC)は信頼性が低い。
我々の診断では、学習された境界条件ベースラインは再利用可能なブロック境界付近の注意ずれを著しく低減するが、内部とタスクレベルの残差を残し、文書表現自体の適応を動機付けている。
本稿では,LoRA対応のWriterをトレーニングして,事前学習したデコーダを変化しないリーダとして保持しながら,動作蒸留を通じてネイティブなレイヤごとのドキュメントKVをコンパイルする。
適応はオフラインキャッシュの構成に限られており、標準のKVインターフェースとキャッシュヒット復号パスを保存する。
さらにKVグラディエントチェックポイントを導入し、キャッシュされたKVを介さずにピークトレーニングメモリを削減する。
3つのモデルと4つのタスクで、SemPICはKV Packet上の平均マイクロF1を0.53から0.60に引き上げ、Full Recomputeに0.62で接近した。
関連論文リスト
- RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention [20.633983983180812]
LLMサービスのためのヘッドアウェアKVキャッシュ管理システムであるRedKnotを提案する。
RedKnotは、KVヘッドに沿ってKVキャッシュを分解することで、従来のモノリシックなKVキャッシュの抽象化を破る。
論文 参考訳(メタデータ) (2026-06-04T14:57:07Z) - GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs [97.36238579001544]
コンテキスト長が拡張された大規模言語モデル(LLM)は、キー値(KV)キャッシュに依存して、以前のトークンに対する注意をサポートする。
KVキャッシュを維持することは、KVキャッシュ圧縮メソッドを動機付け、かなりのメモリオーバーヘッドを引き起こす。
GRKVは,圧縮キャッシュとフルキャッシュのアテンション出力の差を直接最小化する,トレーニング不要なKV-cacheマージ手法である。
論文 参考訳(メタデータ) (2026-05-29T10:16:30Z) - KV-RM: Regularizing KV-Cache Movement for Static-Graph LLM Serving [6.997204534634303]
静的グラフLLMデコーダの下でKV-cache動作を規則化するランタイム設計であるKV-RMを提案する。
KV-RMは、静的グラフベースラインに対する混合長復号スループットとテール遅延を改善する。
論文 参考訳(メタデータ) (2026-05-10T20:10:26Z) - KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs [11.980880525012056]
大規模言語モデルは、推論遅延を最小限に抑えるためにキーバリュー(KV)キャッシングに大きく依存する。
CacheBlend、EPIC、SAM-KVといった既存のソリューションは、トークンのサブセットを選択的に再計算することでこの問題を軽減する。
我々は,KV Packetを提案する。KV Packetは,キャッシュされた文書を,軽量なトレーニング可能なソフトトーケンアダプタでラップした不変パケットとして扱う,再計算不要なキャッシュ再利用フレームワークである。
論文 参考訳(メタデータ) (2026-04-14T18:50:47Z) - DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - Cache Me If You Can: How Many KVs Do You Need for Effective Long-Context LMs? [79.58770714228983]
言語モデルは、書籍要約のようなタスクに対して、ますます長いコンテキストを扱う。
これによりキーバリュー(KV)キャッシュのメモリコストが増大する。
以前の多くの研究でKVをメモリから外す方法が提案されているが、そのアプローチは好ましい設定に適合している。
KVフットプリント*は、記憶中のKVエントリの量と寿命の両方を考慮し、統一された計量として提案する。
論文 参考訳(メタデータ) (2025-06-20T16:21:12Z) - KeepKV: Eliminating Output Perturbation in KV Cache Compression for Efficient LLMs Inference [16.53643930310808]
KeepKVは、厳しいメモリ制約下で性能を保ちながら出力摂動を排除するために設計された、新しい適応KVキャッシュマージ手法である。
KeepKVはメモリ使用量を大幅に削減し、推論スループットを2倍以上に向上し、10%のKVキャッシュ予算でも優れた生成品質を維持している。
論文 参考訳(メタデータ) (2025-04-14T06:58:00Z) - KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse [30.48395228595732]
KVLinkは、大規模言語モデル(LLM)における効率的なキー値(KV)キャッシュ再利用のためのアプローチである。
KVLinkは、連結後のグローバルな位置と一致するように、推論時にKVキャッシュの位置埋め込みを調整することと、自己注意を回復するためにトレーニング可能な特別なトークンを使用することである。
7つのデータセットにわたる実験によると、KVLinkは最先端の手法よりも平均4%の精度で質問応答を改善する。
論文 参考訳(メタデータ) (2025-02-21T23:34:29Z) - KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing [58.29726147780976]
我々は,層間をKVキャッシュで共有し,層間圧縮を実現する,textit KVSharerと呼ばれるプラグアンドプレイ方式を提案する。
実験の結果、textit KVSharerはKVキャッシュの計算を30%削減し、メモリ消費を削減できることがわかった。
我々は,textit KVSharerが既存の層内KVキャッシュ圧縮手法と互換性があることを検証する。
論文 参考訳(メタデータ) (2024-10-24T08:06:41Z) - PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling [38.732413451399]
ピラミッドKVは新規かつ効果的なKVキャッシュ圧縮法である。
提案手法は,KVキャッシュの12%しか保持せず,完全なKVキャッシュでモデルの性能と一致していることを示す。
Needle-in-a-Haystack実験では、Praamid KVは長文理解の維持において競合する手法より優れている。
論文 参考訳(メタデータ) (2024-06-04T07:51:30Z) - Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs [82.08922896531618]
大規模言語モデル(LLM)における生成推論のメモリフットプリントを削減するプラグイン・アンド・プレイ方式である適応KVキャッシュ圧縮を導入する。
我々は,アテンションモジュールの本質的な構造を明らかにするために,ターゲットプロファイリングを行う。
認識された構造に基づいて、我々はKVキャッシュを適応的に構築する: 注意頭上の長距離コンテキストを排除し、局所的なコンテキストを強調し、特別なトークンを中心とした注意頭上の特別なトークンを排除し、すべてのトークンに広く参加する注目頭に対して標準のKVキャッシュのみを使用する。
論文 参考訳(メタデータ) (2023-10-03T05:17:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。