論文の概要: ImpactHO: Importance-Aware KV Cache Transfer for Multi-User Edge LLM Handover
- arxiv url: http://arxiv.org/abs/2608.10545v1
- Date: Tue, 11 Aug 2026 06:37:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.929413
- Title: ImpactHO: Importance-Aware KV Cache Transfer for Multi-User Edge LLM Handover
- Title(参考訳): ImpactHO:マルチユーザエッジLLMハンドオーバにおけるKVキャッシュ転送の重要性
- Abstract要約: 同時ハンドオーバはバックホールを飽和させ、モビリティが付与された転送ウィンドウ内で完全なキャッシュ配信を防止する。
我々は、各ユーザのKVキャッシュを重要度で注文し、最も情報性の高い分数だけを送信し、トークンレベルのスパーシリティを通信節約に変換する。
提案したアロケータは500msの転送ウィンドウで平均93.7%以上の精度を達成し、フルキャッシュ天井の0.5pp以内で、透視上界の98.2-99.5%に達する。
- 参考スコア(独自算出の注目度): 28.862451597563858
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Edge LLMs must preserve inference continuity when a user hands over between edge nodes, requiring key-value (KV) cache transfer to the target node. However, simultaneous handovers saturate the backhaul, preventing full cache delivery within the mobility-imposed transfer window. Rather than allocating bandwidth as if all cache entries were equally valuable, we order each user's KV cache by importance and transmit only its most informative fraction, turning token-level sparsity into communication savings. We cast the transfer as a multi-user backhaul allocation problem that maximizes average accuracy across users. Each user's partial-cache accuracy serves as its utility: a sigmoid that fits measurements on the RULER benchmark with $R^2>0.99$ across models and context lengths. Because importance ordering front-loads the high-value entries, the concave region of the accuracy curve spans nearly the entire cache. Our proposed allocator keeps served users within this region, making each per-slot allocation problem convex. The optimum is derived via a closed-form weighted water-filling solution that generalizes information-theoretic water-filling and enables online scheduling. The proposed allocator attains over 93.7% average accuracy in a 500ms transfer window, within 0.5pp of the full-cache ceiling, and reaches 98.2-99.5% of a clairvoyant upper bound.
- Abstract(参考訳): エッジLLMは、ユーザがエッジノード間でハンドオーバする場合、ターゲットノードへのキー値(KV)キャッシュ転送を必要とする場合に、推論の連続性を保たなければならない。
しかし、同時ハンドオーバはバックホールを飽和させ、モビリティが付与された転送ウィンドウ内で完全なキャッシュ配信を防止する。
すべてのキャッシュエントリが等しく価値があるように帯域幅を割り当てるのではなく、各ユーザのKVキャッシュを重要度で順序付けし、最も情報性の高い分数だけを送信し、トークンレベルの間隔を通信の節約に変換する。
ユーザ間の平均精度を最大化するマルチユーザバックホール割り当て問題として,転送をキャストした。
RULERベンチマークで測定値に適合し、R^2>0.99$のモデルとコンテキスト長をまたいだシグマノイドである。
高い値のエントリをフロントロードする重要性のため、精度曲線の凹部領域はキャッシュ全体のほぼ全域にまたがる。
提案するアロケータは,各スロット割り当て問題を凸化させて,この領域内でユーザをサービスする。
最適条件は、情報理論的な水充填を一般化し、オンラインスケジューリングを可能にする、クローズドフォームの重み付き水充填ソリューションによって導出される。
提案したアロケータは500msの転送ウィンドウで平均精度93.7%、フルキャッシュ天井の0.5pp以内に到達し、透視上界の98.2-99.5%に達する。
関連論文リスト
- CacheBridge: Efficient Cross-Model KV Cache Transfer [12.058564378845373]
フルヘッドマッピングは、ターゲットのKVヘッドを各ソースのKVヘッドから選択したレイヤにマッピングすることで、アーキテクチャ上の違いに敏感な転送品質を実現する。
CacheBridgeは、アーキテクチャインデクシングされたマッパーサポート、アテンションアラインなキャリブレーション、バウンダリされたマッパー構築を共同設計する。
Qwen3 $14mathrmBto32mathrmB$では、マッパーストレージを8times$に減らし、アプリケーションを3.0times$に加速し、キャリブレーションデータの10分の1とフルヘッドにマッチし、500シークエンス構築を92.63から8に短縮する。
論文 参考訳(メタデータ) (2026-09-01T08:20:35Z) - RippleKV: Cross-Layer KV Cache Allocation via Perturbation Propagation [6.31074726504356]
本稿では,各レイヤの値キャッシュに対する摂動が最終予測分布に与える影響を推定し,層間キャッシュを割り当てるRippleKVを提案する。
RippleKVは、キャッシュ予算に適合した評価KVキャッシュ圧縮手法の中で、最も高い平均性能を達成する。
論文 参考訳(メタデータ) (2026-08-09T13:01:11Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Recency/Frequency Adaptive KV Caching for Large Language Model Serving [7.261125311665803]
キーバリューキャッシング(KV)は,大規模言語モデルの推論と生成を高速化する強力な手法である。
推論ワークロードは巨大で多様であり、効果的にキャッシュするのが困難である。
我々は,最近発生したKVブロック間で動的にキャッシュ空間を割り当てる適応キャッシュを統合する。
論文 参考訳(メタデータ) (2026-06-19T09:05:01Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache [28.54642982960947]
大規模言語モデル(LLM)は様々なタスクにまたがって高い性能を示すが、長い入力コンテキストでの推論はメモリサイズと帯域幅によってボトルネックとなる。
既存のメソッドは、消去または量子化によってキャッシュを減らすが、通常は2つを分離して扱う。
本稿では、KVキャッシュ圧縮をレート歪み問題とみなし、同じビット割り当て方式の2つの端点の消去と量子化を行う。
論文 参考訳(メタデータ) (2026-05-08T15:15:06Z) - Latent-Condensed Transformer for Efficient Long Context Modeling [60.72493959155964]
大規模言語モデルに対するLCA(Latent-Condensed Attention)を提案する。
LCAはMLAの潜伏空間内のコンテキストを凝縮し、表現はセマンティック潜伏ベクトルと位置キーに切り離される。
LCAは、最大2.5$times$プリフィルスピードアップと128Kコンテキストでの90%のKVキャッシュ削減を実現している。
論文 参考訳(メタデータ) (2026-04-14T08:40:31Z) - Cache-Craft: Managing Chunk-Caches for Efficient Retrieval-Augmented Generation [14.842469293627271]
CacheCraftは、テキストチャンクに対応する計算済みKVの再利用を管理するシステムである。
再利用可能なチャンクキャッシュの特定方法、キャッシュの修正に少数の再計算を効率的に行う方法、ハードウェアにチャンクキャッシュを効率よく保存・削除する方法を示す。
論文 参考訳(メタデータ) (2025-02-05T14:12:33Z) - XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference [9.65524177141491]
大規模言語モデル(LLM)推論は出力トークンを1つずつ生成し、多くの冗長な計算に繋がる。
KV-Cacheフレームワークは時間と空間の複雑さを妥協する。
既存の研究では、推論精度に重要でないキャッシュデータの一部を削除することで、メモリ消費を減らすことができる。
各レイヤのキャッシュサイズをパーソナライズしてカスタマイズすることで,メモリの大幅な削減が期待できることを示す。
論文 参考訳(メタデータ) (2024-12-08T11:32:08Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - Training-Free Exponential Context Extension via Cascading KV Cache [49.608367376911694]
カスケードサブキャッシュバッファを利用して,最も関連性の高いトークンを選択的に保持する機構を導入する。
本手法は,1Mトークンのフラッシュアテンションと比較して,プリフィルステージ遅延を6.8倍削減する。
論文 参考訳(メタデータ) (2024-06-24T03:59:17Z) - Improving information retention in large scale online continual learning [99.73847522194549]
オンライン連続学習は、既存の知識を維持しながら、新しいデータに効率的に適応することを目的としている。
最近の研究は、リプレイバッファが無制限であっても、大規模なOCLでは情報保持が問題であり続けていることを示唆している。
非定常目標に対する最適化を改善するため,移動平均の手法群を提案する。
論文 参考訳(メタデータ) (2022-10-12T16:59:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。