論文の概要: ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference
- arxiv url: http://arxiv.org/abs/2605.16360v1
- Date: Sat, 09 May 2026 13:18:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 23:51:08.290927
- Title: ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference
- Title(参考訳): ProxyKV:長期LLM推論のためのクロスモデルプロキシプルーニング
- Abstract要約: ProxyKVはクロスモデルプロキシプルーニングフレームワークである。
軽量なファミリー内Small-Model Proxyにスコアをオフロードし、Large-Model Targetに非同期に実行する。
Llama-3.1-8B(Dual-GPU; $sim$1.5times$ shared single-GPU)で最大$3.21timesのプリフィルスピードアップを提供し、Qwen-2.5-7Bで最大170kのトークンでスピードアップを継続する。
- 参考スコア(独自算出の注目度): 12.04455190856202
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Efficient long-context inference in Large Language Models (LLMs) is severely constrained by the Key-Value (KV) cache memory wall, yet existing pruning methods force a choice between low-latency heuristics that sacrifice precision and high-precision reconstruction methods that incur prohibitive prefilling overhead. To bridge this scoring-cost--accuracy gap, we propose ProxyKV, a cross-model proxy pruning framework that offloads importance scoring to a lightweight intra-family Small-Model Proxy executed asynchronously to the Large-Model Target. To bridge the architectural gap between heterogeneous models, we design the HybridAxialMapper, which disentangles temporal feature extraction from cross-head alignment, together with a Multi-Granularity Hybrid Loss that shifts the learning objective from rigid regression to relative ranking consistency. Across the Llama-3.1, Qwen-2.5, and Qwen-3 families spanning targets from 7B up to 32B parameters on LongBench, SCBench, and RULER, ProxyKV matches KVZip on aggregate (recovering $\sim$$98.7\%$ of its mean accuracy) while delivering up to a $3.21\times$ prefilling speedup on Llama-3.1-8B (dual-GPU; $\sim$$1.5\times$ shared single-GPU) and sustaining the speedup at contexts up to 170k tokens on Qwen-2.5-7B.
- Abstract(参考訳): 大規模言語モデル (LLMs) における効率的なロングコンテキスト推論はキーバリュー (KV) キャッシュメモリウォールによって厳しく制約されているが、既存のプルーニング手法では、精度を犠牲にする低遅延ヒューリスティックと、不正なプリフィルのオーバーヘッドを発生させる高精度な再構築手法を選択せざるを得ない。
このスコアリングコスト-精度ギャップを埋めるため、我々は、軽量な家庭内Small-Model Proxyにスコアリングをオフロードし、Large-Model Targetに非同期に実行する、クロスモデルプロキシプルーニングフレームワークProxyKVを提案する。
ヘテロジニアスモデル間のアーキテクチャ的ギャップを埋めるために,クロスヘッドアライメントから時間的特徴抽出を分離するHybridAxialMapperと,学習目標を剛性回帰から相対的ランキング整合性にシフトするMulti-Granularity Hybrid Lossを設計する。
Llama-3.1、Qwen-2.5、Qwen-3ファミリーは、LongBench、SCBench、RULERの7Bから32Bのパラメータを対象とするが、ProxyKVはKVZipとアグリゲーション($\sim$98.7\%$の平均精度)で一致し、Llama-3.1-8B(dual-GPU; $\sim$1.5\times$ shared-GPU)で3.21\timesをプリフィルする。
関連論文リスト
- Accelerating Unified Multimodal Models with Core-Expansion Routing and Unified Computation Scheduling [61.28599393707943]
統一マルチモーダルモデルは、理解と生成を共同でサポートするが、トークン、レイヤ、生成タイムステップ間でかなりの冗長な計算を行う。
本稿では,タスク共有型コアスコアラと進行条件付き生成拡張を提案し,生成分解とクロスタスクコアアライメントを最適化した。
2つの代表的UMMアーキテクチャの実験では、両タスク間で一貫した品質改善が示され、98.03%の高密度な理解性能を維持し、エンドツーエンドの推論速度は1.93times$である。
論文 参考訳(メタデータ) (2026-08-29T14:27:55Z) - Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers [54.01042826416009]
ビジュアル生成には高解像度の画像、長いビデオ、マルチモーダルコンテキストが必要である。
原理的なスケーリングレシピを備えたハイブリッドビジュアル拡散バックボーンであるChimeraを紹介した。
密度の高いバックボーンは、一致したフルアテンションWan2.1 2Bベースラインの1.7倍の計算効率を示す。
論文 参考訳(メタデータ) (2026-07-30T17:58:02Z) - AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding [29.797292873854]
投機的復号化は、ターゲット分布を変更することなく、大きな言語モデル推論を加速する。
本稿では,投機的復号化のための統一的なトレーニングフレームワークであるAngelSpecを紹介する。
アーキテクチャレベルでは,ブロック拡散フレームワークDFlyを提案する。
論文 参考訳(メタデータ) (2026-07-28T15:25:05Z) - SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation [0.0]
大規模言語モデルは、メモリフットプリントがコンテキスト長とともに線形に増加するキー値(KV)キャッシュに依存して、テキストを自動回帰的に生成する。
最近の圧縮法はトークンマージによるコストを軽減している。
これらの制約に対処するKVキャッシュ圧縮のためのトレーニングフリーでデュアルコンポーネントのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-19T17:44:56Z) - Reformulating KV Cache Eviction Problem for Long-Context LLM Inference [2.0590127484132523]
大きな言語モデル(LLM)は、長いコンテキスト推論をサポートするが、キーバリュー(KV)キャッシュの増大により、メモリとランタイムのオーバーヘッドが大幅に増大する。
既存のKVキャッシュ消去法は、値表現、出力プロジェクション、ヘッド間相互作用の影響を無視し、局所的な注意重みに依存している。
注意マップと投影された値状態の間の乗法的相互作用を明示的にモデル化する新しい消去戦略であるLaProxを紹介する。
論文 参考訳(メタデータ) (2026-05-08T04:37:22Z) - The $qs$ Inequality: Quantifying the Double Penalty of Mixture-of-Experts at Inference [0.8986240899504297]
Mixture-of-Experts (MoE)モデルは、低トレーニングのFLOPにおいて高い品質を提供するが、この効率はしばしば推論時に消える。
復号化時に構造的にMoEアーキテクチャに不利な二重ペナルティを識別する。
我々は、MoEが品質整合密度モデルに対して構造的に不利なときを識別する予測的基準である$qs$不等式(inequality)を導入する。
論文 参考訳(メタデータ) (2026-03-09T21:48:04Z) - VSPrefill: Vertical-Slash Sparse Attention with Lightweight Indexing for Long-Context Prefilling [0.0]
既存のスパースアテンション手法は、コンテキスト適応性、オーバーヘッドのサンプリング、微調整コストのトレードオフに直面している。
注意分布に垂直スラッシュ構造パターンを用いる軽量なトレーニング機構であるVSPrefillを提案する。
VSPrefillは注意点の98.35%を保存し、コンテキスト長128kで平均4.95倍のスピードアップを提供する。
論文 参考訳(メタデータ) (2026-03-03T09:24:58Z) - ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding [37.86179431483446]
自己回帰モデル(ARM)は、遅いシーケンシャル推論によって妨げられる。
本稿では,優れた性能と効率を実現するマスク付き拡散モデルReFusionを紹介する。
ReFusionは、2.33$timesの平均スピードアップを維持しながら、パフォーマンスギャップを強力なARMに橋渡しする。
論文 参考訳(メタデータ) (2025-12-15T17:41:19Z) - KV Pareto: Systems-Level Optimization of KV Cache and Model Compression for Long Context Inference [2.8485297992257017]
長文Long-context Large Language Models (LLMs) は、キー値(KV)キャッシュとシーケンス長の線形成長により、推論中に重要なメモリボトルネックに直面している。
KVキャッシュの量子化、チャンクプリフィル、モデルウェイト量子化といった個別の最適化手法は、将来性を示しているが、それらの共同効果とエッジ展開のための最適構成は、まだ未定である。
論文 参考訳(メタデータ) (2025-12-01T18:03:47Z) - OjaKV: Context-Aware Online Low-Rank KV Cache Compression with Oja's Rule [54.37983890753086]
我々は,戦略的ハイブリッドストレージポリシとオンラインサブスペース適応を統合したフレームワークであるOjaKVを紹介する。
OjaKVは、重要かつ最新のトークンをフルランクで保存し、注意のために高忠実なアンカーを維持している。
オンライン主成分分析のためのOjaのアルゴリズムを用いて、プロジェクションベースを漸進的に適応させることにより、低ランク圧縮を適用する。
論文 参考訳(メタデータ) (2025-09-25T21:42:27Z) - R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning [80.104336426172]
CoT(Chain-of- Thought)は、大規模言語モデルの問題解決能力を高める。
CoTは長い自己回帰軌道のためにかなりの推論コストを発生させる。
トレーニング不要なハイブリッドデコーディングフレームワークであるR-Stitchを紹介する。
論文 参考訳(メタデータ) (2025-07-23T08:14:36Z) - HiRE: High Recall Approximate Top-$k$ Estimation for Efficient LLM
Inference [68.59839755875252]
HiREは2つの新しいコンポーネントから構成される: (i) (i) (i) (i) (i) (i) (i) (i) (i) (i) (ii) DA-TOP-$k$: 効率的なマルチデバイス近似トップ-k$演算子) (i) (i) (i) (i) (i) (i) (i) DA-TOP-$k$演算子) 。
我々は、10億のパラメータモデルにおいて、HiREがソフトマックスとフィードフォワード層の両方に適用され、ほぼ一致した事前学習と下流の精度を実現し、1台のTPUv5eデバイスで1.47Times$の推論遅延を高速化することを示した。
論文 参考訳(メタデータ) (2024-02-14T18:04:36Z) - SqueezeLLM: Dense-and-Sparse Quantization [80.32162537942138]
LLMにおける生成推論の主なボトルネックは、単一のバッチ推論のための計算ではなく、メモリ帯域幅である。
学習後量子化フレームワークであるSqueezeLLMを導入し、最大3ビットの超低精度でのロスレス圧縮を実現する。
本フレームワークは,2次情報に基づく最適ビット精度割当を探索する感度ベース非一様量子化法と,2次情報に基づくDense-and-Sparse分解法と,2次情報量割当値と感度重み値を効率的にスパース形式で格納するDense-and-Sparse分解法である。
論文 参考訳(メタデータ) (2023-06-13T08:57:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。