論文の概要: TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning
- arxiv url: http://arxiv.org/abs/2608.03276v1
- Date: Tue, 04 Aug 2026 07:51:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.088239
- Title: TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning
- Title(参考訳): TaskPress: Task-Guided Pruningによるクエリ非依存KVキャッシュ圧縮
- Authors: Wonpyo Park, Seung-won Hwang,
- Abstract要約: タスク誘導型クエリ非依存KVキャッシュ消去のためのフレームワークであるTaskPressを紹介する。
単一のクエリに対してキャッシュを最適化する代わりに、TaskPressは高レベルのタスクガイドに条件付き再利用可能なメモリ表現を構築する。
TaskPressは、様々なクエリにまたがるコンパクトで再利用可能なキャッシュを効率的に生成する。
- 参考スコア(独自算出の注目度): 39.9021319826802
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-context inference with large language models is constrained by the linear growth of the key-value cache to sequence length. While pruning offers mitigation, prevailing methods determine query-specific token importance that cannot be reused across unseen queries. In contrast, we introduce TaskPress, a framework for task-guided, query-agnostic KV cache eviction. Instead of optimizing the cache for a single query, TaskPress constructs a reusable memory representation conditioned on a high-level task guide. The guide functions as a meta-query during prefill to filter irrelevant tokens before downstream queries are issued. In addition, TaskPress leverages quantization scale factors as a zero-cost signal for detecting influential representation outliers, providing an efficient proxy for token importance. Experiments on conducted on various tasks with long context input demonstrate that TaskPress efficiently creates a compact, reusable cache across diverse queries.
- Abstract(参考訳): 大規模言語モデルによる長文推論は、キー値キャッシュからシーケンス長への線形成長によって制約される。
プルーニングは緩和を提供するが、一般的な方法は、目に見えないクエリで再利用できないクエリ固有のトークンの重要性を決定する。
対照的に、タスク誘導型クエリ非依存KVキャッシュ消去のためのフレームワークであるTaskPressを導入する。
単一のクエリに対してキャッシュを最適化する代わりに、TaskPressは高レベルのタスクガイドに条件付き再利用可能なメモリ表現を構築する。
ガイドは、ダウンストリームクエリが発行される前に、無関係なトークンをフィルタリングするプリフィル中のメタクエリとして機能する。
さらに、TaskPressは量子化スケール因子をゼロコスト信号として利用して、影響のある表現のアウトレイラを検出し、トークンの重要度を効率的にプロキシする。
長いコンテキスト入力で様々なタスクで実施された実験は、TaskPressが様々なクエリにまたがるコンパクトで再利用可能なキャッシュを効率的に生成することを示した。
関連論文リスト
- Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Where Matters More Than What: Decoding-aligned KV Cache Compression via Position-aware Pseudo Queries [39.38028687042293]
キーバリュー(KV)キャッシュは、効率的なLarge Language Models(LLM)推論に不可欠である。
既存のKVキャッシュ圧縮手法は、プリフィル段階でトークンの重要性を推定するために入力側注意パターンに依存している。
位置認識型擬似クエリ(DapQ)を提案し,位置認識型擬似クエリによるKVキャッシュ圧縮を近似する。
論文 参考訳(メタデータ) (2026-03-12T05:36:32Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - TableCache: Primary Foreign Key Guided KV Cache Precomputation for Low Latency Text-to-SQL [26.22021341849791]
そこで我々は,KVキャッシュのオフライン化によるテーブル表現の事前計算を提案し,必要な表現をオンラインに問い合わせる。
我々のアプローチの重要な側面は、テーブル間の主要な外部キー関係を維持しながら、テーブルキャッシュの計算である。
論文 参考訳(メタデータ) (2026-01-13T17:20:55Z) - Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks [1.2292307778008844]
本稿では,3大言語モデル(LLM)プロバイダ間でのプロンプトキャッシュの総合評価について述べる。
以上の結果から,プロンプトキャッシングによりAPIコストが45~80%削減され,プロバイダ間で13~31%短縮された。
論文 参考訳(メタデータ) (2026-01-09T18:41:57Z) - CompressKV: Semantic Retrieval Heads Know What Tokens are Not Important Before Generation [7.119276797399788]
キー値(KV)キャッシュサイズの増加は、メモリと実行効率に重大な課題をもたらす。
ほとんどのKVキャッシュ圧縮手法は、GQA (Grouped Query Attention) ベースの LLM において、すべてのアテンションヘッドを用いたトークンの排除に依存している。
我々は階層適応型KVキャッシュ割り当て戦略を導入し、様々なメモリ予算下での最先端のアプローチを一貫して上回ります。
論文 参考訳(メタデータ) (2025-08-04T13:26:16Z) - Lookahead Q-Cache: Achieving More Consistent KV Cache Eviction via Pseudo Query [48.52389201779425]
KVキャッシュメモリの使用は、長いテキストシーケンスで大幅に増加する。
プリフィルステージアテンションスコアを用いた既存のKVキャッシュ消去手法Pruneトークン
Lookahead Q-Cacheは、真のデコードステージクエリをよりよく近似するために、低コストの疑似ルックアヘッドクエリを生成する。
論文 参考訳(メタデータ) (2025-05-24T10:34:38Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - User Intent Recognition and Semantic Cache Optimization-Based Query Processing Framework using CFLIS and MGR-LAU [0.0]
この研究は、拡張QPのためのクエリにおける情報、ナビゲーション、およびトランザクションベースのインテントを分析した。
効率的なQPのために、データはEpanechnikov Kernel-Ordering Pointsを用いて構造化され、クラスタリング構造(EK-OPTICS)を同定する。
抽出された特徴、検出された意図、構造化データは、MGR-LAU(Multi-head Gated Recurrent Learnable Attention Unit)に入力される。
論文 参考訳(メタデータ) (2024-06-06T20:28:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。