論文の概要: A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention
- arxiv url: http://arxiv.org/abs/2610.09051v1
- Date: Tue, 06 Oct 2026 20:00:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.587463
- Title: A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention
- Title(参考訳): 自励式変圧器: ユニバーサルアテンション付き極大KVキャッシュ圧縮
- Abstract要約: 本稿では, 相補的および新規な崩壊機構の統一フレームワークを提案する。
結果として生じるUniversal Attentionは、非常に表現力が高く、エンドツーエンドのトレーニング可能なアーキテクチャである。
- 参考スコア(独自算出の注目度): 11.051308091822506
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The large KV-cache size of modern LLMs creates a barrier to efficient deployment. Recent work has explored replacing attention layers' RoPE positional embeddings with alternative decay-based mechanisms, which can then be used to prune KV-cache during inference. However, these decay functions have limited expressivity, and in practice devolve into sliding-window-like eviction patterns. In this work, we propose a unifying framework for complementary and novel decay mechanisms, capturing complex key statistics and interactions while preserving expressive RoPE embeddings and Softmax attention. The resulting Universal Attention is a highly expressive and end-to-end trainable architecture, whose composite decay mechanism acts as a natural, $\textit{adaptive}$ pruning criterion, removing tokens that contribute least to attention computation. Experimentally, Universal Attention achieves state-of-the-art $10\times$ compression on natural language and synthetic task data, while $\textit{improving}$ downstream performance compared to both state-of-the-art baselines and unpruned oracles. It further demonstrates superior long-context generalization with unprecedented $25\times$ compression at length 16k.
- Abstract(参考訳): 現代のLLMの大きなKVキャッシュサイズは、効率的なデプロイメントの障壁を生み出します。
近年の研究では、注目層のRoPE位置埋め込みを代替の崩壊機構に置き換えることが検討されている。
しかし、これらの崩壊関数は限定的な表現性を持ち、実際にはスライドウインドウのような退化パターンへと発展する。
本研究では,表現力のあるRoPE埋め込みとソフトマックスの注意を保ちながら,複雑な鍵統計と相互作用を捉える,相補的および新規な崩壊機構の統一フレームワークを提案する。
結果として生じるUniversal Attentionは、非常に表現力が高くエンドツーエンドのトレーニング可能なアーキテクチャであり、複合減衰機構は自然な$\textit{adaptive}$プルーニング基準として機能し、注意計算に最も貢献するトークンを除去する。
実験的に、Universal Attentionは、自然言語と合成タスクデータに対する10ドル以上の圧縮を達成する一方、$\textit{improving}$ダウンストリームパフォーマンスは、最先端のベースラインと未実行のオークルの両方と比較して達成される。
さらに、前例のない$25\times$ compression at length 16kで、より優れた長文の一般化を示す。
関連論文リスト
- C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference [31.428047145437773]
長文推論は、検索拡張生成やマルチドキュメント推論といった現代の大規模言語モデル(LLM)アプリケーションの中心である。
推論コストの増大を軽減するため、最近の研究では、余分なプリフィル計算を減らすためにキー値(KV)キャッシュの再利用を検討した。
既存の再利用手法は主に保存に重点を置いており、KVキャッシュの保存とアクセスのコストという長期的サービスにおける重要なボトルネックを見落としている。
論文 参考訳(メタデータ) (2026-07-20T09:09:23Z) - STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation [60.597357847359255]
ビデオセグメンテーションでは、複雑な自然言語クエリの下で数百フレームにわたるピクセル精度の高いオブジェクトトラッキングが要求される。
既存のメソッドはトークン圧縮を通じてこの問題に対処するが、典型的には時間的コンテキストを持たない機能で動作する。
状態空間モデルは、この制約を解決し、その線形反復性は、各トークンを時間的文脈で選択的に$mathcalO(T)$コスト圧縮して減少させる。
論文 参考訳(メタデータ) (2026-07-03T03:28:25Z) - Beyond Single-Dimensional Compression: The Compound Sparsity Frontier of Large Language Models [6.94102129809152]
大規模言語モデル(LLM)はしばしば静的パラメータのプルーニングや動的トークンレベルの計算によって圧縮される。
本稿では,まず低ランク近似とチャネルプルーニングを適用し,静的に圧縮されたバックボーンを得るミニマリスト複合スパーシリティフレームワークについて検討する。
論文 参考訳(メタデータ) (2026-06-29T01:33:30Z) - Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility [31.124813359673073]
我々は,将来のKVユーティリティを予測するメカニズムであるSP-KV(Self-Pruned Key-Value Attention)を導入する。
軽量ユーティリティ予測器は各キーと値のペアをスコアし、最近のKVは常にローカルウィンドウ経由で利用できるが、古いペアはキャッシュに書き込まれる。
このメカニズムは入力に適応し、典型的にはKVキャッシュサイズを3ドルから10ドルに削減する。
論文 参考訳(メタデータ) (2026-05-13T18:58:16Z) - EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction [55.026048429595384]
EchoKVは、標準と圧縮された推論間のオンデマンド移行を可能にする柔軟なKVキャッシュ圧縮スキームである。
高速で低コストなトレーニングを可能にする2段階の微調整戦略を導入する。
論文 参考訳(メタデータ) (2026-03-24T07:58:42Z) - Understanding the Physics of Key-Value Cache Compression for LLMs through Attention Dynamics [22.98826013817833]
トークンレベルのルーティングの制御摂動として,KV圧縮を物理に着想を得た視点を提案する。
適度な圧縮は、内部表現をほとんど精度の低下なく劣化させ、冗長性を明らかにする。
トークンサバイバルにもかかわらず、過度なヘッドレベルのコンセンサスによってルーティングの柔軟性が崩壊する表現剛性を特定する。
論文 参考訳(メタデータ) (2026-03-02T04:16:36Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - OmniSAT: Compact Action Token, Faster Auto Regression [70.70037017501357]
我々は、コンパクトで転送可能なアクション表現を学ぶOmni Swift Action Tokenizerを紹介する。
その結果、離散トークン化はトレーニングシーケンスを6.8$times$に短縮し、ターゲットエントロピーを低下させる。
論文 参考訳(メタデータ) (2025-10-08T03:55:24Z) - OjaKV: Context-Aware Online Low-Rank KV Cache Compression with Oja's Rule [54.37983890753086]
我々は,戦略的ハイブリッドストレージポリシとオンラインサブスペース適応を統合したフレームワークであるOjaKVを紹介する。
OjaKVは、重要かつ最新のトークンをフルランクで保存し、注意のために高忠実なアンカーを維持している。
オンライン主成分分析のためのOjaのアルゴリズムを用いて、プロジェクションベースを漸進的に適応させることにより、低ランク圧縮を適用する。
論文 参考訳(メタデータ) (2025-09-25T21:42:27Z) - UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression [86.33995240043936]
UniGistは、大規模言語モデルのためのシーケンスレベルのロングコンテキスト圧縮フレームワークである。
生のトークンを特別な圧縮トークン(gist)に微粒な方法で置き換えることで、コンテキスト情報を効率的に保存する。
提案手法は,圧縮トークンの実際の除去を可能にすることで,フレキシブルな推論もサポートしている。
論文 参考訳(メタデータ) (2025-09-19T08:47:37Z) - TreeKV: Smooth Key-Value Cache Compression with Tree Structures [19.06842704338332]
TreeKVは、スムーズなキャッシュ圧縮のためにツリー構造を利用するトレーニング不要の手法である。
PG19とOpenWebText2の言語モデリングタスクのベースラインモデルを一貫して上回っている。
論文 参考訳(メタデータ) (2025-01-09T06:00:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。