論文の概要: WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs
- arxiv url: http://arxiv.org/abs/2608.22704v2
- Date: Sat, 29 Aug 2026 17:03:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 13:34:07.501517
- Title: WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs
- Title(参考訳): WnW:長期音声LLMのためのワックス・アンド・ウォーニングKVキャッシュ
- Abstract要約: Waxing-and-Waning KVキャッシュはKVヘッドをオフラインキャリブレーションによってアンカー、タイダル、固定ロールに分類する。
3Bバックボーンが2つあるLibri-Speechでは、WnWはほぼフルキャッシュの精度を維持しながら、プリフィルオンリーのベースラインが終了しないGPU上のオーディオトークンの20%しか保持しない。
- 参考スコア(独自算出の注目度): 60.6692467625441
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-form audio inputs make the KV cache the dominant memory cost of speech LLMs. Prefill-only KV compression methods permanently discard audio KV positions once evicted, with no pathway to recover them during decoding. We show this is fragile on long-form audio: prefill attention concentrates near the audio start (an attention-sink effect), while decode-time attention distributes broadly, and the two rankings overlap weakly. We propose WnW (Waxing-and-Waning KV cache), which classifies KV-heads into anchor, tidal, and fixed roles via offline calibration. Anchor heads keep all audio KV on GPU and yield a decode-time signal of which audio region each token is read from; tidal heads keep a CPU-resident complement that is recalled chunk-by-chunk based on aggregated anchor-head scores; fixed heads keep only an on-GPU subset, with the rest permanently discarded. On LibriSpeech-Long with two 3B backbones (Voxtral-mini-3b and Qwen2.5-Omni-3B), WnW preserves near-Full-Cache accuracy while keeping only 20% of audio tokens on GPU, where prefill-only baselines fail to terminate. Results generalize across language, task, and domain shifts, and CPU-GPU recall adds little decode-time overhead in our measurements.
- Abstract(参考訳): ロングフォーム音声入力は、KVキャッシュを音声LLMの圧倒的なメモリコストにする。
プリフィルオンリーのKV圧縮法は、オーディオKV位置を一度削除した後に永久に破棄するが、復号時に再生する経路はない。
音声開始時(アテンションシンク効果)付近にプリフィルアテンションが集中し、デコードアテンションが広範に分布し、2つのランキングが弱く重なる。
WnW (Waxing-and-Waning KV cache) を提案し、KVヘッドをオフラインキャリブレーションによりアンカー、潮位、固定の役割に分類する。
アンカーヘッドはGPU上のすべてのオーディオKVを保持し、各トークンが読み取られるオーディオ領域のデコードタイム信号を生成する; タイダルヘッドは集約されたアンカーヘッドスコアに基づいてチャンク・バイ・チャンクにリコールされるCPU常駐の補完信号を保持する; 固定ヘッドはGPU上のサブセットのみを保持し、残りは永久に破棄される。
2つの3Bバックボーン(Voxtral-mini-3bとQwen2.5-Omni-3B)を持つLibriSpeech-Longでは、WnWは、プリフィルのみのベースラインが終了しないGPU上のオーディオトークンの20%しか保持することなく、ほぼフルキャッシュの精度を保っている。
結果は言語、タスク、ドメインシフトにまたがって一般化され、CPU-GPUリコールは測定にデコード時のオーバーヘッドをほとんど加えません。
関連論文リスト
- VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference [53.883871460875234]
VoxZipは、セマンティックアンコールされたKVキャッシュ圧縮フレームワークである。
第1段階では、音声トークンを時間的に調整、圧縮、融合するために明示的なセマンティックアンカーとして自動音声認識(ASR)文字を使用する。
第2段階では、時間的に減衰した蓄積された注意に基づいて動的フィルタリング戦略を採用し、非定常トークンを除去する。
論文 参考訳(メタデータ) (2026-08-09T08:17:18Z) - FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention [77.12062766962815]
Lookahead Sparse Attention (LSA)は、DeepSeek-V4アーキテクチャ上に構築されたNeural Memory Indexerを利用している。
このアーキテクチャをバックボーンフリーの非結合なトレーニング戦略でインスタンス化する。
FM-DS-V4は、物理KVキャッシュのフットプリントを、フルコンテキストベースラインのわずか13.5%まで圧縮することを示した。
論文 参考訳(メタデータ) (2026-06-08T06:25:54Z) - WorldKV: Efficient World Memory with World Retrieval and Compression [56.57011243315561]
我々は、World RetrievalとWorld Compressionの2つのコンポーネントを備えた、トレーニング不要のフレームワークであるWorldKVを提案する。
Matrix-Game-2.0とLingBot-World-Fastでは、WorldKVはスループットの約2倍のフルKVメモリ忠実度に対応し、微調整なしでメモリトレーニングされたベースラインと競合する。
論文 参考訳(メタデータ) (2026-05-21T16:55:04Z) - MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering [75.0394545769057]
KVキャッシュは、LLMプリフィルを介して歴史的なトークンのキーバリューを格納する。
MuKV は KV キャッシュ圧縮モジュールと半階層的検索手法を特徴とする手法である。
長時間ストリーミングのVideoQAベンチマークの実験では、MKVはメモリとオンラインQA効率を犠牲にすることなく、回答の正確性を大幅に向上することが示された。
論文 参考訳(メタデータ) (2026-05-21T10:13:03Z) - VeriCache: Turning Lossy KV Cache into Lossless LLM Inference [24.571166055469508]
私たちは、フルKV-cacheデコードと同じ出力を保証する最初の推論フレームワークであるVeriCacheを紹介します。
VeriCacheはフルKVキャッシュよりも最大4倍高いスループットを実現していることを示す。
論文 参考訳(メタデータ) (2026-05-17T19:18:39Z) - RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache [28.54642982960947]
大規模言語モデル(LLM)は様々なタスクにまたがって高い性能を示すが、長い入力コンテキストでの推論はメモリサイズと帯域幅によってボトルネックとなる。
既存のメソッドは、消去または量子化によってキャッシュを減らすが、通常は2つを分離して扱う。
本稿では、KVキャッシュ圧縮をレート歪み問題とみなし、同じビット割り当て方式の2つの端点の消去と量子化を行う。
論文 参考訳(メタデータ) (2026-05-08T15:15:06Z) - Dialogue Without Limits: Constant-Sized KV Caches for Extended Responses in LLMs [6.222287867011644]
精度を保ちながら一定サイズのKVキャッシュを維持する推論時間手法であるMorphKVを提案する。
保持や損失圧縮とは異なり、MorphKVは最近のトークンの注意パターンによってガイドされる軽量更新を通じてKVキャッシュを反復的に洗練する。
我々の研究では、52.9$%のメモリセーブと18.2$%の精度が、最先端の先行研究と比較して高いことを示している。
論文 参考訳(メタデータ) (2025-03-02T18:12:50Z) - DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads [22.462489968597]
すべての注目ヘッドにキーとバリューの状態をキャッシュすると、かなりのメモリが消費される。
我々は,ストリーミングヘッドに軽量で一定長のKVキャッシュを使用しながら,全KVキャッシュのみを検索ヘッドに適用するフレームワークであるDuoAttentionを紹介する。
GQAモデルでは,MHAでは2.55倍,GQAでは1.67倍の長文推論メモリが大幅に削減される。
論文 参考訳(メタデータ) (2024-10-14T17:59:58Z) - Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs [82.08922896531618]
大規模言語モデル(LLM)における生成推論のメモリフットプリントを削減するプラグイン・アンド・プレイ方式である適応KVキャッシュ圧縮を導入する。
我々は,アテンションモジュールの本質的な構造を明らかにするために,ターゲットプロファイリングを行う。
認識された構造に基づいて、我々はKVキャッシュを適応的に構築する: 注意頭上の長距離コンテキストを排除し、局所的なコンテキストを強調し、特別なトークンを中心とした注意頭上の特別なトークンを排除し、すべてのトークンに広く参加する注目頭に対して標準のKVキャッシュのみを使用する。
論文 参考訳(メタデータ) (2023-10-03T05:17:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。