論文の概要: DeCoPrune: Efficient KV-Cache Pruning for Autoregressive Video Diffusion via Denoising Consistency
- arxiv url: http://arxiv.org/abs/2609.39096v2
- Date: Mon, 05 Oct 2026 16:45:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.4519
- Title: DeCoPrune: Efficient KV-Cache Pruning for Autoregressive Video Diffusion via Denoising Consistency
- Title(参考訳): DeCoPrune: 一貫性を損なう自動回帰ビデオ拡散のための効率的なKVキャッシュプルーニング
- Abstract要約: 本稿では,キャッシュ圧縮をデノナイジング一貫性問題として扱う,トレーニング不要なDeCoPruneを紹介する。
DeCoPruneは、その中間的クリーン予測と最終的な復号化値との相違を利用して、各カレントチャンクトークンの復号化困難を測定する。
LingBot World v2の実験によると、DeCoPruneはKVの長距離リコールをほぼ完全に保存し、歴史的KVトークンの85%以上をプルーニングしている。
- 参考スコア(独自算出の注目度): 32.36199443615815
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autoregressive video diffusion supports streaming generation and interactive control, but its KV cache grows continuously with the generated history. Existing compression strategies either discard history using fixed windows or select tokens through local attention and similarity signals, which do not directly measure whether the current chunk contributes information beyond the retained context. We introduce DeCoPrune, a training-free method that treats cache compression as a denoising-consistency problem. We find empirically that denoising difficulty provides a useful proxy for a token's value in long-term retention: tokens with larger step-to-final discrepancies tend to carry visual evidence that is less predictable from the retained context. DeCoPrune measures each current-chunk token's denoising difficulty using the discrepancy between its intermediate clean prediction and final denoised value, retaining high-discrepancy tokens in the long-term cache while pruning those with low discrepancy. To evaluate information retention, we introduce CMBench, comprising 58 approximately one-minute generated or real-world context episodes and 116 Reappear or Revisit continuation tasks that require recalling specific previously observed objects or scenes. Experiments with LingBot World v2 show that DeCoPrune preserves near-FullKV long-range recall while pruning over 85% of historical KV tokens and accelerating continuation generation by over $4\times$, substantially outperforming the evaluated compression baselines at comparable budgets. These results indicate that denoising consistency can serve as a model-intrinsic signal for retaining long-range information while reducing autoregressive inference cost. Our project homepage is https://decoprune.github.io. The code is available at https://github.com/DeCoPrune/CMBench, and the benchmark at https://huggingface.co/datasets/Aoraku/CMBench.
- Abstract(参考訳): 自動回帰ビデオ拡散はストリーミング生成とインタラクティブ制御をサポートするが、KVキャッシュは生成された履歴とともに継続的に増大する。
既存の圧縮戦略は、固定ウィンドウを使った履歴を破棄するか、局所的な注意と類似性信号を通じてトークンを選択するかのいずれかであり、これは現在のチャンクが保持されたコンテキストを超えた情報に寄与するかどうかを直接測定しない。
本稿では,キャッシュ圧縮をデノナイジング一貫性問題として扱う,トレーニング不要なDeCoPruneを紹介する。
長期保持におけるトークンの価値の代用として,難解化が有効なことを実証的に見出した。 ステップ・ツー・ファイナルの差分が大きいトークンは,保持されたコンテキストから予測できない視覚的証拠を運ぶ傾向にある。
DeCoPruneは、その中間クリーンな予測と最終的な復号化値との相違を利用して、各カレントチャンクトークンの復号化困難を測定する。
情報保持を評価するため,約1分間,実世界の文脈エピソード58件と,以前に観察された特定の物体やシーンをリコールする必要のある116件のリルック・リヴィジット継続タスクからなるCMBenchを導入する。
LingBot World v2での実験では、DeCoPruneは、歴史的KVトークンの85%以上をプルーニングしながら、ほぼフルKVの長距離リコールを維持し、継続生成を4\times$以上加速し、同等の予算で評価された圧縮ベースラインを大幅に上回っている。
これらの結果から, 自己回帰的推論コストを低減しつつ, 長距離情報を保持するためのモデル内信号として, 一貫性の認知が有効であることが示唆された。
私たちのプロジェクトのホームページはhttps://decoprune.github.ioです。
コードはhttps://github.com/DeCoPrune/CMBenchで、ベンチマークはhttps://huggingface.co/datasets/Aoraku/CMBenchで入手できる。
関連論文リスト
- Surprise Forcing: What to Remember, When to Skip in Long Video Generation [65.0022589149937]
自己回帰拡散をストリーミングすることで、ミニスケールのビデオ合成が実用的になるが、そのコンテキスト境界と固定化スケジュールはリソースを均一に割り当てる。
我々は、両方の制限をオンラインリソース割り当て問題として扱う、トレーニング不要のフレームワークであるSurprise Forcingを紹介した。
VBench、VBench-Long、VBench-2.0の実験では、提案されたアロケーション戦略は、リアルタイムストリーミングスループットを維持しながら、長時間の一貫性と視覚的品質を改善する。
論文 参考訳(メタデータ) (2026-07-20T18:37:58Z) - ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE [40.4732814295941]
ReCacheは、生成品質を最大化する再計算スケジュールを学ぶ。
政策勾配を通し、完全な拡散推論を通じてバックペーストを横取りする。
スケジュールベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-04T11:59:56Z) - SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning [33.149133156465474]
大規模言語モデルにおける長文推論は、KVキャッシュのボトルネックによってますます制限される。
チャネルレベルでKVをプルーニングすることで、非構造化空間を適用できる訓練不要なプラグアンドプレイ手法であるSPARKを提案する。
SPARKはチャネルレベルの冗長性を低減し、同じメモリ予算内で長いシーケンスの処理を可能にする。
論文 参考訳(メタデータ) (2025-08-21T03:48:28Z) - Dialogue Without Limits: Constant-Sized KV Caches for Extended Responses in LLMs [6.222287867011644]
精度を保ちながら一定サイズのKVキャッシュを維持する推論時間手法であるMorphKVを提案する。
保持や損失圧縮とは異なり、MorphKVは最近のトークンの注意パターンによってガイドされる軽量更新を通じてKVキャッシュを反復的に洗練する。
我々の研究では、52.9$%のメモリセーブと18.2$%の精度が、最先端の先行研究と比較して高いことを示している。
論文 参考訳(メタデータ) (2025-03-02T18:12:50Z) - ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference [61.412894960600205]
大きな言語モデル(LLM)は、長いテキストを処理する際に大きなGPUメモリを必要とする。
ChunkKVは、セマンティックチャンクを基本的な圧縮単位として扱うことで、KVキャッシュ圧縮を再定義する。
結果: ChunkKVは最先端の手法を最大8.7%精度で上回る。
論文 参考訳(メタデータ) (2025-02-01T03:49:47Z) - LoCoCo: Dropping In Convolutions for Long Context Compression [77.26610232994508]
本稿では,Long Context Compression(LoCoCo)のための新しいアプローチであるDropping In Convolutionsを提案する。
LoCoCoは、固定サイズキーバリュー(KV)キャッシュのみを使用し、推論と微調整の両方のステージで効率を向上させることができる。
論文 参考訳(メタデータ) (2024-06-08T01:35:11Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。